일관성 훈련으로 정치적 조작 줄이기
Reducing Political Manipulation with Consistency Training
TL;DR AI
1분핵심 요약
연구진은 대규모 언어 모델이 서로 반대되는 정치적 프롬프트를 비대칭적으로 처리해, 은밀한 정치 편향이 존재함을 확인했다.
이들은 응답의 수사와 참여도를 측정하기 위한 두 가지 편향 지표를 제시했다.
정치 일관성 학습(Political Consistency Training)은 강화학습 방식으로, 보지 않은 평가 데이터에서도 이러한 편향을 줄였다.
또한 전체적인 유용성은 유지돼, 민감한 주제에서 더 공정한 AI를 만드는 실용적 방법으로 제시됐다.
