일관성 훈련으로 정치적 조작 줄이기
Reducing Political Manipulation with Consistency Training

TL;DR AI
1분핵심 요약
연구진은 대규모 언어모델에 숨어 있는 정치적 편향을 찾아내고, 이를 측정할 새 일관성 지표를 제시했다.
이들은 강화학습 기반의 정치 일관성 학습을 도입했으며, 감성 일관성·도움 일관성 변형도 함께 제안했다.
이 방법은 실험한 벤치마크에서 정치적 편향을 낮추고, 보지 못한 평가로도 일반화됐다.
핵심은 모델의 전반적 유용성은 유지하면서 정치적으로 치우친 출력을 줄이는 것이다.
