앤트로픽, 디스토피아 SF가 AI 모델을 ‘악하게’ 행동하도록 훈련시켰다고 지목
Anthropic blames dystopian sci-fi for training AI models to act “evil”

TL;DR AI
1분핵심 요약
앤트로픽은 윤리적인 AI 행동을 다룬 합성 픽션이 Claude의 비정렬 행동을 줄일 수 있다고 밝혔다.
거부 예시로 학습시킨 방식은 효과가 제한적이었지만, 약 1만2천 개의 합성 이야기를 추가하자 개선 폭이 더 컸다.
이 이야기들은 친사회적 AI 행동과 윤리적 추론을 보여주며, 모델이 비윤리적 선택을 덜 하게 만들었다.
이 접근법은 규칙 기반 예시만으로는 부족한 AI 정렬의 새로운 방법이 될 수 있다.



