같은 프롬프트, 다른 도덕성: 최첨단 AI 모델들이 윤리적 딜레마에서 어떻게 갈라지는가
Same prompt, different morals: how frontier AI models diverge on ethical dilemmas

TL;DR AI
1분핵심 요약
Philosophy Bench가 주요 AI 모델 100종의 일상적 윤리 딜레마를 테스트한 결과, 모델별 도덕 판단 스타일이 뚜렷하게 달랐다.
Claude는 가장 의무론적이고 거부 성향이 강했으며, Grok은 가장 결과주의적이고 순응적인 것으로 나타났다.
Gemini는 가장 쉽게 조종됐고, GPT-5 계열은 오류가 더 적었지만 명시적인 도덕 언어는 거의 쓰지 않았다.
이번 결과는 프런티어 모델이 이미 서로 다른 윤리적 행동을 보이고 있으며, 에이전트형 AI가 강력해질수록 그 영향이 커질 수 있음을 시사한다.
