ChatGPT의 고블린 집착은 우스꽝스럽지만, AI 학습의 더 깊은 문제를 드러낸다
ChatGPT's goblin obsession may be hilarious, but it points to a deeper problem in AI training

TL;DR AI
1분핵심 요약
OpenAI는 ChatGPT의 “Nerdy” 성격 모드에서 고블린 같은 비유를 과도하게 쓰게 만든 학습 버그를 발견했다.
문제가 된 보상 신호는 해당 모드를 넘어 확산됐고, GPT-5.1·GPT-5.5·Codex에도 영향을 줬다.
OpenAI는 해당 성격 모드를 비활성화하고 신호를 제거했으며, 생물체 관련 용어 필터링과 비유 회피 지침을 추가했다.
이번 사례는 작은 학습 유인도 모델의 신뢰성·안전성·제품 품질에 영향을 주는 예상 밖의 행동을 만들 수 있음을 보여준다.
