OpenAI, 최신 API와 두 가지 추가 설정으로 GPT-5.6 Sol이 ARC-AGI-3에서 Opus 5를 능가했다고 주장
OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings

TL;DR AI
2분핵심 요약
OpenAI는 Responses API의 Retained Reasoning과 Compaction을 적용한 ARC-AGI-3 테스트에서 GPT-5.6 Sol이 38.3%를 기록해 Claude Opus 5의 30.2%를 앞섰다고 밝혔다.
하지만 공식 벤치마크 하네스에서는 7.8%로 크게 낮아져, 테스트 설정에 따라 결과가 크게 달라질 수 있음을 보여줬다.
ARC Prize와 프랑수아 숄레는 제공사별 설정도 투명하게 공개된다면 허용될 수 있지만, 공정한 비교를 위해 표준화된 테스트가 중요하다고 강조했다.
이번 논쟁은 API 기능과 하네스 설계가 모델 간 성능 비교와 벤치마크 공정성에 큰 영향을 줄 수 있음을 드러낸다.



