Anthropic의 Opus 5, 실제 지능을 측정하도록 설계된 벤치마크에서 Fable 5와 GPT-5.6 Sol을 압도
Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence

TL;DR AI
1분핵심 요약
Anthropic의 Claude Opus 5가 ARC-AGI-3에서 30.2%로 새 최고 점수를 기록해, GPT-5.6 Sol의 7.8%를 크게 앞섰다.
이 모델은 이전에 풀리지 않았던 5개 환경을 해결했으며, 그중 4개는 인간 수준 이상으로 평가됐다.
연구진은 이번 성과가 단순한 벤치마크 최적화가 아니라 추론과 계획 능력 향상의 결과라고 봤다.
이번 결과는 낯선 과제를 다루는 일반 추론 능력의 진전을 보여주며, 업계 경쟁도 더욱 가속화하고 있다.
