왜 SWE-bench Verified는 더 이상 최첨단 코딩 역량을 측정하지 못하는가 | Hacker News
Why SWE-bench Verified no longer measures frontier coding capabilities | Hacker News

TL;DR AI
1분핵심 요약
Hacker News 댓글에서는 SWE-bench Verified가 더 이상 최전선 수준의 코딩 능력을 제대로 보여주지 못한다고 지적했다.
데이터 오염, 벤치마크 특화 최적화, 모델별 상반된 주장 등이 벤치마크 게임화의 증거로 제시됐다.
공개 벤치마크가 널리 최적화되면 실제 코딩 실력을 측정하는 지표로서의 신뢰도가 떨어진다는 논의가 나왔다.
대안으로는 ARC-AGI 같은 최신 평가 흐름처럼, 주기적으로 갱신되는 더 새롭고 더 어려운 평가 방식이 제안됐다.



