OpenAI, AI 벤치마크 점수는 하니스·예산·메모리 설계에 따라 달라진다고 밝혀
OpenAI Says AI Benchmark Scores Depend on Harnesses, Budgets, and Memory Design

TL;DR AI
1분핵심 요약
OpenAI는 벤치마크 점수가 테스트 하네스, 컴퓨트 예산, 도구, 메모리·컨텍스트 설정에 따라 크게 달라질 수 있다는 가이드를 공개했다.
회사는 평가자가 이런 조건을 공개하고, 순수 능력 주장과 통제된 비교, 견고성 테스트를 구분해야 한다고 강조했다.
또 GPT-5.5 사이버레인지 결과에서 컨텍스트 압축이 긴 과제 성능을 높였다고 언급하며, 평가 설계가 결과를 바꿀 수 있음을 보여줬다.
핵심은 벤치마크 점수를 모델의 고정된 능력치가 아니라 특정 평가 환경에서 나온 결과로 읽어야 한다는 점이다.
