언어 바꾸기English
이전 목록

OpenAI, AI 벤치마크 점수는 하니스·예산·메모리 설계에 따라 달라진다고 밝혀

OpenAI Says AI Benchmark Scores Depend on Harnesses, Budgets, and Memory Design

TL;DR AI

핵심 요약

1분
  1. OpenAI는 벤치마크 점수가 테스트 하네스, 컴퓨트 예산, 도구, 메모리·컨텍스트 설정에 따라 크게 달라질 수 있다는 가이드를 공개했다.

  2. 회사는 평가자가 이런 조건을 공개하고, 순수 능력 주장과 통제된 비교, 견고성 테스트를 구분해야 한다고 강조했다.

  3. 또 GPT-5.5 사이버레인지 결과에서 컨텍스트 압축이 긴 과제 성능을 높였다고 언급하며, 평가 설계가 결과를 바꿀 수 있음을 보여줬다.

  4. 핵심은 벤치마크 점수를 모델의 고정된 능력치가 아니라 특정 평가 환경에서 나온 결과로 읽어야 한다는 점이다.

원문 보기