언어 바꾸기English
이전 목록

OpenAI, GPT-5.6 하네스 개선으로 ARC-AGI-3 점수 3배 향상 성공… 모델 자체 성능뿐 아니라 하네스도 중요함을 보여줘

OpenAI successfully improves GPT-5.6 harness to triple ARC-AGI-3 score, showing that harnesses matter as much as the model itself

TL;DR AI

핵심 요약

1분
  1. OpenAI는 GPT-5.6 Sol의 ARC-AGI-3 성적이 낮았던 이유가 평가 harness가 추론 과정을 버리고 문맥을 과도하게 잘랐기 때문이라고 밝혔다.

  2. 추론 보존과 rolling truncation 대신 압축 방식을 적용하자 점수는 13.3%에서 38.3%로 상승했고, 출력 토큰은 원래의 1/6 수준으로 줄었다.

  3. 이번 사례는 벤치마크 결과가 모델 성능만이 아니라 API 설정과 harness 설계에 크게 좌우될 수 있음을 보여준다.

  4. 즉, AI 성능 비교에서는 모델 자체뿐 아니라 평가 방법의 차이도 함께 봐야 한다.

원문 보기