ORCA-bench: 언어 모델 에이전트는 온콜에 얼마나 준비되어 있는가?
ORCA-bench: How Ready Are Language Model Agents for Oncall?

TL;DR AI
1분핵심 요약
연구진이 실제 텔레메트리 데이터, 소스 코드, 1,079개 incident task를 활용한 공개 벤치마크 ORCA-bench를 공개했다.
이 벤치마크는 production 스타일의 oncall root cause analysis에서 코딩 에이전트를 평가하도록 설계됐다.
5개의 최상위 에이전트를 시험한 결과 정확도는 낮았고, 원인을 잘못 추정하는 환각이 자주 나타났다.
소스 코드 접근이 없으면 성능이 더 떨어져, 현재 에이전트들이 실서비스 신뢰성 업무에 아직 충분히 의존할 수 없음을 보여준다.
