언어 바꾸기English
이전 목록

ORCA-bench: 언어 모델 에이전트는 온콜에 얼마나 준비되어 있는가?

ORCA-bench: How Ready Are Language Model Agents for Oncall?

TL;DR AI

핵심 요약

1분
  1. 연구진이 실제 텔레메트리 데이터, 소스 코드, 1,079개 incident task를 활용한 공개 벤치마크 ORCA-bench를 공개했다.

  2. 이 벤치마크는 production 스타일의 oncall root cause analysis에서 코딩 에이전트를 평가하도록 설계됐다.

  3. 5개의 최상위 에이전트를 시험한 결과 정확도는 낮았고, 원인을 잘못 추정하는 환각이 자주 나타났다.

  4. 소스 코드 접근이 없으면 성능이 더 떨어져, 현재 에이전트들이 실서비스 신뢰성 업무에 아직 충분히 의존할 수 없음을 보여준다.

원문 보기