WorkSurface-Bench: 엔터프라이즈 에이전트의 다중 서피스 지식 라우팅 벤치마킹
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

TL;DR AI
1분핵심 요약
연구진이 문서·표·그래프·교차 정보 간 질문 라우팅 성능을 평가하는 1,151개 태스크의 벤치마크 WorkSurface-Bench를 공개했다.
네 개의 모델 백본과 여섯 가지 에이전트 설정에서, 정답 도구 접근이 주어지면 라우팅 정확도는 매우 높았지만 최종 답변 정확도는 훨씬 낮았다.
이는 올바른 지식 표면을 고르는 일이 중요하지만, 그것만으로 정답을 보장하지는 못한다는 점을 보여준다.
연구팀은 데이터셋, 채점 코드, 에이전트 하네스도 함께 공개해 추가 평가를 지원한다.
