TOBench: 실제 환경 도구 사용 에이전트를 위한 작업 지향 옴니모달 벤치마크
TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents
TL;DR AI
1분핵심 요약
연구진이 실제 종단 간 작업을 평가하는 새로운 옴니모달 AI 에이전트 벤치마크 MM-ToolBench를 공개했다.
이 벤치마크는 100개의 실행 가능한 태스크, 27개의 MCP 서버, 324개의 도구로 멀티모달 추론과 도구 사용 능력을 시험한다.
평가 하네스는 에이전트가 결과를 검증하고 실패를 감지해, 요구 조건을 충족하지 못할 때 스스로 수정하는지 확인한다.
결과는 고객 서비스와 콘텐츠 제작 같은 업무 흐름에서 현재 모델과 인간 사이에 큰 격차가 있음을 보여준다.
