언어 바꾸기English
이전 목록

TOBench: 실제 환경 도구 사용 에이전트를 위한 작업 지향 옴니모달 벤치마크

TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

TL;DR AI

핵심 요약

1분
  1. 연구진이 실제 종단 간 작업을 평가하는 새로운 옴니모달 AI 에이전트 벤치마크 MM-ToolBench를 공개했다.

  2. 이 벤치마크는 100개의 실행 가능한 태스크, 27개의 MCP 서버, 324개의 도구로 멀티모달 추론과 도구 사용 능력을 시험한다.

  3. 평가 하네스는 에이전트가 결과를 검증하고 실패를 감지해, 요구 조건을 충족하지 못할 때 스스로 수정하는지 확인한다.

  4. 결과는 고객 서비스와 콘텐츠 제작 같은 업무 흐름에서 현재 모델과 인간 사이에 큰 격차가 있음을 보여준다.

원문 보기