언어 바꾸기English
이전 목록

TerminalWorld: 실제 터미널 작업에서 에이전트 벤치마킹

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

TL;DR AI

핵심 요약

1분
  1. 연구진은 80,870개의 공개 인간 터미널 기록을 역분석해 1,530개의 검증된 과제를 만든 TerminalWorld 벤치마크를 공개했다.

  2. 이 벤치마크는 18개 카테고리와 1,280개의 도구·명령을 포함해, 실제 업무에서 발생하는 복잡한 터미널 작업을 반영한다.

  3. 최신 최상위 모델들을 평가한 결과 최고 성능도 통과율 62.5%에 그쳐, 여전히 개선 여지가 크다는 점이 드러났다.

  4. 이번 결과는 Docker, CI/CD, 클라우드, 시스템 관리 같은 실무 터미널 작업을 AI 에이전트가 아직 안정적으로 처리하지 못함을 보여준다.

원문 보기