Agentic CLEAR: LLM 에이전트의 다단계 평가를 자동화하다
Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents
TL;DR AI
1분핵심 요약
연구진은 LLM 에이전트를 자동으로 평가하는 Agentic CLEAR를 제안했으며, 여러 수준의 텍스트 피드백을 동적으로 생성한다.
이 프레임워크는 시스템, 트레이스, 노드 수준에서 동작을 분석해 고수준과 세부 수준의 인사이트를 함께 제공한다.
여러 벤치마크와 환경에서 Agentic CLEAR는 인간 판단과 높은 일치도를 보이며 에이전트 오류도 효과적으로 포착했다.
고정된 수작업 오류 분류에 의존하지 않아, 변화하는 작업과 도메인에서도 확장성 있는 평가가 가능하다.
