언어 바꾸기English
이전 목록

LongMemEval-V2: 경험 많은 동료를 향한 장기 에이전트 메모리 평가

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

TL;DR AI

핵심 요약

1분
  1. 연구진이 웹 환경에서 에이전트의 장기 기억 성능을 평가하는 벤치마크 LongMemEval-V2를 공개했다.

  2. 이 벤치마크는 5가지 기억 능력과 긴 trajectory 기록을 바탕으로 451개의 선별된 질문으로 구성됐다.

  3. 실험 결과 AgentRunbook-C가 전체적으로 가장 높은 성능을 보였고, 코딩 에이전트 방식은 정확도는 높였지만 지연 시간도 늘어났다.

  4. 이번 벤치마크는 메모리 시스템이 반복되는 작업 흐름과 함정을 얼마나 잘 학습하는지 더 직접적으로 측정하도록 돕는다.

원문 보기