언어 바꾸기English
이전 목록

LiveBrowseComp: 검색 에이전트는 실제로 검색하는가, 아니면 이미 알고 있는 것을 확인하는가?

LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?

TL;DR AI

핵심 요약

1분
  1. 연구진은 BrowseComp에서 많은 LLM 검색 에이전트가 웹 도구보다 내부 기억에 의존해 답하는 경향을 확인했다.

  2. 근거를 제거하자 성능이 크게 떨어져, 실제 증거 기반 검색 능력은 제한적인 것으로 나타났다.

  3. 이를 바탕으로 최근 90일 내 사실을 반영한 인간 작성 질문 335개로 구성된 LiveBrowseComp를 공개했다.

  4. LiveBrowseComp에서 평가된 에이전트들은 폐쇄형(closed-book) 기준 2% 미만의 정확도를 보였고, 검색 성능도 BrowseComp보다 크게 낮았다.

  5. 이번 연구는 기존 검색 벤치마크가 실제 웹 검색 능력을 과대평가할 수 있으며, 더 신선한 평가가 필요함을 보여준다.

원문 보기