언어 바꾸기English
이전 목록

FineVerify: 세밀한 자기 검증을 통한 에이전트 검색의 테스트 시점 컴퓨팅 확장

FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

TL;DR AI

핵심 요약

1분
  1. 연구진은 복잡한 질문을 더 작은 검증 가능한 하위 질문으로 나누는 에이전틱 검색용 자기 검증 프레임워크 FineVerify를 제안했다.

  2. 샘플링한 에이전트 궤적을 이런 로컬 검증 기준으로 채점해 가장 높은 점수를 받은 후보를 선택하며, 테스트 시 검증을 더 세밀하고 해석 가능하게 만든다.

  3. 4개 에이전틱 검색 벤치마크와 2개 모델에서 FineVerify는 기존 스케일링 기준을 능가했으며, GPT-5-mini와 Gemini-3-flash에서도 성능 향상을 보였다.

  4. 12개 샘플에서는 GPT-5-mini가 BrowseComp-Plus에서 GPT-5를 넘어서는 결과도 냈다.

원문 보기