Harness-1: 상태 외부화 하네스를 활용한 검색 에이전트용 강화학습
Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

TL;DR AI
1분핵심 요약
연구진은 강화학습으로 훈련한 20B 규모의 검색 서브에이전트 Harness-1을, 상태를 유지하는 검색 하니스 안에 도입했다.
이 하니스는 후보군, 정제된 증거, 검증 기록, 압축 관찰 등 메모리와 보조 작업을 환경 측에서 관리해 모델이 검색, 문서 선택, 검증, 중단 판단에 집중하게 한다.
Harness-1은 8개 벤치마크에서 강한 성능을 보였고, 특히 보지 못한 전이형 검색 과제에서 크게 개선됐다.
이번 연구는 작업 기억을 환경이 맡기면 검색 에이전트의 강화학습 효율이 높아지고 새로운 검색 환경으로의 전이도 좋아질 수 있음을 보여준다.
