LongTraceRL: 검색 에이전트 궤적과 루브릭 보상으로 긴 문맥 추론 학습
LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards

TL;DR AI
1분핵심 요약
연구진이 대규모 언어모델의 장문맥 추론을 위한 강화학습 방법인 LongTraceRL을 제안했다.
이 방법은 검색 에이전트 궤적과 단계적 오답 유도 문맥을 활용해 더 어려운 학습 데이터를 만들고, 정답에는 엔터티 수준 루브릭 보상을 적용한다.
여러 모델 크기와 5개 벤치마크에서 LongTraceRL은 강력한 기존 기준선보다 더 좋은 성능을 보였다.
이 접근은 긴 문서와 다단계 질문에서 근거를 더 잘 찾고 활용하도록 돕는 것을 목표로 한다.
