행동이 아닌 믿음에 보상하기: 장기 수평 에이전트를 위한 일관성 유도 신용 할당
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

TL;DR AI
1분핵심 요약
연구진은 부분 관측 환경의 장기형 LLM 에이전트를 위한 프로세스 수준 강화학습 기법 ReBel을 제안했다.
ReBel은 구조화된 믿음 상태를 모델링하고, 믿음 일관성 감독을 추가하며, 유사한 믿음 상태의 궤적을 묶어 더 촘촘하고 안정적인 학습 신호를 만든다.
ALFWorld와 WebShop에서 에피소드 수준 GRPO 기준선보다 최대 20.4%p 높은 성능을 보였고, 샘플 효율도 2.1배 개선했다고 보고됐다.
이 방법은 단계별 라벨 없이도 지연 보상 신용 할당 문제를 완화해 장기 에이전트의 성공률과 학습 효율을 높인다.
