자기 확신이 잘못 이끌 때: 검증 가능한 보상을 위한 강화학습의 능동적 라벨 획득
When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

TL;DR AI
1분핵심 요약
연구진은 RLAVR를 제안해, 검증 가능한 보상을 사용하는 강화학습을 더 적은 라벨로도 안정적으로 학습할 수 있게 했다.
RLAVR은 의사 라벨만 쓰는 대신, 일부 샘플에 대해 능동적으로 획득한 정답 라벨과 의사 라벨을 함께 활용한다.
이 방법은 Corrective Advantage Gap(CAG)로 가치 있는 샘플을 찾고, 실제 획득 정책으로 CARE를 사용한다.
실험에서는 다양한 도메인과 모델 규모에서 안정성과 성능이 향상돼, 추론 모델 학습의 핵심 병목을 완화하는 것으로 나타났다.
