모든 루브릭이 똑같이 가르치지는 않는다: RLVR을 위한 정책 인지형 루브릭 보상
Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR
TL;DR AI
1분핵심 요약
연구진은 RL 후학습에 쓰이는 많은 루브릭 기준이 실제로는 특정 정책에 대해 대비 학습 신호를 만들지 못한다는 점을 발견했다.
고정된 루브릭 가중치는 학습 압력을 잘못된 방향으로 보낼 수 있어, 팀은 최종 평가 기준은 유지하되 학습 중 기준 가중치를 조정하는 POW3R를 제안했다.
POW3R는 여러 정책과 설정, 특히 멀티모달 및 HealthBench 계열 평가에서 기준 방법보다 더 좋은 성능을 보였다.
비슷한 성능을 약 2.5~4배 적은 학습 단계로 달성해 샘플 효율성도 높였다.
