CoRT: 토큰 수준 루브릭 기반 정책 최적화를 위한 반사실적 리플레이
CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization
TL;DR AI
1분핵심 요약
연구진은 언어모델의 루브릭 기반 GRPO를 위한 토큰 수준 credit assignment 기법 CoRT를 제안했다.
같은 샘플 응답을 원래 루브릭 프롬프트와 기준이 없는 프롬프트에서 비교해 토큰별 likelihood 차이를 계산한다.
이 차이를 bounded weight로 바꿔, 응답 단위 advantage를 각 토큰으로 분산시킨다.
실험에서 CoRT는 대부분의 비교에서 response-level GRPO보다 우수했고, 학습형 token-level baseline과도 경쟁력을 보였다.
별도의 token scorer 없이 RL 학습을 더 정밀하고 효율적으로 만들 수 있다는 점이 의미가 있다.
