DelTA: 검증 가능한 보상으로부터 강화학습을 위한 판별적 토큰 크레딧 할당
DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards
TL;DR AI
1분핵심 요약
연구진은 검증 가능한 보상 기반 강화학습(RLVR)을 위한 판별적 토큰 크레딧 할당 기법 DelTA를 제안했다.
DelTA는 흔하고 잡음이 많은 패턴의 영향은 줄이고, 정보성 높은 토큰의 기여는 더 크게 반영하도록 가중치를 조정한다.
이 방법은 Qwen3-8B-Base와 Qwen3-14B-Base를 포함한 수학 추론·코드 생성 벤치마크에서 성능 향상을 보였다.
응답 수준의 보상을 토큰 수준 업데이트로 더 효과적으로 바꿔, 추론 성능과 일반화 능력을 높인다.
