언어 바꾸기English
이전 목록

CEPO: 대조적 증거 정책 최적화를 사용한 RLVR 자기 증류

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

TL;DR AI

핵심 요약

1분
  1. 연구진은 검증 가능한 보상을 활용한 강화학습용 대비적 자기증류 기법 CEPO를 제안했다.

  2. CEPO는 거부된 롤아웃을 부정 교사로 활용해 핵심 추론 단계와 불필요한 토큰을 구분한다.

  3. 이 방법은 학습 보장성을 유지하면서 공헌도 할당을 개선하고, 추가 샘플링 비용도 들지 않는다.

  4. CEPO는 멀티모달 수학 벤치마크에서 GRPO, OPSD, SDPO 등 기존 방법보다 더 높은 성능을 보였다.

원문 보기