실패에서 배우기: 검증 가능한 보상을 활용한 수정 지향 정책 최적화
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
TL;DR AI
1분핵심 요약
연구진은 실패한 RL 궤적을 교정 중심의 학습 신호로 바꾸는 언어모델용 정책 최적화 기법 CIPO를 제안했다.
CIPO는 RLVR을 확장해 실패한 시도에서 유용한 학습 신호를 추출함으로써, 오류를 버리지 않고 학습에 활용한다.
11개 벤치마크에서 강력한 기준선들을 능가하며 추론과 자기 수정 지표에서 더 좋은 성능을 보였다.
이 방법은 외부 라벨 없이도 수학 추론과 코드 생성, pass@K 계열 성능을 향상시켰다.
