언어 피드백을 통한 학습: 변분 정책 증류를 활용해
Learning from Language Feedback via Variational Policy Distillation
TL;DR AI
1분핵심 요약
연구진은 컴파일 오류, 비판, 자기 수정 같은 언어 피드백을 활용하는 변분 EM 기반 학습법 Variational Policy Distillation을 제안했다.
이 방법은 교사-학생 모델을 번갈아 최적화해, 단순한 통과/실패 보상보다 풍부한 실패 신호로부터 학습하게 한다.
Qwen3와 Llama-3.1 같은 공개 모델에서 코드 생성과 과학적 추론 벤치마크에서 GRPO와 자기 증류보다 더 좋은 성능을 보였다.
학습 안정성을 높이고 추가 메모리도 필요 없었지만, 일부 엄격한 수학 과제에서는 기존 RL이 여전히 더 좋았다.
