언어 바꾸기English
이전 목록

언어 피드백을 통한 학습: 변분 정책 증류를 활용해

Learning from Language Feedback via Variational Policy Distillation

TL;DR AI

핵심 요약

1분
  1. 연구진은 컴파일 오류, 비판, 자기 수정 같은 언어 피드백을 활용하는 변분 EM 기반 학습법 Variational Policy Distillation을 제안했다.

  2. 이 방법은 교사-학생 모델을 번갈아 최적화해, 단순한 통과/실패 보상보다 풍부한 실패 신호로부터 학습하게 한다.

  3. Qwen3와 Llama-3.1 같은 공개 모델에서 코드 생성과 과학적 추론 벤치마크에서 GRPO와 자기 증류보다 더 좋은 성능을 보였다.

  4. 학습 안정성을 높이고 추가 메모리도 필요 없었지만, 일부 엄격한 수학 과제에서는 기존 RL이 여전히 더 좋았다.

원문 보기