프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류
Multi-Turn On-Policy Distillation with Prefix Replay
TL;DR AI
2분핵심 요약
연구진은 저장된 교사(prefix) 궤적을 재사용해 새 환경 롤아웃 없이 학습하는 오프라인 온-폴리시 증류 방법 ReOPD를 제안했다.
이 논문은 학생이 생성한 히스토리가 신뢰도 높은 교사 궤적과 어긋나며 멀티턴 증류를 어렵게 만드는 ‘prefix trap’을 지적한다.
ReOPD는 replayed prefix와 단계적으로 감소하는 샘플링 전략을 사용해 턴이 진행될수록 커지는 불일치를 줄인다.
추론 및 검색 과제 실험에서 기존 온-폴리시 증류와 비슷하거나 더 나은 성능을 보였고, 툴 호출 없이 학습 속도도 높였다.
이 방식은 에이전트 증류 비용을 크게 낮춰 다양한 과제와 모델 크기로의 확장을 쉽게 만들 수 있다.
