언어 바꾸기English
이전 목록

프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류

Multi-Turn On-Policy Distillation with Prefix Replay

TL;DR AI

핵심 요약

2분
  1. 연구진은 저장된 교사(prefix) 궤적을 재사용해 새 환경 롤아웃 없이 학습하는 오프라인 온-폴리시 증류 방법 ReOPD를 제안했다.

  2. 이 논문은 학생이 생성한 히스토리가 신뢰도 높은 교사 궤적과 어긋나며 멀티턴 증류를 어렵게 만드는 ‘prefix trap’을 지적한다.

  3. ReOPD는 replayed prefix와 단계적으로 감소하는 샘플링 전략을 사용해 턴이 진행될수록 커지는 불일치를 줄인다.

  4. 추론 및 검색 과제 실험에서 기존 온-폴리시 증류와 비슷하거나 더 나은 성능을 보였고, 툴 호출 없이 학습 속도도 높였다.

  5. 이 방식은 에이전트 증류 비용을 크게 낮춰 다양한 과제와 모델 크기로의 확장을 쉽게 만들 수 있다.

원문 보기