Flux-OPD: 진화하는 컨텍스트를 활용한 온-폴리시 증류
Flux-OPD: On-Policy Distillation with Evolving Contexts
TL;DR AI
1분핵심 요약
연구진은 오픈엔드 언어 모델 학습을 위한 새로운 온-폴리시 증류 기법인 Flux-OPD를 제안했다.
이 방법은 변화하는 문맥을 활용해 교사 신호를 제공하고, 충돌을 줄이는 가중치로 학습을 안정화한다.
역 KL 증류를 문맥 조건 교사와 함께 분석해, 기하평균 효과와 충돌 항을 밝혀냈다.
보상이 검증하기 어려운 상황에서도 유용한 감독 신호를 만들 수 있어, 오픈엔드 과제 학습에 도움이 된다.
