DRIFT: 효율적인 다중 턴 최적화를 위한 분리형 롤아웃과 중요도 가중 미세조정
DRIFT: Decoupled Rollouts and Importance-Weighted Fine-Tuning for Efficient Multi-Turn Optimization
TL;DR AI
1분핵심 요약
연구진은 다중 턴 언어 모델 최적화를 위한 학습 프레임워크 DRIFT를 제안했다.
DRIFT는 고정된 기준 정책에서 오프라인 궤적을 샘플링해 데이터 수집과 최적화를 분리한다.
반복적인 온라인 RL 롤아웃 대신, 보상 기반 중요도 가중치를 적용한 지도 미세조정을 사용한다.
이 방식은 더 낮은 학습 비용으로 다중 턴 RL 기준선과 비슷하거나 더 나은 성능을 보인다고 보고됐다.
