더 나은 추론 일반화를 위한 SFT 데이터 적응 학습
Learning to Adapt SFT Data for Better Reasoning Generalization

TL;DR AI
1분핵심 요약
연구진은 모델의 분포에 더 잘 맞도록 SFT 데이터를 적응시키는 DART를 제안했다.
DART는 기존 SFT 데모를 강화학습으로 변환해 모델에 맞는 감독 신호로 만든 뒤 미세조정에 사용한다.
이 방법은 여러 언어 모델과 데이터셋에서 추론 일반화 성능을 높였다.
고정된 학습 데이터를 더 효과적으로 활용할 수 있는 실용적인 방법으로, 강화학습 단독 의존을 줄여준다.
