자체 생성 데이터로 중간 훈련하면 언어 모델의 강화 학습이 향상된다
Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models
TL;DR AI
1분핵심 요약
연구진은 강화학습 전에 언어모델이 여러 개의 정답 풀이를 생성·선별하는 중간 학습 단계를 도입했다.
다양한 자기 생성 추론 흔적으로 학습하면 GRPO 기반 RL이 일반 RL과 STaR+RL보다 여러 벤치마크에서 더 좋아진다.
pass@k가 높을수록 개선 폭이 커져, 여러 좋은 경로를 탐색할 수 있을 때 더 큰 이점을 보였다.
분석 결과 RL은 학습이 진행될수록 하나의 경로를 외우기보다 여러 휴리스틱을 조합하는 방향으로 발전했다.
