LEEPS: 대규모 언어 모델에서 효율적인 RLVR을 위한 잠재 유도 탐색-활용 프롬프트 샘플링
LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

TL;DR AI
1분핵심 요약
LEEPS는 RLVR용 사전 롤아웃 프롬프트 샘플러로, 프롬프트를 exploit와 explore 그룹으로 동적으로 나눠 더 유용한 학습 신호를 우선 수집합니다.
잠재공간 이웃과 과거 결과를 활용해 불확실한 프롬프트를 우선 배정함으로써, 중복 생성으로 인한 롤아웃 낭비를 줄입니다.
Qwen2.5-Math-1.5B와 7B에서 6개 수학 추론 벤치마크와 3개 OOD 벤치마크를 평가한 결과, 두 모델 규모 모두에서 평균 성능이 가장 좋았습니다.
훈련 오버헤드는 크지 않았고, RLVR 훈련의 효율성과 추론 성능을 함께 높였다는 점에서 의미가 큽니다.
