언어 바꾸기English
이전 목록

SFT에서 RL로 넘어가기: 멀티모달 RL을 위한 블랙박스 온-폴리시 증류 기반 사전 정렬

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

TL;DR AI

핵심 요약

1분
  1. 연구진은 멀티모달 모델의 성능을 높이기 위해, 지도 미세조정과 강화학습 사이에 분포 정렬 단계를 넣는 PRISM 3단계 파이프라인을 제안했다.

  2. PRISM은 블랙박스 온폴리시 증류와 policy-vs-MoE 판별자 게임을 활용해 SFT로 생기는 학습-추론 분포 불일치를 줄인다.

  3. Qwen3-VL에서 GRPO, DAPO, GSPO 등 여러 RL 방식에 걸쳐 다운스트림 정확도를 개선했다.

  4. 멀티모달 추론 벤치마크에서도 유의미한 향상을 보여, RLVR 학습을 안정화하는 실용적 방법임을 시사했다.

원문 보기