사전학습을 넘어 Muon 다시 보기: VLA와 RLVR을 위한 스펙트럼 실패와 고역통과 해법
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR
TL;DR AI
1분핵심 요약
연구진은 로보틱스와 강화학습의 포스트 프리트레이닝에 맞춘 드롭인 옵티마이저 Pion을 제안했다.
논문은 Muon의 whitening 기반 spectral 업데이트가 프리트레이닝 밖, 특히 저 SNR·멀티모달 환경에서 불안정해질 수 있다고 지적한다.
Pion은 high-pass Newton-Schulz 업데이트와 선택적 per-head 업데이트를 사용해 노이즈 방향은 줄이고 강한 방향은 유지한다.
VLA 벤치마크, 로봇 조작 과제, RLVR 수학 태스크에서 Muon과 AdamW보다 더 나은 성능을 보고했다.
