포인트와이즈 상호정보를 활용한 추론 RL의 자기 증류 방지
Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information
TL;DR AI
2분핵심 요약
연구진은 표준 자기증류(self-distillation)를 뒤집는 새로운 강화학습 방법 Anti-Self-Distillation(AntiSD)을 공개했다.
AntiSD는 제한된 Jensen-Shannon 목적함수와 엔트로피 트리거 게이트를 사용해 더 적은 학습 단계로 효율적으로 학습한다.
이 방법은 GRPO와 비슷한 정확도를 훨씬 적은 단계에서 달성했고, 4B~30B 규모의 밀집형 및 MoE 모델에서 여러 벤치마크 점수를 최대 11.5점 끌어올렸다.
또한 AIME 2024, AIME 2025, HMMT 2025, BeyondAIME 같은 어려운 수학 벤치마크에서 학습 시간을 약 2~10배 줄이면서 성능을 높였다.
