언어 바꾸기English
이전 목록

포인트와이즈 상호정보를 활용한 추론 RL의 자기 증류 방지

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

TL;DR AI

핵심 요약

2분
  1. 연구진은 표준 자기증류(self-distillation)를 뒤집는 새로운 강화학습 방법 Anti-Self-Distillation(AntiSD)을 공개했다.

  2. AntiSD는 제한된 Jensen-Shannon 목적함수와 엔트로피 트리거 게이트를 사용해 더 적은 학습 단계로 효율적으로 학습한다.

  3. 이 방법은 GRPO와 비슷한 정확도를 훨씬 적은 단계에서 달성했고, 4B~30B 규모의 밀집형 및 MoE 모델에서 여러 벤치마크 점수를 최대 11.5점 끌어올렸다.

  4. 또한 AIME 2024, AIME 2025, HMMT 2025, BeyondAIME 같은 어려운 수학 벤치마크에서 학습 시간을 약 2~10배 줄이면서 성능을 높였다.

원문 보기