언어 바꾸기English
이전 목록

LLM 추론을 위한 기술 조건부 게이트형 자기 증류

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

TL;DR AI

핵심 요약

2분
  1. 연구진은 약한 감독 신호로도 LLM 추론 성능을 높이는 새로운 방법인 Skill-Conditioned Gated Self-Distillation을 제안했다.

  2. 이 방법은 skill-mistake 쌍을 검색해 여러 개의 스킬 조건부 교사를 만들고, 검증기와 게이트 손실로 유의미한 불일치만 학습하며 잡음은 걸러낸다.

  3. AIME24, AIME25, HMMT25 같은 수학 추론 벤치마크에서 GRPO를 능가했고, 답변 조건부 self-distillation과도 견줄 만한 성능을 보였다.

  4. 특히 Qwen3-1.7B에서는 GRPO 대비 평균 6.2% 향상돼, 정답이 완전히 신뢰되지 않는 환경에서도 더 실용적인 추론 개선이 가능함을 보여줬다.

원문 보기