언어 바꾸기English
이전 목록

사후 학습된 MoE는 자기 증류를 통해 절반의 전문가를 건너뛸 수 있다

Post-Trained MoE Can Skip Half Experts via Self-Distillation

TL;DR AI

핵심 요약

1분
  1. 연구진은 정적 Mixture-of-Experts 모델을 동적으로 바꾸는 사후학습 기법 ZEDA를 제안했다.

  2. ZEDA는 zero-output expert를 추가한 뒤, 2단계 self-distillation으로 어떤 expert를 건너뛸지 학습한다.

  3. Qwen3-30B-A3B와 GLM-4.7-Flash 같은 모델에서 expert FLOP를 50% 이상 줄이고 추론 속도를 약 1.2배 높였다.

  4. 정확도 저하는 크지 않아, 학습 후 MoE 추론 비용을 현실적으로 낮출 수 있는 방법으로 보인다.

원문 보기