사후 학습된 MoE는 자기 증류를 통해 절반의 전문가를 건너뛸 수 있다
Post-Trained MoE Can Skip Half Experts via Self-Distillation
TL;DR AI
1분핵심 요약
연구진은 정적 Mixture-of-Experts 모델을 동적으로 바꾸는 사후학습 기법 ZEDA를 제안했다.
ZEDA는 zero-output expert를 추가한 뒤, 2단계 self-distillation으로 어떤 expert를 건너뛸지 학습한다.
Qwen3-30B-A3B와 GLM-4.7-Flash 같은 모델에서 expert FLOP를 50% 이상 줄이고 추론 속도를 약 1.2배 높였다.
정확도 저하는 크지 않아, 학습 후 MoE 추론 비용을 현실적으로 낮출 수 있는 방법으로 보인다.
