Mix-MoE: 혼합 MoE를 통해 대규모 언어 모델의 다국어 기계 번역을 개선하다
Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs
TL;DR AI
1분핵심 요약
연구진은 대규모 언어 모델의 다국어 기계번역을 위한 2단계 Mixture-of-Experts 프레임워크 Mix-MoE를 제안했다.
이 모델은 먼저 단일언어 데이터로 학습한 뒤, 병렬 데이터로 다시 학습하며 언어 모델링과 번역용 전문가를 분리한다.
Fourier 기반 라우팅은 입력을 적절한 전문가에게 전달해 작업 간 간섭을 줄인다.
실험 결과 Mix-MoE는 기존 방법보다 더 좋은 번역 성능을 보였고, 단일언어 지식도 더 잘 유지했다.
