TIDE를 뒤집다: 확산형 대규모 언어 모델을 위한 크로스 아키텍처 증류
Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models
TL;DR AI
1분핵심 요약
연구진은 서로 다른 아키텍처의 확산형 LLM 사이에서 지식을 전이하는 교차-아키텍처 증류 프레임워크 TIDE를 공개했다.
TIDE는 서로 다른 토크나이저와 어텐션 설계를 가진 큰 교사 모델의 지식을 작은 학생 모델로 전달하기 위한 세 가지 구성 요소로 이뤄졌다.
8개 벤치마크에서 0.6B 학생 모델은 기존 기준선을 넘어섰고, 16B 교사 대비 큰 효율 향상을 보였다.
이 결과는 정확도, 코드 생성, 메모리 사용량, 추론 속도 측면에서 확산형 LLM의 실용성을 높일 수 있음을 보여준다.
PKU-YuanGroup은 코드, 체크포인트, 데이터도 함께 공개했다.
