레이어에서 서브모듈로: 교체 기반 LLM 압축의 세분성 재고
From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

TL;DR AI
1분핵심 요약
연구진은 대형 언어 모델을 위한 사후 학습 압축 기법 SubFit을 제안했다.
SubFit은 전체 레이어를 지우는 대신 Attention과 FeedForward 서브모듈을 비연속적으로 선택해 적합된 residual bypass로 대체한다.
10개 모델과 여러 희소성 설정에서 평가한 결과, 특히 높은 압축률에서 여러 대체형 기준선보다 더 좋은 성능을 보였다.
이 방법은 추론 속도 향상과 KV-cache 절감 등 속도·메모리 이점도 제공했다.
결국 SubFit은 정확도를 더 잘 보존하면서 트랜스포머를 더 세밀하게 압축하는 방법을 보여준다.
