언어 바꾸기English
이전 목록

WIDE: 토큰 수준의 동적 폭 가지치기를 통한 적응형 LLM 추론 향상

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

TL;DR AI

핵심 요약

1분
  1. 연구진은 LLM 추론을 더 빠르게 만들기 위해 토큰 단위로 주의(attention) 헤드와 FFN 채널 그룹을 선택적으로 줄이는 WIDE를 제안했다.

  2. WIDE는 종단간 미분 가능한 프루닝 프레임워크와 2단계 학습, 그리고 프루닝-커널 공동 설계를 결합했다.

  3. 이 방법은 prefill과 decode 단계 모두에서 효율적인 실행을 지원하며, 기존 동적 프루닝보다 정확도 손실이 적다고 보고됐다.

  4. 50% 희소성에서도 측정 가능한 속도 향상을 보여, 속도와 품질의 균형을 더 정교하게 맞출 수 있음을 시사한다.

원문 보기