언어 바꾸기English
이전 목록

OScaR: LLM과 그 너머를 위한 극한 KV 캐시 양자화의 오컴의 면도날

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

TL;DR AI

핵심 요약

1분
  1. 연구진은 긴 컨텍스트 LLM을 위한 경량 KV 캐시 양자화 프레임워크 OScaR를 제안했다.

  2. OScaR는 canalized rotation과 omni-token scaling으로 토큰 norm 불균형을 완화해 거의 손실 없는 저비트 압축을 구현한다.

  3. BF16 기준 대비 최대 3.0배 빠른 디코딩, 5.3배 낮은 메모리 사용, 4.1배 높은 처리량을 보고했다.

  4. 이 방식은 FlashDecoding-v2와 CUDA 커널을 활용해 긴 컨텍스트 및 멀티모달 모델의 배포 병목을 줄이는 데 초점을 맞춘다.

원문 보기