OScaR: LLM과 그 너머를 위한 극한 KV 캐시 양자화의 오컴의 면도날
OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond
TL;DR AI
1분핵심 요약
연구진은 긴 컨텍스트 LLM을 위한 경량 KV 캐시 양자화 프레임워크 OScaR를 제안했다.
OScaR는 canalized rotation과 omni-token scaling으로 토큰 norm 불균형을 완화해 거의 손실 없는 저비트 압축을 구현한다.
BF16 기준 대비 최대 3.0배 빠른 디코딩, 5.3배 낮은 메모리 사용, 4.1배 높은 처리량을 보고했다.
이 방식은 FlashDecoding-v2와 CUDA 커널을 활용해 긴 컨텍스트 및 멀티모달 모델의 배포 병목을 줄이는 데 초점을 맞춘다.
