각 토큰의 가치를 높이기: KV 캐시 제거로 장문 컨텍스트 성능 개선하기
Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction
TL;DR AI
1분핵심 요약
연구진이 긴 문맥 추론을 위한 학습형 글로벌 KV 캐시 축출 기법을 제안했다.
공유 보정을 통해 서로 다른 레이어와 헤드의 토큰이 하나의 메모리 예산 아래에서 경쟁하도록 했다.
이 방식은 KV 메모리를 줄이면서 언어·비전-언어·대화 작업에서 전체 캐시와 같거나 더 나은 성능을 보였다.
긴 문맥 AI의 핵심 병목을 완화하며, 모든 토큰을 유지하는 것보다 선택적 제거가 더 효과적일 수 있음을 보여줬다.
