언어 바꾸기English
이전 목록

각 토큰의 가치를 높이기: KV 캐시 제거로 장문 컨텍스트 성능 개선하기

Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction

TL;DR AI

핵심 요약

1분
  1. 연구진이 긴 문맥 추론을 위한 학습형 글로벌 KV 캐시 축출 기법을 제안했다.

  2. 공유 보정을 통해 서로 다른 레이어와 헤드의 토큰이 하나의 메모리 예산 아래에서 경쟁하도록 했다.

  3. 이 방식은 KV 메모리를 줄이면서 언어·비전-언어·대화 작업에서 전체 캐시와 같거나 더 나은 성능을 보였다.

  4. 긴 문맥 AI의 핵심 병목을 완화하며, 모든 토큰을 유지하는 것보다 선택적 제거가 더 효과적일 수 있음을 보여줬다.

원문 보기