언어 바꾸기English
이전 목록

LLM의 KV 캐싱

KV Caching in LLMs

TL;DR AI

핵심 요약

1분
  1. KV 캐싱은 매 생성 단계마다 키와 값 텐서를 다시 계산하지 않고 재사용해 LLM 디코딩을 빠르게 만듭니다.

  2. 첫 토큰은 여전히 느린데, 프롬프트를 먼저 prefill해서 상태를 캐시에 저장해야 하기 때문입니다.

  3. 이 방식은 응답 지연을 줄이지만, 요청당 GPU 메모리 사용량이 크게 늘어나는 단점이 있습니다.

  4. 이 메모리 비용은 ChatGPT, Claude, Qwen 2.5 72B 같은 모델의 확장성과 운영 비용에 직접 영향을 줍니다.

  5. Grouped-query attention, multi-query attention, paged attention 같은 기법은 이런 부담을 줄이기 위한 보완책입니다.

원문 보기