대형 언어 모델의 Paged Attention
Paged Attention in Large Language Models LLMs

TL;DR AI
2분핵심 요약
모델 구성 토큰당 KV 저장에 524,288 바이트를 사용한다 32 레이어, 32 헤드, 헤드 차원 128, fp16 저장.
나이브 할당기 요청당 2048 토큰 분량의 메모리를 미리 할당한다, mAX_SEQ_LEN이 2048 토큰으로 설정됨.
요청 사용량 평균적으로 500 토큰 분량의 메모리를 실제로 사용한다, aVG_RESPONSE가 500 토큰으로 설정됨.
나이브 할당기 예시에서 요청당 약 1024 MB가 예약된다, kV_BYTES_PER_TOKEN과 MAX_SEQ_LEN 기반 계산.
요청 사용량 요청당 실제로 기록되는 메모리는 약 250 MB이다, aVG_RESPONSE와 KV_BYTES_PER_TOKEN 기반.



