CompactAttention: 블록-유니온 KV 선택으로 청크형 프리필 가속
CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection
TL;DR AI
1분핵심 요약
연구진은 장문 컨텍스트 LLM 추론을 위한 새로운 어텐션 방식인 CompactAttention을 제안했다.
블록-스파스 마스크를 그룹별 최소 KV 블록 테이블로 바꿔, chunked prefill에서 별도 KV 압축 없이 바로 접근할 수 있게 했다.
이 방식은 128K 컨텍스트에서 어텐션 속도를 최대 2.72배 높이면서도 밀집 어텐션에 가까운 정확도를 유지했다.
장문 컨텍스트 모델 서빙의 핵심 병목을 줄여, 큰 품질 손실 없이 추론 효율을 개선한다.
