언어 바꾸기English
이전 목록

CompactAttention: 블록-유니온 KV 선택으로 청크형 프리필 가속

CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

TL;DR AI

핵심 요약

1분
  1. 연구진은 장문 컨텍스트 LLM 추론을 위한 새로운 어텐션 방식인 CompactAttention을 제안했다.

  2. 블록-스파스 마스크를 그룹별 최소 KV 블록 테이블로 바꿔, chunked prefill에서 별도 KV 압축 없이 바로 접근할 수 있게 했다.

  3. 이 방식은 128K 컨텍스트에서 어텐션 속도를 최대 2.72배 높이면서도 밀집 어텐션에 가까운 정확도를 유지했다.

  4. 장문 컨텍스트 모델 서빙의 핵심 병목을 줄여, 큰 품질 손실 없이 추론 효율을 개선한다.

원문 보기