Full Attention Strikes Back: 100번의 학습 스텝 안에 Full Attention을 Sparse로 전이하기
Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps
TL;DR AI
1분핵심 요약
연구진은 풀 어텐션 LLM에서 검색 헤드만 전체 KV 캐시를 유지하는 RTPurbo를 제안했다.
이 방법은 경량 동적 sparse 토큰 인덱서로 긴 문맥에서의 내재적 어텐션 희소성을 활용한다.
수백 단계 수준의 최소한의 적응만으로 장문 벤치마크에서 거의 손실 없는 정확도를 달성했다.
비싼 sparse 사전학습 없이도 prefill과 디코딩 속도를 크게 높일 수 있다.
