언어 바꾸기English
이전 목록

Full Attention Strikes Back: 100번의 학습 스텝 안에 Full Attention을 Sparse로 전이하기

Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps

TL;DR AI

핵심 요약

1분
  1. 연구진은 풀 어텐션 LLM에서 검색 헤드만 전체 KV 캐시를 유지하는 RTPurbo를 제안했다.

  2. 이 방법은 경량 동적 sparse 토큰 인덱서로 긴 문맥에서의 내재적 어텐션 희소성을 활용한다.

  3. 수백 단계 수준의 최소한의 적응만으로 장문 벤치마크에서 거의 손실 없는 정확도를 달성했다.

  4. 비싼 sparse 사전학습 없이도 prefill과 디코딩 속도를 크게 높일 수 있다.

원문 보기