효율적인 장문 컨텍스트 생성을 위한 컨텍스트 기억
Context Memorization for Efficient Long Context Generation
TL;DR AI
1분핵심 요약
연구진은 대형 언어모델에서 긴 프롬프트 문맥을 효율적으로 저장하는 학습 불필요 방식인 attention-state memory를 제안했다.
이 방법은 prefix-query 쌍의 attention state를 미리 계산해 가벼운 외부 메모리에 저장함으로써 생성 과정에서 prefix의 영향을 유지한다.
기존 full-attention이나 다른 장문맥 기법보다 추론 지연과 메모리 사용량을 줄일 수 있다.
또한 제한된 메모리 환경에서 정확도를 높여, LLaMA-3.1-8B 같은 모델의 long-context generation을 더 싸고 빠르게 만든다.
