언어 바꾸기English
이전 목록

Nous Research, 긴 컨텍스트에서 사전학습 속도를 1.4~1.7배 높이는 학습 전용 선택 기반 계층적 어텐션 ‘Lighthouse Attention’ 제안

Nous Research Proposes Lighthouse Attention: A Training-Only Selection-Based Hierarchical Attention That Delivers 1.4–1.7× Pretraining Speedup at Long Context

TL;DR AI

핵심 요약

1분
  1. Nous Research가 긴 컨텍스트 모델용 학습 전용 계층형 희소 어텐션 기법인 Lighthouse Attention을 공개했다.

  2. 이 방법은 쿼리·키·밸류를 다층 피라미드로 압축한 뒤, 어텐션 커널 밖에서 일부 토큰을 선택하고 표준 FlashAttention을 적용한다.

  3. cuDNN 기반 SDPA 기준선과 비교해 사전학습 속도가 1.40배에서 1.69배까지 빨라졌다.

  4. 최종 학습 손실은 비슷하거나 더 낮아, 속도 향상이 모델 품질 저하 없이 가능함을 보여준다.

원문 보기