언어 바꾸기English
이전 목록

멀티헤드 어텐션 잔차

Multi-Head Attention Residuals

TL;DR AI

핵심 요약

1분
  1. 연구진이 Multi-Head Attention Residuals(MHAR)를 제안해, Transformer의 residual routing에서 여러 헤드가 서로 다른 depth history를 보도록 설계했다.

  2. MHAR는 표준 Transformer보다 1억, 3.5억, 10억 파라미터 규모에서 검증 손실이 더 낮았고, H=4 또는 H=8에서 가장 좋은 성능을 보였다.

  3. 이 방식은 추가 파라미터가 없고 계산 오버헤드도 거의 없으며, 학습 중간에 전환해도 GSM8K와 GPQA 성능 향상을 확인했다.

  4. 또한 fused Triton 커널로 학습 처리량을 높이면서 메모리 사용은 거의 기존 수준으로 유지했다.

원문 보기