크기는 미미하지만 효과는 큰: 대규모 언어 모델의 스케일 벡터에 대하여
Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
TL;DR AI
1분핵심 요약
연구진은 LLM 정규화 층의 작은 스케일 벡터가 크기와 달리 사전학습 성능에 실제로 큰 영향을 준다는 점을 확인했다.
Pre-Norm 모델에서 이 벡터들은 주로 표현력보다 최적화를 돕는 역할을 했고, 가중치 감쇠는 Input-Norm에는 도움이 되지만 Output-Norm에는 불리했다.
가지별 이질성, 선형층 근처의 더 나은 배치, 크기-방향 재매개변수화라는 세 가지 가벼운 변경이 학습을 꾸준히 개선했다.
이 결합 전략은 0.12B~2B 규모의 밀집형 및 mixture-of-experts 모델에서 검증됐으며, 추가 비용은 적고 최종 손실은 더 낮았다.
