왜 더 큰 모델은 더 많이 학습하는가: 용량, 간섭, 희귀 작업 기억의 영향
Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention
TL;DR AI
2분핵심 요약
새 연구는 큰 모델이 더 많이 학습하는 이유가 작업 간 간섭이 적고 희귀한 특징을 더 잘 유지하기 때문이라고 설명합니다.
합성 멀티태스크 실험과 4M~4B 파라미터 규모의 OLMo 모델 분석에서, 큰 모델이 드물고 복잡한 작업을 더 잘 처리했습니다.
연구진은 큰 모델이 작업을 더 깔끔하게 분리해 gradient interference를 줄이고, task retention을 높인다고 밝혔습니다.
또한 흔한 작업에는 더 많은 용량을 쓰면서도 어려운 작업을 잃지 않아, 작은 모델보다 유리한 것으로 나타났습니다.
이 결과는 규모가 희귀·복잡한 행동 학습을 돕는 이유를 설명하며, 모델 크기와 학습 데이터 구성에 대한 기준을 제공합니다.
