HRM-Text: 스케일링을 넘어선 효율적 사전학습
HRM-Text: Efficient Pretraining Beyond Scaling
TL;DR AI
2분핵심 요약
연구진은 400억 개의 고유 토큰으로 처음부터 학습한 10억 파라미터 규모의 계층적 순환 언어모델 HRM-Text를 공개했다.
이 모델은 instruction-response 데이터와 MagicNorm, PrefixLM 마스킹 같은 안정화 기법을 활용해 깊은 순환 구조를 안정적으로 학습한다.
HRM-Text는 MMLU, ARC-C, DROP, GSM8K, MATH 등 여러 벤치마크에서 경쟁력 있는 성능을 보였다.
기존 Transformer 기반 사전학습보다 훨씬 적은 토큰과 추정 연산량으로 학습된 것으로 나타났다.
이번 연구는 아키텍처와 학습 목표의 변화만으로도 강력한 언어모델 훈련 비용을 크게 낮출 수 있음을 시사한다.
