NVIDIA, NVFP4를 활용한 4비트 사전학습 방법론 공개… 12B 하이브리드 Mamba-Transformer로 10T 토큰 구간 검증
NVIDIA Introduces a 4-Bit Pretraining Methodology Using NVFP4, Validated on a 12B Hybrid Mamba-Transformer at 10T Token Horizon

TL;DR AI
1분핵심 요약
NVIDIA가 대규모 언어 모델용 NVFP4 기반 4비트 사전학습 방법을 공개했다.
이 방식으로 120억 파라미터 하이브리드 Mamba-Transformer를 10조 토큰으로 학습했다.
핵심 기법은 일부 BF16 레이어 선택, 랜덤 하다마드 변환, 지연 양자화를 결합한 것이다.
결과 모델은 MMLU-Pro에서 FP8 기준선과 맞먹는 성능을 보였고 Blackwell 하드웨어 지원을 활용했다.
