구글의 Gemma 4 AI 모델, 미래 토큰 예측으로 속도 3배 향상
Google's Gemma 4 AI models get a 3x speed boost by predicting future tokens

TL;DR AI
1분핵심 요약
구글이 Gemma 4의 로컬 AI 생성 속도를 높이기 위한 실험적 Multi-Token Prediction drafter를 공개했다.
더 작은 E2B·E4B drafter 모델이 다음 토큰을 예측하고 메인 모델과 문맥을 공유해, speculative decoding과 sparse decoding을 가능하게 한다.
구글은 이 방식이 최대 3배 빠른 출력을 낼 수 있다고 주장했으며, NVIDIA RTX PRO 6000 같은 하드웨어에서도 개선 효과가 확인됐다.
추론을 기기 내에서 유지하면서 라이선스도 비교적 개방적이어서, 로컬 AI의 실용성과 도입 확산에 도움이 될 수 있다.



