언어 바꾸기English
이전 목록

구글, MTP 드래프터로 Gemma 4 모델 속도 3배 향상

Google made Gemma 4 models 3x faster with MTP Drafters

TL;DR AI

핵심 요약

1분
  1. 구글이 Gemma 4에 speculative decoding을 도입해 소비자용 GPU와 엣지 기기에서 추론 속도를 높였다.

  2. 작은 MTP drafter가 토큰 후보를 제안하고, 더 큰 모델이 이를 병렬로 검증하는 방식이다.

  3. Gemma 4 26B MoE와 31B Dense는 출력 품질을 유지한 채 최대 3배까지 빨라질 수 있다.

  4. 이번 업데이트로 로컬 AI 챗봇, 코딩 도구, 자율 에이전트의 지연 시간이 줄어든다.

원문 보기