Accelerating Gemma 4: faster inference with multi-token prediction drafters¶
Dátum: 2026. május 5. Szerzők: Olivier Lacombe (Director, Product Management), Maarten Grootendorst (Developer Relations Engineer) Forrás: Google Blog URL: https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/ Licenc: Apache 2.0 Típus: cikk Téma: LLM inference gyorsítás, speculative decoding, open source modellek
Mi az az MTP (Multi-Token Prediction)?¶
A Google Multi-Token Prediction (MTP) "drafter" modelleket adott ki a Gemma 4 családhoz. Ezek lightweight, spekulatív dekódolásra specializált modellek, amelyek párosítva a fő Gemma 4 modellel, akár 3x gyorsítást érnek el inference-nél, minőségromlás nélkül.
A probléma: memória-sávszélesség korlát¶
A standard LLM inference memória-sávszélesség-korlátos: a processzor a legtöbb időt arra tölti, hogy milliárdos paramétereit a VRAM-ból a számítási egységekbe mozgassa, csak hogy egyetlen token-t generáljon. Ez alulhasznált számítási kapacitást és magas latenciát eredményez, különösen consumer hardveren.
A megoldás: speculative decoding¶
A spekulatív dekódolás szétválasztja a token-generálást és a verifikációt:
- Drafter (MTP modell) — kisméretű modell, amely a cél modellnél gyorsabban több jövőbeli token-t jósol meg
- Target modell — a nagy Gemma 4 modell, amely párhuzamosan ellenőrzi az összes javasolt token-t
- Ha a target egyetért a draftra: az egész sorozat egyetlen forward pass-ban elfogadásra kerül + 1 extra token
"A teljes drafted sorozat plusz egy token kimenetele abban az időben történik, ami általában egyetlen token generálásához kell."
Gemma 4 MTP modellek¶
| Modell | Paraméterek | Cél hardver | Jellemzők |
|---|---|---|---|
| Gemma 4 4B | 4B dense | Edge/mobil | E2B/E4B edge variánsok |
| Gemma 4 26B | 26B MoE | Workstation, consumer GPU | Mixture-of-Experts |
| Gemma 4 31B | 31B dense | Workstation, consumer GPU | Dense architektúra |
Sebességnövekedés (benchmark)¶
A sebességnövekedés platformonként változik: - LiteRT-LM, MLX, Hugging Face Transformers, vLLM — mindegyik támogatja - Apple Silicon (MLX): batch size 4-8 esetén ~2.2x gyorsítás a 26B MoE-nél - NVIDIA A100: hasonló nyereség batch méret növelésével - NVIDIA RTX PRO 6000: Gemma 4 26B esetén ~2x gyorsítás (standard vs. MTP)
Technikai architektúra¶
KV cache sharing¶
A draft modellek újrahasználják a target modell aktivációit és KV cache-ét — nem kell újraszámítani a kontextust, amit a nagy modell már feldolgozott.
Efficient clustering (edge modellek)¶
Az E2B és E4B edge modelleknél, ahol a final logit számítás bottleneck, efficient clustering technikát implementáltak az embedderben.
Batch size jelentősége¶
A MoE modellek batch size 1-nél routing kihívásokat mutatnak Apple Siliconon. Batch size 4-8-nál ~2.2x gyorsítás.
Felhasználási esetek¶
- Chat és voice alkalmazások — drasztikusan csökkentett latency
- Kódolási asszisztensek — összetett offline kódolás és agent workflow-k
- Mobil/edge eszközök — gyorsabb generálás = kevesebb energiafogyasztás
- Agentic rendszerek — gyors multi-step tervezés
Elérhetőség¶
- Licenc: Apache 2.0 (ugyanaz, mint Gemma 4)
- Modell súlyok: Hugging Face, Kaggle
- Támogatott keretrendszerek: Transformers, MLX, vLLM, SGLang, Ollama
- Dokumentáció: https://ai.google.dev/gemma/docs/mtp/overview
- Technikai deep dive: https://x.com/googlegemma/status/2051694045869879749
- Mobile app: Google AI Edge Gallery (Android, iOS)
Megjegyzés¶
60 millió+ letöltés a Gemma 4 első heteiben. Az MTP drafterekkel a Google az open source LLM-ek inference hatékonyságát tolja új szintre — minőségromlás nélkül, teljesen nyílt forráskódban.