# Accelerating Gemma 4: faster inference with multi-token prediction drafters

**Dátum:** 2026. május 5.
**Szerzők:** Olivier Lacombe (Director, Product Management), Maarten Grootendorst (Developer Relations Engineer)
**Forrás:** Google Blog
**URL:** https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/
**Licenc:** Apache 2.0
**Típus:** cikk
**Téma:** LLM inference gyorsítás, speculative decoding, open source modellek

---

## Mi az az MTP (Multi-Token Prediction)?

A Google Multi-Token Prediction (MTP) "drafter" modelleket adott ki a Gemma 4 családhoz. Ezek lightweight, spekulatív dekódolásra specializált modellek, amelyek párosítva a fő Gemma 4 modellel, akár **3x gyorsítást** érnek el inference-nél, minőségromlás nélkül.

---

## A probléma: memória-sávszélesség korlát

A standard LLM inference memória-sávszélesség-korlátos: a processzor a legtöbb időt arra tölti, hogy milliárdos paramétereit a VRAM-ból a számítási egységekbe mozgassa, csak hogy **egyetlen token-t** generáljon. Ez alulhasznált számítási kapacitást és magas latenciát eredményez, különösen consumer hardveren.

---

## A megoldás: speculative decoding

A spekulatív dekódolás szétválasztja a token-generálást és a verifikációt:

1. **Drafter (MTP modell)** — kisméretű modell, amely a cél modellnél gyorsabban több jövőbeli token-t jósol meg
2. **Target modell** — a nagy Gemma 4 modell, amely párhuzamosan ellenőrzi az összes javasolt token-t
3. Ha a target egyetért a draftra: az egész sorozat egyetlen forward pass-ban elfogadásra kerül **+ 1 extra token**

> "A teljes drafted sorozat plusz egy token kimenetele abban az időben történik, ami általában egyetlen token generálásához kell."

---

## Gemma 4 MTP modellek

| Modell | Paraméterek | Cél hardver | Jellemzők |
|--------|-------------|-------------|-----------|
| Gemma 4 4B | 4B dense | Edge/mobil | E2B/E4B edge variánsok |
| Gemma 4 26B | 26B MoE | Workstation, consumer GPU | Mixture-of-Experts |
| Gemma 4 31B | 31B dense | Workstation, consumer GPU | Dense architektúra |

---

## Sebességnövekedés (benchmark)

A sebességnövekedés platformonként változik:
- **LiteRT-LM, MLX, Hugging Face Transformers, vLLM** — mindegyik támogatja
- **Apple Silicon (MLX):** batch size 4-8 esetén ~2.2x gyorsítás a 26B MoE-nél
- **NVIDIA A100:** hasonló nyereség batch méret növelésével
- **NVIDIA RTX PRO 6000:** Gemma 4 26B esetén ~2x gyorsítás (standard vs. MTP)

---

## Technikai architektúra

### KV cache sharing
A draft modellek újrahasználják a target modell aktivációit és KV cache-ét — nem kell újraszámítani a kontextust, amit a nagy modell már feldolgozott.

### Efficient clustering (edge modellek)
Az E2B és E4B edge modelleknél, ahol a final logit számítás bottleneck, efficient clustering technikát implementáltak az embedderben.

### Batch size jelentősége
A MoE modellek batch size 1-nél routing kihívásokat mutatnak Apple Siliconon. Batch size 4-8-nál ~2.2x gyorsítás.

---

## Felhasználási esetek

- **Chat és voice alkalmazások** — drasztikusan csökkentett latency
- **Kódolási asszisztensek** — összetett offline kódolás és agent workflow-k
- **Mobil/edge eszközök** — gyorsabb generálás = kevesebb energiafogyasztás
- **Agentic rendszerek** — gyors multi-step tervezés

---

## Elérhetőség

- **Licenc:** Apache 2.0 (ugyanaz, mint Gemma 4)
- **Modell súlyok:** Hugging Face, Kaggle
- **Támogatott keretrendszerek:** Transformers, MLX, vLLM, SGLang, Ollama
- **Dokumentáció:** https://ai.google.dev/gemma/docs/mtp/overview
- **Technikai deep dive:** https://x.com/googlegemma/status/2051694045869879749
- **Mobile app:** Google AI Edge Gallery (Android, iOS)

---

## Megjegyzés

60 millió+ letöltés a Gemma 4 első heteiben. Az MTP drafterekkel a Google az open source LLM-ek inference hatékonyságát tolja új szintre — minőségromlás nélkül, teljesen nyílt forráskódban.
