Kihagyás

Accelerating Gemma 4: faster inference with multi-token prediction drafters

Dátum: 2026. május 5. Szerzők: Olivier Lacombe (Director, Product Management), Maarten Grootendorst (Developer Relations Engineer) Forrás: Google Blog URL: https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/ Licenc: Apache 2.0 Típus: cikk Téma: LLM inference gyorsítás, speculative decoding, open source modellek


Mi az az MTP (Multi-Token Prediction)?

A Google Multi-Token Prediction (MTP) "drafter" modelleket adott ki a Gemma 4 családhoz. Ezek lightweight, spekulatív dekódolásra specializált modellek, amelyek párosítva a fő Gemma 4 modellel, akár 3x gyorsítást érnek el inference-nél, minőségromlás nélkül.


A probléma: memória-sávszélesség korlát

A standard LLM inference memória-sávszélesség-korlátos: a processzor a legtöbb időt arra tölti, hogy milliárdos paramétereit a VRAM-ból a számítási egységekbe mozgassa, csak hogy egyetlen token-t generáljon. Ez alulhasznált számítási kapacitást és magas latenciát eredményez, különösen consumer hardveren.


A megoldás: speculative decoding

A spekulatív dekódolás szétválasztja a token-generálást és a verifikációt:

  1. Drafter (MTP modell) — kisméretű modell, amely a cél modellnél gyorsabban több jövőbeli token-t jósol meg
  2. Target modell — a nagy Gemma 4 modell, amely párhuzamosan ellenőrzi az összes javasolt token-t
  3. Ha a target egyetért a draftra: az egész sorozat egyetlen forward pass-ban elfogadásra kerül + 1 extra token

"A teljes drafted sorozat plusz egy token kimenetele abban az időben történik, ami általában egyetlen token generálásához kell."


Gemma 4 MTP modellek

Modell Paraméterek Cél hardver Jellemzők
Gemma 4 4B 4B dense Edge/mobil E2B/E4B edge variánsok
Gemma 4 26B 26B MoE Workstation, consumer GPU Mixture-of-Experts
Gemma 4 31B 31B dense Workstation, consumer GPU Dense architektúra

Sebességnövekedés (benchmark)

A sebességnövekedés platformonként változik: - LiteRT-LM, MLX, Hugging Face Transformers, vLLM — mindegyik támogatja - Apple Silicon (MLX): batch size 4-8 esetén ~2.2x gyorsítás a 26B MoE-nél - NVIDIA A100: hasonló nyereség batch méret növelésével - NVIDIA RTX PRO 6000: Gemma 4 26B esetén ~2x gyorsítás (standard vs. MTP)


Technikai architektúra

KV cache sharing

A draft modellek újrahasználják a target modell aktivációit és KV cache-ét — nem kell újraszámítani a kontextust, amit a nagy modell már feldolgozott.

Efficient clustering (edge modellek)

Az E2B és E4B edge modelleknél, ahol a final logit számítás bottleneck, efficient clustering technikát implementáltak az embedderben.

Batch size jelentősége

A MoE modellek batch size 1-nél routing kihívásokat mutatnak Apple Siliconon. Batch size 4-8-nál ~2.2x gyorsítás.


Felhasználási esetek

  • Chat és voice alkalmazások — drasztikusan csökkentett latency
  • Kódolási asszisztensek — összetett offline kódolás és agent workflow-k
  • Mobil/edge eszközök — gyorsabb generálás = kevesebb energiafogyasztás
  • Agentic rendszerek — gyors multi-step tervezés

Elérhetőség

  • Licenc: Apache 2.0 (ugyanaz, mint Gemma 4)
  • Modell súlyok: Hugging Face, Kaggle
  • Támogatott keretrendszerek: Transformers, MLX, vLLM, SGLang, Ollama
  • Dokumentáció: https://ai.google.dev/gemma/docs/mtp/overview
  • Technikai deep dive: https://x.com/googlegemma/status/2051694045869879749
  • Mobile app: Google AI Edge Gallery (Android, iOS)

Megjegyzés

60 millió+ letöltés a Gemma 4 első heteiben. Az MTP drafterekkel a Google az open source LLM-ek inference hatékonyságát tolja új szintre — minőségromlás nélkül, teljesen nyílt forráskódban.

Vissza a tetejére