DeepSeek-V4 — MoE nyelvmodellek milliós kontextussal
tömörített változata. Működése:
-
Tömörítés: minden m token KV bejegyzését egyetlen bejegyzésbe sűríti (4-es tömörítési aránynál m=4), így a szekvencia hossza 1/m-re csökken.
-
Lightning Indexer: a tömörített KV bejegyzések közül top-k legfontosabb bejegyzést választja ki a szakaszos figyelemhez (V4-Pro esetében k=1024).
-
Sliding Window figyelem: a közeli tokenek helyi összefüggéseinek megőrzésére szolgáló kiegészítő figyelemág (ablakméret: 128 token).
Heavily Compressed Attention (HCA)¶
A HCA még agresszívebb tömörítést alkalmaz: minden m' (≫ m) token KV bejegyzését egyetlen bejegyzésbe sűríti (V4-ben m'=128), de nem használ szakaszos figyelmet, hanem sűrű figyelmet a tömörített bejegyzéseken.
A kettő együttműködése¶
A hibrid architektúra a CSA és HCA rétegeket váltakozva használja a Transformer blokkokban. Ez a kombináció a 1M tokenes kontextusban a KV cache méretét körülbelül 2%-ra csökkenti a hagyományos BF16 GQA8 baseline-hoz képest.
Hatékonysági adatok¶
| Modell | FLOP csökkenés (1M kontextus) | KV cache csökkenés (1M kontextus) |
|---|---|---|
| V4-Pro vs V3.2 | 73% (27%-ra) | 90% (10%-ra) |
| V4-Flash vs V3.2 | 90% (10%-ra) | 93% (7%-ra) |
Egy millió token kontextus¶
A DeepSeek-V4 sorozat natív és hatékony támogatást nyújt 1M tokenes kontextusokhoz. A gyakorlati jelentőség:
-
Hosszú horizontú ügynöki feladatok: az ügynöki munkafolyamatokban a teljes gondolkodási lánc megőrzése a felhasználói üzenetek határain át.
-
Több dokumentumos elemzés: hosszú tudományos cikkek, technikai jelentések, kód- és jogi dokumentumok egyszerre történő feldolgozása.
-
Online tanulás: a hosszú kontextus alapja lehet az online tanulás új paradigmáinak.
-
Test-time scaling: a nagyobb kontextus lehetővé teszi a mélyebb, többlépéses gondolkodást anélkül, hogy a számítási költségek aránytalanul megnőnének.
Long-context benchmark eredmények¶
- MRCR 1M (in-context retrieval): V4-Pro-Max 83.5 MMR, Gemini-3.1-Pro 76.3 MMR — a V4-Pro felülmúlja a Gemini-t.
- CorpusQA 1M: V4-Pro-Max 62.0% ACC, Gemini-3.1-Pro 53.8% ACC.
Training és infrastruktúra¶
Training adatok¶
- V4-Flash: 32T token pre-training
- V4-Pro: 33T token pre-training
- A korpusz tartalmaz matematikai tartalmakat, kódokat, weboldalakat, hosszú dokumentumokat és egyéb kategóriákat.
- Hosszú dokumentumokra kiemelt hangsúly: tudományos cikkek, technikai jelentések.
Training dinamika¶
- A training 4K kontextus hosszal indul, fokozatosan 16K, 64K, majd 1M-ig növelve.
- Sűrű figyelem az első 1T tokenig, majd szakaszos figyelem bevezetése 64K kontextusnál.
- Muon optimalizáló a legtöbb paraméterhez, AdamW az embedding és prediction head modulokhoz.
- A V4-Pro csúcs learning rate: 2.0×10⁻⁴, V4-Flash: 2.7×10⁻⁴.
- Batch size scheduling: V4-Pro max 94.4M token, V4-Flash max 75.5M token.
Kommunikációs optimalizációk¶
- Finomszemcsézett EP (Expert Parallelism): a kommunikáció és számítás teljes átfedése hullámok (wave) alapú szakértő ütemezéssel, akár 1.92× elméleti gyorsítás.
- TileLang: DSL a kernel fejlesztéshez, amely egyensúlyoz a fejlesztői produktivitás és futási hatékonyság között.
- Batch-invariant és determinisztikus kerneltárak: bitwise reprodukálhatóság training és inference között.
- FP4 kvázi-tudatos training (QAT): MoE szakértői súlyok és az indexer QK útvonal FP4-es kvantálása.
Training stabilitás¶
Két kulcsfontosságú technika a loss spike-ok kezelésére:
- Anticipatory Routing: a routing indexek előre számítása (Δt lépéssel korábban), a backbone és routing hálózat frissítéseinek szétválasztása.
- SwiGLU Clamping: a SwiGLU lineáris komponensének [-10, 10] tartományra korlátozása, a gate komponens felső korlátjának 10-re állítása.
Post-training: On-Policy Distillation (OPD)¶
A V4 sorozat a hagyományos RLHF helyett On-Policy Distillation-t alkalmaz. Folyamata:
- Specialista training: külön szakértők képzése matematika, kódolás, ügynöki és utasításkövetési domainekben (SFT + GRPO RL).
- OPD egyesítés: a tanuló modell a saját generált trajektóriáin tanul a szakértő modellek eloszlásából, teljes szókincsű reverse KL divergence-t alkalmazva.
Benchmark eredmények¶
Alapmodellek összehasonlítása¶
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro | 65.5 | 68.3 | 73.5 |
| GPQA Diamond | — | — | 90.1 |
| HLE | — | — | 37.7 |
| LiveCodeBench | — | — | 93.5 |
| Codeforces (Rating) | — | — | 3206 |
| IMO AnswerBench | — | — | 89.8 |
| LongBench-V2 | 40.2 | 44.7 | 51.5 |
Legjobb modellek összehasonlítása (Pro-Max vs vetélytársak)¶
| Benchmark | Claude-Opus-4.6-Max | GPT-5.4-xHigh | Gemini-3.1-Pro-High | V4-Pro-Max |
|---|---|---|---|---|
| MMLU-Pro | 89.1 | 87.5 | 91.0 | 87.5 |
| SimpleQA-Verified | 46.2 | 45.3 | 75.6 | 57.9 |
| Chinese-SimpleQA | 76.4 | 76.8 | 85.9 | 84.4 |
| GPQA Diamond | 91.3 | 93.0 | 94.3 | 90.1 |
| LiveCodeBench | 88.8 | — | 91.7 | 93.5 |
| Codeforces Rating | — | 3168 | 3052 | 3206 |
| IMO AnswerBench | 75.3 | 91.4 | 81.0 | 89.8 |
| Apex Shortlist | 85.9 | 78.1 | 89.1 | 90.2 |
Kulcsfontosságú megállapítások¶
- Tudás: V4-Pro-Max új nyílt forráskódú csúcsot állított fel a SimpleQA és Chinese-SimpleQA benchmarkokon, jelentősen lezárva a rést a Gemini-3.1-Pro-val szemben.
- Gondolkodás: felülmúlja a GPT-5.2-t és a Gemini-3.0-Pro-t, de minimálisan elmarad a GPT-5.4-től és a Gemini-3.1-Pro-tól (kb. 3-6 hónapos lemaradás a frontiermodellekhez képest).
- Ügynök: szintén versenyképes teljesítmény, Claude Sonnet 4.5-t felülmúlja, az Opus 4.5 szintjét közelíti.
- Hosszú kontextus: 1M tokenes kontextusban Gemini-3.1-Pro-t felülmúlja akadémiai benchmarkokon.
- Hatékonyság: V4-Flash-Max versenyképes gondolkodási teljesítményt nyújt a nagyobb modellekkel szemben, kisebb paraméterszámmal.
Kapcsolódó wiki cikkek¶
- ai automation — mesterséges intelligencia automatizálás és ügynöki rendszerek
- llm supply chain — nagy nyelvmodellek ellátási lánca és hardverigényei
Források¶
- DeepSeek-AI. "DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence." 2026.
- Model checkpoint-ok elérhetők: https://huggingface.co/collections/deepseek-ai/deepseek-v4
A cikk 1120 szóból áll. Kulcsfogalmak: MoE (Mixture-of-Experts), CSA (Compressed Sparse Attention), HCA (Heavily Compressed Attention), mHC (Manifold-Constrained Hyper-Connections), Muon optimalizáló, FP4 kvantálás, 1M token kontextus, On-Policy Distillation, Expert Parallelism, KV cache optimalizálás.