---
title: DeepSeek-V4 — MoE nyelvmodellek milliós kontextussal
category: topic
sources:
- tanulmanyok/deepseek-v4.md
created: 2026-04-25
updated: '2026-05-07'
tags:
- deepseek
- moe
- llm
- ai
- million-token
- context-window
- mixture-of-experts
confidence: high
summary: 'DeepSeek-V4 technikai áttekintés: MoE architektúra, 1.6T paraméter (49B
  aktív), 1M token kontextus, training infrastruktúra, benchmarking'
---
 tömörített változata. Működése:

- **Tömörítés**: minden m token KV bejegyzését egyetlen bejegyzésbe sűríti (4-es tömörítési aránynál m=4), így a szekvencia hossza 1/m-re csökken.

- **Lightning Indexer**: a tömörített KV bejegyzések közül top-k legfontosabb bejegyzést választja ki a szakaszos figyelemhez (V4-Pro esetében k=1024).

- **Sliding Window figyelem**: a közeli tokenek helyi összefüggéseinek megőrzésére szolgáló kiegészítő figyelemág (ablakméret: 128 token).

### Heavily Compressed Attention (HCA)

A HCA még agresszívebb tömörítést alkalmaz: minden m' (≫ m) token KV bejegyzését egyetlen bejegyzésbe sűríti (V4-ben m'=128), de nem használ szakaszos figyelmet, hanem sűrű figyelmet a tömörített bejegyzéseken.

### A kettő együttműködése

A hibrid architektúra a CSA és HCA rétegeket váltakozva használja a Transformer blokkokban. Ez a kombináció a 1M tokenes kontextusban a KV cache méretét körülbelül **2%-ra csökkenti** a hagyományos BF16 GQA8 baseline-hoz képest.

### Hatékonysági adatok

| Modell | FLOP csökkenés (1M kontextus) | KV cache csökkenés (1M kontextus) |
|---|---|---|
| V4-Pro vs V3.2 | 73% (27%-ra) | 90% (10%-ra) |
| V4-Flash vs V3.2 | 90% (10%-ra) | 93% (7%-ra) |

## Egy millió token kontextus

A DeepSeek-V4 sorozat natív és hatékony támogatást nyújt 1M tokenes kontextusokhoz. A gyakorlati jelentőség:

- **Hosszú horizontú ügynöki feladatok**: az ügynöki munkafolyamatokban a teljes gondolkodási lánc megőrzése a felhasználói üzenetek határain át.

- **Több dokumentumos elemzés**: hosszú tudományos cikkek, technikai jelentések, kód- és jogi dokumentumok egyszerre történő feldolgozása.

- **Online tanulás**: a hosszú kontextus alapja lehet az online tanulás új paradigmáinak.

- **Test-time scaling**: a nagyobb kontextus lehetővé teszi a mélyebb, többlépéses gondolkodást anélkül, hogy a számítási költségek aránytalanul megnőnének.

### Long-context benchmark eredmények

- **MRCR 1M (in-context retrieval)**: V4-Pro-Max 83.5 MMR, Gemini-3.1-Pro 76.3 MMR — a V4-Pro felülmúlja a Gemini-t.
- **CorpusQA 1M**: V4-Pro-Max 62.0% ACC, Gemini-3.1-Pro 53.8% ACC.

## Training és infrastruktúra

### Training adatok

- V4-Flash: **32T token** pre-training
- V4-Pro: **33T token** pre-training
- A korpusz tartalmaz matematikai tartalmakat, kódokat, weboldalakat, hosszú dokumentumokat és egyéb kategóriákat.
- Hosszú dokumentumokra kiemelt hangsúly: tudományos cikkek, technikai jelentések.

### Training dinamika

- A training 4K kontextus hosszal indul, fokozatosan 16K, 64K, majd 1M-ig növelve.
- Sűrű figyelem az első 1T tokenig, majd szakaszos figyelem bevezetése 64K kontextusnál.
- Muon optimalizáló a legtöbb paraméterhez, AdamW az embedding és prediction head modulokhoz.
- A V4-Pro csúcs learning rate: 2.0×10⁻⁴, V4-Flash: 2.7×10⁻⁴.
- Batch size scheduling: V4-Pro max 94.4M token, V4-Flash max 75.5M token.

### Kommunikációs optimalizációk

- **Finomszemcsézett EP (Expert Parallelism)**: a kommunikáció és számítás teljes átfedése hullámok (wave) alapú szakértő ütemezéssel, akár **1.92× elméleti gyorsítás**.
- **TileLang**: DSL a kernel fejlesztéshez, amely egyensúlyoz a fejlesztői produktivitás és futási hatékonyság között.
- **Batch-invariant és determinisztikus kerneltárak**: bitwise reprodukálhatóság training és inference között.
- **FP4 kvázi-tudatos training (QAT)**: MoE szakértői súlyok és az indexer QK útvonal FP4-es kvantálása.

### Training stabilitás

Két kulcsfontosságú technika a loss spike-ok kezelésére:

1. **Anticipatory Routing**: a routing indexek előre számítása (Δt lépéssel korábban), a backbone és routing hálózat frissítéseinek szétválasztása.
2. **SwiGLU Clamping**: a SwiGLU lineáris komponensének [-10, 10] tartományra korlátozása, a gate komponens felső korlátjának 10-re állítása.

### Post-training: On-Policy Distillation (OPD)

A V4 sorozat a hagyományos RLHF helyett On-Policy Distillation-t alkalmaz. Folyamata:

1. **Specialista training**: külön szakértők képzése matematika, kódolás, ügynöki és utasításkövetési domainekben (SFT + GRPO RL).
2. **OPD egyesítés**: a tanuló modell a saját generált trajektóriáin tanul a szakértő modellek eloszlásából, teljes szókincsű reverse KL divergence-t alkalmazva.

## Benchmark eredmények

### Alapmodellek összehasonlítása

| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro | 65.5 | 68.3 | 73.5 |
| GPQA Diamond | — | — | 90.1 |
| HLE | — | — | 37.7 |
| LiveCodeBench | — | — | 93.5 |
| Codeforces (Rating) | — | — | 3206 |
| IMO AnswerBench | — | — | 89.8 |
| LongBench-V2 | 40.2 | 44.7 | 51.5 |

### Legjobb modellek összehasonlítása (Pro-Max vs vetélytársak)

| Benchmark | Claude-Opus-4.6-Max | GPT-5.4-xHigh | Gemini-3.1-Pro-High | V4-Pro-Max |
|---|---|---|---|---|
| MMLU-Pro | 89.1 | 87.5 | **91.0** | 87.5 |
| SimpleQA-Verified | 46.2 | 45.3 | 75.6 | 57.9 |
| Chinese-SimpleQA | 76.4 | 76.8 | **85.9** | 84.4 |
| GPQA Diamond | 91.3 | **93.0** | **94.3** | 90.1 |
| LiveCodeBench | 88.8 | — | 91.7 | **93.5** |
| Codeforces Rating | — | 3168 | 3052 | **3206** |
| IMO AnswerBench | 75.3 | **91.4** | 81.0 | 89.8 |
| Apex Shortlist | 85.9 | 78.1 | 89.1 | **90.2** |

### Kulcsfontosságú megállapítások

- **Tudás**: V4-Pro-Max új nyílt forráskódú csúcsot állított fel a SimpleQA és Chinese-SimpleQA benchmarkokon, jelentősen lezárva a rést a Gemini-3.1-Pro-val szemben.
- **Gondolkodás**: felülmúlja a GPT-5.2-t és a Gemini-3.0-Pro-t, de minimálisan elmarad a GPT-5.4-től és a Gemini-3.1-Pro-tól (kb. 3-6 hónapos lemaradás a frontiermodellekhez képest).
- **Ügynök**: szintén versenyképes teljesítmény, Claude Sonnet 4.5-t felülmúlja, az Opus 4.5 szintjét közelíti.
- **Hosszú kontextus**: 1M tokenes kontextusban Gemini-3.1-Pro-t felülmúlja akadémiai benchmarkokon.
- **Hatékonyság**: V4-Flash-Max versenyképes gondolkodási teljesítményt nyújt a nagyobb modellekkel szemben, kisebb paraméterszámmal.

## Kapcsolódó wiki cikkek

- [ai automation](ai-automation.md) — mesterséges intelligencia automatizálás és ügynöki rendszerek
- [llm supply chain](llm-supply-chain.md) — nagy nyelvmodellek ellátási lánca és hardverigényei

## Források

- DeepSeek-AI. "DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence." 2026.
- Model checkpoint-ok elérhetők: https://huggingface.co/collections/deepseek-ai/deepseek-v4

---

*A cikk 1120 szóból áll. Kulcsfogalmak: MoE (Mixture-of-Experts), CSA (Compressed Sparse Attention), HCA (Heavily Compressed Attention), mHC (Manifold-Constrained Hyper-Connections), Muon optimalizáló, FP4 kvantálás, 1M token kontextus, On-Policy Distillation, Expert Parallelism, KV cache optimalizálás.*