Kihagyás

DeepSeek-V4 — MoE nyelvmodellek milliós kontextussal

tömörített változata. Működése:

  • Tömörítés: minden m token KV bejegyzését egyetlen bejegyzésbe sűríti (4-es tömörítési aránynál m=4), így a szekvencia hossza 1/m-re csökken.

  • Lightning Indexer: a tömörített KV bejegyzések közül top-k legfontosabb bejegyzést választja ki a szakaszos figyelemhez (V4-Pro esetében k=1024).

  • Sliding Window figyelem: a közeli tokenek helyi összefüggéseinek megőrzésére szolgáló kiegészítő figyelemág (ablakméret: 128 token).

Heavily Compressed Attention (HCA)

A HCA még agresszívebb tömörítést alkalmaz: minden m' (≫ m) token KV bejegyzését egyetlen bejegyzésbe sűríti (V4-ben m'=128), de nem használ szakaszos figyelmet, hanem sűrű figyelmet a tömörített bejegyzéseken.

A kettő együttműködése

A hibrid architektúra a CSA és HCA rétegeket váltakozva használja a Transformer blokkokban. Ez a kombináció a 1M tokenes kontextusban a KV cache méretét körülbelül 2%-ra csökkenti a hagyományos BF16 GQA8 baseline-hoz képest.

Hatékonysági adatok

Modell FLOP csökkenés (1M kontextus) KV cache csökkenés (1M kontextus)
V4-Pro vs V3.2 73% (27%-ra) 90% (10%-ra)
V4-Flash vs V3.2 90% (10%-ra) 93% (7%-ra)

Egy millió token kontextus

A DeepSeek-V4 sorozat natív és hatékony támogatást nyújt 1M tokenes kontextusokhoz. A gyakorlati jelentőség:

  • Hosszú horizontú ügynöki feladatok: az ügynöki munkafolyamatokban a teljes gondolkodási lánc megőrzése a felhasználói üzenetek határain át.

  • Több dokumentumos elemzés: hosszú tudományos cikkek, technikai jelentések, kód- és jogi dokumentumok egyszerre történő feldolgozása.

  • Online tanulás: a hosszú kontextus alapja lehet az online tanulás új paradigmáinak.

  • Test-time scaling: a nagyobb kontextus lehetővé teszi a mélyebb, többlépéses gondolkodást anélkül, hogy a számítási költségek aránytalanul megnőnének.

Long-context benchmark eredmények

  • MRCR 1M (in-context retrieval): V4-Pro-Max 83.5 MMR, Gemini-3.1-Pro 76.3 MMR — a V4-Pro felülmúlja a Gemini-t.
  • CorpusQA 1M: V4-Pro-Max 62.0% ACC, Gemini-3.1-Pro 53.8% ACC.

Training és infrastruktúra

Training adatok

  • V4-Flash: 32T token pre-training
  • V4-Pro: 33T token pre-training
  • A korpusz tartalmaz matematikai tartalmakat, kódokat, weboldalakat, hosszú dokumentumokat és egyéb kategóriákat.
  • Hosszú dokumentumokra kiemelt hangsúly: tudományos cikkek, technikai jelentések.

Training dinamika

  • A training 4K kontextus hosszal indul, fokozatosan 16K, 64K, majd 1M-ig növelve.
  • Sűrű figyelem az első 1T tokenig, majd szakaszos figyelem bevezetése 64K kontextusnál.
  • Muon optimalizáló a legtöbb paraméterhez, AdamW az embedding és prediction head modulokhoz.
  • A V4-Pro csúcs learning rate: 2.0×10⁻⁴, V4-Flash: 2.7×10⁻⁴.
  • Batch size scheduling: V4-Pro max 94.4M token, V4-Flash max 75.5M token.

Kommunikációs optimalizációk

  • Finomszemcsézett EP (Expert Parallelism): a kommunikáció és számítás teljes átfedése hullámok (wave) alapú szakértő ütemezéssel, akár 1.92× elméleti gyorsítás.
  • TileLang: DSL a kernel fejlesztéshez, amely egyensúlyoz a fejlesztői produktivitás és futási hatékonyság között.
  • Batch-invariant és determinisztikus kerneltárak: bitwise reprodukálhatóság training és inference között.
  • FP4 kvázi-tudatos training (QAT): MoE szakértői súlyok és az indexer QK útvonal FP4-es kvantálása.

Training stabilitás

Két kulcsfontosságú technika a loss spike-ok kezelésére:

  1. Anticipatory Routing: a routing indexek előre számítása (Δt lépéssel korábban), a backbone és routing hálózat frissítéseinek szétválasztása.
  2. SwiGLU Clamping: a SwiGLU lineáris komponensének [-10, 10] tartományra korlátozása, a gate komponens felső korlátjának 10-re állítása.

Post-training: On-Policy Distillation (OPD)

A V4 sorozat a hagyományos RLHF helyett On-Policy Distillation-t alkalmaz. Folyamata:

  1. Specialista training: külön szakértők képzése matematika, kódolás, ügynöki és utasításkövetési domainekben (SFT + GRPO RL).
  2. OPD egyesítés: a tanuló modell a saját generált trajektóriáin tanul a szakértő modellek eloszlásából, teljes szókincsű reverse KL divergence-t alkalmazva.

Benchmark eredmények

Alapmodellek összehasonlítása

Benchmark V3.2-Base V4-Flash-Base V4-Pro-Base
MMLU-Pro 65.5 68.3 73.5
GPQA Diamond — — 90.1
HLE — — 37.7
LiveCodeBench — — 93.5
Codeforces (Rating) — — 3206
IMO AnswerBench — — 89.8
LongBench-V2 40.2 44.7 51.5

Legjobb modellek összehasonlítása (Pro-Max vs vetélytársak)

Benchmark Claude-Opus-4.6-Max GPT-5.4-xHigh Gemini-3.1-Pro-High V4-Pro-Max
MMLU-Pro 89.1 87.5 91.0 87.5
SimpleQA-Verified 46.2 45.3 75.6 57.9
Chinese-SimpleQA 76.4 76.8 85.9 84.4
GPQA Diamond 91.3 93.0 94.3 90.1
LiveCodeBench 88.8 — 91.7 93.5
Codeforces Rating — 3168 3052 3206
IMO AnswerBench 75.3 91.4 81.0 89.8
Apex Shortlist 85.9 78.1 89.1 90.2

Kulcsfontosságú megállapítások

  • Tudás: V4-Pro-Max új nyílt forráskódú csúcsot állított fel a SimpleQA és Chinese-SimpleQA benchmarkokon, jelentősen lezárva a rést a Gemini-3.1-Pro-val szemben.
  • Gondolkodás: felülmúlja a GPT-5.2-t és a Gemini-3.0-Pro-t, de minimálisan elmarad a GPT-5.4-től és a Gemini-3.1-Pro-tól (kb. 3-6 hónapos lemaradás a frontiermodellekhez képest).
  • Ügynök: szintén versenyképes teljesítmény, Claude Sonnet 4.5-t felülmúlja, az Opus 4.5 szintjét közelíti.
  • Hosszú kontextus: 1M tokenes kontextusban Gemini-3.1-Pro-t felülmúlja akadémiai benchmarkokon.
  • Hatékonyság: V4-Flash-Max versenyképes gondolkodási teljesítményt nyújt a nagyobb modellekkel szemben, kisebb paraméterszámmal.

Kapcsolódó wiki cikkek

  • ai automation — mesterséges intelligencia automatizálás és ügynöki rendszerek
  • llm supply chain — nagy nyelvmodellek ellátási lánca és hardverigényei

Források

  • DeepSeek-AI. "DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence." 2026.
  • Model checkpoint-ok elérhetők: https://huggingface.co/collections/deepseek-ai/deepseek-v4

A cikk 1120 szóból áll. Kulcsfogalmak: MoE (Mixture-of-Experts), CSA (Compressed Sparse Attention), HCA (Heavily Compressed Attention), mHC (Manifold-Constrained Hyper-Connections), Muon optimalizáló, FP4 kvantálás, 1M token kontextus, On-Policy Distillation, Expert Parallelism, KV cache optimalizálás.

Vissza a tetejére