# LeWorldModel (LeWM) — Stabil End-to-End JEPA Pixelekből

**Szerzők:** Lucas Maes (Mila/UdeM), Quentin Le Lidec (NYU), Damien Scieur (Mila/Samsung SAIL), Yann LeCun (NYU), Randall Balestriero (Brown)
**Dátum:** 2026-03-24 (v2)
**Forrás:** https://arxiv.org/abs/2603.19312
**Licensz:** CC BY 4.0

---

## Összegzés
A LeWorldModel az **első Joint Embedding Predictive Architecture (JEPA), ami stabilan, end-to-end tanítható nyers pixelekből**, mindössze két loss taggel: egy next-embedding predikciós loss és egy Gauss-eloszlású latens embedding regularizáló. Ezzel a hangolható loss hiperparaméterek számát **6-ról 1-re csökkenti** az előző end-to-end alternatívához képest.

Korábbi JEPA-k törékenyek voltak — komplex multi-term losst, exponential moving average-t, előtanított encodereket vagy külső supervisiont igényeltek a reprezentációs kollapszus elkerülésére.

### Főbb eredmények

- **~15M paraméter** — egyetlen GPU-n pár óra alatt tanítható
- **48× gyorsabb tervezés**, mint foundation-model-alapú world modellek
- Versenyképes teljesítmény **2D és 3D kontroll feladatokon**
- A latens tér **értelmes fizikai struktúrát kódol** (fizikai mennyiségek probe-olhatók belőle)
- **Surprise evaluation:** megbízhatóan detektál fizikailag lehetetlen eseményeket

### Miért fontos

- LeCun régóta szorgalmazza a JEPA architektúrát mint a világmodellezés és az emberi szintű AI felé vezető utat
- Ez az első gyakorlati bizonyíték, hogy a JEPA stabilan működik anélkül hogy a szokásos trükkökre támaszkodna
- **Világmodell, ami érti a fizikát** — nem csak prediktál, hanem "meglepődik" a fizikailag lehetetlen eseményeken
- Hatékony alternatíva a foundation model (GPT/ViT alapú) világmodellekkel szemben: kisebb, gyorsabb, ugyanolyan kompetitív
