LeWorldModel (LeWM) — Stabil End-to-End JEPA Pixelekből¶
Szerzők: Lucas Maes (Mila/UdeM), Quentin Le Lidec (NYU), Damien Scieur (Mila/Samsung SAIL), Yann LeCun (NYU), Randall Balestriero (Brown) Dátum: 2026-03-24 (v2) Forrás: https://arxiv.org/abs/2603.19312 Licensz: CC BY 4.0
Összegzés¶
A LeWorldModel az első Joint Embedding Predictive Architecture (JEPA), ami stabilan, end-to-end tanítható nyers pixelekből, mindössze két loss taggel: egy next-embedding predikciós loss és egy Gauss-eloszlású latens embedding regularizáló. Ezzel a hangolható loss hiperparaméterek számát 6-ról 1-re csökkenti az előző end-to-end alternatívához képest.
Korábbi JEPA-k törékenyek voltak — komplex multi-term losst, exponential moving average-t, előtanított encodereket vagy külső supervisiont igényeltek a reprezentációs kollapszus elkerülésére.
Főbb eredmények¶
- ~15M paraméter — egyetlen GPU-n pár óra alatt tanítható
- 48× gyorsabb tervezés, mint foundation-model-alapú world modellek
- Versenyképes teljesítmény 2D és 3D kontroll feladatokon
- A latens tér értelmes fizikai struktúrát kódol (fizikai mennyiségek probe-olhatók belőle)
- Surprise evaluation: megbízhatóan detektál fizikailag lehetetlen eseményeket
Miért fontos¶
- LeCun régóta szorgalmazza a JEPA architektúrát mint a világmodellezés és az emberi szintű AI felé vezető utat
- Ez az első gyakorlati bizonyíték, hogy a JEPA stabilan működik anélkül hogy a szokásos trükkökre támaszkodna
- Világmodell, ami érti a fizikát — nem csak prediktál, hanem "meglepődik" a fizikailag lehetetlen eseményeken
- Hatékony alternatíva a foundation model (GPT/ViT alapú) világmodellekkel szemben: kisebb, gyorsabb, ugyanolyan kompetitív