Kihagyás

LeWorldModel (LeWM) — Stabil End-to-End JEPA Pixelekből

Szerzők: Lucas Maes (Mila/UdeM), Quentin Le Lidec (NYU), Damien Scieur (Mila/Samsung SAIL), Yann LeCun (NYU), Randall Balestriero (Brown) Dátum: 2026-03-24 (v2) Forrás: https://arxiv.org/abs/2603.19312 Licensz: CC BY 4.0


Összegzés

A LeWorldModel az első Joint Embedding Predictive Architecture (JEPA), ami stabilan, end-to-end tanítható nyers pixelekből, mindössze két loss taggel: egy next-embedding predikciós loss és egy Gauss-eloszlású latens embedding regularizáló. Ezzel a hangolható loss hiperparaméterek számát 6-ról 1-re csökkenti az előző end-to-end alternatívához képest.

Korábbi JEPA-k törékenyek voltak — komplex multi-term losst, exponential moving average-t, előtanított encodereket vagy külső supervisiont igényeltek a reprezentációs kollapszus elkerülésére.

Főbb eredmények

  • ~15M paraméter — egyetlen GPU-n pár óra alatt tanítható
  • 48× gyorsabb tervezés, mint foundation-model-alapú world modellek
  • Versenyképes teljesítmény 2D és 3D kontroll feladatokon
  • A latens tér értelmes fizikai struktúrát kódol (fizikai mennyiségek probe-olhatók belőle)
  • Surprise evaluation: megbízhatóan detektál fizikailag lehetetlen eseményeket

Miért fontos

  • LeCun régóta szorgalmazza a JEPA architektúrát mint a világmodellezés és az emberi szintű AI felé vezető utat
  • Ez az első gyakorlati bizonyíték, hogy a JEPA stabilan működik anélkül hogy a szokásos trükkökre támaszkodna
  • Világmodell, ami érti a fizikát — nem csak prediktál, hanem "meglepődik" a fizikailag lehetetlen eseményeken
  • Hatékony alternatíva a foundation model (GPT/ViT alapú) világmodellekkel szemben: kisebb, gyorsabb, ugyanolyan kompetitív
Vissza a tetejére