# Practical AI. Nyílt modellek és a fizikai AI jövője

**Epizód:** Open models and the future of Physical AI with NVIDIA
**Dátum:** 2026-10-01
**Hossz:** 47:19 (2839 s)
**Házigazdák:** Daniel Whitenack (CEO, Prediction Guard) és Chris Benson (Principal AI/Autonomy Research Engineer)
**Vendég:** Ming-Yu Liu (VP, Cosmos Lab, NVIDIA; IEEE Fellow)
**Forrás:** https://share.transistor.fm/s/217445d3

## Bevezetés és a kiindulópont

A Practical AI 374. epizódja két olyan szálat köt össze, amelyek 2026-ban külön-külön is a szakma figyelmének közepén vannak: a nyílt modellek nyugati helyzetét és a fizikai AI kibontakozását. A vendég Ming-Yu Liu, az NVIDIA Cosmos Lab vezetője, aki a világmodellekkel (world foundation models) foglalkozó kutatócsoportot irányítja.

A beszélgetés azzal indul, amit Chris Benson később „turning pointnak” nevez: néhány hónappal korábban a nyugati nyílt modellek helyzete megingott, és olyan szervezetek álltak le a nyílt fejlesztéssel, amelyek addig élen jártak. Chris megfogalmazása szerint „delight to see NVIDIA step in and take the leadership there”. Ehhez kapcsolja a Hugging Face felvásárlást, amelyet az NVIDIA 2026. szeptember 3-án jelentett be, 12,9 milliárd dollár értékben, és amely a felek szándéka szerint 2027 első felében zárul le, hatósági jóváhagyás után.

A Hugging Face ügylet ebben a beszélgetésben nem mint üzleti tranzakció jelenik meg, hanem mint a nyílt ökoszisztéma infrastrukturális biztosítéka. Az NVIDIA vállalta, hogy a platform nyílt marad, a felhasználókat nem kötelezi saját chipjeire, és más szilíciumgyártókat is kiszolgál tovább. Ez az a pont, ahol a beszélgetés tétje megmutatkozik: egy hardvercég vállal kötelezettséget egy szoftverplatform nyitottságára.

## Miért fontosak a nyílt modellek

Liu a saját kutatói indulásával kezdi a választ. Amikor diákként számítógépes látást és gépi tanulást tanult, a nyílt forráskódú rétegek és modellek olvasása volt az, ami a fogalmakat megértette vele, és ami innovációra késztette. Megfogalmazása szerint „the academy always work like that”, és ez jóval a nagy generatív modellek korszaka előtt is így működött. A törés szerinte az utóbbi időben következett be: a modellek megnőttek, a felépítésükhöz szükséges erőforrás mennyisége hatalmassá vált, ezért a nyílt modellek száma csökkent.

Az érve három lábon áll. Az első az, hogy az API megoldja a problémát, de nem ad belátást: „they solve problems, but they don't give you the insight”. A fejlesztő nem tudja szétszedni a modellt, és nem tudja a saját ötletét beletenni. A második gyakorlati: lehet, hogy a feladat helyi gépen futna, internetkapcsolat nélkül, és ott az API nem megoldás. A harmadik pedig az NVIDIA saját pozíciója.

Ez a harmadik érv a legérdekesebb, mert megfordítja a szokásos logikát. Az NVIDIA gyorsítógépeket épít: GPU-kat, hálózati eszközöket, és egyre inkább CPU-kat és SoC-ket. Liu szerint viszont „to better build these computers, we need to know more about the applications”. Azaz azért építenek modelleket, hogy megértsék, milyen számítógépet kell építeniük. A modell mint új típusú könyvtár jelenik meg: régen számítógép és szoftverkönyvtár volt, ma számítógép, könyvtár és modell, és az alkalmazások a modellek tetejére épülnek.

Daniel Whitenack visszakérdez a kereskedelmi oldalra: mit jelent mindez az NVIDIA vevőinek? Liu két szót használ összefoglalásként: „Innovation, freedom”. Az indoklás szerint az API-val megoldható az ismert probléma, a nyílt modellel viszont több lehetséges, mint ami az API-ban elérhető. A mező egyre több fontos alkalmazást talál, a chatbotok korától a kódoló ágensekig, és lesznek olyan alkalmazások, amelyeket a frontier cégek nem láttak előre, és amelyek testreszabást igényelnek. A nyílt modell itt választási lehetőséget ad.

## A fizikai AI terepe

Liu definíciója szerint a fizikai AI olyan AI, amely fizikai eszközben működik, az eszköz megváltoztatja a világ állapotát, végrehajt egy feladatot, és az eredmény anyagi formában jelenik meg: valami, ami megfogható. Ez a meghatározás szándékosan tág, és több vertikális ágat foglal magába.

A felsorolt területek: az autóipar, a gyári automatizálás, a robotika mint alpillér, és ezeken túl a mezőgazdaság és az építőipar. A beszélgetés során később előkerülnek a drónok is, például a tealevél-betakarítás példájában.

A legizgalmasabb formaként Liu mégis a humanoid robotot nevezi meg. A vízió az, hogy a humanoid robotok segítenek a feladatok elvégzésében, és ehhez számítógépre lesz szükségük: olyan teljesítményre, amely a vizuális bemenetet feldolgozza, az emberi utasítást megérti, és a feladatot önkorrekcióval befejezi. Liu itt nyíltan kimondja az NVIDIA üzleti indokát is: ha a fizikai AI álma valóra válik, abból az NVIDIA számára hatalmas lehetőség származik. Az érdekeltség tehát vállaltan összehangolt, nem leplezett.

## Miért van szüksége a robotoknak nyílt modellekre

Ez a beszélgetés legerősebb technikai szakasza. Liu a policy modellt hozza példaként: ez a modell vizuális megfigyelésből és a felhasználó vagy gép által adott utasításból generál cselekvést. A séma bemenetre és kimenetre bontva: megfigyelés és utasítás be, cselekvés ki.

Az érv lényege az, hogy minden robot másképp látja a világot. Van, amelyiknek két szeme van, van, amelyiknél a markolóra szerelt kamerák néznek, és az önvezető autóknál is nagy a szórás: egyes járművek tizenegy kamerát hordoznak, mások hetet, és van LiDAR is. Minden fizikai eszköz eltérő módon érzékeli a környezetét, és ezek egy része egyedi. Ezért Liu szerint nehéz egyetlen modellt építeni, amely mindezt lefedi.

A nyílt modell itt úgy működik, mint egy induló állapot: a modell hoz magával világértést és szimulációs képességet, és abból a bázisból a fejlesztő a saját eszközén gyűjtött adattal finomhangolhat. Egy modell, amely kezdetben egyetlen kamerát kezelt, utólagos tanítással több nézetet is kezel. Liu szerint ez „easier, more achievable with open model”, és ez adja az innovációs erőt: a nyílt modell testreszabható a saját fizikai felhasználási esetre.

A szakasz záró gondolata a hatékonyság irányába mutat: „in the end, the primary evolution will be intelligence per watt”.

## Valós idejű inferencia az élen

Chris Benson kérése az, hogy Liu adjon gyors bevezetőt azoknak, akik digitális AI-t ismernek, de fizikai AI-t még nem építettek. A válasz a digitális és a fizikai AI közötti különbséget járja körbe.

Az első különbség az időzítés: a robotnak nagyon gyorsan kell reagálnia, a feldolgozásnak valós időben, helyben kell megtörténnie. A második a batch méret: sok feladat egyes batch méretű inferenciaprobléma. Az API világában a szolgáltató több felhasználó hívását összegyűjtheti, és együtt dolgozhatja fel, ami kitölti a számítási kapacitást. Liu itt kitér arra, hogy a nyelvi modellek autóregresszív transformerre épülnek, ezért memóriakötöttek, és éppen az API-hívások aggregálása teszi lehetővé a GPU hatékony kihasználását.

A beágyazott eszközön viszont nincs mit aggregálni. Nincs API-hívás, amit össze lehetne gyűjteni, ezért a gép számítási teljesítménye nem használható ki teljesen. Liu következtetése az, hogy emiatt más architektúrák lehetnek hatékonyabbak: „because the application is different”, más architektúra és más tervezés kell ahhoz, hogy a watt hatékonyabban hasznosuljon. Ehhez jönnek a valós idejű és biztonsági megkötések, amelyek szintén más architektúrák felé terelik a tervezést.

## Mik azok a világmodellek

Daniel Whitenack kérdése az, hogy aki eddig csak nyelvi modellekkel találkozott, az értse meg, mi a világmodell és miért szükséges. Liu a nyelvi modellt úgy írja le, mint amely az emberi tudást nyelvi formában dolgozza fel, és erre a reprezentációra optimalizált, hogy nyelvet generáljon: beszélgetéshez, kódhoz. A kód szintén nyelvként íródik le.

A világmodell másik nézőpontból indul: a világ érzékszervi megfigyeléséből. A szenzorok a valóság különböző szögeit rögzítik, és a kamerák a fizika alakulását is megörökítik. Liu szerint sokan hiszik azt, hogy ezeknek a jeleknek a modellezésével implicit módon kódolható a világ fizikája, és ha a fizika modellezve van, akkor elindulhat a szimuláció. Ha pedig a világreprezentációt összekapcsoljuk a nyelvi reprezentációval, akkor magyarázat generálható arra, hogy miért történt valami.

Liu óvatos abban, hogy mit nevez világmodellnek. Megfogalmazása szerint nehéz bemenet és kimenet alapján definiálni, mert a modellt mindig valamilyen célra építjük: előrejelezni, ami történni fog, megmagyarázni, ami történt, vagy navigálni, amihez a világ háromdimenziós reprezentációja kell. Ezért inkább így fogalmaz: „some sort of modeling of the world is a world model”.

A Cosmos keretein belül két képességet különít el. A világszimuláció bemenete a jelenlegi megfigyelés és a cselekvéssorozat, kimenete pedig a jövő, videó vagy hang formájában. A világértés bemenete a videó és a szöveg, kimenete a szöveg, és ez inkább a multimodális nyelvi modellekhez hasonlít. A Cosmos 3-ban Liu csapata a kettőt összeolvasztotta, azzal az indoklással, hogy a reprezentáció megosztható, mert ugyanabban a világban élünk. A modell így omni-modellé válik: a bemenet szöveg, cselekvés, hang és videó is lehet, és ugyanez igaz a kimenetre, minden kombinációban, hogy a fejlesztő a saját feladatához illő utat választhassa.

## Szimuláció: szabályok kontra tanulás

Chris Benson a szimuláció és a világmodell viszonyát kérdezi. Liu válasza a klasszikus és a neurális szimuláció szembeállítása.

A klasszikus szimulátor évszázadok tudását önti egyenletekbe: a program azokra az egyenletekre épül, amelyek leírják, mi történik, amikor két tárgy összeütközik. Ez szabályalapú megközelítés. A neurális szimuláció ezzel szemben adatvezérelt: a modell rengeteg megfigyelést lát arról, hogyan ütközik össze két tárgy, vagy hogyan terjed szét a víz a földön, és mintázatfelismerés alapján közelíti a kimenetet. Liu megfogalmazása szerint az egyik szabályalapú, a másik adatvezérelt approximáció.

Ez a megkülönböztetés magyarázza azt is, miért nem egyszerű a neurális szimuláció megbízhatósága: a fizika nincs beírva, hanem tanult reprezentációban él.

## Világmodellek a policy-k tesztelésére

A beszélgetés legkonkrétabb példája az önvezető autó fejlesztése. Ha egy policy modellt építünk, amely a járművet A pontból B pontba navigálja, akkor a fejlesztés során sok különböző checkpoint keletkezik. A régi gyakorlat az volt, hogy autóflottát és sofőröket vittek ki a terepre, és minden új policyt élesben mértek. Liu szerint ez nem skálázható, és korlátozza az iterációk számát.

A világmodell ezt a kört rövidíti: a policy a valódi autó helyett a világmodellel lép kölcsönhatásba, és meg lehet nézni, mi történik, ha balra fordul, és mi, ha jobbra. A szimulációból megbecsülhető a checkpoint pontossága, leszűkíthetők a hipotézisek, és csak azok a változatok kerülnek valódi tesztre, amelyek ígéretesnek tűnnek. Liu az iteráció sebességét nevezi a technológia legfontosabb tényezőjének.

A második felhasználási mód a policy modellek gerincének (backbone) szolgálása. A világmodellben lévő reprezentáció érti az emberi utasítást, és a képpont-térbeli alakulás erősen korrelál azzal a vezérlőjellel, amely a manipulációs feladathoz kell. Ez a korreláció regularizációként működik, és jobb policy modellt eredményez akkor is, ha kevés az adat.

Innen érkezik vissza a szál a nyitottsághoz: ha a világreprezentáció egy alapmodellben él, akkor érdemes nyitottá tenni, hogy a fejlesztők kipróbálhassák, és visszajelzést adjanak arról, melyik képesség fontos a fizikai AI ökoszisztémának.

## Többágenses fizikai rendszerek

Chris Benson a skálázás dimenzióját nyitja meg: mi történik, ha nem egy robotról vagy egy autóról beszélünk, hanem sokról, akár egy városnyiról, a föld alattitól az óceán mélyéig. Liu válasza egy gyártási lánc végigjátszása.

A példában egy gyártó robotkutyát épít, és egy nyelvi modellre épülő digitális ágens segít átlátni a készletet és az anyagok helyét. Az ágens magas szintű tervezést végez: kiderül, hogy alapanyagot kell szállítani B gyárból A gyárba. Az ágens ezután kérést küld a B gyár üzemcsarnoki ágensének, és a két ágens kezet fog. A B gyárban mobil platformok és robotok dolgoznak, a robot az árut a platformra teszi, a platform a teherautóra rakja, és egy önvezető teherautó viszi B-ből A-ba. Az összeszerelésnél minden állomáson vizuális ellenőrzés és robotkar működik, zárt hurkokban, egy másik ágens irányításával.

Liu következtetése az, hogy a világ többágenses lesz, és az ágensek specializálódnak. Az indoklás visszavezet a korábbi hatékonysági érvhez: nem kell, hogy egy robotkar olimpiai matematikai feladatokat oldjon meg, hanem az kell, hogy érzékeny legyen egy manipulációs feladatban. A specializált ágenseknek együtt kell működniük, és köztük lesznek olyanok, amelyek a feladatok szétosztásában jók, és olyanok, amelyek a végrehajtásban. Az ágens definíciója itt az autonómia: valaki, aki bizonyos önállósággal cselekszik a felhasználó nevében, és önállóan megoldja a rá bízott problémát.

## Kihívások az úton

Daniel Whitenack a kaszkádos meghibásodás jelenségét hozza be: ha sok ágens kapcsolódik össze, egy kis hiba rendszerszintűvé válhat. Liu egyetért, és rögtön időbeli távolságot is rendel hozzá: a többágenses gyártási kép az ő megítélése szerint „might be decades away”.

A helyesség ellenőrzése Liu szerint kiemelten fontos, és ezért felügyelő ágenseket vizionál az üzemcsarnokban, amelyek a még nem azonosított jelenségeket próbálják megragadni. A második korlát a robotok érettsége: a humanoid robotok gyorsan fejlődnek, de Liu szerint még nem állnak készen a széles körű kereskedelmi használatra. A harmadik a teljes automatizálás feltétele: a robotoknak okosabbnak és konfigurálhatóbbnak kell lenniük, hogy egy új feladatnál elég legyen a használati utasítást elolvasni, és a robotkarnak ki kell találnia, hogyan szerelje össze a darabot. Ez sem adott még.

A szakasz zárása az ökoszisztéma érve: Liu szerint ezt egyetlen cég nem tudja megoldani, ezért fontos a nyílt modell, mert az adja meg több embernek az eszközt az inspirációhoz és az innovációhoz.

## Hogyan kezdje el valaki

Daniel Whitenack arra kéri Liu-t, hogy adjon belépési pontot azoknak a fejlesztőknek, akik most szeretnének elkezdeni dolgozni ezen a területen. A válasz egyben a nyílt modell fogalmának kiterjesztése.

Liu szerint a nyílt modell nem merül ki a nyílt súlyokban: a csomag része a tanító keretrendszer is, amellyel a saját adatot rá lehet tanítani a modellre. Ehhez jönnek a nyíltan kiadott adathalmazok és a példák: fejlesztői blogok és receptgyűjtemények, amelyeken keresztül mások tapasztalata átvehető. Az NVIDIA itt azzal érvel, hogy sok fizikai AI céggel dolgozik együtt, és azok hajlandók megosztani a saját eseteiket.

A gyakorlati tanács a keresési szokásra vonatkozik: Liu szerint manapság a legtöbben nyelvi modellekkel kutatnak, és érdemes a kedvenc ágenst megkérni, hogy keresse meg a hasznos anyagokat. Hozzáteszi azt is, hogy a szolgáltatók érdeke, hogy az anyagok az ágensek számára könnyen elérhetők legyenek. A fő letéti helyek: a Hugging Face és a GitHub, ahol a nyílt modellek mellett receptkönyv (cookbook) is található. Liu szerint ez igaz a Cosmosra, és igaz a Nemotronra, a GR00T-ra és más nyílt modellekre is, köztük az Alpamayóra.

## A lényeg

Az epizód két különböző típusú érvet kapcsol össze, és érdemes szétválasztani őket, mert más a súlyuk.

Az első érv a nyílt modellek mellett szól, és technikai. A fizikai AI-nál az eszközök érzékelése szélsőségesen heterogén, és emiatt nem létezhet egyetlen modell, amely mindenkinek jó. Ez nem ideológiai, hanem mérnöki állítás: a finomhangolhatóság a heterogenitás következménye, nem a nyitottság mellékhatása.

A második érv az NVIDIA érdeke, és ezt Liu nem titkolja. Azért építenek nyílt modelleket, mert meg akarják érteni, milyen számítógépet kell gyártaniuk, és mert a fizikai AI terjedése számukra piacot teremt. Az „intelligence per watt” és az „intelligence per dollar” formulák ugyanezt a logikát viszik tovább: a hasznos teljesítmény egységnyi energia- és pénzráfordításra vetítve lesz a verseny mértéke.

A beszélgetés legpontosabb része a világmodellek és a policy modellek viszonyának leírása. A checkpoint-tesztelés példája konkrét: a világmodell nem a valódi világ helyettesítője általánosságban, hanem egy szűrő, amely a költséges valódi tesztek elé kerül, és leszűkíti a jelölteket. Ez a gyakorlati haszon, nem a szimuláció mint filozófiai program.

Ami hiányzik a képből: a beszélgetés nem tér ki arra, hogy a Cosmos modellek pontosan milyen licenc alatt érhetők el, és nem tárgyalja a fizikai AI biztonsági oldalát azon túl, hogy a valós idejű és biztonsági megkötéseket megemlíti. A humanoid robotok kereskedelmi érettségéről Liu egyértelműen azt mondja, hogy még nem tart ott, és a többágenses gyártási vízióhoz évtizedeket rendel. A lendületes részletek közepette ez a két időbeli korlát a beszélgetés leghasznosabb mértékadása.

## Forrás

- Epizód: https://share.transistor.fm/s/217445d3
- Transistor natív transcript (beszélő-címkékkel): https://share.transistor.fm/s/217445d3/transcription.txt
- Fejezetek: https://share.transistor.fm/s/217445d3/chapters.json
- NVIDIA Cosmos: https://www.nvidia.com/en-us/ai/cosmos/
- Ming-Yu Liu: https://mingyuliu.net
- NVIDIA–Hugging Face felvásárlás bejelentése: https://blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face/
- SEC 8-K nyilatkozat (2026-09-02): https://www.sec.gov/Archives/edgar/data/1045810/000104581026000078/nvda-20260902.htm

## Kapcsolódó külső

- NVIDIA open model families (Nemotron, Cosmos, Isaac GR00T, Alpamayo, BioNeMo): https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Expands-Open-Model-Families-to-Power-the-Next-Wave-of-Agentic-Physical-and-Healthcare-AI
- Cosmos 3 mint nyílt omni-modell: https://blogs.nvidia.com/blog/open-models-icml-2026
- Practical AI adásoldal: https://practicalai.show

## Kapcsolódó belső

- `summaries/practical_ai/2026-09-24_practical_ai_agents_md_enterprise_deployment_nick_kuhn.md`
- `summaries/practical_ai/2026-09-10_practical_ai_computer_use_agents_demetrios_brinkmann.md`
- `summaries/practical_ai/2026-07-02_black-forest-labs-visual-intelligence.md`
- `summaries/tanulmanyok/2026-04-21_jensen_huang_dwarkesh.md`

## Hogyan kapcsolódik a saját rendszerünkhöz (részletes)

Ez az epizód két olyan pontot érint, ahol a saját rendszerünk közvetlenül érintett.

1. **A nyílt modell mint a kutatás alapja és a saját skill-tárunk.** Liu legerősebb személyes érve az volt, hogy diákként a nyílt kód és a nyílt modellek olvasása tanította meg a fogalmakra. Ez pontosan az a mechanizmus, ahogyan a saját tárunk működik: a skill nem utasításgyűjtemény, hanem olvasható, szerkeszthető tudás, amelyet a saját helyzetünkre szabunk. Az epizód azt az elvet erősíti meg, hogy a testreszabhatóság nem kényelmi funkció, hanem az egyetlen módja annak, hogy a tudás a saját esetre illeszkedjen.

2. **A világmodell és a checkpoint-tesztelés analógiája a saját gate-jeinkre.** Liu példája szerint a régi gyakorlat az volt, hogy minden új policyt élesben, valódi autóval mértek, ami nem skálázható. A világmodell a költséges valódi teszt elé kerül, és leszűkíti a jelölteket. A saját média-pipeline-unk ugyanezt a mintát követi: az `output_integrity_gate.py`, az `auto_review.py` és a critique-gate determinisztikus szűrők, amelyek a drága emberi olvasás elé kerülnek. A tanulság itt az, hogy a szűrő értéke nem az, hogy tökéletes, hanem hogy olcsó és gyors, ezért az iteráció számát növeli. Ez egybevág Liu azon állításával, hogy a technológiában az iteráció sebessége a legfontosabb tényező.

3. **A nem-mért negatív állítás, mint visszatérő hiba.** Az epizód anyagának feldolgozása során a feedet meg kellett mérni ahhoz, hogy kiderüljön: a Transistor öt transcript-formátumot kínál, és a natív, beszélő-címkékkel ellátott szöveg elérhető. Ez ugyanaz a hibaosztály, amelyet a Fissionary epizódnál is javítani kellett: a „nincs más út” típusú állítás nem örökölhető, hanem mérni kell. A Transistor esetében a transcript-tag a feedben van, a végpont pedig a `share.transistor.fm/s/<id>/transcription.txt` mintát követi, nem a `/transcript` végpontot, amely csak egy JS-shell oldalt ad vissza.

4. **Az NVIDIA nyílt modelljei és a helyi futtatás lehetősége.** Az epizódban említett modellek (Nemotron, Cosmos 3, GR00T, Alpamayo) mind nyílt súlyokkal érhetők el, a Hugging Face-en és a GitHubon. A saját `mlops` és `local-image-generation` skilljeink szempontjából ez azt jelenti, hogy a helyi futtatás lehetősége nem szűkül, hanem bővül: a modellcsaládok licencfeltételei viszont nem egységesek, ezért minden checkpoint licencét külön kell ellenőrizni, mielőtt a saját pipeline-ba kerül.

5. **Az NVIDIA üzleti indokának nyílt kimondása.** Liu nem rejti el, hogy a nyílt modellek építése az NVIDIA hardverismeretének bővítését is szolgálja, és hogy a fizikai AI terjedése piacot teremt számukra. Ez a fajta átláthatóság hasznos: a nyílt modell ígérete és a hardvercég érdeke nem mond ellent egymásnak, de nem is azonos. Az epizód ezt a kettőt szétválasztva tárgyalja, és a hallgatónak is így érdemes olvasnia.
