# Practical AI – Open Source Self-Driving with Comma AI

**Dátum:** 2026-04-16
**Vendég:** Harald Schäfer, CTO, Comma AI
**Műsorvezetők:** Daniel Whitenack (Prediction Guard), Chris Benson (Lockheed Martin)

---

## Összegzés
Harald Schäfer, a Comma AI CTO-ja 9 éve dolgozik az OpenPilot-on — a legnépszerűbb nyílt forráskódú önvezető rendszer. Az epizód áttekinti az end-to-end tanítási módszertant, a diffúzió-alapú világmodell-szimulátort (elsőként szállítva), a hardver korlátait, és a nyílt forráskód filozófiáját. A Comma 100× kevesebb számítási kapacitással dolgozik, mint a Tesla/Waymo, mégis autópályán >50%-os vezetési arányt ér el.

---

## Főbb témák

### 1. Comma AI és OpenPilot áttekintés

- **Eszköz:** Comma 3/4 — szélvédőre szerelhető készülék (kamera + GPS + IMU + compute)
- **Telepítés:** hátsó tükör mögötti CAN csatlakozó → szélvédő → kész
- **Szoftver:** OpenPilot — nyílt forráskódú önvezető stack (GitHub legnépszerűbb robotikai projektje)
- **Engedélyezés:** tempomat gomb → Comma UI + hang visszajelzés
- **Státusz:** autópályán rendkívül megbízható (>50% mérföld vezetve a rendszerrel), városban még béta (piros lámpák, finom viselkedés)

### 2. End-to-End tanítás

**Megközelítés:**
- Nincs klasszikus érzékelés (nincs sávdetektálás, nincs objektumfelismerés külön)
- Nyers video input → neurális háló → kormányszög + gyorsulás output
- Adatforrás: több százmillió mérföld emberi vezetésből
- **Imitációs tanítás önmagában nem elég** — a modell nem tud visszatérni a hibákból (ismert ML probléma)

**Megoldás: szimulátorban történő tréning:**
- Korábban: klasszikus szimulátor (mélységbecslés + reprojektálás → artifaktek)
- Most: **diffúzió-alapú világmodell szimulátor** — generált videó, fotórealisztikus
- A szimulátor bevezet hibákat (sávközpontból eltérés) és megtanítja a modellt a visszatérésre
- **A Comma az első, aki ezt szállítja** (Waymo/Tesla kutatja, de nem szállította még)

### 3. Világmodell (World Model)

**Két fő kihívás:**
1. **Fotórealizmus** — a videónak valósághűnek kell lennie (ez ~megoldott diffúzió modellekkel)
2. **Bemenet-pontos reagálás** — ha a modell "kormány balra 10°" jelet kap, a videónak azt kell mutatnia (ez a nehéz rész)

**Architektúra:**
- **Világmodell:** szimulátorként működik → valós videóból indul → action jelekre generálja a következő képkockákat
- **Ügynökpolitika (agent policy):** sokkal kisebb modell → a szimulációban tanul → az eszközön fut
- A világmodell "látja a jövőt" → hiba-elhárítási trajektóriákat felügyel
- Minden futásidejű inferencia **eszközön történik** (nincs felhő függőség)

### 4. Hardver és számítási kapacitás

- **Jelenleg:** régebbi telefon chip (hőkorlát a szélvédőn)
- **Comma ~1/100-ad számítási kapacitás** az FSD computerhez képest
- **Közeljövő:** külső GPU az ülés alatt → 100× nagyobb modell → ~2× jobb nuansz-felismerés (pl. zöld lámpa furcsa helyzetekben)
- **Skálawány:** exponenciális compute-növekedés → marginális javulás (autópályán alig észrevehető)

### 5. Nyílt forráskód filozófia

- **Miért?** Közösségi autó-portolás (több autótámogatás = több fejlesztő)
- **Alapelv:** ha megveszel egy eszközt, tudd mi fut rajta és te kontrolláld
- **Szerkezet:** ⅔ Python, ⅓ C++ — ami lehet Python, az Python (könnyebb debug, kísérlet → szállítás)
- **C++ csak ahol kötelező:** biztonsági kritikus CAN interfész chip, teljesítmény-érzékeny részek
- **ROS helyett saját stack:** hatékonyabb inter-process kommunikáció (zero-copy messaging), szűkös hardver miatt
- **Tréning stack:** egyelőre nem nyílt forráskódú, de nyitottak rá — már nyitottak forráskódra adatközpont-kezelési eszközöket

### 6. Három megoldatlan kutatási probléma

1. **Kontroll (Controls):** autó válaszai késnek, nem pontosak, belső logika nem ismert → klasszikus optimalizálás (gumiabroncs merevség, súrlódási együttható élő tanulása) — ML nem tudja megoldani
2. **Megerősítéses tanulás (RL):** szoros visszacsatolású rendszereknél az imitációs tanítás nem működik, RL kellene — de "RL just doesn't work" jelenleg
3. **Folyamatos tanulás (Continual Learning):** eső → tapadás csökken → ember vezető alkalmazkodik, ML nem tud — ideálisan neurális háló élő adaptációja

### 7. Jövőkép: Robotika az önvezetésen túl

- **Beltéri navigáció:** próbálták — world model alapú beltéri térképezés, de ML még nem elég megbízható
- **Cselekvés (action):** kormányzás → kar mozgatás → azonos ML keretrendszerben (távoli cél)
- **Filozófia:** "Egyszerű robotikai termékek, amik megkönnyítik az életet, és nem egy nagyvállalat birtokolja őket"
- **Nyílt forráskód = ha kémprogram van a házadban, törölheted**

---

## Kulcsidézetek

> "Self driving was the most interesting applied robotics problem, period." — Harald

> "We run with 100x less compute than Waymo or Tesla. On the highway, you're not even really gonna notice the difference." — Harald

> "Imitation learning doesn't work for controls. You need RL. And by and large, RL just doesn't work." — Harald

> "If you buy a device and you don't get to know what runs on it, you should question whether you really own it." — Harald

> "I want simple robotics products that make your life easier and aren't owned by a big corporation." — Harald