# Practical AI: Image Generation and Visual Intelligence with Black Forest Labs — Ep. 362

**Dátum:** 2026-07-02  
**Vendég:** Dustin Podell (Co-Founder, Researcher, Black Forest Labs)  
**Műsorvezetők:** Chris Benson, Daniel Whitenack  
**Forrás:** [share.transistor.fm](https://share.transistor.fm/s/6d8dad5f)  
**Média:** [MP3](https://pscrb.fm/rss/p/dts.podtrac.com/redirect.mp3/media.transistor.fm/6d8dad5f/f006d8d2.mp3)  
**Hossz:** 48:21  
**Transcript:** Transistor.fm (nem Whisper)

---

## Practical AI – Képgenerálás és Vizuális Intelligencia a Black Forest Labs-szal

**Epizód:** 362 — Image Generation and Visual Intelligence with Black Forest Labs
**Dátum:** 2026-07-02
**Vendég:** Dustin Podell — társalapító és kutató, Black Forest Labs
**Házigazdák:** Daniel Whitenack (CEO, Prediction Guard) és Chris Benson (Principal AI & Autonomy Research Engineer)
**Összefoglaló rész:** 1/3 (1. rész)

---

## Bevezetés és háttér

- A Practical AI podcast most YouTube-videókat is közzétesz, ami különösen hasznos a vizuális témájú epizódoknál.
- A vendég **Dustin Podell**, a **Black Forest Labs** társalapítója és kutatója — egy olyan cég, amely nemcsak nyers képgenerálással foglalkozik, hanem munkafolyamatokkal, hardveroptimalizálással és sok más területtel is.
- Az epizód célja: átfogó kép adni a képgenerálás és a generatív modellek jelenlegi iparági állapotáról, az elmúlt néhány év fejlődésének bemutatásával.

> *"For an audio podcast, we're gonna talk about a lot of interesting visual things."* — Daniel Whitenack

---

## A képgenerálás állása — hol tartunk most?

Dustin egy kis történelmi visszatekintésből indul ki:

- **~4 éve:** A modellek alig tudtak többet, mint elmosódott színfoltokat előállítani, amelyek csak halványan kapcsolódtak a prompthoz (pl. "világítótorony a parton").
- **Ma:** Teljes rövidfilmek készülnek entirely AI-generációval, bizonyos jelenetek szinte megkülönböztethetetlenek a valóságtól.
- **Ugyanakkor** a technológia magja nem változott túlságosan — folyamatos, előrehaladó fejlődés történt, nem forradalmi ugrás.

> *"We've come quite far, but the core of the technology hasn't actually changed that much."* — Dustin Podell

Chris megjegyzi, hogy a nagyközönség figyelme nagyrészt az LLM-ek felé irányult, így sokan lemaradtak a képgenerálás terén elért hatalmas előrelépésekről.

---

## A technológia alapjai: Transformer és Diffúzió

### Transformer (2017)
- 2017-ben a Google kutatói fejlesztették ki a **transformer** architektúrát.
- Ez az alapja az **autoregresszív nyelvi modelleknek** — az adatot darabonként, egy elemenként predikálják.

### Diffúziós modellek — hogyan működnek?
Dustin rendkívül világosan elmagyarázza a diffúziós folyamatot:

1. **Folytonos közeg:** A világ folytonos — színek, formák, fény. A képet digitális térbe kódolják (RGB, 256 érték/csatorna).
2. **Információeltávolítás zajjal:** Ahelyett, hogy pixelenként predikálnának (mint az autoregresszív modellek), a diffúzió **zajt ad** a tiszta képhez — először egy kicsit (még felismerhető), majd egyre többet, amíg a kép teljes zajjá nem válik.
3. **Tanítás:** A modellt megtanítják, hogy a zajos képből **predikálja a tiszta képet**. Kis zajnál ez egyszerű (csak egy kis zajt kell eltávolítani); nagy zajnál a modellnek szinte a semmiből kell "kitöltenie" a képet.
4. **Inferencia (generálás):** Indulás egy teljesen zajos képből → "kérlek, adj egy kutyát cilinderrel a parton" → a modell lépésről lépésre eltávolítja a zajt, először csak a durva struktúrát találja meg, majd fokozatosan élesedik a kép, végül egy teljesen generált kép jelenik meg.

> *"Fundamentally, it's doing the exact same process of removing this information slowly with this noise, and then just slowly going the other direction, essentially creating info to infill."* — Dustin Podell

Chris dicséri a magyarázatot: *"Probably the best one that I've heard."*

### Fontos: ez a folyamat ma is ugyanez
A régi DALL·E mini / korai Stable Diffusion modellektől a mai 10 másodperces videógeneráló modellekig **alapvetően ugyanaz a folyamat** zajlik: zaj hozzáadása tanításkor, zaj eltávolítása generáláskor.

---

## A jelenlegi state-of-the-art (SOTA)

Dustin három kategóriába osztja a folytonos közegeket:

- **Kép** — a legismertebb folytonos közeg
- **Videó** — a kép + idődimenzió
- **Hang** — sok videómodell már hangot is generál; emellett zenemodellek (pl. **Suno**) is használják ugyanezt a technikát

### "Legjobb" modell — nehéz definiálni
- A "legjobb" fogalma szubjektív: a felhasználók különböző dolgokat várnak el (prompting, képreferenciák, kreatív társ stb.).
- Az LLM-eknél világosabbak a metrikák (programozás, matematika); a kreatív modelleknél általában **preferencia-alapú benchmarkok** (leaderboards) dominálnak, ahol mindenki szavazhat — de ez elveszi a specificitást/granularitást.

### Konkrét ajánlások:
- **Text-to-video SOTA:** **Seedance 2** — 4K felbontás, 15 másodperces generációk, erősen filmes fókuszú. Kiemelkedő munka az elmúlt évben.
- **Sora 2:** Dustin szerint is szép modell, bár a leaderboardokon nem rangsorolt olyan magasra; elismerő szavakat küld a Sora csapatnak.

---

## Flow Matching — a diffúzió továbbfejlesztése

Chris rákérdez, hogy a mai modellek hagyományos diffúziós modellek-e, vagy a korábban említett **flow matching** eljárást használják.

### Átmenet: diffúzió → flow matching
- **Minden modell ugyanazt a folyamatot csinálja:** zaj hozzáadása, majd a modell tanítása a zaj eltávolítására.
- A különbség a **felszín alatti tanulásban** van.
- A korábbi **diffúziós** folyamatot megtisztították és **flow matching**-gé alakították.

### Dustin papírrepülő-analógiája (kiváló audio-barát magyarázat):

1. Képzelj el egy **térképet** a városodról, felülről (égből) nézve. A házad a térkép közepén van.
2. Mindenhol **szél** fúj a területen.
3. A cél: bárhonnan dobj egy **papírrepülőt**, és a szél vigye a házadhoz.
4. A valóságban ez egy **hiperdimenziós térben** történik:
   - A "házad" = a **valódi képek manifoldja** (a latent space azon pontja, ahol valós képek vannak).
   - A "város többi része" = **minden nem-valódi kép** (azaz zaj — a zaj is RGB-értékekkel rendelkezik, menthető a gépre, de nem "valódi" kép).
   - A koordináták nem 2D (x, y), hanem annyi dimenziós, amennyi a kép összes színértékének kódolásához kell.
5. A **flow matching** lényege: a modell egy **flow map**-et (áramlási/iránytérképet) tanul meg, amely bármely zajpontból elvisz a valódi képek manifoldja felé.
6. Ahogy közeledsz a manifoldhoz, a kép egyre "valósabbá" válik — először elmosódott, majd élesebb. Amikor eléred a manifoldot: **boom**, kész a (remélhetőleg valós) kép.

> *"We're training this flow map so that we can land anywhere in this field of noise. And then these flows, these winds, when you take a step, will take you closer to your house — to the manifold of real images."* — Dustin Podell

### Miért jobb a flow matching?
- Lehetővé teszi a **kevésbé véletlenszerű**, célzottabb utat a zajtól a valódi képig.
- Az elmúlt 3-4 év fejlődése nagyrészt **optimalizációkból** (tanításban és modellarchitektúrában) származik.
- De a fundamentális folyamat (információ eltávolítása + újratalálása) változatlan.

> *"It's just like the car — you've been having cars go down the road since the 1950s, and we've made better engines and better safety, but you're still driving down the road."* — Dustin Podell

---

## A gyakorlati alkalmazás felé — "Vizuális Intelligencia"

Az összefoglaló végén a házigazdák egy fontos fordulóponthoz érnek:

- A képgeneráló modellek már **mindennapi életbe is beágyazódtak** (pl. szöveges üzenetküldő appokban azonnali kép-remixelés).
- Sok hallgató azonban még mindig az "asztronauta lovon" típusú játékos példáknál tart, ami nem tűnik praktikusnak.
- Daniel felhívja a figyelmet a Black Forest Labs weboldalán használt **"Visual Intelligence"** kifejezésre — ez már túlmutat a puszta képgeneráláson, és a nyelv/agent/intelligencia irányába mutat.

> *"I love that statement because it gets to more like language... it is very [practical]."* — Daniel Whitenack

Ez a rész végén nyitva hagyott kérdés, amely a következő rész (2. rész) tárgya lesz.

---

## Szponzor/side-note: Midwest AI Summit 2026

- **2026. október 15., Indianapolis** — Midwest AI Summit
- Kiemelkedő esemény: valódi **AI Engineering Lounge**, ahol tapasztalt mérnökökkel lehet use-case-eket átbeszélni.
- Tavalyi előadók között volt pl. **Rajeev Shah** (a podcast korábbi vendége).
- Regisztráció: midwestaisummit.com, **20% kedvezmény** a `Practical AI 20` kóddal.

---

## 1. rész — Kulcstémák összefoglalva

| Téma | Tartalom |
|------|----------|
| **Fejlődés áttekintése** | 4 év alatt színfoltoktól a valósághű rövidfilmekig |
| **Transformer (2017)** | Autoregresszív, darabonkénti predikció — az LLM-ek alapja |
| **Diffúzió mechanizmusa** | Zaj hozzáadása → modell tanítása zaj eltávolítására → inferencia: zajtól valódig |
| **Folytonos közegek** | Kép, videó, hang — mind ugyanazt a technikát használják |
| **SOTA modellek** | Seedance 2 (text-to-video, 4K, 15s); Sora 2 (elismerésre méltó) |
| **Flow matching** | A diffúzió megtisztított változata — flow map tanulása a hiperdimenziós térben |
| **Papírrepülő-analógia** | Ház = valódi képek manifoldja; szél = flow; papírrepülő = generált minta |
| **Optimalizáció** | A fejlődés architektúrából + tanítási optimalizációkból jön, a alapfolyamat változatlan |
| **Vizuális Intelligencia** | A képgenerálás túllép a játékon — nyelv, agentek, gyakorlati alkalmazások felé (2. rész témája) |

## Practical AI – Képgenerálás és Vizuális Intelligencia a Black Forest Labsszal (2/3. rész)

**Epizód:** 362 – Image Generation and Visual Intelligence with Black Forest Labs
**Dátum:** 2026-07-02
**Vendég:** Dustin Podell (Co-Founder, Black Forest Labs)
**Összefoglaló témája:** A vizuális intelligencia gyakorlati alkalmazásai, a Flux modellcsalád bemutatása, helyi futtatás (laptop), és a világmodellek kapcsolata a robotikával.

---

## 1. A vizuális intelligencia gyakorlati alkalmazásai

A beszélgetés ezen szakaszában Dustin a „promptról képre” egyszerű generálástól a **kontextus-alapú szerkesztés és vizuális intelligencia** felé történő átmenetet vázolja fel.

### 1.1 Az idővonal és a kontextus-szerkesztés megjelenése

- Korai modellek: prompt be, kép/videó dal ki – főleg alkotók, reklámügynökségek, filmesek számára vonzó.
- Körülbelül egy éve megjelent a **FluxContext** nevű in-context szerkesztő modell.
- A szerkesztés felszínen „kreatív” funkció, de a motorháztető alatt a modellnek **értenie kell a világ relációit és fizikáját**.
- Példa: „Döntsd fel a vizespoharat és mutasd, mi történik” – a modellnek tudnia kell, hogy a víz kiömlik, valami nedves lesz, stb.
- Ez a képesség a videómodelleknél is megjelenik: egy kiindulási képből olyan jelenet generálható, ahol egy személy tűzoltóval eloltja a tüzet – ehhez a modell **szimulálja a világ egy részét**.

### 1.2 Világmodellek és robotika

- Dustin óvatosan használja a „világmodell” kifejezést (szerinte túlhasznált), de elismeri: a nagy léptékben, robusztusan tanított modellek lényegében **a világ reprezentációját építik fel**.
- A műsort vezető Daniel (robotika / megtestékelt intelligencia háttérrel) rákérdez, hogy a vizuális modellek és a robotikai világmodellek mennyire azonosak-e.
- Dustin válasza: **„nagyon összefüggnek”** – a modell a világ fizikai tulajdonságait és relációit tanulja meg, ami kiváló alap a robotika betanításához.
- A kreatív oldal nem kerül háttérbe, de a világ-reprezentáció **cselekvés-alapú felhasználásra** (pl. robotok) is nyit utat.

> „Fundamentally, this is what these models are doing when you train them at scale... they need to be able to simulate parts of the world to get an output.”

### 1.3 Konkrét gyakorlati felhasználási módok

- **Termékfotózás:** FluxContext segítségével egy termékképből profi stúdiófotó készíthető.
- **Ruhapróbálás (virtual try-on):** „itt vagyok én, itt a ruha – mutasd, hogy néz ki.”
- **Lakberendezés:** bútorok (kanapék, elemek) vizualizálása a saját térben.
- **Tűzoltási forgatókönyv (hackathon-példa):** tűzlépcső-fotókból generálták, hogyan nézne ki a tömeg menekülése vészhelyzetben – tömeg elhelyezkedésének becslésére használták. (Dustin: „érdekes, de sószemmel kell kezelni, mert generált komponens van benne.”)

---

## 2. A Flux modellcsalád – áttekintés

A Black Forest Labs alapvetően **kutatólaborként** tekint magára: minden kiadással egy konkrét képességet akarnak emelni, nem csak általános javítást végezni.

### 2.1 Flux1-család (~2 éve)

A cég alapítása utáni ~4–5 hónapos sprint eredménye. Három változat:

| Modell | Jellemző |
|---|---|
| **Flux1 Pro** | API-n keresztül elérhető, profi minőség |
| **Flux1 Dev** | kereskedelmileg licencelhető, **nyílt súlyokkal** |
| **Flux1 Schnell** | nagy sebességű, lépés-desztillált, teljesen nyílt (MIT/Apache) |

### 2.2 Tools-széria és FluxContext

- Több vezérlés iránti igény vezetett a **Tools-szériához**.
- Ezzel párhuzamosan indult a **kontextus-projekt**, ami a **FluxContext** kiadásához vezetett – a nagy szerkesztő release.

### 2.3 Flux2-család

- Nagy ugrás: nem csak T2I, hanem **többképes szerkesztés (omni-edit)** is.
- Több ember, több tárgy, bonyolult relációk megadhatók.
- Itt jelentek meg a hirdetési-use-case-eken túlmutató, érdekesebb alkalmazások (pl. a tűzlépcsős forgatókönyv).
- Flux2 egy 32B-s modell volt – „elég darabos”, nagyobb gépen helyileg futtatható, de lassú.

### 2.4 Klein-széria és Klein KV

- **Méretdesztilláció:** a lehető legnagyobb teljesítmény kis modellbe csomagolva.
- Text-to-image és szerkesztő modell; nagyon gyors; a Flux1-nél is kisebb.
- Cél: a helyi futtatók (open-weight felhasználók) is kapjanak valamit erős és gyors modellt.
- **Klein KV:** bevezette a **KV-caching**et (az LLM-világból ismert optimalizációs technikát) a szerkesztési világba → nagyon nagy gyorsulás helyi szerkesztésnél.

### 2.5 SelfFlow és a következő nagy kiadás

- Egy kutatási blog megjelent a **SelfFlow** nevű projektről (Dustin is szerző, de nem vezető – a vezető szerző „incredible”).
- A következő nagy release-t **„később nyáron”** várják, és Dustin nagyon izgatott, de konkrétumokat nem mond.

---

## 3. Futtatható-e a modellem a laptopomon?

- A műsorvezető (Daniel) megkérdezi, hogy ésszerű-e ma már egy modellt laptopon futtatni jó minőségű képhez.
- Dustin: **az LLM-világban sokkal többen dolgoznak** ezen a skálázási tengelyen (fel-le), mint a vizuális oldalon.
- **Klein sorozat:** „99%-ban biztos”, hogy fut egy modern **M-szériás MacBook Pro**-n. Konkrét sebességadatokat nem tud idézni (nem tesztelte személyesen).
- Mindig kompromisszum: **teljesítmény vs. méret/sebesség**.
  - Flux2 = 32B, darabos, lassabb helyileg → ezért jött a Klein.
  - A Flux1-nél a Schnell, a Flux2-nél a Klein volt a kis/gyors válasz.
- A cél: minden kiadásnál először egy **nagy, büszke teljesítményű** modell, majd **visszahozni kis, gyors skálára**.

> „It's always a trade off because we wanna push performance and make something that we're really proud of, and then we wanna try to bring that again back into smaller, faster scale.”

---

## Megjegyzések

- Ez a rész egy **szponzori blokkot** is tartalmaz a Prediction Guard (predictionguard.com/practicalai) agentic AI kontrol-síkja köré – az AI-ügynökök governance-ére és biztonságára fókuszáló bevezetővel. Ez a tartalmi összefoglalás szempontjából mellékves, de jelezzük jelenlétét.
- A beszélgetés ezen részében Dustin világmodell-kapcsolatait, a Flux család teljes genealógiáját és a helyi futtathatóság realitásait tárgyalják – a 3. rész várhatóan a következő nagy release és a jövő felé vezet tovább.

## Jövőbeli aspirációk és záró gondolatok

### Dustin két fő jövőbeli területe

**1. Valóban multimodális, hosszú kontextusú modellek**
- A jelenlegi világ: agensek hívják a generatív modelleket külön-külön
- A jövő: egyetlen modell, amely **szövegben, vizuálisan és hangban is gondolkodik**
- Teljes kontextus: "nem kell megadnod a referenciát, nem kell megadnod a megfelelő promptot — a modell már tudja az elmúlt hetek összes kontextusát"
- Folyamatos térben dolgozik, nem külön hívásokként
- **"Think visually"** — a modell nem csak generál képet, hanem vizuálisan is érvel

**2. Valós idejű interakciók**
- Valós idejű videó, hang, duplex interakciók
- Korai példák: Genie (játék generálás valós időben)
- **Robotika alkalmazás:** a modély valós időben fogadja a valós világ inputját és döntéseket hoz
- "Nagyon korai szakaszban vagyunk, de nagyon izgalmas"

### Zárás
- Chris és Daniel köszönik Dustint
- Dustin: "Nagyon köszönöm, srácok, hogy meghívtatok"
- Utalás arra, hogy lesz folytatás: "vannak dolgok készülőben, várom a következő beszélgetést"