Kihagyás

Practical AI: Image Generation and Visual Intelligence with Black Forest Labs — Ep. 362

Dátum: 2026-07-02
Vendég: Dustin Podell (Co-Founder, Researcher, Black Forest Labs)
Műsorvezetők: Chris Benson, Daniel Whitenack
Forrás: share.transistor.fm
Média: MP3
Hossz: 48:21
Transcript: Transistor.fm (nem Whisper)


Practical AI – Képgenerálás és Vizuális Intelligencia a Black Forest Labs-szal

Epizód: 362 — Image Generation and Visual Intelligence with Black Forest Labs Dátum: 2026-07-02 Vendég: Dustin Podell — társalapító és kutató, Black Forest Labs Házigazdák: Daniel Whitenack (CEO, Prediction Guard) és Chris Benson (Principal AI & Autonomy Research Engineer) Összefoglaló rész: 1/3 (1. rész)


Bevezetés és háttér

  • A Practical AI podcast most YouTube-videókat is közzétesz, ami különösen hasznos a vizuális témájú epizódoknál.
  • A vendég Dustin Podell, a Black Forest Labs társalapítója és kutatója — egy olyan cég, amely nemcsak nyers képgenerálással foglalkozik, hanem munkafolyamatokkal, hardveroptimalizálással és sok más területtel is.
  • Az epizód célja: átfogó kép adni a képgenerálás és a generatív modellek jelenlegi iparági állapotáról, az elmúlt néhány év fejlődésének bemutatásával.

"For an audio podcast, we're gonna talk about a lot of interesting visual things." — Daniel Whitenack


A képgenerálás állása — hol tartunk most?

Dustin egy kis történelmi visszatekintésből indul ki:

  • ~4 éve: A modellek alig tudtak többet, mint elmosódott színfoltokat előállítani, amelyek csak halványan kapcsolódtak a prompthoz (pl. "világítótorony a parton").
  • Ma: Teljes rövidfilmek készülnek entirely AI-generációval, bizonyos jelenetek szinte megkülönböztethetetlenek a valóságtól.
  • Ugyanakkor a technológia magja nem változott túlságosan — folyamatos, előrehaladó fejlődés történt, nem forradalmi ugrás.

"We've come quite far, but the core of the technology hasn't actually changed that much." — Dustin Podell

Chris megjegyzi, hogy a nagyközönség figyelme nagyrészt az LLM-ek felé irányult, így sokan lemaradtak a képgenerálás terén elért hatalmas előrelépésekről.


A technológia alapjai: Transformer és Diffúzió

Transformer (2017)

  • 2017-ben a Google kutatói fejlesztették ki a transformer architektúrát.
  • Ez az alapja az autoregresszív nyelvi modelleknek — az adatot darabonként, egy elemenként predikálják.

Diffúziós modellek — hogyan működnek?

Dustin rendkívül világosan elmagyarázza a diffúziós folyamatot:

  1. Folytonos közeg: A világ folytonos — színek, formák, fény. A képet digitális térbe kódolják (RGB, 256 érték/csatorna).
  2. Információeltávolítás zajjal: Ahelyett, hogy pixelenként predikálnának (mint az autoregresszív modellek), a diffúzió zajt ad a tiszta képhez — először egy kicsit (még felismerhető), majd egyre többet, amíg a kép teljes zajjá nem válik.
  3. Tanítás: A modellt megtanítják, hogy a zajos képből predikálja a tiszta képet. Kis zajnál ez egyszerű (csak egy kis zajt kell eltávolítani); nagy zajnál a modellnek szinte a semmiből kell "kitöltenie" a képet.
  4. Inferencia (generálás): Indulás egy teljesen zajos képből → "kérlek, adj egy kutyát cilinderrel a parton" → a modell lépésről lépésre eltávolítja a zajt, először csak a durva struktúrát találja meg, majd fokozatosan élesedik a kép, végül egy teljesen generált kép jelenik meg.

"Fundamentally, it's doing the exact same process of removing this information slowly with this noise, and then just slowly going the other direction, essentially creating info to infill." — Dustin Podell

Chris dicséri a magyarázatot: "Probably the best one that I've heard."

Fontos: ez a folyamat ma is ugyanez

A régi DALL·E mini / korai Stable Diffusion modellektől a mai 10 másodperces videógeneráló modellekig alapvetően ugyanaz a folyamat zajlik: zaj hozzáadása tanításkor, zaj eltávolítása generáláskor.


A jelenlegi state-of-the-art (SOTA)

Dustin három kategóriába osztja a folytonos közegeket:

  • Kép — a legismertebb folytonos közeg
  • Videó — a kép + idődimenzió
  • Hang — sok videómodell már hangot is generál; emellett zenemodellek (pl. Suno) is használják ugyanezt a technikát

"Legjobb" modell — nehéz definiálni

  • A "legjobb" fogalma szubjektív: a felhasználók különböző dolgokat várnak el (prompting, képreferenciák, kreatív társ stb.).
  • Az LLM-eknél világosabbak a metrikák (programozás, matematika); a kreatív modelleknél általában preferencia-alapú benchmarkok (leaderboards) dominálnak, ahol mindenki szavazhat — de ez elveszi a specificitást/granularitást.

Konkrét ajánlások:

  • Text-to-video SOTA: Seedance 2 — 4K felbontás, 15 másodperces generációk, erősen filmes fókuszú. Kiemelkedő munka az elmúlt évben.
  • Sora 2: Dustin szerint is szép modell, bár a leaderboardokon nem rangsorolt olyan magasra; elismerő szavakat küld a Sora csapatnak.

Flow Matching — a diffúzió továbbfejlesztése

Chris rákérdez, hogy a mai modellek hagyományos diffúziós modellek-e, vagy a korábban említett flow matching eljárást használják.

Átmenet: diffúzió → flow matching

  • Minden modell ugyanazt a folyamatot csinálja: zaj hozzáadása, majd a modell tanítása a zaj eltávolítására.
  • A különbség a felszín alatti tanulásban van.
  • A korábbi diffúziós folyamatot megtisztították és flow matching-gé alakították.

Dustin papírrepülő-analógiája (kiváló audio-barát magyarázat):

  1. Képzelj el egy térképet a városodról, felülről (égből) nézve. A házad a térkép közepén van.
  2. Mindenhol szél fúj a területen.
  3. A cél: bárhonnan dobj egy papírrepülőt, és a szél vigye a házadhoz.
  4. A valóságban ez egy hiperdimenziós térben történik:
  5. A "házad" = a valódi képek manifoldja (a latent space azon pontja, ahol valós képek vannak).
  6. A "város többi része" = minden nem-valódi kép (azaz zaj — a zaj is RGB-értékekkel rendelkezik, menthető a gépre, de nem "valódi" kép).
  7. A koordináták nem 2D (x, y), hanem annyi dimenziós, amennyi a kép összes színértékének kódolásához kell.
  8. A flow matching lényege: a modell egy flow map-et (áramlási/iránytérképet) tanul meg, amely bármely zajpontból elvisz a valódi képek manifoldja felé.
  9. Ahogy közeledsz a manifoldhoz, a kép egyre "valósabbá" válik — először elmosódott, majd élesebb. Amikor eléred a manifoldot: boom, kész a (remélhetőleg valós) kép.

"We're training this flow map so that we can land anywhere in this field of noise. And then these flows, these winds, when you take a step, will take you closer to your house — to the manifold of real images." — Dustin Podell

Miért jobb a flow matching?

  • Lehetővé teszi a kevésbé véletlenszerű, célzottabb utat a zajtól a valódi képig.
  • Az elmúlt 3-4 év fejlődése nagyrészt optimalizációkból (tanításban és modellarchitektúrában) származik.
  • De a fundamentális folyamat (információ eltávolítása + újratalálása) változatlan.

"It's just like the car — you've been having cars go down the road since the 1950s, and we've made better engines and better safety, but you're still driving down the road." — Dustin Podell


A gyakorlati alkalmazás felé — "Vizuális Intelligencia"

Az összefoglaló végén a házigazdák egy fontos fordulóponthoz érnek:

  • A képgeneráló modellek már mindennapi életbe is beágyazódtak (pl. szöveges üzenetküldő appokban azonnali kép-remixelés).
  • Sok hallgató azonban még mindig az "asztronauta lovon" típusú játékos példáknál tart, ami nem tűnik praktikusnak.
  • Daniel felhívja a figyelmet a Black Forest Labs weboldalán használt "Visual Intelligence" kifejezésre — ez már túlmutat a puszta képgeneráláson, és a nyelv/agent/intelligencia irányába mutat.

"I love that statement because it gets to more like language... it is very [practical]." — Daniel Whitenack

Ez a rész végén nyitva hagyott kérdés, amely a következő rész (2. rész) tárgya lesz.


Szponzor/side-note: Midwest AI Summit 2026

  • 2026. október 15., Indianapolis — Midwest AI Summit
  • Kiemelkedő esemény: valódi AI Engineering Lounge, ahol tapasztalt mérnökökkel lehet use-case-eket átbeszélni.
  • Tavalyi előadók között volt pl. Rajeev Shah (a podcast korábbi vendége).
  • Regisztráció: midwestaisummit.com, 20% kedvezmény a Practical AI 20 kóddal.

1. rész — Kulcstémák összefoglalva

Téma Tartalom
Fejlődés áttekintése 4 év alatt színfoltoktól a valósághű rövidfilmekig
Transformer (2017) Autoregresszív, darabonkénti predikció — az LLM-ek alapja
Diffúzió mechanizmusa Zaj hozzáadása → modell tanítása zaj eltávolítására → inferencia: zajtól valódig
Folytonos közegek Kép, videó, hang — mind ugyanazt a technikát használják
SOTA modellek Seedance 2 (text-to-video, 4K, 15s); Sora 2 (elismerésre méltó)
Flow matching A diffúzió megtisztított változata — flow map tanulása a hiperdimenziós térben
Papírrepülő-analógia Ház = valódi képek manifoldja; szél = flow; papírrepülő = generált minta
Optimalizáció A fejlődés architektúrából + tanítási optimalizációkból jön, a alapfolyamat változatlan
Vizuális Intelligencia A képgenerálás túllép a játékon — nyelv, agentek, gyakorlati alkalmazások felé (2. rész témája)

Practical AI – Képgenerálás és Vizuális Intelligencia a Black Forest Labsszal (2/3. rész)

Epizód: 362 – Image Generation and Visual Intelligence with Black Forest Labs Dátum: 2026-07-02 Vendég: Dustin Podell (Co-Founder, Black Forest Labs) Összefoglaló témája: A vizuális intelligencia gyakorlati alkalmazásai, a Flux modellcsalád bemutatása, helyi futtatás (laptop), és a világmodellek kapcsolata a robotikával.


1. A vizuális intelligencia gyakorlati alkalmazásai

A beszélgetés ezen szakaszában Dustin a „promptról képre” egyszerű generálástól a kontextus-alapú szerkesztés és vizuális intelligencia felé történő átmenetet vázolja fel.

1.1 Az idővonal és a kontextus-szerkesztés megjelenése

  • Korai modellek: prompt be, kép/videó dal ki – főleg alkotók, reklámügynökségek, filmesek számára vonzó.
  • Körülbelül egy éve megjelent a FluxContext nevű in-context szerkesztő modell.
  • A szerkesztés felszínen „kreatív” funkció, de a motorháztető alatt a modellnek értenie kell a világ relációit és fizikáját.
  • Példa: „Döntsd fel a vizespoharat és mutasd, mi történik” – a modellnek tudnia kell, hogy a víz kiömlik, valami nedves lesz, stb.
  • Ez a képesség a videómodelleknél is megjelenik: egy kiindulási képből olyan jelenet generálható, ahol egy személy tűzoltóval eloltja a tüzet – ehhez a modell szimulálja a világ egy részét.

1.2 Világmodellek és robotika

  • Dustin óvatosan használja a „világmodell” kifejezést (szerinte túlhasznált), de elismeri: a nagy léptékben, robusztusan tanított modellek lényegében a világ reprezentációját építik fel.
  • A műsort vezető Daniel (robotika / megtestékelt intelligencia háttérrel) rákérdez, hogy a vizuális modellek és a robotikai világmodellek mennyire azonosak-e.
  • Dustin válasza: „nagyon összefüggnek” – a modell a világ fizikai tulajdonságait és relációit tanulja meg, ami kiváló alap a robotika betanításához.
  • A kreatív oldal nem kerül háttérbe, de a világ-reprezentáció cselekvés-alapú felhasználásra (pl. robotok) is nyit utat.

„Fundamentally, this is what these models are doing when you train them at scale... they need to be able to simulate parts of the world to get an output.”

1.3 Konkrét gyakorlati felhasználási módok

  • Termékfotózás: FluxContext segítségével egy termékképből profi stúdiófotó készíthető.
  • Ruhapróbálás (virtual try-on): „itt vagyok én, itt a ruha – mutasd, hogy néz ki.”
  • Lakberendezés: bútorok (kanapék, elemek) vizualizálása a saját térben.
  • Tűzoltási forgatókönyv (hackathon-példa): tűzlépcső-fotókból generálták, hogyan nézne ki a tömeg menekülése vészhelyzetben – tömeg elhelyezkedésének becslésére használták. (Dustin: „érdekes, de sószemmel kell kezelni, mert generált komponens van benne.”)

2. A Flux modellcsalád – áttekintés

A Black Forest Labs alapvetően kutatólaborként tekint magára: minden kiadással egy konkrét képességet akarnak emelni, nem csak általános javítást végezni.

2.1 Flux1-család (~2 éve)

A cég alapítása utáni ~4–5 hónapos sprint eredménye. Három változat:

Modell Jellemző
Flux1 Pro API-n keresztül elérhető, profi minőség
Flux1 Dev kereskedelmileg licencelhető, nyílt súlyokkal
Flux1 Schnell nagy sebességű, lépés-desztillált, teljesen nyílt (MIT/Apache)

2.2 Tools-széria és FluxContext

  • Több vezérlés iránti igény vezetett a Tools-szériához.
  • Ezzel párhuzamosan indult a kontextus-projekt, ami a FluxContext kiadásához vezetett – a nagy szerkesztő release.

2.3 Flux2-család

  • Nagy ugrás: nem csak T2I, hanem többképes szerkesztés (omni-edit) is.
  • Több ember, több tárgy, bonyolult relációk megadhatók.
  • Itt jelentek meg a hirdetési-use-case-eken túlmutató, érdekesebb alkalmazások (pl. a tűzlépcsős forgatókönyv).
  • Flux2 egy 32B-s modell volt – „elég darabos”, nagyobb gépen helyileg futtatható, de lassú.

2.4 Klein-széria és Klein KV

  • Méretdesztilláció: a lehető legnagyobb teljesítmény kis modellbe csomagolva.
  • Text-to-image és szerkesztő modell; nagyon gyors; a Flux1-nél is kisebb.
  • Cél: a helyi futtatók (open-weight felhasználók) is kapjanak valamit erős és gyors modellt.
  • Klein KV: bevezette a KV-cachinget (az LLM-világból ismert optimalizációs technikát) a szerkesztési világba → nagyon nagy gyorsulás helyi szerkesztésnél.

2.5 SelfFlow és a következő nagy kiadás

  • Egy kutatási blog megjelent a SelfFlow nevű projektről (Dustin is szerző, de nem vezető – a vezető szerző „incredible”).
  • A következő nagy release-t „később nyáron” várják, és Dustin nagyon izgatott, de konkrétumokat nem mond.

3. Futtatható-e a modellem a laptopomon?

  • A műsorvezető (Daniel) megkérdezi, hogy ésszerű-e ma már egy modellt laptopon futtatni jó minőségű képhez.
  • Dustin: az LLM-világban sokkal többen dolgoznak ezen a skálázási tengelyen (fel-le), mint a vizuális oldalon.
  • Klein sorozat: „99%-ban biztos”, hogy fut egy modern M-szériás MacBook Pro-n. Konkrét sebességadatokat nem tud idézni (nem tesztelte személyesen).
  • Mindig kompromisszum: teljesítmény vs. méret/sebesség.
  • Flux2 = 32B, darabos, lassabb helyileg → ezért jött a Klein.
  • A Flux1-nél a Schnell, a Flux2-nél a Klein volt a kis/gyors válasz.
  • A cél: minden kiadásnál először egy nagy, büszke teljesítményű modell, majd visszahozni kis, gyors skálára.

„It's always a trade off because we wanna push performance and make something that we're really proud of, and then we wanna try to bring that again back into smaller, faster scale.”


Megjegyzések

  • Ez a rész egy szponzori blokkot is tartalmaz a Prediction Guard (predictionguard.com/practicalai) agentic AI kontrol-síkja köré – az AI-ügynökök governance-ére és biztonságára fókuszáló bevezetővel. Ez a tartalmi összefoglalás szempontjából mellékves, de jelezzük jelenlétét.
  • A beszélgetés ezen részében Dustin világmodell-kapcsolatait, a Flux család teljes genealógiáját és a helyi futtathatóság realitásait tárgyalják – a 3. rész várhatóan a következő nagy release és a jövő felé vezet tovább.

Jövőbeli aspirációk és záró gondolatok

Dustin két fő jövőbeli területe

1. Valóban multimodális, hosszú kontextusú modellek - A jelenlegi világ: agensek hívják a generatív modelleket külön-külön - A jövő: egyetlen modell, amely szövegben, vizuálisan és hangban is gondolkodik - Teljes kontextus: "nem kell megadnod a referenciát, nem kell megadnod a megfelelő promptot — a modell már tudja az elmúlt hetek összes kontextusát" - Folyamatos térben dolgozik, nem külön hívásokként - "Think visually" — a modell nem csak generál képet, hanem vizuálisan is érvel

2. Valós idejű interakciók - Valós idejű videó, hang, duplex interakciók - Korai példák: Genie (játék generálás valós időben) - Robotika alkalmazás: a modély valós időben fogadja a valós világ inputját és döntéseket hoz - "Nagyon korai szakaszban vagyunk, de nagyon izgalmas"

Zárás

  • Chris és Daniel köszönik Dustint
  • Dustin: "Nagyon köszönöm, srácok, hogy meghívtatok"
  • Utalás arra, hogy lesz folytatás: "vannak dolgok készülőben, várom a következő beszélgetést"
Vissza a tetejére