Practical AI: Building Durable AI Agents¶
Podcast: Practical AI (Machine Learning, Data Science, LLM) Epizód: Building Durable AI Agents Dátum: 2026-07-09 Vendég: Hamza Tahir (Zen ML → Kitaroo) Házigazda: Daniel Witek (Prediction Guard) Forrás: https://share.transistor.fm/s/facb92e2 Media: https://media.transistor.fm/facb92e2/33d1bc96.mp3
Tartós (durable) AI ágensek építése — Practical AI podcast, 1. rész (1/2)¶
Podcast: Practical AI — Machine Learning, Data Science, LLM Epizód: Building Durable AI Agents Dátum: 2026.07.09. Vendég: Hamza Tahir (a Zen ML társalapítója, jelenleg a Kitaroo projekt vezetője) Házigazda: Daniel Witek (a Prediction Guard CEO-ja)
1. Bevezető és a vendég háttere¶
- Hamza Tahir öt évvel ezelőtt társalapította a Zen ML-t, akkor, amikor az MLOps a csúcspontján volt.
- A Zen ML egy belső keretrendszerből nőtte ki magát, amely DAX-szerű (Directed Acyclic Graph) munkafolyamatokat tudott különböző számítási backendekre telepíteni — ez jól jött Németországban, ahol az ML-modelleket sokféle infrastruktúrán kellett futtatni.
- A cég nyílt forráskódú lett, korai projekteket és bevételt szerzett, tőkebevonást kapott.
- A beszélgetés időzítése egybeesik az AI Engineers World's Fair rendezvénnyel San Franciscóban (Moscone Center, kb. 7000 résztvevő).
„In MLOps, it was like DevOps reinventing itself. And with agents, it's like MLOps reinventing itself.” — Hamza Tahir
2. MLOps → AgentOps: a párhuzamok¶
- Az agent-forradalom közepén a Zen ML felismerte, hogy a termelési ML-alkalmazásoknál tanult alapelvek (biztonságos, megbízható, újrapróbálkozó, nem-determinisztikus kód futtatása) újra felszínre kerülnek az agent-világban.
- A DAG-alapú munkafolyamatok (load data → preprocess → train → evaluate) determinisztikusak és jól strukturálhatók voltak — de az agenteknél a ciklikusság, az elágazások és az állapotkezelés miatt ez a modell csődöt mond.
„All software is essentially a graph… the acyclic part gets very tricky because it cycles all the way down.”
- A Zen ML 2023-ban vezette be a „dynamic mode”-ot, miután a felhasználók elkezdték feltörni a pipeline-motorjukat agentek futtatására.
„Everything is an agent, in my opinion, is just an unrolled graph. So it's like LLM call, tool call, LLM call, tool call.”
3. Lokális → felhő: a tartósság (durability) kérdése¶
- A legtöbb ember ma még mindig lokális agent-példányokban gondolkodik (pl. Claude Code, Hermes), ezért a tartósság kérdése kevésbé tűnik égetőnek.
- Azonban amint az ágensek kikerülnek a sandboxokba és a vállalati felhőbe, a megbízhatóság, az újrapróbálkozás és az állapot-visszaállítás (recovery from failure) kritikus üzleti kérdéssé válik.
- Hamza szerint a jövő egy „digitális munkaerő” (digital workforce): ágensek, amelyek a vállalat infrastruktúráján belül cselekszenek, nem egy adott fejlesztő laptopjához kötve.
„I have the feeling that as infrastructure gets more and more mature and architectural practices get more mature, we can't really predict how much volume of agents would be running once they're not running locally.”
- Amint leválik a „laptop járma”, a skála elvileg korlátlan lehet — akár százezer párhuzamos agent-végrehajtás is (token-költség kérdése persze marad).
4. Mit jelent a „harness”?¶
A beszélgetés egyik legfontosabb fogalmi tisztázása:
- LLM-modell = kizárólag tokengenerátor, önmagában nem cselekszik.
- Strukturált kimenetek és tool calling = szabályrendszer, amely meghatározza, milyen típusú tokeneket generálhat a modell a következő akció előrejelzéséhez.
- Harness = az a szoftver, amely:
- a while-loopban a tokeneket valódi tool-hívásokká alakítja,
- kezeli a kontextus-ablak tömörítését (compaction),
- ellenőrzi a tool-paraméterek helyességét,
- indexeli a memóriát.
- Az agent = harness + modell kombinációjának eredménye.
„It's basically the thing that gives your brain hands, like a body. So your brain is just spewing out tokens and you're converting those tokens into actions.”
- Hamza definícióját 2026. júliusára datálja („I will obviously be very embarrassed in a year when I'm listening back to this”), de a „brain + body” metafora Jeffrey (Nous Research) részéről is elhangzott korábban.
5. A harness–modell csatolás (coupling) jelensége¶
- A modell-teljesítmény aszimptotikussá vált; a szolgáltatók rájöttek, hogy jobb programmal (jobb harness-szel) jobb általános eredmény érhető el, miközben a modell statikus marad.
- Példa: a Claude Code az Opus 4.8-ra van hangolva. Az Opus 4.8 (az Opus 3.5-tel ellentétben) „tudja”, hogy Claude Code-on belül fut, így a tool-hívásai pontosabbak.
- Ha egy másik modellt (pl. GPT 5.5) tennénk a Claude Code harness-be, az eredmény romlana, mert a kettő reinforcement learning útján összecsatolódott.
„Cloud code is the harness and underlying it is Opus 4.8… The harness with the reinforcement learning loop that has gone on for the last year and a half has coupled deeply with the models.”
6. Nyílt vs. zárt harness: iparági feszültség¶
| Megközelítés | Képviselők | Érvelés |
|---|---|---|
| Zárt / coupled harness | Claude Code + Opus 4.8 | „Működik” — miért cserélnéd le? |
| Nyílt / modell-független harness | Pi, LenGraph, Pydantic-AI | Nem akarunk egyetlen modell-szolgáltatóhoz kötődni (pl. kormányzati kitiltások kockázata). |
- Hamza személyes megérzése: a nyílt szabvány fog győzni, de ez még nem dőlt el.
- Eközben a nagy szoftver-szállítók (NetSuite, Salesforce) kétfrontos háborút vívnak:
- egyrészt MCP-integrációt kínálnak, hogy agent-ek érik el a platformot,
- másrészt saját, zárt agent-réteget építenek a webes UI-jukba, ami nem cserélhető.
„The brain ultimately is commoditized. It's like electricity. So what else are you going to make the next whatever trillion dollars on? And that's the whole stack.”
7. Az „always-on” forradalom (2025 decembere)¶
- A Pi és az OpenClaw megjelenésével az agentek elkezdtek folyamatosan futni (heartbeat, állandó memóriakezelés).
- A kulcslépés nem a modellben, hanem a „program jobb megírásában” volt: Peter Steinberger, Mario és Armin új megközelítést hoztak a kontextus- és memóriakezelésben.
- Ez egybeesett azzal, hogy az agentek kikerültek a „lokális gép” világából — a következő lépcső a Kubernetes-szerű, felhőbeli futtatás.
„This revolution is happening December, 2025, we come into this era of suddenly this works.”
8. Hol tart ma a termelési agent-telepítés?¶
- A vállalatoknál valós multi-agent („fleet / swarm”) architektúrák működnek, nem csak kutatási projektek.
- Különböző agent-munkaterhelések más-más infrastruktúrát igényelnek:
- Chatbot / voice agent — egyszerű, a modell-szolgáltatók (pl. Anthropic managed agents) kezelik.
- Személyi asszisztens / deep research — mindig fut, hosszú távú állapotkezelés.
- Üzleti folyamat (business process-y) agent — fetch → LLM-loop → post-process; ezt már érdemes saját platformon futtatni.
„I highly encourage people who are scaling beyond single teams to really invest in [an agent platform] — similar to MLOps, where the people who build the best MLOps platforms like Uber, they won their markets.”
9. Kulcsmegállapítások és idézetek¶
- A Zen ML tanulsága: a munkafolyamat-elv (workflow thinking) nem tűnt el, csak átalakult — az agent = „kibontott gráf”.
- A tartósság (durability) nem lokális, hanem felhő-méretű probléma: state management, retry, replay.
- A coupling (harness + modell összenövése) teljesítményelőny, de lock-in kockázat.
- A „brain = commodity” szemlélet a teljes stack-et (MCP, platform, integráció) tolja értékteremtésbe.
„We just needed to make our system more capable of having graphs that are defined in real time versus statically compiled at the beginning.” — Hamza Tahir
Reklámszünet a részben: Framer (framer.com/practicalai) — agent-ek integrálása weboldal-platformba.
A 2. rész a „fragility” kategóriákat, a konkrét megoldási mintákat (state, retry, replay) és a Kitaroo platform részleteit tárgyalja.
Practical AI — „Building Durable AI Agents” — 2/2. rész (összefoglaló)¶
Podcast: Practical AI — Machine Learning, Data Science, LLM Dátum: 2026-07-09 Vendég: Hamza (a ZenML / Kidaroo csapatától) Téma: Tartós, élesben is megbízható AI agentek építése — a 2. (záró) rész az infrastruktúra-, harness- és jövőkép-kérdésekről.
Megjegyzés: az automatikus átiratban (ASR) több márkanév eltorzult (pl. „Minimax”, „GLM”, „Kimi”, „Pi”, „OpenCode”, „pedantic AI”, „land graph” — valószínűleg Pydantic AI, LangGraph, MiniMax, Qwen/GLM, Py, OpenCode). Az összefoglaló az eredeti szövegalakot idézi, ahol az átiratból egyértelmű, hogy mire gondol a beszélő.
1. Miért éri meg a vállalatoknak házon belül építeni?¶
- Aki házon belül fejleszt egy platformot az agentek futtatására, az cselekvés közben tanulja meg, mi működik a saját üzleti kontextusában — ez sokkal többet ad, mint egy dobozos megoldás.
- Ennek ára: a csapatoknak „agentic frameworköt” kell választaniuk (pl. LangGraph, Pydantic AI stb.), és el kell végezniük a deploymentet, az üzemeltetést, a megbízhatóság biztosítását.
2. Az architektúra fokozatosan növekszik a komplexitásban¶
Hamza lépésről lépésre írja le, hogyan jut el az ember egy „REST API + agent” ötlettől egy éles, hibatűrő rendszerig:
- Harness kiválasztása + deploy (pl. ECS-en vagy Kubernetes clusterön). Eredmény: van egy REST API, ami kickoffol egy agentet.
- REST ≠ állapotmentes gyors hívás. Az agentek hosszú, stateful folyamatok — nem futhatnak in-process. Innen jönnek a workerek és task queue-k.
- Pull vs. push queue kérdése, üzenetbróker beiktatása a FastAPI-szerver és a workerek közé. Az eseményeket tartósan, durable módon kell tárolni, hogy a worker újraindulásakor ne vesszenek el.
- Többlépéses workflow-k megjelenése — a feladatok már nem egy, hanem kettő (vagy több) lépésből állnak, és a lépéseknek függőségeik vannak. → DAG-alapú workflow-orchestration kell.
- In-flight frissítések problémája: mi van, ha egy 30 napig futó agent közben a kód már megváltozott? A régi agent fusson a régi kóddal, vagy az újjal? És mi van, ha közben a modell-szolgáltatót betiltják / kivezetik a modellt?
- Idempotencia, megfigyelhetőség (observability), sandboxolás — a kódot végrehajtó agenteknek sandbox kell (pl. E2B, Daytona, Modal). Ha a pod meghal, a 20 000. tool call után hol folytatjuk?
„You don't want your developers to be writing defensive code. You want them on the offense writing use cases.” — Hamza
3. A „több ezer lehetséges hangolás” problémája¶
- A harnessen belül rengeteg döntés van: tool call-ok időtúllépése, reranker használata, olcsóbb modell alkalmazása bizonyos lépésekre, supply-chain kockázat (modell hirtelen „kockázatosnak” minősül), stb.
- Ezek egy része infrastruktúra-oldali (hálózat, timeout), más része pure fejlesztői döntés a harness szintjén — a kettő összefonódik.
- Daniel példája: „coding factory” — szoftverfejlesztést automatizáló ügynök. A kódot sandboxban futtatja; ha a futás félúton meghal, hogyan jutunk vissza a checkpoint-ig? Hogyan tudunk A/B kísérletet csinálni (pl. más modell, kevesebb tool call, más rendszerprompt)?
4. A rendszerprompt-módosítás félelme¶
- Hamza személyes vallomása: „I'm terrified updating my agent in production” — egy szó hozzáadása a system prompt-hoz ismeretlen hatású a sok futó, stateful execution fényében.
- Ha több százmillió agent fut élesben, a fejlesztőnek képtelenség minden lehetséges kontextus-állapotot végiggondolni. Kell: observability + időben visszatekintő introspekció + kísérletezés (szimuláció).
- Fizikai hasonlattal: az entrópia egy stateful, kaotikus rendszer; csak szimulációkkal és replay-jel lehet tanulni belőle.
5. Bevezető: mi a Kitaru (Kidaroo)?¶
- A Kitaru a ZenML-re épülő új SDK + UI. A ZenML 5 éve fut élesben enterprise workflow-orchestrationre.
- „A harness-től visszafelé” épül: a harness az agent-építés belépési pontja, és az ott hozott döntések az infrastruktúra-oldalon is megjelennek.
- Cél: nyílt runtime, ami bármilyen harness-t képes futtatni anélkül, hogy a fejlesztőnek manuálisan kellene a fenti problémákat megoldania.
- Adapterek a népszerű harness-ekhez: Anthropic Agents SDK, OpenAI Agents SDK — bedobod a Kitaru-t runtime-nak, és viszi a kódot a laptopról a productionbe.
Mit nyújt a Kitaru?¶
- Resilience tool call-hibák közben: a state-et külső DB / blob storage-ban tárolja, így ha a loop közben meghal, onnan folytatható.
- Checkpoint + replay: a harness bizonyos pontjainál snapshot-ot készít, és ezekből a checkpointokból vissza lehet „tekerni” egy futást.
- Mock tool calls + modellcsere a trace közepén: „mi lett volna, ha a 15. lépésben GLM-et használunk GPT helyett?”
- Fontos tudományos korlát: ha menet közben cserélünk modellt, nem garantált, hogy az új modell egyáltalán eljutott volna ugyanoda — tehát a „mi lett volna” kísérlet eleve törött. Ettől függetlenül, kellő mintamérettel, termelési trace-ekből már látható, hol érdemes kisebb/nyílt modellre váltani.
6. Optimalizálás: whack-a-mole, nem lineáris¶
- A manufacturing-párhuzam (Daniel): mindig van egy szűk keresztmetszet, de ha megoldjuk, új jön a helyébe — és a változtatások gyakran csatoltak.
- Hamza gyakorlati receptje:
- Checkpointolj mindent (ez a „durability” — legyen visszatekintés).
- Első lépésként szűrd a legdrágább, de sikeres trace-eket egy hét termelési futás után, és nézd meg, hol a szűk keresztmetszet.
- Azonosítsd a tipikus failure mode-okat, és ott optimalizálj.
- A jövőkép: ne emberek csinálják ezt a manuális elemzést. A Kitaru MCP CLI-t is szállít day-one, hogy más agentek zárhassák a hurkot: „agent-tanár / agent-tréner” agent, ami figyeli a futásokat, kísérleteket futtat a háttérben, és automatikusan szerkeszti a konfigurációt. Ez ma még „dream” — kell hozzá több tooling és infrastruktúra.
„My ultimate goal is you have, every time you launch an agent, you have a companion — a trainer — that's constantly looking at, okay, what is this guy doing wrong? And then running experiments in the back, replaying things and constantly editing that thing.”
7. Jövőkép: Hamza két oldala¶
Aggodalom: a stack káosza¶
- Az AI-engineering most ott tart, ahol az MLOps 2021-ben (Chip Huyen cikkére hivatkozik): eszközrobbanás, befektetői pénz, és a vásárló nem tudja, mi a „modern stack”.
- A modell-szolgáltatók túl agresszívan tolják bele magukat a harness-rétegbe, és ezzel a saját infrastruktúrájukra akarják kényszeríteni az ügyfeleket — ez rontja az interoperabilitást és enyhe negatív gazdasági hatással bír.
- A canonical szétválasztás (harness ↔ infrastruktúra ↔ deployment paradigmák) még nagyon korai szakaszban van.
Optimizmus: a token-árak zuhanása és a nyílt modellek¶
- Nyílt modellek nagyot léptek: a GLM „kb. 95%-a az Opus 4.8-nak” — „ez két hetes” — és ez „phenomenal”. (Az átirat szerinti „Minimax” és „Kimi” említések is a nyílt modellek családjába tartoznak a szövegkörnyezet alapján.)
- Emellett Mistral (EU) is a példa.
- Ha a nyílt modellek teljesítménye megközelíti a zártakét, a vállalatok komolyan el tudnak szakadni a nagy szolgáltatóktól → belső rendszermérnöki csapatok fognak a harness + durable runtime kérdéseivel foglalkozni.
- A nyílt harness-ek (pl. Pi, OpenCode, vagy vertical-specifikus harness-ek jogra, tudományra stb.) robbanásszerű növekedés előtt állnak.
- A vízió: „a tokenek ára az elektromosság árára esik vissza, a modellek commoditizálódnak” — ilyen világban a vállalati belső platform építése lesz a versenyelőny.
8. Daniel záró ajánlója a hallgatóknak¶
- Nézd meg a ZenML oldalát és a nyílt harness-integrációkat.
- „Soha nem volt ennyire egyszerű saját eszközöket és infrastruktúrát felhúzni és kísérletezni.”
- A show linkjei a show notes-ban.
9. A műsor zárása¶
- Műsorvezető: Daniel (Practical AI).
- A műsort a Prediction Guard támogatja (predictionguard.com), a zenét Breakmaster Cylinder szolgáltatja.
- Közösségi csatornák: practicalai.fm, LinkedIn, X, BlueSky.
Kulcs-idézetek (angolul, ahogy elhangzottak)¶
- „You don't want your developers to be writing defensive code. You want them on the offense writing use cases.”
- „I'm terrified updating my agent in production. I'm terrified because I have literally no idea … how I can even add a word to the system prompt, what would happen.”
- „Run it for a week. And then after a week, just filter for the most expensive traces, which were successful … and figure out the common failure modes, and then go from there.”
- „We're at this fever pitch of … MLOps in 2021 … figuring out the modern MLOps stack.”
- „In a world where you can have sort of the same performance with open models, … people will start realizing that actually investing in internal infrastructure at the enterprise level is probably going to be the competitive differentiator in a world where the tokens regress down to the cost of electricity and the models become commoditized.”
Fő fogalmak / kulcsszavak¶
durable runtime · harness (pl. LangGraph, Pydantic AI, Anthropic Agents SDK, OpenAI Agents SDK) · workflow orchestration · DAG · checkpoint + replay · idempotencia · observability · sandbox (E2B, Daytona, Modal) · task queue / message broker · Kubernetes / ECS · FastAPI · supply-chain risk · coding factory · MCP CLI · agent-tanár (companion agent) · ZenML · Kitaru (Kidaroo) · open-source modellek · commoditizálódás · MLOps 2021 párhuzam