# 🐍 Stanford STORM: PhD-szintű kutatás percek alatt

**Dátum:** 2026-06-19
**Forrás:** Stanford STORM Research Project (NAACL 2024, Yijia Shao et al.) + GitHub repo (stanford-oval/storm, 28.5K⭐)

---

## Mi a STORM és miért fontos?

A STORM a *Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking* rövidítése — a Stanford Oval (Omni Lab for AI & Knowledge) 2024-es NAACL publikációja. Célja, hogy egy LLM a semmiből, emberi beavatkozás nélkül képes legyen Wikipedia-minőségű, hivatkozásokkal ellátott, hosszú cikket generálni. A kutatás központi kérdése: hogyan lehet a nyelvi modellek "tudáshiányát" (knowledge gap) pótolni anélkül, hogy a modellt finomhangolnánk vagy hatalmas, kézzel szerkesztett tudásbázist építenénk.

A rendszer filozófiája egyszerű: a cikkírás nem a mondatok megfogalmazásánál kezdődik, hanem a **kutatásnál**. Egy jó újságíró sem úgy ír cikket, hogy leül és elkezdi ontani a szöveget — előbb interjúkat készít, forrásokat olvas, vázlatot készít, és csak utána ír. A STORM ezt a munkafolyamatot formalizálta gépi szintre.

## Két fázis, nem egyben az egész

A STORM nem egyetlen nagy prompt, hanem egy explicit pipeline. Az első fázis a **pre-writing stage**: a modell aktívan kutat, webes kereséseket futtat, forrásokat gyűjt, és egyre pontosabb kérdéseket tesz fel a témáról. A végén egy részletes outline-t (vázlatot) állít elő, amelyben minden egyes állítás mögött legalább egy hivatkozás áll.

A második fázis a **writing stage**: az outline és az összegyűjtött források alapján a modell megírja a végleges cikket. Ez a fázis már "csak" szintézis — az értékes munka (kutatás, perspektívák feltárása, tényellenőrzés) már az első fázisban megtörtént. A két fázis szétválasztása azért kulcsfontosságú, mert ha egyszerre próbáljuk a kutatást és az írást, a modell hajlamos "képzelni" a tartalom kitöltéséhez — a STORM ezt a hibát strukturálisan kerüli el.

## Perspective-Guided Question Asking: nézőpontok automatikus felismerése

A STORM egyik legzseniálisabb trükkje, hogy nem csak "mondj többet a témáról" típusú kérdéseket tesz fel, hanem **különböző perspektívákat** azonosít, és mindegyikből külön kérdéssort generál. Ha például a "bitcoin" a téma, akkor a modell automatikusan felismeri, hogy vannak közgazdász, technológiai, szabályozási, történeti nézőpontok — és mindegyikből feltárja a legfontosabb kérdéseket.

Ez a megközelítés drasztikusan javítja a cikk **szélességét**: ahelyett, hogy egyetlen szempontból írná körül a témát, a modell több szálon halad egyszerre. A nézőpontokat a modell automatikusan generálja (nem kell kézzel megadni), és a kutatás során dinamikusan frissülnek — ha egy új perspektíva bukkan fel a forrásokban, az is beépül.

## Simulated Conversation: szimulált szakértői interjú

A másik kulcstechnika a **simulated conversation**: a STORM nem csak statikus kérdéslistát generál, hanem egy **szimulált beszélgetést** folytat egy "témaszakértővel" (ami valójában egy retrieval-augmented QA rendszer — vagyis a modell a weben keres, és az eredmények alapján "válaszol" a saját kérdéseire).

Ennek az az előnye, hogy a modell **follow-up kérdéseket** tud feltenni: ha az első válaszban valami érdekeset talál, rákérdezhet, pontosíthat, mélyíthet. Ez az iteratív mélyülés sokkal természetesebb, mint ha egyszerre akarnánk minden részletet kideríteni. A valódi kutatók is így dolgoznak: az első olvasás után jönnek a "várj, de mi van akkor, ha…" típusú kérdések.

## Mért eredmények: mit javít ténylegesen a STORM?

A NAACL 2024-es publikációban a szerzők konkrét számokat közöltek: a STORM **25%-os abszolút javulást** ér el a generált cikkek strukturáltságában, és **10%-os javulást** a tartalom szélességében a baseline-hoz képest. Ezeket tapasztalt Wikipedia-szerkesztők értékelték — vagyis nem gépi benchmark, hanem valódi szakértői vélemény.

A kutatás egyik legérdekesebb megállapítása, hogy a szerkesztők különösen a **pre-writing stage**-t találták hasznosnak — az outline-t és a forrásgyűjtést akkor is értékesnek ítélték, ha a végleges cikket végül kézzel írták meg. Ez arra utal, hogy a STORM nem csak végtermékként, hanem **kutatási asszisztensként** is értékes.

## A fő hiba: nem hallucináció, hanem "red herrings"

A STORM elemzésének egyik legtanulságosabb része a hibakatalógus. Ellentétben a legtöbb LLM-alapú rendszerrel, itt **a fő hiba nem a hallucináció** (kitalált tények), hanem az ún. **"red herrings"** — irreleváns vagy lazán kapcsolódó tartalom bekerülése a cikkbe, a fontos tények túlhangsúlyozása, vagy a hangsúlyok elcsúszása.

Ennek oka, hogy a STORM retrieval-alapú: a modell **valódi forrásokból** dolgozik, tehát nem talál ki dolgokat — de a források között nem mindig tud jól szelektálni, és hajlamos a felszínes kapcsolatokat is "érdekesnek" minősíteni. A tanulság: a retrieval minősége fontosabb, mint a generálás minősége. Ha rossz forrásokat adunk a modellnek, akkor a kimenet is rossz lesz — de legalább nem kitalált, hanem **valódi, de félrevezető** tartalom.

## Co-STORM: amikor az ember is részt vesz

Az EMNLP 2024-es follow-up, a **Co-STORM** (Collaborative STORM), a STORM-ot ember-AI kollaboratív rendszerré bővítette. Itt már nem egy LLM dolgozik egyedül, hanem egy **LLM "experts" + Moderator + Human user** hármasban működik együtt, egy explicit turn management policy alapján.

A Co-STORM legfontosabb újítása a **dinamikusan frissülő "mind map"** — egy hierarchikus fogalom-struktúra, amely valós időben követi a beszélgetés állapotát. Ahogy az ember kérdez, és a rendszer válaszol, a mind map automatikusan átrendeződik: az új információk beépülnek, a régiek háttérbe szorulnak, a struktúra áttekinthető marad. Ez különösen hosszú, mély beszélgetéseknél kritikus — a cél, hogy **csökkentse a mentális terhet**, amikor a diskurzus már több tucat lépésnél tart.

A Co-STORM gyakorlatilag egy "AI kutatási partner", akivel hangosan gondolkodhatunk: ő szolgáltatja a tényeket és a struktúrát, mi pedig irányítjuk a kérdésfeltevést és a prioritásokat.

## Technikai részletek: hogyan lehet kipróbálni?

A STORM nyílt forráskódú, és meglepően könnyen telepíthető. A Python csomag a PyPI-n érhető el: `pip install knowledge-storm`. A rendszer a **dspy** framework-re épül (Stanford másik népszerű LLM-programozási könyvtára), és a **litellm** integrációnak köszönhetően számos modellt támogat.

Az alapértelmezett konfiguráció GPT-3.5-öt használ a szimulált beszélgetéshez (olcsó, gyors) és GPT-4o-t a cikkíráshoz (drágább, de jobb minőségű). A search engine oldaláról a támogatott szolgáltatások listája imponáló: You.com, Bing, VectorRM, Serper, Brave, SearXNG, DuckDuckGo, Tavily, Google, Azure AI — gyakorlatilag bármilyen keresőmotorral működik.

A live demo a **storm.genie.stanford.edu** címen érhető el, és a cikk írásakor **70 000+ felhasználó** próbálta már ki — ez önmagában is jelzi, hogy a rendszer nem csak elméleti érdekesség, hanem valóban működő eszköz.

## Korlátok és nyitott kérdések

A STORM sem csodaszer — több nyilvánvaló korlátja is van. Először is, a rendszer **erősen függ a search engine-ek minőségétől**: ha a keresőmotorok elavult vagy alacsony minőségű találatokat adnak, a STORM kimenete is romlik. A "red herrings" probléma is innen ered: a retrieval a szűk keresztmetszet, nem a generálás.

Másodszor, a STORM jelenleg **angol nyelvre van optimalizálva**. A magyar (vagy más nem-angol) nyelvű cikkek generálásához a keresési találatokat és a forrásokat is lokalizálni kellene, és a hivatkozási kultúra is eltérő (más domain-ek, más szerkesztési normák). A módszer elvileg működik más nyelveken is, de a gyakorlati minőség egyelőre angolul a legjobb.

Harmadszor, a **költség és a sebesség** sem elhanyagolható: egy átlagos, ~10 szekciós cikk generálása a pre-writing stage-ben akár több tucat webes lekérést és LLM-hívást is igényelhet, ami percekig tarthat és dollárokba kerülhet (főleg, ha GPT-4o-t használunk). A Co-STORM ezen javít az emberi beavatkozással (a felhasználó irányíthatja a kutatást, és csak a releváns lépéseket kell végrehajtani), de alapvetően a STORM nem "ingyenes és azonnali" eszköz.

Végül, a STORM egy érdekes **episztemológiai kérdést** is felvet: ha egy cikk forrásait a modell maga gyűjti és maga szintetizálja, akkor ki a "szerző"? A STORM kimenete formailag hasonlít egy Wikipedia-szócikkre, de a szerkesztési folyamat nem transzparens — a felhasználó nem feltétlenül tudja követni, hogy a modell melyik forrásból mit vett át, és mi maradt ki. Ez a "fekete doboz" probléma különösen érzékeny területeken (orvoslás, jog, pénzügyek) lehet problematikus.

## Gyakorlati alkalmazási területek

A STORM-ot többféle kontextusban lehet használni. A legegyértelműbb a **Wikipédia-szerű tudásbázis-építés**: ahol gyorsan kell jól strukturált, hivatkozott tartalmat előállítani. A második a **kutatási asszisztensi szerep**: a Co-STORM ember-gép kollaborációban a modell a "kutató", az ember pedig az "igazgató", aki a hangsúlyokat és az irányt szabja meg.

Harmadik terület a **tudás-gyorstérképezés** (knowledge mapping): ha egy új témában kell gyorsan áttekintést kapni, a STORM kiválóan alkalmas arra, hogy percek alatt összerakjon egy vázlatot a legfontosabb szempontokkal, nézőpontokkal és hivatkozásokkal. A negyedik — kevésbé nyilvánvaló — felhasználás az **oktatás**: a STORM kitűnő eszköz arra, hogy egy diák vagy kutató megnézze, milyen nézőpontokat és kérdéseket kellene feltennie egy adott témáról, mielőtt nekiáll a saját kutatásának.

## Modell-agnosztikus módszertan: nem a Claude a lényeg

A STORM egyik legfontosabb tulajdonsága, hogy **modell-agnosztikus**: nem kötődik egyetlen konkrét LLM-hez. A kutatás eredetileg GPT-modellekre optimalizált, de a módszer (multi-perspective kérdésgenerálás + retrieval-augmented szimulált beszélgetés + outline-alapú írás) bármilyen nyelvi modellel működik, amelyik képes strukturált kérdéseket feltenni és kontextus-érzékeny válaszokat adni.

Ez azt jelenti, hogy a GLM-5.2 (és más hasonló modellek) is alkalmazhatják a STORM paradigmát — bár a minőség természetesen függ a modell képességeitől (kontextuskezelés, kérdésmegformázás, szintézis). A lényeg nem a modell, hanem a **módszer**: ha a pipeline-t jól építjük fel, a gyengébb modell is produkálhat erős eredményeket; ha a pipeline rossz, a legerősebb modell is csak drága hallucinátor lesz.

---

## Összegzés

A STORM legnagyobb tanulsága, hogy a hosszú, strukturált, hivatkozásokkal ellátott tartalom generálásának kulcsa nem a nagyobb modell, hanem a **jobb munkafolyamat**: kutatás először, írás utána, több perspektíva párhuzamosan, és iteratív mélyülés szimulált beszélgetéssel. A 25%-os strukturáltság-javulás és a Co-STORM ember-gép kollaboráció egyaránt azt mutatja, hogy a jövő nem a "még több paraméter", hanem a "még okosabb pipeline" irányába mutat — és ebben a STORM úttörő.
