Dream-RSI: Rekurzív önfejlesztés fejlődő világokon keresztül¶
Tanulmány: Dream-RSI: Recursive Self-Improvement through Evolving Worlds Szerzők: Tong Zheng (Google, UMD), Xidong Wu (Google), Zheng Zhang (Google), Zhankui He (Google DeepMind), Chaoyi Zhang, Benjamin Coleman (Google DeepMind), Ruoqiao Wei, Di Bai (Google DeepMind), Haolin Liu (UVA), Rui Liu (UMD), Xue Wang, Yue Zhuan, Wang-Cheng Kang (Google DeepMind), Renkai Xiang, Heng Huang (UMD), Xinwu Cheng, Yunsong Guo Intézmények: Google, University of Maryland College Park, Google DeepMind, University of Virginia Dátum: 2026-09-12 Oldalak: 36 (fő szöveg 12 oldal + appendix) Forrás: https://dream-rsi.com/assets/dream-rsi.pdf Kód: https://github.com/zhengkid/Dream-RSI Honlap: https://dream-rsi.com Kapcsolat: xidongwu@google.com, zzhangx@google.com Kinyerés:
pdftotext -layout(LaTeX/pdfTeX 1.40.29, 15 744 szó; a 24. oldal kód, ezértread_fileOCR-t kért, apdftotextviszont kiolvasta)
Bevezetés és a lényeg¶
A tanulmány a rekurzív önfejlesztés (RSI) egyik szűk keresztmetszetét oldja meg: azt, hogy az explorációs stratégia javítása drága és késleltetett. Az RSI alapmechanizmusa egy iteratív felfedezési hurok, ahol az agent jelölteket generál, kiértékeli az eredményeket, visszacsatolást épít be, és finomítja a következő iterációt. Ahogy az agent képességei nőnek és a célok nehezednek, a felfedezés egyre hosszabb horizontú keresést igényel hatalmas keresési terekben, gyakran több ezer javaslat-kiértékelés cikluson át.
Itt két probléma ütközik. A rögzített stratégiák nem tudnak alkalmazkodni, ahogy a keresési tér skálázódik. Az online policy-optimalizálás viszont hatalmas meta-keresési teret kell bejárjon, késleltetett és drága visszacsatolás mellett: egy explorációs policy kiértékeléséhez meg kell figyelni, hogyan alakítja a felfedezési folyamatot sok cikluson át.
A Dream-RSI kulcs-insightja meglepően egyszerű: egy befejezett felfedezési történet maga is szimulátor. A korábbi munkák a múltbeli felfedezési előzményt statikus szövegkontextusként vagy finomhangolási tanítóadatként kezelik. A Dream-RSI viszont felismeri, hogy egy befejezett folyamat strukturált fát rögzít a múltbeli döntésekről és azok tényleges kód-végrehajtási kimeneteiről. Ha ezt fává szervezzük, replay szimulátorként működik: egy alternatív stratégia bejárhatja ezt az előre rögzített fát, más részhalmazokat, más sorrendben, más párhuzamosítási csoportosítással.
Mivel minden végrehajtási eredmény már el van mentve a fában, egy új stratégia kiértékelése csak az előzmények olvasását igényli, az alapul szolgáló agent és kiértékelő újrafuttatása nélkül. Ez a meta-policy javítását drága online próba-szerencséből gyors, szimuláció-alapú „álmodozássá” alakítja.
A hat legfontosabb tanulság:
- A történet mint replay szimulátor. Egyetlen drága online futtatás több ezer olcsó, zéró-végrehajtási-költségű off-policy kiértékelést tesz lehetővé.
- A meta-szintű visszacsatolás a szűk keresztmetszet, nem a nyers számítás. A policy minősége csak hosszú rollout után derül ki, ezért a javítása drága.
- Az explicit, programozható exploráció. Egy könnyű orchestration-réteg teszi a stratégiát kóddá, miközben az alul lévő coding agent változatlan marad.
- Csak a policy-kód változik. A modellek, a kiértékelő és a végrehajtási interfészek végig rögzítettek maradnak.
- Az „álmodozás” veri a prompt-szintű útmutatást. Az explicit iránymutatás konzisztensen rosszabbul teljesített, mint a guidanc nélküli változat.
- A tanult policy adaptív ritmust mutat. Amikor javul a teljesítmény, csökkenti a számítást; amikor platót ér el, újra növeli.
Összegzés¶
A Dream-RSI a rekurzív önfejlesztés meta-szintjét teszi rekurzívvá és off-policyvé azáltal, hogy a felhalmozott felfedezési történetet statikus kontextusból aktív, visszajátszható szimulátorrá alakítja. Ezzel a meta-optimalizálás alapproblémáját, a késleltetett és drága visszacsatolást oldja meg, ami hosszú horizontú felfedezésnél a legsúlyosabb. Három tudományos felfedezési domainben (algoritmus-tervezés, matematikai optimalizálás, GPU kernel-tervezés) nyolc feladaton mérve a Dream-RSI versenyképes vagy jobb felfedezési minőséget ér el, miközben több esetben lényegesen csökkenti a felfedezési költséget: a Lasso path solver esetében akár 162-szeres megtakarítást a SimpleTES-hez képest, a matematikai optimalizálásban 50-szeres költségmegtakarítást, a GPU kernel-tervezésben 1,79-2,43-szoros generáció-megtakarítást vagy 1,44-2,09-szeres teljesítménynövekedést azonos költségvetés mellett. A munka fogalmi hozadéka, hogy a felfedezési előzmény nem passzív memória, hanem aktív, visszajátszható környezet, amiben alternatív stratégiák olcsón kiértékelhetők.
A probléma: miért nehéz az exploráció javítása¶
Két szűk keresztmetszet¶
A szerzők pontosan megnevezik, miért nem működik a naiv megközelítés. Két alapvető akadály van:
- A visszacsatolás késleltetett és drága a meta-szinten. Egy egyedi jelölt kiértékelésével szemben egy explorációs policy megítéléséhez azt kell megfigyelni, hogyan alakítja a későbbi felfedezési folyamatot sok javaslat-kiértékelés cikluson keresztül. Ez azt jelenti, hogy minden policy-jelölt hosszú online rolloutot igényel, mielőtt hasznos visszacsatolást kapna.
- A meta-policy tér hatalmas. Egy újonnan javasolt policy gyakran gyengén teljesít, ezért sok alternatívát kell kipróbálni. A két probléma együtt teszi a meta-szintű javítást különösen költségessé.
Ez a szerkezet ismerős: pontosan az a helyzet, amikor egy rendszer saját működési stratégiáját kellene javítania, de a stratégia értékéről csak lassan és drágán kap visszajelzést.
A megoldás intuíciója¶
A szerzők megfogalmazása szerint az intuíció egyszerű: a felfedezés gyors és olcsó szimulátora lehetővé tenné sok explorációs policy kiértékelését a drága online telepítés előtt. És a meglepő rész: a befejezett felfedezési előzmények már tartalmazzák ezt a szimulátort.
A szerzők: a completed discovery process inherently records a structured tree of past exploration decisions and their realized code-execution outcomes.
A navigációs hasonlat, amit használnak: egy agent egy ismeretlen környezetben először talán nem hatékony útvonalakat követ, zsákutcákba fut, visszalép, és fokozatosan felépíti a környezet térképét. Amint rögzítették, ez a tapasztalat újrahasznosítható: a térkép támogatja a tervezést anélkül, hogy az agentnek fizikailag újra be kellene járnia minden helyet. Egy új navigációs policy az összegyűlt térkép felett tud érvelni, elkerüli az ismert zsákutcákat, újragondolja a korábbi döntéseket, és összehasonlít alternatív útvonalakat.
A párhuzam a model-alapú megerősítéses tanulással (model-based RL) és a World Modellekkel explicit: a Dreamer-család (Hafner és mtsai) mutatja ezt a legtisztábban, ahol az agent egy kompakt dinamikai modellt tanul a gyűjtött tapasztalatból, és a policy-jét azon belül elképzelt trajektóriákon keresztül javítja. A Dream-RSI ezt a struktúrát alkalmazza a hosszú horizontú felfedezésre.
A replay szimulátor működése¶
Egy explorációs policy eldönti, mely irányokat követi, mely jelölteket finomítja, mely ágakat fedezi fel párhuzamosan, és mikor áll le. Az online végrehajtás egy strukturált felfedezési előzményt produkál: a feltárt ágakat, a döntési pontokat, a számítási költségeket és a tényleges kimeneteket.
Ez az előzmény ezután empirikus replay szimulátorként kezelhető: a felfedezési tér már megfigyelt részének megalapozott modelljeként. A szimulátoron belül az alternatív policyk különböző trajektóriákat indukálnak a rögzített fán. Egy policy más részhalmazt választhat az ágakból, más sorrendbe rendezheti őket, más kéréseket küldhet párhuzamosan, vagy korábban állhat le.
Az értékelés csak a kiválasztott ágak mentén már tárolt kimenetek felfedését igényli, nem az agent és a kiértékelő újrafuttatását. Következmény: egyetlen drága online felfedezési futtatás sok olcsó kiértékelést támogat.
A Dream-RSI architektúrája¶
A három szakasz¶
A rendszer váltogat az online felfedezés és az offline „álmodozás” között, hogy javítsa a felfedezési számítás elosztását. A három magszakasz:
- Online Explore. Az aktuális policy vezeti a valós felfedezést, és rögzíti a történeti végrehajtási nyomokat egy felfedezési fába.
- Construct Replay Simulator. A rögzített felfedezési fák újrahasznosítható replay szimulátor-pool-lá alakulnak.
- Dreaming-based Policy Improvement. A jelölt policyk olcsó „álmodozással” értékelődnek a szimulátor felett.
A frissített policy ezután újra online telepítődik, hogy új felfedezési tapasztalatot generáljon és bővítse a szimulátor-poolt, lezárva az RSI hurkot a meta-explorációs szinten.
Mi változik és mi nem¶
Ez az epizód egyik legfontosabb tervezési döntése, és szándékosan konzervatív:
A szerzők: Only the exploration-policy code is updated; the underlying models, evaluator, and execution interfaces remain fixed.
Az explorációs policy végrehajtható kód, nem szöveges prompt vagy súlyvektor. Ez a döntés teszi lehetővé a könnyű orchestration-t: kontrollálja a branchinget, a párhuzamos felfedezést és a leállást, miközben az alul lévő coding agent érintetlen marad.
Ez a saját rendszerünk szempontjából is tanulságos: a scaffold-szintű, programozható kontroll az a hely, ahol a legnagyobb hozam érhető el anélkül, hogy a modellt érintenénk. Ez pontosan a self-improvement-discipline elve, amit követünk: a scaffold-változtatás olcsó, a súly-szintű nem elérhető és nem is kívánatos.
Felfedezési fák és akciók¶
A rollout fokozatosan épít egy gyökereztetett felfedezési fát, amely kezdetben csak a task gyökér csomópontot tartalmazza. Minden nem-gyökér csomópontnak pontosan egy elsődleges szülője van. A szülő azonosítja, hol kezdődik a csomópontot létrehozó kísérlet: az agent folytatja a szülő mentett munkaterét, és a felhalmozott megfigyeléseket kontextusként használva generál új jelöltet, amit kiértékelnek.
A csomópont rögzíti a fejlődéstörténetet a gyökértől a csomópontig, valamint az egyetlen kísérlet kimenetét: a fájlrendszer-pillanatképet, a generált artefaktumot, a kiértékelési diagnosztikát és a pontszámot.
Az egyetlen atomi művelet a CONTINUE(v), ami folytatja a csomóponthoz tartozó munkateret, és generál és kiértékel egy új gyereket. A gyökérből folytatva új ágat nyitsz; egy nem-gyökér levélből folytatva egy meglévő ág végét finomítod vagy javítod.
Ha W a párhuzamos munkások száma, a jogosult folytatási csomópontok halmaza a gyökér és a levelek uniója, a megengedett batchek pedig ezeknek a legfeljebb W méretű részhalmazai. A policy egy batch-et választ; ha üres batch-et választ, a rollout lezárul.
A replay objektív függvény¶
A replay objektív három dolgot egyensúlyoz:
- Felfedezési minőség: a replay során elért legjobb megoldás-minőség.
- Végrehajtási költség: a megkísérelt generációk számának büntetése.
- Párhuzamossági bónusz: a döntési körönként végrehajtott kísérletek átlagos száma, ami azokat a policykat jutalmazza, amelyek hasznos folytatásokat batch-elnek a szekvenciális végrehajtás helyett.
A szerzők: The first term measures the best solution quality attained during replay. The second penalizes the number of attempted generations... The third rewards the average number of attempts executed per decision round, favoring policies that batch useful continuations rather than execute them sequentially.
A policy-kiválasztás garanciája¶
A policy-javítás és -kiválasztás mechanizmusa egy fontos tulajdonsággal bír. Az offline fázis M kód-revízión megy keresztül, minden verziót minden rögzített fán kiértékelve. A következő online policyt az összes kiértékelt verzió közül választják ki a legjobb átlagos replay pontszám alapján.
Mivel a jelölt-halmaz tartalmazza az aktuális policyt is, a kiválasztás teljesíti a nem-romlás feltételt: a kiválasztott policy átlagos replay pontszáma a rögzített előzményen nem rosszabb, mint az aktuális policyé.
A szerzők: Because the candidate set includes the current policy, this selection satisfies V ≥ V⁰. Thus, the selected policy is no worse than the current policy in average replay score on the fixed history.
Ez egy monoton javulási garancia a szimulátor metrikája szerint, ami a saját rendszerünkben is alkalmazható minta: ha egy javítás-jelöltet egy rögzített metrikán hasonlítasz össze a jelenlegivel, és a jelenlegit is a jelöltek között tartod, akkor a rendszer nem tud visszalépni.
Kísérleti eredmények¶
A kísérleti beállítás¶
A szerzők nyolc tudományos felfedezési feladatot értékelnek három domainben. Az elsődleges kontrollált baseline a Recursive Fixed Exploration, amely ugyanazt a felfedezési beállítást és inicializálást használja, de a policy rögzített marad a rekurzív körökön át. Emellett feladatspecifikus domain-baseline-okkal is összehasonlítanak.
Kritikus módszertani részlet: mindkét módszer ugyanazzal az agenttel, kiértékelővel, inicializálással és erőforrás-korláttal dolgozik, és ugyanabból a kézzel tervezett explorációs policyból indul. Az első körben tehát azonos a viselkedésük; a különbség onnantól, hogy a Dream-RSI fokozatosan finomítja a policyt. A felfedezési költséget az agent-hívások kumulatív számával mérik.
A kísérletek Gemini-3.1 Pro és Gemini-3.7-Flash modellekkel futottak a Gemini CLI-n keresztül. A fix explorációnál a Gemini-3.1 Pro körönként 10 párhuzamos munkateret futtat legfeljebb 11 finomítási lépéssel (110 agent-hívás), a Flash 32 munkateret 20 lépéssel (640 hívás). A Dream-RSI azonos körönkénti költségvetést tart fenn, ami módszertanilag fontos: a javulás nem több számításból, hanem jobb elosztásból jön.
1. Algoritmus-tervezés (Lasso regularizációs út)¶
A feladat a Lasso regularizációs út hatékony implementációinak felfedezése numerikus korrektség megőrzése mellett. Ez egy alapvető számítási primitív a nagy dimenziós statisztikában, széles körben használt modellszelekcióhoz és keresztvalidációhoz olyan területeken, mint a genomika és a pénzügy.
A baseline-ok: a standard sklearn és glmnet solverek, valamint a SimpleTES (GPT-OSS-120B, 51 200 generációval). Öt rekurzív kör, 17 szintetikus példányon, majd hat visszatartott (held-out) downstream adathalmazon értékelve, biológiai és nem-biológiai domainekből.
Az eredmények:
- Gemini-3.1 Pro: az átlagos futásidő a hat held-out adathalmazon 3587,1 ms-ról 2931,0 ms-ra csökken, mindössze 317 agent-hívással az 550 helyett. A Lasso esetében ez 1,7-szeres költségmegtakarítás a fix explorációhoz képest.
- Gemini-3.7-Flash: az átlagos futásidő 2516,7 ms-ról 2350,6 ms-ra csökken, 1879 hívással a 3200 helyett.
- A SimpleTES-hez képest: kevesebb mint két nagyságrenddel kevesebb agent-hívással ér el alacsonyabb átlagos downstream futásidőt. Az ábra a 162-szeres megtakarítást emeli ki a bevezetőben.
- Az sklearn és a glmnet felett: a felfedezett solverek mind a hat held-out adathalmazon felülmúlják mindkét standard implementációt, annak ellenére, hogy lényegesen kevesebb felfedezési számítást használnak.
Az adatok önmagukért beszélnek. Az átlagos futásidő (alacsonyabb a jobb):
- sklearn: 44 180,3 ms
- glmnet: 13 767,5 ms
- SimpleTES: 3804,8 ms (51 200 generációval)
- Recursive Fixed Exploration (Gemini-3.1-Pro): 3587,1 ms (550 hívással)
- Dream-RSI (Gemini-3.1-Pro): 2931,0 ms (317 hívással)
- Recursive Fixed Exploration (Flash): 2516,7 ms (3200 hívással)
- Dream-RSI (Flash): 2350,6 ms (1879 hívással)
A felfedezett solver elemzése¶
A szerzők nem állnak meg a számoknál: elemzik, mit is fedezett fel a rendszer, ami önmagában tanulságos. A SimpleTES a probléma dimenziói szerint váltogat a LARS és a koordináta-leszállás között. A Dream-RSI által felfedezett solver viszont adaptivitást vezet be magában az aktív halmaz optimalizálásban:
- erős-szabály szűrést kombinál Cauchy–Schwarz-alapú KKT-vágással,
- szelektíven számol újra egzakt gradienset, csak amikor a korlát nem tud tanúsítani egy jellemzőt,
- teljes frissítésre esik vissza, amikor a vágás hatástalanná válik.
Ez az adaptív verifikációs séma hatékony aktív halmaz könyveléssel, lusta Gram-mátrix konstrukcióval és hardver-tudatos implementációval integrálódik. Ez a fajta „több mechanizmus kombinálása” pontosan az a viselkedés, amit az explorációs prompt kér: új mechanizmus vagy korábban sikeres elemek új kombinációja, nem ismétlés.
2. Matematikai optimalizálás¶
Három feladat: a Sum–Difference probléma (diszkrét kombinatorikus optimalizálás), a Circle Packing (geometriai optimalizálás) és az Autocorrelation Inequalities (funkcionális optimalizálás). Gemini-3.1 Pro, 10 rekurzív kör. Az összehasonlítás széles: AlphaEvolve, AlphaEvolveV2, OpenEvolve, CodeEvolve, ShinkaEvolve, TTS-Discovery, ThetaEvolve, EvoX és SimpleTES.
Az eredmények:
- Sum–Difference: a Dream-RSI 1,145427 pontszámot ér el, felülmúlva a SimpleTES-t (1,143975) és a fix explorációt (1,144047). Itt a Dream-RSI a legjobb a táblázatban.
- Circle Packing: 2,635983, ami megegyezik a legjobb jelentett eredménnyel a összehasonlított módszerek között.
- Autocorrelation: 1,456375, versenyképes a meglévő rendszerekkel.
A kulcs-árnyalat: a SimpleTES kiváló az Autocorrelation Inequalities feladaton, de 51 200 generációt igényel, ami lényegesen több, mint a Dream-RSI kevesebb mint 1000 generációja. Ez a tanulmány visszatérő motívuma: az azonos vagy jobb minőség töredék költségből.
3. GPU kernel-tervezés¶
Négy KernelBench-feladat: VGG16, LayerNorm, ConvDiv, ConvMax. A jelölteket a végrehajtási teljesítmény alapján értékelik (inverz futásidő), korrektségi ellenőrzés mellett. Ez a domain azért fontos, mert a kernel-tervezés együttesen igényel érvelést az algoritmikus struktúráról, a memóriahozzáférésről, a párhuzamosításról és a hardverspecifikus optimalizálásokról.
Az eredmények két csoportra oszlanak, és a megkülönböztetés fontos:
- Azonos teljesítmény kevesebb munkából: a VGG16-nál 2,43-szor kevesebb generáció, a LayerNorm-nál 1,79-szer kevesebb generáció ugyanahhoz a teljesítményhez.
- Több teljesítmény azonos költségvetésből: a ConvDiv-nál 2,09-szeres, a ConvMax-nál 1,44-szeres teljesítménynövekedés azonos felfedezési költségvetés mellett.
További elemzések¶
A prompt-szintű útmutatás ROSSZABB¶
Ez az epizód egyik legérdekesebb és legellenintuitívabb eredménye. A szerzők megvizsgálták, hogy a történelem felhasználásának egy természetes alternatívája, hogy a korábbi trajektóriákat magas szintű iránybeli insightokká absztrahálják, és explicit szemantikai útmutatásként injektálják a promptba a következő körökhöz.
Az eredmény:
A szerzők: explicit directional guidance consistently underperforms its unguided counterpart across both paradigms under equivalent discovery budgets.
Az explicit útmutatás következetesen rosszabbul teljesített, mindkét paradigmában (Dream-RSI és fix exploráció), azonos költségvetés mellett. Az értelmezés, amit adnak:
A szerzők: in long-horizon discovery—where multiple parallel threads are deployed for exploration—imposing strong semantic inductive biases regarding future search directions tends to over-constrain the search space and impede diverse exploration.
Ez egy mély megfigyelés: a túl erős előzetes iránymutatás leszűkíti a keresési teret. Hosszú horizontú felfedezésnél, ahol több párhuzamos szál fut, az erős szemantikai induktív bias akadályozza a sokszínű explorációt. A történelem mint interaktív replay szimulátor felülmúlja a történelem mint útmutatás használatát.
Ez közvetlenül érinti a saját rendszerünket: a „tanulj a múltbeli tapasztalatból és írd le szabályként” megközelítés nem mindig jobb, mint „tedd a múltbeli tapasztalatot kiértékelhetővé”. A statikus szabállyá sűrítés információt veszít.
A tanult viselkedés evolúciója¶
A hatodik ábra a megtanult explorációs policy evolúcióját mutatja a rekurzív körökön át a ConvDiv feladaton. A minta világos és adaptív:
- Amikor javul a teljesítmény: a policy csökkenti a felfedezési számítást. A kiértékelt kísérletek száma 110-ről 50-re esik.
- Amikor a fejlődés platót ér el: a policy újra növeli a felfedezési erőfeszítést, ami egybeesik a további teljesítménynyereséggel.
Ez a költségvetés dinamikus újraelosztása: a rendszer megtanulja, mikor takarékoskodjon és mikor fektessen be. A körök mentén a legjobb teljesítmény 0,427-ről 1,898-ra nő, miközben a kiértékelt kísérletek száma nem monoton nő: 110, 110, 87, 80, 50, 92, 91, 86.
Ez a minta rokon a saját PID-control megközelítésünkkel: az arányos tag a korrekció, az integráló a heti felülvizsgálat, a deriváló a trenddetektálás. A Dream-RSI policy-ja hasonló elven működik: a javulás ütemére reagál az erőforrás-allokációval.
Kapcsolódó munkák, a pozicionálás¶
A szerzők három tengelyen helyezik el a munkát, és a megkülönböztetés pontos:
AI-vezérelt tudományos és algoritmikus felfedezés. Az LLM-alapú felfedezési rendszerek iteratívan generálnak, értékelnek és finomítanak jelölteket (AlphaEvolve, OpenEvolve, CodeEvolve, ShinkaEvolve, PACEvolve, DeltaEvolve, MLEvolve). Az újabb munkák az exploráció fontosságát hangsúlyozzák: a SkyDiscover adaptív felfedezési infrastruktúrát ad, a SwarmResearch dinamikusan orchestrál több keresési ágat, az EvoX explicit módon optimalizálja a keresési stratégiákat a jelöltek helyett. Ez a váltás meta-szintű optimalizálási problémává teszi az explorációt, de a hasznos felügyelet drága és késleltetett.
Self-evolving agentek. Egy szélesebb vonal olyan agenteket vizsgál, amelyek a saját komponenseiket javítják interakció közben: modellt, harness-t, kontextust, skilleket, modell-viselkedést test-time learning-gel, rubrikákat, környezeteket. A legtöbb objektum-szinten működik (a feladat-végrehajtáshoz használt komponenseket javítja). Az újabb munka elkezdte a meta-szintű mechanizmusokat optimalizálni (keresési stratégiák, önfejlesztési eljárások), de ezek nehezen javíthatók, mert a minőségük csak költséges, hosszú rollout után derül ki.
Memória, történet és tapasztalat-újrahasznosítás. A korábbi munka az agent-tapasztalatot keresési előzményként, kontextusként, memóriaként, újrahasznosítható skillként vagy tanítójelként használja. A DeltaEvolve szemantikai delta-okkal strukturálja az evolúciós előzményt, a SwarmResearch és az MLEvolve kereszt-ág vagy retrospektív információt használ.
A szerzők: We take a different view: rather than using exploration history only as context or memory for the next decision, we organize it as a replay simulator in which many alternative exploration controllers can be evaluated cheaply.
Ez a megkülönböztetés a lényeg: a Dream-RSI a történetet nem olvassa, hanem futtatja rajta az alternatívákat.
Az általánosítható tanulságok¶
A tanulmány négy olyan elvet fogalmaz meg, amelyek túlmutatnak a konkrét feladatokon:
-
A visszacsatolás költsége a szűk keresztmetszet, nem a számítás. Ha egy döntés minőségéről csak drágán lehet visszajelzést kapni, akkor a döntés javítása lesz a korlát. A megoldás nem több számítás, hanem a visszacsatolás olcsóbbá tétele.
-
A rögzített múltbeli végrehajtás újrafuttatható. Ha minden kimenet rögzítve van, akkor egy alternatív stratégia kiértékelése csak olvasást igényel. Ez a replay szimulátor elve, és általánosítható minden olyan rendszerre, ahol a döntések és kimeneteik naplózva vannak.
-
A programozható scaffold a jó beavatkozási pont. A policy kód, nem prompt és nem súly. Az alul lévő modell és kiértékelő rögzített. Ez a legkisebb beavatkozás, ami a legnagyobb kontrollt adja.
-
A statikus szabály gyengébb, mint az interaktív szimulátor. Az explicit útmutatás mérhetően rontott a teljesítményen. A tapasztalat kiértékelhetővé tétele jobb, mint szabállyá sűrítése.
Forrás¶
- Tanulmány: Dream-RSI: Recursive Self-Improvement through Evolving Worlds
- Szerzők: Tong Zheng, Xidong Wu, Zheng Zhang, Zhankui He, Chaoyi Zhang, Benjamin Coleman, Ruoqiao Wei, Di Bai, Haolin Liu, Rui Liu, Xue Wang, Yue Zhuan, Wang-Cheng Kang, Renkai Xiang, Heng Huang, Xinwu Cheng, Yunsong Guo
- Intézmények: Google, University of Maryland, Google DeepMind, University of Virginia
- Dátum: 2026-09-12
- PDF: https://dream-rsi.com/assets/dream-rsi.pdf (36 oldal, 975 KB)
- Kód: https://github.com/zhengkid/Dream-RSI
- Honlap: https://dream-rsi.com
- Kinyerés:
pdftotext -layout, 15 744 szó, natív szöveges réteg (nem OCR, a 24. oldal kódot tartalmaz, ezért aread_fileOCR-t kért, de apdftotexthibátlanul kiolvasta)
Kapcsolódó külső források¶
- Dreamer-család (Hafner és mtsai), a model-alapú RL és World Models, amire a Dream-RSI épít: a policy javítása elképzelt trajektóriákon a tanult dinamikai modellen belül
- AlphaEvolve (Novikov és mtsai), az LLM-alapú felfedezési rendszerek referenciapontja
- SimpleTES (Ye és mtsai), az elsődleges összehasonlítási baseline, 51 200 generációval
- EvoX (Liu és mtsai), a keresési stratégia explicit optimalizálása
- KernelBench (Ouyang és mtsai), a GPU kernel-tervezési feladatok forrása
- Lasso regularizációs út, a statisztikai primitív, amin az algoritmus-tervezési feladat alapul
- OpenEvolve (Sharma), CodeEvolve (Assumpção és mtsai), ShinkaEvolve (Lange és mtsai), további automatizált felfedezési rendszerek
Kapcsolódó belső források¶
- A magyar nyelvű AI/agent-design összefoglalók a wiki
topics/ai-automation.mdtopicjában gyűlnek - Skill Retrieval Augmentation (SRA), arXiv:2604.24594: a skill-alapú tudás-visszakeresés
- Self-Harness, arXiv:2606.09498: az agent saját harness-ének javítása, közvetlenül rokon a scaffold-szintű megközelítéssel (a wiki
raw/papers/mappájában) - Memo: Memory as Model, arXiv:2605.15156: a memória mint modell koncepciója (a wiki
raw/papers/mappájában) - AgentHazard Benchmark: az agent-önfejlesztés kockázatainak mérése (a wiki
raw/papers/mappájában) - Your Agent Is Mine, arXiv:2604.08407: az agent-biztonság és a saját infrastruktúra (a wiki
raw/papers/mappájában)
Hogyan kapcsolódik a saját rendszerünkhöz?¶
Ez a tanulmány több ponton közvetlenül érinti a saját agent-architektúránkat, és a hasonlóságok nem felszínesek:
- A history mint replay szimulátor ↔ a saját session-history. A Dream-RSI felfedezése, hogy a rögzített végrehajtási fák újrafuttathatók, rokon azzal, ahogy a saját
session_searcheszközünk a korábbi session-ök teljes szövegét megőrzi és visszakereshetővé teszi. A megkülönböztetés, amit a szerzők tesznek (nem kontextus, hanem futtatható szimulátor), viszont előrelépés: a mi naplóinkat jelenleg olvassuk, nem futtatjuk rajtuk az alternatívákat. - A „csak a policy-kód változik” elv ↔ a self-improvement-discipline. A szerzők szándékosan a scaffold-szintű, programozható kontrollt választották, és a modellt, a kiértékelőt és az interfészeket rögzítették. Ez pontosan a saját SI-FMA (Self-Improvement Discipline) elvünk: a scaffold-változtatás olcsó, a súly-szintű nem elérhető és nem is kívánatos. A tanulmány egy független megerősítés ugyanarra a tervezési döntésre.
- A monoton javulási garancia ↔ a layered gating. A Dream-RSI az aktuális policyt a jelölt-halmazban tartja, ezért a kiválasztott verzió metrikailag nem lehet rosszabb. A saját rendszerünkben a Σ-update minden javaslata réteges kapuzáson megy át (parse, boundaries, robustness), és a critic nem passzív benchmark, hanem kormányzott infrastruktúra. A minta azonos: a jelenlegi állapot mindig versenyez a javaslattal.
- Az explicit útmutatás rontott, tanulság a saját skill-rendszerünkre. Ez a legérdekesebb kapcsolódási pont, és óvatosságra int. A szerzők mérése szerint a történelem szabállyá sűrítése és promptba injektálása következetesen rosszabb eredményt adott, mint a történelem interaktív, kiértékelhető használata, mert az erős előzetes irány leszűkíti a keresést. A saját skill-rendszerünk pontosan ezt csinálja: tapasztalatot sűrít szabállyá. A tanulmány arra figyelmeztet, hogy ez a sűrítés információt veszít, és hogy az ilyen szabályokat érdemes „kiértékelhető” formában is megőrizni, nem csak imperatív utasításként.
- A dinamikus költségvetés-újraelosztás ↔ a PID-control. A tanult policy mintája (javuláskor kevesebb számítás, platóban több) pontosan az, amit a saját PID-control megközelítésünk céloz: a trendre reagáló erőforrás-allokáció. Az arányos tag a korrekció, az integráló a heti felülvizsgálat, a deriváló a trenddetektálás.
- A 162-szeres megtakarítás ↔ a self-write pipeline döntése. A tanulmány visszatérő motívuma, hogy az azonos vagy jobb minőség töredék költségből érhető el, ha az erőforrás-allokációt javítod. Ez ugyanaz az érv, ami a self-write pipeline bevezetését indokolta: az FTF#57 A/B mérés szerint azonos LLM score (0.90) mellett 43 százalékkal rövidebb summary, mert nem chunkolunk redundánsan. A párhuzam nem véletlen: mindkét esetben a folyamat szerkezetének javítása hozta a nyereséget, nem több nyers számítás.