Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration¶
Szerzők: Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang
Intézmény: Tencent, The Hong Kong University of Science and Technology (Guangzhou)
Dátum: 2026. április 20.
arXiv: 2604.18131v1
Absztrakt¶
A legtöbb mai ágens "önfejlődése" emberi meghatározott jutalmakra és szabályokra támaszkodik. Ez a munka olyan ágenseket képez, amelyek intrinzik meta-evolúciós képességgel rendelkeznek: spontán tanulnak ismeretlen környezetekben feladatvégrehajtás előtt. A kimenetalapú jutalommérték azt méri, mennyire javítja az ágens öngenerált világtudása a lefelé mutató feladatok sikerességét. Ez a jel kizárólag a képzési fázisban használatos — következtetési időben nincs szükség külső jutalmakra vagy emberi utasításokra. Qwen3-30B és Seed-OSS-36B esetén ~20% teljesítménynövekedés. A generált világtudás lehetővé teszi, hogy egy kompakt Qwen3-14B modell túlszárnyalja a segítség nélküli Gemini-2.5-Flash-t.
Három paradigma¶
- Tapasztalatvezérelt evolúció — emberi készítésű feladatok és jutalmak
- Versengő evolúció — challenger-solver dinamika, de még mindig emberi beállítás
- Meta-tanulásvezérelt evolúció (ez a munka) — teljesen autonóm, feladat- és jutalommentes
Módszertan¶
World Knowledge (𝒦)¶
Strukturált, Markdown-alapú reprezentáció — "mentális térkép" egy környezetről. Például egy weboldal esetén: kategóriák, URL prefixek, fontossági pontszámok, összefoglalók.
Kimenetalapú jutalom¶
Ahol Success a lefelé mutató feladatok sikerességi rátája.Kétfázisú képzés¶
- SFT: Gemini-2.5-Pro tanármodell segítségével meta-evolúciós viselkedések belsőítése
- RFT: Rejection Sampling Fine-Tuning — a legjobb trajektóriák kiválasztása és finomítása
Benchmarkok¶
- WebWalker — konferencia, játék, szervezet, oktatás domainek
- WebVoyager — Wolfram, Apple, Dictionary, Coursera weboldalak
Eredmények¶
| Modell | WebWalker | WebVoyager |
|---|---|---|
| Qwen3-30B alap | 22.04% | 41.08% |
| Qwen3-30B + RFT | 40.91% | 57.44% |
| Seed-OSS-36B alap | 16.26% | 39.93% |
| Seed-OSS-36B + RFT | 37.50% | 56.79% |
Cross-model transfer¶
A generált 𝒦 modell-agnosztikus: - Qwen3-14B + Seed-OSS-36B 𝒦: +18.3% - Kimi-K2-Turbo + Seed-OSS-36B 𝒦: +21.0% - Qwen3-14B > Gemini-2.5-Flash (segítség nélkül)
Hatékonyság¶
A 𝒦 csökkenti a lépésszámot ~17%-kal.
Érzékenységi elemzés¶
A World Knowledge hossza és teljesítménye közötti kapcsolat nemlineáris: - 4k→8k token: jelentős javulás (30.74% → 39.71%) - 8k→16k token: további javulás - 16k→32k token: csak kis javulás - 32k→64k token: enyhe romlás (zaj bevezetése)
Következtetés¶
A meta-tanulásvezérelt evolúció megvalósítja az autonóm önfejlődést. A generált világtudás átvihető, skálázható, és a paraméterskálázásnál is fontosabb tényező lehet.