Kihagyás

Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

Szerzők: Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang
Intézmény: Tencent, The Hong Kong University of Science and Technology (Guangzhou)
Dátum: 2026. április 20.
arXiv: 2604.18131v1

Absztrakt

A legtöbb mai ágens "önfejlődése" emberi meghatározott jutalmakra és szabályokra támaszkodik. Ez a munka olyan ágenseket képez, amelyek intrinzik meta-evolúciós képességgel rendelkeznek: spontán tanulnak ismeretlen környezetekben feladatvégrehajtás előtt. A kimenetalapú jutalommérték azt méri, mennyire javítja az ágens öngenerált világtudása a lefelé mutató feladatok sikerességét. Ez a jel kizárólag a képzési fázisban használatos — következtetési időben nincs szükség külső jutalmakra vagy emberi utasításokra. Qwen3-30B és Seed-OSS-36B esetén ~20% teljesítménynövekedés. A generált világtudás lehetővé teszi, hogy egy kompakt Qwen3-14B modell túlszárnyalja a segítség nélküli Gemini-2.5-Flash-t.

Három paradigma

  1. Tapasztalatvezérelt evolúció — emberi készítésű feladatok és jutalmak
  2. Versengő evolúció — challenger-solver dinamika, de még mindig emberi beállítás
  3. Meta-tanulásvezérelt evolúció (ez a munka) — teljesen autonóm, feladat- és jutalommentes

Módszertan

World Knowledge (𝒦)

Strukturált, Markdown-alapú reprezentáció — "mentális térkép" egy környezetről. Például egy weboldal esetén: kategóriák, URL prefixek, fontossági pontszámok, összefoglalók.

Kimenetalapú jutalom

R_evolve(𝒦) = Success(𝒯_E | 𝒦) - Success(𝒯_E | ∅)
Ahol Success a lefelé mutató feladatok sikerességi rátája.

Kétfázisú képzés

  • SFT: Gemini-2.5-Pro tanármodell segítségével meta-evolúciós viselkedések belsőítése
  • RFT: Rejection Sampling Fine-Tuning — a legjobb trajektóriák kiválasztása és finomítása

Benchmarkok

  • WebWalker — konferencia, játék, szervezet, oktatás domainek
  • WebVoyager — Wolfram, Apple, Dictionary, Coursera weboldalak

Eredmények

Modell WebWalker WebVoyager
Qwen3-30B alap 22.04% 41.08%
Qwen3-30B + RFT 40.91% 57.44%
Seed-OSS-36B alap 16.26% 39.93%
Seed-OSS-36B + RFT 37.50% 56.79%

Cross-model transfer

A generált 𝒦 modell-agnosztikus: - Qwen3-14B + Seed-OSS-36B 𝒦: +18.3% - Kimi-K2-Turbo + Seed-OSS-36B 𝒦: +21.0% - Qwen3-14B > Gemini-2.5-Flash (segítség nélkül)

Hatékonyság

A 𝒦 csökkenti a lépésszámot ~17%-kal.

Érzékenységi elemzés

A World Knowledge hossza és teljesítménye közötti kapcsolat nemlineáris: - 4k→8k token: jelentős javulás (30.74% → 39.71%) - 8k→16k token: további javulás - 16k→32k token: csak kis javulás - 32k→64k token: enyhe romlás (zaj bevezetése)

Következtetés

A meta-tanulásvezérelt evolúció megvalósítja az autonóm önfejlődést. A generált világtudás átvihető, skálázható, és a paraméterskálázásnál is fontosabb tényező lehet.

Vissza a tetejére