Reward-Free Self-Evolution: World Knowledge Exploration
B + SFT | 38.17% | 51.50% | | Qwen3-30B + RFT | 40.91% | 57.44% | | Seed-OSS-36B (alap) | 16.26% | 39.93% | | Seed-OSS-36B + RFT | 37.50% | 56.79% |
~20% abszolút javulás mindkét modellnél és benchmarkon.
Átvihetőség (Cross-Model Transfer)¶
A generált World Knowledge modell-agnosztikus:
- Qwen3-14B + Seed-OSS-36B knowledge: +18.3% pontosság
- Kimi-K2-Turbo + Seed-OSS-36B knowledge: +21.0% pontosság
- Qwen3-14B > Gemini-2.5-Flash (segítség nélkül)
Ez azt bizonyítja, hogy a környezet precíz ismerete (𝒦) kritikusabb szűk keresztmetszet, mint a modell mérete.
Hatékonyság¶
A World Knowledge csökkenti a lépésszámot (~17% javulás) — az ágens nem a főoldalról indul vak felfedezésbe, hanem egy "mentális térképet" használ.
Kulcsinsight¶
"A frontier teljesítmény felé vezető út nemcsak a modell paramétereinek skálázásában rejlik, hanem a környezet proaktív felfedezésének és tanulásának képességében."
A paraméterskálázás helyett a felfedezési kapacitás skálázása a kulcs.
Kapcsolódó cikkek¶
- ai automation — MI automatizáció, agentic economy
- mcp — Model Context Protocol, ágens integráció
- software-engineering-laws — Szoftverfejlesztési törvények
- harness self evolution capabilities — Harness self-evolution decoupling (arXiv 2605.30621), harness-updating vs. harness-benefit split, weak-tier failure modes
Források¶
- arXiv:2604.18131v1 — Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration (2026. április 20.)
SoL-Pi (2026-09-17, NVlabs) — reward-free scaffold evolution, broad-to-deep funnel¶
A SoL-Pi a reward-free self-evolution egy konkrét implementációja a harness-rétegen (nem modell-súlyokon). Nincs RL jel, nincs evolúciós fitness függvény — csak capability- és efficiency-metric-ek, amelyek a keresés előtt rögzítettek és kívül esnek az optimalizáló kontrollján. A "reward-free" jelleg itt: a harness-javaslatok elfogadása két gate-en múlik (capability a tolerancián belül + efficiency javulás), nem egy skaláris reward maximalizálásán.
A szélesebb kontextus: a self-evolution-szakirodalom (RHI, Meta-Harness, AutoHarness, MemoHarness) három kihívással küzd: (a) held-out overfitting (Wang et al. 2026, arXiv:2607.12227); (b) cross-backend transfer (a GPT-5.6 Sol trajectory-kon fejlesztett harness működik-e Opus 5-ön?); (c) scalability (controlled comparison fix budget alatt). A SoL-Pi mindháromra pozitív előzetes választ ad: broad-to-deep funnel szétválasztja a keresést és a validációt; cross-backend transfer működik; a search scope (152 × 500 × 3000+ × 60 000+) jelzi, hogy a skálázás lehetséges.
Forrás: https://arxiv.org/abs/2609.20519