Kihagyás

Reward-Free Self-Evolution: World Knowledge Exploration

B + SFT | 38.17% | 51.50% | | Qwen3-30B + RFT | 40.91% | 57.44% | | Seed-OSS-36B (alap) | 16.26% | 39.93% | | Seed-OSS-36B + RFT | 37.50% | 56.79% |

~20% abszolút javulás mindkét modellnél és benchmarkon.

Átvihetőség (Cross-Model Transfer)

A generált World Knowledge modell-agnosztikus:

  • Qwen3-14B + Seed-OSS-36B knowledge: +18.3% pontosság
  • Kimi-K2-Turbo + Seed-OSS-36B knowledge: +21.0% pontosság
  • Qwen3-14B > Gemini-2.5-Flash (segítség nélkül)

Ez azt bizonyítja, hogy a környezet precíz ismerete (𝒦) kritikusabb szűk keresztmetszet, mint a modell mérete.

Hatékonyság

A World Knowledge csökkenti a lépésszámot (~17% javulás) — az ágens nem a főoldalról indul vak felfedezésbe, hanem egy "mentális térképet" használ.

Kulcsinsight

"A frontier teljesítmény felé vezető út nemcsak a modell paramétereinek skálázásában rejlik, hanem a környezet proaktív felfedezésének és tanulásának képességében."

A paraméterskálázás helyett a felfedezési kapacitás skálázása a kulcs.

Kapcsolódó cikkek

Források

  • arXiv:2604.18131v1 — Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration (2026. április 20.)

SoL-Pi (2026-09-17, NVlabs) — reward-free scaffold evolution, broad-to-deep funnel

A SoL-Pi a reward-free self-evolution egy konkrét implementációja a harness-rétegen (nem modell-súlyokon). Nincs RL jel, nincs evolúciós fitness függvény — csak capability- és efficiency-metric-ek, amelyek a keresés előtt rögzítettek és kívül esnek az optimalizáló kontrollján. A "reward-free" jelleg itt: a harness-javaslatok elfogadása két gate-en múlik (capability a tolerancián belül + efficiency javulás), nem egy skaláris reward maximalizálásán.

A szélesebb kontextus: a self-evolution-szakirodalom (RHI, Meta-Harness, AutoHarness, MemoHarness) három kihívással küzd: (a) held-out overfitting (Wang et al. 2026, arXiv:2607.12227); (b) cross-backend transfer (a GPT-5.6 Sol trajectory-kon fejlesztett harness működik-e Opus 5-ön?); (c) scalability (controlled comparison fix budget alatt). A SoL-Pi mindháromra pozitív előzetes választ ad: broad-to-deep funnel szétválasztja a keresést és a validációt; cross-backend transfer működik; a search scope (152 × 500 × 3000+ × 60 000+) jelzi, hogy a skálázás lehetséges.

Forrás: https://arxiv.org/abs/2609.20519

Vissza a tetejére