---
title: 'Reward-Free Self-Evolution: World Knowledge Exploration'
category: topic
sources:
- 2026-04-24_reward_free_self_evolution_world_knowledge.md
created: 2026-04-24
updated: '2026-06-11'
tags:
- ai
- agent
- self-evolution
- reinforcement-learning
- meta-learning
- qwen
- web-agents
- harness-updating
- harness-benefit
- world-knowledge-exploration
aliases:
- native-evolution
- world-knowledge
- spontaneous-learning
confidence: high
summary: 'Tencent/HKUST kutatás: LLM ágensek önálló evolúciója jutalom nélkül, World
  Knowledge felfedezéssel. 20% teljesítménynövekedés, Qwen3-14B > Gemini-2.5-Flash.'
---
B + SFT | 38.17% | 51.50% |
| **Qwen3-30B + RFT** | **40.91%** | **57.44%** |
| Seed-OSS-36B (alap) | 16.26% | 39.93% |
| **Seed-OSS-36B + RFT** | **37.50%** | **56.79%** |

**~20% abszolút javulás** mindkét modellnél és benchmarkon.

### Átvihetőség (Cross-Model Transfer)

A generált World Knowledge **modell-agnosztikus**:

- Qwen3-14B + Seed-OSS-36B knowledge: **+18.3%** pontosság
- Kimi-K2-Turbo + Seed-OSS-36B knowledge: **+21.0%** pontosság
- **Qwen3-14B > Gemini-2.5-Flash** (segítség nélkül)

Ez azt bizonyítja, hogy a környezet precíz ismerete (𝒦) kritikusabb szűk keresztmetszet, mint a modell mérete.

### Hatékonyság

A World Knowledge **csökkenti a lépésszámot** (~17% javulás) — az ágens nem a főoldalról indul vak felfedezésbe, hanem egy "mentális térképet" használ.

## Kulcsinsight

> **"A frontier teljesítmény felé vezető út nemcsak a modell paramétereinek skálázásában rejlik, hanem a környezet proaktív felfedezésének és tanulásának képességében."**

A paraméterskálázás helyett a **felfedezési kapacitás skálázása** a kulcs.

## Kapcsolódó cikkek

- [ai automation](ai-automation.md) — MI automatizáció, agentic economy
- [mcp](../concepts/mcp.md) — Model Context Protocol, ágens integráció
- [software-engineering-laws](../concepts/software-engineering-laws.md) — Szoftverfejlesztési törvények
- [harness self evolution capabilities](harness-self-evolution-capabilities.md) — Harness self-evolution decoupling (arXiv 2605.30621), harness-updating vs. harness-benefit split, weak-tier failure modes

## Források

- arXiv:2604.18131v1 — Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration (2026. április 20.)

### SoL-Pi (2026-09-17, NVlabs) — reward-free scaffold evolution, broad-to-deep funnel

A SoL-Pi a reward-free self-evolution egy konkrét implementációja a **harness-rétegen** (nem modell-súlyokon). Nincs RL jel, nincs evolúciós fitness függvény — csak capability- és efficiency-metric-ek, amelyek a keresés előtt rögzítettek és **kívül esnek** az optimalizáló kontrollján. A "reward-free" jelleg itt: a harness-javaslatok elfogadása két gate-en múlik (capability a tolerancián belül + efficiency javulás), nem egy skaláris reward maximalizálásán.

A szélesebb kontextus: a self-evolution-szakirodalom (RHI, Meta-Harness, AutoHarness, MemoHarness) három kihívással küzd: (a) held-out overfitting (Wang et al. 2026, arXiv:2607.12227); (b) cross-backend transfer (a GPT-5.6 Sol trajectory-kon fejlesztett harness működik-e Opus 5-ön?); (c) scalability (controlled comparison fix budget alatt). A SoL-Pi mindháromra pozitív előzetes választ ad: broad-to-deep funnel szétválasztja a keresést és a validációt; cross-backend transfer működik; a search scope (152 × 500 × 3000+ × 60 000+) jelzi, hogy a skálázás lehetséges.

Forrás: <https://arxiv.org/abs/2609.20519>
