---
title: "Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration"
source: "https://arxiv.org/abs/2604.18131v1"
type: papers
ingested: 2026-04-24
tags: [ai, agent, self-evolution, reinforcement-learning, meta-learning, qwen, web-agents, tencent, hkust]
summary: "Tencent/HKUST kutatás: LLM ágensek önálló evolúciója jutalom nélkül, World Knowledge felfedezéssel. Kétfázisú képzés (SFT + RFT), 20% teljesítménynövekedés, Qwen3-14B > Gemini-2.5-Flash."
---

# Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

**Szerzők:** Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang  
**Intézmény:** Tencent, The Hong Kong University of Science and Technology (Guangzhou)  
**Dátum:** 2026. április 20.  
**arXiv:** 2604.18131v1

## Absztrakt

A legtöbb mai ágens "önfejlődése" emberi meghatározott jutalmakra és szabályokra támaszkodik. Ez a munka olyan ágenseket képez, amelyek intrinzik meta-evolúciós képességgel rendelkeznek: spontán tanulnak ismeretlen környezetekben feladatvégrehajtás előtt. A kimenetalapú jutalommérték azt méri, mennyire javítja az ágens öngenerált világtudása a lefelé mutató feladatok sikerességét. Ez a jel kizárólag a képzési fázisban használatos — következtetési időben nincs szükség külső jutalmakra vagy emberi utasításokra. Qwen3-30B és Seed-OSS-36B esetén ~20% teljesítménynövekedés. A generált világtudás lehetővé teszi, hogy egy kompakt Qwen3-14B modell túlszárnyalja a segítség nélküli Gemini-2.5-Flash-t.

## Három paradigma

1. **Tapasztalatvezérelt evolúció** — emberi készítésű feladatok és jutalmak
2. **Versengő evolúció** — challenger-solver dinamika, de még mindig emberi beállítás
3. **Meta-tanulásvezérelt evolúció** (ez a munka) — teljesen autonóm, feladat- és jutalommentes

## Módszertan

### World Knowledge (𝒦)
Strukturált, Markdown-alapú reprezentáció — "mentális térkép" egy környezetről. Például egy weboldal esetén: kategóriák, URL prefixek, fontossági pontszámok, összefoglalók.

### Kimenetalapú jutalom
```
R_evolve(𝒦) = Success(𝒯_E | 𝒦) - Success(𝒯_E | ∅)
```
Ahol Success a lefelé mutató feladatok sikerességi rátája.

### Kétfázisú képzés
- **SFT:** Gemini-2.5-Pro tanármodell segítségével meta-evolúciós viselkedések belsőítése
- **RFT:** Rejection Sampling Fine-Tuning — a legjobb trajektóriák kiválasztása és finomítása

## Benchmarkok

- **WebWalker** — konferencia, játék, szervezet, oktatás domainek
- **WebVoyager** — Wolfram, Apple, Dictionary, Coursera weboldalak

## Eredmények

| Modell | WebWalker | WebVoyager |
|--------|-----------|------------|
| Qwen3-30B alap | 22.04% | 41.08% |
| Qwen3-30B + RFT | **40.91%** | **57.44%** |
| Seed-OSS-36B alap | 16.26% | 39.93% |
| Seed-OSS-36B + RFT | **37.50%** | **56.79%** |

### Cross-model transfer
A generált 𝒦 modell-agnosztikus:
- Qwen3-14B + Seed-OSS-36B 𝒦: **+18.3%**
- Kimi-K2-Turbo + Seed-OSS-36B 𝒦: **+21.0%**
- **Qwen3-14B > Gemini-2.5-Flash** (segítség nélkül)

### Hatékonyság
A 𝒦 csökkenti a lépésszámot ~17%-kal.

## Érzékenységi elemzés

A World Knowledge hossza és teljesítménye közötti kapcsolat nemlineáris:
- 4k→8k token: jelentős javulás (30.74% → 39.71%)
- 8k→16k token: további javulás
- 16k→32k token: csak kis javulás
- 32k→64k token: **enyhe romlás** (zaj bevezetése)

## Következtetés

A meta-tanulásvezérelt evolúció megvalósítja az autonóm önfejlődést. A generált világtudás átvihető, skálázható, és a paraméterskálázásnál is fontosabb tényező lehet.
