Self-Harness: Harnesses That Improve Themselves — nyers kivonat¶
Szerzők: Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu Intézmény: Shanghai Artificial Intelligence Laboratory arXiv: 2606.09498v1 [cs.CL] 08 Jun 2026 URL: https://arxiv.org/html/2606.09498v1
Miről szól¶
A Self-Harness egy új paradigma az agent engineeringben: az LLM-alapú agent saját maga javítja a körülötte lévő harness-t (system promptok, tool-ok, runtime mechanizmusok, verification rules, orchestration), emberi mérnök vagy erősebb külső agent segítsége nélkül.
Három paradigma összehasonlítása¶
- Human harness engineering — mai standard, de nem skálázódik a modellek sokféleségére
- Meta-Harness — erősebb külső agent javítja a gyengébbet (ADAS, Meta-Harness)
- Self-Harness — ugyanaz a modell javítja a saját harness-ét
A Self-Harness 3 fázisú iteratív loopja¶
1. Weakness Mining¶
- A fix modell futtatása a jelenlegi harness-szel egy held-in task halmazon
- Failed trace-ek klaszterezése verifier-grounded failure signature alapján (terminal cause + causal status + agent mechanism)
- Cél: nem izolált hibák, hanem ismétlődő mechanizmusok azonosítása
2. Harness Proposal¶
- Ugyanaz a modell proposer role-ban kapja a failure pattern-eket
- Korlátos proposal context: editable surfaces, failure patterns, passing behaviors, korábbi próbálkozások
- Párhuzamos proposal generálás: K darab diverse yet minimal candidate edit, mindegyik konkrét failure mechanism-re céloz
- Diverzitás proposal branches között, minimalitás branch-en belül
3. Proposal Validation¶
- Minden candidate edit → új harness variáns
- Evaluator ugyanaz, mint a diagnózisnál
- Acceptance rule: javítania kell legalább egy split-en (held-in VAGY held-out) anélkül, hogy a másikat rontaná
- Több kompatibilis candidate → merge-ölve a következő harness-be
- Minden átmenet auditálható (changed surfaces, split-wise outcomes, accept/reject)
Kísérleti eredmények (Terminal-Bench-2.0)¶
| Modell | Held-in (előtte→utána) | Held-out (előtte→utána) | Relatív javulás (held-out) |
|---|---|---|---|
| MiniMax M2.5 | 43.0% → 50.0% (+16%) | 40.5% → 61.9% (+53%) | 53% |
| Qwen3.5-35B-A3B | 15.1% → 36.0% (+138%) | 23.8% → 38.1% (+60%) | 60% |
| GLM-5 | 47.7% → 57.0% (+20%) | 42.9% → 57.1% (+33%) | 33% |
Abszolút maximum nyereség: 21.4pp (held-out) Relatív maximum nyereség: 138% (held-in, Qwen3.5)
Modell-specifikus változások¶
- MiniMax M2.5: korai artifact creation, structured tool output kezelés, tool-use loop korlát, "redirect after long tool calls"
- Qwen3.5-35B-A3B: dependency precheck, retry discipline, loop breaking, artifact recovery after tool errors
- GLM-5: persistent environment settings, transition exploration→implementation, faster task resolution
Korlátok¶
- Csak bounded harness edit, nem open-ended self-improvement
- Benchmark-specific failure pattern-ekre hajlamos
- Pass-rate non-regression önmagában nem elég magasabb stakes-hez
Kapcsolat más munkákkal¶
- ReAct, SWE-agent, Claude Code, Codex, OpenHands (harness példák)
- Reflexion, agentic context engineering, STOP (self-improving agents)
- ADAS, Meta-Harness (külső optimalizálás)
- AI Scientist, AlphaEvolve, Alita, Gödel Agent, Darwin Gödel Machine (önfejlesztő rendszerek)
- Harness Self-Evolution: Updating vs. Benefit (arXiv 2605.30621, 2026-05-28) — ugyanaz a téma, Lin et al., Penn State + UCSC + Amazon
Állapot¶
- Magyar összefoglaló: feldolgozás alatt (subagent: sa_self_harness_summary)
- Összefoglaló fájl: (a külön összefoglaló nem készült el; a cikk feldolgozása a fenti keretben maradt)
- Topic update: docs/wiki/topics/harness-self-evolution-capabilities.md (frissítendő)