---
title: "Self-Harness: Harnesses That Improve Themselves"
source: "arXiv:2606.09498v1 [cs.CL] 08 Jun 2026"
type: papers
ingested: 2026-06-16
tags: [self-harness, harness, agent-engineering, weakness-mining, harness-proposal, proposal-validation, terminal-bench, minimax-m2.5, qwen3.5, glm-5, regression-testing, self-improvement]
summary: "Zhang et al. (Shanghai AI Lab, 2026-06-08) — Self-Harness paradigma: az LLM-alapú agent a saját harness-ét javítja iteratív Weakness Mining → Harness Proposal → Proposal Validation ciklusban. Három modellcsaládon (MiniMax M2.5, Qwen3.5-35B-A3B, GLM-5) a Terminal-Bench-2.0 benchmarkon held-out pass rate 40.5%→61.9%, 23.8%→38.1%, 42.9%→57.1% — abszolút nyereség 21.4pp-ig, relatív 138%-ig."
---

# Self-Harness: Harnesses That Improve Themselves — nyers kivonat

**Szerzők:** Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu
**Intézmény:** Shanghai Artificial Intelligence Laboratory
**arXiv:** 2606.09498v1 [cs.CL] 08 Jun 2026
**URL:** https://arxiv.org/html/2606.09498v1

## Miről szól

A Self-Harness egy új paradigma az agent engineeringben: az LLM-alapú agent **saját maga javítja a körülötte lévő harness-t** (system promptok, tool-ok, runtime mechanizmusok, verification rules, orchestration), emberi mérnök vagy erősebb külső agent segítsége nélkül.

## Három paradigma összehasonlítása

1. **Human harness engineering** — mai standard, de nem skálázódik a modellek sokféleségére
2. **Meta-Harness** — erősebb külső agent javítja a gyengébbet (ADAS, Meta-Harness)
3. **Self-Harness** — ugyanaz a modell javítja a saját harness-ét

## A Self-Harness 3 fázisú iteratív loopja

### 1. Weakness Mining
- A fix modell futtatása a jelenlegi harness-szel egy held-in task halmazon
- Failed trace-ek klaszterezése **verifier-grounded failure signature** alapján (terminal cause + causal status + agent mechanism)
- Cél: nem izolált hibák, hanem ismétlődő mechanizmusok azonosítása

### 2. Harness Proposal
- Ugyanaz a modell **proposer role-ban** kapja a failure pattern-eket
- Korlátos proposal context: editable surfaces, failure patterns, passing behaviors, korábbi próbálkozások
- Párhuzamos proposal generálás: K darab **diverse yet minimal** candidate edit, mindegyik konkrét failure mechanism-re céloz
- **Diverzitás** proposal branches között, **minimalitás** branch-en belül

### 3. Proposal Validation
- Minden candidate edit → új harness variáns
- Evaluator ugyanaz, mint a diagnózisnál
- Acceptance rule: javítania kell legalább egy split-en (held-in VAGY held-out) anélkül, hogy a másikat rontaná
- Több kompatibilis candidate → merge-ölve a következő harness-be
- Minden átmenet **auditálható** (changed surfaces, split-wise outcomes, accept/reject)

## Kísérleti eredmények (Terminal-Bench-2.0)

| Modell | Held-in (előtte→utána) | Held-out (előtte→utána) | Relatív javulás (held-out) |
|--------|------------------------|--------------------------|----------------------------|
| MiniMax M2.5 | 43.0% → 50.0% (+16%) | 40.5% → 61.9% (+53%) | 53% |
| Qwen3.5-35B-A3B | 15.1% → 36.0% (+138%) | 23.8% → 38.1% (+60%) | 60% |
| GLM-5 | 47.7% → 57.0% (+20%) | 42.9% → 57.1% (+33%) | 33% |

**Abszolút maximum nyereség:** 21.4pp (held-out)
**Relatív maximum nyereség:** 138% (held-in, Qwen3.5)

## Modell-specifikus változások

- **MiniMax M2.5:** korai artifact creation, structured tool output kezelés, tool-use loop korlát, "redirect after long tool calls"
- **Qwen3.5-35B-A3B:** dependency precheck, retry discipline, loop breaking, artifact recovery after tool errors
- **GLM-5:** persistent environment settings, transition exploration→implementation, faster task resolution

## Korlátok

- Csak bounded harness edit, nem open-ended self-improvement
- Benchmark-specific failure pattern-ekre hajlamos
- Pass-rate non-regression önmagában nem elég magasabb stakes-hez

## Kapcsolat más munkákkal

- ReAct, SWE-agent, Claude Code, Codex, OpenHands (harness példák)
- Reflexion, agentic context engineering, STOP (self-improving agents)
- ADAS, Meta-Harness (külső optimalizálás)
- AI Scientist, AlphaEvolve, Alita, Gödel Agent, Darwin Gödel Machine (önfejlesztő rendszerek)
- **Harness Self-Evolution: Updating vs. Benefit** (arXiv 2605.30621, 2026-05-28) — ugyanaz a téma, Lin et al., Penn State + UCSC + Amazon

## Állapot

- **Magyar összefoglaló:** feldolgozás alatt (subagent: sa_self_harness_summary)
- **Összefoglaló fájl:** *(a külön összefoglaló nem készült el; a cikk feldolgozása a fenti keretben maradt)*
- **Topic update:** docs/wiki/topics/harness-self-evolution-capabilities.md (frissítendő)
