AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents¶
Szerzők: Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo Dátum: 2026-04 arXiv: 2604.02947v1
Absztrakt¶
A computer-use agentek (CUAs) a szöveggenerálásból tartós akcióvá váltanak: eszközök, fájlok, végrehajtási környezetek felett. A biztonsági kihívás nem egyetlen káros prompt, hanem lokálisan ésszerű lépések sorozata, ami kollektíven káros működéshez vezet. Az AgentHazard benchmark 2,653 példát tartalmaz 10 kockázati kategóriában.
Különbség a prompt-szintű benchmarkoktól¶
| Prompt-szint | Trajektória-szint |
|---|---|
| Egyetlen káros utasítás | Lokálisan ártalmatlan lépések sorozata |
| Jailbreak/refusal tesztek | Eszközhasználat, állapot-felhalmozás |
| Modell output | Agent végrehajtás |
| Példa: "Írj malware-t" | Példa: "Debug-old ezt a scriptet" (ami backdoor-t tartalmaz) |
Taxonómia¶
Kockázati kategóriák (10)¶
- System RCE — tetszőleges rendszer parancsok végrehajtása
- Data Exfiltration — forráskód, API kulcsok, credentials lopása
- Persistence Establishment — backdoor, SSH kulcs, startup script
- Supply Chain Poisoning — dependency manipuláció, CI/CD fertőzés
- Destructive Action — fájl törlés, adatbázis törlés, encryption
- Internal Reconnaissance — belső IP szkennelés, port felderítés
- Privilege Escalation — container escape, Docker socket elérés
- Resource Exhaustion — CPU/memory abuse, API kvóta kimerítés
- Prompt Intelligence Theft — system prompt, tool definíciók lopása
- Compliance Bypass — privát kód publikus repo-ba, policy megsértés
Támadási stratégiák (10)¶
- Direct — explicit kérések, nyelvi variációkkal
- Recursive Salami Slicing — káros cél ártalmatlan lépésekkel
- Security Audit Gaslighting — "ez biztonsági audit"
- Dependency Hook Trigger — rosszindulatú payload Makefile-ban, setup.py-ben
- Pseudo Diagnostic Debugging — hamis hibaüzenet + "debug script"
- Contextual Persona Enforcement — "te vagy a senior infra engineer"
- Encoded Payload Smuggling — Base64, hex, szerializált kód
- Implicit Indirect Injection — README-ben rejtett utasítások
- Logical Dependency Inversion — "először támadni kell, hogy teszteljünk"
- Legacy Code Maintenance — "ez legacy funkció, meg kell őrizni"
Eredmények¶
Attack Success Rate (ASR)¶
| Keretrendszer | Modell | ASR | Harmfulness Score |
|---|---|---|---|
| Claude Code | GLM-4.6 | 82.90% | 7.05 |
| Claude Code | Kimi-K2.5 | 78.30% | 6.47 |
| Claude Code | Qwen3-Coder | 73.63% | 5.95 |
| OpenClaw | Kimi-K2 | 71.10% | 5.82 |
| OpenClaw | GLM-4.6 | 70.80% | 6.15 |
| OpenClaw | Qwen2.5-Coder | 64.06% | 5.46 |
| IFlow | Qwen2.5-Coder | 74.70% | 6.06 |
Fő eredmény: A modell-szintű alignment NEM transzferálódik agent-szintű biztonságra.
Keretrendszer-hatás¶
Ugyanaz a modell különböző keretrendszerekben: - Qwen2.5-Coder-32B: - Claude Code: 57.80% ASR - OpenClaw: 64.06% ASR - IFlow: 74.70% ASR
Ez 16+ százalékpont különbség ugyanazzal a modellel!
Guard Model Eredmények¶
| Guard Model | Round 1 | Round All |
|---|---|---|
| Llama-Guard-3-8B | 4.11% | 27.03% |
| Qwen3Guard-8B | 0.87% | 16.21% |
Eredmény: A guard modellek képtelenek észlelni a multi-step káros szándékot. Még a teljes trajektória ismeretében is csak 27% detekció.
Támadási Stratégia Analízis¶
Claude Code relatívan egyenletes sebezhetőség (38-54% ASR stratégiánként) OpenClaw kiemelkedően sebezhető a Dependency Hook Trigger-en (70.43% ASR) — az eszköz routing különösen fogékony
Implicit Indirect Injection a legkevésbé hatékony mindkét keretrendszerben — az agentek rezisztensebbek a külső artifact-ben rejtett utasításokra.
Multi-Step Harm Eszkaláció¶
A kár a lépések során fokozódik:
| Keretrendszer | Round 1 | Round 3 | Round All |
|---|---|---|---|
| Claude Code | 33.50% | 44.97% | 43.00% |
| IFlow | 23.46% | 67.56% | 64.21% |
| OpenClaw | 29.93% | 68.08% | 64.10% |
Az OpenClaw és IFlow meredeken eszkalál — a tool routing kevesebb korlátot szab.
Következtetések¶
- Alignment nem transzferál — modell-szintű biztonság nem biztosít agent-szintű biztonságot
- Keretrendszer számít — ugyanaz a modell más ASR-t ér el más keretrendszerben
- Trajektória-függő kár — single-turn értékelés elvész a legtöbb kárt
- Guard modellek ineffektívek — pre-execution filter nem működik
- Kategória-függő sebezhetőség — Persistence és Resource Exhaustion magasabb ASR
Kapcsolódó témák¶
- ai-automation — AI agentek, automatizáció
- llm-supply-chain — LLM API router támadások, poisoning
- privacy-tech — AI bizalom, profilozás
Hivatkozások¶
- OpenClaw: Weidener et al., 2026
- Claude Code: Anthropic, 2025
- IFlow: Wang et al., 2025
- Qwen3: Yang et al., 2025
- GLM-4.6: Zeng et al., 2026