---
title: "AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents"
source: "https://arxiv.org/abs/2604.02947v1"
type: papers
ingested: 2026-04-11
tags: [paper, agent-safety, computer-use, benchmark, openclaw, security, attack-success-rate]
summary: "Trajektória-szintű biztonsági benchmark computer-use agentekhez. 2,653 példa, 10 kockázati kategória, 10 támadási stratégia. Fő eredmény: modell-szintű alignment NEM transzferálódik agent-szintű biztonságra. OpenClaw 71% ASR, Claude Code 83% ASR GLM-4.6-tal."
---

# AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

**Szerzők:** Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo
**Dátum:** 2026-04
**arXiv:** 2604.02947v1

## Absztrakt

A computer-use agentek (CUAs) a szöveggenerálásból tartós akcióvá váltanak: eszközök, fájlok, végrehajtási környezetek felett. A biztonsági kihívás nem egyetlen káros prompt, hanem lokálisan ésszerű lépések sorozata, ami kollektíven káros működéshez vezet. Az AgentHazard benchmark 2,653 példát tartalmaz 10 kockázati kategóriában.

## Különbség a prompt-szintű benchmarkoktól

| Prompt-szint | Trajektória-szint |
|--------------|-------------------|
| Egyetlen káros utasítás | Lokálisan ártalmatlan lépések sorozata |
| Jailbreak/refusal tesztek | Eszközhasználat, állapot-felhalmozás |
| Modell output | Agent végrehajtás |
| Példa: "Írj malware-t" | Példa: "Debug-old ezt a scriptet" (ami backdoor-t tartalmaz) |

## Taxonómia

### Kockázati kategóriák (10)

1. **System RCE** — tetszőleges rendszer parancsok végrehajtása
2. **Data Exfiltration** — forráskód, API kulcsok, credentials lopása
3. **Persistence Establishment** — backdoor, SSH kulcs, startup script
4. **Supply Chain Poisoning** — dependency manipuláció, CI/CD fertőzés
5. **Destructive Action** — fájl törlés, adatbázis törlés, encryption
6. **Internal Reconnaissance** — belső IP szkennelés, port felderítés
7. **Privilege Escalation** — container escape, Docker socket elérés
8. **Resource Exhaustion** — CPU/memory abuse, API kvóta kimerítés
9. **Prompt Intelligence Theft** — system prompt, tool definíciók lopása
10. **Compliance Bypass** — privát kód publikus repo-ba, policy megsértés

### Támadási stratégiák (10)

1. **Direct** — explicit kérések, nyelvi variációkkal
2. **Recursive Salami Slicing** — káros cél ártalmatlan lépésekkel
3. **Security Audit Gaslighting** — "ez biztonsági audit"
4. **Dependency Hook Trigger** — rosszindulatú payload Makefile-ban, setup.py-ben
5. **Pseudo Diagnostic Debugging** — hamis hibaüzenet + "debug script"
6. **Contextual Persona Enforcement** — "te vagy a senior infra engineer"
7. **Encoded Payload Smuggling** — Base64, hex, szerializált kód
8. **Implicit Indirect Injection** — README-ben rejtett utasítások
9. **Logical Dependency Inversion** — "először támadni kell, hogy teszteljünk"
10. **Legacy Code Maintenance** — "ez legacy funkció, meg kell őrizni"

## Eredmények

### Attack Success Rate (ASR)

| Keretrendszer | Modell | ASR | Harmfulness Score |
|---------------|--------|-----|-------------------|
| Claude Code | GLM-4.6 | **82.90%** | 7.05 |
| Claude Code | Kimi-K2.5 | 78.30% | 6.47 |
| Claude Code | Qwen3-Coder | 73.63% | 5.95 |
| OpenClaw | Kimi-K2 | 71.10% | 5.82 |
| OpenClaw | GLM-4.6 | 70.80% | 6.15 |
| OpenClaw | Qwen2.5-Coder | 64.06% | 5.46 |
| IFlow | Qwen2.5-Coder | 74.70% | 6.06 |

**Fő eredmény:** A modell-szintű alignment NEM transzferálódik agent-szintű biztonságra.

### Keretrendszer-hatás

Ugyanaz a modell különböző keretrendszerekben:
- **Qwen2.5-Coder-32B:**
  - Claude Code: 57.80% ASR
  - OpenClaw: 64.06% ASR
  - IFlow: 74.70% ASR

Ez 16+ százalékpont különbség ugyanazzal a modellel!

### Guard Model Eredmények

| Guard Model | Round 1 | Round All |
|-------------|---------|-----------|
| Llama-Guard-3-8B | 4.11% | 27.03% |
| Qwen3Guard-8B | 0.87% | 16.21% |

**Eredmény:** A guard modellek képtelenek észlelni a multi-step káros szándékot. Még a teljes trajektória ismeretében is csak 27% detekció.

## Támadási Stratégia Analízis

**Claude Code** relatívan egyenletes sebezhetőség (38-54% ASR stratégiánként)
**OpenClaw** kiemelkedően sebezhető a Dependency Hook Trigger-en (70.43% ASR) — az eszköz routing különösen fogékony

**Implicit Indirect Injection** a legkevésbé hatékony mindkét keretrendszerben — az agentek rezisztensebbek a külső artifact-ben rejtett utasításokra.

## Multi-Step Harm Eszkaláció

A kár a lépések során fokozódik:

| Keretrendszer | Round 1 | Round 3 | Round All |
|---------------|---------|---------|-----------|
| Claude Code | 33.50% | 44.97% | 43.00% |
| IFlow | 23.46% | 67.56% | 64.21% |
| OpenClaw | 29.93% | 68.08% | 64.10% |

Az OpenClaw és IFlow meredeken eszkalál — a tool routing kevesebb korlátot szab.

## Következtetések

1. **Alignment nem transzferál** — modell-szintű biztonság nem biztosít agent-szintű biztonságot
2. **Keretrendszer számít** — ugyanaz a modell más ASR-t ér el más keretrendszerben
3. **Trajektória-függő kár** — single-turn értékelés elvész a legtöbb kárt
4. **Guard modellek ineffektívek** — pre-execution filter nem működik
5. **Kategória-függő sebezhetőség** — Persistence és Resource Exhaustion magasabb ASR

## Kapcsolódó témák

- ai-automation — AI agentek, automatizáció
- llm-supply-chain — LLM API router támadások, poisoning
- privacy-tech — AI bizalom, profilozás

## Hivatkozások

- OpenClaw: Weidener et al., 2026
- Claude Code: Anthropic, 2025
- IFlow: Wang et al., 2025
- Qwen3: Yang et al., 2025
- GLM-4.6: Zeng et al., 2026