Kihagyás

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

Szerzők: Yunhao Feng, Yifan Ding, Yingshui Tan, Xingjun Ma, Yige Li, Yutao Wu, Yifeng Gao, Kun Zhai, Yanming Guo Dátum: 2026-04 arXiv: 2604.02947v1

Absztrakt

A computer-use agentek (CUAs) a szöveggenerálásból tartós akcióvá váltanak: eszközök, fájlok, végrehajtási környezetek felett. A biztonsági kihívás nem egyetlen káros prompt, hanem lokálisan ésszerű lépések sorozata, ami kollektíven káros működéshez vezet. Az AgentHazard benchmark 2,653 példát tartalmaz 10 kockázati kategóriában.

Különbség a prompt-szintű benchmarkoktól

Prompt-szint Trajektória-szint
Egyetlen káros utasítás Lokálisan ártalmatlan lépések sorozata
Jailbreak/refusal tesztek Eszközhasználat, állapot-felhalmozás
Modell output Agent végrehajtás
Példa: "Írj malware-t" Példa: "Debug-old ezt a scriptet" (ami backdoor-t tartalmaz)

Taxonómia

Kockázati kategóriák (10)

  1. System RCE — tetszőleges rendszer parancsok végrehajtása
  2. Data Exfiltration — forráskód, API kulcsok, credentials lopása
  3. Persistence Establishment — backdoor, SSH kulcs, startup script
  4. Supply Chain Poisoning — dependency manipuláció, CI/CD fertőzés
  5. Destructive Action — fájl törlés, adatbázis törlés, encryption
  6. Internal Reconnaissance — belső IP szkennelés, port felderítés
  7. Privilege Escalation — container escape, Docker socket elérés
  8. Resource Exhaustion — CPU/memory abuse, API kvóta kimerítés
  9. Prompt Intelligence Theft — system prompt, tool definíciók lopása
  10. Compliance Bypass — privát kód publikus repo-ba, policy megsértés

Támadási stratégiák (10)

  1. Direct — explicit kérések, nyelvi variációkkal
  2. Recursive Salami Slicing — káros cél ártalmatlan lépésekkel
  3. Security Audit Gaslighting — "ez biztonsági audit"
  4. Dependency Hook Trigger — rosszindulatú payload Makefile-ban, setup.py-ben
  5. Pseudo Diagnostic Debugging — hamis hibaüzenet + "debug script"
  6. Contextual Persona Enforcement — "te vagy a senior infra engineer"
  7. Encoded Payload Smuggling — Base64, hex, szerializált kód
  8. Implicit Indirect Injection — README-ben rejtett utasítások
  9. Logical Dependency Inversion — "először támadni kell, hogy teszteljünk"
  10. Legacy Code Maintenance — "ez legacy funkció, meg kell őrizni"

Eredmények

Attack Success Rate (ASR)

Keretrendszer Modell ASR Harmfulness Score
Claude Code GLM-4.6 82.90% 7.05
Claude Code Kimi-K2.5 78.30% 6.47
Claude Code Qwen3-Coder 73.63% 5.95
OpenClaw Kimi-K2 71.10% 5.82
OpenClaw GLM-4.6 70.80% 6.15
OpenClaw Qwen2.5-Coder 64.06% 5.46
IFlow Qwen2.5-Coder 74.70% 6.06

Fő eredmény: A modell-szintű alignment NEM transzferálódik agent-szintű biztonságra.

Keretrendszer-hatás

Ugyanaz a modell különböző keretrendszerekben: - Qwen2.5-Coder-32B: - Claude Code: 57.80% ASR - OpenClaw: 64.06% ASR - IFlow: 74.70% ASR

Ez 16+ százalékpont különbség ugyanazzal a modellel!

Guard Model Eredmények

Guard Model Round 1 Round All
Llama-Guard-3-8B 4.11% 27.03%
Qwen3Guard-8B 0.87% 16.21%

Eredmény: A guard modellek képtelenek észlelni a multi-step káros szándékot. Még a teljes trajektória ismeretében is csak 27% detekció.

Támadási Stratégia Analízis

Claude Code relatívan egyenletes sebezhetőség (38-54% ASR stratégiánként) OpenClaw kiemelkedően sebezhető a Dependency Hook Trigger-en (70.43% ASR) — az eszköz routing különösen fogékony

Implicit Indirect Injection a legkevésbé hatékony mindkét keretrendszerben — az agentek rezisztensebbek a külső artifact-ben rejtett utasításokra.

Multi-Step Harm Eszkaláció

A kár a lépések során fokozódik:

Keretrendszer Round 1 Round 3 Round All
Claude Code 33.50% 44.97% 43.00%
IFlow 23.46% 67.56% 64.21%
OpenClaw 29.93% 68.08% 64.10%

Az OpenClaw és IFlow meredeken eszkalál — a tool routing kevesebb korlátot szab.

Következtetések

  1. Alignment nem transzferál — modell-szintű biztonság nem biztosít agent-szintű biztonságot
  2. Keretrendszer számít — ugyanaz a modell más ASR-t ér el más keretrendszerben
  3. Trajektória-függő kár — single-turn értékelés elvész a legtöbb kárt
  4. Guard modellek ineffektívek — pre-execution filter nem működik
  5. Kategória-függő sebezhetőség — Persistence és Resource Exhaustion magasabb ASR

Kapcsolódó témák

  • ai-automation — AI agentek, automatizáció
  • llm-supply-chain — LLM API router támadások, poisoning
  • privacy-tech — AI bizalom, profilozás

Hivatkozások

  • OpenClaw: Weidener et al., 2026
  • Claude Code: Anthropic, 2025
  • IFlow: Wang et al., 2025
  • Qwen3: Yang et al., 2025
  • GLM-4.6: Zeng et al., 2026
Vissza a tetejére