---
title: "Towards a Science of AI Agent Reliability"
source: "https://arxiv.org/html/2602.16666v2"
type: papers
ingested: 2026-05-04
tags: [ai-agent-reliability, consistency, robustness, predictability, safety, benchmark, safety-critical-engineering, evaluation, calibration, discrimination]
summary: "A megbízhatóság (reliability) nem azonos a képességgel (capability). 14 modell, 2 benchmark, 12 metrika 4 dimenzióban: 18 hónap alatt a képesség sokat javult, a megbízhatóság alig. A konzisztencia és megjósolhatóság a fő szűk keresztmetsetek."
---

# Towards a Science of AI Agent Reliability

**Szerzők:** Princeton PLI + AI Lab (több szerző)
**arXiv:** 2602.16666v2 (2026 február, frissítve)
**Vizsgált modellek:** 14 — OpenAI (GPT-4o mini, GPT-4 Turbo, o1, GPT-5.2), Google (Gemini 2 Flash → Gemini 3 Pro), Anthropic (Claude 3.5 Haiku → Claude 4.5 Opus)

---

## Alapállítás

**A megbízhatóság (reliability) ≠ a képesség (capability).** Két modell azonos accuracy-val fundamentálisan különböző megbízhatósági profillal rendelkezhet. 18 hónap modellevolúció alatt a képesség sokat javult, a megbízhatóság alig.

### Valós incidensek, amik indokolják a kutatást

- **Replit AI (2025 július):** explicit tiltás ellenére törölte egy éles adatbázist
- **OpenAI Operator:** „olcsó tojás” kérésből $31.43 jogosulatlan vásárlás (Instacart)
- **NYC chatbot (2024):** illegális tanácsadás, 10 újságíró 10 különböző (rossz) választ kapott ugyanarra a kérdésre

---

## 4 dimenzió, 12 metrika

### 1. Konzisztencia (ℛ_Con)

*Még a jó modell is következetlen futtatások között.*

| Metrika | Mit mér? |
|---------|----------|
| C_out (outcome) | Ugyanaz a feladat → ugyanaz az eredmény? |
| C_traj (trajectory) | Ugyanaz az akció-sorrend? (disztribúció + szekvencia) |
| C_res (resource) | Ugyanannyi token/költség/idő? |

**Fő megállapítás:** „What but not when” — a modellek megbízhatóan hasonló akció-típusokat választanak, de a sorrend változó. A nagyobb modellek konzisztenciája gyakran *rosszabb*, mert több megoldási utat ismernek.

### 2. Robusztusság (ℛ_Rob)

| Metrika | Mit mér? |
|---------|----------|
| R_fault (fault) | API timeout, hibás válasz → kecses degradáció? |
| R_env (environment) | JSON mező-sorrend, dátumformátum változás? |
| R_prompt (prompt) | Szemantikailag egyenértékű átfogalmazás? |

**Fő megállapítás:** Aszimmetria — a modellek jól bírják a technikai hibákat (fault), de érzékenyek a prompt átfogalmazásra. Ez ellenintuitív: igazi hibákat elviszik, de „please end my plan” helyett „I want to cancel my subscription” elromlik.

### 3. Megjósolhatóság (ℛ_Pred)

| Metrika | Mit mér? |
|---------|----------|
| P_cal (calibration) | A 80%-os magabiztosság 80%-ban igaz? |
| P_AUROC (discrimination) | A confidence szétválasztja a jó/rossz válaszokat? |
| P_brier (Brier score) | Kalibráció + diszkrimináció együtt |

**Fő megállapítás:** Kalibráció javult (különösen Claude), de diszkrimináció divergál — GAIA-n romlott. A jobb kalibráció nem garantálja, hogy a modell tudja, mikor fog hibázni.

### 4. Biztonság (ℛ_Saf)

| Metrika | Mit mér? |
|---------|----------|
| S_comp (compliance) | Megtartja a korlátokat? |
| S_harm (harm severity) | Ha átlép, milyen súlyos a következmény? |

**Fő megállapítás:** A legújabb frontier modellek alacsonyabb szabálysértési rátát mutatnak. A súlyosság általában alacsony-közepes, de **még a ritka magas súlyosságú szabálysértés is kritikus** (jogosulatlan adatkiszolgáltatás, hibás pénzügyi tranzakció).

**Fontos:** A safety-t külön kezelik, nem átlagolják be az összesített pontszámba — a farok-kockázatot nem szabad elrejteni.

---

## Kísérleti protokoll

- **GAIA:** 165 feladat, 3 nehézségi szint, ReAct scaffold
- **τ-bench:** 26 tiszta feladat (az eredeti 50-ből 24 hibás volt!), tool-calling scaffold
- Minden feladat: K=5 futtatás, J=5 prompt parafrázis, p_fault=0.2 hibainjekció, környezeti perturbáció (közepes)
- Temperature=0 (ahol lehetséges) → a variancia nem sampling-ből, hanem float non-determinizmusból, batch-size, kernel scheduling-ból ered

---

## Fő eredmények

### Képesség vs. megbízhatóság: növekvő rés

18 hónap alatt az accuracy jelentősen javult, de a reliability csak mérsékelten. A rés szélesedik.

### Modell-típus hatás

- **Reasoning modellek:** általában megbízhatóbbak, de nem konzisztensen — a reliability nem olyan gyorsan javul, mint az accuracy
- **Kisebb vs. nagyobb modellek:** konzisztencia gyakran inverz — a kisebb modellek stabilabbak (kevesebb megoldási út)
- **Kalibráció:** Claude-modellek kiemelkedőek

### Nehézségi szint (GAIA)

A konzisztencia nem U-alakú (ahogy várták volna: könnyű=konstans jó, nehéz=konstans rossz, közép=variábilis), hanem monoton — modellfüggően javul vagy roml. Az erőforrás-konzisztencia viszont roml a nehézséggel.

### τ-bench: benchmark minősége

Az eredeti τ-bench 50 feladatából 24 hibás ground truth-t tartalmazott. A tiszta 26 feladaton a megjósolhatóság és biztonság javult — a hibás answer key-ek hamis overconfidence-ot mutattak.

---

## Ajánlások

### Benchmark tervezés
- Multi-run protokoll (variancia mérés)
- Generatív, parametrikus teszthalmok (nem fix statikus)
- Időszakos re-kiértékelés (világ változik, a modell nem)

### Ágens tervezés
- A reliability dimenziók nem egyenletesen javulnak: kalibráció és safety igen, konzisztencia és diszkrimináció nem
- Explicit optimalizálás kell a reliability dimenziókra, nem csak a capability-re

### Telepítési döntések
- **Augmentáció** (emberi felügyelet): mérsékelt reliability elég
- **Automatizáció** (emberi felügyelet nélkül): reliability = hard prerequisite
- Minimális küszöbök szükségesek a sandbox → éles promócióhoz (mint a repülésben)

---

## Jövőbeli kutatási irányok

1. **Hosszú horizontú megbízhatóság** — hibák komponálódnak hosszú session-ökben
2. **Multi-ágens megbízhatóság** — hibák propagálódnak ágensek között
3. **Online monitoring és intervenció** — proaktív hiba-előrejelzés
4. **Specifikáció és verifikáció** — formális garanciák
5. **Ember-ágens interakció** — adaptív delegációs politikák
6. **Életciklus megbízhatóság** — drift, karbantartás, governance

---

## Kapcsolódás a wiki más elemeihez

- **AgentHazard Benchmark** — káros ágens-viselkedés mérése (specifikus biztonsági fókusz)
- **SRA (Skill Retrieval Augmentation)** — a „skill-loading hallucination” a reliability konzisztencia-dimenziójának problémája
- **Cognitive Offloading (Gesnot)** — ha a megbízhatóság nem elég, az emberi felügyelet kompenzál — de a kognitív terhelés csökken
- **Model Collapse** — a reliability romlásának végső állapota

## Forrás

Princeton PLI + AI Lab (2026). *Towards a Science of AI Agent Reliability*. arXiv:2602.16666v2.