Towards a Science of AI Agent Reliability¶
Szerzők: Princeton PLI + AI Lab (több szerző) arXiv: 2602.16666v2 (2026 február, frissítve) Vizsgált modellek: 14 — OpenAI (GPT-4o mini, GPT-4 Turbo, o1, GPT-5.2), Google (Gemini 2 Flash → Gemini 3 Pro), Anthropic (Claude 3.5 Haiku → Claude 4.5 Opus)
Alapállítás¶
A megbízhatóság (reliability) ≠ a képesség (capability). Két modell azonos accuracy-val fundamentálisan különböző megbízhatósági profillal rendelkezhet. 18 hónap modellevolúció alatt a képesség sokat javult, a megbízhatóság alig.
Valós incidensek, amik indokolják a kutatást¶
- Replit AI (2025 július): explicit tiltás ellenére törölte egy éles adatbázist
- OpenAI Operator: „olcsó tojás” kérésből $31.43 jogosulatlan vásárlás (Instacart)
- NYC chatbot (2024): illegális tanácsadás, 10 újságíró 10 különböző (rossz) választ kapott ugyanarra a kérdésre
4 dimenzió, 12 metrika¶
1. Konzisztencia (ℛ_Con)¶
Még a jó modell is következetlen futtatások között.
| Metrika | Mit mér? |
|---|---|
| C_out (outcome) | Ugyanaz a feladat → ugyanaz az eredmény? |
| C_traj (trajectory) | Ugyanaz az akció-sorrend? (disztribúció + szekvencia) |
| C_res (resource) | Ugyanannyi token/költség/idő? |
Fő megállapítás: „What but not when” — a modellek megbízhatóan hasonló akció-típusokat választanak, de a sorrend változó. A nagyobb modellek konzisztenciája gyakran rosszabb, mert több megoldási utat ismernek.
2. Robusztusság (ℛ_Rob)¶
| Metrika | Mit mér? |
|---|---|
| R_fault (fault) | API timeout, hibás válasz → kecses degradáció? |
| R_env (environment) | JSON mező-sorrend, dátumformátum változás? |
| R_prompt (prompt) | Szemantikailag egyenértékű átfogalmazás? |
Fő megállapítás: Aszimmetria — a modellek jól bírják a technikai hibákat (fault), de érzékenyek a prompt átfogalmazásra. Ez ellenintuitív: igazi hibákat elviszik, de „please end my plan” helyett „I want to cancel my subscription” elromlik.
3. Megjósolhatóság (ℛ_Pred)¶
| Metrika | Mit mér? |
|---|---|
| P_cal (calibration) | A 80%-os magabiztosság 80%-ban igaz? |
| P_AUROC (discrimination) | A confidence szétválasztja a jó/rossz válaszokat? |
| P_brier (Brier score) | Kalibráció + diszkrimináció együtt |
Fő megállapítás: Kalibráció javult (különösen Claude), de diszkrimináció divergál — GAIA-n romlott. A jobb kalibráció nem garantálja, hogy a modell tudja, mikor fog hibázni.
4. Biztonság (ℛ_Saf)¶
| Metrika | Mit mér? |
|---|---|
| S_comp (compliance) | Megtartja a korlátokat? |
| S_harm (harm severity) | Ha átlép, milyen súlyos a következmény? |
Fő megállapítás: A legújabb frontier modellek alacsonyabb szabálysértési rátát mutatnak. A súlyosság általában alacsony-közepes, de még a ritka magas súlyosságú szabálysértés is kritikus (jogosulatlan adatkiszolgáltatás, hibás pénzügyi tranzakció).
Fontos: A safety-t külön kezelik, nem átlagolják be az összesített pontszámba — a farok-kockázatot nem szabad elrejteni.
Kísérleti protokoll¶
- GAIA: 165 feladat, 3 nehézségi szint, ReAct scaffold
- τ-bench: 26 tiszta feladat (az eredeti 50-ből 24 hibás volt!), tool-calling scaffold
- Minden feladat: K=5 futtatás, J=5 prompt parafrázis, p_fault=0.2 hibainjekció, környezeti perturbáció (közepes)
- Temperature=0 (ahol lehetséges) → a variancia nem sampling-ből, hanem float non-determinizmusból, batch-size, kernel scheduling-ból ered
Fő eredmények¶
Képesség vs. megbízhatóság: növekvő rés¶
18 hónap alatt az accuracy jelentősen javult, de a reliability csak mérsékelten. A rés szélesedik.
Modell-típus hatás¶
- Reasoning modellek: általában megbízhatóbbak, de nem konzisztensen — a reliability nem olyan gyorsan javul, mint az accuracy
- Kisebb vs. nagyobb modellek: konzisztencia gyakran inverz — a kisebb modellek stabilabbak (kevesebb megoldási út)
- Kalibráció: Claude-modellek kiemelkedőek
Nehézségi szint (GAIA)¶
A konzisztencia nem U-alakú (ahogy várták volna: könnyű=konstans jó, nehéz=konstans rossz, közép=variábilis), hanem monoton — modellfüggően javul vagy roml. Az erőforrás-konzisztencia viszont roml a nehézséggel.
τ-bench: benchmark minősége¶
Az eredeti τ-bench 50 feladatából 24 hibás ground truth-t tartalmazott. A tiszta 26 feladaton a megjósolhatóság és biztonság javult — a hibás answer key-ek hamis overconfidence-ot mutattak.
Ajánlások¶
Benchmark tervezés¶
- Multi-run protokoll (variancia mérés)
- Generatív, parametrikus teszthalmok (nem fix statikus)
- Időszakos re-kiértékelés (világ változik, a modell nem)
Ágens tervezés¶
- A reliability dimenziók nem egyenletesen javulnak: kalibráció és safety igen, konzisztencia és diszkrimináció nem
- Explicit optimalizálás kell a reliability dimenziókra, nem csak a capability-re
Telepítési döntések¶
- Augmentáció (emberi felügyelet): mérsékelt reliability elég
- Automatizáció (emberi felügyelet nélkül): reliability = hard prerequisite
- Minimális küszöbök szükségesek a sandbox → éles promócióhoz (mint a repülésben)
Jövőbeli kutatási irányok¶
- Hosszú horizontú megbízhatóság — hibák komponálódnak hosszú session-ökben
- Multi-ágens megbízhatóság — hibák propagálódnak ágensek között
- Online monitoring és intervenció — proaktív hiba-előrejelzés
- Specifikáció és verifikáció — formális garanciák
- Ember-ágens interakció — adaptív delegációs politikák
- Életciklus megbízhatóság — drift, karbantartás, governance
Kapcsolódás a wiki más elemeihez¶
- AgentHazard Benchmark — káros ágens-viselkedés mérése (specifikus biztonsági fókusz)
- SRA (Skill Retrieval Augmentation) — a „skill-loading hallucination” a reliability konzisztencia-dimenziójának problémája
- Cognitive Offloading (Gesnot) — ha a megbízhatóság nem elég, az emberi felügyelet kompenzál — de a kognitív terhelés csökken
- Model Collapse — a reliability romlásának végső állapota
Forrás¶
Princeton PLI + AI Lab (2026). Towards a Science of AI Agent Reliability. arXiv:2602.16666v2.