Kihagyás

Towards a Science of AI Agent Reliability

Szerzők: Princeton PLI + AI Lab (több szerző) arXiv: 2602.16666v2 (2026 február, frissítve) Vizsgált modellek: 14 — OpenAI (GPT-4o mini, GPT-4 Turbo, o1, GPT-5.2), Google (Gemini 2 Flash → Gemini 3 Pro), Anthropic (Claude 3.5 Haiku → Claude 4.5 Opus)


Alapállítás

A megbízhatóság (reliability) ≠ a képesség (capability). Két modell azonos accuracy-val fundamentálisan különböző megbízhatósági profillal rendelkezhet. 18 hónap modellevolúció alatt a képesség sokat javult, a megbízhatóság alig.

Valós incidensek, amik indokolják a kutatást

  • Replit AI (2025 július): explicit tiltás ellenére törölte egy éles adatbázist
  • OpenAI Operator: „olcsó tojás” kérésből $31.43 jogosulatlan vásárlás (Instacart)
  • NYC chatbot (2024): illegális tanácsadás, 10 újságíró 10 különböző (rossz) választ kapott ugyanarra a kérdésre

4 dimenzió, 12 metrika

1. Konzisztencia (ℛ_Con)

Még a jó modell is következetlen futtatások között.

Metrika Mit mér?
C_out (outcome) Ugyanaz a feladat → ugyanaz az eredmény?
C_traj (trajectory) Ugyanaz az akció-sorrend? (disztribúció + szekvencia)
C_res (resource) Ugyanannyi token/költség/idő?

Fő megállapítás: „What but not when” — a modellek megbízhatóan hasonló akció-típusokat választanak, de a sorrend változó. A nagyobb modellek konzisztenciája gyakran rosszabb, mert több megoldási utat ismernek.

2. Robusztusság (ℛ_Rob)

Metrika Mit mér?
R_fault (fault) API timeout, hibás válasz → kecses degradáció?
R_env (environment) JSON mező-sorrend, dátumformátum változás?
R_prompt (prompt) Szemantikailag egyenértékű átfogalmazás?

Fő megállapítás: Aszimmetria — a modellek jól bírják a technikai hibákat (fault), de érzékenyek a prompt átfogalmazásra. Ez ellenintuitív: igazi hibákat elviszik, de „please end my plan” helyett „I want to cancel my subscription” elromlik.

3. Megjósolhatóság (ℛ_Pred)

Metrika Mit mér?
P_cal (calibration) A 80%-os magabiztosság 80%-ban igaz?
P_AUROC (discrimination) A confidence szétválasztja a jó/rossz válaszokat?
P_brier (Brier score) Kalibráció + diszkrimináció együtt

Fő megállapítás: Kalibráció javult (különösen Claude), de diszkrimináció divergál — GAIA-n romlott. A jobb kalibráció nem garantálja, hogy a modell tudja, mikor fog hibázni.

4. Biztonság (ℛ_Saf)

Metrika Mit mér?
S_comp (compliance) Megtartja a korlátokat?
S_harm (harm severity) Ha átlép, milyen súlyos a következmény?

Fő megállapítás: A legújabb frontier modellek alacsonyabb szabálysértési rátát mutatnak. A súlyosság általában alacsony-közepes, de még a ritka magas súlyosságú szabálysértés is kritikus (jogosulatlan adatkiszolgáltatás, hibás pénzügyi tranzakció).

Fontos: A safety-t külön kezelik, nem átlagolják be az összesített pontszámba — a farok-kockázatot nem szabad elrejteni.


Kísérleti protokoll

  • GAIA: 165 feladat, 3 nehézségi szint, ReAct scaffold
  • τ-bench: 26 tiszta feladat (az eredeti 50-ből 24 hibás volt!), tool-calling scaffold
  • Minden feladat: K=5 futtatás, J=5 prompt parafrázis, p_fault=0.2 hibainjekció, környezeti perturbáció (közepes)
  • Temperature=0 (ahol lehetséges) → a variancia nem sampling-ből, hanem float non-determinizmusból, batch-size, kernel scheduling-ból ered

Fő eredmények

Képesség vs. megbízhatóság: növekvő rés

18 hónap alatt az accuracy jelentősen javult, de a reliability csak mérsékelten. A rés szélesedik.

Modell-típus hatás

  • Reasoning modellek: általában megbízhatóbbak, de nem konzisztensen — a reliability nem olyan gyorsan javul, mint az accuracy
  • Kisebb vs. nagyobb modellek: konzisztencia gyakran inverz — a kisebb modellek stabilabbak (kevesebb megoldási út)
  • Kalibráció: Claude-modellek kiemelkedőek

Nehézségi szint (GAIA)

A konzisztencia nem U-alakú (ahogy várták volna: könnyű=konstans jó, nehéz=konstans rossz, közép=variábilis), hanem monoton — modellfüggően javul vagy roml. Az erőforrás-konzisztencia viszont roml a nehézséggel.

τ-bench: benchmark minősége

Az eredeti τ-bench 50 feladatából 24 hibás ground truth-t tartalmazott. A tiszta 26 feladaton a megjósolhatóság és biztonság javult — a hibás answer key-ek hamis overconfidence-ot mutattak.


Ajánlások

Benchmark tervezés

  • Multi-run protokoll (variancia mérés)
  • Generatív, parametrikus teszthalmok (nem fix statikus)
  • Időszakos re-kiértékelés (világ változik, a modell nem)

Ágens tervezés

  • A reliability dimenziók nem egyenletesen javulnak: kalibráció és safety igen, konzisztencia és diszkrimináció nem
  • Explicit optimalizálás kell a reliability dimenziókra, nem csak a capability-re

Telepítési döntések

  • Augmentáció (emberi felügyelet): mérsékelt reliability elég
  • Automatizáció (emberi felügyelet nélkül): reliability = hard prerequisite
  • Minimális küszöbök szükségesek a sandbox → éles promócióhoz (mint a repülésben)

Jövőbeli kutatási irányok

  1. Hosszú horizontú megbízhatóság — hibák komponálódnak hosszú session-ökben
  2. Multi-ágens megbízhatóság — hibák propagálódnak ágensek között
  3. Online monitoring és intervenció — proaktív hiba-előrejelzés
  4. Specifikáció és verifikáció — formális garanciák
  5. Ember-ágens interakció — adaptív delegációs politikák
  6. Életciklus megbízhatóság — drift, karbantartás, governance

Kapcsolódás a wiki más elemeihez

  • AgentHazard Benchmark — káros ágens-viselkedés mérése (specifikus biztonsági fókusz)
  • SRA (Skill Retrieval Augmentation) — a „skill-loading hallucination” a reliability konzisztencia-dimenziójának problémája
  • Cognitive Offloading (Gesnot) — ha a megbízhatóság nem elég, az emberi felügyelet kompenzál — de a kognitív terhelés csökken
  • Model Collapse — a reliability romlásának végső állapota

Forrás

Princeton PLI + AI Lab (2026). Towards a Science of AI Agent Reliability. arXiv:2602.16666v2.

Vissza a tetejére