Kihagyás

Outcome Grading — Agentek Saját Munkájának Verifikálása

A Minta

Az Anthropic Claude Cookbook-ja egy Managed Agents (CMA) feature-t mutat be, ahol az agent:

  1. Elvégzi a feladatot (pl. kódot ír)
  2. Egy outcome grader ellenőrzi az outputot (pl. teszteket futtat)
  3. Ha a grader "pass"-t ad → kész
  4. Ha "fail" → az agent javít és újrapróbálja

A grader lehet kód (unit tesztek, linter, compiler), vagy akár egy második LLM hívás strukturált ellenőrzéssel.

Framework-független Koncepció

Bár a CMA Anthropic-specifikus infrastruktúra, maga az outcome grading koncepció bármilyen agent pipeline-ba beépíthető. A lényeg: legyen egy explicit verify step a pipeline végén, ami:

  • Strukturáltan ellenőrzi az output minőségét
  • Objektív kritériumok alapján dönt
  • Sikertelenség esetén visszajelzést ad a javításhoz

Alkalmazási Lehetőségek

  • Összefoglalók: forrás-validitás, dátum-pontosság, strukturális teljesség ellenőrzése
  • Wiki: duplikátum detektálás, broken link ellenőrzés, topic mapping konzisztencia
  • Nuclear Pulse: minden hivatkozott forrás létezik-e, a megadott dátumon jelent-e meg
  • Kód: tesztek, lint, type-check automatikus futtatása commit előtt

Korlátok

  • A grader minősége határozza meg a teljes pipeline minőségét
  • Költséges lehet (második LLM hívás)
  • A grader is hibázhat — a "grader grading the grader" végtelen regresszióhoz vezethet
Vissza a tetejére