Outcome Grading — Agentek Saját Munkájának Verifikálása
A Minta¶
Az Anthropic Claude Cookbook-ja egy Managed Agents (CMA) feature-t mutat be, ahol az agent:
- Elvégzi a feladatot (pl. kódot ír)
- Egy outcome grader ellenőrzi az outputot (pl. teszteket futtat)
- Ha a grader "pass"-t ad → kész
- Ha "fail" → az agent javít és újrapróbálja
A grader lehet kód (unit tesztek, linter, compiler), vagy akár egy második LLM hívás strukturált ellenőrzéssel.
Framework-független Koncepció¶
Bár a CMA Anthropic-specifikus infrastruktúra, maga az outcome grading koncepció bármilyen agent pipeline-ba beépíthető. A lényeg: legyen egy explicit verify step a pipeline végén, ami:
- Strukturáltan ellenőrzi az output minőségét
- Objektív kritériumok alapján dönt
- Sikertelenség esetén visszajelzést ad a javításhoz
Alkalmazási Lehetőségek¶
- Összefoglalók: forrás-validitás, dátum-pontosság, strukturális teljesség ellenőrzése
- Wiki: duplikátum detektálás, broken link ellenőrzés, topic mapping konzisztencia
- Nuclear Pulse: minden hivatkozott forrás létezik-e, a megadott dátumon jelent-e meg
- Kód: tesztek, lint, type-check automatikus futtatása commit előtt
Korlátok¶
- A grader minősége határozza meg a teljes pipeline minőségét
- Költséges lehet (második LLM hívás)
- A grader is hibázhat — a "grader grading the grader" végtelen regresszióhoz vezethet