Kihagyás

How do you write a good skill? There's actual data now. — Aparna Dhinakaran (2026-07-07)

Szerző: Aparna Dhinakaran (Co-Founder & CPO, Arize AI; blue verified) Forrás: https://x.com/aparnadhinak/status/2074569427346174039 (article: https://x.com/i/article/2074569015369056256) Dátum: 2026-07-07 Formátum: X (Twitter) hosszú formátumú cikk, képes-szöveges (a teljes szöveg a cover image-en, vision OCR kiolvasás) Likes: 267 · Conversation: 7

A cikk fő tézise

Egy jó skill szándékosan, átláthatóan és mérhetően formálja a modell viselkedését egy ismert, ismételhető irányba — és a skill-tervezés nagyon más, mint a prompt-tervezés. A cikk az AI Engineer World's Fair (San Francisco, 2026. június/július) kontextusában született, ahol a skill-ek kiemelt téma voltak: a Latent Space AINews is feldolgozta, Paul Bakaus workshopot tartott "a skill-építés sötét művészetéről", és az Anthropic, valamint más vendor-ok is skill-feature-öket mutattak be.

A cikk legfontosabb empirikus adata: a népszerű agent platformokon publikált skill-ek közel fele (48%) az első verzióban negatív eval delta-t produkált — vagyis rontotta a modell teljesítményét a skill nélküli baseline-hoz képest. Ez a "wake-up call" a szerző szerint mindenkinek, aki a skill-eket "csak promptnak" tekinti.

A hét alapelv (behavior/operation matrix → tested across model families)

  1. Behavior/operation matrix. A skillnek tartalmaznia kell egy behavior mátrixot — explicit kontraktust, amely meghatározza, hogy mely triggerek aktiválják a skillt, és milyen műveleteket hajt végre. Ez a "trigger and operation" modell: "trigger conditions" (kulcsszavak, fájltípusok, kódminták, projekt-kontextusok) + "operation set" (a triggerelt műveletek rendezett listája). Enélkül a kontraktus nélkül a skill csak prompt — nem hordozható, nem tesztelhető, nem verzionálható.

  2. Zero decision space. A jó skill nulla döntési teret hagy az LLM-nek olyan elemekre, amelyek nincsenek a mátrixban. Az agent SOHA ne dönthessen a "should I apply this skill?" kérdésről — ez bináris döntés, amelyet a mátrix definiál. Kritikus, mert: (a) az LLM-ek megbízhatatlanok a saját döntési határaik megítélésében, (b) egy "if you think this applies..." típusú skill néha alkalmazza magát, néha nem, (c) a mátrixnak kimerítőnek kell lennie a skill domain-jében.

  3. Eval-driven iteration. Egy skill nem akkor kész, amikor megírták — akkor kész, amikor az eval-ok átmennek. A 48%-os negatív eval delta arány miatt a skill-eket: golden dataset-eken kell tesztelni, eval eredmények alapján kell iterálni (nem "vibes" alapján), és az eval score-okat a verziókhoz kell csatolni.

  4. Iteratively designed and rigorously tested. Ne küldjünk el egy skillt az első draft után. A 151 skill-t tartalmazó dataset azt mutatja, hogy a skill-ekhez: több iteráció kell a konvergenciához, rigorózus edge-case tesztelés kell, és a baseline (no-skill) teljesítménnyel való összehasonlítás kell.

  5. Measures context budget. Minden betöltött skill kontextus-tokent fogyaszt. A jó skill: mért kontextus-költséggel rendelkezik, szelektív a betöltött kontextusra, figyelembe veszi az inklúzió költségét vs. értékét.

  6. Selectively loaded. Nem minden skill kell minden feladathoz. A mindig betöltött skill pazarló. A jó skill: triggerfeltételek alapján töltődik, inaktív állapotban "fel van szerelve de nincs aktiválva".

  7. Tested across model families. Ami GPT-4-en működik, nem biztos, hogy Claude-on, Llama-n vagy Gemini-n is működik. A skill-eket: legalább 2-3 modell-családon tesztelni kell, validálni kell hogy a viselkedés modell-agnosztikus (vagy explicit modell-specifikus), és újra kell értékelni az alapmodell változásakor.

Dataset release

A szerző nyílt forráskódúvá tette a teljes 151 skill-ből álló dataset-et, mindegyikhez ~10K eval eredménnyel, valamint a részletes rubric-ot és módszertant.

A cikk legfontosabb üzenete

Skill design is engineering, not magic.

A 48%-os negatív eval delta szám "wake-up call" mindenkinek, aki a skill-eket "csak promptnak" tekinti. A skill-ek nem írószerzői termékek — mérnöki termékek, amelyeket eval-alapú iterációval kell fejleszteni, multi-model teszteléssel kell validálni, és a kontextus-költséget is mérni kell.

Miért fontos ez a saját rendszerem (Hermes) szempontjából

A hét alapelv közül több már a saját skill-írási gyakorlatomban is megvan (behavior/operation mátrix a SKILL.md-kben, eval-driven iteration a podcast-processing skillben a Hamel-féle golden dataset-tel), de van, ahol van hova fejlődni:

  • A "zero decision space" elv — jelenleg a skill-ek egy része "use when X" triggerrel indul, de a "don't use for: Y" counter-trigger opcionális. A mátrix-szemléletű kimerítő trigger lista erősebb kontraktust adna.
  • A "context budget" mérés — nem mérem rendszeresen, hogy egy-egy skill betöltése mennyi tokent fogyaszt.
  • A "tested across model families" — a saját skilljeimet lokálisan (gemma4:26b-mlx, qwen3.5-27b) és távoli (minimax-m3:cloud, glm-5.2:cloud) modelleken is futtatom, de nincs szisztematikus multi-model eval rendszer a skill-ekhez.
  • A 48%-os negatív eval delta — a references/eval-pitfalls.md és a critique_runner.py a subagent summary-kra fókuszálnak, a skill-ekre nem. Ez egy hiányosság.

Kulcsszavak

skill design, skill authoring, eval-driven iteration, behavior matrix, zero decision space, context budget, model-agnostic skill, multi-model testing, prompt vs skill, Arize AI, AI Engineer World's Fair, Latent Space, Paul Bakaus.

Forrás / Wiki raw

  • Téma szerinti besorolás: AI/agents skill-ek (elsődleges: ai-automation.md); másodlagos: Hermes agent saját skill-ek audit (memória-szinten, külön skill-ek nem érintettek most)
Vissza a tetejére