How do you write a good skill? There's actual data now. — Aparna Dhinakaran (2026-07-07)¶
Szerző: Aparna Dhinakaran (Co-Founder & CPO, Arize AI; blue verified) Forrás: https://x.com/aparnadhinak/status/2074569427346174039 (article: https://x.com/i/article/2074569015369056256) Dátum: 2026-07-07 Formátum: X (Twitter) hosszú formátumú cikk, képes-szöveges (a teljes szöveg a cover image-en, vision OCR kiolvasás) Likes: 267 · Conversation: 7
A cikk fő tézise¶
Egy jó skill szándékosan, átláthatóan és mérhetően formálja a modell viselkedését egy ismert, ismételhető irányba — és a skill-tervezés nagyon más, mint a prompt-tervezés. A cikk az AI Engineer World's Fair (San Francisco, 2026. június/július) kontextusában született, ahol a skill-ek kiemelt téma voltak: a Latent Space AINews is feldolgozta, Paul Bakaus workshopot tartott "a skill-építés sötét művészetéről", és az Anthropic, valamint más vendor-ok is skill-feature-öket mutattak be.
A cikk legfontosabb empirikus adata: a népszerű agent platformokon publikált skill-ek közel fele (48%) az első verzióban negatív eval delta-t produkált — vagyis rontotta a modell teljesítményét a skill nélküli baseline-hoz képest. Ez a "wake-up call" a szerző szerint mindenkinek, aki a skill-eket "csak promptnak" tekinti.
A hét alapelv (behavior/operation matrix → tested across model families)¶
-
Behavior/operation matrix. A skillnek tartalmaznia kell egy behavior mátrixot — explicit kontraktust, amely meghatározza, hogy mely triggerek aktiválják a skillt, és milyen műveleteket hajt végre. Ez a "trigger and operation" modell: "trigger conditions" (kulcsszavak, fájltípusok, kódminták, projekt-kontextusok) + "operation set" (a triggerelt műveletek rendezett listája). Enélkül a kontraktus nélkül a skill csak prompt — nem hordozható, nem tesztelhető, nem verzionálható.
-
Zero decision space. A jó skill nulla döntési teret hagy az LLM-nek olyan elemekre, amelyek nincsenek a mátrixban. Az agent SOHA ne dönthessen a "should I apply this skill?" kérdésről — ez bináris döntés, amelyet a mátrix definiál. Kritikus, mert: (a) az LLM-ek megbízhatatlanok a saját döntési határaik megítélésében, (b) egy "if you think this applies..." típusú skill néha alkalmazza magát, néha nem, (c) a mátrixnak kimerítőnek kell lennie a skill domain-jében.
-
Eval-driven iteration. Egy skill nem akkor kész, amikor megírták — akkor kész, amikor az eval-ok átmennek. A 48%-os negatív eval delta arány miatt a skill-eket: golden dataset-eken kell tesztelni, eval eredmények alapján kell iterálni (nem "vibes" alapján), és az eval score-okat a verziókhoz kell csatolni.
-
Iteratively designed and rigorously tested. Ne küldjünk el egy skillt az első draft után. A 151 skill-t tartalmazó dataset azt mutatja, hogy a skill-ekhez: több iteráció kell a konvergenciához, rigorózus edge-case tesztelés kell, és a baseline (no-skill) teljesítménnyel való összehasonlítás kell.
-
Measures context budget. Minden betöltött skill kontextus-tokent fogyaszt. A jó skill: mért kontextus-költséggel rendelkezik, szelektív a betöltött kontextusra, figyelembe veszi az inklúzió költségét vs. értékét.
-
Selectively loaded. Nem minden skill kell minden feladathoz. A mindig betöltött skill pazarló. A jó skill: triggerfeltételek alapján töltődik, inaktív állapotban "fel van szerelve de nincs aktiválva".
-
Tested across model families. Ami GPT-4-en működik, nem biztos, hogy Claude-on, Llama-n vagy Gemini-n is működik. A skill-eket: legalább 2-3 modell-családon tesztelni kell, validálni kell hogy a viselkedés modell-agnosztikus (vagy explicit modell-specifikus), és újra kell értékelni az alapmodell változásakor.
Dataset release¶
A szerző nyílt forráskódúvá tette a teljes 151 skill-ből álló dataset-et, mindegyikhez ~10K eval eredménnyel, valamint a részletes rubric-ot és módszertant.
A cikk legfontosabb üzenete¶
Skill design is engineering, not magic.
A 48%-os negatív eval delta szám "wake-up call" mindenkinek, aki a skill-eket "csak promptnak" tekinti. A skill-ek nem írószerzői termékek — mérnöki termékek, amelyeket eval-alapú iterációval kell fejleszteni, multi-model teszteléssel kell validálni, és a kontextus-költséget is mérni kell.
Miért fontos ez a saját rendszerem (Hermes) szempontjából¶
A hét alapelv közül több már a saját skill-írási gyakorlatomban is megvan (behavior/operation mátrix a SKILL.md-kben, eval-driven iteration a podcast-processing skillben a Hamel-féle golden dataset-tel), de van, ahol van hova fejlődni:
- A "zero decision space" elv — jelenleg a skill-ek egy része "use when X" triggerrel indul, de a "don't use for: Y" counter-trigger opcionális. A mátrix-szemléletű kimerítő trigger lista erősebb kontraktust adna.
- A "context budget" mérés — nem mérem rendszeresen, hogy egy-egy skill betöltése mennyi tokent fogyaszt.
- A "tested across model families" — a saját skilljeimet lokálisan (gemma4:26b-mlx, qwen3.5-27b) és távoli (minimax-m3:cloud, glm-5.2:cloud) modelleken is futtatom, de nincs szisztematikus multi-model eval rendszer a skill-ekhez.
- A 48%-os negatív eval delta — a
references/eval-pitfalls.mdés acritique_runner.pya subagent summary-kra fókuszálnak, a skill-ekre nem. Ez egy hiányosság.
Kulcsszavak¶
skill design, skill authoring, eval-driven iteration, behavior matrix, zero decision space, context budget, model-agnostic skill, multi-model testing, prompt vs skill, Arize AI, AI Engineer World's Fair, Latent Space, Paul Bakaus.
Forrás / Wiki raw¶
- Téma szerinti besorolás: AI/agents skill-ek (elsődleges:
ai-automation.md); másodlagos: Hermes agent saját skill-ek audit (memória-szinten, külön skill-ek nem érintettek most)