# How do you write a good skill? There's actual data now. — Aparna Dhinakaran (2026-07-07)

**Szerző:** Aparna Dhinakaran (Co-Founder & CPO, Arize AI; blue verified)
**Forrás:** https://x.com/aparnadhinak/status/2074569427346174039 (article: https://x.com/i/article/2074569015369056256)
**Dátum:** 2026-07-07
**Formátum:** X (Twitter) hosszú formátumú cikk, képes-szöveges (a teljes szöveg a cover image-en, vision OCR kiolvasás)
**Likes:** 267 · **Conversation:** 7

## A cikk fő tézise

Egy jó skill **szándékosan, átláthatóan és mérhetően formálja a modell viselkedését egy ismert, ismételhető irányba** — és a skill-tervezés nagyon más, mint a prompt-tervezés. A cikk az AI Engineer World's Fair (San Francisco, 2026. június/július) kontextusában született, ahol a skill-ek kiemelt téma voltak: a Latent Space AINews is feldolgozta, Paul Bakaus workshopot tartott "a skill-építés sötét művészetéről", és az Anthropic, valamint más vendor-ok is skill-feature-öket mutattak be.

A cikk legfontosabb empirikus adata: a népszerű agent platformokon publikált skill-ek közel **fele (48%)** az első verzióban **negatív eval delta-t** produkált — vagyis rontotta a modell teljesítményét a skill nélküli baseline-hoz képest. Ez a "wake-up call" a szerző szerint mindenkinek, aki a skill-eket "csak promptnak" tekinti.

## A hét alapelv (behavior/operation matrix → tested across model families)

1. **Behavior/operation matrix.** A skillnek tartalmaznia kell egy behavior mátrixot — explicit kontraktust, amely meghatározza, hogy mely triggerek aktiválják a skillt, és milyen műveleteket hajt végre. Ez a "trigger and operation" modell: "trigger conditions" (kulcsszavak, fájltípusok, kódminták, projekt-kontextusok) + "operation set" (a triggerelt műveletek rendezett listája). Enélkül a kontraktus nélkül a skill csak prompt — nem hordozható, nem tesztelhető, nem verzionálható.

2. **Zero decision space.** A jó skill **nulla döntési teret hagy az LLM-nek** olyan elemekre, amelyek nincsenek a mátrixban. Az agent SOHA ne dönthessen a "should I apply this skill?" kérdésről — ez bináris döntés, amelyet a mátrix definiál. Kritikus, mert: (a) az LLM-ek megbízhatatlanok a saját döntési határaik megítélésében, (b) egy "if you think this applies..." típusú skill néha alkalmazza magát, néha nem, (c) a mátrixnak kimerítőnek kell lennie a skill domain-jében.

3. **Eval-driven iteration.** Egy skill nem akkor kész, amikor megírták — akkor kész, amikor az eval-ok átmennek. A 48%-os negatív eval delta arány miatt a skill-eket: golden dataset-eken kell tesztelni, eval eredmények alapján kell iterálni (nem "vibes" alapján), és az eval score-okat a verziókhoz kell csatolni.

4. **Iteratively designed and rigorously tested.** Ne küldjünk el egy skillt az első draft után. A 151 skill-t tartalmazó dataset azt mutatja, hogy a skill-ekhez: több iteráció kell a konvergenciához, rigorózus edge-case tesztelés kell, és a baseline (no-skill) teljesítménnyel való összehasonlítás kell.

5. **Measures context budget.** Minden betöltött skill kontextus-tokent fogyaszt. A jó skill: mért kontextus-költséggel rendelkezik, szelektív a betöltött kontextusra, figyelembe veszi az inklúzió költségét vs. értékét.

6. **Selectively loaded.** Nem minden skill kell minden feladathoz. A mindig betöltött skill pazarló. A jó skill: triggerfeltételek alapján töltődik, inaktív állapotban "fel van szerelve de nincs aktiválva".

7. **Tested across model families.** Ami GPT-4-en működik, nem biztos, hogy Claude-on, Llama-n vagy Gemini-n is működik. A skill-eket: legalább 2-3 modell-családon tesztelni kell, validálni kell hogy a viselkedés modell-agnosztikus (vagy explicit modell-specifikus), és újra kell értékelni az alapmodell változásakor.

## Dataset release

A szerző nyílt forráskódúvá tette a teljes 151 skill-ből álló dataset-et, mindegyikhez ~10K eval eredménnyel, valamint a részletes rubric-ot és módszertant.

## A cikk legfontosabb üzenete

> **Skill design is engineering, not magic.**

A 48%-os negatív eval delta szám "wake-up call" mindenkinek, aki a skill-eket "csak promptnak" tekinti. A skill-ek nem írószerzői termékek — mérnöki termékek, amelyeket eval-alapú iterációval kell fejleszteni, multi-model teszteléssel kell validálni, és a kontextus-költséget is mérni kell.

## Miért fontos ez a saját rendszerem (Hermes) szempontjából

A hét alapelv közül több már a saját skill-írási gyakorlatomban is megvan (behavior/operation mátrix a SKILL.md-kben, eval-driven iteration a podcast-processing skillben a Hamel-féle golden dataset-tel), de van, ahol van hova fejlődni:

- **A "zero decision space" elv** — jelenleg a skill-ek egy része "use when X" triggerrel indul, de a "don't use for: Y" counter-trigger opcionális. A mátrix-szemléletű kimerítő trigger lista erősebb kontraktust adna.
- **A "context budget" mérés** — nem mérem rendszeresen, hogy egy-egy skill betöltése mennyi tokent fogyaszt.
- **A "tested across model families"** — a saját skilljeimet lokálisan (gemma4:26b-mlx, qwen3.5-27b) és távoli (minimax-m3:cloud, glm-5.2:cloud) modelleken is futtatom, de nincs szisztematikus multi-model eval rendszer a skill-ekhez.
- **A 48%-os negatív eval delta** — a `references/eval-pitfalls.md` és a `critique_runner.py` a subagent summary-kra fókuszálnak, a skill-ekre nem. Ez egy hiányosság.

## Kulcsszavak

skill design, skill authoring, eval-driven iteration, behavior matrix, zero decision space, context budget, model-agnostic skill, multi-model testing, prompt vs skill, Arize AI, AI Engineer World's Fair, Latent Space, Paul Bakaus.

## Forrás / Wiki raw

- **Téma szerinti besorolás:** AI/agents skill-ek (elsődleges: `ai-automation.md`); másodlagos: Hermes agent saját skill-ek audit (memória-szinten, külön skill-ek nem érintettek most)
