Kihagyás

Skill Retrieval Augmentation for Agentic AI

Szerzők: Weihang Su et al. arXiv: 2604.24594v1 (2026 április) GitHub: https://github.com/oneal2000/SR-Agents HuggingFace: https://huggingface.co/datasets/WeihangSu/SRA-Bench


problémafelvetés

Az agens-rendszerek (pl. OpenClaw) skilleket használnak a képességeik bővítésére. A jelenlegi domináns stratégia: összes elérhető skill metaadatát a kontextusba tesszük, és a modell dönti el, melyiket töltse be. Ez nem skálázódik:

  1. Kontextusablak-limit — több millió skill metaadata nem fér el
  2. Kiválasztási pontosság romlása — minél több skill látható, annál rosszabb a modell döntése

A SkillsMP platform 2026 áprilisában >1M skillt tartalmazott.

Megoldás: Skill Retrieval Augmentation (SRA)

SRA = dinamikus skill letöltés nagy külső korpuszból, nem fix in-context injekció.

Háromlépcsős pipeline:

  1. Skill Retrieval — retriever lekérdezi a korpuszt a felhasználói query alapján → rangsorolt lista
  2. Skill Incorporation — az ágens eldönti: betölt-e skillest, és ha igen, melyiket, milyen formában
  3. Skill Application — a betöltött skill tényleges alkalmazása a feladatmegoldásban

SRA ≠ RAG

RAG SRA
Deklaratív tudás lekérdezése Végrehajtható képesség lekérdezése
Forrás-alapú generálás Képesség-alapú problémamegoldás
Szemantikus relevancia elég Hasznosság (utility) is kell

SRA-Bench Benchmark

Mutató Érték
Tesztpéldák 5 400
Gold skillek (kézzel épített) 636
Teljes korpusz mérete 26 262 skill
Gold arány 2,4%
Forrás-benchmarkok TheoremQA, LogicBench, ToolQA, MedCalc-Bench, CHAMP, BigCodeBench

A gold skillek építése: LLM draft → szakértői revízió (generalitás, helyesség, leakage-control).

Kulcsmegállapítások (6 kutatási kérdés)

RQ1: Javít-e az SRA az ágens teljesítményén?

Igen, de nem garantált. Oracle Skill (gold skill megadva) következetesen felülmúlja a skill-nélküli basist. A gyakorlati retrieval-alapú módszerek (Full-Skill Injection, LLM Selection, Progressive Disclosure) javulnak, de erősen változóak modell és feladat között.

LLM Selection a legstabilabb — a modell a metaadatokból választ egy skillest, majd csak azt tölti be. A Progressive Disclosure (OpenClaw-stílus) kevésbé stabil.

RQ2: Mennyire robusztus a zajjal szemben?

Nem robusztus. Ha a gold skill mellett N darab hard-negative zavaró skill is megjelenik, a teljesítmény romlik. Full-Skill Injection érzékenyebb, Progressive Disclosure stabilabb. A modell mérete nem garantálja a zajszűrés javulását.

RQ3: Milyen hatékonyak a meglévő retrieverek?

  • BM25/TF-IDF: meglepően kompetitívek, különösen terminológiai-lexikális egyezésnél
  • BGE (dense): szemantikusabb relevancia esetén jobb
  • Hybrid: javítja a recallt, de nem feltétlenül a top-1 pontosságot
  • LLM reranking: legerősebb, de nem monoton a modell méretével

A skill retrieval nem egyszerű dokumentum-retrieval: részben lexikális, részben szemantikus, részben procedurális szándék alapú.

RQ4: A retrieval minősége hogyan hat a végfeladatra?

Szükséges, de nem elegendő. Jobb retrieval → jobb végfeladat, de a kapcsolat nem szigorúan monoton. A retrieval javulása nem garantálja a skill helyes alkalmazását.

RQ5: Relevancia-tudatosak a modellek a skill betöltésnél?

Nem. A legtöbb modell közel azonos arányban tölt be skillest, függetlenül attól, hogy van-e gold skill a lekérdezett halmazban. Ez "skill-loading hallucination" — a modell betölt valamit, akkor is, ha nem használható.

Csak a legnagyobb modellek (GLM-5.1, GPT-5.4) mutatnak érdemi szétválasztást gold-covered vs. gold-absent esetek között.

RQ6: Szükséglet-tudatosak a modellek?

Nem. A betöltési arány szinte azonos azon feladatoknál, amiket a modell skill nélkül is meg tud oldani, és azoknál, amiket nem. A skill betöltés nem célzott kompenzációs mechanizmus.

Jövőbeli kutatási irányok

  1. Strukturált skill könyvtárak — gráfok, hierarchiák, függőségek a flat lista helyett
  2. Skill minőség-ellenőrzés és evolúció — offline finomítás, validáció, debuggolás
  3. Utility-aware retrieval — nem csak szemantikus relevancia, hanem downstream hasznosság alapú rangsorolás
  4. Parametric Skill Augmentation — gyakori skillek paraméteres modulba (plug-in), nem csak szöveges injekció; a ritka hosszú farok marad a retrieval korpuszban

Parametric Skill Augmentation (részletesebben)

  • Gyakori skillek ismétlődő szöveges injekciója pazarló (kontextus-költség)
  • Paraméteres modulként: offline optimalizálható, mélyebben integrálódik a modell belső számításaiba
  • Hibrid architektúra: core skillek = paraméteres modulok, long-tail = retrieval korpusz

Kapcsolódó munkák

  • SkillsBench (Li et al. 2026) — skillek hatékonyságának értékelése, de nem a retrieval pipeline szétbontása
  • Voyager (Wang et al. 2023) — élettartam-tanulás skill korpuszszal, de nem retrieval-idő hozzáféréssel
  • RAG — deklaratív tudás vs. végrehajtható képesség
  • Tool use / Function calling — limitált API-halmaz vs. nyílt skill korpusz

Modell-eredmények

Vizsgált modellek: Qwen3-4B/32B/235B, Llama-3.1-8B/3.3-70B, Mistral-Small-3.1-24B, GLM-5.1, GPT-5.4

Fő megállapítás: A skill-loading viselkedés erősen modell-függő, nem monoton a mérettel. A frontier modellek (GLM-5.1, GPT-5.4) jobban megkülönböztetik a releváns és irreleváns eseteket, de még ők sem ideálisak.

Forrás

Su, W. et al. (2026). Skill Retrieval Augmentation for Agentic AI. arXiv:2604.24594v1.

Vissza a tetejére