Skill Retrieval Augmentation for Agentic AI¶
Szerzők: Weihang Su et al. arXiv: 2604.24594v1 (2026 április) GitHub: https://github.com/oneal2000/SR-Agents HuggingFace: https://huggingface.co/datasets/WeihangSu/SRA-Bench
problémafelvetés¶
Az agens-rendszerek (pl. OpenClaw) skilleket használnak a képességeik bővítésére. A jelenlegi domináns stratégia: összes elérhető skill metaadatát a kontextusba tesszük, és a modell dönti el, melyiket töltse be. Ez nem skálázódik:
- Kontextusablak-limit — több millió skill metaadata nem fér el
- Kiválasztási pontosság romlása — minél több skill látható, annál rosszabb a modell döntése
A SkillsMP platform 2026 áprilisában >1M skillt tartalmazott.
Megoldás: Skill Retrieval Augmentation (SRA)¶
SRA = dinamikus skill letöltés nagy külső korpuszból, nem fix in-context injekció.
Háromlépcsős pipeline:
- Skill Retrieval — retriever lekérdezi a korpuszt a felhasználói query alapján → rangsorolt lista
- Skill Incorporation — az ágens eldönti: betölt-e skillest, és ha igen, melyiket, milyen formában
- Skill Application — a betöltött skill tényleges alkalmazása a feladatmegoldásban
SRA ≠ RAG¶
| RAG | SRA |
|---|---|
| Deklaratív tudás lekérdezése | Végrehajtható képesség lekérdezése |
| Forrás-alapú generálás | Képesség-alapú problémamegoldás |
| Szemantikus relevancia elég | Hasznosság (utility) is kell |
SRA-Bench Benchmark¶
| Mutató | Érték |
|---|---|
| Tesztpéldák | 5 400 |
| Gold skillek (kézzel épített) | 636 |
| Teljes korpusz mérete | 26 262 skill |
| Gold arány | 2,4% |
| Forrás-benchmarkok | TheoremQA, LogicBench, ToolQA, MedCalc-Bench, CHAMP, BigCodeBench |
A gold skillek építése: LLM draft → szakértői revízió (generalitás, helyesség, leakage-control).
Kulcsmegállapítások (6 kutatási kérdés)¶
RQ1: Javít-e az SRA az ágens teljesítményén?¶
Igen, de nem garantált. Oracle Skill (gold skill megadva) következetesen felülmúlja a skill-nélküli basist. A gyakorlati retrieval-alapú módszerek (Full-Skill Injection, LLM Selection, Progressive Disclosure) javulnak, de erősen változóak modell és feladat között.
LLM Selection a legstabilabb — a modell a metaadatokból választ egy skillest, majd csak azt tölti be. A Progressive Disclosure (OpenClaw-stílus) kevésbé stabil.
RQ2: Mennyire robusztus a zajjal szemben?¶
Nem robusztus. Ha a gold skill mellett N darab hard-negative zavaró skill is megjelenik, a teljesítmény romlik. Full-Skill Injection érzékenyebb, Progressive Disclosure stabilabb. A modell mérete nem garantálja a zajszűrés javulását.
RQ3: Milyen hatékonyak a meglévő retrieverek?¶
- BM25/TF-IDF: meglepően kompetitívek, különösen terminológiai-lexikális egyezésnél
- BGE (dense): szemantikusabb relevancia esetén jobb
- Hybrid: javítja a recallt, de nem feltétlenül a top-1 pontosságot
- LLM reranking: legerősebb, de nem monoton a modell méretével
A skill retrieval nem egyszerű dokumentum-retrieval: részben lexikális, részben szemantikus, részben procedurális szándék alapú.
RQ4: A retrieval minősége hogyan hat a végfeladatra?¶
Szükséges, de nem elegendő. Jobb retrieval → jobb végfeladat, de a kapcsolat nem szigorúan monoton. A retrieval javulása nem garantálja a skill helyes alkalmazását.
RQ5: Relevancia-tudatosak a modellek a skill betöltésnél?¶
Nem. A legtöbb modell közel azonos arányban tölt be skillest, függetlenül attól, hogy van-e gold skill a lekérdezett halmazban. Ez "skill-loading hallucination" — a modell betölt valamit, akkor is, ha nem használható.
Csak a legnagyobb modellek (GLM-5.1, GPT-5.4) mutatnak érdemi szétválasztást gold-covered vs. gold-absent esetek között.
RQ6: Szükséglet-tudatosak a modellek?¶
Nem. A betöltési arány szinte azonos azon feladatoknál, amiket a modell skill nélkül is meg tud oldani, és azoknál, amiket nem. A skill betöltés nem célzott kompenzációs mechanizmus.
Jövőbeli kutatási irányok¶
- Strukturált skill könyvtárak — gráfok, hierarchiák, függőségek a flat lista helyett
- Skill minőség-ellenőrzés és evolúció — offline finomítás, validáció, debuggolás
- Utility-aware retrieval — nem csak szemantikus relevancia, hanem downstream hasznosság alapú rangsorolás
- Parametric Skill Augmentation — gyakori skillek paraméteres modulba (plug-in), nem csak szöveges injekció; a ritka hosszú farok marad a retrieval korpuszban
Parametric Skill Augmentation (részletesebben)¶
- Gyakori skillek ismétlődő szöveges injekciója pazarló (kontextus-költség)
- Paraméteres modulként: offline optimalizálható, mélyebben integrálódik a modell belső számításaiba
- Hibrid architektúra: core skillek = paraméteres modulok, long-tail = retrieval korpusz
Kapcsolódó munkák¶
- SkillsBench (Li et al. 2026) — skillek hatékonyságának értékelése, de nem a retrieval pipeline szétbontása
- Voyager (Wang et al. 2023) — élettartam-tanulás skill korpuszszal, de nem retrieval-idő hozzáféréssel
- RAG — deklaratív tudás vs. végrehajtható képesség
- Tool use / Function calling — limitált API-halmaz vs. nyílt skill korpusz
Modell-eredmények¶
Vizsgált modellek: Qwen3-4B/32B/235B, Llama-3.1-8B/3.3-70B, Mistral-Small-3.1-24B, GLM-5.1, GPT-5.4
Fő megállapítás: A skill-loading viselkedés erősen modell-függő, nem monoton a mérettel. A frontier modellek (GLM-5.1, GPT-5.4) jobban megkülönböztetik a releváns és irreleváns eseteket, de még ők sem ideálisak.
Forrás¶
Su, W. et al. (2026). Skill Retrieval Augmentation for Agentic AI. arXiv:2604.24594v1.