---
title: "Skill Retrieval Augmentation for Agentic AI"
source: "https://arxiv.org/html/2604.24594v1"
type: papers
ingested: 2026-05-04
tags: [sra, skill-retrieval, agents, rag, benchmark, skill-corpus, retrieval-augmentation, incorporation, need-awareness, relevance-awareness]
summary: "Új paradigma: Skill Retrieval Augmentation (SRA) — agensek dinamikusan kérnek le és alkalmaznak skilleket nagy külső korpuszból. SRA-Bench benchmark, 5400 tesztpélda, 26262 skill. A kulcsmegállapítás: a fő szűk keresztmetszet nem a retrieval, hanem a skill inkorporáció — a modellek nem tudják megítélni, mikor van szükségük külső skillre."
---

# Skill Retrieval Augmentation for Agentic AI

**Szerzők:** Weihang Su et al.
**arXiv:** 2604.24594v1 (2026 április)
**GitHub:** https://github.com/oneal2000/SR-Agents
**HuggingFace:** https://huggingface.co/datasets/WeihangSu/SRA-Bench

---

## problémafelvetés

Az agens-rendszerek (pl. OpenClaw) skilleket használnak a képességeik bővítésére. A jelenlegi domináns stratégia: **összes elérhető skill metaadatát a kontextusba tesszük**, és a modell dönti el, melyiket töltse be. Ez nem skálázódik:

1. **Kontextusablak-limit** — több millió skill metaadata nem fér el
2. **Kiválasztási pontosság romlása** — minél több skill látható, annál rosszabb a modell döntése

A SkillsMP platform 2026 áprilisában >1M skillt tartalmazott.

## Megoldás: Skill Retrieval Augmentation (SRA)

**SRA = dinamikus skill letöltés nagy külső korpuszból, nem fix in-context injekció.**

Háromlépcsős pipeline:

1. **Skill Retrieval** — retriever lekérdezi a korpuszt a felhasználói query alapján → rangsorolt lista
2. **Skill Incorporation** — az ágens eldönti: betölt-e skillest, és ha igen, melyiket, milyen formában
3. **Skill Application** — a betöltött skill tényleges alkalmazása a feladatmegoldásban

### SRA ≠ RAG

| RAG | SRA |
|-----|-----|
| Deklaratív tudás lekérdezése | Végrehajtható képesség lekérdezése |
| Forrás-alapú generálás | Képesség-alapú problémamegoldás |
| Szemantikus relevancia elég | Hasznosság (utility) is kell |

## SRA-Bench Benchmark

| Mutató | Érték |
|--------|-------|
| Tesztpéldák | 5 400 |
| Gold skillek (kézzel épített) | 636 |
| Teljes korpusz mérete | 26 262 skill |
| Gold arány | 2,4% |
| Forrás-benchmarkok | TheoremQA, LogicBench, ToolQA, MedCalc-Bench, CHAMP, BigCodeBench |

A gold skillek építése: LLM draft → szakértői revízió (generalitás, helyesség, leakage-control).

## Kulcsmegállapítások (6 kutatási kérdés)

### RQ1: Javít-e az SRA az ágens teljesítményén?

**Igen, de nem garantált.** Oracle Skill (gold skill megadva) következetesen felülmúlja a skill-nélküli basist. A gyakorlati retrieval-alapú módszerek (Full-Skill Injection, LLM Selection, Progressive Disclosure) javulnak, de erősen változóak modell és feladat között.

**LLM Selection a legstabilabb** — a modell a metaadatokból választ egy skillest, majd csak azt tölti be. A Progressive Disclosure (OpenClaw-stílus) kevésbé stabil.

### RQ2: Mennyire robusztus a zajjal szemben?

**Nem robusztus.** Ha a gold skill mellett N darab hard-negative zavaró skill is megjelenik, a teljesítmény romlik. Full-Skill Injection érzékenyebb, Progressive Disclosure stabilabb. A modell mérete nem garantálja a zajszűrés javulását.

### RQ3: Milyen hatékonyak a meglévő retrieverek?

- **BM25/TF-IDF:** meglepően kompetitívek, különösen terminológiai-lexikális egyezésnél
- **BGE (dense):** szemantikusabb relevancia esetén jobb
- **Hybrid:** javítja a recallt, de nem feltétlenül a top-1 pontosságot
- **LLM reranking:** legerősebb, de nem monoton a modell méretével

A skill retrieval nem egyszerű dokumentum-retrieval: részben lexikális, részben szemantikus, részben procedurális szándék alapú.

### RQ4: A retrieval minősége hogyan hat a végfeladatra?

**Szükséges, de nem elegendő.** Jobb retrieval → jobb végfeladat, de a kapcsolat nem szigorúan monoton. A retrieval javulása nem garantálja a skill helyes alkalmazását.

### RQ5: Relevancia-tudatosak a modellek a skill betöltésnél?

**Nem.** A legtöbb modell közel azonos arányban tölt be skillest, függetlenül attól, hogy van-e gold skill a lekérdezett halmazban. Ez "skill-loading hallucination" — a modell betölt valamit, akkor is, ha nem használható.

Csak a legnagyobb modellek (GLM-5.1, GPT-5.4) mutatnak érdemi szétválasztást gold-covered vs. gold-absent esetek között.

### RQ6: Szükséglet-tudatosak a modellek?

**Nem.** A betöltési arány szinte azonos azon feladatoknál, amiket a modell skill nélkül is meg tud oldani, és azoknál, amiket nem. A skill betöltés nem célzott kompenzációs mechanizmus.

## Jövőbeli kutatási irányok

1. **Strukturált skill könyvtárak** — gráfok, hierarchiák, függőségek a flat lista helyett
2. **Skill minőség-ellenőrzés és evolúció** — offline finomítás, validáció, debuggolás
3. **Utility-aware retrieval** — nem csak szemantikus relevancia, hanem downstream hasznosság alapú rangsorolás
4. **Parametric Skill Augmentation** — gyakori skillek paraméteres modulba (plug-in), nem csak szöveges injekció; a ritka hosszú farok marad a retrieval korpuszban

### Parametric Skill Augmentation (részletesebben)

- Gyakori skillek ismétlődő szöveges injekciója pazarló (kontextus-költség)
- Paraméteres modulként: offline optimalizálható, mélyebben integrálódik a modell belső számításaiba
- Hibrid architektúra: core skillek = paraméteres modulok, long-tail = retrieval korpusz

## Kapcsolódó munkák

- **SkillsBench** (Li et al. 2026) — skillek hatékonyságának értékelése, de nem a retrieval pipeline szétbontása
- **Voyager** (Wang et al. 2023) — élettartam-tanulás skill korpuszszal, de nem retrieval-idő hozzáféréssel
- **RAG** — deklaratív tudás vs. végrehajtható képesség
- **Tool use / Function calling** — limitált API-halmaz vs. nyílt skill korpusz

## Modell-eredmények

Vizsgált modellek: Qwen3-4B/32B/235B, Llama-3.1-8B/3.3-70B, Mistral-Small-3.1-24B, GLM-5.1, GPT-5.4

**Fő megállapítás:** A skill-loading viselkedés erősen modell-függő, nem monoton a mérettel. A frontier modellek (GLM-5.1, GPT-5.4) jobban megkülönböztetik a releváns és irreleváns eseteket, de még ők sem ideálisak.

## Forrás

Su, W. et al. (2026). *Skill Retrieval Augmentation for Agentic AI*. arXiv:2604.24594v1.