# When is Routing Meaningful? Diversity and Robustness in Language Model Societies

**Szerzők:** Fantine Huot, Michael Kaisers, Mirella Lapata (Google DeepMind)
**Forrás:** https://arxiv.org/abs/2607.09197
**arXiv v1:** 2026. július 10.
**Szószám (PDF):** 10,405 szó | **Feldolgozva:** 3 chunk × 3 párhuzamos subagent

---

## arXiv 2607.09197
**Cikk:** *When is Routing Meaningful? Diversity and Robustness in Language Model Societies*
**Szerzők:** Fantine Huot, Michael Kaisers, Mirella Lapata (Google DeepMind)
**arXiv v1:** 2026. július 10.
**Rész hatóköre:** Absztrakt, 1. Bevezetés, 2. Specialisation in Multi-Agent Systems, Related Work, Preliminaries, valamint a Society Diversity (HSE) és a Routing Robustness metrika bevezetése (Section 4–5).

## 1. Bevezetés és a fő tézis: „When is routing meaningful?”

- A cikk alapállítása, hogy az LLM routing kiértékelése jelenleg szinte kizárólag hasznossági szempontok (feladat-pontosság, következtetési költség) mentén történik (pl. FrugalGPT, RouterBench, RouteLLM, MasRouter), pedig két ettől ortogonális szerkezeti tulajdonság határozza meg, hogy a routing egyáltalán értelmes-e.
- **Tulajdonság 1 – Társadalmi diverzitás (HSE(R)):** a társadalom szereplői viselkedésükben differenciáltak legyenek. Ha minden szereplő azonos módon válaszol, a routing tartalmatlan („vacuous”), függetlenül az irányítási házirendtől (Balch 2000; Bettini et al. 2025).
- **Tulajdonság 2 – Routing robusztusság (ρ(π, Q)):** az irányítási házirend legyen stabil felületi (surface-form) variánsokkal szemben; azonos jelentésű, de eltérő helyesírású/szintaxisú/szóhasználatú lekérdezések ne kerüljenek csak ezért más szereplőhöz (Sclar et al. 2024), mert ez ellehetetleníti a specializációt.
- A két tulajdonság együtt jellemzi, mikor értelmes a routing: a diverzitás adja, hogy legyen mibe routolni, a robusztusság adja a specializáció szükséges feltételét. A magas feladat-pontosság mindkettővel kompatibilis anélkül, hogy bármelyik teljesülne — ez a cikk központi figyelmeztetése.
- A szerzők a Hierarchic Social Entropy (HSE, Balch 2000) LM-társadalmakhoz adaptált változatát és egy új, perturbáció-alapú robusztussági metrikát javasolnak, és ezeket az EmbedLLM (Zhuang et al. 2025) és RouterBench (Hu et al. 2024) benchmarkokon validálják.
- Fő empirikus üzenetek (a rész hatókörén belül előrevetítve): a specialista társadalmak HSE-értéke lényegesen magasabb, mint az azonos méretű valós modellkészleteké; erős csökkenő hozamok (< 10 szereplő EmbedLLM-en, 4 szereplő RouterBench-en); a magas HSE nem jelent magas robusztusságot — a KNN routerek pont a specialista társadalmakon adnak jobb pontosságot, de ott a legrosszabb a robusztusságuk, míg a promptolt routing minden perturbációtípusnál stabil marad.

## 2. Kapcsolódó irodalom: HSE, SND, ensemble, quality-diversity, specializáció

- **Balch (2000) Hierarchic Social Entropy (HSE):** információelméleti mérőszám robotswarm-ök viselkedési diverzitására; a cikk ezt adaptálja LM-társadalmakra, a viselkedést model outputokból (nem paraméterekből) mérve (Stanley et al. 2019 nyomán).
- **Bettini et al. (2025) System Neural Diversity (SND):** Wasserstein-távolságot használ többváltozós robot policy action disztribúciók felett; az SND megköveteli, hogy minden agent ugyanazon az akciótéren számítson valószínűséget, ezért heterogén, különböző tool-hozzáférésű LM-ekre nem vihető át.
- **Ensemble learning és quality-diversity:** Krogh & Vedelsby (1994) a diverzitást már tervezési célként kezeli; Mouret & Clune (2015) quality-diversity optimalizációja explicit nagy teljesítményű, diverz megoldáshalmazt keres — párhuzamos motiváció a specialista poolok építéséhez.
- **Specializáció a multi-robot irodalomban:** Labella et al. (2006) response threshold modellje szerint egy agent specializálódik, ha egy adott task küszöbértéke tartósan alacsony marad; Nitschke et al. (2008) Collective Neuro-Evolution (CONE) keretében pedig akkor tekint specializáltnak egy agentet, ha élete > 50%-ában ugyanazt a viselkedési szerepet tölti be — a cikk routing robustness metrikája ezt a szerep-stabilitást formalizálja LM-társadalmakra.
- **LLM routing irodalom:** FrugalGPT (Chen et al. 2024) költség-érzékeny cascade, RouterBench (Hu et al. 2024) multi-LLM routing benchmark, RouteLLM (Ong et al. 2025) preferencia-adatból tanul policy-t erős-gyenge modellek között, MasRouter (Yue et al. 2025) multi-agent környezetben együttesen optimalizálja a collaboration mode-ot, a role allocation-t és a modellszelekciót (Wu et al. 2024; Hong et al. 2024; Li et al. 2023 multi-agent keretrendszereire építve).
- **Robusztusság prompt-perturbációkra:** Sclar et al. (2024) kimutatta, hogy jelentésmegőrző változtatások (karakterzaj, lexikai csere, szintaktikai átalakítás, parafrázis) nagy accuracy-ingadozást okoznak modellmérettől és instruction tuningtól függetlenül; Qiang et al. (2024) válasza az volt, hogy a modelleket tanítsák a clean–perturbed promptokon konzisztens outputra. A cikk ezzel szemben nem a végső válasz stabilitását, hanem a routing döntés stabilitását méri.
- **Ökológiai párhuzam:** Kellert (1996) és Cadotte et al. (2011) a természetes rendszerek funkcionális diverzitását és a túlélésben betöltött szerepét vizsgálja; ugyanaz a hierarchikus nézet köszön vissza a HSE „taxonomic level” koncepciójában (species/genus szintű megkülönböztetés).

## 3. A három fő contribution (a cikk saját felsorolása)

- **C1 – Viselkedési diverzitási metrika LM routing elemzéshez:** a Hierarchic Social Entropy első alkalommal történő adaptálása nyelvi modell társadalmakra, hogy az jellemezze, a routing mikor meaningful.
- **C2 – Perturbáció-alapú robustness metrika + ötszintű taxonómia:** formalizálja, hogy egy routing policy mennyire stabilan rendeli azonos szereplőhoz a szemantikailag ekvivalens lekérdezéseket; az 5 perturbációs szint (Character, Word, Syntax, Paraphrase, Rambling) finom szemcsézettségű elemzést tesz lehetővé.
- **C3 – Erős csökkenő hozamok, gyakorlati coreset heurisztika:** HSE-vel mérve kevesebb mint tíz gondosan választott agent a teljes pool diverzitásának nagy részét visszaadja — ez közvetlenül alkalmazható heurisztika társadalom-tervezéshez.

## 4. Preliminaries és a két szerkezeti tulajdonság formális kerete

- **Jelölés:** R = {r1, …, rN} az N darab szereplő halmaza (különböző modell, prompt, tool-using agent vagy role-specializált konfiguráció lehet); Q = {q1, …, qn} a lekérdezések halmaza; π: Q → R a routing policy, ai = π(qi) az i. lekérdezéshez rendelt szereplő; Qk = {qi ∈ Q | ai = rk} az rk szereplőhoz rendelt lekérdezések.
- **Behavioral vector és mátrix:** minden rk szereplő kiértékelése egy E = {e1, …, eL} evaluation seten egy bk = (s(rk,e1), …, s(rk,eL)) ∈ R^L viselkedési vektort ad, ahol s(rk,el) ∈ [0,1]; ezekből áll a B ∈ R^{N×L} behavioral matrix. A B-ből pairwise cosine similarity-n alapuló távolságot számolnak (nem weight-space Euclidean-t), mert a paraméter-térbeli különbség nem feltétlenül jelent viselkedésbelit (Stanley et al. 2019), és ez a megközelvezés kiterjed olyan társadalmakra is, amelyek közös backbone-on osztoznak, de system promptban vagy tool-hozzáférésben térnek el.
- **Diversity HSE(R):** kizárólag a társadalom tulajdonsága, policy-független; ha HSE(R) ≈ 0, minden szereplő hasonlóan válaszol és a routing vacuous.
- **Robustness ρ(π, Q):** a policy tulajdonsága, R csak a π által indukált döntéseken keresztül játszik szerepet; ha ρ ≈ 0, az szereplők inkonzisztens lekérdezés-elosztást kapnak, ami a specializáció kialakulásának előfeltételét rombolja le.

## 5. Section 4 — Society Diversity és a Hierarchic Social Entropy (HSE) részletes definíciója

- **Simple Social Entropy (Equation 1):** Shannon (1948) entrópiáját alkalmazza egy C = {c1, …, cM} partícióra: H(R) = −Σ pi log2(pi), ahol pi a c1 részhalmazba eső szereplők aránya. Két alapvető tulajdonság: (i) H(R) = 0 iff minden szereplő egyetlen részhalmazba esik; (ii) H(R) maximális, ha az szereplők egyenletesen oszlanak el M részhalmaz között.
- **A simple entropy korlátja (Figure 2):** kizárólag a részhalmaz-arányokon múlik, ezért egy 3 azonos + 1 közeli outlier és egy 3 azonos + 1 távoli outlier társadalmat is H = 0.811-re értékel — azaz a simple entropy nem érzékeny az inter-group távolságra, ami a routing szempontjából kritikus (egy közeli outlier szinte semmit nem ad hozzá a routing-hoz).
- **Inter-szereplő distance (Equation 2):** d(rj, rk) = 1 − (bj · bk) / (‖bj‖ ‖bk‖), azaz 1 − cosine similarity. A cosine-t a Euclidean helyett azért választották, mert a viselkedési vektorok nagysága nagyon eltérő lehet, ha az szereplők átlagos pontossága különbözik; a cél a profil-hasonlóság, nem az abszolút teljesítményszint mérése. Az eredeti HSE (Balch 2000) Eulides-t használt centroid linkage-szel — ezt a szerzők az Appendix E-ben hasonlítják össze a cosine + single linkage verzióval. A SND (Bettini 2025) által használt Wasserstein-távolság azért nem jó, mert teljes action disztribúciókat igényel, ami LM outputokra nem áll rendelkezésre.
- **Taxonomic level h:** a hierarchikus klaszterezés single linkage (nearest-point) algoritmussal fut, h küszöbérték mellett; ez az LM-beállításban azért helyes, mert akár egyetlen viselkedésében elkülönülő szereplő is megérdemel külön klasztert. A h a biológiai taxonómiából kölcsönzött fogalom: a kutató h-val szabályozza a megfigyelés felbontását (species vs. genus szint).
- **H(R, h) viselkedése:** h = 0-nál csak azonos szereplők olvadnak össze, így H(R, 0) = log2 M (M ≤ N, ahol M a különböző viselkedési profilok száma); h → ∞ esetén minden szereplő egy csoportba kerül és H(R, h) = 0.
- **HSE integrálja az entrópiát a teljes h-tartományon (Equation 3):** HSE(R) = ∫₀^∞ H(R, h) dh. Ez a mérőszám folytonos ratio measure abszolút nullával (amikor minden szereplő azonos), ami lehetővé teszi olyan kijelentéseket, hogy „A társadalom kétszer olyan diverz, mint B”, és normalizálás után különböző méretű társadalmak teljes sorrendbe állíthatók.
- **Sanity check – Table 1:** három azonos modell HSE = 0, Norm = 0 (routing valóban vacuous); három ortogonális modell (minden prompton másnál van maximum) HSE = 1.585, Norm = 1.0 — a normalizált érték invariant a társadalom méretére, ami méretfüggetlen összehasonlítást ad.
- **Sanity check – Table 2:** egy háromfős bázis társadalomra (a) a duplikált modell (D = C, case b) és a duplikált prompt (p4 = p3, case c) hozzáadása nem növeli, hanem kissé csökkenti a HSE-t (0.654 → 0.607/0.610, ill. norm 0.413 → 0.405/0.385) — a metrika nem téved meg a redundanciától, ami fontos: a routing rendszer ne tűnjön diverzebbnek pusztán duplikáció miatt.
- **Monotonitás:** a szerzők a 3. ábrán empirikusan igazolják, hogy a HSE monoton nő, ahogy viselkedésében egyre inkább elkülönülő szereplőkat adunk a társadalomhoz.

## 6. Section 5 — Routing Robustness metrika és az ötszintű perturbáció-taxonómia

- **Központi intuíció:** a stabil lekérdezés-hozzárendelés szükséges feltétele a specializációnak — ha a router q1-et rk-hoz, de egy surface-form variánsát rj ≠ rk-hoz rendeli, a feltétel sérül, függetlenül attól, hogy a downstream tanulás mit csinál. A cikk nem állítja, hogy a stabil routing *előidézi* a specializációt (az más tényezőktől függ), csak azt, hogy enélkül nem lehetséges.
- **A ρ(π, Q) metrika:** a n = |Q| lekérdezés feletti aggregáció; a mögöttes feltevés, hogy a jelentésmegőrző perturbációk nem változtatják meg, melyik szereplő a legpontosabb q-re — tehát ha a router a perturbált változatot máshová küldi, az a policy instabilitását tükrözi, nem a környezet változását.
- **Ötszintű perturbáció-taxonómia:**
  - **Level 1 – Character-level:** gépelési hibák, szóköz-variációk, központozás változtatása.
  - **Level 2 – Word-level:** szinonima-helyettesítés.
  - **Level 3 – Syntax-level:** passzív szórend, tagmondat-átrendezés.
  - **Level 4 – Paraphrase:** teljes átfogalmazás azonos jelentéssel.
  - **Level 5 – Rambling:** irreleváns kontextus hozzáadása a lekérdezéshez.
- A két szerkezeti tulajdonság együttesen adja a „meaningful routing” formális definícióját: a diversity biztosítja, hogy legyen nem-triviális routolási célpont, a robustness biztosítja, hogy a döntések kielégítsék a specializáció szükséges feltételét.

### Összegzés

- A cikk központi tézise, hogy a routing meaningfulness-e két, a feladat-pontosságtól ortogonális szerkezeti tulajdonságon múlik: a társadalom viselkedési diverzitásán (HSE) és a routing policy perturbációkkal szembeni robustnesén (ρ).
- A HSE LM-társadalmakra adaptált formája hierarchikus klaszterezéssel és cosine-alapú inter-szereplő távolsággal operál, integrálja az entrópiát a teljes taxonomic level h tartományon, folytonos, normalizálható, és sanity check-ek igazolják, hogy nem érzékeny a redundanciára.
- A routing robustness új, ötszintű perturbáció-taxonómiával (Character → Word → Syntax → Paraphrase → Rambling) méri, hogy a policy konzisztensen ugyanahhoz az szereplőhoz rendeli-e a szemantikailag ekvivalens lekérdezéseket — a specializáció formális előfeltételeként.
- A 1. rész itt zárul: a fenti metrikák definícióját és a sanity check-eket tartalmazza; a kísérleti eredmények (EmbedLLM, RouterBench, specialista vs. valós poolok, KNN vs. prompted routerek divergáló accuracy–robustness viselkedése) a 2. részben következnek.
## When is Routing Meaningful? — 2. rész összefoglaló

**Cikk:** When is Routing Meaningful? Diversity and Robustness in Language Model Societies
**Szerzők:** Fantine Huot, Michael Kaisers, Mirella Lapata (Google DeepMind)
**Dátum:** 2026. július 10. (arXiv v1)
**arXiv ID:** 2607.09197
**Ez a rész:** a cikk 5–7. szakaszait tartalmazza — a perturbation-alapú robusztusság metrika részletes definícióját (5.1–5.2), az 5-szintű perturbation taxonomy-t (Table 3), a teljes experimental setup-ot (6. szakasz: EmbedLLM és RouterBench benchmarkok, 5 routing policy, szintetikus specialista társadalmak, HSE görbék és max-HSE subset), valamint az első eredményeket (7. szakasz). A rész a 8. (Conclusion) szakasz és a Limitations szakasz végével zárul, és tartalmazza a referenciaszakasz nagy részét is. A rész kisebb része az Appendix A elejét is bemutatja (EmbedLLM és RouterBench benchmark-listák, Tables 4–5).

---

## 1. A perturbation-alapú robusztusság metrika részletei

A routing-robosztusság központi definíciója: a szerzők a routing döntések stabilitását mérik a query surface-form változatain, nem a router-t érintő zajon.

- A per-query robosztusság képlete: **ρᵢ = (1/p) · Σⱼ=1..p 1[π(qᵢʲ) = aᵢ]**, ahol `qᵢʲ` a `qᵢ` query `j`-edik perturbációja, `aᵢ = π(qᵢ)` az eredeti hozzárendelés, és `p` a perturbációk száma (5. egyenlet, Eq. 5).
- A ρᵢ értéke [0,1] intervallumba esik: **ρᵢ = 1**, ha minden perturbáció ugyanahhoz az szereplőhoz kerül; **ρᵢ = 0**, ha egyik sem.
- A dataset-szintű aggregált robosztusság: **ρ(π, Q) = (1/n) · Σᵢ ρᵢ** — az összes per-query érték egyszerű átlaga.
- A per-szereplő robosztusság: **ρ⁽ᵏ⁾(π, Q) = (1/|Qₖ|) · Σ_{qᵢ ∈ Qₖ} ρᵢ**, ahol `Qₖ` azon query-k halmaza, amelyeket a `rₖ` szereplőhoz rendeltek; ha `|Qₖ| = 0`, akkor **ρ⁽ᵏ⁾ = 0** definiáljuk (6. egyenlet, Eq. 6).
- **Határ-esetek (anchor cases):** (1) fix router (mindig ugyanazt az szereplőt választja) → **ρᵢ = 1** minden i-re, így **ρ = 1**; (2) uniform random router → **E[ρ] = 1/N** (ahol N az szereplők száma).
- **A metrika mögötti feltételezés:** ha egy eredeti query és aperturbációja szemantikailag ekvivalens, akkor az optimális hozzárendelésnek meg kell egyeznie; a döntés változása tehát a policy instabilitását jelzi, nem a query nehézségére adott legitim választ.
- **Alkalmazási korlát:** a metrika a specializáció kialakulásának **szükséges (de nem elégséges) feltételét** méri — ha a perturbációk instabil hozzárendelést eredményeznek, akkor specializáció sem alakulhat ki.

---

## 2. Az 5-szintű perturbation taxonomy

A robusztusság-metrika nem önmagában értelmes, hanem mindig egy konkrét **perturbation regime**-hez képest — ugyanaz a router lehet stabil felületi zajjal szemben, de instabil szemantikai újrafogalmazás esetén. Ezért a szerzők 5 növekvő szemantikai távolságú osztályt definiáltak (Table 3).

- **Level 1–3 (surface-proximity):** az eredeti query felszínéhez közeli variánsok; tipikusan karakter- vagy szintaxis-szintű zajok, amelyek nem változtatják meg a jelentést.
- **Level 4–5 (semantic reformulation):** a jelentést megőrző, de a szöveget jelentősen átfogalmazó variánsok — ezek tesztlik, hogy a router érzékeny-e a mélyebb, tartalmi változtatásokra.
- A per-class ρ kiszámítása megmutatja, **hol törik el** egy policy: ha egy router csak a 4–5 szinten degradálódik, gyakorlatban robosztusabb, mint egy olyan, amelyik már a 2. szinten is — még ha az aggregált ρ hasonló is.
- Minden egyes query-hez **p = 5** perturbációt generálnak (szintenként egyet), és a dataset-szintű ρ-t ezen 5 variáns együttes átlagaként jelentik.
- A perturbation-ök generálásának pontos prompt-template-jei az **Appendix B.1**-ben találhatók (a rész csak hivatkozik rá).

---

## 3. Experimental setup (EmbedLLM, RouterBench, 5 routing policy)

A szerzők két routing benchmarkon és ötféle policy-vel értékelnek, valamint három szintetikus specialista társadalmat (synthetic societies) konstruálnak az EmbedLLM pool felett.

- **EmbedLLM (Zhuang et al., 2025):** 112 modell teljesítmény-scoresait tartalmazza **10 reasoning és knowledge benchmarkon** (MMLU, GSM8K, GPQA, ASDiv és mások), összesen **36 054 kérdéssel**. A EmbedLLM benchmark-listát a Table 4 részletezi: MMLU (általános tudás, 57 tantárgy), TruthfulQA (factuality), SocialIQA, PIQA, MedMCQA, MathQA, LogiQA, GSM8K, GPQA (graduate-level science), ASDiv (arithmetic word problems).
- **RouterBench (Hu et al., 2024):** kiegészítő routing benchmark, **11 modell** teljesítmény-scoresaival **36 497 lekérdezésen**, amelyek **8 dataset-ből** származnak (részletek az Appendix A-ban, train/val/test split-ek). A Table 5 szerint: HellaSwag, Winogrande, MMLU (57 a 64 taskból), és Conversation, Math, Coding kategóriák.
- **Öt routing policy:**
  - **random** — egyenletes eloszlással mintavételez egy szereplőt minden query-hez.
  - **prompted** — egy LLM-et promptolnak az szereplő-szerepek természetes nyelvű leírásával és few-shot példákkal (prompt template: Appendix C).
  - **KNN-k (k ∈ {1, 3, 10})** — a query embedding-terében megkeresik a `k` legközelebbi szomszédot, és azt az szereplőt választják, amelyik ezeken a szomszédokon a legjobban teljesített (részletek: Appendix D).
- **Szintetikus specialista társadalmak (EmbedLLM-en, a default HSE=1.62 poolhoz képest):**
  - **RD (Reasoning Depth):** 5 nem-átfedő expert, amelyek a kognitív komplexitás 5 szintjét fedik le (direkt lookup → komplex multi-step reasoning), **HSE = 2.32**.
  - **SA (Subject Area):** 15 nem-átfedő expert, amelyek különböző akadémiai/praktikus domainekre specializálódnak (haladó matematika, computer science, orvostudomány, commonsense reasoning stb.), **HSE = 3.91**.
  - **RD+SA:** a kettő kombinált poolja, **20 expert** részben átfedő expertise-szel, **HSE = 3.19**.
- **Oracle accuracy:** minden szintetikus társadalom felett az oracle pontosság definíció szerint **1.0**, mert minden query pontosan egy expert domainjébe esik.
- **max-HSE subset:** minden benchmarkon a teljes poolból greedy módon kiválasztott részhalmaz, amely egy adott társadalom-méretnél maximalizálja a normalizált HSE-t — ez a magas-diverzitású referenciapont a valós modellek között. A RouterBench-en a teljes társadalmat a max-HSE subset-tel hasonlítják össze.
- **HSE számítási részletek:** cosine distance + single linkage (greedy szereplő selection). Expert-kategorizálási heurisztikák: Appendix A.3. A HSE-t kombinálni lehet a feladat-pontosság-val közös kiválasztási kritériumként (Appendix F).

---

## 4. A HSE görbék és az első eredmények (diminishing returns, KNN vs prompted)

A 7. szakasz (Results and Analysis) első eredményei a normalizált HSE-t mint társadalom-méret függvényét, valamint a KNN és prompted routerek éles trade-offját mutatják be.

- **Specialista társadalmak lényegesen diverzebbek.** A Figure 3 (normalizált HSE vs. társadalom-méret, EmbedLLM) azt mutatja, hogy bármely rögzített méretnél a célzottan tervezett specialista társadalmak magasabb HSE-t érnek el, mint a default valós modell-pool.
- **SA (HSE = 3.91) több mint kétszer olyan diverz**, mint a default (HSE = 1.62); az **RD+SA kombinált pool (HSE = 3.19)** szintén felülmúlja a default-ot, pedig sokkal kevesebb szereplőt tartalmaz. Ez azt jelzi, hogy a valós modellek nagy száma a viselkedési tér hasonló régióit foglalja el: a méret önmagában nem jelent diverzitást.
- **Erős diminishing returns** minden társadalmon: a marginális nyereség az újabb actrok hozzáadásával gyorsan esik. A default társadalom görbéje **~9 szereplő után plateauol**; a szintetikus RD és SA specialista poolok **~4–5 szereplő után** még hamarabb, mert a viselkedési profilok konstrukció szerint maximálisan ortogonálisak.
- **KNN routerek: pontosság nő, robosztusság összeomlik specialistáknál.** A Figure 4(a) szerint a KNN routerek feladat-pontossága élesen és monoton nő a HSE növekedésével; a perturbed-query accuracy viszont minden specialista társadalomnál **közel véletlen szintre** zuhan. A Figure 4(b) megerősíti: a robosztusság ρ alacsony marad a teljes HSE-tartományban, pedig a clean-query accuracy magas. Az éles viselkedési határok — amelyek a clean query-knél könnyűvé teszik a routingot — épp ilyen könnyen okoznak hibát, ha egy felületi átfogalmazás a query embeddingjét átlöki egy domain-határon.
- **Prompted router: fordított minta.** Clean accuracy az SA-n alacsonyabb, mint a KNN-10-é, de a perturbed accuracy szinte változatlan marad (kevesebb mint 5 pontos szakadék). A robosztusság **monoton nő a HSE-vel** — ezt egyetlen KNN-router sem produkálja. A prompted router a query szemantikai intentjére tapad, nem az embedding-pozíciójára, így természetesen stabil a jelentés-megőrző átfogalmazásokkal szemben.
- **max-HSE subset hatás: policy-függő.** A Figure 5 a teljes poolt a max-HSE subset-tel hasonlítja össze (EmbedLLM és RouterBench). A prompted router robosztussága **közel megduplázódik** az EmbedLLM-en, és szerényebben javul a RouterBench-en. A KNN routerek története összetettebb: a RouterBench-en a max-HSE subset **minden k értékre drámaian megmenti** a robosztusságot, míg az EmbedLLM-en a **KNN-1 robosztussága valójában csökken**, a KNN-3 és KNN-10 pedig csak marginálisan javul. Ennek oka a két pool struktúrájának különbsége: a RouterBench subset sima, gradált viselkedési profilokból válogat (ahol a magasabb diverzitás élesíti az szereplő-különbségeket éles domain-határok nélkül), míg az EmbedLLM pool — még maximális HSE mellett is — kevésbé strukturált viselkedési szeparációt mutat, így a nearest-neighbour routing érzékeny marad a query felületi variációira.

---

## 5. a rész további specifikus témái: a Conclusion, a Limitations és a referenciaszakasz

### 5.1 Conclusion (8. szakasz)

- A cikk amellett érvel, hogy a routingot a feladat-pontosságon **túl két strukturális dimenzióban** kell értékelni: viselkedési diverzitás (HSE) és routing stabilitás (ρ).
- **A diverzitás-módszer:** a Hierarchic Social Entropy-t adaptálták nyelvi modell-társadalmakra, cosine similarity-t használva a viselkedési vektorok közötti távolságként.
- **A robosztusság-módszer:** egy perturbáció-alapú metrika, amely a query surface-form variánsainak ugyanahhoz az szereplőhoz való hozzárendelési arányát méri.
- **Fő empirikus megállapítások:** (1) a HSE erős diminishing returns-t mutat — kevesebb mint 10 szereplő megragadja a rendelkezésre álló diverzitás nagy részét, ami gyakorlati heurisztikát ad a társadalom-tervezéshez; (2) a robosztusság és az accuracy éles trade-offban áll: a KNN routerek magas accuracy-t érnek el specialista társadalmakon, de perturbáció alatt összeesnek, míg a prompted routerek kevésbé accurat-ak, de stabilabbak minden perturbation-típus és társadalom-konfiguráció mellett.
- A HSE és a routing robosztusság együttesen azt a kérdést teszik fel: **nem csupán azt, hogy a router jól teljesít-e, hanem azt, hogy a routing értelmes-e** — azaz a társadalam elég differenciált-e a routing döntések igazolásához, és a policy teljesíti-e a specializáció szükséges feltételét.

### 5.2 Limitations

- **Measurement assumptions (HSE):** a HSE-t egy fix `E` értékelési halmaz felett számítják; ha ez a halmaz nem reprezentatív a deployment query-eloszlásra, a viselkedési vektorok nem tükrözik a telepítési viselkedést, és a diverzitás-becslés félrevezető lehet.
- **Greedy subset selection:** a max-HSE subset-et greedy módon választják, ami nem garantálja a globálisan optimális részhalmazt egy adott méretnél — a valódi optimum exponenciális keresést igényelne.
- **A szintetikus társadalmak korlátai:** a szerzők bináris performance-indikátorokat használnak, amelyek maximálisan éles viselkedési határokat és konstrukció szerinti oracle accuracy-t (1.0) eredményeznek; a valós specialista agentek puhább, átfedő profilokat mutatnak, és a KNN-eknél megfigyelt ridegség a gyakorlatban enyhülhet.
- **Scope of the robustness metric:** a routing robosztusságot az **assignment szintjén** mérik single-turn query-knél, és nem ragadja meg, hogy az szereplők valóban kifejlesztenek-e specialista kompetenciát a stabil query-eloszlások eredményeként. A metrika kiterjesztése multi-step agentic settingekre (ahol a perturbáció az állapoton, nem egyetlen query-n keresztül terjed) természetes következő lépés — csakúgy, mint a HSE training-signal-ként való használata a bootstrappeléshez egy homogén kezdeti állapotból.

### 5.3 a részben megjelenő referenciák kulcsszereplői

- A cikk kontextusában fontosabb munkák: FrugalGPT (Chen et al., 2024), RouteLLM (Ong et al., 2025), MasRouter (Yue et al., 2025), AutoGen (Wu et al., 2024), MetaGPT (Hong et al., 2024), CAMEL (Li et al., 2023), LLM-Blender (Jiang et al., 2023).
- A diverzitás-elméleti alap: Balch (2000) Hierarchic Social Entropy, valamint System Neural Diversity (Bettini et al., 2025), az ecology-ból Cadotte et al. (2011) functional diversity, a robotikából Labella et al. (2006) division of labor.
- Az EmbedLLM és RouterBench forrás-benchmarkjai között megjelennek: HellaSwag, Winogrande, MMLU, PIQA, SocialIQA, MedMCQA, MathQA, LogiQA, GSM8K, GPQA, ASDiv, TruthfulQA, ARC (Clark et al., 2018), MBPP (Austin et al., 2021).

---

### Összegzés

A rész a cikk módszertani magját és első empirikus eredményeit tartalmazza: a **perturbation-alapú robosztusság-metrika** (per-query ρᵢ, dataset-szintű ρ, per-szereplő ρ⁽ᵏ⁾; fix router = 1, random = 1/N) egy **5-szintű perturbation taxonomy**-ra épül, ahol az 1–3 szint a surface-proximity, a 4–5 a szemantikai reformulation. Az experimental setup két benchmarkra épül: **EmbedLLM (112 modell, 36 054 kérdés, 10 benchmark)** és **RouterBench (11 modell, 36 497 lekérdezés, 8 dataset)**, 5 routing policy-val (random, prompted, KNN-1/3/10). A fő eredmény, hogy a **HSE erős diminishing returns-t mutat** (~9 szereplő a default poolnál, ~4–5 a synthetic specialistáknál), és hogy a **KNN és prompted routerek éles trade-offban állnak**: a KNN magas accuracy-t ad specialistáknál, de perturbáció alatt összeesik; a prompted kevésbé accurat, de stabil, és a robosztussága monoton követi a HSE-t. A max-HSE subset hatása policy- és pool-függő (RouterBench-en minden KNN-t megment, EmbedLLM-en a KNN-1-et rontja).
## ArXiv 2607.09197 — 3. rész összefoglaló

**Cikk:** *When is Routing Meaningful? Diversity and Robustness in Language Model Societies*
**Szerzők:** Fantine Huot, Michael Kaisers, Mirella Lapata (Google DeepMind)
**Dátum:** 2026. július 10. (arXiv v1)
**Rész tartalom:** Appendix A.1–F — kizárólag appendixe anyag (nincs benne Related Work vagy Conclusion szekció, ezek feltehetően az 1. rész/2. részben szerepeltek).

> Megjegyzés a rész-határokról: a 3/3 rész valójában kimerítően a függelékeket (A–F) tartalmazza — benchmark-leírások, szintetikus társadalmak, perturbáció-generálás, router policy, KNN, valamint kiegészítő táblázatok/ábrák. Related work és conclusion szövegrészlet nincs a részben, így a konklúzióra vonatkozó megállapítások csak a kísérleti megfigyelésekből következtethetők.

## EmbedLLM benchmark részletek

- Az **EmbedLLM** (Zhuang et al., 2025) egy model routing és correctness-forecasting benchmark, amely **112 nyílt forráskódú nyelvi modell** bináris teljesítménymátrixát tartalmazza, méretben és specializációban (general-purpose, coding, biomedical, physics) széles skálán.
- A 112 modellt **36 054 kérdésen** értékelték, amelyek tíz bevált benchmark tesztkészleteiből származnak (összefoglalva Table 4-ben).
- Minden modell–kérdés párra a label rögzíti, hogy a modell helyesen válaszolt-e (1) vagy sem (0), így egy **Y ∈ {0,1}^(112×36054)** helyességmátrixot kapunk.
- A kérdések egy része duplikátum vagy közel-duplikátum volt (csak a feleletválasztós opciók sorrendjében különböztek), ezért **~3000 promptot kiszűrtek**.
- A megmaradt kérdéseket **80% / 10% / 10%** arányban train / validation / test splitre osztották (kb. **26K / 3.6K / 3.6K** kérdés).
- A cikkben minden modellt `rk ∈ R` aktorként kezelnek, a sorok alkotják az aktor viselkedési vektorát `bk`. A **teljes 112 modell** az alapértelmezett társadalom; a **max-HSE részhalmaz** a mohó kiválasztással nyert 9 modellből álló halmaz, amely a normalizált HSE-t maximalizálja (Section 6).

## RD/SA szintetikus társadalmak (Reasoning Depth, Subject Area)

- A szintetikus társadalmakhoz a szerzők az EmbedLLM **67 evaluation itemét** használják: **57 MMLU subject** + **10 további benchmark** (GSM8K, MathQA, ASDiv, LogiQA, GPQA, MedMCQA, TruthfulQA, SocialQA, PIQA).
- **Subject-Area klaszterezés (SA):** a 67 itemet **15 kölcsönösen kizáró subject-area klaszterbe** sorolják; a besorolás kritériuma a tudományos domain, függetlenül a szükséges érvelés mélységétől (Table 6). A klaszterek: Elementary & school arithmetic; Advanced & university mathematics; Logic, argumentation & formal reasoning; Physics & astronomy; Chemistry & earth sciences; Biology, genetics & virology; Clinical medicine & healthcare; Computer science, AI & cybersecurity; Economics, business & accounting; Law & legal reasoning; Ethics, philosophy & religion; Psychology & behavioural sciences; Politics, international relations & security; History, geography & world knowledge; Commonsense & physical intuition.
- Minden szintetikus SA-ágens egy bináris teljesítményvektort kap: **1 a klaszterébe tartozó minden itemen, 0 mindenhol máshol** — tökéletes, de szűk specialista.
- **Reasoning-Depth klaszterezés (RD):** ugyanaz a 67 item **5 érvelési mélységi szint** egyikébe kerül, szigorúan rendezett skálán a felszíni visszaidézéstől az adversariális szakértői érvelésig. A besorolás a helyes megoldáshoz szükséges domináns kognitív művelet, nem a témakör alapján történik.
- Az öt RD szint: **R1 (Direct Lookup, 13 item)** — egylépcsős visszaidézés, nincs inferencia; **R2 (Concept Application, 21 item)** — egy inferencialépés szabály/fogalom alkalmazására (PIQA, SocialQA, TruthfulQA); **R3 (Multi-Step Reasoning, 21 item)** — két vagy több függő inferencialépés komponálása (GSM8K, MathQA, MedMCQA); **R4 (Formal Symbolic Reasoning, 7 item)** — formális rendszer mechanikus alkalmazása (LogiQA, ASDiv); **R5 (Adversarial & Expert-Level, 5 item)** — sekély heurisztikák kijátszására tervezett, mély domain-szakértelmet igénylő itemek (GPQA, négy MMLU Professional subject).
- A SA-val analóg módon minden RD-ágens **1 a saját szintjének összes itemén és 0 máshol**.
- Néhány vitatható határbesorolás a cikkben explicit dokumentálva van: az Econometrics a haladó matematikába került (statisztikai modellezés dominál), a GPQA a Chemistry & Earth Sciences klaszterbe (graduate szintű kémia), TruthfulQA a Psychology & Behavioural Sciences-be (episztemikus/pszichológiai jelleg); Business Ethics a Law & Legal Reasoning alá (corporate governance túlsúly). RD-ben: TruthfulQA R2 (egyetlen értékelő ítélet), LogiQA R4 (formális szabályok), ASDiv R4 (szabályalkalmazás), GPQA R5 (szakértők is csak ~65%-os teljesítményt érnek el).

## RouterBench részletek

- A **RouterBench** (Hu et al., 2024) egy átfogó benchmark multi-LLM routing rendszerek értékelésére, amely széles feladat- és domainskálát fed le.
- A dataset **405 467 előre generált inferenciamintát** tartalmaz, **11 LLM** válaszaival — hat nyílt forráskódú (Llama-70B-chat, Mixtral-8x7B, Yi-34B-chat, Code Llama34B, Mistral-7B-chat, WizardLM-13B) és öt zárt (GPT-4, GPT-3.5-turbo, Claude-instant-v1, Claude-v1, Claude-v2) — értékelve **8 dataseten, 64 feladaton** (Table 5).
- Minden minta rögzíti a modell válaszát, egy minőségi pontszámot és az inferencia dollárköltségét — lehetővé téve a task performance és gazdasági költség együttes értékelését.
- Routing kísérletekhez a datasetet **80% / 10% / 10%** train / validation / test splitre osztják (kb. **29K / 3.6K / 3.6K** prompt).
- A cikkben mind a 11 modellt `rk ∈ R` aktorként kezelik, bináris helyességi labelekkel a viselkedési mátrix `B` elemeiként. A **teljes 11 modell** az alapértelmezett társadalom; a **max-HSE részhalmaz** mohó kiválasztással nyert 4 modellből áll, amely a normalizált HSE-t maximalizálja.

## Perturbáció-generálás (Appendix B)

- A query-perturbációkat LM-mel generálják, **Gemini 3.1 Flash-Lite** (Pichai et al., 2025) backbone-nal.
- Öt zero-shot promptot használnak, mindegyik **10 rewrite-et** kér a bemeneti `{prompt}`-ból az adott szintnek megfelelő perturbációs utasításokkal: **karakter, szó, szintaxis, parafrázis, rambling** szintek.
- A kérés azért 10, mert a modell néha duplikátumokat produkál — a kimenetből **5 egyedi variánst** tartanak meg kategóriánként.
- Példa EmbedLLM perturbációkra: eredeti prompt "How can I get something sweet even when I am not eating sugar?" → L1 (Character): "Hoq can I get somethin gswwet even when I am not eating suagr?"; L2 (Word): "How can I satisfy a sweet tooth if I am not consuming sugar?"; L3 (Syntax): "If I am abstaining from sugar, how can I still enjoy something sweet?"; L4 (Paraphrase): "How can I satisfy a craving for sweetness without consuming any sugar?"; L5 (Rambling): "System status: online. How can I get something sweet even when I am not eating sugar?".

## Prompted Router Policy és KNN router (Appendix C–D)

- A prompted router policy **Gemini 3.1 Flash-Lite**-ot használ LM-backbone-ként, few-shot prompt template-tel, amely a nyelvi modellt kéri, hogy válassza ki a legalkalmasabb aktort egy adott query-hez, kondicionálva (i) az egyes aktorok természetes nyelvű leírására és (ii) a train splitből vett few-shot exemplárokra.
- Minden aktorból **k exemplárt** véletlenszerűen mintavételeznek train promptokból, ahol az adott aktor egyértelmű győztes, vagyis score-ja legalább **δ margóval** meghaladja az összes többi aktorét; a **k=4** és **δ=0.4** értékeket használják. Ha kevesebb mint k prompt elégíti ki ezt a kritériumot, fallbackként olyan train promptokból vesznek, ahol az adott aktor érte el a legmagasabb score-t (más aktrokkal holtversenyben is).
- A szintetikus társadalmakhoz az `actors_description` mezőbe knowledge-domain leírásokat injektálnak: SA-nál 15 specialista (elementary_math, advanced_math, logic, physics, chemistry, biology, medicine, computer_science, economics, law, philosophy, psychology, politics, history, commonsense); RD-nél 5 specialista (direct_lookup, concept_application, multi_step, formal_symbolic, adversarial).
- A **KNN router** a query embeddingjét `e(q)` a **Gemini Embedding 2** (Lee et al., 2025) backbone-nal számítja, majd cosine similarity-vel a k legközelebbi szomszédot `Nk(x)` keresi ki a train setből, és a k legközelebbi szomszédra számított legmagasabb score-ú aktort rendeli hozzá.

## Distance metric és linkage érzékenység, illetve modell-szelekciós trade-off (Appendix E–F)

- A **Figure 7** a normalizált HSE-t ábrázolja a társadalom méretének függvényében **mind a 12 kombinációját** a distance metric-nek (cosine, correlation, euclidean, manhattan) és linkage módszernek (single, complete, average), mohó ágens-szelekcióval EmbedLLM-en.
- A kvalitatív minta **minden konfigurációban konzisztens**: a specialista társadalmak gyorsan magas HSE-n plateauolnak, míg az alapértelmezett valós modellkészlet lényegesen alacsonyabb HSE-n plateauol — a fő megállapítás nem függ a distance/linkage választástól.
- A **cosine distance single linkage**-kel (amit a fő szövegben használnak) adja a **legkonzervatívabb** diverzitás-becslést az alapértelmezett társadalomra.
- A **Table 7** a feladat-pontosság és a társadalmi diverzitás (normalizált HSE) értékeit mutatja különböző routing policy-kra az EmbedLLM társadalom két szelekciós kritériummal választott részhalmazain: (i) pusztán HSE maximalizálásával, illetve (ii) HSE és feladat-pontosság együttes maximalizálásával.
- A tisztán HSE-alapú szelekció **minden méretben magasabb** normalizált HSE-t ér el, de **alacsonyabb routing feladat-pontosságot**; a feladat-pontosság hozzáadása a szelekciós kritériumhoz visszaállítja a routing teljesítményt (n=9-nél KNN-10 a teljes 112 modellel azonos 0.65-ös accuracy-t ér el, oracle 0.92), de alacsonyabb HSE-vel (0.48 vs. 0.53).
- A **HSE + acc. részhalmaz n=9-nél kevesebb mint 10%-át** használja a rendelkezésre álló modelleknek, és versenyképes routing accuracy-t ér el — ez egy praktikus coreset, ami egyensúlyoz a diverzitás és teljesítmény között.

## Konklúzió, jövőbeli irányok, limitációk (a kísérleti eredményekből rekonstruálva)

- **Megjegyzés:** a 3. rész nem tartalmaz önálló Related Work / Conclusion szekciót; az alábbi pontok a függelékekben rögzített módszertani döntésekből és a fő szövegben (1. rész/2. rész) idézett megállapításokkal való konzisztenciából következtethetők.
- A szerzők kutatásának egyik legfontosabb módszertani tanulsága, hogy a **specialista-társadalmak diverzitása gyorsan plateauol** magas HSE-értéken, míg a **valós, default modellkészletek lényegesen alacsonyabb szinten** — ez a fő érv amellett, hogy a routingnak csak akkor van értelme, ha a társadalom valóban sokszínű.
- A **diverzitás-pontosság trade-off** explicit: a pusztán diverzitásra optimalizált részhalmazok kisebb pontosságúak, mint a pontosságot is figyelembe vevők — a kettő együttes kezelésével (HSE + acc.) <10%-os modellhasználattal elérhető a teljes társadalom teljesítménye.
- A perturbációs robusztusság vizsgálatából (Appendix B) kiderül, hogy **5 különböző zaj-szinten** (karakter, szó, szintaxis, parafrázis, rambling) tesztelnek — ez a legfinomabb granularitás a routing-robosztusság mérésére.
- A limitációk egyike, hogy a szintetikus SA/RD társadalmak **tökéletes, de bináris** specialisták — ez idealizált felső korlátot jelent; a valós modellek általában sztochasztikusak és parciálisan kompetensek több klaszterben is.
- További limitáció, hogy a RouterBench és EmbedLLM **kvázi-diszjunkt modell-univerzumot** használnak (11 vs. 112 modell), ami megnehezíti az eredmények közvetlen összevetését és általánosítását.
- A jövőbeli irányokra utaló módszertani elemek: a **Gemini 3.1 Flash-Lite** és **Gemini Embedding 2** alkalmazása perturbáció- és embedding-backbone-ként egységesíti a kísérleti infrastruktúrát; a **k=4, δ=0.4** few-shot router-konfiguráció egy konkrét, reprodukálható alapbeállítás.

## Összegzés

- A 3/3 chunk kimerítően dokumentálja a két fő benchmarkot (EmbedLLM: 112 modell × 36054 kérdés; RouterBench: 11 modell × 64 feladat × 405467 minta) és a két szintetikus társadalom-konstrukciót (15 subject-area klaszter és 5 reasoning-depth szint, 67 EmbedLLM itemre építve).
- A perturbáció-generálás ötszintű (karakter, szó, szintaxis, parafrázis, rambling), Gemini 3.1 Flash-Lite-tal, kategóriánként 5 egyedi variánssal; a KNN és a prompted router policy (k=4, δ=0.4) konkrét, reprodukálható alapbeállításokat ad.
- A tizenkét distance × linkage kombináció és a két modell-szelekciós kritérium (HSE vs. HSE+acc.) egyaránt megerősíti, hogy a specialista társadalmak diverzitása robusztusan magas, míg a default társadalmaké alacsony — ez a cikk központi módszertani üzenete.
- A részben nincs explicit Related Work és Conclusion szekció, így a kutatás tágabb kontextusba helyezése és a jövőbeli irányok az 1. rész/2. rész anyagából egészíthetők ki.
