# Laya: 33 ms-os System 1 döntési motor kalibrált valószínűségekkel, és a Jev-vita

> **Szerző:** Nandakishor Mukkunnoth (Founder & CEO, ConvAI Innovations)
> **Megjelenés:** 2026-09-18
> **Forrás:** https://laya.convaiinnovations.com/ (azonos a dev.to poszttal)
> **Kód:** https://github.com/NandhaKishorM/laya (Apache-2.0, ~8 800 csillag a feldolgozáskor)
> **Modellek:** https://huggingface.co/convaiinnovations/laya (3 checkpoint, egy repóban)
> **Csomag:** `pip install laya` (PyPI 0.3.4)
> **Típus:** technikai blog-bejegyzés, nem peer-reviewed tanulmány
> **Terjedelem:** ~2 000 szó, 12 perc olvasás

---

## Összegzés

- A szerző egy **nem-autoregresszív döntési modellcsaládot** mutat be (Laya), amely nem generál szöveget, hanem egyetlen forward passban ad **kalibrált valószínűségeket** strukturált sémákra. A mérési alap: **32,8 ms** egy GPU-n (7,2 ms kérdésenként batchelve), szemben a TypeSafe Jev 236-276 ms-jával.
- **Három döntési primitív** alkotja a felületet: `choice` (egy opció választása egy kritérium-szótárból, eloszlással), `score` (ordinális rubrika, pl. 0-3 sürgősség) és `noul` (közvetlen logikai kérdés kalibrált P(igaz) értékkel). Mivel a kimeneti tér kizárólag valószínűségekből és számokból áll, **sémahiba és hallucináció fizikailag lehetetlen**.
- **A kalibráció a cikk legerősebb mérőszáma.** Az ECE (Expected Calibration Error) **0,246-ról 0,081-re** javul, ami háromszoros javulás. A szerző külön kiemeli, hogy a generatív LLM-ek „confidence: 0.95” kimenete mögött **nulla matematikai kalibráció** van: a modell csak olyan tokeneket generál, amelyek magabiztosnak hangzanak.
- **A routing nem kényelmi funkció, hanem hibaelleni védelem.** Az 51 nyelves MASSIVE-vizsgálatban az angol checkpoint **Khmer nyelven 0,000 pontosságot** ért el **0,952 átlagos magabiztosság mellett**, egyetlen helyes döntés sem 100 kérdésből, miközben a modell 95%-ot állított. Az önbizalom tehát **nem figyelmeztet**, ha a modell nem tudja olvasni az írásrendszert; a modellválasztást a forward pass **előtt** kell meghozni.
- **A három checkpoint** egy Hugging Face repóban él, ahonnan az SDK az `allow_patterns` segítségével csak a kért alkönyvtárat tölti le (808 MB vagy 647 MB a 2,5 GB-os bundle helyett).
- **A szerző nyíltan felsorolja a korlátokat:** 20+ opció felett a `choice` romlik (a Banking77 77 címkéjén 0,425 a Jev 0,870-ével szemben), a zero-shot alapmodell ~0,35-öt ad (gyakorlatilag véletlen), a 0,766-os pont a benchmark tanítóhalmazán való finomhangolás eredménye, és a nyers súlyok hőmérséklet-kalibrálatlanok.
- **A cikk politikai éle:** a szerző szerint a TypeSafe AI 2026 szeptemberében „teljesen új tudományos áttörésként” vezette be ugyanazt a koncepciót, amit ő 2025 márciusában publikált, nyílt súlyok, technikai paperek és nyílt tanítóadat nélkül. **Az ellenőrzés ezt részben támasztja alá, részben nem** (lásd a kritikai szakaszt).

---

## A kontextus: a „System 1” hullám és a Jev-ügy

A cikk egy személyes sérelem-nyitánnyal indul, ami egyben a motiváció is. A szerző 2025 márciusában publikálta az első munkáját (arXiv:2503.23303), közzétette a súlyokat a Hugging Face-en, nyílt adathalmazt tett közzé, PyPI-csomagot épített, és megírta a megközelítést a Redditen. 2025 szeptemberében egy második paper következett. A „vezető agy” a rendszerében mindvégig a **megerősítéses tanulás** volt, nem pusztán egy beágyazó modell.

Majd 2026 szeptemberében a TypeSafe AI, amit Diogo Almeida alapított, aki az OpenAI-nál a ChatGPT egyik társfeltalálója és az RLHF kidolgozója volt, bemutatta a **Jev**-et, és ugyanazt a nem-autoregresszív döntési koncepciót javasolta, mintha vadonatúj tudományos áttörés lenne.

A szerző technikai leírása szerint a különbség a horizontban van: a korábbi modellje **PPO-t** használt szekvencia-reprezentációkon, és vertikális értékesítési beszélgetésekben adott körről körre konverziós trajektóriákat (0,0-1,0 valószínűségeket). A Jev ezt **horizontálisan** általánosította, párhuzamos mintavétellel, amit RLCD-nek (Reinforcement Learning for Calibrated Decisions) neveztek el.

A szerző válasza nem a panaszkodás lett, hanem egy **teljesen nyílt, horizontális System 1 döntésimodell-család**: a Laya. A mondat, ami a cikk egészét összefoglalja: *„mivel helyesen, bidirekcionális enkóderekre építettük, a modelljeink 32,8 ms alatt futnak egyetlen GPU-n, 6-8-szor gyorsabban, mint a Jev.”*

## A három döntési primitív

A Laya bármilyen állapotot (nyers szöveg, e-mail, ticket, JSON-dokumentum) kiértékel egyetlen forward passban, három primitíven keresztül:

- **`choice`**, válassz egy opciót egy kritérium-szótárból. Visszaadja a kiválasztott kulcsot, az **összes opció fölötti valószínűség-eloszlást** és egy kalibrált magabiztossági pontot.
- **`score`**, helyezd az állapotot egy **ordinális rubikára** (0, 1, 2, … szintek). Visszaadja a várható szintet, a rubrika-rangok fölötti eloszlást és a magabiztosságot.
- **`noul`**, közvetlen logikai kérdés, ami kalibrált P(igaz) értéket ad 0,0 és 1,0 között (a P(hamis) = 1 - P(igaz) konstrukcióból adódik).

A szerző központi érve, hogy a modern AI-pipeline-ok legnagyobb szűk keresztmetszete az, hogy **generatív LLM-eket hívunk egyszerű reflex-döntésekre**. Amikor egy támogatási ticket érkezik, vagy egy e-mail bejön, valójában csak egyszerű, strukturált kérdésekre kell válaszolni:

- Melyik osztály kapja ezt a ticketet?
- Ez az e-mail adathalász támadás vagy spam?
- Ez a prompt jailbreak-kísérlet vagy injektálás?
- Mennyire sürgős ez egy 0-3-as rubikán?
- Igényel ez a kérdés kódfuttatást vagy elég egy tényválasz?

Ezekre egy 8B, 70B vagy frontier modellt hívni a szerző szerint **teljes túltervezés**: 500-2 000 ms várakozás, valós inferenciaköltség, majd regex vagy JSON-parser írása, hogy tiszta címkét nyerjünk ki szabad szövegből.

## A három checkpoint és a bundle-architektúra

A szerző elismeri, hogy egy modell nem lehet optimális minden feladatra és nyelvre. Ezért három specializált checkpoint készült, egyetlen Hugging Face repóban:

- **`convaiinnovations/laya`**. ModernBERT-large gerinc, 421M paraméter, 512 kontextus. Angol szövegosztályozás, guardrail-ek, e-mail triage.
- **`convaiinnovations/laya-multilingual`**, mmBERT-base (256k szókészlet), 322M paraméter, 1024 kontextus (8k-ig). 100+ nyelv, 2,2-szer gyorsabb, cross-lingual NLI.
- **`convaiinnovations/laya-typed-decisions`**. ModernBERT-large, 421M paraméter, 1024 kontextus. Agent-megfigyelhetőség, ügyfélszolgálat, számlafeldolgozás, biztonsági riasztások (0,766 pontosság).

A bundle-megoldás technikailag figyelemre méltó: ahelyett, hogy a felhasználónak három külön repót kellene kezelnie vagy 2,5 GB súlyt letöltenie, a fő repó mindhármat tartalmazza, és az SDK a Hugging Face `allow_patterns` mechanizmusával **csak a kért alkönyvtárat** tölti le:

```python
## Letölti az angol modellt (~808 MB)
agent_en = laya.load("convaiinnovations/laya")

## CSAK a multilingual alkönyvtárat tölti le (~647 MB), nem a teljes 2,5 GB bundle-t
agent_ml = laya.load("convaiinnovations/laya", subfolder="multilingual")
```

## Miért létszükséglet a routing: a több-írásrendszer valóság

Ez a cikk technikailag a legerősebb része. Az 51 nyelves MASSIVE-vizsgálatban (20 opció, véletlen alapvonal = 0,050) a szerző azt mérte, hogyan vallanak kudarcot az angol modellek a latin írásrendszeren kívül. A ModernBERT-large 50 000 tokenes angol BPE szókészlete egyszerűen **szétroncsolja** a nem-latin ábécéket:

- **Khmer:** 0,000 pontosság **0,952 átlagos magabiztosság mellett**, egyetlen helyes döntés sem 100 kérdésből, miközben ~95% önbizalmat jelentett.
- **Örmény:** 0,050 pontosság (pontos érmefeldobás) 0,885 magabiztosság mellett.
- **Héber:** 0,060 pontosság 0,964 magabiztosság mellett.
- **Bengáli:** 0,080 pontosság 0,945 magabiztosság mellett.
- **Hindi:** 0,100 pontosság 0,941 magabiztosság mellett.

A szerző tanulsága tömör: az angol checkpoint átlagos magabiztossága 51 nyelven **soha nem csökken 0,885 alá**, függetlenül attól, hogy a pontossága 82% vagy 0%. Ezért **a magabiztossági kapuzás nem véd meg**, a modellválasztásról a forward pass előtt kell dönteni.

A megoldás egy beépített Router, amely a bejövő szöveg Unicode írásrendszerét vizsgálja **22 ábécé** fölött (devanagari, CJK Han, cirill, arab, héber, tamil, thai stb.), és emellett a latin stopword-eloszlásokat elemzi. A mérési overhead elhanyagolható:

- Szabványos angol szöveg: **0,09 ms**
- Devanagari / indiai szöveg: **0,54 ms**
- Nagy, 200 soros beágyazott JSON-dokumentumok: **0,73 ms**

A 33 ms-os forward passhoz képest ez **2% alatti** többlet. A `Router(preload=True)` emellett a szükséges modelleket VRAM-ban/RAM-ban tartja, amivel a 7-10 másodperces hideg-áttöltési büntetés megszűnik, amikor a forgalom nyelvek között váltakozik.

## Összehasonlítás a TypeSafe Jev-vel

A cikk közvetlen összehasonlítást ad. Fontos módszertani megjegyzés, amit a szerző maga is jelöl: **minden Laya-szám saját mérés, a Jev-számok harmadik féltől** (AbdelStark, nibzard független vizsgálatai) és a TypeSafe AI-tól származnak.

- **typed-decisions (2 000 döntés):** Jev 0,727. Laya 0,766 (**+3,9%**, és meghaladja a 0,735-ös tanári plafont)
- **AG News (4 címke):** 0,910, 0,950 (**+4,0%**)
- **DAIR Emotion (6 címke):** 0,480 (Brier 0,846), 0,595 (**+11,5%**; a Jevnél 16% nulla valószínűség volt)
- **Kalibrációs hiba (ECE):** 0,246, 0,081 (**3-szoros javulás**)
- **Latency P50 (1 kérdés):** 236-276 ms, **32,8 ms** (**7,8-szer gyorsabb**)
- **Latency P50 (10 kérdés batchelve):** ~1 500 ms (soros), **72,3 ms** (7,2 ms/kérdés, **20-szoros**)
- **Használható nyelvek (>3x véletlen):** nincs közzétett benchmark, **45 az 51-ből**
- **Költség 1M tokenenként:** 0,042 USD (mért API), **0,00 USD** (saját hosztolás)
- **Súlyok és kód:** zárt, tulajdonosi API, **nyílt forráskódú safetensors**, air-gapped és on-premise képes

## Valós alkalmazási munkafolyamatok

Kilenc vállalati munkafolyamatot értékeltek. A mérési eredmények:

- **E-mail spam-szűrés (Enron):** 0,993 pontosság, 0,993 F1, 0,013 ECE
- **Adathalász-detektálás:** 0,980 pontosság, 0,979 F1, 0,012 ECE
- **LLM guardrail-ek és jailbreak (held-out ToxicChat):** 0,755-0,762 pontosság; **50%-os szelektív lefedettségnél 0,931**
- **RAG-passzus relevanciaszűrés:** 0,657 pontosság egyetlen forward passban
- **Támogatási ticket sorba rendezése (10 irányba):** 0,522 pontosság

## Őszinte korlátok

A szerző szokatlanul nyíltan felsorolja a korlátokat, és ezt a részt érdemes komolyan venni:

- **A `choice` romlik 20+ opció felett.** A Banking77 77 címkéjén a Laya 0,425-öt ért el a Jev 0,870-ével szemben. Az ok **architekturális költségvetési korlát**: az opciók egy 192-256 tokenes `head_max_len` keretet osztanak meg, ami 77 opciónál mindössze ~3-4 tokent hagy jelöltenként. Javaslat: tartsd a `choice` sémát 20 opció alatt, vagy használj kétlépcsős durva-finom hierarchiát.
- **Zero-shot kontra finomhangolás.** Az alapmodellek a `typed-decisions` benchmarkon **~0,35-öt** adnak (gyakorlatilag véletlen). A 0,766-os pont a benchmark tanítóhalmazán való finomhangolással érhető el. A szerző megfogalmazása pontos: *„tekintsd a Layát gyors alapmodellnek, amit specializálni kell, nem mindentudó zero-shot orákulumnak.”*
- **Hőmérséklet-kalibráció.** Az alap súlyok nyers hőmérséklet-logitokkal érkeznek. Egyetlen skaláris hőmérséklet illesztése kérdéstípusonként a saját domain-eloszlásodon **0,466-ról 0,081-re** vágja a várható kalibrációs hibát.

## Quickstart

A teljes példa több sémát és automatikus nyelvi routingot mutat:

```python
pip install laya>=0.3.3

import laya
from laya import Router

## Router előtöltéssel (elkerüli az áttöltési késleltetést)
router = Router(preload=True)

ticket = {
    "ticket_id": "TCK-8821",
    "customer": "enterprise_user",
    "subject": "System downtime and billing dispute",
    "body": "Our production API has been failing since 6 AM. We lost critical "
            "transactions. We demand an immediate SLA refund."
}

questions = {
    "queue": {
        "type": "choice",
        "instructions": "Which engineering queue owns this ticket?",
        "criteria": {
            "infrastructure": "server outages, network downtime, database failures",
            "billing": "refunds, SLA credits, invoice disputes",
            "security": "breaches, vulnerability reports",
            "support": "general customer inquiries"
        }
    },
    "urgency": {
        "type": "score",
        "instructions": "How urgent is this ticket?",
        "criteria": ["low priority", "medium", "high priority", "critical blocker"]
    },
    "churn_risk": {
        "type": "noul",
        "instructions": "Does the customer threaten to cancel or express severe churn intent?"
    }
}

## Egyetlen forward pass: minden kérdést egyszerre értékel
res = router.predict(ticket, questions)
## -> queue: infrastructure (confidence: 0.96)
## -> urgency: 2.87 / 3.0
## -> churn_risk: 91.4%
```

---

## Ellenőrzés: amit a cikk állít, és amit a források mutatnak

A cikk erős, személyes állítást tesz a prior art-ról, ezért a feldolgozás során ellenőriztem a hivatkozott forrásokat. **Az eredmény vegyes, és ezt érdemes tudni, mielőtt a cikk kontextusát elfogadjuk.**

**Ami megállja a helyét:**

- **arXiv:2503.23303 valós és illeszkedik.** A „SalesRLAgent: A Reinforcement Learning Approach for Real-Time Sales Conversion Prediction and Optimization” 2025-03-30-án jelent meg, a szerző Nandakishor M. Az absztrakt pontosan azt írja le, amit a cikk állít: megerősítéses tanulással valós idejű konverziós valószínűséget jósol értékesítési beszélgetésekben, szemben a Kapa.ai, Mendable, Inkeep típusú, kész LLM-ekre épülő rendszerekkel. Ez **valóban egy évvel a Jev előtt** volt.
- **A TypeSafe AI és a Jev létezik**, és valós visszhangot kapott: a TechCrunch és a Tom's Hardware is írt róla 2026 szeptemberében. A szerző állítása, hogy „egy jól finanszírozott frontier lab” vezette be a koncepciót, tényszerű.
- **A nyílt szoftveres állítások ellenőrizhetők.** A GitHub repó (`NandhaKishorM/laya`) Apache-2.0 licencű, ~8 800 csillaggal és 740 fork-kal a feldolgozás idején. A 51 commit túlnyomó része a szerzőé (a többi dependabot és két külső közreműködő). A Hugging Face repó ~1 570 lájkot gyűjtött, a PyPI-csomag első kiadása 2026-09-18-i.

**Ami nem állja meg a helyét:**

- **A második paper leírása pontatlan.** A cikk azt állítja, hogy 2025 szeptemberében publikálta az arXiv:2510.01237-et, „formalizálva a séma-alapú döntések keretrendszerét, megerősítéses tanulással vezérelve”. A paper valódi címe és tartalma más: **„Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation”**. Ez egy **hallucináció-mitigáló routing** rendszer leírása, három jel (szemantikai illeszkedés, rétegen belüli konvergencia, tanult magabiztosság-becslés) alapján négy útvonalra irányítja a kérdéseket (helyi generálás, RAG, nagyobb modell, emberi felülvizsgálat). Ez **nem** séma-alapú döntések formalizálása és nem RL-vezérelt. A kettő között van tematikus rokonság, mindkettő routing és magabiztosság körül forog, de a cikk által állított folytonosság a két munka között **nem igazolható a paper szövegéből**.
- **A következmény a prior art igényre:** az első paperre alapozott „én előbb csináltam” érv **erős**; a másodikra alapozott „formalizáltam a keretrendszert” érv **nem**. A cikk retorikailag a két munkát egy folytonos vonalként mutatja be, ami a Jev-ügy narratíváját erősíti, de a források ezt nem támasztják alá egyformán.
- **A „beats 0.735 teacher ceiling” állítás önmagában nem sokat mond**, hacsak a tanári plafon definíciója és mérése nem ismert. A cikk nem adja meg, mi a tanári modell, hogyan mérték a plafont, és a `typed-decisions` benchmark tanítóhalmazán való finomhangolás mennyire teszi összemérhetetlenné a számot. Ez utóbbit a szerző önmaga is elismeri a korlátok szekcióban, ami enyhíti a problémát, de a benchmark-táblázat ezt a kontextust nem tartalmazza.

**Ami semleges, de hiányzik:** a cikk nem közöl semmit a **Jev oldaláról**, hogy a TypeSafe mit állít magáról, milyen benchmarkon, milyen feltételekkel. A Jev-számokat harmadik féltől veszi át, ami módszertanilag helyes eljárás, de azt jelenti, hogy az összehasonlítás fele nem ellenőrizhető a cikkből.

**Összesítés:** a cikk technikai tartalma önmagában erős és jól mérhető, a kalibráció, a routing-szükséglet és a korlátok szekciók konkrét számokkal dolgoznak, és a nyílt szoftver valóban létezik és elérhető. A **történeti prioritás-narratíva viszont csak részben igazolt**: az első paper igen, a második nem. Aki a cikket a „miért nem kapott elismerést a szerző” keretben olvassa, annak érdemes tudnia, hogy a szerző által hivatkozott második bizonyíték nem azt tartalmazza, amit a cikk állít róla.

---

## Saját rendszerünkre alkalmazható

**MAGAS alkalmazhatóság.** A cikk olyan problémát tárgyal, amivel a saját pipeline-unk mindennap küzd: **a jelenleg LLM-ekre bízott egyszerű osztályozási döntéseket kalibrált, gyors, determinisztikus modellekre cserélni**.

- **A saját „System 1” döntéseink listája.** A pipeline-unkban számos helyen hívunk generatív modellt reflex-döntésre: a terminológia-detektálás (`detect_new_terms.py`), a batch-review `classify()`-ja (accept/reject/noise), a topic-mapping, az auto-review pontozás, a kanonikus név-felismerés. Ezek mind `choice` vagy `score` típusú döntések. A cikk konkrét alternatívát mutat: egy 322M paraméteres, ~33 ms-os modell, saját súlyokkal, saját gépen.
- **A kalibráció közvetlenül érinti az auto-review küszöbeinket.** A saját rendszerünkben az „LLM score 0.90 → `auto_approved`” egy **kalibrálatlan** valószínűségen alapul, a cikk leírása szerint pontosan azon a hibán, amit a „confidence: 0.95 generált token” jelenség okoz. Az ECE-mérés módszere (0,246 → 0,081) és a hőmérséklet-kalibrálás technikája (egy skalár illesztése kérdéstípusonként) **közvetlenül átültethető** arra, hogy az auto-review 0.90-es küszöbe valóban 90%-os megbízhatóságot jelentsen.
- **A „magabiztosság nem figyelmeztet, ha nem érti a bemenetet” tanulság a saját ASR- és nyelvi kezelésünkre vonatkozik.** A Khmer-eset (0,000 pontosság, 0,952 magabiztosság) ugyanaz a hibaosztály, mint amit a saját ASR-error-lexikonjainknál kezelünk: a modell magabiztos kimenetet ad rossz bemenetre. A cikk módszere, a **bemenet írásrendszerének vizsgálata a forward pass ELŐTT**, 0,09 ms-os overhead-del, egy olcsó, determinisztikus előszűrő, amit a saját pipeline-jainkba is be lehet építeni annak eldöntésére, hogy egy adott nyelvű szöveget egyáltalán érdemes-e a fő modellnek adni.
- **A primitív-típusok (`choice`/`score`/`noul`) jó séma a saját döntéseink formalizálására.** A saját terminológia-detektálás jelenleg szabad szöveges LLM-választ kér, majd regex-szel parse-olja, pontosan az a minta, amit a cikk kritizál. A három primitív explicit felülete tisztább szerződést adna, és a `noul` (kalibrált logikai valószínűség) különösen jól illik olyan eldöntendő kérdéseinkhez, mint „ez a terminus valódi szakszó vagy zaj?”.
- **A nyílt súlyok és az Apache-2.0 licenc megfelel a saját elvárásainknak.** A cikk rendszere self-hostolható, air-gapped képes, és nincs API-költsége, összhangban a self-host preferenciánkkal és a privacy-first elvárással. A mérések szerint a saját hosztolás 0,00 USD/1M token a Jev 0,042 USD-jével szemben.
- **Amit óvatosan kell kezelni:** a szerző maga mondja, hogy a zero-shot teljesítmény ~0,35 (véletlen szint). Ez azt jelenti, hogy a Laya bevezetése a saját döntéseinkbe **finomhangolást igényel a saját domainünkön**, nem elég a csomag telepítése. Ez valós munkamennyiség, nem plug-and-play. A cikk viszont megad egy ingyenes Kaggle 2xT4 notebookot (~4 óra), ami pontosan erre a célra készült.

---

## Forrás (a magyar summaryhez)

- **Eredeti URL:** https://laya.convaiinnovations.com/
- **Tartalom:** ~1 973 szó, 14 229 karakter, self-write (subagent nélkül)
- **Szerző:** Nandakishor Mukkunnoth, Founder & CEO, ConvAI Innovations
- **Megjelenés:** 2026-09-18 (dev.to API-val ellenőrizve; a `.com` oldal ugyanez a szöveg)
- **Kinyerés:** `browser_exec` + `document.body.innerText` (a cikk egyoldalas, statikus; nincs paywall, nincs `<article>`-kinyerés szükséges)
- **Feldolgozva:** 2026-09-21
- **Topic mapping:** `ai-automation.md` (agent-design, döntési architektúra, inferencia-hatékonyság)
- **Ellenőrzött külső források:** arXiv API (2503.23303, 2510.01237, a szerző teljes paper-listája), GitHub API (repo-metaadatok, commitok, közreműködők), Hugging Face API (modell-metaadatok), PyPI JSON API (kiadások, licenc), dev.to API (publikálás dátuma)
- **Kapcsolódó saját témák:** `ai-automation.md` topic; az agent-döntési architektúrák és a kalibráció kérdése a wiki `raw/papers/` mappájában lévő tanulmányokhoz kapcsolódik (Self-Harness, Memo: Memory as Model, Skill Retrieval Augmentation)
