Laya: 33 ms-os System 1 döntési motor kalibrált valószínűségekkel, és a Jev-vita¶
Szerző: Nandakishor Mukkunnoth (Founder & CEO, ConvAI Innovations) Megjelenés: 2026-09-18 Forrás: https://laya.convaiinnovations.com/ (azonos a dev.to poszttal) Kód: https://github.com/NandhaKishorM/laya (Apache-2.0, ~8 800 csillag a feldolgozáskor) Modellek: https://huggingface.co/convaiinnovations/laya (3 checkpoint, egy repóban) Csomag:
pip install laya(PyPI 0.3.4) Típus: technikai blog-bejegyzés, nem peer-reviewed tanulmány Terjedelem: ~2 000 szó, 12 perc olvasás
Összegzés¶
- A szerző egy nem-autoregresszív döntési modellcsaládot mutat be (Laya), amely nem generál szöveget, hanem egyetlen forward passban ad kalibrált valószínűségeket strukturált sémákra. A mérési alap: 32,8 ms egy GPU-n (7,2 ms kérdésenként batchelve), szemben a TypeSafe Jev 236-276 ms-jával.
- Három döntési primitív alkotja a felületet:
choice(egy opció választása egy kritérium-szótárból, eloszlással),score(ordinális rubrika, pl. 0-3 sürgősség) ésnoul(közvetlen logikai kérdés kalibrált P(igaz) értékkel). Mivel a kimeneti tér kizárólag valószínűségekből és számokból áll, sémahiba és hallucináció fizikailag lehetetlen. - A kalibráció a cikk legerősebb mérőszáma. Az ECE (Expected Calibration Error) 0,246-ról 0,081-re javul, ami háromszoros javulás. A szerző külön kiemeli, hogy a generatív LLM-ek „confidence: 0.95” kimenete mögött nulla matematikai kalibráció van: a modell csak olyan tokeneket generál, amelyek magabiztosnak hangzanak.
- A routing nem kényelmi funkció, hanem hibaelleni védelem. Az 51 nyelves MASSIVE-vizsgálatban az angol checkpoint Khmer nyelven 0,000 pontosságot ért el 0,952 átlagos magabiztosság mellett, egyetlen helyes döntés sem 100 kérdésből, miközben a modell 95%-ot állított. Az önbizalom tehát nem figyelmeztet, ha a modell nem tudja olvasni az írásrendszert; a modellválasztást a forward pass előtt kell meghozni.
- A három checkpoint egy Hugging Face repóban él, ahonnan az SDK az
allow_patternssegítségével csak a kért alkönyvtárat tölti le (808 MB vagy 647 MB a 2,5 GB-os bundle helyett). - A szerző nyíltan felsorolja a korlátokat: 20+ opció felett a
choiceromlik (a Banking77 77 címkéjén 0,425 a Jev 0,870-ével szemben), a zero-shot alapmodell ~0,35-öt ad (gyakorlatilag véletlen), a 0,766-os pont a benchmark tanítóhalmazán való finomhangolás eredménye, és a nyers súlyok hőmérséklet-kalibrálatlanok. - A cikk politikai éle: a szerző szerint a TypeSafe AI 2026 szeptemberében „teljesen új tudományos áttörésként” vezette be ugyanazt a koncepciót, amit ő 2025 márciusában publikált, nyílt súlyok, technikai paperek és nyílt tanítóadat nélkül. Az ellenőrzés ezt részben támasztja alá, részben nem (lásd a kritikai szakaszt).
A kontextus: a „System 1” hullám és a Jev-ügy¶
A cikk egy személyes sérelem-nyitánnyal indul, ami egyben a motiváció is. A szerző 2025 márciusában publikálta az első munkáját (arXiv:2503.23303), közzétette a súlyokat a Hugging Face-en, nyílt adathalmazt tett közzé, PyPI-csomagot épített, és megírta a megközelítést a Redditen. 2025 szeptemberében egy második paper következett. A „vezető agy” a rendszerében mindvégig a megerősítéses tanulás volt, nem pusztán egy beágyazó modell.
Majd 2026 szeptemberében a TypeSafe AI, amit Diogo Almeida alapított, aki az OpenAI-nál a ChatGPT egyik társfeltalálója és az RLHF kidolgozója volt, bemutatta a Jev-et, és ugyanazt a nem-autoregresszív döntési koncepciót javasolta, mintha vadonatúj tudományos áttörés lenne.
A szerző technikai leírása szerint a különbség a horizontban van: a korábbi modellje PPO-t használt szekvencia-reprezentációkon, és vertikális értékesítési beszélgetésekben adott körről körre konverziós trajektóriákat (0,0-1,0 valószínűségeket). A Jev ezt horizontálisan általánosította, párhuzamos mintavétellel, amit RLCD-nek (Reinforcement Learning for Calibrated Decisions) neveztek el.
A szerző válasza nem a panaszkodás lett, hanem egy teljesen nyílt, horizontális System 1 döntésimodell-család: a Laya. A mondat, ami a cikk egészét összefoglalja: „mivel helyesen, bidirekcionális enkóderekre építettük, a modelljeink 32,8 ms alatt futnak egyetlen GPU-n, 6-8-szor gyorsabban, mint a Jev.”
A három döntési primitív¶
A Laya bármilyen állapotot (nyers szöveg, e-mail, ticket, JSON-dokumentum) kiértékel egyetlen forward passban, három primitíven keresztül:
choice, válassz egy opciót egy kritérium-szótárból. Visszaadja a kiválasztott kulcsot, az összes opció fölötti valószínűség-eloszlást és egy kalibrált magabiztossági pontot.score, helyezd az állapotot egy ordinális rubikára (0, 1, 2, … szintek). Visszaadja a várható szintet, a rubrika-rangok fölötti eloszlást és a magabiztosságot.noul, közvetlen logikai kérdés, ami kalibrált P(igaz) értéket ad 0,0 és 1,0 között (a P(hamis) = 1 - P(igaz) konstrukcióból adódik).
A szerző központi érve, hogy a modern AI-pipeline-ok legnagyobb szűk keresztmetszete az, hogy generatív LLM-eket hívunk egyszerű reflex-döntésekre. Amikor egy támogatási ticket érkezik, vagy egy e-mail bejön, valójában csak egyszerű, strukturált kérdésekre kell válaszolni:
- Melyik osztály kapja ezt a ticketet?
- Ez az e-mail adathalász támadás vagy spam?
- Ez a prompt jailbreak-kísérlet vagy injektálás?
- Mennyire sürgős ez egy 0-3-as rubikán?
- Igényel ez a kérdés kódfuttatást vagy elég egy tényválasz?
Ezekre egy 8B, 70B vagy frontier modellt hívni a szerző szerint teljes túltervezés: 500-2 000 ms várakozás, valós inferenciaköltség, majd regex vagy JSON-parser írása, hogy tiszta címkét nyerjünk ki szabad szövegből.
A három checkpoint és a bundle-architektúra¶
A szerző elismeri, hogy egy modell nem lehet optimális minden feladatra és nyelvre. Ezért három specializált checkpoint készült, egyetlen Hugging Face repóban:
convaiinnovations/laya. ModernBERT-large gerinc, 421M paraméter, 512 kontextus. Angol szövegosztályozás, guardrail-ek, e-mail triage.convaiinnovations/laya-multilingual, mmBERT-base (256k szókészlet), 322M paraméter, 1024 kontextus (8k-ig). 100+ nyelv, 2,2-szer gyorsabb, cross-lingual NLI.convaiinnovations/laya-typed-decisions. ModernBERT-large, 421M paraméter, 1024 kontextus. Agent-megfigyelhetőség, ügyfélszolgálat, számlafeldolgozás, biztonsági riasztások (0,766 pontosság).
A bundle-megoldás technikailag figyelemre méltó: ahelyett, hogy a felhasználónak három külön repót kellene kezelnie vagy 2,5 GB súlyt letöltenie, a fő repó mindhármat tartalmazza, és az SDK a Hugging Face allow_patterns mechanizmusával csak a kért alkönyvtárat tölti le:
## Letölti az angol modellt (~808 MB)
agent_en = laya.load("convaiinnovations/laya")
## CSAK a multilingual alkönyvtárat tölti le (~647 MB), nem a teljes 2,5 GB bundle-t
agent_ml = laya.load("convaiinnovations/laya", subfolder="multilingual")
Miért létszükséglet a routing: a több-írásrendszer valóság¶
Ez a cikk technikailag a legerősebb része. Az 51 nyelves MASSIVE-vizsgálatban (20 opció, véletlen alapvonal = 0,050) a szerző azt mérte, hogyan vallanak kudarcot az angol modellek a latin írásrendszeren kívül. A ModernBERT-large 50 000 tokenes angol BPE szókészlete egyszerűen szétroncsolja a nem-latin ábécéket:
- Khmer: 0,000 pontosság 0,952 átlagos magabiztosság mellett, egyetlen helyes döntés sem 100 kérdésből, miközben ~95% önbizalmat jelentett.
- Örmény: 0,050 pontosság (pontos érmefeldobás) 0,885 magabiztosság mellett.
- Héber: 0,060 pontosság 0,964 magabiztosság mellett.
- Bengáli: 0,080 pontosság 0,945 magabiztosság mellett.
- Hindi: 0,100 pontosság 0,941 magabiztosság mellett.
A szerző tanulsága tömör: az angol checkpoint átlagos magabiztossága 51 nyelven soha nem csökken 0,885 alá, függetlenül attól, hogy a pontossága 82% vagy 0%. Ezért a magabiztossági kapuzás nem véd meg, a modellválasztásról a forward pass előtt kell dönteni.
A megoldás egy beépített Router, amely a bejövő szöveg Unicode írásrendszerét vizsgálja 22 ábécé fölött (devanagari, CJK Han, cirill, arab, héber, tamil, thai stb.), és emellett a latin stopword-eloszlásokat elemzi. A mérési overhead elhanyagolható:
- Szabványos angol szöveg: 0,09 ms
- Devanagari / indiai szöveg: 0,54 ms
- Nagy, 200 soros beágyazott JSON-dokumentumok: 0,73 ms
A 33 ms-os forward passhoz képest ez 2% alatti többlet. A Router(preload=True) emellett a szükséges modelleket VRAM-ban/RAM-ban tartja, amivel a 7-10 másodperces hideg-áttöltési büntetés megszűnik, amikor a forgalom nyelvek között váltakozik.
Összehasonlítás a TypeSafe Jev-vel¶
A cikk közvetlen összehasonlítást ad. Fontos módszertani megjegyzés, amit a szerző maga is jelöl: minden Laya-szám saját mérés, a Jev-számok harmadik féltől (AbdelStark, nibzard független vizsgálatai) és a TypeSafe AI-tól származnak.
- typed-decisions (2 000 döntés): Jev 0,727. Laya 0,766 (+3,9%, és meghaladja a 0,735-ös tanári plafont)
- AG News (4 címke): 0,910, 0,950 (+4,0%)
- DAIR Emotion (6 címke): 0,480 (Brier 0,846), 0,595 (+11,5%; a Jevnél 16% nulla valószínűség volt)
- Kalibrációs hiba (ECE): 0,246, 0,081 (3-szoros javulás)
- Latency P50 (1 kérdés): 236-276 ms, 32,8 ms (7,8-szer gyorsabb)
- Latency P50 (10 kérdés batchelve): ~1 500 ms (soros), 72,3 ms (7,2 ms/kérdés, 20-szoros)
- Használható nyelvek (>3x véletlen): nincs közzétett benchmark, 45 az 51-ből
- Költség 1M tokenenként: 0,042 USD (mért API), 0,00 USD (saját hosztolás)
- Súlyok és kód: zárt, tulajdonosi API, nyílt forráskódú safetensors, air-gapped és on-premise képes
Valós alkalmazási munkafolyamatok¶
Kilenc vállalati munkafolyamatot értékeltek. A mérési eredmények:
- E-mail spam-szűrés (Enron): 0,993 pontosság, 0,993 F1, 0,013 ECE
- Adathalász-detektálás: 0,980 pontosság, 0,979 F1, 0,012 ECE
- LLM guardrail-ek és jailbreak (held-out ToxicChat): 0,755-0,762 pontosság; 50%-os szelektív lefedettségnél 0,931
- RAG-passzus relevanciaszűrés: 0,657 pontosság egyetlen forward passban
- Támogatási ticket sorba rendezése (10 irányba): 0,522 pontosság
Őszinte korlátok¶
A szerző szokatlanul nyíltan felsorolja a korlátokat, és ezt a részt érdemes komolyan venni:
- A
choiceromlik 20+ opció felett. A Banking77 77 címkéjén a Laya 0,425-öt ért el a Jev 0,870-ével szemben. Az ok architekturális költségvetési korlát: az opciók egy 192-256 tokeneshead_max_lenkeretet osztanak meg, ami 77 opciónál mindössze ~3-4 tokent hagy jelöltenként. Javaslat: tartsd achoicesémát 20 opció alatt, vagy használj kétlépcsős durva-finom hierarchiát. - Zero-shot kontra finomhangolás. Az alapmodellek a
typed-decisionsbenchmarkon ~0,35-öt adnak (gyakorlatilag véletlen). A 0,766-os pont a benchmark tanítóhalmazán való finomhangolással érhető el. A szerző megfogalmazása pontos: „tekintsd a Layát gyors alapmodellnek, amit specializálni kell, nem mindentudó zero-shot orákulumnak.” - Hőmérséklet-kalibráció. Az alap súlyok nyers hőmérséklet-logitokkal érkeznek. Egyetlen skaláris hőmérséklet illesztése kérdéstípusonként a saját domain-eloszlásodon 0,466-ról 0,081-re vágja a várható kalibrációs hibát.
Quickstart¶
A teljes példa több sémát és automatikus nyelvi routingot mutat:
pip install laya>=0.3.3
import laya
from laya import Router
## Router előtöltéssel (elkerüli az áttöltési késleltetést)
router = Router(preload=True)
ticket = {
"ticket_id": "TCK-8821",
"customer": "enterprise_user",
"subject": "System downtime and billing dispute",
"body": "Our production API has been failing since 6 AM. We lost critical "
"transactions. We demand an immediate SLA refund."
}
questions = {
"queue": {
"type": "choice",
"instructions": "Which engineering queue owns this ticket?",
"criteria": {
"infrastructure": "server outages, network downtime, database failures",
"billing": "refunds, SLA credits, invoice disputes",
"security": "breaches, vulnerability reports",
"support": "general customer inquiries"
}
},
"urgency": {
"type": "score",
"instructions": "How urgent is this ticket?",
"criteria": ["low priority", "medium", "high priority", "critical blocker"]
},
"churn_risk": {
"type": "noul",
"instructions": "Does the customer threaten to cancel or express severe churn intent?"
}
}
## Egyetlen forward pass: minden kérdést egyszerre értékel
res = router.predict(ticket, questions)
## -> queue: infrastructure (confidence: 0.96)
## -> urgency: 2.87 / 3.0
## -> churn_risk: 91.4%
Ellenőrzés: amit a cikk állít, és amit a források mutatnak¶
A cikk erős, személyes állítást tesz a prior art-ról, ezért a feldolgozás során ellenőriztem a hivatkozott forrásokat. Az eredmény vegyes, és ezt érdemes tudni, mielőtt a cikk kontextusát elfogadjuk.
Ami megállja a helyét:
- arXiv:2503.23303 valós és illeszkedik. A „SalesRLAgent: A Reinforcement Learning Approach for Real-Time Sales Conversion Prediction and Optimization” 2025-03-30-án jelent meg, a szerző Nandakishor M. Az absztrakt pontosan azt írja le, amit a cikk állít: megerősítéses tanulással valós idejű konverziós valószínűséget jósol értékesítési beszélgetésekben, szemben a Kapa.ai, Mendable, Inkeep típusú, kész LLM-ekre épülő rendszerekkel. Ez valóban egy évvel a Jev előtt volt.
- A TypeSafe AI és a Jev létezik, és valós visszhangot kapott: a TechCrunch és a Tom's Hardware is írt róla 2026 szeptemberében. A szerző állítása, hogy „egy jól finanszírozott frontier lab” vezette be a koncepciót, tényszerű.
- A nyílt szoftveres állítások ellenőrizhetők. A GitHub repó (
NandhaKishorM/laya) Apache-2.0 licencű, ~8 800 csillaggal és 740 fork-kal a feldolgozás idején. A 51 commit túlnyomó része a szerzőé (a többi dependabot és két külső közreműködő). A Hugging Face repó ~1 570 lájkot gyűjtött, a PyPI-csomag első kiadása 2026-09-18-i.
Ami nem állja meg a helyét:
- A második paper leírása pontatlan. A cikk azt állítja, hogy 2025 szeptemberében publikálta az arXiv:2510.01237-et, „formalizálva a séma-alapú döntések keretrendszerét, megerősítéses tanulással vezérelve”. A paper valódi címe és tartalma más: „Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation”. Ez egy hallucináció-mitigáló routing rendszer leírása, három jel (szemantikai illeszkedés, rétegen belüli konvergencia, tanult magabiztosság-becslés) alapján négy útvonalra irányítja a kérdéseket (helyi generálás, RAG, nagyobb modell, emberi felülvizsgálat). Ez nem séma-alapú döntések formalizálása és nem RL-vezérelt. A kettő között van tematikus rokonság, mindkettő routing és magabiztosság körül forog, de a cikk által állított folytonosság a két munka között nem igazolható a paper szövegéből.
- A következmény a prior art igényre: az első paperre alapozott „én előbb csináltam” érv erős; a másodikra alapozott „formalizáltam a keretrendszert” érv nem. A cikk retorikailag a két munkát egy folytonos vonalként mutatja be, ami a Jev-ügy narratíváját erősíti, de a források ezt nem támasztják alá egyformán.
- A „beats 0.735 teacher ceiling” állítás önmagában nem sokat mond, hacsak a tanári plafon definíciója és mérése nem ismert. A cikk nem adja meg, mi a tanári modell, hogyan mérték a plafont, és a
typed-decisionsbenchmark tanítóhalmazán való finomhangolás mennyire teszi összemérhetetlenné a számot. Ez utóbbit a szerző önmaga is elismeri a korlátok szekcióban, ami enyhíti a problémát, de a benchmark-táblázat ezt a kontextust nem tartalmazza.
Ami semleges, de hiányzik: a cikk nem közöl semmit a Jev oldaláról, hogy a TypeSafe mit állít magáról, milyen benchmarkon, milyen feltételekkel. A Jev-számokat harmadik féltől veszi át, ami módszertanilag helyes eljárás, de azt jelenti, hogy az összehasonlítás fele nem ellenőrizhető a cikkből.
Összesítés: a cikk technikai tartalma önmagában erős és jól mérhető, a kalibráció, a routing-szükséglet és a korlátok szekciók konkrét számokkal dolgoznak, és a nyílt szoftver valóban létezik és elérhető. A történeti prioritás-narratíva viszont csak részben igazolt: az első paper igen, a második nem. Aki a cikket a „miért nem kapott elismerést a szerző” keretben olvassa, annak érdemes tudnia, hogy a szerző által hivatkozott második bizonyíték nem azt tartalmazza, amit a cikk állít róla.
Saját rendszerünkre alkalmazható¶
MAGAS alkalmazhatóság. A cikk olyan problémát tárgyal, amivel a saját pipeline-unk mindennap küzd: a jelenleg LLM-ekre bízott egyszerű osztályozási döntéseket kalibrált, gyors, determinisztikus modellekre cserélni.
- A saját „System 1” döntéseink listája. A pipeline-unkban számos helyen hívunk generatív modellt reflex-döntésre: a terminológia-detektálás (
detect_new_terms.py), a batch-reviewclassify()-ja (accept/reject/noise), a topic-mapping, az auto-review pontozás, a kanonikus név-felismerés. Ezek mindchoicevagyscoretípusú döntések. A cikk konkrét alternatívát mutat: egy 322M paraméteres, ~33 ms-os modell, saját súlyokkal, saját gépen. - A kalibráció közvetlenül érinti az auto-review küszöbeinket. A saját rendszerünkben az „LLM score 0.90 →
auto_approved” egy kalibrálatlan valószínűségen alapul, a cikk leírása szerint pontosan azon a hibán, amit a „confidence: 0.95 generált token” jelenség okoz. Az ECE-mérés módszere (0,246 → 0,081) és a hőmérséklet-kalibrálás technikája (egy skalár illesztése kérdéstípusonként) közvetlenül átültethető arra, hogy az auto-review 0.90-es küszöbe valóban 90%-os megbízhatóságot jelentsen. - A „magabiztosság nem figyelmeztet, ha nem érti a bemenetet” tanulság a saját ASR- és nyelvi kezelésünkre vonatkozik. A Khmer-eset (0,000 pontosság, 0,952 magabiztosság) ugyanaz a hibaosztály, mint amit a saját ASR-error-lexikonjainknál kezelünk: a modell magabiztos kimenetet ad rossz bemenetre. A cikk módszere, a bemenet írásrendszerének vizsgálata a forward pass ELŐTT, 0,09 ms-os overhead-del, egy olcsó, determinisztikus előszűrő, amit a saját pipeline-jainkba is be lehet építeni annak eldöntésére, hogy egy adott nyelvű szöveget egyáltalán érdemes-e a fő modellnek adni.
- A primitív-típusok (
choice/score/noul) jó séma a saját döntéseink formalizálására. A saját terminológia-detektálás jelenleg szabad szöveges LLM-választ kér, majd regex-szel parse-olja, pontosan az a minta, amit a cikk kritizál. A három primitív explicit felülete tisztább szerződést adna, és anoul(kalibrált logikai valószínűség) különösen jól illik olyan eldöntendő kérdéseinkhez, mint „ez a terminus valódi szakszó vagy zaj?”. - A nyílt súlyok és az Apache-2.0 licenc megfelel a saját elvárásainknak. A cikk rendszere self-hostolható, air-gapped képes, és nincs API-költsége, összhangban a self-host preferenciánkkal és a privacy-first elvárással. A mérések szerint a saját hosztolás 0,00 USD/1M token a Jev 0,042 USD-jével szemben.
- Amit óvatosan kell kezelni: a szerző maga mondja, hogy a zero-shot teljesítmény ~0,35 (véletlen szint). Ez azt jelenti, hogy a Laya bevezetése a saját döntéseinkbe finomhangolást igényel a saját domainünkön, nem elég a csomag telepítése. Ez valós munkamennyiség, nem plug-and-play. A cikk viszont megad egy ingyenes Kaggle 2xT4 notebookot (~4 óra), ami pontosan erre a célra készült.
Forrás (a magyar summaryhez)¶
- Eredeti URL: https://laya.convaiinnovations.com/
- Tartalom: ~1 973 szó, 14 229 karakter, self-write (subagent nélkül)
- Szerző: Nandakishor Mukkunnoth, Founder & CEO, ConvAI Innovations
- Megjelenés: 2026-09-18 (dev.to API-val ellenőrizve; a
.comoldal ugyanez a szöveg) - Kinyerés:
browser_exec+document.body.innerText(a cikk egyoldalas, statikus; nincs paywall, nincs<article>-kinyerés szükséges) - Feldolgozva: 2026-09-21
- Topic mapping:
ai-automation.md(agent-design, döntési architektúra, inferencia-hatékonyság) - Ellenőrzött külső források: arXiv API (2503.23303, 2510.01237, a szerző teljes paper-listája), GitHub API (repo-metaadatok, commitok, közreműködők), Hugging Face API (modell-metaadatok), PyPI JSON API (kiadások, licenc), dev.to API (publikálás dátuma)
- Kapcsolódó saját témák:
ai-automation.mdtopic; az agent-döntési architektúrák és a kalibráció kérdése a wikiraw/papers/mappájában lévő tanulmányokhoz kapcsolódik (Self-Harness, Memo: Memory as Model, Skill Retrieval Augmentation)