Kihagyás

Laya: 33 ms-os System 1 döntési motor kalibrált valószínűségekkel, és a Jev-vita

Szerző: Nandakishor Mukkunnoth (Founder & CEO, ConvAI Innovations) Megjelenés: 2026-09-18 Forrás: https://laya.convaiinnovations.com/ (azonos a dev.to poszttal) Kód: https://github.com/NandhaKishorM/laya (Apache-2.0, ~8 800 csillag a feldolgozáskor) Modellek: https://huggingface.co/convaiinnovations/laya (3 checkpoint, egy repóban) Csomag: pip install laya (PyPI 0.3.4) Típus: technikai blog-bejegyzés, nem peer-reviewed tanulmány Terjedelem: ~2 000 szó, 12 perc olvasás


Összegzés

  • A szerző egy nem-autoregresszív döntési modellcsaládot mutat be (Laya), amely nem generál szöveget, hanem egyetlen forward passban ad kalibrált valószínűségeket strukturált sémákra. A mérési alap: 32,8 ms egy GPU-n (7,2 ms kérdésenként batchelve), szemben a TypeSafe Jev 236-276 ms-jával.
  • Három döntési primitív alkotja a felületet: choice (egy opció választása egy kritérium-szótárból, eloszlással), score (ordinális rubrika, pl. 0-3 sürgősség) és noul (közvetlen logikai kérdés kalibrált P(igaz) értékkel). Mivel a kimeneti tér kizárólag valószínűségekből és számokból áll, sémahiba és hallucináció fizikailag lehetetlen.
  • A kalibráció a cikk legerősebb mérőszáma. Az ECE (Expected Calibration Error) 0,246-ról 0,081-re javul, ami háromszoros javulás. A szerző külön kiemeli, hogy a generatív LLM-ek „confidence: 0.95” kimenete mögött nulla matematikai kalibráció van: a modell csak olyan tokeneket generál, amelyek magabiztosnak hangzanak.
  • A routing nem kényelmi funkció, hanem hibaelleni védelem. Az 51 nyelves MASSIVE-vizsgálatban az angol checkpoint Khmer nyelven 0,000 pontosságot ért el 0,952 átlagos magabiztosság mellett, egyetlen helyes döntés sem 100 kérdésből, miközben a modell 95%-ot állított. Az önbizalom tehát nem figyelmeztet, ha a modell nem tudja olvasni az írásrendszert; a modellválasztást a forward pass előtt kell meghozni.
  • A három checkpoint egy Hugging Face repóban él, ahonnan az SDK az allow_patterns segítségével csak a kért alkönyvtárat tölti le (808 MB vagy 647 MB a 2,5 GB-os bundle helyett).
  • A szerző nyíltan felsorolja a korlátokat: 20+ opció felett a choice romlik (a Banking77 77 címkéjén 0,425 a Jev 0,870-ével szemben), a zero-shot alapmodell ~0,35-öt ad (gyakorlatilag véletlen), a 0,766-os pont a benchmark tanítóhalmazán való finomhangolás eredménye, és a nyers súlyok hőmérséklet-kalibrálatlanok.
  • A cikk politikai éle: a szerző szerint a TypeSafe AI 2026 szeptemberében „teljesen új tudományos áttörésként” vezette be ugyanazt a koncepciót, amit ő 2025 márciusában publikált, nyílt súlyok, technikai paperek és nyílt tanítóadat nélkül. Az ellenőrzés ezt részben támasztja alá, részben nem (lásd a kritikai szakaszt).

A kontextus: a „System 1” hullám és a Jev-ügy

A cikk egy személyes sérelem-nyitánnyal indul, ami egyben a motiváció is. A szerző 2025 márciusában publikálta az első munkáját (arXiv:2503.23303), közzétette a súlyokat a Hugging Face-en, nyílt adathalmazt tett közzé, PyPI-csomagot épített, és megírta a megközelítést a Redditen. 2025 szeptemberében egy második paper következett. A „vezető agy” a rendszerében mindvégig a megerősítéses tanulás volt, nem pusztán egy beágyazó modell.

Majd 2026 szeptemberében a TypeSafe AI, amit Diogo Almeida alapított, aki az OpenAI-nál a ChatGPT egyik társfeltalálója és az RLHF kidolgozója volt, bemutatta a Jev-et, és ugyanazt a nem-autoregresszív döntési koncepciót javasolta, mintha vadonatúj tudományos áttörés lenne.

A szerző technikai leírása szerint a különbség a horizontban van: a korábbi modellje PPO-t használt szekvencia-reprezentációkon, és vertikális értékesítési beszélgetésekben adott körről körre konverziós trajektóriákat (0,0-1,0 valószínűségeket). A Jev ezt horizontálisan általánosította, párhuzamos mintavétellel, amit RLCD-nek (Reinforcement Learning for Calibrated Decisions) neveztek el.

A szerző válasza nem a panaszkodás lett, hanem egy teljesen nyílt, horizontális System 1 döntésimodell-család: a Laya. A mondat, ami a cikk egészét összefoglalja: „mivel helyesen, bidirekcionális enkóderekre építettük, a modelljeink 32,8 ms alatt futnak egyetlen GPU-n, 6-8-szor gyorsabban, mint a Jev.”

A három döntési primitív

A Laya bármilyen állapotot (nyers szöveg, e-mail, ticket, JSON-dokumentum) kiértékel egyetlen forward passban, három primitíven keresztül:

  • choice, válassz egy opciót egy kritérium-szótárból. Visszaadja a kiválasztott kulcsot, az összes opció fölötti valószínűség-eloszlást és egy kalibrált magabiztossági pontot.
  • score, helyezd az állapotot egy ordinális rubikára (0, 1, 2, … szintek). Visszaadja a várható szintet, a rubrika-rangok fölötti eloszlást és a magabiztosságot.
  • noul, közvetlen logikai kérdés, ami kalibrált P(igaz) értéket ad 0,0 és 1,0 között (a P(hamis) = 1 - P(igaz) konstrukcióból adódik).

A szerző központi érve, hogy a modern AI-pipeline-ok legnagyobb szűk keresztmetszete az, hogy generatív LLM-eket hívunk egyszerű reflex-döntésekre. Amikor egy támogatási ticket érkezik, vagy egy e-mail bejön, valójában csak egyszerű, strukturált kérdésekre kell válaszolni:

  • Melyik osztály kapja ezt a ticketet?
  • Ez az e-mail adathalász támadás vagy spam?
  • Ez a prompt jailbreak-kísérlet vagy injektálás?
  • Mennyire sürgős ez egy 0-3-as rubikán?
  • Igényel ez a kérdés kódfuttatást vagy elég egy tényválasz?

Ezekre egy 8B, 70B vagy frontier modellt hívni a szerző szerint teljes túltervezés: 500-2 000 ms várakozás, valós inferenciaköltség, majd regex vagy JSON-parser írása, hogy tiszta címkét nyerjünk ki szabad szövegből.

A három checkpoint és a bundle-architektúra

A szerző elismeri, hogy egy modell nem lehet optimális minden feladatra és nyelvre. Ezért három specializált checkpoint készült, egyetlen Hugging Face repóban:

  • convaiinnovations/laya. ModernBERT-large gerinc, 421M paraméter, 512 kontextus. Angol szövegosztályozás, guardrail-ek, e-mail triage.
  • convaiinnovations/laya-multilingual, mmBERT-base (256k szókészlet), 322M paraméter, 1024 kontextus (8k-ig). 100+ nyelv, 2,2-szer gyorsabb, cross-lingual NLI.
  • convaiinnovations/laya-typed-decisions. ModernBERT-large, 421M paraméter, 1024 kontextus. Agent-megfigyelhetőség, ügyfélszolgálat, számlafeldolgozás, biztonsági riasztások (0,766 pontosság).

A bundle-megoldás technikailag figyelemre méltó: ahelyett, hogy a felhasználónak három külön repót kellene kezelnie vagy 2,5 GB súlyt letöltenie, a fő repó mindhármat tartalmazza, és az SDK a Hugging Face allow_patterns mechanizmusával csak a kért alkönyvtárat tölti le:

## Letölti az angol modellt (~808 MB)
agent_en = laya.load("convaiinnovations/laya")

## CSAK a multilingual alkönyvtárat tölti le (~647 MB), nem a teljes 2,5 GB bundle-t
agent_ml = laya.load("convaiinnovations/laya", subfolder="multilingual")

Miért létszükséglet a routing: a több-írásrendszer valóság

Ez a cikk technikailag a legerősebb része. Az 51 nyelves MASSIVE-vizsgálatban (20 opció, véletlen alapvonal = 0,050) a szerző azt mérte, hogyan vallanak kudarcot az angol modellek a latin írásrendszeren kívül. A ModernBERT-large 50 000 tokenes angol BPE szókészlete egyszerűen szétroncsolja a nem-latin ábécéket:

  • Khmer: 0,000 pontosság 0,952 átlagos magabiztosság mellett, egyetlen helyes döntés sem 100 kérdésből, miközben ~95% önbizalmat jelentett.
  • Örmény: 0,050 pontosság (pontos érmefeldobás) 0,885 magabiztosság mellett.
  • Héber: 0,060 pontosság 0,964 magabiztosság mellett.
  • Bengáli: 0,080 pontosság 0,945 magabiztosság mellett.
  • Hindi: 0,100 pontosság 0,941 magabiztosság mellett.

A szerző tanulsága tömör: az angol checkpoint átlagos magabiztossága 51 nyelven soha nem csökken 0,885 alá, függetlenül attól, hogy a pontossága 82% vagy 0%. Ezért a magabiztossági kapuzás nem véd meg, a modellválasztásról a forward pass előtt kell dönteni.

A megoldás egy beépített Router, amely a bejövő szöveg Unicode írásrendszerét vizsgálja 22 ábécé fölött (devanagari, CJK Han, cirill, arab, héber, tamil, thai stb.), és emellett a latin stopword-eloszlásokat elemzi. A mérési overhead elhanyagolható:

  • Szabványos angol szöveg: 0,09 ms
  • Devanagari / indiai szöveg: 0,54 ms
  • Nagy, 200 soros beágyazott JSON-dokumentumok: 0,73 ms

A 33 ms-os forward passhoz képest ez 2% alatti többlet. A Router(preload=True) emellett a szükséges modelleket VRAM-ban/RAM-ban tartja, amivel a 7-10 másodperces hideg-áttöltési büntetés megszűnik, amikor a forgalom nyelvek között váltakozik.

Összehasonlítás a TypeSafe Jev-vel

A cikk közvetlen összehasonlítást ad. Fontos módszertani megjegyzés, amit a szerző maga is jelöl: minden Laya-szám saját mérés, a Jev-számok harmadik féltől (AbdelStark, nibzard független vizsgálatai) és a TypeSafe AI-tól származnak.

  • typed-decisions (2 000 döntés): Jev 0,727. Laya 0,766 (+3,9%, és meghaladja a 0,735-ös tanári plafont)
  • AG News (4 címke): 0,910, 0,950 (+4,0%)
  • DAIR Emotion (6 címke): 0,480 (Brier 0,846), 0,595 (+11,5%; a Jevnél 16% nulla valószínűség volt)
  • Kalibrációs hiba (ECE): 0,246, 0,081 (3-szoros javulás)
  • Latency P50 (1 kérdés): 236-276 ms, 32,8 ms (7,8-szer gyorsabb)
  • Latency P50 (10 kérdés batchelve): ~1 500 ms (soros), 72,3 ms (7,2 ms/kérdés, 20-szoros)
  • Használható nyelvek (>3x véletlen): nincs közzétett benchmark, 45 az 51-ből
  • Költség 1M tokenenként: 0,042 USD (mért API), 0,00 USD (saját hosztolás)
  • Súlyok és kód: zárt, tulajdonosi API, nyílt forráskódú safetensors, air-gapped és on-premise képes

Valós alkalmazási munkafolyamatok

Kilenc vállalati munkafolyamatot értékeltek. A mérési eredmények:

  • E-mail spam-szűrés (Enron): 0,993 pontosság, 0,993 F1, 0,013 ECE
  • Adathalász-detektálás: 0,980 pontosság, 0,979 F1, 0,012 ECE
  • LLM guardrail-ek és jailbreak (held-out ToxicChat): 0,755-0,762 pontosság; 50%-os szelektív lefedettségnél 0,931
  • RAG-passzus relevanciaszűrés: 0,657 pontosság egyetlen forward passban
  • Támogatási ticket sorba rendezése (10 irányba): 0,522 pontosság

Őszinte korlátok

A szerző szokatlanul nyíltan felsorolja a korlátokat, és ezt a részt érdemes komolyan venni:

  • A choice romlik 20+ opció felett. A Banking77 77 címkéjén a Laya 0,425-öt ért el a Jev 0,870-ével szemben. Az ok architekturális költségvetési korlát: az opciók egy 192-256 tokenes head_max_len keretet osztanak meg, ami 77 opciónál mindössze ~3-4 tokent hagy jelöltenként. Javaslat: tartsd a choice sémát 20 opció alatt, vagy használj kétlépcsős durva-finom hierarchiát.
  • Zero-shot kontra finomhangolás. Az alapmodellek a typed-decisions benchmarkon ~0,35-öt adnak (gyakorlatilag véletlen). A 0,766-os pont a benchmark tanítóhalmazán való finomhangolással érhető el. A szerző megfogalmazása pontos: „tekintsd a Layát gyors alapmodellnek, amit specializálni kell, nem mindentudó zero-shot orákulumnak.”
  • Hőmérséklet-kalibráció. Az alap súlyok nyers hőmérséklet-logitokkal érkeznek. Egyetlen skaláris hőmérséklet illesztése kérdéstípusonként a saját domain-eloszlásodon 0,466-ról 0,081-re vágja a várható kalibrációs hibát.

Quickstart

A teljes példa több sémát és automatikus nyelvi routingot mutat:

pip install laya>=0.3.3

import laya
from laya import Router

## Router előtöltéssel (elkerüli az áttöltési késleltetést)
router = Router(preload=True)

ticket = {
    "ticket_id": "TCK-8821",
    "customer": "enterprise_user",
    "subject": "System downtime and billing dispute",
    "body": "Our production API has been failing since 6 AM. We lost critical "
            "transactions. We demand an immediate SLA refund."
}

questions = {
    "queue": {
        "type": "choice",
        "instructions": "Which engineering queue owns this ticket?",
        "criteria": {
            "infrastructure": "server outages, network downtime, database failures",
            "billing": "refunds, SLA credits, invoice disputes",
            "security": "breaches, vulnerability reports",
            "support": "general customer inquiries"
        }
    },
    "urgency": {
        "type": "score",
        "instructions": "How urgent is this ticket?",
        "criteria": ["low priority", "medium", "high priority", "critical blocker"]
    },
    "churn_risk": {
        "type": "noul",
        "instructions": "Does the customer threaten to cancel or express severe churn intent?"
    }
}

## Egyetlen forward pass: minden kérdést egyszerre értékel
res = router.predict(ticket, questions)
## -> queue: infrastructure (confidence: 0.96)
## -> urgency: 2.87 / 3.0
## -> churn_risk: 91.4%

Ellenőrzés: amit a cikk állít, és amit a források mutatnak

A cikk erős, személyes állítást tesz a prior art-ról, ezért a feldolgozás során ellenőriztem a hivatkozott forrásokat. Az eredmény vegyes, és ezt érdemes tudni, mielőtt a cikk kontextusát elfogadjuk.

Ami megállja a helyét:

  • arXiv:2503.23303 valós és illeszkedik. A „SalesRLAgent: A Reinforcement Learning Approach for Real-Time Sales Conversion Prediction and Optimization” 2025-03-30-án jelent meg, a szerző Nandakishor M. Az absztrakt pontosan azt írja le, amit a cikk állít: megerősítéses tanulással valós idejű konverziós valószínűséget jósol értékesítési beszélgetésekben, szemben a Kapa.ai, Mendable, Inkeep típusú, kész LLM-ekre épülő rendszerekkel. Ez valóban egy évvel a Jev előtt volt.
  • A TypeSafe AI és a Jev létezik, és valós visszhangot kapott: a TechCrunch és a Tom's Hardware is írt róla 2026 szeptemberében. A szerző állítása, hogy „egy jól finanszírozott frontier lab” vezette be a koncepciót, tényszerű.
  • A nyílt szoftveres állítások ellenőrizhetők. A GitHub repó (NandhaKishorM/laya) Apache-2.0 licencű, ~8 800 csillaggal és 740 fork-kal a feldolgozás idején. A 51 commit túlnyomó része a szerzőé (a többi dependabot és két külső közreműködő). A Hugging Face repó ~1 570 lájkot gyűjtött, a PyPI-csomag első kiadása 2026-09-18-i.

Ami nem állja meg a helyét:

  • A második paper leírása pontatlan. A cikk azt állítja, hogy 2025 szeptemberében publikálta az arXiv:2510.01237-et, „formalizálva a séma-alapú döntések keretrendszerét, megerősítéses tanulással vezérelve”. A paper valódi címe és tartalma más: „Confidence-Aware Routing for Large Language Model Reliability Enhancement: A Multi-Signal Approach to Pre-Generation Hallucination Mitigation”. Ez egy hallucináció-mitigáló routing rendszer leírása, három jel (szemantikai illeszkedés, rétegen belüli konvergencia, tanult magabiztosság-becslés) alapján négy útvonalra irányítja a kérdéseket (helyi generálás, RAG, nagyobb modell, emberi felülvizsgálat). Ez nem séma-alapú döntések formalizálása és nem RL-vezérelt. A kettő között van tematikus rokonság, mindkettő routing és magabiztosság körül forog, de a cikk által állított folytonosság a két munka között nem igazolható a paper szövegéből.
  • A következmény a prior art igényre: az első paperre alapozott „én előbb csináltam” érv erős; a másodikra alapozott „formalizáltam a keretrendszert” érv nem. A cikk retorikailag a két munkát egy folytonos vonalként mutatja be, ami a Jev-ügy narratíváját erősíti, de a források ezt nem támasztják alá egyformán.
  • A „beats 0.735 teacher ceiling” állítás önmagában nem sokat mond, hacsak a tanári plafon definíciója és mérése nem ismert. A cikk nem adja meg, mi a tanári modell, hogyan mérték a plafont, és a typed-decisions benchmark tanítóhalmazán való finomhangolás mennyire teszi összemérhetetlenné a számot. Ez utóbbit a szerző önmaga is elismeri a korlátok szekcióban, ami enyhíti a problémát, de a benchmark-táblázat ezt a kontextust nem tartalmazza.

Ami semleges, de hiányzik: a cikk nem közöl semmit a Jev oldaláról, hogy a TypeSafe mit állít magáról, milyen benchmarkon, milyen feltételekkel. A Jev-számokat harmadik féltől veszi át, ami módszertanilag helyes eljárás, de azt jelenti, hogy az összehasonlítás fele nem ellenőrizhető a cikkből.

Összesítés: a cikk technikai tartalma önmagában erős és jól mérhető, a kalibráció, a routing-szükséglet és a korlátok szekciók konkrét számokkal dolgoznak, és a nyílt szoftver valóban létezik és elérhető. A történeti prioritás-narratíva viszont csak részben igazolt: az első paper igen, a második nem. Aki a cikket a „miért nem kapott elismerést a szerző” keretben olvassa, annak érdemes tudnia, hogy a szerző által hivatkozott második bizonyíték nem azt tartalmazza, amit a cikk állít róla.


Saját rendszerünkre alkalmazható

MAGAS alkalmazhatóság. A cikk olyan problémát tárgyal, amivel a saját pipeline-unk mindennap küzd: a jelenleg LLM-ekre bízott egyszerű osztályozási döntéseket kalibrált, gyors, determinisztikus modellekre cserélni.

  • A saját „System 1” döntéseink listája. A pipeline-unkban számos helyen hívunk generatív modellt reflex-döntésre: a terminológia-detektálás (detect_new_terms.py), a batch-review classify()-ja (accept/reject/noise), a topic-mapping, az auto-review pontozás, a kanonikus név-felismerés. Ezek mind choice vagy score típusú döntések. A cikk konkrét alternatívát mutat: egy 322M paraméteres, ~33 ms-os modell, saját súlyokkal, saját gépen.
  • A kalibráció közvetlenül érinti az auto-review küszöbeinket. A saját rendszerünkben az „LLM score 0.90 → auto_approved” egy kalibrálatlan valószínűségen alapul, a cikk leírása szerint pontosan azon a hibán, amit a „confidence: 0.95 generált token” jelenség okoz. Az ECE-mérés módszere (0,246 → 0,081) és a hőmérséklet-kalibrálás technikája (egy skalár illesztése kérdéstípusonként) közvetlenül átültethető arra, hogy az auto-review 0.90-es küszöbe valóban 90%-os megbízhatóságot jelentsen.
  • A „magabiztosság nem figyelmeztet, ha nem érti a bemenetet” tanulság a saját ASR- és nyelvi kezelésünkre vonatkozik. A Khmer-eset (0,000 pontosság, 0,952 magabiztosság) ugyanaz a hibaosztály, mint amit a saját ASR-error-lexikonjainknál kezelünk: a modell magabiztos kimenetet ad rossz bemenetre. A cikk módszere, a bemenet írásrendszerének vizsgálata a forward pass ELŐTT, 0,09 ms-os overhead-del, egy olcsó, determinisztikus előszűrő, amit a saját pipeline-jainkba is be lehet építeni annak eldöntésére, hogy egy adott nyelvű szöveget egyáltalán érdemes-e a fő modellnek adni.
  • A primitív-típusok (choice/score/noul) jó séma a saját döntéseink formalizálására. A saját terminológia-detektálás jelenleg szabad szöveges LLM-választ kér, majd regex-szel parse-olja, pontosan az a minta, amit a cikk kritizál. A három primitív explicit felülete tisztább szerződést adna, és a noul (kalibrált logikai valószínűség) különösen jól illik olyan eldöntendő kérdéseinkhez, mint „ez a terminus valódi szakszó vagy zaj?”.
  • A nyílt súlyok és az Apache-2.0 licenc megfelel a saját elvárásainknak. A cikk rendszere self-hostolható, air-gapped képes, és nincs API-költsége, összhangban a self-host preferenciánkkal és a privacy-first elvárással. A mérések szerint a saját hosztolás 0,00 USD/1M token a Jev 0,042 USD-jével szemben.
  • Amit óvatosan kell kezelni: a szerző maga mondja, hogy a zero-shot teljesítmény ~0,35 (véletlen szint). Ez azt jelenti, hogy a Laya bevezetése a saját döntéseinkbe finomhangolást igényel a saját domainünkön, nem elég a csomag telepítése. Ez valós munkamennyiség, nem plug-and-play. A cikk viszont megad egy ingyenes Kaggle 2xT4 notebookot (~4 óra), ami pontosan erre a célra készült.

Forrás (a magyar summaryhez)

  • Eredeti URL: https://laya.convaiinnovations.com/
  • Tartalom: ~1 973 szó, 14 229 karakter, self-write (subagent nélkül)
  • Szerző: Nandakishor Mukkunnoth, Founder & CEO, ConvAI Innovations
  • Megjelenés: 2026-09-18 (dev.to API-val ellenőrizve; a .com oldal ugyanez a szöveg)
  • Kinyerés: browser_exec + document.body.innerText (a cikk egyoldalas, statikus; nincs paywall, nincs <article>-kinyerés szükséges)
  • Feldolgozva: 2026-09-21
  • Topic mapping: ai-automation.md (agent-design, döntési architektúra, inferencia-hatékonyság)
  • Ellenőrzött külső források: arXiv API (2503.23303, 2510.01237, a szerző teljes paper-listája), GitHub API (repo-metaadatok, commitok, közreműködők), Hugging Face API (modell-metaadatok), PyPI JSON API (kiadások, licenc), dev.to API (publikálás dátuma)
  • Kapcsolódó saját témák: ai-automation.md topic; az agent-döntési architektúrák és a kalibráció kérdése a wiki raw/papers/ mappájában lévő tanulmányokhoz kapcsolódik (Self-Harness, Memo: Memory as Model, Skill Retrieval Augmentation)
Vissza a tetejére