Kihagyás

GLM-5.3-Flash: Frontier Intelligence, Flash Cost

Dátum: 2026. augusztus 26. • Forrás: https://z.ai/blog/glm-5.3-flash Szerző: Z.ai (Zhipu AI) • Topic: ai-automation.md (AI frontier research) Típus: Modell-bejelentés / kutatási blog

Összegzés

A Z.ai 2026. augusztus 26-án bejelentette a GLM-5.3-Flash modellt, amely a GLM-5 sorozat első natívan multimodális tagja. A modell 320 milliárd teljes paraméterrel rendelkezik, de csupán 18 milliárd aktív paramétert használ inference közben, és a gyártó szerint a GLM-5.2-höz képest benchmarkokon és valós workloadokon is felülmúlja azt, mindezt tizedáron, miközben a coding és agentic benchmarkokon megközelíti a Claude Opus 4.8 teljesítményét.

A GLM-5.3-Flash több architektúrális újítást vezet be a GLM-5-höz képest. Először is, hibrid architektúrát alkalmaz, amely a ritka (sparse) és lineáris figyelmet kombinálja, élesen csökkentve a hosszú kontextusú kiszolgálás költségeit, miközben megőrzi a precíz hosszú kontextusú képességeket. Másodszor, a modell alkalmazza a Manifold-Constrained Hyper-Connections (mHC) technikát, amely tovább javítja a skálázási hatékonyságot. Ezek az architektúrális fejlesztések a legújabb 30T-token multimodális pre-training korpusszal együtt lehetővé teszik, hogy a GLM-5.3-Flash kevesebb számítással több intelligenciát produkáljon.

A modell teljesítménye kiemelkedő a költség-versenyképesség szempontjából. Az Artificial Analysis Intelligence Index v4.1.1-en 57 pontot ér el mindössze $0.045/feladat áron (diszkontált áron), ami korábban csak tízszer ennyi költség mellett volt elérhető. Ez a GLM-5.3-Flash-ot kiválóan alkalmassá teszi széles körű workloadokhoz. Hat coding és agentic benchmarkon a modell konzisztensen felülmúlja a GLM-5.2-t, gyakran jelentős mértékben: 63.4 vs. 46.2 a DeepSWE v1.1-en, és 48.8 vs. 26.2 az AutomationBench-en, miközben összességében megközelíti a Claude Opus 4.8-at. A gyártó belső coding értékelésén, a Z.ai Code Bench v1.0-on (Claude Code 2.1.207-ben futtatva), a GLM-5.3-Flash egyértelműen felülmúlja a GLM-5.2-t minden erőfeszítés-szinten, és maximális erőfeszítésnél majdnem eléri a Claude Opus 4.8-at (29.0 vs. 29.5).

Az architektúra hatékonysága lenyűgöző. A GLM-4.5 sorozathoz képest a GLM-5.3-Flash kifejezetten ultra-alacsony költségű inference-re van tervezve. Hasonló teljes paraméterszám mellett (320B vs. 355B) közel felére csökkenti mind az aktivált paraméterek számát (18B vs. 32B), mind a rétegek számát (45 vs. 92). Hosszú kontextusú szituációkban a lineáris és ritka figyelem kombinációját használja: a lineáris figyelem az állapotmodellezésen keresztül a lokális függőségeket ragadja meg, míg a ritka figyelem egy könnyűsúlyú indexer segítségével a releváns globális kontextust keresi vissza. Az indexer késleltetésének és memóriaigényének további csökkentésére 1M-token kontextus mellett a modell bevezeti az IndexPool-t, amely négy indexer kulcsvektort tömöríti eggyé súlyozott pooling-gal. A GLM-5.3-höz képest a GLM-5.3-Flash 3.0-szeresére csökkenti a figyelem számítását és 4.4-szeresére a KV cache méretét, és az összehasonlított modellek közül a legalacsonyabb figyelem-számítással rendelkezik.

A vizuális intelligencia a coding loopban fontos új képesség. A Z.ai adat-szintézis pipeline-okat fejlesztett a vizuális codinghoz, amelyek a self-visual judgment-re és a test-time improvement-re fókuszálnak. Az eredményül kapott trajektóriák megkövetelik a modelltől, hogy interakcióba lépjen a környezettel, ellenőrizze a saját kimeneteit, és iteratívan finomítsa azokat. A kutatási filozófia itt világos: "a kód lehetővé teszi a modell számára, hogy építse és változtassa a világot; a látás pedig lehetővé teszi, hogy belépjen abba a világba, amelyet az emberek látnak és használnak". A vizuális self-verifikáció révén a modell képes észlelni a layout-problémákat, és iteratívan javítani a megjelenítést, ami különösen hasznos a frontend fejlesztésben és a UI/UX tervezésben.

A kínai AI chipeken való kiszolgálás technikai áttörés. Az elmúlt héten a GLM-5.3-Flash-ot nagy léptékű kínai AI chip-klaszteren szolgáltatták ki, nagy sávszélességű összeköttetéssel és a hardverre optimalizált serving stack-kel. Figyelemre méltó, hogy ezt az erőfeszítést a GLM-5.3-alapú infrastruktúra-ágens gyorsította, amely a mérnököknek segített a kernel-ek fejlesztésében és optimalizálásában, a teljesítmény-szűk keresztmetszetek diagnosztizálásában, és a serving stack fejlesztésében, létrehozva egy visszacsatolási hurkot, amelyben a modell segítette a rendszer optimalizálását, amely a modellt kiszolgálja. Ez a fajta meta-optimalizáció új szintje a modell-infrastruktúra ko-designnak.

A serving stack ötvözi az intra-node tensor párhuzamosságot a Linear Attention és LM head számára, a ReplaySSM-et, a W8A8 kvantálást, a hibrid INT8/FP8/BF16 cache kvantálást, és a Layer Split technikát. A klaszter skálán a termelési Encode-Prefill-Decode (EPD) disaggregált architektúra szétválasztja a multimodális kódolást, a prompt prefillt és a token-by-token dekódolást függetlenül ütemezett és skálázható worker pool-okba, lehetővé téve a hatékony és megbízható kiszolgálást több tízezer kérésen keresztül. Az azonos hardveren az eredeti baseline-hoz képest 3-szeres végponti serving teljesítményjavulást értek el, a hardver-hatékonyság és a per-token költség a főáramú NVIDIA GPU-kkal összehasonlítható szintre jutott. Ez demonstrálja, hogy a kínai chipek képesek hatékonyan és gazdaságosan támogatni a frontier-modell inference-t nagy léptékben.

A benchmark-összehasonlításban a GLM-5.3-Flash a coding benchmarkokon (Terminal Bench 2.1: 84.3, DeepSWE v1.1: 63.4) versenyképes a Claude Opus 4.8-cal (85.0, 58.0), és közelíti a GPT-5.6 Terra és Gemini 3.7 Flash modelleket. Az agentic benchmarkokon (Toolathlon Verified: 78.4, AutomationBench v1.0.6: 48.8) kiemelkedő, és a vision benchmarkokon (OfficeQA Pro: 62.4, CharXiv Reasoning w/ Tools: 89.4, Chartography w/ Tools: 78.0) szintén versenyképes. A BabyVision benchmarkon (53.4) a Gemini 3.7 Flash (70.9) és a GPT-5.6 Terra (61.6) mögött van, ami arra utal, hogy a vizuális képességek terén még van fejlesztési potenciál. A getting started részben a Z.ai jelzi, hogy a GLM-5.3-Flash minden GLM Coding Plan felhasználó számára elérhető, háromszor akkora használható kvótával, mint a GLM-5.3, és a modell súlyok nyilvánosan elérhetők a HuggingFace-on. Helyi deployment-hez a modell jelenleg támogatja az SGLang, vLLM és TokenSpeed inference keretrendszereket, más keretrendszerek hamarosan következnek.

A bejelentés legfőbb üzenete, hogy a frontier intelligencia nem igényel frontier költséget. Ez nem egyetlen trükk eredménye, hanem három együttműködő rétegé: egy architektúra, amely kevesebb számításból erősebb képességet produkál, egy gazdagabb multimodális pre-training korpus, és egy inference hardverrel ko-designolt infrastruktúra. A Z.ai most ezt a receptet skálázza nagyobb modellekre: a GLM-5.3-Fash a költség-teljesítmény frontiert tolja, és a belőle levont tanulságok már a következő frontier modellt formálják.

Kulcsmondatok

  • "A GLM-5.3-Flash 320 milliárd teljes paraméterrel és csupán 18 milliárd aktív paraméterrel rendelkezik, és a GLM-5.2-höz képest benchmarkokon és valós workloadokon is felülmúlja azt, mindezt tizedáron, miközben a coding és agentic benchmarkokon megközelíti a Claude Opus 4.8-at". Z.ai blog
  • "A GLM-5.3-Flash 57 pontot ér el az Artificial Analysis Intelligence Index v4.1.1-en mindössze $0.045/feladat áron, ami korábban csak tízszer ennyi költség mellett volt elérhető". Z.ai blog
  • "A lineáris figyelem az állapotmodellezésen keresztül a lokális függőségeket ragadja meg, míg a ritka figyelem egy könnyűsúlyú indexer segítségével a releváns globális kontextust keresi vissza". Z.ai blog
  • "A GLM-5.3-höz képest a GLM-5.3-Flash 3.0-szeresére csökkenti a figyelem számítását és 4.4-szeresére a KV cache méretét". Z.ai blog
  • "A kód lehetővé teszi a modell számára, hogy építse és változtassa a világot; a látás pedig lehetővé teszi, hogy belépjen abba a világba, amelyet az emberek látnak és használnak". Z.ai blog
  • "Egy visszacsatolási hurkot hoztunk létre, amelyben a modell segítette a rendszer optimalizálását, amely a modellt kiszolgálja". Z.ai blog (infrastruktúra-ágens a kernel-fejlesztésben)
  • "Az azonos hardveren az eredeti baseline-hoz képest 3-szeres végponti serving teljesítményjavulást értünk el, a hardver-hatékonyság és a per-token költség a főáramú NVIDIA GPU-kkal összehasonlítható szintre jutott". Z.ai blog
  • "A frontier intelligencia nem igényel frontier költséget. Ez nem egyetlen trükk eredménye, hanem három együttműködő rétegé: egy architektúra, amely kevesebb számításból erősebb képességet produkál, egy gazdagabb multimodális pre-training korpus, és egy inference hardverrel ko-designolt infrastruktúra". Z.ai blog

Személyek és projektek

  • Z.ai (Zhipu AI): Kínai AI kutató és szolgáltató cég, amely a GLM modellcsaládot fejleszti. A blog bejelentés a cég saját kutatási eredményeit mutatja be, és a GLM-5.3-Flash a cég első natívan multimodális modellje.
  • GLM-5.3-Flash: A GLM-5 sorozat első natívan multimodális modellje, 320B teljes és 18B aktív paraméterrel, hibrid sparse + linear attention architektúrával, mHC (Manifold-Constrained Hyper-Connections) technikával, és 30T-token multimodális pre-training korpusszal.
  • GLM-5.2: A GLM-5.3-Flash előd modellje, amelyet a benchmarkokon és valós workloadokon konzisztensen felülmúl.
  • GLM-4.5: Korábbi GLM generáció, amelyhez képest a GLM-5.3-Flash közel felére csökkenti az aktivált paraméterek számát és a rétegek számát.
  • GLM-5: A GLM-5.3-Flash alapjául szolgáló modellcsalád, amellyel az új modell a hibrid attention és az mHC tekintetében is összehasonlítva van.
  • DeepSeek-V4-Flash, Kimi-K3: Open-source modellek, amelyekkel a GLM-5.3-Flash architektúráját összehasonlítják (figyelem-számítás, KV cache méret).
  • Claude Opus 4.8: Az Anthropic frontier modellje, amelyet a GLM-5.3-Flash a coding és agentic benchmarkokon megközelít, de olcsóbban.
  • GPT-5.6 Terra, Gemini 3.7 Flash: OpenAI és Google frontier modelljei, amelyek a benchmark-összehasonlításban referenciaként szolgálnak.
  • OpenCode, OpenRouter: Platformok, ahol a GLM-5.3-Flash-ot anonim "ox-alpha" néven tesztelték a kiadás előtt, és ahol a leggyakoribb modell lett a héten.

Technikai részletek

  • 320B / 18B paraméter: A GLM-5.3-Flash 320 milliárd teljes paraméterrel és 18 milliárd aktív paraméterrel rendelkezik, ami a MoE (Mixture of Experts) architektúrára utal.
  • Hibrid sparse + linear attention: A lineáris figyelem az állapotmodellezésen keresztül lokális függőségeket ragad meg, a ritka figyelem egy könnyűsúlyú indexer segítségével a releváns globális kontextust keresi vissza. A kettő kombinációja csökkenti a hosszú kontextusú serving költségeket a precíz hosszú kontextusú képességek megőrzése mellett.
  • Manifold-Constrained Hyper-Connections (mHC): Technika, amely javítja a skálázási hatékonyságot a hyper-connections manifold-constraint-jével.
  • IndexPool: 1M-token kontextus mellett az indexer késleltetésének és memóriaigényének csökkentésére szolgál, négy indexer kulcsvektort tömörít eggyé súlyozott pooling-gal.
  • 30T-token pre-training korpus: A modell pre-training adatbázisa, amely multimodális (képek, szöveg, videó) elemeket is tartalmaz.
  • 3.0× / 4.4× hatékonyság: A GLM-5.3-Flash a GLM-5.3-hoz képest 3.0-szeresére csökkenti a figyelem-számítást és 4.4-szeresére a KV cache méretét.
  • 45 / 92 réteg: A GLM-5.3-Flash 45 réteggel rendelkezik, míg a GLM-4.5 92-vel, vagyis a rétegszám közel felére csökkent.
  • Vizuális self-verifikáció: A modell képes ellenőrizni a saját vizuális kimeneteit, és iteratívan finomítani azokat, ami különösen hasznos UI/UX és frontend fejlesztésben.
  • EPD (Encode-Prefill-Decode) disaggregált architektúra: A serving stack szétválasztja a multimodális kódolást, a prompt prefillt és a dekódolást független worker pool-okba, ami hatékony skálázást tesz lehetővé több tízezer kérésen.
  • ReplaySSM, W8A8 kvantálás, hibrid INT8/FP8/BF16 cache kvantálás, Layer Split: A serving stack optimalizálási technikái a kínai AI chipek sajátosságaira szabva.
  • Infrastruktúra-ágens (GLM-5.3-alapú): A Z.ai saját modelljét használta a saját serving stack-jének optimalizálására, egy meta-visszacsatolási hurkot teremtve.
  • 3× végponti serving teljesítményjavulás: A kínai AI chipeken az eredeti baseline-hoz képest 3-szeres végponti serving teljesítményjavulás, NVIDIA GPU-kkal összehasonlítható hatékonyság.
  • Coding benchmarkok: Terminal Bench 2.1 (84.3), DeepSWE v1.1 (63.4), NL2Repo (56.3), Z.ai Code Bench v1.0 (29.0 max effort).
  • Agentic benchmarkok: Toolathlon Verified (78.4), AutomationBench v1.0.6 (48.8), Agents' Last Exam (26.3), HLE w/ Tools (55.3), GDPval-AA v2 (1773).
  • Vision benchmarkok: OfficeQA Pro (62.4), CharXiv Reasoning w/ Tools (89.4), Chartography w/ Tools (78.0), BabyVision (53.4), MVbench (77.8), MMVU (80.5).
  • $0.045/feladat: A GLM-5.3-Flash diszkontált ára az Artificial Analysis Intelligence Index v4.1.1 benchmarkon.
  • 3× kvóta: A GLM Coding Plan felhasználók számára a GLM-5.3-Flash háromszor akkora használható kvótával rendelkezik, mint a GLM-5.3.
  • Inference keretrendszerek: SGLang, vLLM, TokenSpeed (helyi deployment).
  • Modell súlyok elérhetősége: HuggingFace (https://huggingface.co/zai-org/GLM-5.3-Flash).
  • ZCode integráció: Browser Use és Computer Use a ZCode-ban (https://zcode.z.ai), az ágens vizuálisan verifikálja a weboldalakat és operál az asztali appokkal.

Szakmai párhuzamok és kontextus

A GLM-5.3-Flash bejelentése több fontos trendet is megerősít az AI iparban. Először is, a költség-teljesítmény frontier aktív tolása: ahol korábban csak tízszer drágább modellekkel volt elérhető egy bizonyos intelligencia-szint, ott most egy nagyságrenddel olcsóbb modellek is megjelennek. Ez a trend párhuzamba állítható a DeepSeek V3 és R1 kiadásaival, amelyek szintén a költség-teljesítmény arány javítására fókuszáltak. A második trend a nyílt forráskódú és zárt modellek közötti szakadék csökkenése: a GLM-5.3-Flash benchmark-eredményei megközelítik a Claude Opus 4.8-at, miközben a modell súlyok nyilvánosan elérhetők a HuggingFace-on. Ez a democratizáció a fejlett AI képességek terén.

A harmadik trend a multimodalitás standarddá válása: a GLM-5.3-Flash a GLM-5 sorozat első natívan multimodális modellje, és a vizuális self-verifikáció a coding loopban új paradigmát jelent. A vizuális képességek integrálása a coding workflow-ba (különösen a UI/UX fejlesztésben) a jövő egyik kulcsfontosságú iránya. A negyedik trend a kínai AI hardver-ökoszisztéma érettsége: a kínai chipeken való 3× végponti serving teljesítményjavulás és az NVIDIA GPU-kkal összehasonlítható hatékonyság azt mutatja, hogy a kínai AI hardver már nem marginális, hanem frontier-modell inference-re is alkalmas. Ez geopolitikai szempontból is jelentős, mert csökkenti a nyugati GPU-któl való függőséget.

Az ötödik trend a modell-infrastruktúra ko-design: a Z.ai saját modelljét (GLM-5.3) használta a saját serving stack-jének optimalizálására, ami egy meta-visszacsatolási hurkot teremt. Ez a fajta AI-asszisztált rendszer-optimalizálás várhatóan egyre elterjedtebbé válik, ahogy a modellek egyre jobban megértik a saját futtatási környezetüket. A hatodik trend az inference-re optimalizált architektúrák térnyerése: a hibrid sparse + linear attention, az mHC és az IndexPool technikák mind azt mutatják, hogy az új modellek kifejezetten az inference költségek csökkentésére vannak tervezve, nem csak a tanítási hatékonyságra.

Forrás

  • Eredeti cikk URL: https://z.ai/blog/glm-5.3-flash
  • API dokumentáció: https://docs.z.ai/guides/llm/glm-5.3-flash
  • Coding Plan: https://z.ai/subscribe
  • ZCode: https://zcode.z.ai
  • HuggingFace modell súlyok: https://huggingface.co/zai-org/GLM-5.3-Flash
  • Dátum: 2026. augusztus 26.
  • Szerző: Z.ai (Zhipu AI) kutatási csapat
  • Topic: ai-automation.md (AI frontier research)
Vissza a tetejére