AI-mallit ja alustat
Z.ai esittelee GLM-5.3-Flash-inferenssin, joka on rakennettu 100 000 kiinalaisella sirulla

Z.ai julkaisi 17. syyskuuta 2026 teknisen selostuksen, jossa kuvataan, miten se rakensi alusta alkaen täyden tuotantotason inferenssipalvelun GLM-5.3-Flash-mallille yli 100 000 kiinalaisella AI-kiihdyttimellä varustetulle klusterille. Yrityksen mukaan suuri osa työstä toteutettiin GLM-5.3‑voiman Infra Agentin avulla sen sijaan, että pelkästään infrastruktuuri‑insinöörit tekisivät sen, ja kaikki GLM-5.3-Flash‑tuotantoinferenssi ajetaan järjestelmässä.
Z.ai totesi, ettei kukaan ollut aiemmin käyttänyt kiinalaisilla kiihdyttimillä varustettua klusteria tässä mittakaavassa. Yritys mainitsi suhteellisen rajoitetun sirun sisäisen muistin kapasiteetin ja kaistanleveyden, uuden mallirakenteen, 1 miljonin tokenin kontekstin ikkunan ja multimodaaliset pyynnöt, sekä kypsymättömän ekosysteemin, jossa ytimen tuki oli puutteellista ja insinöörien täytyi arvata käyttäytymistä, jonka olisi pitänyt olla dokumentoituna.
GLM-5.3-Flash julkaistiin 26. elokuuta 2026 ensimmäisenä natiivimultimodaalisena mallina GLM-5-sarjassa, jossa on yhteensä 320 miljardia parametria ja 18 miljardia aktiivisia parametreja hybridirakenteessa, joka yhdistää harvan ja lineaarisen huomion. Ennen julkaisua Z.ai testasi mallia nimettömästi nimellä ox-alpha OpenCodelta ja OpenRouterilta, ja yritys kertoi sen nousseen molempien alustojen eniten käytetyksi malliksi viikon sisällä julkaisusta, käsitellen yli 62 triljoonaa tokenia kuudessa päivässä.
Tiheä palaute -menetelmä
Kertomuksen ytimessä on järjestelmäongelma: päästä‑päähän-mittarit voivat kertoa agentille, että tulokset ovat heikentyneet, mutta eivät miksi. Epäonnistunut numeerisen tarkkuuden testi, 30 %:n kasvu ensimmäisen tokenin odotusajassa tai 20 %:n lasku lähtökapasiteetissa eivät näytä, mikä kerros on vastuussa tai mitä seuraavaksi testata. Z.ai:n vastaus, jota se kutsuu tiheäksi palautteeksi, yhdistää oikeellisuustestit, suoritusaikakirjautumiset, suorituksen jäljitykset, suoritustapahtumat, mikrobenchmarkit ja päästä‑päähän-mittarit toistettaviksi työnkuluiksi, joiden avulla agentti voi paikallisesti vahvistaa jokaisen hypoteesin sen sijaan, että odottaisi täyttä käyttöönottoa ja kuormitustestiä jokaisen muutoksen jälkeen.
Yritys määrittelee täälle palautteelle kolme vaadittua ominaisuutta. Sen on oltava paikallinen, mahdollisuuksien mukaan sidottu erityisiin käynnistysparametreihin, koodimuutoksiin, ytimiin, syöteolosuhteisiin, säikeisiin, suoritusaikaväleihin tai koodipolkuihin. Sen on oltava edullinen ja nopeasti saatavilla. Lisäksi sen on tuettava objektiivista vahvistusta referenssitoimeenpiteiden ja kontrolloitujen kokeiden avulla, koska pelkät havainnoidut korrelaatiot eivät itsessään määritä perimmäistä syytä.
Käynnistysloopissa kertomus kuvaa, että insinöörit määrittivät tavoitteet ja järjestelmän rajat sekä tarkastelivat kriittisiä muutoksia, jotka koskivat numeerista semantiikkaa, samanaikaisuuskäyttäytymistä ja tuotantoriskiä, kun taas agentti hoiti analyysin, hypoteesit ja koodimuutokset. Yhdessä optimoitu pino yhdisti intra-solmu tensoriparallelismin lineaariselle huomille ja LM Head -komponentille, ReplaySSM:lle, W8A8-kvantisoinnin, sekoitetun tarkkuuden INT8/FP8/BF16-välimuistikvantisoinnin sekä Layer Split -menetelmän, Encode-Prefill-Decode‑eriytetyn arkkitehtuurin alla.
Kolme Insinööritapausta
Ensimmäinen tapaus koskee numeerista tarkkuutta. Ositetun ja jakamattoman ytimen suorituspolkkujen vertailu paljasti tarkkuusongelman KDA-ytimen Context Parallelism -polussa: tl.dot‑operaatio oletuksena käytti TF32‑laskentaa, vaikka sen syötteet olivat FP32, jolloin virheitä kertyi tilan yhdistämisen aikana ja paheni kontekstin pituuden kasvaessa. Korjaus asetti syötteen tarkkuuden eksplisiittisesti tf32x3:ksi, mikä käyttää kolmea TF32 Tensor Core -operaatiota tuottaakseen tarkemman tuloksen.
Kertomuksen mukaan korjaukset yhdistettiin ylävirtaan Flash Linear Attention -malliin. vetopyyntö, joka avattiin ja yhdistettiin 27. elokuuta 2026, soveltaa tf32x3‑affiiniketjua tilapäivitys‑ ja transformaatio‑yhdistyskernelle valinnaisena tarkkuuspolkuna, lisää Context Parallelism -testit ja palauttaa eksplisiittisesti IEEE‑tarkkuuteen alustoilla, joilla ei ole tf32‑tukea (AMD, NPU:t ja NVIDIA‑GPU:t, joiden laskentakyky on alle 8.0).
Toinen tapaus koskee KV Transfer -samanaikaisuuspulmaa. Kertomuksen mukaan insinöörit asettivat hyväksymiskriteerin, jonka mukaan saman työkuorman alla Prefill‑plus‑KV Transfer -toiminnon tulisi toimia 5 %:n sisällä Prefill‑vain‑peruslinjan suorituskyvystä. Agentti havaitsi joissakin tilanteissa yli 20 %:n aukkoja ja jäljitti ne DeepEP v1.2.1:een, jossa kumpikaan intranodelähetys eikä intranodeyhdistyskutsu ei vapauttanut eksplisiittisesti Python‑GIL:iä. Niin kauan kuin nämä kutsut pitivät lukkoa, samassa prosessissa oleva Mooncake Transfer -Python‑säie ei pystynyt saamaan GIL:iä ajoissa, jolloin siirto‑tehtävien ajoitus ja lähetys viivästyivät ja päällekkäisyys laskennassa supistui. Kertomus huomauttaa, että internode_dispatch samassa versiossa vapautti jo GIL:n, koodikommentissa todettiin, että tarkoituksena oli estää KV Transferin estäminen muissa säikeissä CPU:n odotellessa. Kun korjaus vapautti GIL:n asianomaisten C++‑suoritusaikavälien aikana, kertomuksen mukaan aukko laski alle 1 % saman testin olosuhteissa.
Kolmas tapaus koskee ytimen suorituskykyä. Z.ai antoi agentin tiivistää käsin kirjoitettujen ytimien tekniikoita projekteissa, kuten SGLang, Flash Linear Attention ja DeepGEMM, uudelleenkäytettäviin optimointirunkoihin, jotka sisältävät soveltuvuusolosuhteet, muunnosmenetelmät, resurssirajoitukset ja validointitodisteet. Edustavassa KDA Decode -ytimessä yritys raportoi, että agentin jakautumisoptimointi lyhensi suoritusaikaa 9,6 %. Kun palautteessa tunnistettiin laskenta pääasiallisena pullonkaulana, agentti yhdisti ytimen V‑ulottuvuuden lohkot, joissa sama FP32‑normaalistus- ja porttitoiminto toistui neljä kertaa, yhdeksi säie‑lohkoksi, jossa välitulokset säilyvät rekistereissä ja yksi warp‑tasoinen reduktio, mikä tuotti yrityksen mukaan 1,71‑kerran nopeamman suorituksen kuin edellisessä versiossa.
Ilmoitetut tulokset ja rekursiivinen itseparannus
Z.ai raportoi, että GLM-5.3-Flash siirtyi alkuperäisestä mallin sovituksesta tuotantovalmiuteen alle kahdessa viikossa, ja että loppuun asti kestävä läpimeno kolminkertaistui alkuperäiseen peruslinjaan verrattuna. Yritys totesi myös, että laitteiston käyttötehokkuus ja token‑kohtainen kustannus saavuttivat tasot, jotka ovat verrattavissa tavallisiin NVIDIA‑GPU:ihin.
Yritys esittää työn varhaisena esimerkkinä rekursiivisesta itseparannuksesta, huomauttaen, että malli osallistui sen suoritusympäristön optimointiin. Samalla Z.ai toteaa, ettei se ole vielä saavuttanut täyttä rekursiivista itseparannusta, ja että tavoitteiden valinta, rajojen asettaminen ja riskien arviointi pysyvät ihmisten vastuulla, jonka heidän tulisi jatkossakin pitää hallussaan.












