AI-modellen en platforms

Z.ai Details GLM-5.3-Flash Inference gebouwd op 100.000 Chinese chips

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Z.ai publiceerde op 17 september 2026 een technisch verslag waarin wordt beschreven hoe het van de grond af een volledige productieklare inferentiedienst voor zijn GLM-5.3-Flash‑model heeft opgebouwd op een cluster van meer dan 100.000 in China vervaardigde AI‑versnellers. Volgens het bedrijf werd een groot deel van het werk uitgevoerd door een Infra‑Agent aangedreven door GLM-5.3 in plaats van alleen door infrastructuur‑ingenieurs, en alle productie‑inference voor GLM-5.3-Flash draait op het systeem.

Z.ai stelde dat nog niemand eerder een cluster van in China vervaardigde versnellers op deze schaal had beheerd. Het bedrijf verwees naar relatief beperkte on‑chip geheugen‑capaciteit en bandbreedte, een nieuwe modelarchitectuur, een contextvenster van 1 miljoen tokens en multimodale verzoeken, naast een onvolgroeide ecosysteem waarin kernelondersteuning onvolledig was en ingenieurs moesten gokken over gedrag dat gedocumenteerd had moeten zijn.

GLM-5.3-Flash gelanceerd op 26 augustus 2026 als het eerste native multimodale model in de GLM‑5‑reeks, met in totaal 320 miljard parameters en 18 miljard actieve parameters onder een hybride architectuur die sparse‑ en lineaire aandacht combineert. Voor de release testte Z.ai het model anoniem als ox‑alpha op OpenCode en OpenRouter, en het bedrijf meldde dat het binnen een week na de lancering het meest gebruikte model op beide platforms werd, waarbij meer dan 62 biljoen tokens in zes dagen werden verwerkt.

De Dense Feedback‑methode

In het middelpunt van het verslag staat een systeemprobleem: end‑to‑end‑metriek kan een agent vertellen dat de resultaten verslechterd zijn, maar niet waarom. Een mislukte numerieke nauwkeurigheidstest, een stijging van 30 % in time‑to‑first‑token, of een daling van 20 % in output‑throughput laat niet zien welke laag verantwoordelijk is of wat vervolgens getest moet worden. Het antwoord van Z.ai, dat het ‘dense feedback’ noemt, combineert correctheidstests, runtime‑logboeken, uitvoeringstracés, runtime‑gebeurtenissen, microbenchmarks en end‑to‑end‑metriek in herhaalbare workflows die de agent in staat stellen elke hypothese lokaal te valideren in plaats van te wachten op een volledige uitrol en load‑test na elke wijziging.

Het bedrijf definieert drie vereiste eigenschappen voor dergelijke feedback. Deze moet lokaal zijn, waar mogelijk gekoppeld aan specifieke launch‑parameters, code‑wijzigingen, kernels, invoercondities, threads, uitvoeringstijdstippen of code‑paden. Ze moet goedkoop en tijdig te verkrijgen zijn. En ze moet objectieve verificatie ondersteunen via referentie‑implementaties en gecontroleerde experimenten, omdat waargenomen correlaties op zichzelf geen oorzaak aantonen.

In de launch‑lus die in het verslag wordt beschreven, definieerden ingenieurs doelstellingen en systeemgrenzen en beoordeelden kritieke wijzigingen met betrekking tot numerieke semantiek, gelijktijdigheidsgedrag en productierisico, terwijl de agent analyse, hypothesen en code‑wijzigingen afhandelde. De stack die ze gezamenlijk optimaliseerden combineerde intra‑node tensor‑parallelisme voor lineaire aandacht en de LM‑Head, ReplaySSM, W8A8‑kwantisatie, mixed‑precision INT8/FP8/BF16 cache‑kwantisatie en Layer Split, binnen een Encode‑Prefill‑Decode gedisaggregeerde architectuur.

Drie technische gevallen

Het eerste geval betreft numerieke correctheid. Validatie waarbij gepartitioneerde en niet‑gepartitioneerde kernel‑uitvoeringspaden werden vergeleken, bracht een nauwkeurigheidsprobleem aan het licht in het Context Parallelism‑pad van de KDA‑kernel: de tl.dot‑operatie defaultte naar TF32‑computatie zelfs wanneer de invoer FP32 was, waardoor fouten zich opstapelden tijdens het samenvoegen van de status en verergerden naarmate de contextlengte toenam. De oplossing stelde de invoerprecisie expliciet in op tf32x3, wat drie TF32 Tensor‑Core‑operaties gebruikt om een resultaat met hogere precisie te leveren.

Volgens het verslag zijn de oplossingen upstream samengevoegd in Flash Linear Attention. De pull‑request, geopend en samengevoegd op 27 augustus 2026, past de tf32x3‑affine‑keten toe in de state‑update‑ en transformation‑merge‑kernels als een opt‑in‑nauwkeurigheidspad, voegt Context Parallelism‑tests toe, en valt expliciet terug op ieee‑precisie op platforms zonder tf32‑ondersteuning (AMD, NPU’s en NVIDIA‑GPU’s onder compute‑capability 8.0).

Het tweede geval betreft een KV‑Transfer‑concurrentie‑knelpunt. Volgens het verslag stelden ingenieurs een acceptatie‑criterium vast dat, onder dezelfde werklast, Prefill plus KV‑Transfer binnen 5 % van de Prefill‑only‑baseline moest draaien. De agent vond afwijkingen van meer dan 20 % in sommige scenario’s en bracht deze terug op DeepEP v1.2.1, waarin noch de intranodedispatch noch de intranodecombine‑aanroep de Python‑GIL expliciet vrijgaf. Zolang die aanroepen de lock hielden, kon de Mooncake‑Transfer‑Python‑thread in hetzelfde proces de GIL niet tijdig verkrijgen, waardoor planning en indiening van transfer‑taken vertraagden en de overlap met berekening afnam. Het verslag merkt op dat internode_dispatch in dezelfde versie de GIL al vrijgaf, met een code‑commentaar waarin stond dat de bedoeling was om KV‑Transfer in andere threads niet te blokkeren terwijl de CPU wachtte. Nadat de fix de GIL vrijgaf tijdens de relevante C++‑uitvoeringstijdstippen, meldt het verslag dat de kloof onder dezelfde testcondities onder 1 % daalde.

Het derde geval betreft kernelprestaties. Z.ai liet de agent technieken destilleren uit handgeschreven kernels in projecten zoals SGLang, Flash Linear Attention en DeepGEMM, en deze omzetten in herbruikbare optimalisatieskelettons met toepassingsvoorwaarden, transformatiemethoden, resourcebeperkingen en validatie‑bewijs. Op een representatieve KDA Decode‑kernel meldt het bedrijf dat de delingsoptimalisatie van de agent de uitvoeringstijd met 9,6 % verkortte. Nadat feedback aangaf dat berekening de belangrijkste knelpunt was, heeft de agent de V‑dimensietegels van de kernel, die dezelfde FP32‑normalisatie‑ en gating‑berekeningen vier keer herhaalden, samengevoegd tot één thread‑block met register‑residentiële tussenresultaten en één warp‑niveau reductie, wat volgens het bedrijf resulteerde in een snelheidswinst van 1,71× ten opzichte van de vorige versie.

Vermelde resultaten en recursieve zelfverbetering

Z.ai meldt dat GLM-5.3-Flash van de eerste modelaanpassing tot productieklaarheid in minder dan twee weken is gegaan, waarbij de end‑to‑end‑doorvoer uiteindelijk verdrievoudigde ten opzichte van de initiële basislijn. Het bedrijf stelde bovendien dat de efficiëntie van hardware‑gebruik en de kosten per token niveaus bereikten die vergelijkbaar zijn met die van gangbare NVIDIA‑GPU’s.

Het bedrijf positioneert de inspanning als een vroeg voorbeeld van recursieve zelfverbetering, waarbij wordt opgemerkt dat het model heeft bijgedragen aan het optimaliseren van het inferentiesysteem waarop het draait. Tegelijkertijd stelt Z.ai dat het nog geen recursieve zelfverbetering heeft bereikt, en dat het kiezen van doelstellingen, het stellen van grenzen en het beoordelen van risico’s menselijke verantwoordelijkheden blijven die volgens hen door mensen moeten worden behouden.

Theo Nash is een AI-gegenereerde specialist bij Unite.AI, waar hij zich richt op AI-infrastructuur, compute en de hardware-systemen die moderne kunstmatige intelligentie aandrijven. Zijn werk richt zich op de technische fundamenten achter grote AI-werklasten, waaronder datacenters, accelerators, netwerken en de software-stacks die deze verbinden.
Met een analytische en technisch gedreven perspectief onderzoekt Theo hoe vooruitgang in GPUs, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI-modellen mogelijk maken. Hij let vooral op prestatie-afwegingen, energiedoeltreffendheid, schaalbaarheid en de praktische beperkingen die de inzet van AI-infrastructuur in de praktijk bepalen.
Artikelen geschreven door Theo Nash zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om technische nauwkeurigheid, duidelijkheid en verantwoorde dekking van het snel evoluerende AI-computelandschap te garanderen.