Modele și platforme AI
Z.ai detaliază construcția inferenței GLM-5.3-Flash pe 100.000 de cipuri chinezești

Z.ai a publicat pe 17 septembrie 2026 un raport tehnic care descrie cum a construit de la zero un serviciu de inferență de nivel producție complet pentru modelul său GLM-5.3-Flash pe un cluster de peste 100.000 de acceleratoare AI fabricate în China. Conform companiei, o mare parte a lucrării a fost realizată de un Agent Infra alimentat de GLM-5.3, mai degrabă decât de inginerii de infrastructură singuri, și toate inferențele de producție pentru GLM-5.3-Flash rulează pe sistem.
Z.ai a declarat că nimeni nu operase anterior un cluster de acceleratoare fabricate în China la această scară. Compania a menționat capacitatea limitată a memoriei pe cip și lățimea de bandă, o arhitectură de model nouă, o fereastră de context de 1M de tokeni și cereri multimodale, alături de un ecosistem imatur în care suportul pentru kerneluri era incomplet și inginerii trebuiau să ghicească comportamentul care ar fi trebuit documentat.
GLM-5.3-Flash lansat pe 26 august 2026 ca primul model nativ multimodal din seria GLM-5, cu 320 de miliarde de parametri în total și 18 miliarde de parametri activi, sub o arhitectură hibridă ce combină atenția rară și cea liniară. Înainte de lansare, Z.ai a testat modelul anonim ca ox-alpha pe OpenCode și OpenRouter, iar compania a declarat că a devenit cel mai utilizat model pe ambele platforme în decurs de o săptămână de la lansare, procesând peste 62 de trilioane de tokeni în șase zile.
Metoda de Feedback Dens
În centrul raportului se află o problemă de sistem: metricile end-to-end pot indica unui agent că rezultatele s-au înrăutățit, dar nu de ce. Un test de acuratețe numerică eșuat, o creștere de 30 % a timpului până la primul token sau o scădere de 20 % a debitului de ieșire nu arată care strat este responsabil sau ce să se testeze în continuare. Răspunsul Z.ai, pe care îl numește feedback dens, combină testele de corectitudine, jurnalele de execuție, urmele de execuție, evenimentele de rulare, microbenchmark-urile și metricile end-to-end în fluxuri de lucru repetabile care permit agentului să valideze fiecare ipoteză local, în loc să aștepte o implementare completă și un test de încărcare după fiecare modificare.
Compania definește trei proprietăți obligatorii pentru un astfel de feedback. Acesta trebuie să fie local, legat, ori de câte ori este posibil, de parametri specifici de lansare, modificări de cod, kerneluri, condiții de intrare, fire de execuție, intervale de execuție sau căi de cod. Trebuie să fie ieftin și rapid de obținut. Și trebuie să susțină verificarea obiectivă prin implementări de referință și experimente controlate, deoarece corelațiile observate, luate izolat, nu stabilesc o cauză rădăcină.
În bucla de lansare descrisă în raport, inginerii au definit obiective și limite ale sistemului și au revizuit modificările critice ce implicau semantica numerică, comportamentul concurenței și riscul de producție, în timp ce agentul a gestionat analiza, ipotezele și modificările de cod. Stiva pe care au optimizat-o împreună a combinat paralelismul tensorial intra-nod pentru atenția liniară și LM Head, ReplaySSM, cuantizarea W8A8, cuantizarea cache de precizie mixtă INT8/FP8/BF16 și Layer Split, sub o arhitectură de tip Encode-Prefill-Decode dezagregată.
Trei Cazuri de Inginerie
Primul caz se referă la corectitudinea numerică. Validarea care compara căile de execuție ale kernelului partiționat și nepartiționat a expus o problemă de acuratețe în calea de Paralelism Contextual a kernelului KDA: operația tl.dot se seta implicit la calcul TF32 chiar și când intrările erau FP32, astfel încât erorile s-au acumulat în timpul combinării stărilor și s-au amplificat pe măsură ce lungimea contextului creștea. Remediul a setat explicit precizia intrării la tf32x3, care folosește trei operații TF32 Tensor Core pentru a obține un rezultat cu precizie mai mare.
Conform raportului, remedierile au fost integrate în fluxul principal în Flash Linear Attention. cerere de extragere, deschisă și integrată pe 27 august 2026, aplică lanțul afin tf32x3 în kernelurile de actualizare a stării și de combinare a transformărilor ca o cale de acuratețe opțională, adaugă teste de Paralelism Contextual și revine explicit la precizia ieee pe platformele fără suport tf32 (AMD, NPU‑uri și GPU‑uri NVIDIA cu capacitate de calcul sub 8.0).
Al doilea caz se referă la un blocaj de concurență în transferul KV. Conform raportului, inginerii au stabilit un criteriu de acceptare conform căruia, la aceeași sarcină de lucru, Prefill plus transfer KV ar trebui să ruleze în limita a 5 % față de linia de bază doar cu Prefill. Agentul a identificat diferențe de peste 20 % în unele scenarii și le-a atribuit versiunii DeepEP v1.2.1, în care nici expediere sau combinația intranodapel de combinare nu elibera explicit GIL‑ul Python. Atâta timp cât aceste apeluri dețineau blocarea, firul de execuție Python Mooncake Transfer din același proces nu putea prelua GIL‑ul la timp, astfel că programarea și trimiterea sarcinilor de transfer au întârziat, iar suprapunerea cu calculul s-a redus. Raportul menționează că în aceeași versiune, internode_dispatch elibera deja GIL‑ul, cu un comentariu în cod care indica că scopul era evitarea blocării transferului KV în alte fire în timp ce CPU‑ul aștepta. După ce remedierea a eliberat GIL‑ul în intervalele relevante de execuție C++, conform raportului, diferența a scăzut sub 1 % în aceleași condiții de testare.
Al treilea caz se referă la performanța nucleului. Z.ai a făcut ca agentul să extragă tehnici din nucleele scrise manual în proiecte precum SGLang, Flash Linear Attention și DeepGEMM, transformându-le în schelete de optimizare reutilizabile care includ condiții de aplicabilitate, metode de transformare, constrângeri de resurse și dovezi de validare. Pe un nucleu reprezentativ KDA Decode, compania raportează că optimizarea divizării realizată de agent a redus timpul de execuție cu 9,6 %. După ce feedback‑ul a identificat calculul ca principalul blocaj, agentul a fuzionat plăcile din dimensiunea V ale nucleului, care repetau aceleași calcule de normalizare și control FP32 de patru ori, într-un singur bloc de fire cu rezultate intermediare rezidente în registre și o reducere la nivel de warp, obținând, conform companiei, o creștere a vitezei de 1,71× față de versiunea anterioară.
Rezultate declarate și auto‑îmbunătățire recursivă
Z.ai raportează că GLM-5.3-Flash a trecut de la adaptarea inițială a modelului la pregătirea pentru producție în mai puțin de două săptămâni, iar debitul final a ajuns să se tripleze în raport cu linia de bază inițială. Compania a mai precizat că eficiența utilizării hardware‑ului și costul per token au atins niveluri comparabile cu cele ale GPU‑urilor NVIDIA de larg consum.
Compania încadrează efortul ca un prim exemplu de auto‑îmbunătățire recursivă, subliniind că modelul a participat la optimizarea sistemului de inferență pe care rulează. În același timp, Z.ai afirmă că nu a atins încă auto‑îmbunătățirea recursivă și că alegerea obiectivelor, stabilirea limitelor și evaluarea riscurilor rămân responsabilități umane pe care, în opinia lor, oamenii ar trebui să le păstreze.












