AI-modeller og platforme
Z.ai lancerer GLM-5.3 med Frontier-kodning og en cyberkapacitet, der voksede ud over dens træning

Z.ai udgav GLM-5.3 den 14. august 2026, en opdatering, som virksomheden siger har samme basismodel som GLM-5.2 og får alle sine kapacitetsgevinster fra opskaleret post-træning. Hovedresultaterne er i kodning, hvor Z.ai rapporterer, at modellen er det stærkeste åbne-weights-system, det har målt, og i cybersikkerhed, hvor virksomheden siger, at kapaciteten voksede hurtigere, end det havde forventet, da træningen blev opskaleret. Vægtene er endnu ikke offentligt tilgængelige: Z.ai siger, at det vil frigive dem om cirka to uger, efter at sikkerheds evaluering og hårdning er fuldført.
Ifølge virksomhedens meddelelse er GLM-5.3 nu tilgængelig via Z.ai’s API og dets GLM Coding Plan og er blevet rullet ud til alle eksisterende coding plan-abonnenter.
Udgivelsen finder sted få dage efter, at DeepSeek har sendt sin egen flagship V4 Pro ud af preview, og Z.ai’s sammenligningstabel stiller GLM-5.3 direkte op mod DeepSeek-V4 Pro, Moonshots Kimi K3 og OpenAI’s GPT-5.6 Sol på kodning, cyber og agentic suites.
Post-træning på en større samling af arbejdsmiljøer
Recepten, som Z.ai beskriver det, er miljøskalering snarere end arkitekturændring. GLM-5.2 introducerede træningsstakken (en lang-kontekstteknik kaldet IndexShare, en forstærkning-læringsmetode til lang-horizontale opgaver kaldet SAO og slime, et open-source-rammework til stor-skala-asynkron RL) og virksomheden siger, at GLM-5.3 kom fra at bruge mere compute på mere og mere diverse opgave-miljøer bygget på den stack.
Disse miljøer er bygget til at ligne enheder af professionelt arbejde snarere end kodningsøvelser. I et eksempel, som virksomheden giver, placeres en model i en ML-infrastruktur-teknikers arbejdsmiljø med adgang til compute-klynger, interne dokumentation, kodebaser og eksperiment-resultater og skal diagnostisere flaskeshals, implementere optimeringer og levere en målbart slut-til-slut-hastighed. Nogle opgaver, siger Z.ai, repræsenterer flere dages arbejde for en erfaren ingeniør. For at producere miljøer i mængde byggede Z.ai pipelines, hvor forskningsagenter konverterer opgave-mønstre fra rigtigt arbejde til kørbare lang-horizontale miljøer, en dommeragent verificerer hver opgave, der faktisk er løselig, og verificatorer syntetiseres uden adgang til reference-løsningen. Belønnings-signalet selv er maskin-genereret for en undermængde af opgaver, med løser-traektorier brugt til at lukke belønnings-genveje. Z.ai bemærker, at pipelines stadig kræver betydeligt menneske-i-løkken-arbejde.
De rapporterede resultater følger mønsteret, som recepten ville forudsige: de største gevinster sidder på de længste-horizontale evalueringer. På Terminal-Bench 3.0, flytter GLM-5.3 fra 4,6 til 28,3 mod GLM-5.2; på DeepSWE v1.1, fra 46,2 til 66,9; på Agents’ Last Exam’s CLI-variant, fra 23,8 til 28,5. Alle tal er vendor-rapporteret, med metod-noter i meddelelsen, der dækker harness, kontekst-længde og sampling-indstillinger for hver benchmark.
Mod andre modeller er billedet blandet. På det interne Z.ai Code Bench rapporterer virksomheden en 50% forbedring over GLM-5.2 og siger, at modellen scorer højere end Claude Opus 4.8 ved sammenlignelig indsats, mens den forbruger færre output-tegn (31,4% ved cirka 50.000 output-tegn per opgave versus 29,5% ved 120.000) og forbliver bag Anthropics Claude Fable 5, som når 39,5% ved maksimal indsats. På offentlige suites, følger GLM-5.3 GPT-5.6 Sol og Fable 5 på flere hårdere kodnings-evalueringer, herunder Terminal-Bench 3.0 og DeepSWE. Som en privat benchmark, argumenterer virksomheden, reducerer Z.ai Code Bench risikoen for forurening fra offentlige test-sæt.
Cyber-resultatet, som Z.ai siger, det ikke havde planlagt
Det andet hovedresultat er det, som Z.ai selv markerer som uventet. Virksomheden introducerede sårbarheds-opdagelsesdata og -miljøer i post-træning, forventede, at modellen ville blive bedre til at finde og resonere om enkeltstående svagheder. I stedet, siger det, fortsatte kapaciteten med at vækste, da træningen blev opskaleret, og modellen begyndte at resonere på tværs af flere stadier af udnyttelse, dannede koherente planer for komplet udnyttelses-kæder snarere end isolerede bug-findings.
De rapporterede tal følger dette krav. På CyberGym, som tester, om en model kan identificere og validere sårbarheder fra white-box kildekode, scorer GLM-5.3 84,5%, op fra GLM-5.2’s 77,2% og foran hver model i Z.ai’s sammenligningssæt. På ExploitBench, som kræver dybere resonering om rigtige sårbarheder og deres udnyttelse, mere end fordobler det sin forgænger, 54,4% til 24,4%. På ExploitGym, som tæller udnyttelsesopgaver fuldført under tid-normaliserede budgetter, afslutter det 105 opgaver inden for to timer og 130 inden for seks, mod 29 og 39 for GLM-5.2. Z.ai’s egen sammenfatning af mønsteret er direkte: jo længere oppe i udnyttelses-kæden en benchmark sidder, jo større er gevinsten fra GLM-5.2, og jo bredere er den resterende gab til lukkede frontier-modeller, med Mythos 5, der fuldfører 181 og 247 ExploitGym-opgaver på samme budgetter.
Z.ai rapporterer også om test af overførsel ud over kontrollerede benchmarks. I samarbejde med flere sikkerhedsteams i Kina, siger virksomheden, at dets modeller har identificeret 2.436 sårbarheder på tværs af 269 open-source-projekter siden GLM-5.2, herunder 1.097 vurderet kritisk eller høj alvorlighed, der spænder over system-kerner, operativsystemer, browser-motorer og netværksprotokoller. Mange havde været ubemærkede i år; den ældste, siger virksomheden, blev introduceret i 1981.
Fundene føder en offentlig Z.ai Security Disclosure Ledger, som sporer hver problem tilbage til afsløringsprocessen: 53 offentligt afsløret med CVE’er tildelt ved lancering, 2.383 stadig under embargo. Seneste indgange inkluderer en use-after-free i Linux-kernen, en WebKit-hukommelseshåndteringssvaghed, der påvirker Apple Safari, og en parameter-valideringsfejl i FreeBSD.
For API’et understøtter GLM-5.3 tre tænkeindsatsniveauer (lav, høj og maks) og tillader ikke længere at tænke kan deaktiveres, en breaking change for applikationer, der tidligere kørte med tænke slået fra.
Hvad den åbne-vægt-frigivelse efterlader åbent
Det to-ugers mellemrum mellem meddelelsen og vægt-frigivelsen udfører arbejde i denne lancering. Z.ai binder forsinkelsen eksplicit til sikkerheds-evaluering og hårdning, og det, der hårdnes, er en model, som virksomheden selv beskriver som havende udviklet offensiv sikkerheds-kapacitet hurtigere, end forventet, med dets største gevinster på udnyttelses-enden af kæden. Z.ai siger, at vægtene vil være downloadbare for alle efter den to-ugers sikkerheds-evaluering og hårdningsperiode.
Cyber-resultaterne ankommer i en uge, hvor frontier-laboratorier offentligt demonstrerer, hvad agentic-modeller kan gøre mod infrastruktur: OpenAI beskrev nylig dets egne test-modeller brudt Hugging Face i en red-team-øvelse. Z.ai’s afslørings-ledger er den konstruktive modpart til den kapacitet: samme færdighed, der kæder udnyttelser, overflader også årtier-gamle fejl til patchning, og 1.097 kritiske og høj-alvorligheds-fund er nu i gang med koordineret afsløring.
Om uafhængige evalueringer reproducerer GLM-5.3’s tal (især det interne Code Bench-resultater og cyber-score, som Z.ai kørte i sine egne harness-konfigurationer) vil bestemme, hvor meget af denne lancering er et ægte skridt for åbne-weights-kodningsmodeller og hvor meget, der er evaluering-valg. Vægt-frigivelsen, forventet omkring slutningen af august 2026, er, når den testing begynder.












