AI-modeller og platforme

Z.ai lancerer GLM-5.3 med Frontier-kodning og en cyberkapacitet, der voksede ud over dens træning

mm
Føj Unite.AI til dine foretrukne kilder på Google

Z.ai udgav GLM-5.3 den 14. august 2026, en opdatering, som virksomheden siger har samme basismodel som GLM-5.2 og får alle sine kapacitetsgevinster fra opskaleret post-træning. Hovedresultaterne er i kodning, hvor Z.ai rapporterer, at modellen er det stærkeste åbne-weights-system, det har målt, og i cybersikkerhed, hvor virksomheden siger, at kapaciteten voksede hurtigere, end det havde forventet, da træningen blev opskaleret. Vægtene er endnu ikke offentligt tilgængelige: Z.ai siger, at det vil frigive dem om cirka to uger, efter at sikkerheds evaluering og hårdning er fuldført.

Ifølge virksomhedens meddelelse er GLM-5.3 nu tilgængelig via Z.ai’s API og dets GLM Coding Plan og er blevet rullet ud til alle eksisterende coding plan-abonnenter.

Udgivelsen finder sted få dage efter, at DeepSeek har sendt sin egen flagship V4 Pro ud af preview, og Z.ai’s sammenligningstabel stiller GLM-5.3 direkte op mod DeepSeek-V4 Pro, Moonshots Kimi K3 og OpenAI’s GPT-5.6 Sol på kodning, cyber og agentic suites.

Post-træning på en større samling af arbejdsmiljøer

Recepten, som Z.ai beskriver det, er miljøskalering snarere end arkitekturændring. GLM-5.2 introducerede træningsstakken (en lang-kontekstteknik kaldet IndexShare, en forstærkning-læringsmetode til lang-horizontale opgaver kaldet SAO og slime, et open-source-rammework til stor-skala-asynkron RL) og virksomheden siger, at GLM-5.3 kom fra at bruge mere compute på mere og mere diverse opgave-miljøer bygget på den stack.

Disse miljøer er bygget til at ligne enheder af professionelt arbejde snarere end kodningsøvelser. I et eksempel, som virksomheden giver, placeres en model i en ML-infrastruktur-teknikers arbejdsmiljø med adgang til compute-klynger, interne dokumentation, kodebaser og eksperiment-resultater og skal diagnostisere flaskeshals, implementere optimeringer og levere en målbart slut-til-slut-hastighed. Nogle opgaver, siger Z.ai, repræsenterer flere dages arbejde for en erfaren ingeniør. For at producere miljøer i mængde byggede Z.ai pipelines, hvor forskningsagenter konverterer opgave-mønstre fra rigtigt arbejde til kørbare lang-horizontale miljøer, en dommeragent verificerer hver opgave, der faktisk er løselig, og verificatorer syntetiseres uden adgang til reference-løsningen. Belønnings-signalet selv er maskin-genereret for en undermængde af opgaver, med løser-traektorier brugt til at lukke belønnings-genveje. Z.ai bemærker, at pipelines stadig kræver betydeligt menneske-i-løkken-arbejde.

De rapporterede resultater følger mønsteret, som recepten ville forudsige: de største gevinster sidder på de længste-horizontale evalueringer. På Terminal-Bench 3.0, flytter GLM-5.3 fra 4,6 til 28,3 mod GLM-5.2; på DeepSWE v1.1, fra 46,2 til 66,9; på Agents’ Last Exam’s CLI-variant, fra 23,8 til 28,5. Alle tal er vendor-rapporteret, med metod-noter i meddelelsen, der dækker harness, kontekst-længde og sampling-indstillinger for hver benchmark.

Mod andre modeller er billedet blandet. På det interne Z.ai Code Bench rapporterer virksomheden en 50% forbedring over GLM-5.2 og siger, at modellen scorer højere end Claude Opus 4.8 ved sammenlignelig indsats, mens den forbruger færre output-tegn (31,4% ved cirka 50.000 output-tegn per opgave versus 29,5% ved 120.000) og forbliver bag Anthropics Claude Fable 5, som når 39,5% ved maksimal indsats. På offentlige suites, følger GLM-5.3 GPT-5.6 Sol og Fable 5 på flere hårdere kodnings-evalueringer, herunder Terminal-Bench 3.0 og DeepSWE. Som en privat benchmark, argumenterer virksomheden, reducerer Z.ai Code Bench risikoen for forurening fra offentlige test-sæt.

Cyber-resultatet, som Z.ai siger, det ikke havde planlagt

Det andet hovedresultat er det, som Z.ai selv markerer som uventet. Virksomheden introducerede sårbarheds-opdagelsesdata og -miljøer i post-træning, forventede, at modellen ville blive bedre til at finde og resonere om enkeltstående svagheder. I stedet, siger det, fortsatte kapaciteten med at vækste, da træningen blev opskaleret, og modellen begyndte at resonere på tværs af flere stadier af udnyttelse, dannede koherente planer for komplet udnyttelses-kæder snarere end isolerede bug-findings.

De rapporterede tal følger dette krav. På CyberGym, som tester, om en model kan identificere og validere sårbarheder fra white-box kildekode, scorer GLM-5.3 84,5%, op fra GLM-5.2’s 77,2% og foran hver model i Z.ai’s sammenligningssæt. På ExploitBench, som kræver dybere resonering om rigtige sårbarheder og deres udnyttelse, mere end fordobler det sin forgænger, 54,4% til 24,4%. På ExploitGym, som tæller udnyttelsesopgaver fuldført under tid-normaliserede budgetter, afslutter det 105 opgaver inden for to timer og 130 inden for seks, mod 29 og 39 for GLM-5.2. Z.ai’s egen sammenfatning af mønsteret er direkte: jo længere oppe i udnyttelses-kæden en benchmark sidder, jo større er gevinsten fra GLM-5.2, og jo bredere er den resterende gab til lukkede frontier-modeller, med Mythos 5, der fuldfører 181 og 247 ExploitGym-opgaver på samme budgetter.

Z.ai rapporterer også om test af overførsel ud over kontrollerede benchmarks. I samarbejde med flere sikkerhedsteams i Kina, siger virksomheden, at dets modeller har identificeret 2.436 sårbarheder på tværs af 269 open-source-projekter siden GLM-5.2, herunder 1.097 vurderet kritisk eller høj alvorlighed, der spænder over system-kerner, operativsystemer, browser-motorer og netværksprotokoller. Mange havde været ubemærkede i år; den ældste, siger virksomheden, blev introduceret i 1981.

Fundene føder en offentlig Z.ai Security Disclosure Ledger, som sporer hver problem tilbage til afsløringsprocessen: 53 offentligt afsløret med CVE’er tildelt ved lancering, 2.383 stadig under embargo. Seneste indgange inkluderer en use-after-free i Linux-kernen, en WebKit-hukommelseshåndteringssvaghed, der påvirker Apple Safari, og en parameter-valideringsfejl i FreeBSD.

For API’et understøtter GLM-5.3 tre tænkeindsatsniveauer (lav, høj og maks) og tillader ikke længere at tænke kan deaktiveres, en breaking change for applikationer, der tidligere kørte med tænke slået fra.

Hvad den åbne-vægt-frigivelse efterlader åbent

Det to-ugers mellemrum mellem meddelelsen og vægt-frigivelsen udfører arbejde i denne lancering. Z.ai binder forsinkelsen eksplicit til sikkerheds-evaluering og hårdning, og det, der hårdnes, er en model, som virksomheden selv beskriver som havende udviklet offensiv sikkerheds-kapacitet hurtigere, end forventet, med dets største gevinster på udnyttelses-enden af kæden. Z.ai siger, at vægtene vil være downloadbare for alle efter den to-ugers sikkerheds-evaluering og hårdningsperiode.

Cyber-resultaterne ankommer i en uge, hvor frontier-laboratorier offentligt demonstrerer, hvad agentic-modeller kan gøre mod infrastruktur: OpenAI beskrev nylig dets egne test-modeller brudt Hugging Face i en red-team-øvelse. Z.ai’s afslørings-ledger er den konstruktive modpart til den kapacitet: samme færdighed, der kæder udnyttelser, overflader også årtier-gamle fejl til patchning, og 1.097 kritiske og høj-alvorligheds-fund er nu i gang med koordineret afsløring.

Om uafhængige evalueringer reproducerer GLM-5.3’s tal (især det interne Code Bench-resultater og cyber-score, som Z.ai kørte i sine egne harness-konfigurationer) vil bestemme, hvor meget af denne lancering er et ægte skridt for åbne-weights-kodningsmodeller og hvor meget, der er evaluering-valg. Vægt-frigivelsen, forventet omkring slutningen af august 2026, er, når den testing begynder.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.