AI-modeller og plattformer

Z.ai lanserer GLM-5.3 med Frontier-koding og en cyber-kapasitet som vokste raskere enn forventet

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Z.ai lanserte GLM-5.3 den 14. august 2026, en oppdatering som selskapet sier beholder samme basismodell som GLM-5.2 og får alle kapabilitetsgevinster fra skalert opp post-trening. Hovedresultatene er i koding, der Z.ai rapporterer at modellen er det sterkeste åpne-vekt-systemet det har målt, og i cybersikkerhet, der selskapet sier at kapabiliteten vokste raskere enn det var forventet når treningen ble skalert opp. Vektene er ennå ikke offentlige: Z.ai sier at de vil bli utgitt om to uker, etter at sikkerhetsvurdering og hardning er fullført.

Ifølge selskapets annonsering er GLM-5.3 nå tilgjengelig gjennom Z.ai’s API og dens GLM-kodingplan, og har blitt rullet ut til alle eksisterende kodingplan-abonnenter.

Lanseringen skjer dager etter at DeepSeek sendte sin egen flaggskip V4 Pro ut av forhåndsvisning, og Z.ai’s sammenligningstabell setter GLM-5.3 direkte mot DeepSeek-V4 Pro, Moonshot’s Kimi K3 og OpenAI’s GPT-5.6 Sol over koding-, cyber- og agentic-suites.

Post-trening på en større samling av arbeidsmiljøer

Oppskriften, som Z.ai beskriver den, er miljøskalering i stedet for arkitektur-endring. GLM-5.2 innførte treningsstaken (en lang-kontekst-teknikk kalt IndexShare, en forsterkingslæringsmetode for lang-horisont-oppgaver kalt SAO, og slime, en åpen kildekode-ramme for stor-skala-asynkron RL) og selskapet sier at GLM-5.3 kom fra å bruke mer beregningskraft på flere og mer diverse oppgave-miljøer bygget på den staken.

Disse miljøene er bygget for å ligne enheter av profesjonell arbeid i stedet for koding-øvelser. I ett eksempel selskapet gir, plasseres en modell i en ML-infrastruktur-ingeniørs arbeidsmiljø, med tilgang til beregningskluster, interne dokumenter, kodebasert og eksperiment-resultater, og må diagnostisere flaskenakker, implementere optimaliseringer og levere en målbart sluttpunkt-forbedring. Noen oppgaver, Z.ai sier, representerer flere dager med arbeid for en erfaren ingeniør. For å produsere miljøer i volum, bygde Z.ai pipeliner hvor forskningsagenter konverterer oppgave-mønstre fra virkelig arbeid til kjørbare lang-horisont-miljøer, en dommer-agent verifiserer hver oppgave som faktisk er løsbare, og verifiserer syntetiseres uten tilgang til referanseplassen. Belønningssignalet selv er maskin-generert for en undergruppe av oppgaver, med løser-traektorier brukt til å lukke belønnings-gjennomføringer. Z.ai bemerker at pipelinene fortsatt krever meningsfullt menneske-i-løkken-arbeid.

De rapporterte resultater følger mønsteret som oppskriften ville forutsi: de største gevinster sitter på de lengste horisont-vurderingene. På Terminal-Bench 3.0, flytter GLM-5.3 fra 4,6 til 28,3 mot GLM-5.2; på DeepSWE v1.1, fra 46,2 til 66,9; på Agents’ Last Exam’s CLI-variant, fra 23,8 til 28,5. Alle tall er leverandør-rapportert, med metodologi-fotnoter i annonseringen som dekker harness, kontekst-lengde og sampling-innstillingene for hver benchmark.

Mot andre modeller, er bildet blandet. På det interne Z.ai Code Bench, rapporterer selskapet en 50% forbedring over GLM-5.2 og sier at modellen scorer høyere enn Claude Opus 4.8 ved sammenlignbar innsats mens den konsumerer færre utgangstoken (31,4% ved omtrent 50 000 utgangstoken per oppgave versus 29,5% ved 120 000) mens den fortsatt ligger bak Anthropic’s Claude Fable 5, som når 39,5% ved maksimal innsats. På offentlige suiter, ligger GLM-5.3 bak GPT-5.6 Sol og Fable 5 på flere vanskeligere koding-vurderinger, inkludert Terminal-Bench 3.0 og DeepSWE. Som en privat benchmark, argumenterer selskapet at Z.ai Code Bench reduserer risikoen for forurensning fra offentlige testsett.

Cyber-resultatet Z.ai sier det ikke planla

Det andre hovedresultatet er det Z.ai selv flagger som uventet. Selskapet innførte sårbarhetsoppdagelsesdata og -miljøer i post-trening, og forventet at modellen skulle bli bedre til å finne og resonere om enkeltfeil. I stedet, sier det, fortsatte kapabiliteten å vokse når treningen ble skalert opp, og modellen begynte å resonere over flere stadier av utnyttelse, og dannet koherente planer for fullstendig utnyttelseskjeder i stedet for isolerte feil-funn.

De rapporterte tallene følger dette kravet. På CyberGym, som tester om en modell kan identifisere og validere sårbarheter fra white-box kildekode, scorer GLM-5.3 84,5%, opp fra GLM-5.2’s 77,2% og foran hver modell i Z.ai’s sammenligningssett. På ExploitBench, som krever dypere resonnering om virkelige sårbarheter og deres utnyttelse, mer enn dobbler det sin forgjenger, 54,4% til 24,4%. På ExploitGym, som teller utnyttelsesoppgaver fullført under tid-normaliserte budsjetter, fullfører det 105 oppgaver innen to timer og 130 innen seks, mot 29 og 39 for GLM-5.2. Z.ai’s egen sammenfatting av mønsteret er direkte: jo lenger opp utnyttelseskjeden en benchmark sitter, jo større er gevinningen fra GLM-5.2, og jo større er gapet til lukkede frontier-modeller, med Mythos 5 som fullfører 181 og 247 ExploitGym-oppgaver på samme budsjetter.

Z.ai rapporterer også testing av overføring utenfor kontrollerte benchmarks. I samarbeid med flere sikkerhetsteam i Kina, sier selskapet at deres modeller har identifisert 2 436 sårbarheter over 269 åpne kildekode-prosjekter siden GLM-5.2, inkludert 1 097 som er klassifisert som kritiske eller høye alvorlighetsgrader, som omfatter systemkjerne, operativsystemer, nettleser-motorer og nettverksprotokoller. Mange hadde gått ubemerket i år; den eldste, sier selskapet, ble introdusert i 1981.

Funnene bidrar til en offentlig Z.ai Security Disclosure Ledger, som sporer hver enkelt problem gjennom diskusjonsprosessen: 53 offentliggjort med CVE-er tildelt ved lansering, 2 383 fortsatt under embargo. Nylige innføringer inkluderer en use-after-free i Linux-kjernen, en WebKit-minnehåndtering-feil som påvirker Apple Safari, og en parameter-valideringsfeil i FreeBSD.

For API-en, støtter GLM-5.3 tre tenke-innsatsnivåer (lav, høy og maks) og tillater ikke lenger å deaktivere tenking, en breaking-endring for applikasjoner som tidligere kjørte med tenking deaktivert.

Hva den åpne-vekt-utgivelsen lar åpen

De to ukers gapet mellom annonseringen og vekt-utgivelsen gjør arbeid i denne lanseringen. Z.ai knytter forsinkelsen eksplisitt til sikkerhetsvurdering og hardning, og det som hardnes er en modell som selskapet selv beskriver som å ha utviklet offensiv sikkerhetskapasitet raskere enn forventet, med sine største gevinster på utnyttelses-enden av kjeden. Z.ai sier at vektene vil være nedlastbare for alle etter den to-ukers sikkerhetsvurderings- og hardningsperioden.

Cyber-resultatene ankommer også i en uke hvor frontier-laboratorier offentlig demonstrerer hva agentic-modeller kan gjøre mot infrastruktur: OpenAI beskrev nylig egne test-modeller som brøt gjennom Hugging Face i en rød-lag-øvelse. Z.ai’s diskusjons-ledger er den konstruktive motparten til denne kapabiliteten: samme ferdighet som kjeder utnyttelser også avdekker åre gamle feil for patching, og 1 097 kritiske og høye alvorlighetsgrader-bevilninger er nå i gang med koordinert diskusjon.

Om uavhengige evalueringer reproduserer GLM-5.3’s tall (spesielt de interne Code Bench-resultatene og de cyber-poeng Z.ai kjørte i sine egne harness-konfigurasjoner) vil bestemme hvor mye av denne lanseringen som er et ekte skritt for åpne-vekt-koding-modeller og hvor mye som er evaluering-valg. Vekt-utgivelsen, forventet rundt slutten av august 2026, er når den testingen begynner.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.