AI-modeller och plattformar
Z.ai Lanserar GLM-5.3 Med Frontier-kodning och Cyber-kapacitet som Växte Utanför Utbildningen

Z.ai släppte GLM-5.3 den 14 augusti 2026, en uppdatering som företaget säger behåller samma basmodell som GLM-5.2 och hämtar alla kapacitetsvinster från skalförstorad post-utbildning. De viktigaste resultaten finns i kodning, där Z.ai rapporterar att modellen är det starkaste öppna viktsystemet som det har mätt, och i cybersäkerhet, där företaget säger att kapaciteten växte snabbare än det förväntade sig när utbildningen skalförstorades. Vikterna är ännu inte offentliga: Z.ai säger att de kommer att släppa dem om cirka två veckor, efter att säkerhetsutvärdering och härdning är klara.
Enligt företagets tillkännagivande är GLM-5.3 tillgänglig nu via Z.ai:s API och dess GLM-kodningsplan, och har rullats ut till alla befintliga kodningsplanprenumeranter.
Lanseringen sker dagar efter att DeepSeek skickade sitt eget flaggskepp V4 Pro ur förhandsvisning, och Z.ai:s jämförelsetabell ställer GLM-5.3 direkt mot DeepSeek-V4 Pro, Moonshots Kimi K3 och OpenAI:s GPT-5.6 Sol över kodnings-, cyber- och agenssuiter.
Post-utbildning på en Större Mängd Arbetsmiljöer
Receptet, som Z.ai beskriver det, är miljöskalning snarare än arkitekturförändring. GLM-5.2 introducerade utbildningsstacken (en långkontextteknik som kallas IndexShare, en förstärkt inlärningsmetod för långsiktiga uppgifter som kallas SAO, och slime, ett öppen källkodsramverk för storskalig asynkron RL) och företaget säger att GLM-5.3 kom från att lägga mer beräkningskraft på fler och fler olika uppgiftsmiljöer byggda på den stacken.
De miljöerna är byggda för att likna enheter av professionellt arbete snarare än kodningsövningar. I ett exempel som företaget ger, placeras en modell i en ML-infrastrukturingenjörs arbetsmiljö, med tillgång till beräkningskluster, intern dokumentation, kodbas och experimentresultat, och måste diagnostisera flaskhalsar, implementera optimeringar och leverera en mätbar slut-till-slut-förbättring. Vissa uppgifter, säger Z.ai, representerar flera dagars arbete för en erfaren ingenjör. För att producera miljöer i volym byggde Z.ai pipelines där forskningsagenter omvandlar uppgiftsmönster från riktigt arbete till körbara långsiktiga miljöer, en domareagent verifierar varje uppgift som faktiskt är lösbar, och verifierare syntetiseras utan tillgång till referenslösningen. Belöningsignalen själv är maskingenererad för en undergrupp av uppgifter, med lösningsbanor som används för att stänga belöningsgenvägar. Z.ai påpekar att pipelines fortfarande kräver meningsfullt mänskligt arbete i slingan.
De rapporterade resultaten följer mönstret som receptet skulle förutsäga: de största vinsterna sitter på de längsta horisonterna. På Terminal-Bench 3.0, flyttar GLM-5.3 från 4,6 till 28,3 mot GLM-5.2; på DeepSWE v1.1, från 46,2 till 66,9; på Agents’ Last Exam’s CLI-variant, från 23,8 till 28,5. Alla siffror är rapporterade av leverantören, med metodnoter i tillkännagivandet som täcker harness, kontextlängd och urvalsinstitut för varje benchmark.
Mot andra modeller är bilden blandad. På det in-house Z.ai Code Bench, rapporterar företaget en 50-procentig förbättring mot GLM-5.2 och säger att modellen överträffar Claude Opus 4.8 vid jämförbar ansträngning medan den konsumerar färre utdatatoken (31,4% vid cirka 50 000 utdatatoken per uppgift jämfört med 29,5% vid 120 000) medan den förblir bakom Anthropics Claude Fable 5, som når 39,5% vid maximal ansträngning. På offentliga sviter, GLM-5.3 följer GPT-5.6 Sol och Fable 5 på flera svårare kodningsutvärderingar, inklusive Terminal-Bench 3.0 och DeepSWE. Som en privat benchmark, hävdar företaget att Z.ai Code Bench minskar kontaminationsrisken från offentliga testuppsättningar.
Cyber-resultatet Z.ai Säger Att Det Inte Planerade
Den andra rubriken är den som Z.ai själv flaggar som oväntad. Företaget introducerade sårbarhetsupptäcktsdata och miljöer i post-utbildning, och förväntade sig att modellen skulle bli bättre på att hitta och resonera om enskilda brister. Istället, säger det, fortsatte kapaciteten att ackumuleras när utbildningen skalförstorades, och modellen började resonera över flera stadier av exploatering, forma sammanhängande planer för fullständiga exploateringskedjor snarare än isolerade bugg-fynd.
De rapporterade siffrorna spårar det påståendet. På CyberGym, som testar om en modell kan identifiera och validera sårbarheter från white-box-källkod, poängsätter GLM-5.3 84,5%, upp från GLM-5.2:s 77,2% och före varje modell i Z.ai:s jämförelsesätt. På ExploitBench, som kräver djupare resonemang om riktiga sårbarheter och deras exploatering, mer än dubblar det sin föregångare, 54,4% till 24,4%. På ExploitGym, som räknar exploateringsuppgifter som slutförs under tidnormaliserade budgetar, slutför det 105 uppgifter inom två timmar och 130 inom sex, mot 29 och 39 för GLM-5.2. Z.ai:s egen sammanfattning av mönstret är direkt: ju längre upp i exploateringskedjan en benchmark sitter, desto större är vinsten från GLM-5.2, och desto bredare är den återstående klyftan till slutna gränsmodeller, med Mythos 5 som slutför 181 och 247 ExploitGym-uppgifter på samma budgetar.
Z.ai rapporterar också testning av överföring utöver kontrollerade benchmark. I samarbete med flera säkerhetsteam i Kina, säger företaget att dess modeller har identifierat 2 436 sårbarheter över 269 öppen källkodsprojekt sedan GLM-5.2, inklusive 1 097 som bedöms som kritiska eller hög svårighetsgrad, som omfattar systemkärnor, operativsystem, webbläsarmotorer och nätverksprotokoll. Många hade förblivit ouppmärksammade i år; den äldsta, säger företaget, introducerades 1981.
Resultaten matar en offentlig Z.ai Security Disclosure Ledger, som spårar varje problem genom avslöjandeprocessen: 53 offentligt avslöjade med CVE-tilldelade vid lansering, 2 383 fortfarande under embargo. Senaste posterna inkluderar en använd-efter-fri i Linux-kärnan, en WebKit-minnes hanteringsbrist som påverkar Apple Safari och en parameter-valideringsbugg i FreeBSD.
För API:t, GLM-5.3 stöder tre tankeansträngningsnivåer (låg, hög och max) och tillåter inte längre att tankeansträngningen inaktiveras, en brytande förändring för applikationer som tidigare körde med tankeansträngningen inaktiverad.
Vad den Öppna Viktsutgåvan Lämnar Öppet
De två veckor som skiljer tillkännagivandet från viktsutgåvan gör arbete i den här lanseringen. Z.ai knyter fördröjningen explicit till säkerhetsutvärdering och härdning, och det som härdas är en modell som företaget själv beskriver som ha utvecklat offensiv säkerhetskapacitet snabbare än förväntat, med de största vinsterna på exploateringssidan av kedjan. Z.ai säger att vikterna kommer att vara nedladdningsbara för alla efter den tvåveckorslånga säkerhetsutvärderings- och härdningsperioden.
Cyber-resultaten anländer också under en vecka när gräns-laboratorier offentligt demonstrerar vad agens-modeller kan göra mot infrastruktur: OpenAI beskrev nyligen sina egna testmodeller som bröt Hugging Face i en röd-lag-övning. Z.ai:s avslöjanderegister är den konstruktiva motvikten till den kapaciteten: samma färdighet som kedjar exploateringar också ytor decenniergamla buggar för lappning, och 1 097 kritiska och hög svårighetsgrads fynd är nu på väg genom samordnad avslöjande.
Om oberoende utvärderare replikerar GLM-5.3:s siffror (särskilt de in-house Code Bench-resultaten och de cyberscore som Z.ai körde i sina egna harness-konfigurationer) kommer att bestämma hur mycket av den här lanseringen som är ett äkta steg för öppna viktskodningsmodeller och hur mycket som är utvärderingsval. Viktsutgåvan, som förväntas runt slutet av augusti 2026, är när den testningen börjar.












