Modely a platformy AI
Z.ai Spouští GLM-5.3 S Frontier Codingem a Kybernetickou Schopností, Která Přerostla Její Školení

Z.ai vydalo GLM-5.3 dne 14. srpna 2026, aktualizaci, o které společnost prohlašuje, že zachovává stejnou základní model jako GLM-5.2 a získává všechny schopnosti díky škálování post-školení. Hlavní výsledky jsou v kódování, kde Z.ai uvádí, že model je nej silnějším otevřeným systémem, který společnost měřila, a v kybernetické bezpečnosti, kde společnost prohlašuje, že se schopnost vyvíjela rychleji, než se očekávalo, když se školení škálovalo. Váhy ještě nejsou veřejně dostupné: Z.ai prohlašuje, že je vydá za asi dva týdny, po dokončení bezpečnostní evaluace a zpevnění.
Podle oznámení společnosti je GLM-5.3 nyní dostupný prostřednictvím API Z.ai a jeho plánu GLM Coding, a byl nasazen všem stávajícím předplatitelům plánu kódování.
Vydání přichází několik dní poté, co DeepSeek vydal svou vlajkovou loď V4 Pro z náhledu, a srovnávací tabulka Z.ai umístila GLM-5.3 přímo proti DeepSeek-V4 Pro, Moonshot’s Kimi K3 a OpenAI’s GPT-5.6 Sol v kódování, kybernetické a agentic suites.
Školení na Širším Souboru Pracovních Prostředí
Recept, jak jej Z.ai popisuje, je škálování prostředí spíše než změna architektury. GLM-5.2 zavedl školicí stack (dlouhá kontextová technika nazvaná IndexShare, metoda učení s posilováním pro dlouhodobé úkoly nazvaná SAO a slime, otevřený framework pro velké asynchronní RL) a společnost prohlašuje, že GLM-5.3 vznikl tím, že společnost vynaložila více výpočetních zdrojů na více a více rozmanitých úkolových prostředích postavených na tomto stacku.
Tato prostředí jsou navržena tak, aby připomínala profesionální pracovní jednotky spíše než cvičení v kódování. V jednom příkladu, který společnost uvádí, je model umístěn do pracovního prostředí inženýra ML, s přístupem k výpočetním clusterům, interní dokumentaci, kódovým základnám a výsledkům experimentů, a musí diagnostikovat úzká místa, implementovat optimalizace a dodat měřitelné celkové zrychlení. Některé úkoly, prohlašuje Z.ai, představují několik dní práce pro zkušeného inženýra. Pro výrobu prostředí ve velkém množství, Z.ai postavila potrubí, ve kterých agenti výzkumu převádějí úkoly z reálné práce do spustitelných dlouhodobých prostředí, agent posuzuje, zda každý úkol je skutečně řešitelný, a verifikátory jsou syntetizovány bez přístupu k referenčnímu řešení. Signál odměny je sám o sobě strojově generován pro podmnožinu úkolů, s trajektoriemi řešitelů použitémi k uzavření zkratů odměn. Z.ai poznamenává, že potrubí stále vyžadují významnou práci člověka v smyčce.
Uvedené výsledky následují vzorec, který by tento recept předpovídal: největší zisky se nacházejí na nejdelších hodnoceních. Na Terminal-Bench 3.0, GLM-5.3 přechází z 4,6 na 28,3 proti GLM-5.2; na DeepSWE v1.1, z 46,2 na 66,9; na Agents’ Last Exam’s CLI variant, z 23,8 na 28,5. Všechna čísla jsou hlášena dodavatelem, s metodologickými poznámkami v oznámení, které pokrývají harness, délku kontextu a nastavení vzorkování pro každou bench.
Ve srovnání s ostatními modely je obrazec smíšený. Na interní Z.ai Code Bench, společnost hlásí 50% zlepšení oproti GLM-5.2 a prohlašuje, že model překonává Claude Opus 4.8 při srovnatelném úsilí, zatímco spotřebovává méně výstupních tokenů (31,4% při zhruba 50 000 výstupních tokenech na úkol oproti 29,5% při 120 000) a zůstává za Anthropic’s Claude Fable 5, který dosahuje 39,5% při maximálním úsilí. Na veřejných souborech, GLM-5.3 zaostává za GPT-5.6 Sol a Fable 5 na několika těžších kódovacích hodnoceních, včetně Terminal-Bench 3.0 a DeepSWE. Jako soukromá bench, společnost prohlašuje, že Z.ai Code Bench snižuje riziko kontaminace z veřejných testovacích souborů.
Kybernetický Výsledek, Který Z.ai Říká, Že Neplánoval
Druhý hlavním výsledkem je ten, který Z.ai sama označuje jako nečekaný. Společnost zavedla data o objevování zranitelností a prostředí do post-školení, očekávajíc, že model se bude zlepšovat v hledání a rozumění jednotlivým slabostem. Místo toho, prohlašuje, že schopnost pokračovala v růstu, když se školení škálovalo, a model začal rozumět napříč několika fázemi exploatace, tvořil koherentní plány pro kompletní exploatační řetězce spíše než izolované bug-finding.
Uvedená čísla sledují toto tvrzení. Na CyberGym, který testuje, zda model může identifikovat a ověřit zranitelnosti z white-box zdrojového kódu, GLM-5.3 dosahuje 84,5%, oproti 77,2% u GLM-5.2 a předchází každému modelu ve srovnávacím souboru Z.ai. Na ExploitBench, který vyžaduje hlubší rozumění skutečných zranitelností a jejich exploatace, více než zdvojnásobuje svého předchůdce, 54,4% oproti 24,4%. Na ExploitGym, který počítá exploatační úkoly dokončené v časově normalizovaných rozpočtech, dokončuje 105 úkolů do dvou hodin a 130 do šesti, oproti 29 a 39 u GLM-5.2. Shrnutí Z.ai je přímé: čím dále je benchmark v exploatačním řetězci, tím větší je zisk z GLM-5.2 a tím širší je zbývající mezera k uzavřeným frontovým modelům, s Mythos 5 dokončujícím 181 a 247 ExploitGym úkolů ve stejných rozpočtech.
Z.ai také prohlašuje, že testovalo transfer mimo kontrolované benchy. Pracujíce s několika bezpečnostními týmy v Číně, společnost prohlašuje, že její modely identifikovaly 2 436 zranitelností napříč 269 open-source projekty od GLM-5.2, včetně 1 097 ohodnocených jako kritické nebo vysoké, pokrývajících systémové jádra, operační systémy, prohlížečové motory a síťové protokoly. Mnoho z nich zůstalo nepovšimnuto po mnoho let; nejstarší, prohlašuje společnost, byl zaveden v roce 1981.
Nález se dostává do veřejného Z.ai Security Disclosure Ledger, který sleduje každou otázku během procesu oznamování: 53 veřejně oznámených s CVEs přiřazeno při spuštění, 2 383 stále pod embargem. Nedávné položky zahrnují použití po uvolnění v jádru Linux, chybu zpracování paměti WebKit ovlivňující Apple Safari a chybu ověření parametrů v FreeBSD.
Pro API, GLM-5.3 podporuje tři úrovně úsilí (nízké, vysoké a maximální) a již nepovoluje vypnutí úsilí, což je změna pro aplikace, které dříve běžely s vypnutým úsilím.
Co Otevřená Váha Zanechává Otevřené
Dvou týdenní mezera mezi oznámením a vydáním váhy dělá práci v tomto spuštění. Z.ai váže zpoždění explicitně na bezpečnostní evaluaci a zpevnění, a tím, co je zpevňováno, je model, který společnost sama popisuje jako vyvíjející se ofenzivní bezpečnostní schopnost rychleji, než se očekávalo, s největšími zisky na exploatační straně řetězce. Z.ai prohlašuje, že váhy budou stažitelné pro každého po dvou týdnech bezpečnostní evaluace a zpevnění.
Kybernetické výsledky také přicházejí v týdnu, kdy frontové laboratoře veřejně demonstrují, co agentic models mohou udělat s infrastrukturou: OpenAI nedávno popsal své vlastní testovací modely, které porušily Hugging Face v červeném týmovém cvičení. Z.ai Security Disclosure Ledger je konstruktivním protějškem této schopnosti: stejná dovednost, která řetězuje exploatace, také odhaluje desetiletá chyby pro opravu, a 1 097 kritických a vysokých zranitelností se nyní pohybuje skrz koordinované oznamování.
Zda nezávislí hodnotitelé replikují čísla GLM-5.3 (zvláště výsledky z interní Z.ai Code Bench a kybernetické skóre, které Z.ai provedl ve svých vlastních konfiguracích harnessu) určí, kolik z tohoto spuštění je skutečným krokem pro otevřené váhy kódovacích modelů a kolik je výběr evaluace. Vydání váhy, očekávané kolem konce srpna 2026, je kdy toto testování začíná.












