Modely a platformy AI

Z.ai Spouští GLM-5.3 S Frontier Codingem a Kybernetickou Schopností, Která Přerostla Její Školení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Z.ai vydalo GLM-5.3 dne 14. srpna 2026, aktualizaci, o které společnost prohlašuje, že zachovává stejnou základní model jako GLM-5.2 a získává všechny schopnosti díky škálování post-školení. Hlavní výsledky jsou v kódování, kde Z.ai uvádí, že model je nej silnějším otevřeným systémem, který společnost měřila, a v kybernetické bezpečnosti, kde společnost prohlašuje, že se schopnost vyvíjela rychleji, než se očekávalo, když se školení škálovalo. Váhy ještě nejsou veřejně dostupné: Z.ai prohlašuje, že je vydá za asi dva týdny, po dokončení bezpečnostní evaluace a zpevnění.

Podle oznámení společnosti je GLM-5.3 nyní dostupný prostřednictvím API Z.ai a jeho plánu GLM Coding, a byl nasazen všem stávajícím předplatitelům plánu kódování.

Vydání přichází několik dní poté, co DeepSeek vydal svou vlajkovou loď V4 Pro z náhledu, a srovnávací tabulka Z.ai umístila GLM-5.3 přímo proti DeepSeek-V4 Pro, Moonshot’s Kimi K3 a OpenAI’s GPT-5.6 Sol v kódování, kybernetické a agentic suites.

Školení na Širším Souboru Pracovních Prostředí

Recept, jak jej Z.ai popisuje, je škálování prostředí spíše než změna architektury. GLM-5.2 zavedl školicí stack (dlouhá kontextová technika nazvaná IndexShare, metoda učení s posilováním pro dlouhodobé úkoly nazvaná SAO a slime, otevřený framework pro velké asynchronní RL) a společnost prohlašuje, že GLM-5.3 vznikl tím, že společnost vynaložila více výpočetních zdrojů na více a více rozmanitých úkolových prostředích postavených na tomto stacku.

Tato prostředí jsou navržena tak, aby připomínala profesionální pracovní jednotky spíše než cvičení v kódování. V jednom příkladu, který společnost uvádí, je model umístěn do pracovního prostředí inženýra ML, s přístupem k výpočetním clusterům, interní dokumentaci, kódovým základnám a výsledkům experimentů, a musí diagnostikovat úzká místa, implementovat optimalizace a dodat měřitelné celkové zrychlení. Některé úkoly, prohlašuje Z.ai, představují několik dní práce pro zkušeného inženýra. Pro výrobu prostředí ve velkém množství, Z.ai postavila potrubí, ve kterých agenti výzkumu převádějí úkoly z reálné práce do spustitelných dlouhodobých prostředí, agent posuzuje, zda každý úkol je skutečně řešitelný, a verifikátory jsou syntetizovány bez přístupu k referenčnímu řešení. Signál odměny je sám o sobě strojově generován pro podmnožinu úkolů, s trajektoriemi řešitelů použitémi k uzavření zkratů odměn. Z.ai poznamenává, že potrubí stále vyžadují významnou práci člověka v smyčce.

Uvedené výsledky následují vzorec, který by tento recept předpovídal: největší zisky se nacházejí na nejdelších hodnoceních. Na Terminal-Bench 3.0, GLM-5.3 přechází z 4,6 na 28,3 proti GLM-5.2; na DeepSWE v1.1, z 46,2 na 66,9; na Agents’ Last Exam’s CLI variant, z 23,8 na 28,5. Všechna čísla jsou hlášena dodavatelem, s metodologickými poznámkami v oznámení, které pokrývají harness, délku kontextu a nastavení vzorkování pro každou bench.

Ve srovnání s ostatními modely je obrazec smíšený. Na interní Z.ai Code Bench, společnost hlásí 50% zlepšení oproti GLM-5.2 a prohlašuje, že model překonává Claude Opus 4.8 při srovnatelném úsilí, zatímco spotřebovává méně výstupních tokenů (31,4% při zhruba 50 000 výstupních tokenech na úkol oproti 29,5% při 120 000) a zůstává za Anthropic’s Claude Fable 5, který dosahuje 39,5% při maximálním úsilí. Na veřejných souborech, GLM-5.3 zaostává za GPT-5.6 Sol a Fable 5 na několika těžších kódovacích hodnoceních, včetně Terminal-Bench 3.0 a DeepSWE. Jako soukromá bench, společnost prohlašuje, že Z.ai Code Bench snižuje riziko kontaminace z veřejných testovacích souborů.

Kybernetický Výsledek, Který Z.ai Říká, Že Neplánoval

Druhý hlavním výsledkem je ten, který Z.ai sama označuje jako nečekaný. Společnost zavedla data o objevování zranitelností a prostředí do post-školení, očekávajíc, že model se bude zlepšovat v hledání a rozumění jednotlivým slabostem. Místo toho, prohlašuje, že schopnost pokračovala v růstu, když se školení škálovalo, a model začal rozumět napříč několika fázemi exploatace, tvořil koherentní plány pro kompletní exploatační řetězce spíše než izolované bug-finding.

Uvedená čísla sledují toto tvrzení. Na CyberGym, který testuje, zda model může identifikovat a ověřit zranitelnosti z white-box zdrojového kódu, GLM-5.3 dosahuje 84,5%, oproti 77,2% u GLM-5.2 a předchází každému modelu ve srovnávacím souboru Z.ai. Na ExploitBench, který vyžaduje hlubší rozumění skutečných zranitelností a jejich exploatace, více než zdvojnásobuje svého předchůdce, 54,4% oproti 24,4%. Na ExploitGym, který počítá exploatační úkoly dokončené v časově normalizovaných rozpočtech, dokončuje 105 úkolů do dvou hodin a 130 do šesti, oproti 29 a 39 u GLM-5.2. Shrnutí Z.ai je přímé: čím dále je benchmark v exploatačním řetězci, tím větší je zisk z GLM-5.2 a tím širší je zbývající mezera k uzavřeným frontovým modelům, s Mythos 5 dokončujícím 181 a 247 ExploitGym úkolů ve stejných rozpočtech.

Z.ai také prohlašuje, že testovalo transfer mimo kontrolované benchy. Pracujíce s několika bezpečnostními týmy v Číně, společnost prohlašuje, že její modely identifikovaly 2 436 zranitelností napříč 269 open-source projekty od GLM-5.2, včetně 1 097 ohodnocených jako kritické nebo vysoké, pokrývajících systémové jádra, operační systémy, prohlížečové motory a síťové protokoly. Mnoho z nich zůstalo nepovšimnuto po mnoho let; nejstarší, prohlašuje společnost, byl zaveden v roce 1981.

Nález se dostává do veřejného Z.ai Security Disclosure Ledger, který sleduje každou otázku během procesu oznamování: 53 veřejně oznámených s CVEs přiřazeno při spuštění, 2 383 stále pod embargem. Nedávné položky zahrnují použití po uvolnění v jádru Linux, chybu zpracování paměti WebKit ovlivňující Apple Safari a chybu ověření parametrů v FreeBSD.

Pro API, GLM-5.3 podporuje tři úrovně úsilí (nízké, vysoké a maximální) a již nepovoluje vypnutí úsilí, což je změna pro aplikace, které dříve běžely s vypnutým úsilím.

Co Otevřená Váha Zanechává Otevřené

Dvou týdenní mezera mezi oznámením a vydáním váhy dělá práci v tomto spuštění. Z.ai váže zpoždění explicitně na bezpečnostní evaluaci a zpevnění, a tím, co je zpevňováno, je model, který společnost sama popisuje jako vyvíjející se ofenzivní bezpečnostní schopnost rychleji, než se očekávalo, s největšími zisky na exploatační straně řetězce. Z.ai prohlašuje, že váhy budou stažitelné pro každého po dvou týdnech bezpečnostní evaluace a zpevnění.

Kybernetické výsledky také přicházejí v týdnu, kdy frontové laboratoře veřejně demonstrují, co agentic models mohou udělat s infrastrukturou: OpenAI nedávno popsal své vlastní testovací modely, které porušily Hugging Face v červeném týmovém cvičení. Z.ai Security Disclosure Ledger je konstruktivním protějškem této schopnosti: stejná dovednost, která řetězuje exploatace, také odhaluje desetiletá chyby pro opravu, a 1 097 kritických a vysokých zranitelností se nyní pohybuje skrz koordinované oznamování.

Zda nezávislí hodnotitelé replikují čísla GLM-5.3 (zvláště výsledky z interní Z.ai Code Bench a kybernetické skóre, které Z.ai provedl ve svých vlastních konfiguracích harnessu) určí, kolik z tohoto spuštění je skutečným krokem pro otevřené váhy kódovacích modelů a kolik je výběr evaluace. Vydání váhy, očekávané kolem konce srpna 2026, je kdy toto testování začíná.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.