Modele și platforme AI
Z.ai Lansează GLM-5.3 Cu Codare Avansată și Capabilități de Securitate Cibernetică Care Au Depășit Așteptările

Z.ai a lansat GLM-5.3 pe 14 august 2026, o actualizare pe care compania o descrie ca păstrând același model de bază ca GLM-5.2 și obținând toate câștigurile de capacități din post-antrenarea extinsă. Rezultatele principale se regăsesc în codare, unde Z.ai raportează că modelul este cel mai puternic sistem cu greutăți deschise pe care l-a măsurat, și în securitatea cibernetică, unde compania afirmă că capacitățile au crescut mai rapid decât se așteptau pe măsură ce antrenamentul a fost extins. Greutățile nu sunt încă publice: Z.ai afirmă că le va lansa în aproximativ două săptămâni, după evaluarea și consolidarea securității.
Conform anunțului companiei, GLM-5.3 este disponibil acum prin API-ul Z.ai și Planul de Codare GLM, și a fost implementat pentru toți abonații existenți ai planului de codare.
Lansarea are loc în urma lansării de către DeepSeek a modelului său emblematic V4 Pro din faza de prezentare, și tabelul de comparație al lui Z.ai plasează GLM-5.3 direct împotriva lui DeepSeek-V4 Pro, Kimi K3 de la Moonshot și GPT-5.6 Sol de la OpenAI, în ceea ce privește codarea, securitatea cibernetică și suitele agenților.
Post-Antrenament pe Un Set Mai Mare de Medii de Lucru
Rețeta, așa cum o descrie Z.ai, constă în scalarea mediului și nu în schimbarea arhitecturii. GLM-5.2 a introdus stiva de antrenament (o tehnică de context lung numită IndexShare, o metodă de învățare prin întărire pentru sarcini cu orizont lung numită SAO și slime, un cadru open-source pentru învățare asincronă la scară largă) și compania afirmă că GLM-5.3 a rezultat din alocarea mai multor resurse de calcul pentru medii de sarcini mai diverse și mai extinse, construite pe această stivă.
Aceste medii sunt create pentru a semăna cu unități de muncă profesională și nu cu exerciții de codare. Într-un exemplu oferit de companie, un model este plasat în mediul de lucru al unui inginer de infrastructură ML, cu acces la clusterul de calcul, documentația internă, codurile sursă și rezultatele experimentelor, și trebuie să diagnosticheze blocajele, să implementeze optimizări și să ofere o accelerare de sfârșit-la-sfârșit măsurabilă. Unele sarcini, afirmă Z.ai, reprezintă câteva zile de muncă pentru un inginer experimentat. Pentru a produce medii în volum, Z.ai a creat fluxuri de lucru în care agenții de cercetare transformă modelele de sarcini din munca reală în medii de orizont lung rulabile, un agent judecător verifică dacă fiecare sarcină este de fapt soluționabilă, iar verificatorii sunt sintetizați fără acces la soluția de referință. Semnalul de recompensă însuși este generat de mașină pentru un subset de sarcini, cu trasee de soluționare folosite pentru a închide scurtăturile de recompensă. Z.ai menționează că fluxurile de lucru încă necesită un efort uman semnificativ.
Rezultatele raportate urmează modelul pe care această rețetă l-ar prevedea: cele mai mari câștiguri se află pe evaluările cu orizontul cel mai lung. Pe Terminal-Bench 3.0, GLM-5.3 trece de la 4,6 la 28,3 față de GLM-5.2; pe DeepSWE v1.1, de la 46,2 la 66,9; pe varianta CLI a examenului ultim al agenților, de la 23,8 la 28,5. Toate cifrele sunt raportate de furnizor, cu note de metodologie în anunț care acoperă setările de harness, lungimea contextului și setările de eșantionare pentru fiecare benchmark.
În comparație cu alte modele, imaginea este mixtă. Pe banchila internă Z.ai Code Bench, compania raportează o îmbunătățire de 50% față de GLM-5.2 și afirmă că modelul depășește Claude Opus 4.8 la efort comparabil, consumând mai puține tokenuri de ieșire (31,4% la aproximativ 50.000 de tokenuri de ieșire pe sarcină, față de 29,5% la 120.000) și rămânând în urma lui Anthropic’s Claude Fable 5, care atinge 39,5% la efort maxim. Pe suitele publice, GLM-5.3 se află în urma lui GPT-5.6 Sol și Fable 5 pe mai multe evaluări de codare mai grele, incluzând Terminal-Bench 3.0 și DeepSWE. Ca benchmark privat, compania argumentează că Z.ai Code Bench reduce riscul de contaminare din seturile de test publice.
Rezultatul Cibernetic Pe Care Z.ai Spune Că Nu L-a Planificat
Al doilea titlu este acela pe care Z.ai însuși îl marchează ca neașteptat. Compania a introdus date de descoperire a vulnerabilităților și medii în post-antrenament, așteptându-se ca modelul să devină mai bun la găsirea și raționamentul despre defecte individuale. În schimb, afirmă că, pe măsură ce antrenamentul a fost extins, capacitățile au continuat să se acumuleze, iar modelul a început să raționeze pe mai multe etape ale exploatării, formând planuri coerente pentru lanțuri complete de exploatare, și nu doar găsirea de bug-uri izolate.
Numerele raportate urmează această afirmație. Pe CyberGym, care testează dacă un model poate identifica și valida vulnerabilități din codul sursă white-box, GLM-5.3 obține 84,5%, în creștere de la 77,2% pentru GLM-5.2 și depășește fiecare model din setul de comparație al lui Z.ai. Pe ExploitBench, care cere un raționament mai profund despre vulnerabilitățile reale și exploatarea lor, depășește de două ori predecesorul său, de la 24,4% la 54,4%. Pe ExploitGym, care numără sarcinile de exploatare finalizate sub bugete normalizate în timp, finalizează 105 sarcini în două ore și 130 în șase ore, față de 29 și 39 pentru GLM-5.2. Rezumatul lui Z.ai al modelului este direct: cu cât un benchmark se află mai sus în lanțul de exploatare, cu atât câștigul de la GLM-5.2 este mai mare, și decalajul rămas față de modelele cu frontieră închisă este mai larg, Mythos 5 finalizând 181 și 247 de sarcini ExploitGym pe aceleași bugete.
Z.ai raportează, de asemenea, testarea transferului dincolo de benchmark-urile controlate. Lucrând cu mai multe echipe de securitate din China, compania afirmă că modelele sale au identificat 2.436 de vulnerabilități în 269 de proiecte open-source de la GLM-5.2, incluzând 1.097 evaluate ca fiind critice sau de gravitate ridicată, care acoperă nuclei de sistem, sisteme de operare, motoare de browser și protocoale de rețea. Multe dintre acestea nu fuseseră observate timp de ani; cea mai veche, afirmă compania, a fost introdusă în 1981.
Descoperirile alimentează un Registru Public de Divulgare a Securității Z.ai, care urmărește fiecare problemă prin procesul de divulgare: 53 divulgări publice cu CVE-uri atribuite la lansare, 2.383 încă sub embargo. Intrările recente includ o utilizare după eliberare în nucleul Linux, o eroare de manipulare a memoriei WebKit care afectează Apple Safari și o eroare de validare a parametrilor în FreeBSD.
Pentru API, GLM-5.3 suportă trei niveluri de efort de gândire (scăzut, ridicat și maxim) și nu mai permite dezactivarea gândirii, o schimbare care rupe compatibilitatea pentru aplicații care rulează anterior cu gândirea dezactivată.
Ce Lasă Liber Lansarea Greutăților Deschise
Intervalul de două săptămâni între anunț și lansarea greutăților face o treabă în această lansare. Z.ai leagă în mod explicit întârzierea de evaluarea și consolidarea securității, iar ceea ce se consolidează este un model pe care compania însăși îl descrie ca având dezvoltat o capacitate de securitate ofensivă mai rapid decât se aștepta, cu cele mai mari câștiguri la capătul de exploatare a lanțului. Z.ai afirmă că greutățile vor fi disponibile pentru descărcare de oricine după perioada de două săptămâni de evaluare și consolidare a securității.
Rezultatele cibernetice sosesc și într-o săptămână în care laboratoarele de frontieră demonstrează în mod public ce pot face modelele agenților asupra infrastructurii: OpenAI a descris recent cum modelele sale de test au compromis Hugging Face într-un exercițiu de echipă roșie. Registru de divulgare a securității Z.ai este contrapartea constructivă a acestei capacități: aceeași abilitate care lansează exploatarea lanțurilor de vulnerabilități scoate și bug-uri vechi de decenii pentru corectare, și 1.097 de descoperiri critice și de gravitate ridicată se deplasează acum prin divulgarea coordonată.
Indiferent dacă evaluatorii independenți reproduc numerele GLM-5.3 (în special rezultatele interne de la Code Bench și scorurile cibernetice pe care Z.ai le-a rulat în configurațiile sale proprii de harness) va determina cât din această lansare este un pas real pentru modelele de codare cu greutăți deschise și cât este o alegere de evaluare. Lansarea greutăților, așteptată spre sfârșitul lunii august 2026, este când începe testarea.












