AI-mallit ja alustat
Z.ai julkaisee GLM-5.3:n, jossa on Frontier-koodaus ja kyber-kapasiteetti, joka ylitti koulutuksensa

Z.ai julkaisi GLM-5.3:n 14. elokuuta 2026, ja yhtiö kertoo, että tämä päivitys säilyttää saman perusmallin kuin GLM-5.2 ja jokaista lisäystä koulutuksen jälkeen. Otsikko tulokset ovat koodauksessa, jossa Z.ai ilmoittaa, että malli on vahvin avoimen painojen järjestelmä, jonka se on mitannut, ja kyberturvallisuudessa, jossa yhtiö kertoo, että kyber-kapasiteetti kasvoi nopeammin kuin odotettiin koulutuksen aikana. Painot eivät ole vielä julkisia: Z.ai kertoo, että ne julkaistaan noin kahden viikon kuluttua, kun turvallisuuden arviointi ja lujittaminen on valmis.
Yhtiön ilmoituksen mukaan GLM-5.3 on saatavilla jo Z.ai:n API:n ja GLM-koodaus-suunnitelman kautta, ja se on otettu käyttöön kaikkiin olemassa oleviin koodaus-suunnitelman tilaajiin.
Julkaisu tapahtuu päivien kuluttua, kun DeepSeek toimitti oman lippulaivamallinsa V4 Pro:n esikatselusta, ja Z.ai:n vertailutaulukko asettaa GLM-5.3:n suoraan DeepSeek-V4 Pro:n, Moonshotin Kimi K3:n ja OpenAI:n GPT-5.6 Solin rinnalle koodaus-, kyber- ja agenteille.
Koulutus suuremmassa työympäristössä
Resepti, kuten Z.ai kuvailee, on ympäristön skaalaus, ei arkkitehtuurin muutos. GLM-5.2 esitteli koulutuspinon (pitkän kontekstin tekniikka, jota kutsutaan IndexShareksi, vahvistusoppimismenetelmä pitkän aikavälin tehtäville, jota kutsutaan SAO:ksi, ja slime, avoimen lähdekoodin kehys suurelle aikajänteiselle RL:lle) ja yhtiö kertoo, että GLM-5.3 syntyi käyttämällä enemmän laskentaa monipuolisemmissa tehtävissä, jotka perustuvat tähän pinoon.
Nämä ympäristöt on suunniteltu muistuttamaan ammattimaisia työyksiköitä, ei koodausharjoituksia. Yhdessä esimerkissä yhtiö antaa, malli asetetaan ML-infrastruktuuri-insinöörin työympäristöön, jossa on pääsy laskentaklusteriin, sisäiseen asiakirjaan, koodipohjiin ja kokeiden tuloksiin, ja se on diagnosoida pullonkaulat, toteuttaa optimoinnit ja toimittaa mitattava lopputulos. Jotkut tehtävät, Z.ai kertoo, edustavat useita päiviä työtä kokeneelle insinöörille. Tuottamaan ympäristöjä suuressa määrin, Z.ai rakensi putkistot, joissa tutkimusagentit muuttavat tehtävämalleja todellisesta työstä suoritettaviksi pitkän aikavälin ympäristöiksi, tuomari-agentti vahvistaa jokaisen tehtävän olevan ratkaistavissa, ja vahvistajat syntetisoidaan ilman pääsyä viite-ratkaisuun. Palkintosignaali itsessään on koneella tuotettu tehtävien alijoukolle, jossa ratkaisija-traektoriat käytetään palkintosignaalin sulkemiseen. Z.ai huomauttaa, että putkistot edellyttävät edelleen merkittävää ihmisten osallistumista.
Ilmoitetut tulokset seuraavat reseptin kuvaamaa kaavaa: suurimmat voitot sijaitsevat pidentetyillä arvioilla. Terminal-Bench 3.0:lla GLM-5.3 siirtyy 4,6:sta 28,3:een GLM-5.2:ta vastaan; DeepSWE v1.1:llä 46,2:sta 66,9:ään. Kaikki luvut ovat toimittajan ilmoittamia, ja metodologiset jalanmerkit ilmoituksessa kattavat hihnan, kontekstin pituuden ja otoksen asetukset kullekin benchmarkille.
Muiden mallien suhteen kuva on sekoittunut. Z.ai:n omassa Code Bench -testissä yhtiö ilmoittaa 50 prosentin parantumisen GLM-5.2:een verrattuna ja kertoo, että malli ylittää Claude Opus 4.8:n samalla vaivalla ja kuluttaa vähemmän tulostokeneita (31,4 prosenttia noin 50 000 tulostokenia tehtävää kohden verrattuna 29,5 prosenttiin 120 000 tulostokenia kohden) ja jää Anthropicin Claude Fable 5:n jälkeen, joka saavuttaa 39,5 prosenttia maksimivaivalla. Julkisilla sovelluksilla GLM-5.3 jää GPT-5.6 Solin ja Fable 5:n jälkeen useilla haasteisimmilla koodausarvioilla, mukaan lukien Terminal-Bench 3.0 ja DeepSWE. Yksityisenä benchmarkina yhtiö väittää, että Z.ai Code Bench vähentää julkisten testien riskiä.
Z.ai:n mukaan ei suunniteltu kyber-tulosta
Toinen otsikko on se, jonka Z.ai itse korostaa odottamattomaksi. Yhtiö esitteli haavoittuvuuden löytämisen tiedot ja ympäristöt koulutuksen jälkeen, odottaen, että malli parantaisi yksittäisten virheiden löytämistä ja päättelyä. Sen sijaan se kertoo, että kyber-kapasiteetti jatkoi kasvamistaan koulutuksen aikana, ja malli alkoi päättelyä useiden hyökkäysvaiheiden yli, muodostaen koherentteja suunnitelmia täydellisten hyökkäysketjujen muodostamiseksi yksittäisten virheiden sijaan.
Ilmoitetut numerot seuraavat tätä väitettä. CyberGymillä, joka testaa, voittaako malli valkoisen laatikon lähdekoodin haavoittuvuuksia ja validoida, GLM-5.3 saa 84,5 prosenttia, nousua GLM-5.2:n 77,2 prosentista, ja se on edellä jokaista mallia Z.ai:n vertailusarjassa. ExploitBenchillä, joka vaatii syvempää päättelyä todellisista haavoittuvuuksista ja niiden hyökkäyksistä, se ylittää edeltäjänsä, 54,4 prosenttia 24,4 prosenttiin. ExploitGymillä, joka laskee hyökkäystehtävien määrän aikajänteisillä budjeteilla, se suorittaa 105 tehtävää kahdessa tunnissa ja 130 kuudessa tunnissa, verrattuna 29:ään ja 39:ään GLM-5.2:lle. Z.ai:n oma yhteenveto mallista on suora: mitä pidemmälle hyökkäysketjussa benchmark sijaitsee, sitä suurempi on voitto GLM-5.2:sta, ja sitä laajempi on jäljellä oleva aukko suljettuihin eturintamallisiin, joissa Mythos 5 suorittaa 181 ja 247 ExploitGym-tehtävää samalla budjetilla.
Z.ai kertoo myös testanneensa siirrettävyyttä kontrolloiduista benchmarkeista. Työskennellessään useiden turvallisuustiimien kanssa Kiinassa yhtiö kertoo, että sen mallit ovat tunnistanneet 2 436 haavoittuvuutta 269 avoimen lähdekoodin projektissa GLM-5.2:n jälkeen, mukaan lukien 1 097 kriittistä tai korkean tason haavoittuvuutta, jotka kattavat järjestelmäydinten, käyttöjärjestelmien, selainmoottorien ja verkkoprotokollien. Monet olivat jääneet huomaamatta vuosiksi; vanhin, jonka yhtiö kertoo, oli esitelty vuonna 1981.
Näiden löytöjen tuloksena on julkinen Z.ai:n turvallisuusilmoitusrekisteri, joka seuraa jokaista ongelmaa ilmoitusprosessin kautta: 53 on julkaistu julkisesti CVE-tunnuksilla, 2 383 on edelleen embargoalta. Viimeaikaiset sisäänkirjaukset sisältävät Linux-ytimen käytön jälkeen, WebKitin muistinhallintavirheen, joka vaikuttaa Apple Safariin, ja parametrin validointivirheen FreeBSD:ssä.
API:lle GLM-5.3 tukee kolmea ajattelun ponnistelua (matala, korkea ja maksimi) eikä enää salli ajattelun pois kytkemistä, mikä on muutos sovelluksille, jotka aiemmin suorittivat ajattelun pois kytkettynä.
Mikä avoimen painojen julkaisu jättää avoimeksi
Kahden viikon väli ilmoituksen ja painojen julkaisun välillä tekee työtä tässä julkaisussa. Z.ai sitoo viiveen nimenomaisesti turvallisuuden arviointiin ja lujittamiseen, ja se, mitä lujitetaan, on malli, jota yhtiö itse kuvailee kehittäneen hyökkäyskykyä odottamattomasti, ja sen suurimmat voitot ovat hyökkäysketjun päässä. Z.ai kertoo, että painot ovat ladattavissa kelle tahansa kahden viikon turvallisuuden arvioinnin ja lujittamisen jälkeen.
Kybertulokset saapuvat viikolla, jolloin eturintamalaboratoriot esittävät julkisesti, mitä agenteille voidaan tehdä infrastruktuurille: OpenAI kertoi äskettäin omista testimalleistaan rikkoen Hugging Facen punaisessa tiimiharjoituksessa. Z.ai:n ilmoitusrekisteri on rakentava vastine tähän kykyyn: sama taito, joka ketjuu hyökkäykset, myös paljastaa vuosikymmenien vanhoja bugeja korjaamista varten, ja 1 097 kriittistä ja korkean tason löytöä on nyt siirtymässä koordinoituun ilmoitusprosessiin.
Onko riippumattomien arvioijien toistava GLM-5.3:n lukemia (erityisesti Z.ai:n Code Bench -tulokset ja kyber-pisteet, joita Z.ai suoritti omassa harness-kokoonpanossaan) määrää, kuinka paljon tämä julkaisu on aito askel avoimen painojen koodausmalleille ja kuinka paljon se on arviointivalinta. Painojen julkaisu, joka odotetaan elokuun 2026 lopussa, on kun testaus alkaa.












