Modele i platformy AI

Z.ai uruchamia GLM-5.3 z kodowaniem Frontier i zdolnościami cybernetycznymi, które przerosły jego szkolenie

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Z.ai wydał GLM-5.3 w dniu 14 sierpnia 2026 r., aktualizację, której firma mówi, że zachowuje taki sam podstawowy model jak GLM-5.2 i pochodzi z każdego zysku zdolności z powiększonego szkolenia. Główne wyniki są w kodowaniu, gdzie Z.ai raportuje, że model jest najsilniejszym systemem open-weights, który zmierzył, i w cyberbezpieczeństwie, gdzie firma mówi, że zdolność rosła szybciej, niż się spodziewała, gdy szkolenie rosło. Wagi nie są jeszcze publiczne: Z.ai mówi, że wyda je za około dwa tygodnie, po zakończeniu oceny bezpieczeństwa i wzmocnienia.

Zgodnie z ogłoszeniem firmy, GLM-5.3 jest dostępny teraz za pośrednictwem API Z.ai i planu kodowania GLM, i został wdrożony do wszystkich istniejących subskrybentów planu kodowania.

Wydanie pojawia się kilka dni po tym, jak DeepSeek wydał swój flagowy V4 Pro poza wersją preview, a tabela porównawcza Z.ai umieszcza GLM-5.3 bezpośrednio przeciwko DeepSeek-V4 Pro, Moonshot’s Kimi K3 i OpenAI’s GPT-5.6 Sol w zakresie kodowania, cybernetyki i agenciów.

Szkolenie na większym zestawie środowisk pracy

Przepis, jak go opisuje Z.ai, to skalowanie środowiska, a nie zmiana architektury. GLM-5.2 wprowadził stos szkoleniowy (długą technikę kontekstową o nazwie IndexShare, metodę uczenia wzmacniania dla długoterminowych zadań o nazwie SAO i slime, framework otwartego kodu dla dużego, asynchronicznego uczenia wzmacniania) i firma mówi, że GLM-5.3 powstał dzięki zwiększeniu komputera na więcej i bardziej zróżnicowanych środowisk zadań zbudowanych na tym stosie.

Te środowiska są zbudowane, aby przypominać jednostki pracy zawodowej, a nie ćwiczenia kodowania. W jednym przykładzie, który firma podaje, model jest umieszczony w środowisku inżyniera infrastruktury ML, z dostępem do klastrów obliczeniowych, dokumentacji wewnętrznej, kodów źródłowych i wyników eksperymentów, i musi zdiagnozować wąskie gardła, wdrożyć optymalizacje i dostarczyć wymierne przyspieszenie końcowe. Niektóre zadania, mówi Z.ai, reprezentują kilka dni pracy doświadczonego inżyniera. Aby wytworzyć środowiska w ilości, Z.ai zbudował potoki, w których agenci badawczy konwertują wzorce zadań z prawdziwej pracy w uruchamiane długoterminowe środowiska, agent sędziowski weryfikuje każde zadanie, czy jest ono naprawdę rozwiązywalne, a weryfikatory są syntetyzowane bez dostępu do rozwiązania odniesienia. Sygnał nagrody jest samoczynnie generowany dla podzbioru zadań, z trajektoriami rozwiązywania używanymi do zamknięcia skrótów nagrody. Z.ai zauważa, że potoki nadal wymagają znaczącej pracy w pętli ludzkiej.

Raportowane wyniki są zgodne z przepisem, jaki można by przewidzieć: największe zyski znajdują się na długoterminowych ocenach. Na Terminal-Bench 3.0, GLM-5.3 przechodzi od 4,6 do 28,3 w porównaniu z GLM-5.2; na DeepSWE v1.1, od 46,2 do 66,9; na Agents’ Last Exam’s CLI variant, od 23,8 do 28,5. Wszystkie dane są raportowane przez dostawcę, z przypisami metodycznymi w ogłoszeniu, pokrywającymi harness, długość kontekstu i ustawienia próbkowania dla każdego benchmarku.

W porównaniu z innymi modelami, obraz jest mieszany. Na wewnętrznej Z.ai Code Bench, firma raportuje 50% poprawę w porównaniu z GLM-5.2 i mówi, że model przewyższa Claude Opus 4.8 przy porównywalnym wysiłku, zużywając mniej tokenów wyjściowych (31,4% przy około 50 000 tokenach wyjściowych na zadanie w porównaniu z 29,5% przy 120 000), podczas gdy pozostaje za Anthropic’s Claude Fable 5, który osiąga 39,5% przy maksymalnym wysiłku. Na publicznych suitach, GLM-5.3 wyprzedza GPT-5.6 Sol i Fable 5 na kilku trudniejszych ocenach kodowania, w tym Terminal-Bench 3.0 i DeepSWE. Jako benchmark prywatny, firma argumentuje, że Z.ai Code Bench redukuje ryzyko zanieczyszczenia publicznych zestawów testowych.

Wynik cybernetyczny, którego Z.ai mówi, że nie planował

Drugi nagłówek to ten, który Z.ai sam flaguje jako nieoczekiwany. Firma wprowadziła dane odkrycia podatności i środowisk do szkolenia, spodziewając się, że model będzie lepszy w znajdowaniu i rozumowaniu o indywidualnych słabościach. Zamiast tego, mówi, że zdolność nadal rosła, gdy szkolenie rosło, a model zaczął rozumować na kilku etapach eksploatacji, tworząc spójne plany dla kompletnych łańcuchów eksploatacji, a nie izolowanych badań nad błędami.

Raportowane liczby śledzą to twierdzenie. Na CyberGym, który testuje, czy model może identyfikować i walidować podatności z białego kodu źródłowego, GLM-5.3 uzyskuje 84,5%, w górę od 77,2% GLM-5.2 i przed każdym modelem w zestawie porównawczym Z.ai. Na ExploitBench, który wymaga głębszego rozumowania o prawdziwych podatnościach i ich eksploatacji, więcej niż podwaja swojego poprzednika, 54,4% do 24,4%. Na ExploitGym, który liczy zadania eksploatacji ukończone w ramach czasowych budżetów, kończy 105 zadań w ciągu dwóch godzin i 130 w ciągu sześciu, w porównaniu z 29 i 39 dla GLM-5.2. Własne podsumowanie wzorca Z.ai jest bezpośrednie: im wyżej w łańcuchu eksploatacji znajduje się benchmark, tym większy zysk z GLM-5.2, a tym szersza pozostająca luka do zamkniętych modeli granicznych, z Mythos 5 kończąc 181 i 247 zadań ExploitGym w ramach tych samych budżetów.

Z.ai również raportuje testowanie transferu poza kontrolowanymi benchmarkami. Współpracując z kilkoma zespołami bezpieczeństwa w Chinach, firma mówi, że jej modele zidentyfikowały 2 436 podatności w 269 projektach open-source od GLM-5.2, w tym 1 097 ocenionych jako krytyczne lub o wysokim nasileniu, obejmujących jądra systemów, systemy operacyjne, silniki przeglądarek i protokoły sieciowe. Wiele z nich pozostawało niezauważonych przez lata; najstarsze, mówi firma, zostało wprowadzone w 1981 roku.

Odkrycia karmią publiczny Z.ai Security Disclosure Ledger, który śledzi każdy problem przez proces ujawniania: 53 publicznie ujawnione z przypisanymi CVE, 2 383 nadal pod embargiem. Ostatnie wpisy obejmują użycie po zwolnieniu w jądrze Linux, awarię obsługi pamięci WebKit wpływającą na Apple Safari i błąd walidacji parametrów w FreeBSD.

Dla API, GLM-5.3 obsługuje trzy poziomy wysiłku myślowego (niski, wysoki i maksymalny) i nie pozwala już na wyłączenie myślenia, zmianę przełamującą dla aplikacji, które wcześniej uruchamiały się z myśleniem wyłączonym.

Czego wydanie otwartych wag pozostawia otwarte

Dwutygodniowa luka między ogłoszeniem a wydaniem wag robi pracę w tym wydaniu. Z.ai wiąże opóźnienie wyraźnie z oceną bezpieczeństwa i wzmocnieniem, a rzeczą, która jest wzmacniana, jest model, który firma sama opisuje jako mający rozwiniętą zdolność bezpieczeństwa ofensywnego szybciej, niż się spodziewała, z największymi zyskami na końcu łańcucha eksploatacji. Z.ai mówi, że wagi będą dostępne do pobrania przez każdego po dwutygodniowym okresie oceny bezpieczeństwa i wzmocnienia.

Wyniki cybernetyczne pojawiają się w tygodniu, w którym laboratoria graniczne publicznie demonstrują, co modele agenciowe mogą zrobić z infrastrukturą: OpenAI niedawno opisał swoje własne modele testowe naruszające Hugging Face w ćwiczeniu czerwonego zespołu. Z.ai Security Disclosure Ledger jest konstruktywnym odpowiednikiem tej możliwości: ta sama umiejętność, która łańcuchy eksploatacji, również ujawnia dekady stare błędy do łatania, a 1 097 krytycznych i wysokich podatności jest teraz przenoszonych przez skoordynowane ujawnianie.

Czy niezależni ewaluatorzy powtórzą liczby GLM-5.3 (szczególnie wyniki Code Bench i wyniki cybernetyczne Z.ai, które uruchomił w swoich własnych konfiguracjach harnessu) określi, ile z tego wydania jest prawdziwym krokiem do modeli kodowania open-weights i ile jest wyborem oceny. Wydanie wag, które ma nastąpić pod koniec sierpnia 2026 r., to kiedy zaczyna się to testowanie.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.