Моделі та платформи ШІ
Z.ai запускає GLM-5.3 з передовим кодуванням та кібер-можливостями, які перевищили тренування

Z.ai випустив GLM-5.3 14 серпня 2026 року, оновлення, яке, за словами компанії, зберігає ту ж саму базову модель, що й GLM-5.2, і отримує всі можливості завдяки масштабованому пост-тренуванню. Головні результати стосуються кодування, де Z.ai повідомляє, що модель є найсильнішою системою з відкритими вагами, яку вона виміряла, та кібербезпеки, де компанія каже, що можливості виросли швидше, ніж очікувалося, при масштабуванні тренування. Ваги ще не публічні: Z.ai каже, що вони будуть випущені через два тижні, після завершення оцінки безпеки та зміцнення.
За словами компанії, GLM-5.3 вже доступний через API Z.ai та план кодування GLM, і був розгорнутий для всіх існуючих абонентів плану кодування.
Випуск відбувається через кілька днів після того, як DeepSeek випустив свій флагманський V4 Pro з попереднього перегляду, і порівняльна таблиця Z.ai ставить GLM-5.3 безпосередньо проти DeepSeek-V4 Pro, Kimi K3 від Moonshot та GPT-5.6 Sol від OpenAI у сфері кодування, кібербезпеки та агентських наборів.
Пост-тренування на більшій кількості робочих середовищ
Рецепт, як описує його Z.ai, полягає у масштабуванні середовища, а не у зміні архітектури. GLM-5.2 ввела стек тренування (техніку довгого контексту під назвою IndexShare, метод підкріплення навчання для завдань з довгим горизонтом під назвою SAO та slime, відкритий каркас для великомасштабного асинхронного навчання з підкріпленням) і компанія каже, що GLM-5.3 була отримана шляхом витрат更多 обчислювальних ресурсів на більш різноманітні завдання середовища, побудовані на цьому стеку.
Ці середовища побудовані так, щоб вони нагадували одиниці професійної роботи, а не завдання з кодування. У одному з прикладів, який дає компанія, модель розміщується в робочому середовищі інженера-розробника штучного інтелекту, з доступом до кластерів обчислень, внутрішньої документації, кодових баз та результатів експериментів, і повинна діагностувати вузькі місця, реалізовувати оптимізації та забезпечувати вимірюване прискорення кінця в кінець. Деякі завдання, каже Z.ai, представляють собою кілька днів роботи для досвідченого інженера. Для створення середовищ у великих обсягах Z.ai побудувала конвеєри, у яких агенти-дослідники конвертують шаблони завдань з реальної роботи у виконувані довгогоризонтові середовища, агент-екзаменатор перевіряє кожне завдання на те, чи воно дійсно розв’язується, а верифікатори синтезуються без доступу до посилкової розв’язки. Сигнал винагороди сам по собі генерується машиною для підмножини завдань, з використанням траєкторій розв’язувача для закриття винагородних скорочень. Z.ai зазначає, що конвеєри все ще потребують значної роботи людини у циклі.
Отримані результати відповідають шаблону, який би передбачала цей рецепт: найбільші здобутки розташовані на довгогоризонтових оцінках. На Terminal-Bench 3.0 GLM-5.3 рухається від 4,6 до 28,3 проти GLM-5.2; на DeepSWE v1.1 – від 46,2 до 66,9; на Agents’ Last Exam’s CLI-варіант – від 23,8 до 28,5. Всі цифри надані виробником, з методологічними примітками в оголошенні, що охоплюють харNESS, довжину контексту та налаштування вибірки для кожного бенчмарка.
У порівнянні з іншими моделями картина змішана. На внутрішньому бенчмарку Z.ai Code Bench компанія повідомляє про 50% покращення порівняно з GLM-5.2 і каже, що модель набирає більше балів, ніж Claude Opus 4.8 при порівнянних зусиллях, споживаючи менше токенів виводу (31,4% при приблизно 50 000 токенів виводу на завдання порівняно з 29,5% при 120 000) і залишається позаду Anthropic’s Claude Fable 5, який досягає 39,5% при максимальних зусиллях. На публічних наборах GLM-5.3 відстає від GPT-5.6 Sol і Fable 5 на декількох складніших оцінках кодування, включаючи Terminal-Bench 3.0 і DeepSWE. Як приватний бенчмарк, компанія стверджує, що Z.ai Code Bench зменшує ризик забруднення публічних тестових наборів.
Кібер-результат, який Z.ai каже, що не планував
Друга головна заява – це та, яку сама Z.ai позначає як несподівану. Компанія ввела дані про виявлення уразливостей та середовища у пост-тренування, очікуючи, що модель покращить свою здатність знаходити та обґрунтовувати окремі слабкості. Замість цього, каже вона, можливості продовжували зростати при масштабуванні тренування, і модель почала обґрунтовувати по декілька етапів експлуатації, формуючи цілісні плани для повних ланцюгів експлуатації, а не окремих пошуків багів.
Надані цифри підтверджують це твердження. На CyberGym, який перевіряє, чи може модель ідентифікувати та валідувати уразливості з білої коробки джерельного коду, GLM-5.3 набирає 84,5%, збільшення з 77,2% у GLM-5.2 і попереду кожної моделі у порівняльному наборі Z.ai. На ExploitBench, який вимагає глибшого обґрунтування реальних уразливостей та їх експлуатації, вона більш ніж удвоїла свого попередника, 54,4% до 24,4%. На ExploitGym, який нараховує завдання експлуатації, виконані у часових бюджетах з нормалізацією, вона завершує 105 завдань протягом двох годин і 130 протягом шести, проти 29 і 39 для GLM-5.2. Сумарний опис компанії цього шаблону прямий: чим далі по ланцюгу експлуатації знаходиться бенчмарк, тим більший здобуток від GLM-5.2 і тим ширша залишається прогалина до закритих фронтових моделей, з Mythos 5, який завершує 181 і 247 завдань ExploitGym у тих же бюджетах.
Z.ai також повідомляє про тестування трансферу за межі контрольованих бенчмарків. Працюючи з декількома командами безпеки в Китаї, компанія каже, що її моделі ідентифікували 2 436 уразливостей у 269 відкритих проєктах з моменту GLM-5.2, включаючи 1 097 уразливостей, оцінених як критичні або високого рівня тяжкості, що охоплюють ядра систем, операційні системи, браузерні двигуни та мережеві протоколи. Багато з них залишалися непоміченими протягом років; найстаріша, каже компанія, була введена в 1981 році.
Ці висновки живлять публічний реєстр розголошення безпеки Z.ai, який відстежує кожну проблему через процес розголошення: 53 публічно розголошені з призначеними CVE, 2 383 все ще під ембарго. Недавні записи включають використання після звільнення в ядрі Linux, помилку обробки пам’яті WebKit, яка впливає на Apple Safari, та помилку перевірки параметрів у FreeBSD.
Для API GLM-5.3 підтримує три рівні зусиль мислення (низький, високий і максимальний) і більше не дозволяє вимкнути мислення, що є критичною зміною для застосунків, які раніше працювали з вимкненим мисленням.
Що залишається відкритим після випуску відкритих ваг
Двотижневий розрив між оголошенням та випуском ваг робить свою роботу у цьому запуску. Z.ai явно пов’язує затримку з оцінкою безпеки та зміцненням, а те, що зміцнюється, – це модель, яку сама компанія описує як розроблену кібер-можливості швидше, ніж очікувалося, з найбільшими здобутками на кінці ланцюга експлуатації. Z.ai каже, що ваги будуть доступні для завантаження кожним після двотижневого періоду оцінки безпеки та зміцнення.
Кібер-результати також приходять у тиждень, коли фронтові лабораторії публічно демонструють, що можуть зробити агентні моделі з інфраструктурою: OpenAI недавно описала, як її власні тестові моделі прорвали Hugging Face у червоному командному тренуванні. Реєстр розголошення Z.ai є конструктивним аналогом цієї можливості: та ж сама уміння, яка ланцюжків експлуатації, також виявляє багаторічні баги для патчування, і 1 097 критичних та високого рівня тяжкості знахідок зараз рухаються через координоване розголошення.
Чи незалежні оцінювачі відтворюють числа GLM-5.3 (особливо результати внутрішнього бенчмарка Code Bench та кібер-оцінки Z.ai, які вона провела у власних конфігураціях харNESS), визначить, скільки цього запуску є справжнім кроком для моделей кодування з відкритими вагами та скільки з цього є вибором оцінки. Випуск ваг, очікуваний наприкінці серпня 2026 року, – це коли починається це тестування.












