Моделі та платформи ШІ

Z.ai запускає GLM-5.3 з передовим кодуванням та кібер-можливостями, які перевищили тренування

mm
Додайте Unite.AI до бажаних джерел у Google

Z.ai випустив GLM-5.3 14 серпня 2026 року, оновлення, яке, за словами компанії, зберігає ту ж саму базову модель, що й GLM-5.2, і отримує всі можливості завдяки масштабованому пост-тренуванню. Головні результати стосуються кодування, де Z.ai повідомляє, що модель є найсильнішою системою з відкритими вагами, яку вона виміряла, та кібербезпеки, де компанія каже, що можливості виросли швидше, ніж очікувалося, при масштабуванні тренування. Ваги ще не публічні: Z.ai каже, що вони будуть випущені через два тижні, після завершення оцінки безпеки та зміцнення.

За словами компанії, GLM-5.3 вже доступний через API Z.ai та план кодування GLM, і був розгорнутий для всіх існуючих абонентів плану кодування.

Випуск відбувається через кілька днів після того, як DeepSeek випустив свій флагманський V4 Pro з попереднього перегляду, і порівняльна таблиця Z.ai ставить GLM-5.3 безпосередньо проти DeepSeek-V4 Pro, Kimi K3 від Moonshot та GPT-5.6 Sol від OpenAI у сфері кодування, кібербезпеки та агентських наборів.

Пост-тренування на більшій кількості робочих середовищ

Рецепт, як описує його Z.ai, полягає у масштабуванні середовища, а не у зміні архітектури. GLM-5.2 ввела стек тренування (техніку довгого контексту під назвою IndexShare, метод підкріплення навчання для завдань з довгим горизонтом під назвою SAO та slime, відкритий каркас для великомасштабного асинхронного навчання з підкріпленням) і компанія каже, що GLM-5.3 була отримана шляхом витрат更多 обчислювальних ресурсів на більш різноманітні завдання середовища, побудовані на цьому стеку.

Ці середовища побудовані так, щоб вони нагадували одиниці професійної роботи, а не завдання з кодування. У одному з прикладів, який дає компанія, модель розміщується в робочому середовищі інженера-розробника штучного інтелекту, з доступом до кластерів обчислень, внутрішньої документації, кодових баз та результатів експериментів, і повинна діагностувати вузькі місця, реалізовувати оптимізації та забезпечувати вимірюване прискорення кінця в кінець. Деякі завдання, каже Z.ai, представляють собою кілька днів роботи для досвідченого інженера. Для створення середовищ у великих обсягах Z.ai побудувала конвеєри, у яких агенти-дослідники конвертують шаблони завдань з реальної роботи у виконувані довгогоризонтові середовища, агент-екзаменатор перевіряє кожне завдання на те, чи воно дійсно розв’язується, а верифікатори синтезуються без доступу до посилкової розв’язки. Сигнал винагороди сам по собі генерується машиною для підмножини завдань, з використанням траєкторій розв’язувача для закриття винагородних скорочень. Z.ai зазначає, що конвеєри все ще потребують значної роботи людини у циклі.

Отримані результати відповідають шаблону, який би передбачала цей рецепт: найбільші здобутки розташовані на довгогоризонтових оцінках. На Terminal-Bench 3.0 GLM-5.3 рухається від 4,6 до 28,3 проти GLM-5.2; на DeepSWE v1.1 – від 46,2 до 66,9; на Agents’ Last Exam’s CLI-варіант – від 23,8 до 28,5. Всі цифри надані виробником, з методологічними примітками в оголошенні, що охоплюють харNESS, довжину контексту та налаштування вибірки для кожного бенчмарка.

У порівнянні з іншими моделями картина змішана. На внутрішньому бенчмарку Z.ai Code Bench компанія повідомляє про 50% покращення порівняно з GLM-5.2 і каже, що модель набирає більше балів, ніж Claude Opus 4.8 при порівнянних зусиллях, споживаючи менше токенів виводу (31,4% при приблизно 50 000 токенів виводу на завдання порівняно з 29,5% при 120 000) і залишається позаду Anthropic’s Claude Fable 5, який досягає 39,5% при максимальних зусиллях. На публічних наборах GLM-5.3 відстає від GPT-5.6 Sol і Fable 5 на декількох складніших оцінках кодування, включаючи Terminal-Bench 3.0 і DeepSWE. Як приватний бенчмарк, компанія стверджує, що Z.ai Code Bench зменшує ризик забруднення публічних тестових наборів.

Кібер-результат, який Z.ai каже, що не планував

Друга головна заява – це та, яку сама Z.ai позначає як несподівану. Компанія ввела дані про виявлення уразливостей та середовища у пост-тренування, очікуючи, що модель покращить свою здатність знаходити та обґрунтовувати окремі слабкості. Замість цього, каже вона, можливості продовжували зростати при масштабуванні тренування, і модель почала обґрунтовувати по декілька етапів експлуатації, формуючи цілісні плани для повних ланцюгів експлуатації, а не окремих пошуків багів.

Надані цифри підтверджують це твердження. На CyberGym, який перевіряє, чи може модель ідентифікувати та валідувати уразливості з білої коробки джерельного коду, GLM-5.3 набирає 84,5%, збільшення з 77,2% у GLM-5.2 і попереду кожної моделі у порівняльному наборі Z.ai. На ExploitBench, який вимагає глибшого обґрунтування реальних уразливостей та їх експлуатації, вона більш ніж удвоїла свого попередника, 54,4% до 24,4%. На ExploitGym, який нараховує завдання експлуатації, виконані у часових бюджетах з нормалізацією, вона завершує 105 завдань протягом двох годин і 130 протягом шести, проти 29 і 39 для GLM-5.2. Сумарний опис компанії цього шаблону прямий: чим далі по ланцюгу експлуатації знаходиться бенчмарк, тим більший здобуток від GLM-5.2 і тим ширша залишається прогалина до закритих фронтових моделей, з Mythos 5, який завершує 181 і 247 завдань ExploitGym у тих же бюджетах.

Z.ai також повідомляє про тестування трансферу за межі контрольованих бенчмарків. Працюючи з декількома командами безпеки в Китаї, компанія каже, що її моделі ідентифікували 2 436 уразливостей у 269 відкритих проєктах з моменту GLM-5.2, включаючи 1 097 уразливостей, оцінених як критичні або високого рівня тяжкості, що охоплюють ядра систем, операційні системи, браузерні двигуни та мережеві протоколи. Багато з них залишалися непоміченими протягом років; найстаріша, каже компанія, була введена в 1981 році.

Ці висновки живлять публічний реєстр розголошення безпеки Z.ai, який відстежує кожну проблему через процес розголошення: 53 публічно розголошені з призначеними CVE, 2 383 все ще під ембарго. Недавні записи включають використання після звільнення в ядрі Linux, помилку обробки пам’яті WebKit, яка впливає на Apple Safari, та помилку перевірки параметрів у FreeBSD.

Для API GLM-5.3 підтримує три рівні зусиль мислення (низький, високий і максимальний) і більше не дозволяє вимкнути мислення, що є критичною зміною для застосунків, які раніше працювали з вимкненим мисленням.

Що залишається відкритим після випуску відкритих ваг

Двотижневий розрив між оголошенням та випуском ваг робить свою роботу у цьому запуску. Z.ai явно пов’язує затримку з оцінкою безпеки та зміцненням, а те, що зміцнюється, – це модель, яку сама компанія описує як розроблену кібер-можливості швидше, ніж очікувалося, з найбільшими здобутками на кінці ланцюга експлуатації. Z.ai каже, що ваги будуть доступні для завантаження кожним після двотижневого періоду оцінки безпеки та зміцнення.

Кібер-результати також приходять у тиждень, коли фронтові лабораторії публічно демонструють, що можуть зробити агентні моделі з інфраструктурою: OpenAI недавно описала, як її власні тестові моделі прорвали Hugging Face у червоному командному тренуванні. Реєстр розголошення Z.ai є конструктивним аналогом цієї можливості: та ж сама уміння, яка ланцюжків експлуатації, також виявляє багаторічні баги для патчування, і 1 097 критичних та високого рівня тяжкості знахідок зараз рухаються через координоване розголошення.

Чи незалежні оцінювачі відтворюють числа GLM-5.3 (особливо результати внутрішнього бенчмарка Code Bench та кібер-оцінки Z.ai, які вона провела у власних конфігураціях харNESS), визначить, скільки цього запуску є справжнім кроком для моделей кодування з відкритими вагами та скільки з цього є вибором оцінки. Випуск ваг, очікуваний наприкінці серпня 2026 року, – це коли починається це тестування.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.