Модели и платформы ИИ

Z.ai запускает GLM-5.3 с передовой кодировкой и кибер-способностью, которая превзошла свою подготовку

mm
Добавьте Unite.AI в избранные источники в Google

Z.ai выпустила GLM-5.3 14 августа 2026 года, обновление, которое, по словам компании, сохраняет ту же базовую модель, что и GLM-5.2, и получает все возможности за счет масштабирования после обучения. Основные результаты находятся в кодировании, где Z.ai сообщает, что модель является самой сильной системой с открытыми весами, которую она измерила, и в кибербезопасности, где компания говорит, что возможности выросли быстрее, чем она ожидала, когда обучение было масштабировано. Веса еще не являются публичными: Z.ai говорит, что она выпустит их через две недели, после завершения оценки безопасности и укрепления.

Согласно объявлению компании, GLM-5.3 доступна сейчас через API Z.ai и ее план кодирования GLM, и была развернута для всех существующих подписчиков плана кодирования.

Выпуск происходит через несколько дней после того, как DeepSeek отправила свою флагманскую V4 Pro из预览, и сравнительная таблица Z.ai ставит GLM-5.3 trực tiếp против DeepSeek-V4 Pro, Moonshot’s Kimi K3 и OpenAI’s GPT-5.6 Sol по кодированию, кибер- и агентским наборам.

Обучение на большем наборе рабочих сред

Рецепт, как описывает его Z.ai, заключается в масштабировании среды, а не в изменении архитектуры. GLM-5.2 ввела стек обучения (долгосрочная техника под названием IndexShare, метод обучения с подкреплением для долгосрочных задач под названием SAO и slime, открытую框架 для крупномасштабного асинхронного RL) и компания говорит, что GLM-5.3 получилась за счет увеличения вычислительных ресурсов на более разнообразных задачах, построенных на этом стеке.

Эти среды построены для имитации профессиональной работы, а не упражнений по кодированию. В одном примере, который дает компания, модель помещается в рабочую среду инженера-исследователя ML, с доступом к кластерам вычислений, внутренней документации, кодовым базам и результатам экспериментов, и должна диагностировать узкие места, реализовать оптимизации и обеспечить измеримое ускорение от начала до конца. Некоторые задачи, говорит Z.ai, представляют собой несколько дней работы для опытного инженера. Чтобы производить среды в большом объеме, Z.ai построила конвейеры, в которых агенты-исследователи конвертируют шаблоны задач из реальной работы в долгосрочные среды, агент-оценщик проверяет каждую задачу на решение, и верификаторы синтезируются без доступа к эталонному решению. Сам сигнал вознаграждения генерируется машиной для подмножества задач, с использованием траекторий решающих задач для закрытия обрезков вознаграждения. Z.ai отмечает, что конвейеры все еще требуют значимой работы человека в цикле.

Сообщенные результаты следуют тому шаблону, который этот рецепт предсказывает: самые большие выигрыши находятся на самых длинных оценках. На Terminal-Bench 3.0 GLM-5.3 переходит от 4,6 до 28,3 против GLM-5.2; на DeepSWE v1.1 от 46,2 до 66,9; на Agents’ Last Exam’s CLI-варинте от 23,8 до 28,5. Все цифры являются заявленными поставщиком, с методологическими сносками в объявлении, охватывающими настройки харнесса, длину контекста и настройки выборки для каждого бенчмарка.

По сравнению с другими моделями, картина смешанная. На внутреннем Z.ai Code Bench компания сообщает о 50% улучшении по сравнению с GLM-5.2 и говорит, что модель превосходит Claude Opus 4.8 при сопоставимых усилиях, потребляя меньше токенов вывода (31,4% при примерно 50 000 токенов вывода на задачу против 29,5% при 120 000), оставаясь позади Anthropic’s Claude Fable 5, который достигает 39,5% при максимальных усилиях. На публичных наборах GLM-5.3 отстает от GPT-5.6 Sol и Fable 5 на нескольких более сложных оценках кодирования, включая Terminal-Bench 3.0 и DeepSWE. Как частный бенчмарк, компания утверждает, что Z.ai Code Bench снижает риск загрязнения публичными тестовыми наборами.

Кибер-результат, который Z.ai говорит, что не планировала

Второй заголовок – это тот, который сама Z.ai отмечает как непредвиденный. Компания ввела данные об обнаружении уязвимостей и среды в послеобучение, ожидая, что модель станет лучше в обнаружении и рассуждении об отдельных недостатках. Вместо этого, говорит она, возможности продолжали нарастать, когда обучение было масштабировано, и модель начала рассуждать на нескольких стадиях эксплуатации, формируя связные планы для полных цепей эксплуатации, а не изолированного поиска ошибок.

Сообщенные цифры подтверждают это утверждение. На CyberGym, который проверяет, может ли модель выявить и проверить уязвимости из белого ящика исходного кода, GLM-5.3 набирает 84,5%, что выше, чем 77,2% у GLM-5.2, и опережает каждую модель в сравнительном наборе Z.ai. На ExploitBench, который требует более глубокого рассуждения о реальных уязвимостях и их эксплуатации, она более чем удваивает своего предшественника, 54,4% против 24,4%. На ExploitGym, который считает задачи эксплуатации, выполненные в рамках нормализованных бюджетов времени, она завершает 105 задач за два часа и 130 за шесть, против 29 и 39 для GLM-5.2. Суммарное описание Z.ai этого шаблона прямое: чем дальше вверх по цепи эксплуатации находится бенчмарк, тем больше выигрыш от GLM-5.2, и тем шире оставшийся разрыв с закрытыми фронтовыми моделями, с Mythos 5, завершившей 181 и 247 задач ExploitGym на тех же бюджетах.

Z.ai также сообщает о проверке переноса за пределы контролируемых бенчмарков. Работая с несколькими командами безопасности в Китае, компания говорит, что ее модели выявляют 2 436 уязвимостей в 269 открытых проектах с момента GLM-5.2, включая 1 097, оцененных как критические или высокие по степени тяжести, охватывающих ядра систем, операционные системы, движки браузеров и сетевые протоколы. Многие из них оставались незамеченными в течение лет; самая старая, говорит компания, была введена в 1981 году.

Найденные результаты питают публичный З.ai Security Disclosure Ledger, который отслеживает каждую проблему через процесс раскрытия: 53 публично раскрыты с назначенными CVE, 2 383 все еще находятся под эмбарго. Недавние записи включают использование после освобождения в ядре Linux, ошибку обработки памяти WebKit, влияющую на Apple Safari, и ошибку проверки параметров в FreeBSD.

Для API GLM-5.3 поддерживает три уровня усилий мышления (низкий, высокий и максимальный) и больше не позволяет отключать мышление, что является разрывным изменением для приложений, которые ранее запускались с отключенным мышлением.

Что оставляет открытым выпуск открытых весов

Двухнедельный перерыв между объявлением и выпуском весов делает работу в этом запуске. Z.ai связывает задержку явно с оценкой безопасности и укреплением, и то, что укрепляется, – это модель, которую сама компания описывает как разработавшую возможность кибербезопасности быстрее, чем ожидалось, с самыми большими выигрышами на конце эксплуатации цепи. Z.ai говорит, что веса будут доступны для скачивания кем угодно после двухнедельного периода оценки безопасности и укрепления.

Кибер-результаты также приходят в неделю, когда лаборатории передового опыта публично демонстрируют, что могут сделать агентные модели с инфраструктурой: OpenAI недавно описала свои собственные тестовые модели, нарушающие Hugging Face в упражнении красной команды. З.ai Security Disclosure Ledger является конструктивным аналогом этой возможности: тот же навык, который цепляет эксплуатацию, также выявляет десятилетние ошибки для исправления, и 1 097 критических и высоких по степени тяжести находок теперь перемещаются через координированное раскрытие.

Будут ли независимые оценщики воспроизводить цифры GLM-5.3 (прежде всего результаты внутреннего Code Bench и кибер-оценки Z.ai, которые она провела в своих собственных конфигурациях харнесса) будут определять, сколько этого запуска является настоящим шагом для моделей кодирования с открытыми весами и сколько является выбором оценки. Выпуск весов, ожидаемый в конце августа 2026 года, – это когда начинается это тестирование.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.