Модели и платформы ИИ
Z.ai раскрывает детали вывода GLM-5.3-Flash, построенного на 100 000 китайских чипов

Z.ai 17 сентября 2026 г. опубликовала технический отчёт, описывающий, как она построила полностью производственный сервис вывода для модели GLM-5.3-Flash с нуля на кластере из более чем 100 000 китайских AI‑ускорителей. По словам компании, большая часть работы была выполнена Infra Agent, работающим на базе GLM-5.3, а не только инженерами инфраструктуры, и весь производственный вывод для GLM-5.3-Flash работает в этой системе.
Z.ai заявила, что ранее никому не удавалось эксплуатировать кластер китайских ускорителей такого масштаба. Компания указала на относительно ограниченную ёмкость и пропускную способность памяти на кристалле, новую архитектуру модели, контекстное окно в 1 млн токенов и мультимодальные запросы, а также на незрелую экосистему, в которой поддержка ядер была неполной, и инженерам приходилось догадываться о поведении, которое должно было быть задокументировано.
GLM-5.3-Flash запущен 26 августа 2026 г. как первая изначально мультимодальная модель серии GLM-5, с общим числом параметров 320 млрд и 18 млрд активных параметров в гибридной архитектуре, объединяющей разреженное и линейное внимание. До выпуска Z.ai анонимно тестировала модель под именем ox-alpha на OpenCode и OpenRouter, и компания заявила, что она стала самой используемой моделью на обеих платформах в течение недели после запуска, обработав более 62 трлн токенов за шесть дней.
Метод плотной обратной связи
В основе отчёта лежит системная проблема: сквозные метрики могут сообщить агенту, что результаты ухудшились, но не объяснить причину. Неудачный тест числовой точности, увеличение времени до первого токена на 30 % или падение пропускной способности вывода на 20 % не показывают, какой слой отвечает за проблему и что проверять дальше. Ответ Z.ai, названный плотной обратной связью, объединяет тесты корректности, журналы выполнения, трассировки, события времени выполнения, микробенчмарки и сквозные метрики в повторяемые рабочие процессы, позволяющие агенту локально проверять каждую гипотезу вместо ожидания полного развертывания и нагрузочного теста после каждого изменения.
Компания определяет три обязательных свойства такой обратной связи. Она должна быть локальной, по возможности привязанной к конкретным параметрам запуска, изменениям кода, ядрам, условиям ввода, потокам, интервалам выполнения или путям кода. Она должна быть недорогой и быстрой в получении. И она должна поддерживать объективную проверку с помощью эталонных реализаций и контролируемых экспериментов, поскольку наблюдаемые корреляции сами по себе не устанавливают первопричину.
В описанном цикле запуска инженеры определяли цели и границы системы, а также проверяли критические изменения, связанные с числовой семантикой, поведением параллелизма и производственными рисками, в то время как агент занимался анализом, гипотезами и изменениями кода. Совместно оптимизированный стек объединял внутринодовый тензорный параллелизм для линейного внимания и LM‑Head, ReplaySSM, квантизацию W8A8, квантизацию кэша смешанной точности INT8/FP8/BF16 и разбиение слоёв в рамках дезагрегированной архитектуры Encode‑Prefill‑Decode.
Три инженерных случая
Первый случай касается числовой точности. Сравнительная проверка разделённых и неразделённых путей выполнения ядра выявила проблему точности в пути Context Parallelism ядра KDA: операция tl.dot по умолчанию использовала вычисления TF32, даже когда её входы были FP32, из‑за чего ошибки накапливались при объединении состояний и усиливались с ростом длины контекста. Исправление явно задаёт точность входов как tf32x3, использующее три операции TF32 Tensor Core для получения результата более высокой точности.
Согласно отчёту, исправления были интегрированы в основной репозиторий Flash Linear Attention. pull‑request, открытый и принятый 27 августа 2026 г., применяет цепочку tf32x3 в ядрах обновления состояния и объединения преобразований как опциональный путь точности, добавляет тесты Context Parallelism и явно переходит к точности IEEE на платформах без поддержки tf32 (AMD, NPU и графические процессоры NVIDIA ниже вычислительной способности 8.0).
Второй случай касается узкого места параллелизма KV Transfer. Согласно отчёту, инженеры установили критерий приемлемости, согласно которому при той же нагрузке Prefill плюс KV Transfer должны работать в пределах 5 % от базового уровня только Prefill. Агент обнаружил отклонения более 20 % в некоторых сценариях и проследил их до DeepEP v1.2.1, в которой ни вызов intranodedispatch, ни вызов intranodecombine явно не освобождали GIL Python. Пока эти вызовы удерживали блокировку, поток Mooncake Transfer в том же процессе не мог своевременно захватить GIL, из‑за чего планирование и отправка задач передачи откладывались, а наложение с вычислениями сокращалось. В отчёте отмечается, что internode_dispatch в той же версии уже освобождал GIL, с комментарием в коде, указывающим, что цель — избежать блокировки KV Transfer в других потоках, пока процессор ждёт. После того как исправление освободило GIL во время соответствующих интервалов выполнения C++, отчёт сообщает, что разрыв упал ниже 1 % при тех же тестовых условиях.
Третий случай касается производительности ядра. Z.ai поручил агенту извлечь техники из написанных вручную ядер в проектах, включая SGLang, Flash Linear Attention и DeepGEMM, в переиспользуемые скелеты оптимизации, содержащие условия применимости, методы преобразования, ограничения ресурсов и доказательства валидации. На репрезентативном ядре KDA Decode компания сообщает, что оптимизация деления агента сократила время выполнения на 9,6 %. После того как обратная связь указала вычисления как основной узкий места, агент объединил плитки V‑измерения ядра, которые четырежды повторяли одинаковые вычисления нормализации и гейтинга в FP32, в один блок потоков с промежуточными результатами, хранящимися в регистрах, и одной редукцией на уровне warp, что, по данным компании, дало ускорение 1,71× по сравнению с предыдущей версией.
Указанные результаты и рекурсивное самоулучшение
Z.ai сообщает, что GLM-5.3-Flash прошёл от начальной адаптации модели до готовности к производству менее чем за две недели, при этом сквозная пропускная способность в конечном итоге утроилась по сравнению с исходным базовым уровнем. Компания также заявила, что эффективность использования аппаратных ресурсов и стоимость за токен достигли уровней, сопоставимых с обычными графическими процессорами NVIDIA.
Компания позиционирует эту работу как ранний пример рекурсивного самоулучшения, отмечая, что модель участвовала в оптимизации системы вывода, на которой она работает. В то же время Z.ai заявляет, что рекурсивное самоулучшение ещё не достигнуто, и что выбор целей, установление границ и оценка рисков остаются человеческой ответственностью, которую, по их мнению, должны продолжать выполнять люди.












