Modelos e plataformas de IA

Z.ai detalha a inferência GLM-5.3-Flash construída em 100.000 chips chineses

mm
Adicione Unite.AI às suas fontes preferidas no Google

Em 17 de setembro de 2026, a Z.ai publicou um relato técnico descrevendo como construiu um serviço de inferência de produção completo para seu modelo GLM-5.3-Flash do zero em um cluster com mais de 100.000 aceleradores de IA fabricados na China. Segundo a empresa, grande parte do trabalho foi realizado por um Infra Agent alimentado pelo GLM-5.3, e não apenas por engenheiros de infraestrutura, e toda a inferência de produção do GLM-5.3-Flash roda no sistema.

A Z.ai afirmou que ninguém havia operado anteriormente um cluster de aceleradores fabricados na China nessa escala. A empresa apontou a capacidade e largura de banda de memória on-chip relativamente limitadas, uma nova arquitetura de modelo, uma janela de contexto de 1 milhão de tokens e solicitações multimodais, além de um ecossistema ainda imaturo em que o suporte a kernels era incompleto e os engenheiros tinham de adivinhar comportamentos que deveriam estar documentados.

GLM-5.3-Flash lançado em 26 de agosto de 2026 como o primeiro modelo nativamente multimodal da série GLM-5, com 320 bilhões de parâmetros totais e 18 bilhões de parâmetros ativos sob uma arquitetura híbrida que combina atenção esparsa e linear. Antes do lançamento, a Z.ai testou o modelo anonimamente como ox-alpha no OpenCode e no OpenRouter, e a empresa afirmou que ele se tornou o modelo mais usado em ambas as plataformas dentro de uma semana após o lançamento, processando mais de 62 trilhões de tokens em seis dias.

O Método de Feedback Denso

No centro do relato está um problema de sistema: métricas de ponta a ponta podem indicar a um agente que os resultados pioraram, mas não o motivo. Um teste de precisão numérica falho, um aumento de 30 % no tempo até o primeiro token ou uma queda de 20 % na taxa de saída não revelam qual camada é responsável nem o que testar a seguir. A resposta da Z.ai, que chama de feedback denso, integra testes de correção, logs de execução, rastros de execução, eventos de runtime, microbenchmarkings e métricas de ponta a ponta em fluxos de trabalho repetíveis que permitem ao agente validar cada hipótese localmente, em vez de aguardar uma implantação completa e um teste de carga após cada alteração.

A empresa define três propriedades necessárias para esse feedback. Ele deve ser local, vinculado, sempre que possível, a parâmetros de lançamento específicos, alterações de código, kernels, condições de entrada, threads, intervalos de execução ou caminhos de código. Deve ser barato e rápido de obter. E deve suportar verificação objetiva por meio de implementações de referência e experimentos controlados, pois correlações observadas por si só não estabelecem a causa raiz.

No ciclo de lançamento descrito no relato, os engenheiros definiram objetivos e limites do sistema e revisaram mudanças críticas envolvendo semântica numérica, comportamento de concorrência e risco de produção, enquanto o agente cuidava da análise, hipóteses e alterações de código. A pilha que otimizaram em conjunto combinou paralelismo de tensor intra‑nó para atenção linear e o LM Head, ReplaySSM, quantização W8A8, quantização de cache de precisão mista INT8/FP8/BF16 e Layer Split, sob uma arquitetura desagregada Encode‑Prefill‑Decode.

Três Casos de Engenharia

O primeiro caso trata da correção numérica. A validação comparando caminhos de execução de kernel particionados e não particionados revelou um problema de precisão no caminho de Paralelismo de Contexto do kernel KDA: a operação tl.dot usava por padrão computação TF32 mesmo quando suas entradas eram FP32, de modo que erros se acumulavam durante a fusão de estado e se agravavam à medida que o comprimento do contexto aumentava. A correção definiu explicitamente a precisão de entrada como tf32x3, que utiliza três operações TF32 Tensor Core para gerar um resultado de maior precisão.

Segundo o relato, as correções foram incorporadas a montante no Flash Linear Attention. A solicitação de pull, aberta e mesclada em 27 de agosto de 2026, aplica a cadeia afim tf32x3 nos kernels de atualização de estado e de fusão de transformações como um caminho de precisão opcional, adiciona testes de Paralelismo de Contexto e recorre explicitamente à precisão IEEE em plataformas sem suporte a tf32 (AMD, NPUs e GPUs NVIDIA com capacidade de computação inferior a 8.0).

O segundo caso trata de um gargalo de concorrência na Transferência KV. Segundo o relato, os engenheiros definiram um critério de aceitação que, sob a mesma carga de trabalho, o Prefill mais a Transferência KV deveriam ser executados dentro de 5 % da linha de base apenas de Prefill. O agente encontrou lacunas superiores a 20 % em alguns cenários e as atribuiu ao DeepEP v1.2.1, no qual nem a chamada intranodedespacho nem a chamada intranode combinar liberavam explicitamente o GIL do Python. Enquanto essas chamadas mantinham o bloqueio, a thread Python Mooncake Transfer no mesmo processo não conseguia adquirir o GIL a tempo, de modo que o agendamento e a submissão das tarefas de transferência atrasavam e a sobreposição com a computação diminuía. O relato observa que internode_dispatch na mesma versão já liberava o GIL, com um comentário no código indicando que a intenção era evitar bloquear a Transferência KV em outras threads enquanto a CPU esperava. Após a correção liberar o GIL durante os intervalos de execução relevantes em C++, o relato indica que a lacuna caiu para menos de 1 % nas mesmas condições de teste.

O terceiro caso trata do desempenho do kernel. A Z.ai fez com que o agente destilasse técnicas de kernels escritos à mão em projetos como SGLang, Flash Linear Attention e DeepGEMM em esqueletos de otimização reutilizáveis que incluem condições de aplicabilidade, métodos de transformação, restrições de recursos e evidências de validação. Em um kernel representativo de KDA Decode, a empresa relata que a otimização de divisão do agente reduziu o tempo de execução em 9,6 %. Após o feedback identificar a computação como o gargalo principal, o agente mesclou os blocos de tiles da dimensão V do kernel, que repetiam a mesma normalização FP32 e os cálculos de gating quatro vezes, em um único bloco de threads com resultados intermediários residindo em registradores e uma redução ao nível de warp, produzindo o que a empresa descreve como um aumento de velocidade de 1,71× em relação à versão anterior.

Resultados Declarados e Autoaperfeiçoamento Recursivo

A Z.ai informa que o GLM-5.3-Flash passou da adaptação inicial do modelo à prontidão para produção em menos de duas semanas, com a taxa de transferência de ponta a ponta triplicando em relação à linha de base inicial. A empresa também afirmou que a eficiência de utilização de hardware e o custo por token atingiram níveis comparáveis aos das GPUs NVIDIA convencionais.

A empresa enquadra o esforço como um exemplo precoce de autoaperfeiçoamento recursivo, observando que o modelo participou da otimização do sistema de inferência no qual ele opera. Ao mesmo tempo, a Z.ai declara que ainda não alcançou o autoaperfeiçoamento recursivo e que a escolha de objetivos, o estabelecimento de limites e a avaliação de riscos permanecem responsabilidades humanas que, segundo a empresa, devem continuar a ser exercidas por pessoas.

Theo Nash é um especialista em AI gerado pela Unite.AI, cobrindo infraestrutura de AI, computação e os sistemas de hardware que alimentam a inteligência artificial moderna. Seu trabalho se concentra nas fundações técnicas por trás das cargas de trabalho de AI em larga escala, incluindo centros de dados, aceleradores, redes e as pilhas de software que os unem.
Com uma perspectiva analítica e orientada por engenharia, Theo examina como os avanços em GPUs, silício personalizado, arquiteturas de memória e sistemas distribuídos permitem novas gerações de modelos de AI. Ele presta atenção especial às trocas de desempenho, eficiência energética, escalabilidade e às restrições práticas que moldam a implantação real da infraestrutura de AI.
Os artigos escritos por Theo Nash são gerados por AI e revisados pela equipe editorial da Unite.AI para garantir a precisão técnica, clareza e cobertura responsável do paisagem de computação de AI em rápida evolução.