Modelos y plataformas de IA

Z.ai Detalla la Inferencia GLM-5.3-Flash construida sobre 100,000 chips chinos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Z.ai el 17 de septiembre de 2026 publicó un informe técnico que describe cómo construyó desde cero un servicio de inferencia de nivel de producción completo para su modelo GLM-5.3-Flash en un clúster de más de 100,000 aceleradores de IA fabricados en China. Según la empresa, gran parte del trabajo fue realizado por un Infra Agent impulsado por GLM-5.3 en lugar de solo por ingenieros de infraestructura, y toda la inferencia de producción para GLM-5.3-Flash se ejecuta en el sistema.

Z.ai afirmó que nadie había operado previamente un clúster de aceleradores fabricados en China a esta escala. La empresa señaló la capacidad y ancho de banda de memoria en chip relativamente limitados, una nueva arquitectura de modelo, una ventana de contexto de 1 millón de tokens y solicitudes multimodales, junto con un ecosistema inmaduro en el que el soporte de kernels era incompleto y los ingenieros tenían que adivinar el comportamiento que debería haber sido documentado.

GLM-5.3-Flash lanzado el 26 de agosto de 2026 como el primer modelo multimodal nativo de la serie GLM-5, con 320 mil millones de parámetros totales y 18 mil millones de parámetros activos bajo una arquitectura híbrida que combina atención dispersa y lineal. Antes del lanzamiento, Z.ai probó el modelo de forma anónima como ox-alpha en OpenCode y OpenRouter, y la empresa dijo que se convirtió en el modelo más usado en ambas plataformas dentro de una semana del lanzamiento, procesando más de 62 trillones de tokens en seis días.

El Método de Retroalimentación Densa

En el centro del informe hay un problema de sistemas: las métricas de extremo a extremo pueden indicar a un agente que los resultados empeoraron, pero no por qué. Una prueba de precisión numérica fallida, un aumento del 30 % en el tiempo hasta el primer token, o una caída del 20 % en el rendimiento de salida no muestra qué capa es responsable ni qué probar a continuación. La respuesta de Z.ai, que denomina retroalimentación densa, integra pruebas de corrección, registros de ejecución, trazas, eventos en tiempo de ejecución, microbenchmarks y métricas de extremo a extremo en flujos de trabajo repetibles que permiten al agente validar cada hipótesis localmente en lugar de esperar a una implementación completa y una prueba de carga después de cada cambio.

La empresa define tres propiedades requeridas para dicha retroalimentación. Debe ser local, vinculada siempre que sea posible a parámetros de lanzamiento específicos, cambios de código, kernels, condiciones de entrada, hilos, intervalos de ejecución o rutas de código. Debe ser económica y oportuna de obtener. Y debe soportar una verificación objetiva mediante implementaciones de referencia y experimentos controlados, porque las correlaciones observadas por sí solas no establecen una causa raíz.

En el ciclo de lanzamiento descrito en el informe, los ingenieros definieron objetivos y límites del sistema y revisaron cambios críticos relacionados con la semántica numérica, el comportamiento de concurrencia y el riesgo de producción, mientras el agente se encargaba del análisis, las hipótesis y los cambios de código. La pila que optimizaron conjuntamente combinó paralelismo de tensores intra-nodo para atención lineal y la LM Head, ReplaySSM, cuantización W8A8, cuantización de caché de precisión mixta INT8/FP8/BF16 y Layer Split, bajo una arquitectura desagregada Encode-Prefill-Decode.

Tres Casos de Ingeniería

El primer caso se refiere a la corrección numérica. La validación que comparó rutas de ejecución de kernels particionados y no particionados reveló un problema de precisión en la ruta de Paralelismo de Contexto del kernel KDA: la operación tl.dot utilizaba por defecto cálculo TF32 incluso cuando sus entradas eran FP32, por lo que los errores se acumularon durante la fusión de estados y se agravaron a medida que aumentaba la longitud del contexto. La solución estableció explícitamente la precisión de entrada a tf32x3, que emplea tres operaciones TF32 Tensor Core para obtener un resultado de mayor precisión.

Según el informe, las correcciones se fusionaron aguas arriba en Flash Linear Attention. La solicitud de extracción, abierta y fusionada el 27 de agosto de 2026, aplica la cadena afín tf32x3 en los kernels de actualización de estado y fusión de transformaciones como una ruta de precisión opcional, añade pruebas de Paralelismo de Contexto y retrocede explícitamente a precisión IEEE en plataformas sin soporte tf32 (AMD, NPUs y GPUs de NVIDIA con capacidad de cómputo inferior a 8.0).

El segundo caso se refiere a un cuello de botella de concurrencia en la transferencia KV. Según el informe, los ingenieros establecieron un criterio de aceptación que, bajo la misma carga de trabajo, el Prefill más la Transferencia KV deberían ejecutarse dentro del 5 % del punto de referencia solo de Prefill. El agente encontró brechas que superaban el 20 % en algunos escenarios y las rastreó hasta DeepEP v1.2.1, en la que ni la intranododespacho ni el intranodocombinar llamada liberaba explícitamente el GIL de Python. Mientras esas llamadas mantenían el bloqueo, el hilo Python de Mooncake Transfer en el mismo proceso no podía adquirir el GIL a tiempo, por lo que la planificación y el envío de tareas de transferencia se retrasaron y la superposición con la computación se redujo. El informe señala que internode_dispatch en la misma versión ya liberaba el GIL, con un comentario en el código que indica que la intención era evitar bloquear la Transferencia KV en otros hilos mientras la CPU esperaba. Después de que la corrección liberara el GIL durante los intervalos de ejecución relevantes de C++, el informe indica que la brecha cayó por debajo del 1 % bajo las mismas condiciones de prueba.

El tercer caso se refiere al rendimiento del kernel. Z.ai hizo que el agente destilara técnicas de kernels escritos a mano en proyectos como SGLang, Flash Linear Attention y DeepGEMM en esqueletos de optimización reutilizables que incluyen condiciones de aplicabilidad, métodos de transformación, limitaciones de recursos y evidencia de validación. En un kernel representativo de KDA Decode, la empresa informa que la optimización de división del agente redujo el tiempo de ejecución en un 9,6 %. Después de que los comentarios identificaran la computación como el principal cuello de botella, el agente fusionó los mosaicos de la dimensión V del kernel, que repetían la misma normalización y cálculos de compuerta en FP32 cuatro veces, en un único bloque de hilos con resultados intermedios residentes en registros y una reducción a nivel de warp, produciendo lo que la empresa reporta como una aceleración de 1,71× respecto a la versión anterior.

Resultados declarados y auto‑mejora recursiva

Z.ai informa que GLM-5.3-Flash pasó de la adaptación inicial del modelo a la preparación para producción en menos de dos semanas, con un rendimiento de extremo a extremo que finalmente se triplicó respecto a la línea base inicial. La empresa también indicó que la eficiencia de utilización del hardware y el costo por token alcanzaron niveles comparables a los de las GPUs convencionales de NVIDIA.

La empresa presenta el esfuerzo como un ejemplo temprano de mejora recursiva autónoma, señalando que el modelo participó en la optimización del sistema de inferencia en el que se ejecuta. Al mismo tiempo, Z.ai afirma que aún no ha alcanzado la mejora recursiva autónoma, y que la elección de objetivos, el establecimiento de límites y la evaluación de riesgos siguen siendo responsabilidades humanas que, según la empresa, deberían seguir siendo asumidas por personas.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.