Modelos y plataformas de IA

Z.ai lanza GLM-5.3 con codificación fronteriza y una capacidad cibernética que superó su entrenamiento

mm
Añade Unite.AI a tus fuentes preferidas en Google

Z.ai lanzó GLM-5.3 el 14 de agosto de 2026, una actualización que la empresa dice que mantiene el mismo modelo base que GLM-5.2 y deriva todas las ganancias de capacidad de la escalada de post-entrenamiento. Los resultados principales están en la codificación, donde Z.ai informa que el modelo es el sistema de pesos abiertos más fuerte que ha medido, y en la ciberseguridad, donde la empresa dice que la capacidad creció más rápido de lo que anticipó a medida que se escaló el entrenamiento. Los pesos aún no son públicos: Z.ai dice que los lanzará en aproximadamente dos semanas, después de que se completen la evaluación de seguridad y el endurecimiento.

Según el anuncio de la empresa, GLM-5.3 está disponible ahora a través de la API de Z.ai y su plan de codificación GLM, y se ha implementado en todos los suscriptores existentes del plan de codificación.

El lanzamiento llega días después de que DeepSeek lanzara su propio modelo insignia V4 Pro fuera de la vista previa, y la tabla de comparación de Z.ai coloca a GLM-5.3 directamente contra DeepSeek-V4 Pro, Moonshot’s Kimi K3 y OpenAI’s GPT-5.6 Sol en suites de codificación, ciberseguridad y agencia.

Entrenamiento posterior en un conjunto más grande de entornos de trabajo

La receta, como la describe Z.ai, es la escalada de entornos en lugar de un cambio de arquitectura. GLM-5.2 introdujo la pila de entrenamiento (una técnica de contexto largo llamada IndexShare, un método de aprendizaje de refuerzo para tareas de horizonte largo llamado SAO y slime, un marco de código abierto para aprendizaje de refuerzo asíncrono a gran escala) y la empresa dice que GLM-5.3 se derivó de gastar más cómputo en más y más entornos de tareas diversos construidos sobre esa pila.

Esos entornos están diseñados para parecerse a unidades de trabajo profesional en lugar de ejercicios de codificación. En un ejemplo que da la empresa, un modelo se coloca en el entorno de trabajo de un ingeniero de infraestructura de ML, con acceso a clústeres de cómputo, documentación interna, bases de código y resultados de experimentos, y debe diagnosticar cuellos de botella, implementar optimizaciones y entregar un aumento de velocidad de extremo a extremo medible. Algunas tareas, dice Z.ai, representan varios días de trabajo para un ingeniero experimentado. Para producir entornos en volumen, Z.ai construyó tuberías en las que los agentes de investigación convierten patrones de tareas de trabajo real en entornos de horizonte largo ejecutables, un agente juez verifica que cada tarea sea en realidad resoluble y los verificadores se sintetizan sin acceso a la solución de referencia. La señal de recompensa en sí misma es generada por máquina para un subconjunto de tareas, con trayectorias de solución utilizadas para cerrar atajos de recompensa. Z.ai nota que las tuberías aún requieren un trabajo significativo de humano en el bucle.

Los resultados informados siguen el patrón que predeciría esa receta: las ganancias más grandes se encuentran en las evaluaciones de horizonte más largo. En Terminal-Bench 3.0, GLM-5.3 pasa de 4.6 a 28.3 frente a GLM-5.2; en DeepSWE v1.1, de 46.2 a 66.9; en la variante CLI del examen final de los agentes, de 23.8 a 28.5. Todas las cifras son informadas por el proveedor, con notas a pie de página en el anuncio que cubren la configuración de la arnes, la longitud del contexto y la configuración de muestreo para cada benchmark.

Frente a otros modelos, la imagen es mixta. En el banco de pruebas de código de Z.ai, la empresa informa una mejora del 50% sobre GLM-5.2 y dice que el modelo supera a Claude Opus 4.8 con un esfuerzo comparable mientras consume menos tokens de salida (31.4% a aproximadamente 50,000 tokens de salida por tarea en comparación con 29.5% a 120,000) mientras permanece detrás de Claude Fable 5 de Anthropic, que alcanza 39.5% con un esfuerzo máximo. En suites públicas, GLM-5.3 sigue detrás de GPT-5.6 Sol y Fable 5 en varias evaluaciones de codificación más difíciles, incluyendo Terminal-Bench 3.0 y DeepSWE. Como un benchmark privado, la empresa argumenta que el banco de pruebas de código de Z.ai reduce el riesgo de contaminación de conjuntos de prueba públicos.

El resultado cibernético que Z.ai dice que no planeó

El segundo titular es el que Z.ai mismo señala como inesperado. La empresa introdujo datos de descubrimiento de vulnerabilidades y entornos en el post-entrenamiento, esperando que el modelo mejorara para encontrar y razonar sobre fallos individuales. En cambio, dice, la capacidad continuó compounding a medida que se escaló el entrenamiento, y el modelo comenzó a razonar a través de múltiples etapas de explotación, formando planes coherentes para cadenas de explotación completas en lugar de encontrar errores aislados.

Los números informados siguen esa afirmación. En CyberGym, que prueba si un modelo puede identificar y validar vulnerabilidades desde el código fuente de white-box, GLM-5.3 obtiene una puntuación del 84.5%, por encima del 77.2% de GLM-5.2 y por delante de todos los modelos en el conjunto de comparación de Z.ai. En ExploitBench, que exige un razonamiento más profundo sobre vulnerabilidades reales y su explotación, más que duplica a su predecesor, 54.4% a 24.4%. En ExploitGym, que cuenta las tareas de explotación completadas dentro de presupuestos normalizados en el tiempo, completa 105 tareas dentro de dos horas y 130 dentro de seis, en comparación con 29 y 39 para GLM-5.2. El resumen de Z.ai del patrón es directo: cuanto más arriba en la cadena de explotación se encuentre un benchmark, mayor es la ganancia desde GLM-5.2 y más ancho es el hueco restante a los modelos de frontera cerrada, con Mythos 5 completando 181 y 247 tareas de ExploitGym en los mismos presupuestos.

Z.ai también informa que ha probado la transferencia más allá de benchmarks controlados. Trabajando con varios equipos de seguridad en China, la empresa dice que sus modelos han identificado 2,436 vulnerabilidades en 269 proyectos de código abierto desde GLM-5.2, incluyendo 1,097 calificadas como críticas o de gravedad alta, que abarcan kernels de sistema, sistemas operativos, motores de navegador y protocolos de red. Muchas habían pasado desapercibidas durante años; la más antigua, dice la empresa, se introdujo en 1981.

Los hallazgos alimentan un Libro de registro de divulgación de seguridad de Z.ai, que rastrea cada problema a través del proceso de divulgación: 53 divulgados públicamente con CVEs asignados en el lanzamiento, 2,383 aún bajo embargo. Las entradas recientes incluyen un uso después de la liberación en el kernel de Linux, un error de manejo de memoria de WebKit que afecta a Apple Safari y un error de validación de parámetros en FreeBSD.

Para la API, GLM-5.3 admite tres niveles de esfuerzo de pensamiento (bajo, alto y máximo) y ya no permite deshabilitar el pensamiento, un cambio de ruptura para las aplicaciones que anteriormente se ejecutaban con el pensamiento desactivado.

Lo que el lanzamiento de pesos abiertos deja abierto

El intervalo de dos semanas entre el anuncio y el lanzamiento de pesos está haciendo un trabajo en este lanzamiento. Z.ai vincula explícitamente la demora a la evaluación de seguridad y el endurecimiento, y lo que se está endureciendo es un modelo que la empresa misma describe como haber desarrollado una capacidad de seguridad ofensiva más rápido de lo esperado, con sus ganancias más grandes en el extremo de explotación de la cadena. Z.ai dice que los pesos estarán disponibles para su descarga por cualquier persona después del período de evaluación de seguridad y endurecimiento de dos semanas.

Los resultados cibernéticos también llegan en una semana en que los laboratorios de frontera están demostrando públicamente lo que los modelos agenciales pueden hacer a la infraestructura: OpenAI describió recientemente cómo sus propios modelos de prueba violaron Hugging Face en un ejercicio de equipo rojo. El libro de registro de divulgación de Z.ai es el contraparte constructiva de esa capacidad: la misma habilidad que encadena explotaciones también saca a la luz errores de décadas para su parcheo, y 1,097 hallazgos críticos y de gravedad alta ahora se están moviendo a través de una divulgación coordinada.

Si los evaluadores independientes replican los números de GLM-5.3 (particularmente los resultados del banco de pruebas de código de Z.ai y las puntuaciones cibernéticas que Z.ai ejecutó en sus propias configuraciones de arnés) determinará cuánto de este lanzamiento es un paso genuino para los modelos de codificación de pesos abiertos y cuánto es una elección de evaluación. El lanzamiento de pesos, que se espera que ocurra a fines de agosto de 2026, es cuando comienza esa prueba.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.