Modelos y plataformas de IA

GLM-5.3 alcanza 60 en el Índice de Inteligencia de Artificial Analysis, igualando a Kimi K3

mm
Añade Unite.AI a tus fuentes preferidas en Google

El GLM-5.3 de Z.ai ha sido evaluado por Artificial Analysis con 60 en su Índice de Inteligencia, según informó el evaluador independiente el 18 de agosto de 2026, situando al modelo de razonamiento más reciente del laboratorio chino al mismo nivel que Kimi K3 de Moonshot AI y a tres puntos por debajo de Claude Opus 5 de Anthropic, el líder actual con 63.

La puntuación corresponde al GLM-5.3 funcionando con su máximo esfuerzo de razonamiento, la configuración que Z.ai recomienda para trabajos de codificación. Con 60, se sitúa muy por encima de la mediana de 35 de los 181 modelos de su clase de comparación, y ocupa el octavo puesto en la clase en general.

El resultado es la primera lectura independiente sobre un modelo que Z.ai lanzó el 14 de agosto de 2026 con una construcción inusual: GLM-5.3 utiliza el mismo modelo base que GLM-5.2, y todas las mejoras de capacidad provienen de un post‑entrenamiento en lugar de una nueva fase de preentrenamiento.

Cómo llegó GLM-5.3

La publicación de lanzamiento de Z.ai describe un mes de escalado del aprendizaje por refuerzo en entornos de tareas de largo horizonte: más entornos, tareas más diversas, mayor capacidad de cómputo, todo sobre la pila de entrenamiento que el laboratorio construyó para GLM-5.2. La compañía informó que este enfoque elevó Terminal‑Bench 3.0 de 4.6 a 28.3 y DeepSWE v1.1 de 46.2 a 66.9, y su propia publicación documenta una variedad de resultados en codificación, ciberseguridad y benchmarks de agentes frente a Kimi K3, Claude Opus 4.8, Claude Fable 5 y GPT‑5.6 Sol. Unite.AI cubrió el lanzamiento y sus resultados emergentes en ciberseguridad en detalle cuando el modelo se envió la semana pasada.

El número de Artificial Analysis tiene un peso diferente al de esas tablas reportadas por los proveedores, porque el evaluador ejecuta su propia suite. Su Índice de Inteligencia v4.1.1 agrupa nueve evaluaciones que abarcan tareas de trabajo real con agentes, uso de herramientas de agentes, codificación terminal, razonamiento y conocimiento científico, preguntas de ciencia a nivel de posgrado, razonamiento físico, fiabilidad del conocimiento y alucinaciones, y razonamiento de contexto largo. Los 60 de GLM-5.3 son el compuesto de su ejecución en esa batería, con un costo total de evaluación de $1,238.50 en la API de Z.ai.

Dónde se sitúa GLM-5.3 en la tabla de clasificación

La paridad con Kimi K3 es la comparación principal. Kimi K3, lanzado el 16 de julio de 2026, obtiene la misma puntuación de 60 en el índice y sigue siendo el modelo de pesos abiertos mejor puntuado en las clasificaciones de Artificial Analysis, una posición que GLM-5.3 ahora comparte en puntuación, aunque no en licencia. Moonshot abrió los pesos de Kimi K3 bajo una licencia escalonada por ingresos en julio de 2026; GLM-5.3 se lista como propietario por ahora, con Artificial Analysis registrando 753 mil millones de parámetros para el modelo.

Claude Opus 5, lanzado el 24 de julio de 2026, sigue liderando el índice con 63. La diferencia de tres puntos entre GLM-5.3 y el líder es la distancia que un ciclo rápido de post‑entrenamiento no logró cerrar, frente a una frontera que ha avanzado desde la primavera.

El precio es donde los dos modelos con 60 puntos divergen marcadamente. GLM-5.3 cuesta $1.40 por millón de tokens de entrada y $4.40 por millón de tokens de salida en la API de Z.ai, frente a $3.00 y $15.00 para Kimi K3 en la de Moonshot. Por tarea del Índice de Inteligencia, eso equivale a $0.68 para GLM-5.3 frente a $0.84 para Kimi K3 y $2.34 para Claude Opus 5. GLM-5.3 alcanza su puntuación con el costo por tarea más bajo de los tres, aunque también es el más verboso del grupo, generando 170 millones de tokens de salida en la suite de evaluación frente a una mediana de 72 millones en su clase.

Qué se lanzará a continuación

GLM-5.3 está disponible a través de la API de Z.ai y se ha desplegado a todos los suscriptores del GLM Coding Plan. El modelo requiere que el modo de razonamiento (thinking) esté habilitado, con tres niveles de esfuerzo, y Z.ai advierte que las aplicaciones que lo llamen con el razonamiento desactivado fallarán hasta que se migren.

Los pesos son la pieza restante. Z.ai se ha comprometido a publicarlos dos semanas después del lanzamiento del 14 de agosto de 2026, una vez completadas la evaluación de seguridad y el endurecimiento, lo que situaría a GLM-5.3 junto a Kimi K3 como una opción de pesos abiertos en la marca de 60 del índice, a aproximadamente la mitad del precio por token.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.