Modèles et plateformes d’IA

GLM-5.3 obtient 60 sur l’Artificial Analysis Intelligence Index, égalant le Kimi K3

mm
Ajouter Unite.AI à vos sources préférées sur Google

Le GLM-5.3 de Z.ai a été évalué par Artificial Analysis à 60 sur son Intelligence Index, a indiqué l’évaluateur indépendant le 18 août 2026, plaçant le tout nouveau modèle de raisonnement du laboratoire chinois au même niveau que le Kimi K3 de Moonshot AI et à trois points du Claude Opus 5 d’Anthropic, leader actuel avec 63.

Le score concerne le GLM-5.3 fonctionnant à son effort de raisonnement maximal, le paramètre que Z.ai recommande pour le travail de codage. Avec 60, il se situe bien au-dessus de la médiane de 35 des 181 modèles de sa catégorie de comparaison, et se classe huitième dans l’ensemble de la catégorie.

Ce résultat constitue la première lecture indépendante d’un modèle que Z.ai a publié le 14 août 2026 avec une construction inhabituelle : le GLM-5.3 utilise le même modèle de base que le GLM-5.2, chaque gain de capacité provenant d’un post‑entraînement plutôt que d’une nouvelle phase de pré‑entraînement.

Comment GLM-5.3 en est arrivé là

Le communiqué de sortie de Z.ai décrit un mois d’extension de l’apprentissage par renforcement sur des environnements de tâches à long terme: plus d’environnements, plus de tâches diversifiées, davantage de calcul, le tout sur la pile d’entraînement que le laboratoire a construite pour le GLM-5.2. L’entreprise a indiqué que cette approche a fait passer Terminal‑Bench 3.0 de 4,6 à 28,3 et DeepSWE v1.1 de 46,2 à 66,9, et son propre article documente une série de résultats dans le codage, la cybersécurité et les benchmarks agentiques face à Kimi K3, Claude Opus 4.8, Claude Fable 5 et GPT‑5.6 Sol. Unite.AI a couvert le lancement et ses résultats émergents en cybersécurité en détail lorsque le modèle a été déployé la semaine dernière.

Le chiffre d’Artificial Analysis a un poids différent de ceux des tableaux fournis par les éditeurs, car l’évaluateur exécute lui‑même sa suite. Son Intelligence Index v4.1.1 agrège neuf évaluations couvrant des tâches de travail réelles agentiques, l’utilisation d’outils agentiques, le codage terminal, le raisonnement scientifique et les connaissances, les questions scientifiques de niveau master, le raisonnement en physique, la fiabilité des connaissances et les hallucinations, ainsi que le raisonnement sur de longs contextes. Le 60 du GLM-5.3 est le résultat composite de son exécution sur cet ensemble, à un coût total d’évaluation de $1,238.50 sur l’API de Z.ai.

Où le GLM-5.3 se situe sur le classement

L’égalité avec le Kimi K3 constitue le point principal de la comparaison. Kimi K3, publié le 16 juillet 2026, obtient le même score de 60 sur l’index et reste le modèle à poids ouverts le mieux classé dans le classement d’Artificial Analysis, une position que le GLM-5.3 partage désormais en termes de score, bien que pas en licence. Moonshot a ouvert les poids du Kimi K3 sous une licence à paliers de revenus en juillet 2026 ; le GLM-5.3 est pour l’instant répertorié comme propriétaire, Artificial Analysis indiquant 753 billion parameters pour le modèle.

Claude Opus 5, publié le 24 juillet 2026, reste en tête de l’index avec 63. L’écart de trois points entre le GLM-5.3 et le leader représente la distance qu’un cycle de post‑entraînement rapide n’a pas comblée, face à une frontière qui a elle‑même évolué depuis le printemps.

Le prix est le point où les deux modèles à 60 points divergent fortement. Le GLM-5.3 coûte $1.40 par million de jetons d’entrée et $4.40 par million de jetons de sortie sur l’API de Z.ai, contre $3.00 et $15.00 pour le Kimi K3 sur celle de Moonshot. Par tâche de l’Intelligence Index, cela représente $0.68 pour le GLM-5.3 contre $0.84 pour le Kimi K3 et $2.34 pour le Claude Opus 5. Le GLM-5.3 atteint son score au coût par tâche le plus bas des trois, bien qu’il soit également le plus verbeux du groupe, générant 170 million output tokens across the evaluation suite against a 72 million median in its class.

Ce qui arrive ensuite

Le GLM-5.3 est disponible via l’API de Z.ai et a été déployé auprès de tous les abonnés du GLM Coding Plan. Le modèle nécessite l’activation de la fonction « thinking », avec trois niveaux d’effort, et Z.ai avertit que les applications qui l’appellent encore avec le « thinking » désactivé échoueront jusqu’à ce qu’elles soient migrées.

Les poids constituent la pièce manquante. Z.ai s’est engagé à les publier deux semaines après le lancement du 14 août 2026, une fois l’évaluation de sécurité et le renforcement terminés, ce qui placerait le GLM-5.3 aux côtés du Kimi K3 comme option à poids ouverts au niveau 60 de l’index, à environ la moitié du prix par jeton.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.