KI-Modelle und Plattformen

GLM-5.3 erzielt 60 im Artificial Analysis Intelligence Index und erreicht damit das Niveau von Kimi K3

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Der GLM-5.3 von Z.ai wurde von Artificial Analysis bewertet mit 60 im Intelligence Index, wie der unabhängige Evaluator am 18. August 2026 berichtete. Damit liegt das neueste Reasoning‑Modell des chinesischen Labors auf demselben Niveau wie Kimi K3 von Moonshot AI und drei Punkte hinter Claude Opus 5 von Anthropic, dem derzeitigen Spitzenreiter mit 63.

Der Wert bezieht sich auf den GLM-5.3, der mit maximalem Reasoning‑Aufwand läuft, der von Z.ai für Coding‑Arbeiten empfohlen wird. Mit 60 liegt er deutlich über dem Median von 35 der 181 Modelle seiner Vergleichsklasse und belegt den achten Platz in der Gesamtkategorie.

Das Ergebnis ist die erste unabhängige Bewertung eines Modells, das Z.ai am 14. August 2026 veröffentlicht hat und eine ungewöhnliche Architektur aufweist: GLM-5.3 nutzt dasselbe Basismodell wie GLM-5.2, wobei sämtliche Leistungssteigerungen durch Post‑Training und nicht durch einen neuen Pre‑Training‑Durchlauf erzielt werden.

Wie GLM-5.3 hierher kam

Der Release‑Beitrag von Z.ai beschreibt einen Monat der Skalierung von Reinforcement Learning in Langzeit‑Aufgaben‑Umgebungen: mehr Umgebungen, vielfältigere Aufgaben, mehr Rechenleistung, alles auf dem Trainings‑Stack, den das Labor für GLM-5.2 aufgebaut hat. Das Unternehmen berichtete, dass dieser Ansatz Terminal‑Bench 3.0 von 4,6 auf 28,3 und DeepSWE v1.1 von 46,2 auf 66,9 brachte, und sein eigener Beitrag dokumentiert ein breites Spektrum an Ergebnissen in den Bereichen Coding, Cybersicherheit und agentische Benchmarks im Vergleich zu Kimi K3, Claude Opus 4.8, Claude Fable 5 und GPT‑5.6 Sol. Unite.AI behandelte den Launch und die daraus resultierenden neu auftretenden Cybersicherheits‑Ergebnisse ausführlich, als das Modell letzte Woche ausgeliefert wurde.

Die Zahl von Artificial Analysis hat ein anderes Gewicht als die von Anbietern gemeldeten Tabellen, da der Evaluator die Suite selbst ausführt. Der Intelligence Index v4.1.1 fasst neun Bewertungen zusammen, die agentische Aufgaben aus der realen Arbeitswelt, den Einsatz agentischer Werkzeuge, Terminal‑Coding, wissenschaftliches Denken und Wissen, Fragen auf Graduate‑Level‑Wissenschaft, physikalisches Schließen, Zuverlässigkeit des Wissens und Halluzinationen sowie Lang‑Kontext‑Reasoning abdecken. Die 60 von GLM‑5.3 ist das Ergebnis dieser gesamten Testreihe, bei Gesamtkosten von 1.238,50 $ über die API von Z.ai.

Wo GLM-5.3 in der Rangliste steht

Die Parität mit Kimi K3 ist der zentrale Vergleich. Kimi K3, veröffentlicht am 16. Juli 2026, erzielt ebenfalls 60 im Index und bleibt das am besten bewertete Open‑Weights‑Modell in den Rankings von Artificial Analysis – eine Position, die GLM‑5.3 nun im Ergebnis, wenn nicht in der Lizenz, teilt. Moonshot hat im Juli 2026 die Gewichte von Kimi K3 unter einer umsatzgestuften Lizenz freigegeben; GLM‑5.3 wird derzeit als proprietär gelistet, wobei Artificial Analysis 753 Milliarden Parameter für das Modell verzeichnet.

Claude Opus 5, veröffentlicht am 24. Juli 2026, führt den Index weiterhin mit 63 an. Die dreipunktige Lücke zwischen GLM‑5.3 und dem Spitzenreiter ist die Distanz, die ein schneller Post‑Training‑Zyklus nicht schließen konnte, angesichts einer Front, die sich seit dem Frühjahr selbst weiterentwickelt hat.

Der Preis ist der Punkt, an dem die beiden 60‑Punkte‑Modelle stark divergieren. GLM‑5.3 kostet 1,40 $ pro Million Eingabetoken und 4,40 $ pro Million Ausgabetoken über die API von Z.ai, gegenüber 3,00 $ bzw. 15,00 $ für Kimi K3 bei Moonshot. Pro Intelligence‑Index‑Aufgabe entspricht das 0,68 $ für GLM‑5.3 gegenüber 0,84 $ für Kimi K3 und 2,34 $ für Claude Opus 5. GLM‑5.3 erreicht seine Punktzahl bei den geringsten Kosten pro Aufgabe der drei Modelle, obwohl es zugleich das wortreichste der Gruppe ist und 170 Millionen Ausgabetoken im Bewertungspaket erzeugt, verglichen mit einem Median von 72 Millionen in seiner Klasse.

Was als Nächstes kommt

GLM‑5.3 ist über die API von Z.ai verfügbar und wurde an alle Abonnenten des GLM Coding Plan ausgerollt. Das Modell erfordert aktiviertes „Thinking“, das in drei Aufwand‑Stufen angeboten wird, und Z.ai warnt, dass Anwendungen, die es weiterhin mit deaktiviertem Thinking aufrufen, bis zur Migration fehlschlagen werden.

Die Gewichte sind das noch fehlende Element. Z.ai hat sich verpflichtet, sie zwei Wochen nach dem Launch am 14. August 2026 zu veröffentlichen, sobald die Sicherheitsbewertung und das Hardening abgeschlossen sind. Damit würde GLM‑5.3 neben Kimi K3 als Open‑Weights‑Option die 60‑Marke im Index erreichen, zu etwa der Hälfte des Preises pro Token.

Jonas Reeve ist ein künstlich intelligenter Analyst bei Unite.AI, der sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) und die theoretischen Grundlagen der Maschinenintelligenz konzentriert. Seine Arbeit erforscht, wie Lernen, Argumentation, Gedächtnis und Abstraktion in biologischen und künstlichen Systemen entstehen, und zieht Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitivwissenschaft und Philosophie des Geistes.
Mit einem konzeptionellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Argumentationsmodelle, agentische Systeme, emergente Kognition und Ausrichtungstheorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten - und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er erste Prinzipien, konzeptionelle Strenge und die Grenzen der aktuellen Modelle.
Artikel, die von Jonas Reeve verfasst werden, sind künstlich intelligenter generiert und von Unite.AIs Redaktionsteam überprüft, um Genauigkeit, Klarheit und verantwortungsvolle Diskussion über fortgeschrittene KI-Konzepte zu gewährleisten.