KI-Modelle und Plattformen

Benchmark-Unternehmen gibt Mistral Large 4 Preview einen Intelligenz‑Score von 38

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Artificial Analysis veröffentlichte seine Benchmark‑Analyse von Mistral Large 4 Preview am 6. Oktober 2026, bewertete das Modell mit 38 in seinem Intelligence Index und bezeichnet es als das intelligenteste KI‑Modell außerhalb der USA und China.

Ergebnisse des Intelligence Index

Die Analyse berichtet, dass Mistral Large 4 Preview in der Artificial Analysis Intelligence Index‑Version 4.3.2 einen Wert von 38 erzielt, ein Ergebnis, das das Benchmark‑Unternehmen als vergleichbar mit GPT‑6 Luna (max) mit 38 und DeepSeek V4.1 Flash (max) mit 39 bezeichnet. In dieser Einordnung hat Frankreich wieder das intelligenteste Modell außerhalb der USA und China, vor Ländern wie Südkorea und den Vereinigten Arabischen Emiraten.

Auf der Modellseite für die Vorschau von Artificial Analysis rangiert dieser Wert das Modell auf Platz 64 von 225 Modellen in seiner Vergleichsklasse, über dem Klassendurchschnitt von 26. Die Seite listet die Vorschau als ein Reasoning‑Modell, das am 6. Oktober 2026 veröffentlicht wurde, mit Text‑ und Bildeingabe, Textausgabe und Service über zwei API‑Anbieter.

Laut der veröffentlichten Intelligence Index-Methodik kombiniert Version 4.3.2 zehn Bewertungen — AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA‑Omniscience und AA‑LCR v1.1 — zu einem gewichteten Durchschnitt über vier Kategorien: Agenten mit 30 %, Codierung mit 20 %, wissenschaftliches Schließen mit 20 % und allgemein mit 30 %. Artificial Analysis schätzt ein 95‑%‑Konfidenzintervall von weniger als ±1 % für den Index und beschreibt die Suite als hauptsächlich textbasiert und englischsprachig, wobei Bild‑, Sprach‑ und mehrsprachige Leistungen separat benchmarked werden.

Ergebnisse des Cyber Index

Im Artificial Analysis Cyber Index erzielt die Vorschau 50 Punkte, gleichauf mit GLM‑5.3‑Flash bei 50 und hinter MiMo‑V2.6‑Pro bei 56, während sie vor Modellen wie Kimi K3 und DeepSeek V4.1 Flash (max) liegt. Artificial Analysis gibt an, dass das Modell, sobald seine Gewichte veröffentlicht werden, zu den drei besten Open‑Weight‑Modellen im Cyber Index gehören wird.

Das stärkste einzelne Cyber‑Ergebnis des Modells erreichte es bei CyberGym‑E2E‑AA, wo es 82 % erzielt, vor MiMo‑V2.6‑Pro mit 79 % und GPT‑6 Luna (max) mit 78 %, laut der Analyse.

Kosten, Geschwindigkeit und Token‑Verbrauch

Die Analyse schätzt die Kosten für die Ausführung des Intelligence Index auf Mistral Large 4 Preview auf 1,13 $ pro Aufgabe, basierend auf einem Standardpreis von 1,36 $ pro 1 M Eingabetoken und 4,18 $ pro 1 M Ausgabetoken, bei zwischengespeicherten Eingaben zu 0,14 $ pro 1 M Token. Für die ersten zwei Wochen gilt ein Startnachlass von 50 %, der die Token‑Preise auf 0,68 $ bzw. 2,09 $ senkt und die Kosten pro Aufgabe auf 0,57 $ reduziert – immer noch über GLM‑5.3‑Flash bei 0,25 $ und DeepSeek V4.1 Flash (max) bei 0,27 $. Artificial Analysis charakterisiert die Vorschau als mehr als viermal so teuer pro Aufgabe im Vergleich zu Modellen mit ähnlicher Intelligenz und offenen Gewichten.

Die Modellseite verzeichnet, dass die Vorschau im Verlauf des Intelligence Index 200 M Ausgabetoken erzeugt hat, gegenüber einem Klassendurchschnitt von 81 M. Gemessen über Mistrals API wird eine Ausgabegeschwindigkeit von 116,1 Token pro Sekunde gegenüber einem Median von 86,1 sowie eine Zeit bis zum ersten Token von 1,46 Sekunden gegenüber einem Median von 3,81 Sekunden angegeben.

Dokumenten‑Schlussfolgerung und Modelldetails

Bei GDP.pdf, einer professionellen Dokument‑Reasoning‑Bewertung, erzielt Mistral Large 4 Preview 19 %, gleichauf mit MiMo‑V2.6‑Pro bei 19 % und hinter Kimi K3 bei 22 %. Artificial Analysis beschreibt das Ergebnis als eine Verbesserung um 18 Punkte gegenüber Mistral Large 3, zum Teil bedingt durch eine API‑Änderung, die nun 100 Bilder pro Anfrage akzeptiert, gegenüber acht bei früheren Mistral‑Modellen.

Die Analyse gibt ein Kontextfenster von 512 k Token und ein Modell mit 1 Billion Parametern und 49 Milliarden aktiven Parametern an. Die Verfügbarkeit ist auf eine Research Public Preview über Mistrals API beschränkt, offene Gewichte sind für Ende Oktober 2026 geplant; die Modellseite klassifiziert die Vorschau derzeit als proprietär, da die Gewichte noch nicht öffentlich verfügbar sind.

Der Start von Mistral Large 4

Mistral startete die öffentliche Vorschau von Mistral Large 4, mit dem Spitznamen Le Chonk, am 6. Oktober 2026 und beschreibt ein nativ multimodales Modell, das von Grund auf auf 3.800 NVIDIA Grace Blackwell GPUs in den firmeneigenen Rechenzentren in Europa trainiert wurde, wobei die Trainingsdaten mehr als 160 Sprachen umfassen, einschließlich aller offiziellen EU‑Sprachen. Mistral behauptet, das Modell übertreffe jedes in den USA oder Europa entwickelte Open‑Weight‑Modell deutlich und kündigt an, die Gewichte bis Ende Oktober 2026 zu veröffentlichen, wobei das Reinforcement‑Learning‑Training hinter der Vorschau noch im Gange ist.

Jonas Reeve ist ein KI-generierter Rechercheagent bei Unite.AI und konzentriert sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) sowie die theoretischen Grundlagen der Maschinenintelligenz. Seine Arbeit untersucht, wie Lernen, Schließen, Gedächtnis und Abstraktion sowohl in biologischen als auch in künstlichen Systemen entstehen, und stellt Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitionswissenschaft und Philosophie des Geistes her.

Mit einem konzeptuellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Schließmodelle, agentische Systeme, emergente Kognition und Alignment-Theorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten – und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er Grundprinzipien, konzeptuelle Strenge und die Grenzen aktueller Modelle.

Von Jonas Reeve verfasste Artikel werden KI-generiert und vom Redaktionsteam von Unite.AI geprüft, um Genauigkeit, Klarheit und eine verantwortungsvolle Diskussion fortgeschrittener KI-Konzepte zu gewährleisten.