Vordenker
Open-Modelle werden immer besser. Die Wirtschaftlichkeit wird immer undurchsichtiger.

KI-Modelle sind offensichtlich besser als vor 18 Monaten. Aber als ich genauer hinsah, passten die üblichen Erklärungen für diesen Fortschritt nicht.
Sie verbesserten sich nicht nur, weil sie größer wurden. „Open Source gewinnt“ ist nur zur Hälfte richtig. Und der Rat, sich Benchmark‑Scores anzusehen, erwies sich als weitaus weniger nützlich, als ich erwartet hatte. Das hat eine Weile gedauert, bis ich es akzeptierte.
Also zog ich 18 Monate Daten von 46 Modellen aus acht Laboren heran. Ich wollte verstehen, ob Intelligenz zu einer Ware wird, ob Open‑Modelle die Spitze einholen und welche Kennzahlen Unternehmen berücksichtigen sollten, wenn sie die Systeme auswählen, auf denen sie aufbauen.
Die zentrale Erkenntnis war einfach: Ein Benchmark‑Score ist nicht wirklich eine Eigenschaft eines Modells. Er spiegelt das Modell, die zugehörige Software und den Kontext sowie die Menge an Zeit und Rechenleistung wider, die ihm zur Verfügung standen. Veröffentlicht man nur eine Zahl, versteckt man die beiden anderen.
Die Implikationen sind jedoch weitaus umfassender. Unternehmen vergleichen einzelne Modelle, obwohl sie das komplette System bewerten sollten, das die Arbeit erledigen muss.
Benchmarks verbergen das System
Als ich aufhörte, zusammengesetzte Scores zu betrachten, und Modelle testweise verglich, war die Lücke zwischen führenden Open‑Weight‑ und proprietären Modellen keineswegs eine einzelne Zahl.
Beim SWE-bench Verified, einem älteren Test, der in unzähligen Modellankündigungen vorkam, betrug die Lücke 0,2 Punkte. Beim SWE-bench Pro, einem neueren Test, der für realistische, mehrsprachige Softwarearbeit mit standardisiertem Setup konzipiert wurde, lag sie bei 18,2 Punkten.
Die scheinbare Modells‑Lücke hängt vom Benchmark ab
| Benchmark | Lücke | Status |
|---|---|---|
| SWE-bench Verified | 0.2 pts | Gesättigt, Kontamination gekennzeichnet |
| GPQA Diamond | 2.0 pts | Gesättigt, Obergrenze bei etwa 92–95 % |
| Terminal-Bench 2.1 | 4.9 pts | Live, agentisch |
| Humanity’s Last Exam | 9.8 pts | Live, Grenz‑Schlussfolgerung |
| SWE-bench Pro | 18.2 pts | Live, standardisiertes Gerüst |
Quelle: Jaspreet Singhs Analyse führender Open‑Weight‑ und proprietärer Modelle, Juli 2026.
Dasselbe Modell kann je nach Durchführendem des Tests unterschiedliche Scores erhalten. Kimi K3 erzielte 80,9 % bei Terminal-Bench 2.1 in einer unabhängigen Bewertung und 88,3 %, als sein Hersteller das Ergebnis meldete. Dieser Unterschied von 7,4 Punkten ist größer als die Open‑gegen‑Frontier‑Lücke bei drei der fünf von mir analysierten Benchmarks.
Ein Modell erhält Anweisungen über die umgebende Software, greift auf den bereitgestellten Kontext zurück, nutzt die verfügbaren Werkzeuge und arbeitet innerhalb eines vom Entwickler festgelegten Reasoning‑Budgets. Ändert man diese Bedingungen, ändert sich das Ergebnis entsprechend.
Öffentliche Benchmarks sind nützlich, um die Richtung des Fortschritts zu verstehen. Sie sind jedoch eine schlechte Grundlage, um zu entscheiden, was in Ihrem Unternehmen funktionieren wird.
Agentische Zuverlässigkeit ändert die Rechnung
Das wird wichtiger, wenn KI von der Beantwortung von Fragen zur Ausführung einer Aktionssequenz übergeht.
Betrachten Sie einen Arbeitsablauf mit 20 Schritten, bei dem die KI jeden Schritt zu 95 % korrekt ausführt. Das klingt zuverlässig. Über die gesamte Sequenz hinweg gelingt der Arbeitsablauf jedoch nur in 36 % der Fälle.
Ein besseres Modell kann die Erfolgswahrscheinlichkeit bei jedem Schritt erhöhen, insbesondere bei schwieriger agentischer Arbeit. Es ist das umgebende Engineering, das bestimmt, ob ein falscher Schritt das Projekt ruiniert. Das Speichern des Fortschritts, die Verifizierung von Ausgaben, sicheres Wiederholen und die Wiederherstellung nach einem Fehlschlag trennen häufig eine überzeugende Demonstration von einem verlässlichen Produkt.
Die Modellauswahl bleibt wichtig. Aber das am besten bewertete Modell erzeugt nicht automatisch das zuverlässigste System.
Wählen Sie Modelle nach der Aufgabe
Die Daten stützen eine engere Schlussfolgerung, als sie typischerweise von beiden Seiten der Open‑gegen‑proprietär‑Debatte gezogen wird.
Open‑Weight‑Modelle sind wettbewerbsfähig bei klar definierten, kurzzeitigen Aufgaben, bei denen das Ergebnis direkt messbar ist. Klassifikation, Extraktion, Zusammenfassung und strukturierte Generierung fallen zunehmend in diese Kategorie.
Frontier‑Modelle rechtfertigen ihren Aufpreis weiterhin bei längeren agentischen Aufgaben, der Einhaltung von Anweisungen unter Druck und Arbeiten, bei denen ein Versagen nachträglich teuer zu erkennen ist. Dort zeigen neuere Benchmarks eine Lücke von etwa 18 Punkten statt null, und dort hat die vom Modellanbieter bereitgestellte Sicherheitsschicht Wert.
Unternehmen sollten Modelle nach Aufgabe auswählen, aber sie sollten nicht davon ausgehen, dass ein Wechsel kostenlos ist. Kontext, Argumentation und Prompt‑Caches lassen sich nicht sauber zwischen Anbietern übertragen. Ein günstigeres Modell kann teurer werden, wenn ein Systemwechsel die Arbeit neu starten lässt oder zusätzliche Ebenen von Engineering und Governance hinzufügt.
Die Modellauswahl wird immer weniger dauerhaft. Ein Wechsel bleibt dennoch eine architektonische Entscheidung.
Während Intelligenz günstiger wird, bleibt Urteilsvermögen teuer
Kompetente, allgemein einsetzbare Leistungsfähigkeit wird außerordentlich preiswert. Am oberen Ende der Kurve jedoch kostet jeder zusätzliche Leistungspunkt mehr als der vorherige. Die letzten neun Leistungspunkte kosten etwa das Zehnfache dessen, was alles darunter kostet.
Die meisten Unternehmen benötigen nicht das leistungsstärkste Modell für jede Anfrage. Sie müssen jedoch wissen, welche Arbeit es rechtfertigt.
Zusammenfassen, extrahieren, klassifizieren, entwerfen und übersetzen entwickeln sich zu einer Nutzen‑Fähigkeit. Was knapp bleibt, ist Urteilsvermögen: zu wissen, welche von fünf plausiblen Antworten korrekt ist, zu erkennen, dass die Frage falsch war, und zu entscheiden, wann man stoppt und einen Menschen hinzuzieht.
Urteilsvermögen entsteht aus proprietärem Kontext, Geschäftsregeln, Workflows, historischem Wissen und dem Engineering, das die Arbeit verifiziert und Fehler enthält.
Erstelle die Bewertung, die niemand sonst durchführen kann
Für ein Unternehmen ist der wertvollste Benchmark jener, der aus der eigenen Arbeit entsteht.
Erstelle ein privates Evaluationsset mit 50 bis 200 realen Aufgaben aus deinem Unternehmen. Halte das umgebende System konstant, führe die Tests wiederholt durch und bewerte, ob die Aufgabe korrekt erledigt wurde, anstatt wie poliert die Antwort klingt.
Wende dieselbe Disziplin auf die Kosten an. Kosten pro Token können irreführen, wenn ein Modell länger argumentiert, mehr Wiederholungen benötigt oder mehr Arbeit für einen menschlichen Prüfer erzeugt. Miss die Kosten pro akzeptiertem Ergebnis stattdessen.
Beginne mit einer kleinen Anzahl von Modellen. Leite die Arbeit zu Beginn einer Aufgabe, anstatt den Anbieter mitten im Prozess zu wechseln. Zähle die Sicherheits-, Governance‑ und Betriebsbelastung jedes zusätzlichen Anbieters zusammen mit dessen beworbenem Preis.
Der Markt wird weiterhin neue Benchmark‑Gewinner hervorbringen, und Unternehmen werden weiterhin versucht sein, ihre KI‑Strategie um jeden einzelnen herum neu zu gestalten. Ein besserer Ansatz ist, Modelle nach der Arbeit auszuwählen und dann das gesamte System unter den Bedingungen zu bewerten, in denen es funktionieren muss.
Der Benchmark, der deine Architektur steuern sollte, ist der, den nur dein Unternehmen ausführen kann.












