KI-Modelle und Plattformen
Cerebras betreibt OpenAIs GPT-5.6 Sol mit 750 Token pro Sekunde im neuen Ultrafast‑Tier

Cerebras (CBRS ) betreibt jetzt das Flaggschiff‑Modell von OpenAI mit einer Geschwindigkeit, die keine GPU‑Cloud öffentlich erreicht hat. Am 13. August 2026 hat der Wafer‑Scale‑Chip‑Hersteller bekanntgegeben, dass er GPT‑5.6 Sol auf einem neuen OpenAI‑Dienst‑Tier namens Ultrafast betreibt, das bis zu 750 Ausgabetoken pro Sekunde liefert und nach Angaben von OpenAI das Modell bis zu 14 × schneller als die Standard‑Verarbeitung ausführt. Ultrafast wird zunächst in der OpenAI‑API als begrenzte Vorschau für eine ausgewählte Kundengruppe gestartet, wobei der Zugriff mit wachsender Kapazität erweitert wird.
Die zentrale Behauptung ist eine konkrete: Spitzentechnologie ohne Geschwindigkeitsnachteil. GPT‑5.6 Sol ist das leistungsfähigste Modell von OpenAI, und auf Cerebras‑Silizium erzeugt es Token so schnell, dass es in Echtzeit‑Produkten eingesetzt werden kann, anstatt hinter einem nächtlichen Batch‑Job zu stehen. Beide Unternehmen präsentieren das Tier als Aufhebung des Kompromisses zwischen einem Modell, das intelligent genug für hochriskante Aufgaben ist, und einem Modell, das schnell genug ist, um es zu nutzen, während die Arbeit noch läuft.
Die Geschwindigkeitszahlen hinter Ultrafast
Die Angabe von 750 Ausgabetoken pro Sekunde ist die Schlagzeile, aber die aufschlussreicheren Vergleiche sind die von Cerebras veröffentlichten Direktvergleiche. Im Vergleich zu den von Artificial Analysis gemeldeten Ausgabegeschwindigkeiten sagt das Unternehmen, dass GPT‑5.6 Sol auf Ultrafast 11 × schneller als Claude Fable 5 und 5 × schneller als Opus 4.8 im Fast‑Modus läuft.
Cerebras hat das Tier außerdem einem kompletten Durchlauf des „Humanity’s Last Exam“ unterzogen, einem Benchmark mit 2.500 Fragen auf Doktoratsniveau. GPT‑5.6 Sol auf Ultrafast beantwortete alle 2.500 Fragen in 11 Stunden und 11 Minuten; Claude Fable 5 benötigte 78 Stunden und 27 Minuten, um vergleichbare Ergebnisse zu erzielen – fast 7 × langsamer, so Cerebras. Beim GDP‑Val, einem Benchmark für wirtschaftlich wertvolle Wissensarbeit, berichtet das Unternehmen von einer 5,6‑fachen End‑zu‑Ende‑Geschwindigkeitssteigerung gegenüber der Standard‑Verarbeitung ohne Qualitätsverlust.
Dies sind von Anbietern durchgeführte Bewertungen, und Cerebras macht das ausdrücklich klar: Der Vergleich mit dem Humanity’s Last Exam wurde von Cerebras am 10. Juli sowie vom 13.‑15. Juli 2026 benchmarked, und die GDP‑Val‑Zahl stammt aus eigenen Tests vom 31. Juli 2026. Betrachten Sie sie als firmeneigene Messungen, nicht als unabhängige Ergebnisse.
Warum der Wafer‑Scale‑Chip bei der Latenz gewinnt
Der Mechanismus ist hier entscheidend, weil er erklärt, warum ein relativ kleiner Chip‑Hersteller das größte Modell von OpenAI mit Geschwindigkeiten bereitstellt, die die GPU‑Konkurrenten nicht erreicht haben. Schnelle Inferenz bei einem großen Modell ist im Wesentlichen ein Problem der Datenbewegung: Auf GPUs müssen Modellgewichte wiederholt zwischen On‑Chip‑Speicher und Off‑Chip‑Speicher hin- und hergeschoben werden, um jedes nachfolgende Token zu erzeugen, und die Speicherbandbreite wird zum Engpass.
Cerebras‘ Antwort besteht darin, diese Bewegung zu eliminieren. Seine Wafer‑Scale‑Engine integriert 44 GB SRAM auf einem einzigen wafer‑großen Chip, sodass die Modellgewichte on‑chip bleiben und Tokens durch Schichten fließen, die über Wafer hinweg pipeline‑artig ohne Unterbrechung verarbeitet werden. Da die Gewichte das Silizium nie verlassen, skaliert der Ansatz mit der Modellgröße – das ist das Argument des Unternehmens, dass der Geschwindigkeitsvorteil auch bei wachsenden Spitzmodellen erhalten bleibt. Für die Wirtschaftlichkeit der Inferenz ist das das entscheidende Element: Die Kosten und die Latenz beim Bereitstellen eines Modells werden davon bestimmt, wie schnell man Gewichte an die Rechen‑Einheit liefern kann, und das Vorhalten von 44 GB auf einem einzigen Chip greift dieses Problem direkt an.
Eine 10‑Milliarden‑Dollar‑Partnerschaft erreicht das Flaggschiff
Ultrafast ist das bislang sichtbarste Produkt einer Beziehung, die sich über Monate aufgebaut hat. OpenAI hat Cerebras Anfang 2026 für 10 Milliarden Dollar für Low‑Latency‑Rechnen engagiert, und dieser Start stellt diese Kapazität hinter das Spitzenmodell des Unternehmens, nicht hinter ein kleineres oder spezialisiertes Modell. OpenAI beschreibt Ultrafast als „den nächsten Schritt“ in der Partnerschaft, um Ultra‑Low‑Latency‑Inference auf seine Plattform zu bringen.
Für Cerebras ist diese Platzierung bedeutend. Das Startup argumentiert seit langem, dass seine Wafer‑Scale‑Architektur die richtige Form für Inferenz ist, selbst wenn das Marktgewicht bei GPU‑Anbietern liegt – ein Wettstreit, der sich im Beschleuniger‑Geschäft abspielt, während etablierte Unternehmen dazu übergehen, Modelle direkt in ihr Silizium zu integrieren. Die Bereitstellung der Serving‑Schicht für das Flaggschiff von OpenAI verschafft Cerebras ein Produktions‑Referenzkonto an der Marktspitze. Das Modell selbst verankert die von OpenAI gestartete GPT‑5.6‑Familie (Sol als Flaggschiff, neben dem ausgewogenen Terra und dem kosteneffizienten Luna), sodass Ultrafast Cerebras an die Spitze dieser Reihe stellt.
Wer bekommt es und wofür es gedacht ist
OpenAI positioniert das Tier für zeitkritische, hochriskante Aufgaben: Incident‑Response, während ein Ausfall noch andauert, Finanzforschung, während sich Marktbedingungen ändern, Echtzeit‑Kundensupport und Sprachdienste, Handel sowie Live‑Forschungs‑Loops, die früher über Nacht liefen. Der frühe Zugang ging an Unternehmen aus den Bereichen Programmierung, Handel und Finanzen, darunter Jane Street, Podium, Basis und Rogo.
„Die von Cerebras erzielte Geschwindigkeitssteigerung ist beeindruckend“, sagte John Crepezzi, AI Assistants bei Jane Street, in OpenAIs Ankündigung. „Sie ermöglicht verschiedene Nutzungsmöglichkeiten der Modelle und macht es für Entwickler praktisch, zusammen mit ihnen fokussierter und produktiver zu arbeiten.“
OpenAI hält die Einführung bewusst eng. Das Unternehmen sagt, dass es die Vorschauphase nutzt, um zu erfahren, wo eine um Größenordnungen schnellere Leistung den größten Mehrwert schafft, und den Zugang ausweiten wird, wenn die Kapazität wächst. Sowohl OpenAI als auch Cerebras nehmen Anmeldungen für Updates entgegen, während die Vorschau größer wird.
Was als Nächstes passiert
Kurzfristig ist die Kapazität das Beobachtbare, nicht die Leistungsfähigkeit. Ultrafast ist eine begrenzte Vorschau, und beide Unternehmen koppeln eine breitere Verfügbarkeit an das Wachstum der Kapazität statt an ein festes Datum – das Tempo der Expansion ist also zu beobachten. Die längerfristige Frage ist, ob Cerebras‘ On‑Chip‑Speicher‑Vorteil auch bei wachsender Größe von OpenAIs Modellen Bestand hat, was genau die Wette ist, auf der die Wafer‑Scale‑Architektur beruht.












