AI-modellen en platforms
Cerebras draait OpenAI’s GPT-5.6 Sol met 750 tokens per seconde in de nieuwe Ultrafast-tier

Cerebras (CBRS ) draait nu het vlaggenschipmodel van OpenAI met een snelheid die geen enkele GPU‑cloud openbaar heeft evenaarde. Op 13 augustus 2026 kondigde de wafer‑scale chipmaker aan dat ze GPT‑5.6 Sol aandrijft op een nieuwe OpenAI‑servicelaag genaamd Ultrafast, met een levering van tot wel 750 output‑tokens per seconde en, volgens OpenAI, tot 14 × sneller dan standaardverwerking. Ultrafast wordt eerst gelanceerd in de OpenAI‑API als een beperkte preview voor een selecte groep klanten, waarbij de toegang wordt uitgebreid naarmate de capaciteit groeit.
De centrale bewering is een specifieke: grensverleggende intelligentie zonder de snelheidsstraff. GPT‑5.6 Sol is OpenAI’s meest capabele model, en op Cerebras‑silicon genereert het tokens snel genoeg om in realtime‑producten te worden geïntegreerd in plaats van achter een nachtelijke batch‑taak te blijven hangen. Beide bedrijven presenteren de laag als het wegnemen van de afweging tussen een model dat slim genoeg is voor werk met hoge inzet en een model dat snel genoeg is om te gebruiken terwijl het werk nog gaande is.
De snelheidscijfers achter Ultrafast
Het cijfer van 750 output‑tokens per seconde is de kop, maar de meer verhelderende vergelijkingen zijn de head‑to‑head tests die Cerebras publiceerde. Ten opzichte van de door Artificial Analysis gerapporteerde outputsnelheden zegt het bedrijf dat GPT‑5.6 Sol op Ultrafast 11 × sneller draait dan Claude Fable 5 en 5 × sneller dan Opus 4.8 in Fast‑modus.
Cerebras heeft de laag ook door een volledige run van “Humanity’s Last Exam” gehaald, een benchmark van 2 500 vragen op PhD‑niveau. GPT‑5.6 Sol op Ultrafast beantwoordde alle 2 500 vragen in 11 uur en 11 minuten; Claude Fable 5 had 78 uur en 27 minuten nodig om vergelijkbare conclusies te bereiken: bijna 7 × trager, volgens Cerebras. Op GDP‑Val, een benchmark voor economisch waardevol kenniswerk, meldt het bedrijf een eindsnelheidsverbetering van 5,6 × ten opzichte van standaardverwerking zonder kwaliteitsverlies.
Dit zijn door de leverancier uitgevoerde evaluaties, en Cerebras maakt dat expliciet: de “Humanity’s Last Exam”‑vergelijking werd door Cerebras zelf gebenchmarkt op 10 juli en 13‑15 juli 2026, en de GDP‑Val‑cijfers komen uit hun eigen test op 31 juli 2026. Beschouw ze als de eigen metingen van het bedrijf, niet als onafhankelijke resultaten.
Waarom de wafer‑scale chip wint op latentie
Het mechanisme is hier cruciaal, want het verklaart waarom een relatief kleine chipmaker OpenAI’s grootste model kan bedienen met snelheden die GPU‑incumbenten niet hebben gehaald. Snelle inferentie op een groot model is fundamenteel een data‑verplaatsingsprobleem: op GPU’s moeten modelgewichten herhaaldelijk tussen on‑chip geheugen en off‑chip opslag worden verplaatst om elk volgend token te genereren, en geheugenbandbreedte wordt de bottleneck.
Cerebras’ antwoord is die verplaatsing te elimineren. Hun Wafer‑Scale Engine bevat 44 GB SRAM op één wafer‑groot chip, zodat de gewichten on‑chip blijven en tokens door lagen stromen die over wafers gepijplijnd zijn zonder onderbreking. Omdat de gewichten nooit het silicon verlaten, schaalt de aanpak met de modelgrootte — wat volgens het bedrijf de snelheidsvoordeel behoudt naarmate frontier‑modellen groeien. Voor inferentie‑economie is dat het hele spel: de kosten en latentie van het bedienen van een model worden gedomineerd door hoe snel je gewichten aan de rekenunits kunt voeren, en het resident houden van 44 GB op één chip richt zich direct op dat probleem.
Een partnerschap van $10 miljard bereikt het vlaggenschip
Ultrafast is het meest zichtbare product tot nu toe van een relatie die maandenlang is opgebouwd. OpenAI sloot Cerebras in voor $10 miljard aan low‑latency compute eerder in 2026, en deze lancering plaatst die capaciteit achter het topmodel van het bedrijf in plaats van een kleiner of gespecialiseerd model. OpenAI beschrijft Ultrafast als “de volgende stap” in de samenwerking om ultra‑low‑latency inferentie naar haar platform te brengen.
Voor Cerebras is die plaatsing significant. De startup heeft al lang betoogd dat haar wafer‑scale architectuur de juiste vorm is voor inferentie, zelfs terwijl het zwaartepunt van de markt bij GPU‑leveranciers ligt — een strijd die zich afspeelt in de accelerator‑industrie terwijl incumbents modellen rechtstreeks in hun silicon integreren (modellen rechtstreeks in hun chips inbouwen). Het leveren van de serving‑laag voor OpenAI’s vlaggenschip geeft Cerebras een productie‑referentieaccount aan de top van de markt. Het model zelf verankert de GPT‑5.6‑familie die OpenAI heeft gelanceerd (Sol als vlaggenschip, naast het gebalanceerde Terra en de kostenefficiënte Luna), waardoor Ultrafast Cerebras aan de voorzijde van die lineup koppelt.
Wie krijgt het en waarvoor is het bedoeld
OpenAI positioneert de laag voor tijdgevoelig, high‑stakes werk: incidentrespons terwijl een storing nog gaande is, financieel onderzoek terwijl marktomstandigheden veranderen, realtime klantenondersteuning en spraak, commerce, en live‑onderzoeksloops die vroeger ’s nachts draaiden. Vroegtijdige toegang is verleend aan bedrijven uit codering, commerce en financiën, waaronder Jane Street, Podium, Basis en Rogo.
“De snelheidsstijging die Cerebras brengt is indrukwekkend,” zei John Crepezzi, AI Assistants bij Jane Street, in de aankondiging van OpenAI. “Het maakt verschillende manieren van modelgebruik mogelijk en maakt het praktisch voor ontwikkelaars om op een meer gefocuste en productieve manier met hen samen te werken.”
OpenAI houdt de uitrol bewust beperkt. Het bedrijf zegt dat het de preview‑periode gebruikt om te leren waar een snelheidsverandering van een orde van grootte de meeste waarde creëert, en zal de toegang uitbreiden naarmate de capaciteit groeit. Zowel OpenAI als Cerebras nemen aanmeldingen voor updates aan terwijl de preview wordt uitgebreid.
Wat gebeurt er hierna
Het kortetermijn‑observeerbare is capaciteit, niet functionaliteit. Ultrafast is een beperkte preview, en beide bedrijven koppelen bredere beschikbaarheid aan capaciteitsgroei in plaats van een vaste datum — dus het tempo van uitbreiding is het te volgen aspect. De langere vraag is of Cerebras’ on‑chip‑memory‑voordeel standhoudt naarmate OpenAI’s modellen opschalen, wat precies de weddenschap is waarop de wafer‑scale architectuur is gebouwd.












