AI-modellen en platforms

Cerebras Voert OpenAI’s GPT-5.6 Sol Uit Op 750 Tokens Per Seconde in Nieuwe Ultrafast Tier

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Cerebras draait nu OpenAI’s vlaggenschipmodel op een snelheid die geen enkele GPU-cloud heeft geëvenaard. Op 13 augustus 2026 maakte het bedrijf bekend dat het GPT-5.6 Sol aandrijft op een nieuwe OpenAI-servicetier genaamd Ultrafast, met een uitvoersnelheid van maximaal 750 tokens per seconde en, volgens OpenAI’s account, tot 14× sneller dan de standaardverwerking. Ultrafast wordt eerst gelanceerd in de OpenAI API als een beperkte preview voor een selecte groep klanten, met toegang die wordt uitgebreid naarmate de capaciteit groeit.

Het centrale punt is een specifiek punt: frontierintelligentie zonder snelheidsstraf. GPT-5.6 Sol is OpenAI’s meest capabele model, en op Cerebras-silicium genereert het tokens snel genoeg om in realtimeproducten te zitten in plaats van achter een batchjob van één nacht. Beide bedrijven beschrijven de tier als het wegnemen van de afweging tussen een model dat slim genoeg is voor hoge inzet en een model dat snel genoeg is om te gebruiken terwijl het werk nog gaande is.

De Snelheidscijfers Achter Ultrafast

Het cijfer van 750 uitvoertokens per seconde is het hoofdpunt, maar de meer vertellende vergelijkingen zijn de head-to-head-runs die Cerebras heeft gepubliceerd. Tegen de uitvoersnelheden die door Artificial Analysis zijn gerapporteerd, zegt het bedrijf dat GPT-5.6 Sol op Ultrafast 11× sneller loopt dan Claude Fable 5 en 5× sneller dan Opus 4.8 in de snelle modus.

Cerebras heeft de tier ook door een volledige ronde van Humanity’s Last Exam gehaald, een 2.500-vragenbenchmark die is gericht op PhD-niveau. GPT-5.6 Sol op Ultrafast beantwoordde alle 2.500 vragen in 11 uur en 11 minuten; Claude Fable 5 had 78 uur en 27 minuten nodig om vergelijkbare conclusies te bereiken: bijna 7× langzamer, volgens Cerebras. Op GDP-Val, een benchmark voor economisch waardevolle kenniswerk, meldt het bedrijf een eind-tot-eind-snelheidsverbetering van 5,6× ten opzichte van de standaardverwerking zonder kwaliteitsafname.

Dit zijn door de leverancier uitgevoerde evaluaties, en Cerebras is hierover expliciet: de vergelijking met Humanity’s Last Exam werd op 10 en 13-15 juli 2026 door Cerebras getest, en het GDP-Val-cijfer komt uit zijn eigen test van 31 juli 2026. Behandel ze als de metingen van het bedrijf zelf, niet als onafhankelijke resultaten.

Waarom De Wafer-Schaalchip Wint Op Latentie

De mechanisme is hier van belang, omdat het uitlegt waarom een relatief kleine chipmaker OpenAI’s grootste model op snelheden dient die de GPU-incumbenten niet hebben geëvenaard. Snelle inferentie op een groot model is fundamenteel een gegevensbewegingsprobleem: op GPU’s moeten modelgewichten herhaaldelijk tussen on-chipgeheugen en off-chipopslag worden vervoerd om elk volgend token te genereren, en geheugenbandbreedte wordt de bottleneck.

Cerebras’ antwoord is om die beweging te elimineren. Zijn Wafer-Scale Engine bevat 44 GB SRAM op één wafer-grote chip, zodat de modelgewichten op de chip blijven en tokens door lagen worden gepipeerd die over wafers zijn verdeeld zonder onderbreking. Omdat de gewichten de silicium nooit verlaten, schaalt de aanpak met de grootte van het model — wat het argument van het bedrijf is dat het snelheidsvoordeel blijft bestaan naarmate frontiermodellen groeien. Voor inferentie-economie is dat het hele spel: de kosten en latentie van het serveren van een model worden gedomineerd door hoe snel je gewichten aan de berekening kunt voeden, en 44 GB resident houden op één die valt dit rechtstreeks aan.

Een $10 Miljard Partnerschap Bereikt Het Vlaggenschip

Ultrafast is het meest zichtbare product tot nu toe van een relatie die al maanden aan het opbouwen is. OpenAI heeft Cerebras getapt voor $10 miljard in low-latency-computing eerder in 2026, en deze lancering zet die capaciteit achter het topmodel van het bedrijf in plaats van een kleiner of gespecialiseerd model. OpenAI beschrijft Ultrafast als “de volgende stap” in het partnerschap om ultra-low-latency-inferentie naar zijn platform te brengen.

Voor Cerebras is de plaatsing significant. Het startupbedrijf heeft lang betoogd dat zijn wafer-schaalarchitectuur de juiste vorm heeft voor inferentie, zelfs als het marktgewicht van de markt bij GPU-leveranciers ligt — een strijd die zich afspeelt in de versnellerbranche, waarbij gevestigde bedrijven modellen rechtstreeks in hun silicium bakken. Het serveren van de servinglaag voor OpenAI’s vlaggenschip geeft Cerebras een productiereferentieaccount aan de top van de markt. Het model zelf ankeren de GPT-5.6-familie die OpenAI heeft gelanceerd (Sol als vlaggenschip, naast de evenwichtige Terra en de kostenefficiënte Luna), dus Ultrafast koppelt Cerebras aan de voorzijde van die lijn.

Wie Krijgt Het En Waarvoor Het Is

OpenAI positioneert de tier op tijdsgevoelige, hoge inzet: incidentrespons terwijl een uitval nog gaande is, financieel onderzoek terwijl marktomstandigheden veranderen, real-timeklantondersteuning en spraak, handel en liveonderzoeksloops die eerder ‘s nachts liepen. Vroege toegang is verleend aan bedrijven in de codering, handel en financiën, waaronder Jane Street, Podium, Basis en Rogo.

> “De toename in snelheid door Cerebras is indrukwekkend”, zei John Crepezzi, AI-assistenten bij Jane Street, in OpenAI’s aankondiging. “Het maakt het mogelijk om de modellen op verschillende manieren te gebruiken en maakt het praktisch voor ontwikkelaars om op een meer gefocuste en productieve manier samen te werken met hen.”

OpenAI houdt de rollout smal opzettelijk. Het bedrijf zegt dat het de previewperiode gebruikt om te leren waar een orde-grootte-snelheidsverandering de meeste waarde creëert en zal toegang uitbreiden naarmate de capaciteit groeit. Beide OpenAI en Cerebras nemen inschrijvingen voor updates terwijl de preview zich uitbreidt.

Wat Er Gebeurt

Het nabije waarneembare is capaciteit, niet mogelijkheid. Ultrafast is een beperkte preview, en beide bedrijven koppelen bredere beschikbaarheid aan capaciteitsgroei in plaats van een vaste datum — dus het tempo van de uitbreiding is het punt om te volgen. De langere vraag is of Cerebras’ voordeel van on-chipgeheugen blijft bestaan naarmate OpenAI’s modellen schalen, wat precies de inzet is die de wafer-schaalarchitectuur heeft.

Theo Nash is een AI-gegenereerde specialist bij Unite.AI, waar hij zich richt op AI-infrastructuur, compute en de hardware-systemen die moderne kunstmatige intelligentie aandrijven. Zijn werk richt zich op de technische fundamenten achter grote AI-werklasten, waaronder datacenters, accelerators, netwerken en de software-stacks die deze verbinden.
Met een analytische en technisch gedreven perspectief onderzoekt Theo hoe vooruitgang in GPUs, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI-modellen mogelijk maken. Hij let vooral op prestatie-afwegingen, energiedoeltreffendheid, schaalbaarheid en de praktische beperkingen die de inzet van AI-infrastructuur in de praktijk bepalen.
Artikelen geschreven door Theo Nash zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om technische nauwkeurigheid, duidelijkheid en verantwoorde dekking van het snel evoluerende AI-computelandschap te garanderen.