AI-modeller og plattformer
Cerebras kjører OpenAI’s GPT-5.6 Sol med 750 tokens per sekund i nytt Ultrafast-nivå

Cerebras kjører nå OpenAI’s flaggskipmodell med en hastighet som ingen GPU-basert skytjeneste har offentlig matchet. Den 13. august 2026 annonserte selskapet at de driver GPT-5.6 Sol på en ny OpenAI-tjeneste kalt Ultrafast, som leverer opptil 750 utgangstokens per sekund og, ifølge OpenAI’s beskrivelse, kjører modellen opptil 14 ganger raskere enn standardbehandling. Ultrafast lanseres først i OpenAI API som en begrenset forhåndsvisning for en utvalgt gruppe kunder, med tilgang som utvides når kapasiteten øker.
Påstanden i sentrum er en spesifikk en: frontier-intelligens uten hastighetsstraff. GPT-5.6 Sol er OpenAI’s mest kapable modell, og på Cerebras’ silisium genererer den tokens raskt nok til å sitte inne i sanntidsprodukter i stedet for bak en nattlig batchjobb. Begge selskapene fremstiller nivået som en fjerning av kompromisset mellom en modell som er smart nok for høyrisik-arbeid og en som er rask nok til å bruke mens arbeidet fortsatt skjer.
Hastighetstallene bak Ultrafast
Tallet på 750 utgangstokens per sekund er overskriften, men de mer avslørende sammenligningene er de direkte løpene Cerebras har offentliggjort. Mot utgangshastigheter rapportert av Artificial Analysis, sier selskapet at GPT-5.6 Sol på Ultrafast kjører 11 ganger raskere enn Claude Fable 5 og 5 ganger raskere enn Opus 4.8 på hurtig modus.
Cerebras har også satt nivået gjennom en fulltur av Humanity’s Last Exam, en 2 500-spørsmålsbenchmark rettet mot PhD-nivå. GPT-5.6 Sol på Ultrafast svarte på alle 2 500 spørsmålene på 11 timer og 11 minutter; Claude Fable 5 trengte 78 timer og 27 minutter for å nå sammenlignbare konklusjoner: nesten 7 ganger langsommere, ifølge Cerebras.
Disse er leverandørutførte evalueringer, og Cerebras er eksplisitt om det: sammenligningen med Humanity’s Last Exam ble benchmarket av Cerebras den 10. og 13.-15. juli 2026, og GDP-Val-tallet kommer fra deres egen testing den 31. juli 2026. Behandle dem som selskapets egne målinger, ikke uavhengige resultater.
Hvorfor wafer-skala-chippen vinner på latens
Mekanismen betyr her, fordi den forklarer hvorfor en relativt liten chipprodusent kan betjene OpenAI’s største modell med hastigheter som GPU-leverandørene ikke har matchet. Rask inferens på en stor modell er fundamentalt et data-bevegelsesproblem: på GPUer må modellvekter flyttes gjentatte ganger mellom på-chip-minne og av-chip-lagring for å generere hver påfølgende token, og minnehastighet blir flaskenhalen.
Cerebras’ svar er å eliminere denne bevegelsen. Deres Wafer-Scale Engine pakker 44 GB SRAM på en enkelt wafer-størrelse chip, så modellvekter forblir på chippen og token flyter gjennom lag pipelinet over wafer uten avbrytelse. Fordi vekter aldri forlater silisium, skalerer tilnærmingen med modellstørrelse — som er selskapets argument for at hastighetsfordelen holder når frontier-modeller vokser. For inferensøkonomi er det hele spillet: kostnaden og latensen for å betjene en modell domineres av hvor raskt du kan mata vekter til beregningen, og å holde 44 GB boende på én die angriper det direkte.
En 10 milliarder dollar-partneravtale når flaggskipet
Ultrafast er det mest synlige produktet hittil av et forhold som har bygget seg opp over måneder. OpenAI tappet Cerebras for 10 milliarder dollar i lav-latens beregning tidligere i 2026, og denne lanseringen setter den kapasiteten bak selskapets toppmodell i stedet for en mindre eller spesialisert en. OpenAI beskriver Ultrafast som “neste skritt” i partneravtalen for å bringe ultra-lav-latens inferens til deres plattform.
For Cerebras er plasseringen betydelig. Startupen har lenge argumentert for at deres wafer-skala-arkitektur er riktig form for inferens, selv om markedets tyngdepunkt ligger hos GPU-leverandører — en konkurranse som spiller ut over akseleratorforretningen mens etablerte selskaper flytter til å bake modeller direkte inn i deres silisium. Å få serverlaget for OpenAI’s flaggskip gir Cerebras en produksjonsreferanse på toppen av markedet. Modellen selvanker GPT-5.6-familien OpenAI lanserte (Sol som flaggskipet, sammen med den balanserte Terra og den kosteffektive Luna), så Ultrafast kobler Cerebras til fronten av den linjen.
Hvem får det og hva det er for
OpenAI stiller nivået mot tidssensitive, høyrisiko-arbeid: hendelsesrespons mens en nedtid fortsatt utvikler seg, finansiell forskning mens markedsbetingelser endrer seg, sanntidskundestøtte og stemme, handel og live-forskningsløkker som tidligere kjørte over natten. Tidlig tilgang har gått til selskaper over hele kodning, handel og finanse, inkludert Jane Street, Podium, Basis og Rogo.
> “Økningen i hastighet som Cerebras bringer, er imponerende,” sa John Crepezzi, AI-assistanse ved Jane Street, i OpenAI’s annonsering. “Det muliggjør forskjellige måter å bruke modellene på, og gjør det praktisk for utviklere å arbeide på en mer fokusert og produktiv måte sammen med dem.”
OpenAI holder rullingen smal med vilje. Selskapet sier at de bruker forhåndsvisningsperioden til å lære hvor en ordre-of-magnitude-hastighetsendring skaper mest verdi, og vil utvide tilgang når kapasiteten øker. Begge OpenAI og Cerebras tar imot påmeldinger for oppdateringer mens forhåndsvisningen utvides.
Hva skjer neste
Nærmeste observerbare er kapasitet, ikke evne. Ultrafast er en begrenset forhåndsvisning, og begge selskapene knytter videre tilgjengelighet til kapasitetsvekst i stedet for en fast dato — så tempoet i utvidelsen er det å se på. Den lengre spørsmålet er om Cerebras’ på-chip-minnefordel holder når OpenAI’s modeller skalerer, som er eksakt det veddemålet wafer-skala-arkitekturen er bygget på.












