AI-modeller og platforme
Cerebras kører OpenAI’s GPT-5.6 Sol med 750 tokens per sekund i ny Ultrafast-kategori

Cerebras kører nu OpenAI’s flagskibmodel i en hastighed, som ingen GPU-cloud offentligt har matchet. Den 13. august 2026 annoncerede wafer-scale chip-producenten, at de driver GPT-5.6 Sol på en ny OpenAI-service kaldet Ultrafast, der leverer op til 750 output tokens per sekund og ifølge OpenAI’s opgørelse kører modellen op til 14 gange hurtigere end standardbehandling. Ultrafast lanceres først i OpenAI API som en begrænset preview for en udvalgt gruppe kunder, med adgang, der udvides, efterhånden som kapaciteten vokser.
Påstanden i centrum er en specifik en: grænseintelligens uden hastighedsstraf. GPT-5.6 Sol er OpenAI’s mest kapable model, og på Cerebras silicium genererer den tokens hurtigt nok til at sidde inde i realtidsprodukter i stedet for bag en overnatningssag. Begge selskaber fremstiller kategorien som en, der fjerner kompromisset mellem en model, der er intelligent nok til højrisikoarbejde, og en, der er hurtig nok til at bruge, mens arbejdet stadig sker.
Hastighedstallene bag Ultrafast
Tallet på 750 output tokens per sekund er overskriften, men de mere betydningsfulde sammenligninger er de direkte sammenligninger, som Cerebras har offentliggjort. I forhold til outputhastigheder, der er rapporteret af Artificial Analysis, siger virksomheden, at GPT-5.6 Sol på Ultrafast kører 11 gange hurtigere end Claude Fable 5 og 5 gange hurtigere end Opus 4.8 i hurtig tilstand.
Cerebras har også testet kategorien igennem en fuld gennemløb af Humanity’s Last Exam, en 2.500-spørgsmål-benchmark, der er rettet mod ph.d.-niveau sværhedsgrad. GPT-5.6 Sol på Ultrafast svarede på alle 2.500 spørgsmål på 11 timer og 11 minutter; Claude Fable 5 havde brug for 78 timer og 27 minutter for at nå tilsvarende konklusioner – næsten 7 gange langsommere, ifølge Cerebras. På GDP-Val, en benchmark for økonomisk værdifuld videnarbejde, rapporterer virksomheden en 5,6-gange hastighedsforbedring i forhold til standardbehandling uden kvalitetsnedgang.
Disse er vendor-gennemførte evalueringer, og Cerebras er eksplicit omkring det: sammenligningen med Humanity’s Last Exam blev målt af Cerebras den 10. og 13.-15. juli 2026, og GDP-Val-tallet kommer fra deres egen test den 31. juli 2026. Behandle dem som virksomhedens egne målinger, ikke uafhængige resultater.
Hvorfor wafer-scale-chippen vinder på latency
Mekanismen er vigtig her, fordi den forklarer, hvorfor en relativt lille chipproducent kan betjene OpenAI’s største model i hastigheder, som GPU-indekserne ikke har matchet. Hurtig inference på en stor model er fundamentalt et data-bevægelsesproblem: på GPU’er skal modelvægte flyttes gentagne gange mellem on-chip-hukommelse og off-chip-lagring for at generere hver efterfølgende token, og hukommelsesbåndbredden bliver flaskenhalen.
Cerebras’ løsning er at eliminere denne bevægelse. Deres Wafer-Scale Engine pakker 44 GB SRAM på en enkelt wafer-størrelse chip, så modelvægtene forbliver på chippen, og tokens flyder gennem lag, der er rørledt på tværs af wafers uden afbrydelse. Fordi vægtene aldrig forlader silicium, skalerer tilgangen med modellens størrelse – hvilket er virksomhedens argument for, at hastighedsfordelen består, efterhånden som frontmodellerne vokser. For inferensøkonomi er det hele spillet: omkostningerne og latencyen ved at betjene en model domineres af, hvor hurtigt du kan føde vægte til beregningen, og at holde 44 GB resident på én die angriber det direkte.
En 10 milliards-dollar-partnerskab når flagskibet
Ultrafast er det mest synlige produkt endnu af et forhold, der har været under opbygning i måneder. OpenAI valgte Cerebras til 10 milliarder dollars i lav-latens beregning tidligere i 2026, og denne lancering placerer den kapacitet bag virksomhedens topmodel i stedet for en mindre eller specialiseret en. OpenAI beskriver Ultrafast som “næste skridt” i partnerskabet om at bringe ultra-lav-latens inference til deres platform.
For Cerebras er placeringen betydningsfuld. Startup-virksomheden har længe argumenteret for, at deres wafer-scale-arkitektur er den rigtige form for inference, selv om markedets tyngdepunkt ligger hos GPU-leverandører – en konkurrence, der spiller ud over acceleratorforretningen, mens indehaverne flytter mod at bage modeller direkte ind i deres silicium. At få serverlaget for OpenAI’s flagskib giver Cerebras en produktionsreferencekonto på toppen af markedet. Modellen selv er ankeret i GPT-5.6-familien, som OpenAI lancerede (Sol som flagskib, sammen med den balancerede Terra og den omkostningseffektive Luna), så Ultrafast kobler Cerebras til fronten af den linje.
Hvem får det og hvad det er til
OpenAI positionerer kategorien på tidssensitive, højrisikoarbejde: incidentrespons, mens en afbrydelse stadig udvikler sig, finansielle undersøgelser, mens markedsvilkårene bevæger sig, realtidskundesupport og stemme, handel og levende forskningsløkker, der tidligere kørte over natten. Tidlig adgang er gået til virksomheder på tværs af kodning, handel og finans, herunder Jane Street, Podium, Basis og Rogo.
> “Hastighedsforbedringen, som Cerebras bringer, er imponerende,” sagde John Crepezzi, AI-assistenter hos Jane Street, i OpenAI’s annoncering. “Det muliggør forskellige måder at bruge modellerne på og gør det praktisk for udviklere at arbejde på en mere fokuseret og produktiv måde sammen med dem.”
OpenAI holder rollouten smal med vilje. Virksomheden siger, at de bruger preview-perioden til at lære, hvor en størrelsesorden-forbedring i hastighed skaber mest værdi, og vil udvide adgang, efterhånden som kapaciteten vokser. Begge OpenAI og Cerebras tager tilmeldinger til opdateringer, mens previewen udvides.
Hvad sker herefter
Det nærmeste observerbare er kapacitet, ikke evne. Ultrafast er en begrænset preview, og begge virksomheder binder en bredere tilgængelighed til kapacitetsvækst i stedet for en fast dato – så tempoet i udvidelsen er det at se på. Den længerevarende spørgsmål er, om Cerebras’ på-chip-hukommelsesforbedring består, efterhånden som OpenAI’s modeller skalerer, hvilket er det væddemål, som wafer-scale-arkitekturen er bygget på.












