AI-modeller og platforme

Cerebras kører OpenAI’s GPT-5.6 Sol med 750 tokens pr. sekund i den nye Ultrafast‑tier

mm
Føj Unite.AI til dine foretrukne kilder på Google

Cerebras (CBRS ) kører nu OpenAI’s flagskibsmodel med en hastighed, som ingen GPU‑cloud offentligt har matchet. Den 13. august 2026 annoncerede, at den driver GPT-5.6 Sol på en ny OpenAI‑tjenestetier kaldet Ultrafast, som leverer op til 750 output‑tokens per sekund og, ifølge OpenAI, kører modellen op til 14× hurtigere end Standard‑behandling. Ultrafast lanceres først i OpenAI‑API’en som en begrænset forhåndsvisning for en udvalgt gruppe af kunder, med adgang der udvides efterhånden som kapaciteten vokser.

Påstanden i centrum er en specifik: frontlinje‑intelligens uden hastighedsstraffen. GPT-5.6 Sol er OpenAI’s mest kapable model, og på Cerebras‑silicium genererer den tokens hurtigt nok til at kunne indgå i realtidsprodukter i stedet for bag en natlig batch‑job. Begge virksomheder fremstiller tieren som en fjernelse af kompromiset mellem en model, der er smart nok til høj‑risiko‑opgaver, og en model, der er hurtig nok til at bruges mens arbejdet stadig foregår.

Hastighedstallene bag Ultrafast

Figuren på 750 output‑tokens per sekund er overskriften, men de mere sigende sammenligninger er de direkte tests, som Cerebras har offentliggjort. I forhold til output‑hastigheder rapporteret af Artificial Analysis, siger virksomheden, at GPT-5.6 Sol på Ultrafast kører 11× hurtigere end Claude Fable 5 og 5× hurtigere end Opus 4.8 i Fast‑tilstand.

Cerebras satte også tieren igennem en fuld gennemløb af Humanity’s Last Exam, et benchmark med 2 500 spørgsmål på PhD‑niveau. GPT-5.6 Sol på Ultrafast besvarede alle 2 500 spørgsmål på 11 timer og 11 minutter; Claude Fable 5 brugte 78 timer og 27 minutter for at nå sammenlignelige konklusioner: næsten 7× langsommere, ifølge Cerebras. På GDP‑Val, et benchmark for økonomisk værdifuldt vidensarbejde, rapporterer virksomheden en 5,6× end‑to‑end‑forbedring i hastighed i forhold til Standard‑behandling uden kvalitetstab.

Dette er leverandør‑kørte evalueringer, og Cerebras er eksplicit omkring det: Humanity’s Last Exam‑sammenligningen blev benchmarket af Cerebras den 10. juli samt 13.–15. juli 2026, og GDP‑Val‑tallet kommer fra deres egen test den 31. juli 2026. Betragt dem som virksomhedens egne målinger, ikke som uafhængige resultater.

Hvorfor wafer‑scale‑chippen vinder på latenstid

Mechanismen er vigtig her, fordi den forklarer, hvorfor en relativt lille chipproducent betjener OpenAI’s største model med hastigheder, som GPU‑incumbenterne ikke har matchet. Hurtig inferens på en stor model er grundlæggende et data‑bevægelsesproblem: på GPU’er skal modelvægt‑data gentagne gange flyttes mellem on‑chip‑hukommelse og off‑chip‑lager for at generere hvert efterfølgende token, og hukommelsesbåndbredden bliver flaskehalsen.

Cerebras’ svar er at eliminere den bevægelse. Deres Wafer‑Scale Engine pakker 44 GB SRAM på en enkelt wafer‑størrelse chip, så modellens vægte forbliver on‑chip, og tokens flyder gennem lag, der er pipeline‑et over wafers uden afbrydelse. Fordi vægtene aldrig forlader silicium, skalerer tilgangen med modelstørrelsen — hvilket er virksomhedens argument for, at hastighedsfordelen holder, efterhånden som frontlinje‑modeller vokser. For inferensekonomi er det hele spillet: omkostningerne og latenstiden ved at betjene en model domineres af, hvor hurtigt du kan levere vægtene til beregningen, og at holde 44 GB resident på én die angriber dette direkte.

Et partnerskab på 10 milliarder dollar når flagskibet

Ultrafast er det mest synlige produkt hidtil i et forhold, der har været under opbygning i måneder. OpenAI valgte Cerebras til 10 milliarder dollar i lav‑latenstid beregning tidligere i 2026, og denne lancering placerer den kapacitet bag virksomhedens topmodel i stedet for en mindre eller specialiseret model. OpenAI beskriver Ultrafast som “det næste skridt” i partnerskabet for at bringe ultra‑lav‑latenstid inferens til deres platform.

For Cerebras er placeringen betydningsfuld. Startup‑virksomheden har længe argumenteret for, at deres wafer‑scale‑arkitektur er den rette form for inferens, selvom markedets tyngdepunkt ligger hos GPU‑leverandører — en konkurrence, der udfolder sig på accelerator‑markedet, mens incumbenterne bevæger sig mod at indlejre modeller direkte i deres silicium. At lande betjeningslaget for OpenAI’s flagskibsmodel giver Cerebras en produktionsreference‑konto i toppen af markedet. Modellen selv forankrer GPT-5.6‑familien, som OpenAI lancerede (Sol som flagskib, sammen med den balancerede Terra og den omkostningseffektive Luna), så Ultrafast knytter Cerebras til fronten af denne produktlinje.

Hvem får det, og hvad det er til

OpenAI positionerer tieren til tidsfølsomt, høj‑risiko‑arbejde: hændelsesrespons mens et nedbrud stadig udfolder sig, finansiel forskning mens markedsforholdene ændrer sig, realtids‑kundesupport og stemme, handel og live‑forskningsløb, som tidligere kørte natten over. Tidlig adgang er gået til virksomheder inden for kodning, handel og finans, herunder Jane Street, Podium, Basis og Rogo.

“Stigningen i hastighed, som Cerebras leverer, er imponerende,” sagde John Crepezzi, AI Assistants hos Jane Street, i OpenAI’s meddelelse. “Det muliggør forskellige måder at bruge modellerne på, og gør det praktisk for udviklere at arbejde på en mere fokuseret og produktiv måde sammen med dem.”

OpenAI holder udrulningen bevidst snæver. Virksomheden siger, at de bruger forhåndsvisningsperioden til at lære, hvor en hastighedsforbedring på en størrelsesorden skaber mest værdi, og vil udvide adgangen efterhånden som kapaciteten vokser. Både OpenAI og Cerebras tager tilmeldinger til opdateringer, efterhånden som forhåndsvisningen udvides.

Hvad sker der næste

Den kortsigtede observerbare faktor er kapacitet, ikke funktionalitet. Ultrafast er en begrænset forhåndsvisning, og begge virksomheder knytter enhver bredere tilgængelighed til kapacitetsvækst i stedet for en fast dato — så tempoet i udvidelsen er det, man skal holde øje med. Det længere spørgsmål er, om Cerebras’ on‑chip‑hukommelsesfordel holder, når OpenAI’s modeller skalerer, hvilket præcis er det væddemål, som wafer‑scale‑arkitekturen er bygget på.

Theo Nash er en AI-genereret specialist hos Unite.AI, der dækker AI-infrastruktur, beregning og de hardware-systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag for store AI-arbejdsbyrder, herunder datacentre, acceleratorer, netværk og software-stacks, der binder dem sammen.
Med en analytisk og ingeniør-dreven perspektiv undersøger Theo, hvordan fremskridt i GPU'er, brugerdefineret silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI-modeller. Han lægger særlig vægt på ydelses-omkostningsforhold, energoeffektivitet, skalerbarhed og de praktiske begrænsninger, der former den virkelige udvikling af AI-infrastruktur.
Artikler skrevet af Theo Nash er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af den hurtigt udviklende AI-beregningsskala.