AI-modeller og plattformer

Cerebras kjører OpenAI sin GPT‑5.6 Sol med 750 token per sekund i den nye Ultrafast‑nivået

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Cerebras (CBRS ) kjører nå OpenAI sin flaggskip‑modell med en hastighet som ingen GPU‑sky har offentlig matchet. 13. august 2026 kunngjorde selskapet at det driver GPT‑5.6 Sol på et nytt OpenAI‑tjenestenivå kalt Ultrafast, som leverer opptil 750 utdata‑token per sekund og, ifølge OpenAI, kjører modellen opptil 14× raskere enn Standard‑behandling. Ultrafast lanseres først i OpenAI API som en begrenset forhåndsvisning for en utvalgt gruppe kunder, med tilgang som utvides etter hvert som kapasiteten vokser.

Kjernen i påstanden er konkret: den mest avanserte intelligensen uten tap av hastighet. GPT-5.6 Sol er OpenAIs mest kapable modell, og på Cerebras-brikker genererer den tokener raskt nok til å brukes i sanntidsprodukter fremfor i satsvise jobber som kjører over natten. Begge selskapene beskriver tilbudet som en løsning som fjerner avveiningen mellom en modell som er klok nok for kritisk arbeid, og en som er rask nok til å brukes mens arbeidet pågår.

Hastighetstallene bak Ultrafast

750 utdata-token per sekund er tallet som får overskriftene, men direkte sammenligninger publisert av Cerebras forteller mer. Sammenholdt med utdatahastigheter rapportert av Artificial Analysis sier selskapet at GPT-5.6 Sol på Ultrafast er 11 ganger raskere enn Claude Fable 5 og 5 ganger raskere enn Opus 4.8 i Fast-modus.

Cerebras lot også nivået gjennomføre hele Humanity’s Last Exam, en test med 2 500 spørsmål på det som beskrives som doktorgradsnivå. GPT-5.6 Sol på Ultrafast besvarte alle spørsmålene på 11 timer og 11 minutter. Claude Fable 5 brukte 78 timer og 27 minutter på å komme frem til sammenlignbare konklusjoner — altså nesten sju ganger så lang tid, ifølge Cerebras. På GDP-Val, en test av økonomisk verdifullt kunnskapsarbeid, rapporterer selskapet 5,6 ganger raskere gjennomføring fra start til slutt enn med Standard-prosessering, uten redusert kvalitet.

Dette er evalueringer utført av leverandøren selv, noe Cerebras er tydelig på: Selskapet gjennomførte sammenligningen på Humanity’s Last Exam 10. og 13.–15. juli 2026, mens GDP-Val-tallet kommer fra egne tester 31. juli 2026. Tallene må behandles som selskapets egne målinger, ikke som uavhengige resultater.

Hvorfor wafer‑scale‑brikken vinner på latens

Mekanismen er viktig fordi den forklarer hvordan en relativt liten brikkeprodusent kan kjøre OpenAIs største modell med hastigheter de etablerte GPU-leverandørene ikke har matchet. Rask inferens på en stor modell handler grunnleggende om dataflytting: På GPU-er må modellvektene flyttes gjentatte ganger mellom minne på brikken og lagring utenfor brikken for å generere hvert nye token. Minnebåndbredden blir dermed flaskehalsen.

Cerebras’ svar er å fjerne denne flyttingen. Wafer-Scale Engine samler 44 GB SRAM på én brikke på størrelse med en hel silisiumskive. Modellvektene blir dermed på brikken, mens token flyter uavbrutt gjennom lag som er organisert i en prosesseringskjede på tvers av silisiumskiver. Fordi vektene aldri forlater silisiumet, skalerer løsningen med modellstørrelsen. Det er selskapets argument for at hastighetsfordelen varer etter hvert som de mest avanserte modellene vokser. For økonomien i inferens er dette avgjørende: Kostnad og ventetid ved å kjøre en modell styres i stor grad av hvor raskt vektene kan mates til beregningsenhetene. Å holde 44 GB tilgjengelig på én brikke angriper dette direkte.

Et partnerskap på $10 milliarder når flaggskipet

Ultrafast er det mest synlige produktet hittil fra et samarbeid som har utviklet seg over flere måneder. OpenAI valgte Cerebras for $10 milliarder i lav‑latens‑beregning tidligere i 2026, og denne lanseringen bruker kapasiteten til selskapets toppmodell fremfor en mindre eller spesialisert modell. OpenAI beskriver Ultrafast som «det neste steget» i samarbeidet om inferens med svært lav ventetid på plattformen.

For Cerebras er denne posisjonen viktig. Oppstartsselskapet har lenge hevdet at arkitekturen i silisiumskiveskala er riktig for inferens, selv om markedets tyngdepunkt ligger hos GPU-leverandørene. Denne konkurransen utspiller seg i hele akseleratormarkedet, der etablerte aktører forsøker å bygge modellene direkte inn i brikkene. Å levere inferensen for OpenAIs flaggskip gir Cerebras en referansekunde i produksjon helt i toppen av markedet. Selve modellen er hovedmodellen i GPT-5.6-familien som OpenAI lanserte (med Sol som flaggskip, sammen med den balanserte Terra og den kostnadseffektive Luna). Ultrafast knytter dermed Cerebras til spissen av dette modellutvalget.

Hvem får den og hva den er til for

OpenAI retter nivået mot tidskritiske oppgaver med store konsekvenser: hendelseshåndtering mens et driftsavbrudd pågår, finansanalyse mens markedsforholdene endrer seg, kundestøtte og tale i sanntid, handel og løpende analysearbeid som tidligere måtte kjøres over natten. Selskaper innen programmering, handel og finans har fått tidlig tilgang, blant dem Jane Street, Podium, Basis og Rogo.

«Hastighetsøkningen Cerebras gir, er imponerende», sa John Crepezzi fra AI Assistants hos Jane Street i OpenAIs kunngjøring. «Den åpner for andre måter å bruke modellene på og gjør det praktisk mulig for utviklere å arbeide mer fokusert og produktivt sammen med dem.»

OpenAI begrenser utrullingen med hensikt. Selskapet sier at det bruker forhåndsvisningen til å lære hvor en tidobling av hastigheten skaper mest verdi, og vil utvide tilgangen etter hvert som kapasiteten vokser. Både OpenAI og Cerebras tilbyr påmelding til oppdateringer mens forhåndsvisningen blir tilgjengelig for flere.

Hva skjer videre

På kort sikt er det kapasiteten som kan observeres, ikke nye evner. Ultrafast er en begrenset forhåndsvisning, og begge selskapene knytter bredere tilgjengelighet til kapasitetsvekst fremfor en bestemt dato. Utvidelsestakten blir derfor viktig å følge. På lengre sikt er spørsmålet om Cerebras’ fordel med minne på brikken varer når OpenAIs modeller blir større — nettopp det arkitekturen i silisiumskiveskala er bygget for å satse på.

Theo Nash er en AI-generert spesialist hos Unite.AI, som dekker AI-infrastruktur, beregning og maskinvaresystemene som driver moderne kunstig intelligens. Arbeidet hans fokuserer på de tekniske grunnlagene bak AI-arbeidsbelastninger i stor skala, inkludert datasentre, akseleratorer, nettverk og programvarestablene som binder dem sammen.

Med et analytisk og ingeniørdrevet perspektiv undersøker Theo hvordan fremskritt innen GPU-er, tilpasset silisium, minnearkitekturer og distribuerte systemer muliggjør nye generasjoner av AI-modeller. Han legger særlig vekt på ytelsesavveininger, energieffektivitet, skalerbarhet og de praktiske begrensningene som former implementeringen av AI-infrastruktur i den virkelige verden.

Artikler skrevet av Theo Nash er AI-genererte og gjennomgås av redaksjonsteamet i Unite.AI for å sikre teknisk nøyaktighet, klarhet og ansvarlig dekning av det raskt utviklende AI-beregningslandskapet.