AI-modeller och plattformar
Cerebras kör OpenAIs GPT-5.6 Sol med 750 token per sekund i den nya Ultrafast‑nivån

Cerebras (CBRS ) kör nu OpenAIs flaggskeppsmodell med en hastighet som ingen GPU‑molntjänst offentligt har matchat. Den 13 augusti 2026 annonserade att de driver GPT-5.6 Sol på en ny OpenAI‑tjänstenivå som heter Ultrafast, levererar upp till 750 utdata‑token per sekund och, enligt OpenAIs uppgift, kör modellen upp till 14× snabbare än standardbehandling. Ultrafast lanseras först i OpenAI‑API:et som en begränsad förhandsvisning för en utvald grupp kunder, med åtkomst som utökas i takt med att kapaciteten växer.
Påståendet i centrum är ett specifikt: frontlinje‑intelligens utan hastighetsstraffet. GPT-5.6 Sol är OpenAIs mest kapabla modell, och på Cerebras‑silicium genererar den token så snabbt att den kan integreras i realtidsprodukter snarare än ligga bakom ett övernatts‑batchjobb. Båda företagen beskriver nivån som ett sätt att ta bort kompromissen mellan en modell som är tillräckligt smart för höginsatsarbete och en som är tillräckligt snabb för att användas medan arbetet pågår.
Hastighetssiffrorna bakom Ultrafast
Siffran 750 utdata‑token per sekund är rubriken, men de mer avslöjande jämförelserna är de direkta testerna som Cerebras publicerade. Mot de utdatahastigheter som Artificial Analysis rapporterade säger företaget att GPT-5.6 Sol på Ultrafast är 11× snabbare än Claude Fable 5 och 5× snabbare än Opus 4.8 i Fast‑läge.
Cerebras testade också nivån genom hela Humanity’s Last Exam, ett benchmark med 2 500 frågor på PhD‑nivå. GPT-5.6 Sol på Ultrafast svarade på alla 2 500 frågor på 11 timmar och 11 minuter; Claude Fable 5 behövde 78 timmar och 27 minuter för att nå jämförbara slutsatser: nästan 7× långsammare, enligt Cerebras. På GDP‑Val, ett benchmark för ekonomiskt värdefullt kunskapsarbete, rapporterar företaget en 5,6× helhetsökning i hastighet jämfört med standardbehandling utan kvalitetsförsämring.
Detta är leverantörsdrivna utvärderingar, och Cerebras är tydlig med det: jämförelsen med Humanity’s Last Exam benchmarkades av Cerebras den 10 juli samt 13–15 juli 2026, och GDP‑Val‑siffran kommer från deras egna tester den 31 juli 2026. Betrakta dem som företagets egna mätningar, inte oberoende resultat.
Varför wafer‑scale‑chipet vinner på latens
Mekanismen är viktig här, eftersom den förklarar varför en relativt liten chipstillverkare levererar OpenAIs största modell med hastigheter som GPU‑konkurrenterna inte har kunnat matcha. Snabb inferens på en stor modell är i grunden ett problem med datatransport: på GPU:er måste modellvikter ständigt flyttas mellan on‑chip‑minne och off‑chip‑lagring för att generera varje efterföljande token, och minnesbandbredden blir flaskhalsen.
Cerebras svar är att eliminera den förflyttningen. Dess Wafer‑Scale Engine packar 44 GB SRAM på ett enda wafer‑stort chip, så modellvikterna stannar på chipet och token flödar genom lager som pipelinas över wafers utan avbrott. Eftersom vikterna aldrig lämnar silikonen skalar metoden med modellens storlek — vilket är företagets argument för att hastighetsfördelen kvarstår när frontlinjemodellerna växer. För inferensekonomi är det hela spelet: kostnaden och latensen för att leverera en modell domineras av hur snabbt du kan mata vikterna till beräkningen, och att hålla 44 GB på ett enda die angriper detta direkt.
Ett partnerskap på 10 miljarder dollar når flaggskeppet
Ultrafast är den mest synliga produkten hittills i ett förhållande som byggts upp under månader. OpenAI valde Cerebras för 10 miljarder dollar i låg‑latens‑beräkning tidigare under 2026, och denna lansering placerar den kapaciteten bakom företagets toppmodell snarare än en mindre eller specialiserad. OpenAI beskriver Ultrafast som ”nästa steg” i partnerskapet för att föra ultra‑låg‑latens‑inferens till sin plattform.
För Cerebras är placeringen betydelsefull. Startupen har länge hävdat att dess wafer‑scale‑arkitektur är rätt form för inferens även när marknadens tyngdpunkt ligger hos GPU‑leverantörerna — en tävling som pågår inom acceleratorbranschen när de etablerade går över till att integrera modeller direkt i deras silikon. Att landa serveringslagret för OpenAIs flaggskepp ger Cerebras ett produktionsreferenskonto högst upp på marknaden. Modellen själv förankrar GPT-5.6‑familjen som OpenAI lanserade (Sol som flaggskepp, tillsammans med den balanserade Terra och den kostnadseffektiva Luna), så Ultrafast fäster Cerebras i fronten av den produktlinjen.
Vem får den och vad den är för
OpenAI positionerar nivån för tidskänsligt, höginsatsarbete: incidentrespons medan ett avbrott fortfarande pågår, finansiell forskning medan marknadsförhållanden förändras, realtidskundsupport och röst, handel och live‑forskningsloopar som tidigare kördes över natten. Tidig åtkomst har gått till företag inom kodning, handel och finans, inklusive Jane Street, Podium, Basis och Rogo.
”Den hastighetsökning som Cerebras levererar är imponerande,” sade John Crepezzi, AI Assistants på Jane Street, i OpenAIs tillkännagivande. ”Den möjliggör olika sätt att använda modellerna och gör det praktiskt för utvecklare att arbeta på ett mer fokuserat och produktivt sätt tillsammans med dem.”
OpenAI håller medvetet utrullningen begränsad. Företaget säger att de använder förhandsvisningsperioden för att lära sig var en hastighetsökning på en ordningsmagnitude skapar mest värde, och kommer att utöka åtkomsten i takt med att kapaciteten växer. Både OpenAI och Cerebras tar emot anmälningar för uppdateringar när förhandsvisningen breddas.
Vad händer härnäst
Det som är observerbart på kort sikt är kapacitet, inte kapabilitet. Ultrafast är en begränsad förhandsvisning, och båda företagen kopplar eventuell bredare tillgänglighet till kapacitetsökning snarare än ett fast datum — så expansionshastigheten är det man bör bevaka. Den längre frågan är om Cerebras fördel med on‑chip‑minne kvarstår när OpenAIs modeller skalar, vilket exakt är det satsning som wafer‑scale‑arkitekturen bygger på.












