AI-modeller och plattformar
Cerebras kör OpenAI:s GPT-5.6 Sol med 750 token per sekund i ny Ultrafast-nivå

Cerebras kör nu OpenAI:s flaggskeppmodell i en hastighet som ingen GPU-molntjänst har matchat offentligt. Den 13 augusti 2026 meddelade wafer-skale-chip-tillverkaren att de driver GPT-5.6 Sol på en ny OpenAI-tjänstnivå som kallas Ultrafast, som levererar upp till 750 utdatatoken per sekund och, enligt OpenAI:s beskrivning, kör modellen upp till 14 gånger snabbare än standardbearbetning. Ultrafast lanseras först i OpenAI API som en begränsad förhandsvisning för en utvald grupp kunder, med tillgång som utökas allteftersom kapaciteten växer.
Anspråket i centrum är ett specifikt: gränsintelligens utan hastighetsstraff. GPT-5.6 Sol är OpenAI:s mest kapabla modell, och på Cerebras kisel genererar den token så snabbt att den kan sitta i realtidsprodukter snarare än bakom en nattlig batchjobb. Båda företagen beskriver nivån som att den tar bort avvägningen mellan en modell som är tillräckligt smart för högriskarbete och en som är tillräckligt snabb för att användas medan arbetet fortfarande pågår.
Hastighetsnumren bakom Ultrafast
De 750 utdatatokena per sekund är rubriken, men de mer avslöjande jämförelserna är de huvud-mot-huvud-körningar som Cerebras publicerade. Mot utdatningshastigheter som rapporterats av Artificial Analysis säger företaget att GPT-5.6 Sol på Ultrafast kör 11 gånger snabbare än Claude Fable 5 och 5 gånger snabbare än Opus 4.8 på snabb läge.
Cerebras körde också nivån genom en fullständig passering av Humanity’s Last Exam, en 2 500-frågebenchmark som riktas mot doktorsexamensnivå. GPT-5.6 Sol på Ultrafast svarade på alla 2 500 frågorna på 11 timmar och 11 minuter; Claude Fable 5 behövde 78 timmar och 27 minuter för att nå jämförbara slutsatser: nästan 7 gånger långsammare, enligt Cerebras. På GDP-Val, en benchmark för ekonomiskt värdefull kunskapsarbete, rapporterar företaget en 5,6-gånger snabbare slut-till-slut-hastighet jämfört med standardbearbetning utan kvalitetsförsämring.
Detta är utvärderingar som utförts av leverantören, och Cerebras är tydliga med det: jämförelsen med Humanity’s Last Exam testades av Cerebras den 10 och 13-15 juli 2026, och GDP-Val-siffran kommer från deras egen testning den 31 juli 2026. Behandla dem som företagets egna mätningar, inte oberoende resultat.
Varför wafer-skale-chippet vinner på latens
Mekanismen är viktig här, eftersom den förklarar varför en relativt liten chip-tillverkare kan betjäna OpenAI:s största modell i hastigheter som GPU-jättarna inte har matchat. Snabb inferens på en stor modell är i grunden ett data-rörelseproblem: på GPU:er måste modellvikterna skickas mellan chip-minne och extern lagring för att generera varje efterföljande token, och minnesbandbredden blir flaskhalsen.
Cerebras svar är att eliminera den rörelsen. Deras Wafer-Scale Engine packar 44 GB SRAM på en enda wafer-stor chip, så modellvikterna stannar på chipet och token flyter genom lager som pipelinas över wafer utan avbrott. Eftersom vikterna aldrig lämnar kiseln, skalar tillvägagångssättet med modellstorlek — vilket är företagets argument för att hastighetsfördelen består när gränsmodellerna växer. För inferens-ekonomi är det hela spelet: kostnaden och latensen för att betjäna en modell domineras av hur snabbt du kan mata vikter till beräkningen, och att hålla 44 GB boende på en enda die attackerar det direkt.
En 10 miljarders partnerskap når flaggskeppet
Ultrafast är den mest synliga produkten hittills av ett förhållande som har byggts upp under månader. OpenAI anlitade Cerebras för 10 miljarder i låglatensberäkning tidigare i 2026, och den här lanseringen sätter den kapaciteten bakom företagets toppmodell snarare än en mindre eller specialiserad en. OpenAI beskriver Ultrafast som “nästa steg” i partnerskapet för att bringa ultra-låglatens-inferens till sin plattform.
För Cerebras är placeringen betydelsefull. Startupen har länge hävdat att deras wafer-skale-arkitektur är rätt form för inferens, även om marknadens tyngdpunkt ligger hos GPU-leverantörer — en tävling som utspelar sig över acceleratorbranschen när etablerade företag flyttar för att baka in modeller direkt i sin kisel. Att få serverlagret för OpenAI:s flaggskepp ger Cerebras en produktionsreferenskonto på toppen av marknaden. Modellen i sig förankrar GPT-5.6-familjen som OpenAI lanserade (Sol som flaggskepp, tillsammans med den balanserade Terra och den kostnadseffektiva Luna), så Ultrafast kopplar Cerebras till framsidan av den linjen.
Vem får det och vad det är till
OpenAI riktar nivån mot tidskänsligt, högriskarbete: incidenthantering medan en avbrott fortfarande pågår, finansiell forskning medan marknadsförhållanden förändras, realtidskundsupport och röst, handel och levande forskningsloopar som tidigare kördes på natten. Tidig tillgång har getts till företag inom kodning, handel och finans, inklusive Jane Street, Podium, Basis och Rogo.
> “Hastighetsökningen som Cerebras medför är imponerande”, sa John Crepezzi, AI-assistent på Jane Street, i OpenAI:s tillkännagivande. “Det möjliggör olika sätt att använda modellerna och gör det praktiskt för utvecklare att arbeta på ett mer fokuserat och produktivt sätt tillsammans med dem.”
OpenAI håller utrullningen smal medvetet. Företaget säger att de använder förhandsvisningsperioden för att lära sig var en hastighetsförändring på en storleksordning skapar mest värde och kommer att utöka tillgången allteftersom kapaciteten växer. Både OpenAI och Cerebras tar emot anmälningar för uppdateringar när förhandsvisningen breddas.
Vad händer härnäst
Den närmaste observerbara är kapacitet, inte förmåga. Ultrafast är en begränsad förhandsvisning, och båda företagen knyter en bredare tillgänglighet till kapacitetsväxt snarare än en fast datum — så expansions takten är det som ska observeras. Den längre frågan är om Cerebras på-chip-minnes-fördel består när OpenAI:s modeller skalar, vilket är exakt den satsning som wafer-skale-arkitekturen byggs på.












