AI-modeller och plattformar
Cerebras rapporterar 5X‑ökning av inferenstillströmning genom disaggregation

Cerebras Systems meddelade den 1 oktober 2026 att de ökade inferenstillströmningen med 5‑fald i tidiga resultat genom en teknik som kallas disaggregation, med samma antal Cerebras‑system och utan förlust i token‑genereringshastigheter. Avslöjandet kom i Disaggregated Inference From the Ground Up, ett företagsblogginlägg av Isaac Tai och Zhenwei Gao som inleder en planerad serie om ämnet.
Inlägget inramar serien för läsare som har hört termen disaggregation, eller påståendet att förifyllning är beräkningsbunden och avkodning är minnesbunden, och som undrat vad någon av dem faktiskt betyder. Det bygger förklaringen från grunden, med början i hur acceleratorer balanserar aritmetik mot datatransport.
Förifyllning och avkodning ställer olika krav på hårdvaran
Inlägget definierar aritmetisk intensitet som antalet flyttalsoperationer delat med antalet byte som överförs mellan minnet och en accelerators beräkningsenheter. I ett av exemplen utför addition av två matriser 1 FLOP för varje 6 byte som flyttas, en aritmetisk intensitet på 0,167 FLOP per byte, och detta förhållande förblir konstant när matriserna växer. Matrismultiplikation beter sig annorlunda: varje utdatavärde byggs upp från en hel rad i en inmatning och en hel kolumn i den andra, så laddade värden bidrar till fler utdata och den aritmetiska intensiteten ökar med indatat storlek.
Inferens, förklarar inlägget, är en kedja av sådana matrismultiplikationer mellan en modells fasta vikter och dess inmatningstoken, och den körs i två faser med olika intensitetsprofiler. Under förifyllning bearbetas hela prompten parallellt som en stor matrisoperation, och verkliga promptar kan innehålla tusentals eller till och med hundratusentals token. Under avkodning genereras token en i taget, och modellen förlitar sig på KV‑cachen, som lagrar nycklar och värden beräknade för tidigare token så att de återanvänds istället för att beräknas på nytt.
Båda faserna måste fortfarande flytta alla modellens vikter, potentiellt hundratals gigabyte eller terabyte, till beräkningsenheterna för varje genererad token. Inlägget visar att minnesrörelsen förblir nästan konstant medan den aritmetiska intensiteten minskar efter förifyllning, och hänvisar till detta gap som orsaken till att ökad rå beräkningskapacitet inte nödvändigtvis gör att token anländer snabbare under avkodning.
Disaggregation delar upp inferens i separata pooler
I produktion hanterar en inferensserver vanligtvis många förfrågningar samtidigt, och när förifyllning och avkodning körs på samma hårdvara kan den beräkningsintensiva förifyllningen hindra aktiva avkodningsförfrågningar. Schemaläggare måste då välja mellan att snabbt ge nya förfrågningar deras första token, hålla aktiva svar strömmande smidigt och maximera total genomströmning. Batching låter samtidiga förfrågningar dela på arbetet med att läsa modellvikter, men större batcher kan göra varje avkodningssteg längre, så total genomströmning kan öka medan varje användare får token långsammare.
Inlägget beskriver disaggregation som ett systemdesignmönster som kör de två faserna i separata hårdvarupooler. När stegen är separerade kan operatörer tilldela hårdvara, sätta batch‑policyer och prioritera latens eller genomströmning för varje fas oberoende: ett system med strikta mål för tid till första token kan reservera mer kapacitet för förifyllning, medan ett system byggt för smidig strömning kan ge avkodning en större eller mer tätt schemalagd pool. Poolerna kan också skalas individuellt.
Separationen inför ett nytt krav. Efter att förifyllning har byggt KV‑cachen måste den förfrågningsspecifika staten överföras till avkodningspoolen, där den laddas in i minnet innan genereringen kan fortsätta, medan modellvikterna redan är laddade i båda poolerna. Inlägget påpekar att överlämningen lägger till nätverks‑ och samordningskostnader, att någon av poolerna kan stå tomma om kapaciteten inte matchar efterfrågan, och att den extra latensen beror på om cachen flyttas mellan samlokalerade maskiner eller över regioner. Det hävdas att disaggregation är mest attraktiv i stor skala, där vinsterna från att oberoende dimensionera och schemalägga poolerna kan överväga överförings‑ och driftskostnader, och att det förändrar kontrollgränssnittet för serveringssystemet snarare än bara jämna ut strömningen.
Heterogen hårdvara, tidiga resultat och partnerskap
Cerebras uppgav att de leder utvecklingen av heterogen disaggregation, genom att kombinera flera typer av chip i ett inferenssystem och tilldela olika hårdvara till de segment som är minnesbundna eller beräkningsbundna. Inlägget jämför företagets wafer‑scale‑design, som distribuerar SRAM tillsammans med beräkning över hela wafer, med GPU:er, som stegvis hanterar modelldata från högbandbreddsmemory genom mindre on‑chip‑minnen och cache.
Ett publicerat diagram över topp‑minnesbandbredd i inlägget, daterat 10 september 2026, listar Cerebras WSE‑3 on‑chip‑SRAM på 21 000 TB/s per wafer, tillsammans med en namnlös on‑chip‑SRAM‑accelerator på 150 TB/s och HBM4‑GPU:er på 23,3 och 22 TB/s. Diagrammet varnar för att SRAM‑siffrorna summerar lokal minnesbandbredd över en processor medan HBM‑siffrorna mäter trafik från minne utanför chipet, så siffrorna beskriver olika minnesnivåer snarare än uppmätta tokenhastigheter.
Inlägget återger också Artificial Analysis-data från den 10 september 2026 för GPT-oss-120B som kör hög resonemang med 10 000 ingångstoken. Det listar Cerebras med 1 669 utgångstoken per sekund, SambaNova med 708, Groq med 475, Microsoft Azure med 319, Nebius med 294 och Baseten med 293.
Cerebras sade att i ett traditionellt aggregerat system innebar ökad kapacitet att distribuera mer hårdvara, och att genom att utnyttja partneracceleratorer för att hantera promptbearbetning ökade kapaciteten med 5 × i tidiga tester med samma WSE-fotavtryck. Företaget meddelade att det har ingått partnerskap med flera hårdvarupartners för att leverera fler ultrarapida token till marknaden, och ett diagram i inlägget visar AWS Trainium och AMD Helios Instinct GPU‑system bland förhandsfylla‑hårdvarualternativen som matar en Cerebras‑avkodningspool.
Inlägget identifierar agentbaserade applikationer som ett övertygande exempel på heterogen disaggregation, eftersom de ofta involverar långa, flerstegsarbetsflöden där kontexten växer över modellanrop och fördröjningar i varje steg adderas. Cerebras sade att de kommande avsnitten kommer att behandla hårdvaru‑ och mjukvarustacken som är inblandade samt de ekonomiska avvägningarna vid implementering av disaggregated inference at scale.












