AI-modellen en platforms

Cerebras meldt 5X-inferentiedoorvoerverhoging door disaggregatie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Cerebras Systems zei op 1 oktober 2026 dat het de inferentiedoorvoer met 5× heeft verhoogd in vroege resultaten met een techniek die disaggregatie wordt genoemd, met hetzelfde aantal Cerebras‑systemen en zonder verlies in tokensnelheid. De bekendmaking verscheen in Gedissegregeerde inferentie vanaf de basis, een bedrijfsblogpost van Isaac Tai en Zhenwei Gao die een geplande serie over het onderwerp opent.

De post plaatst de serie voor lezers die de term disaggregatie hebben gehoord, of de bewering dat prefill rekenintensief en decode geheugenintensief is, en zich afvroegen wat elk eigenlijk betekent. Hij bouwt de uitleg vanaf de basis op, beginnend met hoe versnellers rekenwerk afwegen tegen dataverplaatsing.

Prefill en decode leggen verschillende eisen op hardware

De post definieert rekenintensiteit als het aantal floating‑point‑bewerkingen gedeeld door het aantal bytes dat tussen het geheugen en de rekeneenheden van een accelerator wordt verplaatst. In een van de voorbeelden voert het optellen van twee matrices 1 FLOP uit voor elke 6 bytes die worden verplaatst, een rekenintensiteit van 0,167 FLOP per byte, en die verhouding blijft constant naarmate de matrices groeien. Matrixvermenigvuldiging gedraagt zich anders: elke outputwaarde wordt opgebouwd uit een volledige rij van de ene invoer en een volledige kolom van de andere, waardoor geladen waarden bijdragen aan meer outputs en de rekenintensiteit toeneemt met de invoergrootte.

Inferentie, legt de post uit, is een keten van dergelijke matrixvermenigvuldigingen tussen de vaste gewichten van een model en zijn invoertokens, en verloopt in twee fasen met verschillende intensiteitsprofielen. Tijdens prefill wordt de volledige prompt parallel verwerkt als een grote matrixbewerking, en real‑world prompts kunnen duizenden of zelfs honderdduizenden tokens bevatten. Tijdens decode worden tokens één voor één gegenereerd, en het model maakt gebruik van de KV‑cache, die sleutels en waarden opslaat die voor eerdere tokens zijn berekend zodat ze hergebruikt worden in plaats van opnieuw te worden berekend.

Beide fasen moeten nog steeds alle gewichten van het model, mogelijk honderden gigabytes of terabytes, naar de rekeneenheden verplaatsen voor elke gegenereerde token. De post toont aan dat het geheugenverkeer vrijwel constant blijft terwijl de rekenintensiteit daalt na prefill, en noemt die kloof de reden waarom het toevoegen van ruwe rekencapaciteit niet per se leidt tot snellere tokenlevering tijdens decode.

Disaggregatie splitst inferentie in afzonderlijke pools

In productie verwerkt een inference‑server doorgaans veel verzoeken gelijktijdig, en wanneer prefill en decode op dezelfde hardware draaien, kan de rekenintensieve prefill actieve decode‑verzoeken vertragen. Planners moeten dan kiezen tussen het snel naar het eerste token van nieuwe verzoeken brengen, actieve responsen vloeiend laten streamen, en de totale doorvoer maximaliseren. Batching laat gelijktijdige verzoeken het lezen van modelgewichten delen, maar grotere batches kunnen elke decode‑stap langer laten duren, waardoor de totale doorvoer kan stijgen terwijl elke gebruiker tokens langzamer ontvangt.

De post beschrijft disaggregatie als een systeem‑ontwerppatroon dat de twee fasen in afzonderlijke hardware‑pools uitvoert. Zodra de fasen gescheiden zijn, kunnen operators hardware toewijzen, batch‑beleid instellen en latentie of doorvoer voor elke fase onafhankelijk prioriteren: een systeem met strikte tijd‑tot‑eerste‑token‑doelen kan meer capaciteit voor prefill reserveren, terwijl een systeem dat gericht is op vloeiende streaming decode een grotere of strakker geplande pool kan geven. De pools kunnen ook individueel worden opgeschaald.

Scheiding introduceert een nieuwe eis. Nadat prefill de KV‑cache heeft opgebouwd, moet die verzoek‑specifieke status worden overgebracht naar de decode‑pool, waar deze in het geheugen wordt geladen voordat de generatie kan doorgaan, terwijl de modelgewichten al in beide pools geladen zijn. De post merkt op dat de overdracht netwerk‑ en coördinatie‑overhead toevoegt, dat elke pool idle kan blijven als de capaciteit niet overeenkomt met de vraag, en dat de toegevoegde latentie afhangt van of de cache zich verplaatst tussen gecoloceerde machines of tussen regio’s. Er wordt betoogd dat disaggregatie het meest overtuigend is op grote schaal, waar winsten door onafhankelijk de grootte en planning van de pools te bepalen de overdrachts‑ en operationele kosten kunnen compenseren, en dat het de besturings‑interface van het serveersysteem verandert in plaats van alleen streaming te verzachten.

Heterogene hardware, vroege resultaten en partnerschappen

Cerebras zei dat het de ontwikkeling van heterogene disaggregatie leidt, waarbij meerdere soorten chips in één inferentiesysteem worden gecombineerd en verschillende hardware wordt toegewezen aan de segmenten die geheugen‑intensief of reken‑intensief zijn. De post zet het wafer‑scale‑ontwerp van het bedrijf tegenover dat van GPU’s, die modeldata van high‑bandwidth‑memory via kleinere on‑chip‑memorieën en caches verwerken.

Een gepubliceerde piek‑geheugen‑bandbreedte‑grafiek in de post, gedateerd 10 september 2026, vermeldt Cerebras WSE‑3 on‑chip SRAM op 21.000 TB/s per wafer, naast een niet‑genoemde on‑chip SRAM‑accelerator op 150 TB/s en HBM4‑GPU’s op 23,3 en 22 TB/s. De grafiek waarschuwt dat SRAM‑cijfers de lokale geheugen‑bandbreedte over een processor optellen, terwijl HBM‑cijfers het verkeer van off‑chip‑geheugen meten, zodat de cijfers verschillende geheugenniveaus beschrijven in plaats van gemeten tokensnelheden.

De post reproduceert ook Artificial Analysis-gegevens van 10 september 2026 voor GPT-oss-120B die hoge redenering uitvoert met 10.000 invoertokens. Het vermeldt Cerebras met 1.669 outputtokens per seconde, SambaNova met 708, Groq met 475, Microsoft Azure met 319, Nebius met 294 en Baseten met 293.

Cerebras zei dat in een traditioneel geaggregeerd systeem het vergroten van de capaciteit betekende dat er meer hardware moest worden ingezet, en dat door partner‑accelerators te gebruiken voor het verwerken van prompts de capaciteit in vroege tests met dezelfde WSE‑footprint met 5× werd vergroot. Het bedrijf meldde dat het partnerschappen heeft aangekondigd met meerdere hardware‑partners om meer ultrasnelle tokens op de markt te brengen, en een diagram in de post toont AWS Trainium‑ en AMD Helios Instinct‑GPU‑systemen onder de prefill‑hardware‑opties die een Cerebras‑decode‑pool voeden.

De post identificeert agentische toepassingen als een overtuigende match voor heterogene disaggregatie, omdat ze vaak lange, meertraps‑werkstromen omvatten waarin de context groeit over model‑aanroepen en vertragingen bij elke stap zich opstapelen. Cerebras zei dat de volgende afleveringen de betrokken hardware‑ en software‑stacks zullen behandelen en de economische afwegingen van het inzetten van gedistribueerde inferentie op schaal.

Theo Nash is een AI‑gegenereerde specialist bij Unite.AI, die AI‑infrastructuur, rekenkracht en de hardware‑systemen die moderne kunstmatige intelligentie aandrijven, behandelt. Zijn werk richt zich op de technische basis van grootschalige AI‑werkbelastingen, inclusief datacenters, versnellers, netwerken en de software‑stacks die ze met elkaar verbinden.

Met een analytisch en engineering‑gedreven perspectief onderzoekt Theo hoe vooruitgang in GPU's, custom silicon, geheugenarchitecturen en gedistribueerde systemen nieuwe generaties AI‑modellen mogelijk maakt. Hij besteedt bijzondere aandacht aan prestatie‑afwegingen, energie‑efficiëntie, schaalbaarheid en de praktische beperkingen die de implementatie van AI‑infrastructuur in de echte wereld vormgeven.

Artikelen geschreven door Theo Nash zijn AI‑gegenereerd en worden beoordeeld door de redactie van Unite.AI om technische nauwkeurigheid, helderheid en verantwoordelijke berichtgeving over het snel evoluerende AI‑rekenlandschap te waarborgen.