AI-modeller og platforme

Cerebras rapporterer 5‑gange højere inferensgennemløb som følge af disaggregation

mm
Føj Unite.AI til dine foretrukne kilder på Google

Cerebras Systems sagde den 1. oktober 2026, at de øgede inferensgennemløbet femfoldigt i tidlige resultater ved hjælp af en teknik kaldet disaggregation, med samme antal Cerebras‑systemer og uden tab i token‑genereringshastigheder. Oplysningen kom i Disaggregated Inference Fra Bunden, et blogindlæg fra virksomheden skrevet af Isaac Tai og Zhenwei Gao, som indleder en planlagt serie om emnet.

Indlægget indrammer serien for læsere, der har hørt udtrykket disaggregation, eller påstanden om, at prefill er compute‑bound og decode er memory‑bound, og som har spekuleret på, hvad det egentlig betyder. Det opbygger forklaringen fra bunden af, begyndende med hvordan acceleratorer balancerer aritmetik mod databevægelse.

Prefill og Decode pålægger forskellige krav til hardware

Indlægget definerer aritmetisk intensitet som antallet af floating‑point‑operationer divideret med antallet af byte, der overføres mellem hukommelsen og en accelerators beregningsenheder. I et af eksemplerne udfører addition af to matricer 1 FLOP for hver 6 byte, en aritmetisk intensitet på 0,167 FLOP per byte, og dette forhold forbliver konstant, efterhånden som matricerne vokser. Matrixmultiplikation opfører sig anderledes: hver outputværdi bygges ud fra en hel række af den ene input og en hel kolonne af den anden, så de indlæste værdier bidrager til flere outputs, og den aritmetiske intensitet vokser med inputstørrelsen.

Indlægget forklarer, at inferens er en kæde af sådanne matrixmultiplikationer mellem en models faste vægte og dens input‑tokens, og at den kører i to faser med forskellige intensitetsprofiler. Under prefill behandles hele prompten parallelt som en stor matrixoperation, og virkelige prompts kan indeholde tusinder eller endda hundredtusinder af tokens. Under decode genereres tokens én ad gangen, og modellen er afhængig af KV‑cachen, som gemmer nøgler og værdier beregnet for tidligere tokens, så de kan genbruges i stedet for at blive beregnet igen.

Begge faser skal stadig flytte alle modellens vægte, potentielt hundredevis af gigabyte eller terabyte, til beregningsenhederne for hver token, der genereres. Indlægget viser, at hukommelsesbevægelsen forbliver næsten konstant, mens den aritmetiske intensitet falder efter prefill, og det peger på dette hul som årsagen til, at tilføjelse af rå beregningskapacitet ikke nødvendigvis får tokens til at ankomme hurtigere under decode.

Disaggregation opdeler inferens i separate puljer

I produktion håndterer en inference‑server typisk mange anmodninger samtidigt, og når prefill og decode kører på den samme hardware, kan den beregningstunge prefill forsinke aktive decode‑anmodninger. Planlæggere skal så vælge mellem at få nye anmodninger til deres første token hurtigt, holde aktive svar i en jævn streaming, og maksimere den samlede gennemløb. Batching gør det muligt for samtidige anmodninger at dele arbejdet med at læse modellens vægte, men større batches kan få hvert decode‑trin til at tage længere, så den samlede gennemløb kan stige, mens hver bruger modtager tokens langsommere.

Indlægget beskriver disaggregation som et systemdesignmønster, der kører de to faser i separate hardware‑puljer. Når faserne er adskilt, kan operatører tildele hardware, fastsætte batch‑politikker og prioritere latenstid eller gennemløb for hver fase uafhængigt: et system med strenge mål for tid til første token kan reservere mere kapacitet til prefill, mens et system bygget omkring glat streaming kan give decode en større eller mere stramt planlagt pulje. Puljerne kan også skaleres individuelt.

Adskillelsen introducerer et nyt krav. Efter at prefill har bygget KV‑cachen, skal denne anmodningsspecifikke tilstand overføres til decode‑puljen, hvor den indlæses i hukommelsen, før genereringen kan fortsætte, mens modellens vægte allerede er indlæst i begge puljer. Indlægget bemærker, at overdragelsen tilføjer netværks‑ og koordineringsomkostninger, at enten pulje kan stå ubrugt, hvis kapaciteten ikke matcher efterspørgslen, og at den ekstra latenstid afhænger af, om cachen flyttes mellem same‑location‑maskiner eller mellem regioner. Det argumenterer for, at disaggregation er mest overbevisende i stor skala, hvor gevinster ved uafhængig dimensionering og planlægning af puljerne kan opveje overførsels‑ og driftsomkostninger, og at det ændrer kontrol‑interfacet for serveringssystemet frem for kun at udglatte streaming.

Heterogen hardware, tidlige resultater og partnerskaber

Cerebras sagde, at de leder udviklingen af heterogen disaggregation, ved at kombinere flere typer chips i ét inferenssystem og tildele forskellig hardware til de segmenter, der er memory‑bound eller compute‑bound. Indlægget sammenligner virksomhedens wafer‑scale‑design, som fordeler SRAM sammen med beregning over hele waferet, med GPU’er, som overfører modeldata fra høj‑båndbredde‑hukommelse gennem mindre on‑chip‑hukommelser og caches.

Et offentliggjort top‑memory‑båndbredde‑diagram i indlægget, dateret den 10. september 2026, viser Cerebras WSE‑3 on‑chip SRAM på 21.000 TB/s pr. wafer, sammen med en unavngivet on‑chip SRAM‑accelerator på 150 TB/s og HBM4‑GPU’er på 23,3 og 22 TB/s. Diagrammet advarer om, at SRAM‑tallene summerer lokal hukommelsesbåndbredde på tværs af en processor, mens HBM‑tallene måler trafik fra off‑chip‑hukommelse, så tallene beskriver forskellige hukommelseslag i stedet for målte token‑hastigheder.

Indlægget gengiver også Artificial Analysis-data fra 10. september 2026 for GPT-oss-120B, der kører høj ræsonnement med 10.000 input‑tokens. Det viser Cerebras med 1.669 output‑tokens per sekund, SambaNova med 708, Groq med 475, Microsoft Azure med 319, Nebius med 294 og Baseten med 293.

Cerebras sagde, at i et traditionelt aggregeret system betød en kapacitetsforøgelse, at der skulle implementeres mere hardware, og at ved at udnytte partneracceleratorer til at håndtere prompt‑behandling øgede man kapaciteten med 5‑fold i tidlige tests med samme WSE‑fodaftryk. Virksomheden oplyste, at den har annonceret partnerskaber med flere hardware‑partnere for at bringe flere ultrahurtige tokens på markedet, og et diagram i indlægget viser AWS Trainium og AMD Helios Instinct GPU‑systemer blandt prefill‑hardwaremulighederne, der fodrer en Cerebras‑dekodningspulje.

Indlægget identificerer agentbaserede applikationer som en overbevisende anvendelse af heterogen disaggregation, da de ofte involverer lange, flertrins‑arbejdsprocesser, hvor konteksten vokser på tværs af model‑kald, og forsinkelser på hvert trin forstærkes. Cerebras sagde, at de næste dele vil dække de involverede hardware‑ og software‑stakke samt de økonomiske afvejninger ved at implementere disaggregated inference i stor skala.

Theo Nash er en AI‑genereret specialist hos Unite.AI, der dækker AI‑infrastruktur, beregning og de hardware‑systemer, der driver moderne kunstig intelligens. Hans arbejde fokuserer på de tekniske grundlag bag store AI‑arbejdsbelastninger, herunder datacentre, acceleratorer, netværk og software‑stakke, der binder dem sammen.

Med et analytisk og ingeniørdrevet perspektiv undersøger Theo, hvordan fremskridt inden for GPU’er, specialdesignet silicium, hukommelsesarkitekturer og distribuerede systemer muliggør nye generationer af AI‑modeller. Han lægger særlig vægt på præstationsafvejninger, energieffektivitet, skalerbarhed og de praktiske begrænsninger, der former implementeringen af AI‑infrastruktur i den virkelige verden.

Artikler skrevet af Theo Nash er AI‑genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre teknisk nøjagtighed, klarhed og ansvarlig dækning af det hastigt udviklende AI‑beregningslandskab.