Modely a platformy AI
Cerebras oznamuje 5X zvýšení propustnosti inferování díky disaggregaci

Cerebras Systems uvedla dne 1. října 2026, že díky technice zvané disaggregace zvýšila propustnost inferování pětinásobně v raných výsledcích, přičemž použila stejný počet systémů Cerebras a nedošlo ke ztrátě rychlosti generování tokenů. Informace byly zveřejněny v Rozdělené inferování od základů, blogovém příspěvku společnosti od Isaaca Taiho a Zhenweia Gaoa, který zahajuje plánovanou sérii na toto téma.
Příspěvek uvádí sérii pro čtenáře, kteří slyšeli pojem disaggregace nebo tvrzení, že předvyplnění je výpočetně omezené a dekódování je paměťově omezené, a zajímalo je, co tyto pojmy ve skutečnosti znamenají. Vysvětlení staví od základů a začíná tím, jak akcelerátory vyvažují aritmetiku a pohyb dat.
Předvyplnění a dekódování kladou na hardware různé nároky
Příspěvek definuje aritmetickou intenzitu jako počet operací s pohyblivou řádovou čárkou dělený počtem bajtů přenesených mezi pamětí a výpočetními jednotkami akcelerátoru. V jednom ze svých příkladů přidání dvou matic provádí 1 FLOP na každých 6 bajtů přesunu, což představuje aritmetickou intenzitu 0,167 FLOP na bajt, a tento poměr zůstává konstantní při zvětšování matic. Násobení matic se chová odlišně: každá výstupní hodnota je vytvořena z celé řádky jednoho vstupu a celé sloupce druhého, takže načtené hodnoty přispívají k více výstupům a aritmetická intenzita roste s velikostí vstupu.
Příspěvek vysvětluje, že inferování je řetězec takových násobení matic mezi pevnými vahami modelu a jeho vstupními tokeny a probíhá ve dvou fázích s odlišnými profily intenzity. Během předvyplnění je celý prompt zpracován paralelně jako velká maticová operace a reálné prompty mohou obsahovat tisíce nebo dokonce stovky tisíc tokenů. Během dekódování jsou tokeny generovány po jednom a model se spoléhá na KV cache, která ukládá klíče a hodnoty vypočtené pro předchozí tokeny, aby byly znovu použity místo opětovného výpočtu.
Obě fáze musí i nadále přesouvat veškeré váhy modelu, potenciálně stovky gigabajtů nebo terabajtů, do výpočetních jednotek pro každý generovaný token. Příspěvek ukazuje, že přesun paměti zůstává téměř konstantní, zatímco aritmetická intenzita klesá po předvyplnění, a uvádí, že tento rozdíl je důvodem, proč pouhé přidání výpočetní kapacity nutně neurychlí doručení tokenů během dekódování.
Disaggregace rozděluje inferování do samostatných poolů
Ve výrobním prostředí typicky inferenční server zpracovává mnoho požadavků současně a když předvyplnění a dekódování běží na stejném hardwaru, výpočetně náročné předvyplnění může zpozdit aktivní požadavky na dekódování. Plánovači pak musejí volit mezi rychlým získáním prvního tokenu pro nové požadavky, plynulým streamováním aktivních odpovědí a maximalizací celkové propustnosti. Dávkování umožňuje souběžným požadavkům sdílet práci při načítání vah modelu, ale větší dávky mohou prodloužit každý krok dekódování, takže celková propustnost může růst, zatímco každý uživatel dostává tokeny pomaleji.
Příspěvek popisuje disaggregaci jako návrhový vzor systému, který spouští obě fáze v samostatných hardwarových poolech. Jakmile jsou fáze odděleny, operátoři mohou přidělovat hardware, nastavovat politiky dávkování a nezávisle upřednostňovat latenci nebo propustnost pro každou fázi: systém s přísnými cíli na čas do prvního tokenu může vyhradit více kapacity pro předvyplnění, zatímco systém zaměřený na plynulé streamování může poskytnout dekódování větší nebo těsněji plánovaný pool. Pooly lze také škálovat individuálně.
Oddělení zavádí nový požadavek. Po předvyplnění vytvoří KV cache, která musí být přenesena do poolu pro dekódování, kde je načtena do paměti před pokračováním generování, zatímco váhy modelu jsou již načteny v obou poolech. Příspěvek uvádí, že tento přenos přidává síťové a koordinační zatížení, že kterýkoli pool může zůstat nečinný, pokud kapacity neodpovídají poptávce, a že přidaná latence závisí na tom, zda se cache přesouvá mezi spolu umístěnými stroji nebo mezi regiony. Argumentuje, že disaggregace je nejpřesvědčivější ve velkém měřítku, kde výhody z nezávislého dimenzování a plánování poolů mohou převážit náklady na přenos a provoz, a že mění řídicí rozhraní poskytovacího systému spíše než jen vyhlazení streamování.
Různorodý hardware, první výsledky a partnerství
Cerebras uvedla, že vede vývoj heterogenní disaggregace, kombinující více typů čipů v jednom inferenčním systému a přiřazující různý hardware segmentům, které jsou paměťově omezené nebo výpočetně omezené. Příspěvek kontrastuje design společnosti založený na wafer-scale, který rozděluje SRAM spolu s výpočtem po celém waferu, s GPU, které přenášejí data modelu z vysoce šířkové paměti přes menší on-chip paměti a cache.
Graf publikovaného špičkového šířkového pásma paměti v příspěvku, datovaný 10. září 2026, uvádí on-chip SRAM Cerebras WSE-3 s 21 000 TB/s na wafer, vedle nepojmenovaného on-chip SRAM akcelerátoru s 150 TB/s a HBM4 GPU s 23,3 a 22 TB/s. Graf upozorňuje, že hodnoty SRAM sčítají lokální šířkové pásmo paměti napříč procesorem, zatímco hodnoty HBM měří provoz z off-chip paměti, takže tyto údaje popisují různé úrovně paměti spíše než měřené rychlosti tokenů.
Příspěvek také reprodukuje data z Artificial Analysis ze dne 10. září 2026 pro GPT-oss-120B běžící s vysokým uvažováním a 10 000 vstupními tokeny. Uvádí Cerebras s 1 669 tokeny za sekundu, SambaNova s 708, Groq s 475, Microsoft Azure s 319, Nebius s 294 a Baseten s 293.
Cerebras uvedla, že v tradičním agregovaném systému zvýšení kapacity znamenalo nasazení více hardwaru, a že využitím akcelerátorů partnerů pro zpracování promptů zvýšila kapacitu 5‑násobně v raných testech se stejnou stopou WSE. Společnost uvedla, že oznámila partnerství s několika hardwarovými partnery, aby na trh přinesla více ultrarychlých tokenů, a diagram v příspěvku ukazuje systémy AWS Trainium a AMD Helios Instinct GPU mezi možnostmi hardwaru pro předvyplnění, které napájejí dekódovací fond Cerebras.
Příspěvek identifikuje agentní aplikace jako přesvědčivě vhodné pro heterogenní rozložení, protože často zahrnují dlouhé, vícekolové konverzace, ve kterých kontext roste napříč voláními modelu a zpoždění v každém kroku se kumulují. Cerebras uvedla, že další díly se budou věnovat zapojenému hardwarovému a softwarovému stacku a ekonomickým kompromisům při nasazení rozložené inferování ve velkém měřítku.












