KI-Modelle und Plattformen
Cerebras meldet 5X Anstieg des Inferenz‑Durchsatzes durch Disaggregation

Cerebras Systems sagte am 1. Oktober 2026, dass es den Inferenz‑Durchsatz in frühen Ergebnissen um das 5‑fache erhöht habe, indem es eine als Disaggregation bezeichnete Technik einsetzte, bei gleicher Anzahl von Cerebras‑Systemen und ohne Verlust bei der Token‑Generierungsgeschwindigkeit. Die Bekanntmachung erschien in Disaggregierte Inferenz von Grund auf, einem Unternehmens‑Blogbeitrag von Isaac Tai und Zhenwei Gao, der eine geplante Serie zu diesem Thema einleitet.
Der Beitrag stellt die Serie für Leser dar, die den Begriff Disaggregation gehört haben oder die Behauptung, dass das Vorbefüllen rechnergebunden und das Dekodieren speichergebunden sei, und sich gefragt haben, was das tatsächlich bedeutet. Er entwickelt die Erklärung von Grund auf, beginnend damit, wie Beschleuniger arithmetische Operationen gegen Datenbewegungen abwägen.
Vorbefüllung und Dekodierung stellen unterschiedliche Anforderungen an die Hardware
Der Beitrag definiert die arithmetische Intensität als die Anzahl der Gleitkommaoperationen geteilt durch die Anzahl der Bytes, die zwischen dem Speicher und den Recheneinheiten eines Beschleunigers übertragen werden. In einem seiner Beispiele führt das Addieren zweier Matrizen zu 1 FLOP pro 6 Bytes, also einer arithmetischen Intensität von 0,167 FLOP pro Byte, und dieses Verhältnis bleibt konstant, wenn die Matrizen größer werden. Die Matrixmultiplikation verhält sich anders: Jeder Ausgabewert wird aus einer gesamten Zeile einer Eingabe und einer gesamten Spalte der anderen aufgebaut, sodass geladene Werte zu mehr Ausgaben beitragen und die arithmetische Intensität mit der Eingabegröße steigt.
Der Beitrag erklärt, dass Inferenz eine Kette solcher Matrixmultiplikationen zwischen den festen Gewichten eines Modells und seinen Eingabetoken ist und in zwei Phasen mit unterschiedlichen Intensitätsprofilen abläuft. Während der Vorbefüllung wird die gesamte Eingabeaufforderung parallel als große Matrixoperation verarbeitet, wobei reale Eingabeaufforderungen Tausende oder sogar Hunderttausende von Token enthalten können. Während der Dekodierung werden Token einzeln erzeugt, und das Modell nutzt den KV‑Cache, der Schlüssel und Werte speichert, die für frühere Token berechnet wurden, sodass sie wiederverwendet statt neu berechnet werden.
Beide Phasen müssen dennoch für jedes erzeugte Token alle Gewichte des Modells, potenziell Hunderte von Gigabyte oder Terabyte, zu den Recheneinheiten bewegen. Der Beitrag zeigt, dass die Speicherbewegung nahezu konstant bleibt, während die arithmetische Intensität nach der Vorbefüllung abnimmt, und führt diese Lücke als Grund dafür an, dass das Hinzufügen reiner Rechenkapazität die Token‑Ankunftsgeschwindigkeit während der Dekodierung nicht zwangsläufig erhöht.
Disaggregation teilt die Inferenz in separate Pools
In der Produktion verarbeitet ein Inference-Server typischerweise viele Anfragen gleichzeitig, und wenn Vorbefüllung und Dekodierung auf derselben Hardware laufen, kann die rechenintensive Vorbefüllung aktive Dekodierungsanfragen blockieren. Scheduler müssen dann abwägen, ob sie neue Anfragen schnell zum ersten Token bringen, aktive Antworten flüssig streamen oder den Gesamtdurchsatz maximieren. Batching ermöglicht es gleichzeitig eingehenden Anfragen, die Arbeit des Lesens der Modellgewichte zu teilen, aber größere Batches können jeden Dekodierungsschritt länger dauern lassen, sodass der Gesamtdurchsatz steigen kann, während jeder Nutzer die Token langsamer erhält.
Der Beitrag beschreibt Disaggregation als ein System‑Design‑Muster, das die beiden Phasen in separaten Hardware‑Pools ausführt. Sobald die Stufen getrennt sind, können Betreiber Hardware zuweisen, Batching‑Richtlinien festlegen und Latenz oder Durchsatz für jede Phase unabhängig priorisieren: Ein System mit strengen Zeit‑zum‑ersten‑Token‑Zielen kann mehr Kapazität für die Vorbefüllung reservieren, während ein auf reibungsloses Streaming ausgelegtes System der Dekodierung einen größeren oder enger geplanten Pool zuweisen kann. Die Pools können zudem einzeln skaliert werden.
Die Trennung führt eine neue Anforderung ein. Nachdem die Vorbefüllung den KV‑Cache aufgebaut hat, muss dieser anfrage‑spezifische Zustand zum Dekodierungs‑Pool übertragen werden, wo er in den Speicher geladen wird, bevor die Generierung fortgesetzt werden kann, während die Modellgewichte bereits in beiden Pools geladen sind. Der Beitrag stellt fest, dass die Übergabe Netzwerk‑ und Koordinationsaufwand hinzufügt, dass einer der Pools idle sitzen kann, wenn Kapazitäten nicht mit der Nachfrage übereinstimmen, und dass die zusätzliche Latenz davon abhängt, ob der Cache zwischen ko‑lokalisierten Maschinen oder über Regionen hinweg bewegt wird. Er argumentiert, dass Disaggregation besonders in großem Maßstab überzeugend ist, weil die Vorteile durch unabhängige Dimensionierung und Planung der Pools die Transfer‑ und Betriebskosten überwiegen können, und dass sie die Steuerungs‑Schnittstelle des Servingsystems ändert, anstatt lediglich das Streaming zu glätten.
Heterogene Hardware, frühe Ergebnisse und Partnerschaften
Cerebras erklärte, dass es die Entwicklung heterogener Disaggregation anführt, indem mehrere Chip‑Typen in einem Inferenzsystem kombiniert und unterschiedliche Hardware den Segmenten zugewiesen werden, die speichergebunden bzw. rechengebunden sind. Der Beitrag stellt das wafer‑scale‑Design des Unternehmens, das SRAM zusammen mit Rechenkapazität über das gesamte Wafer verteilt, den GPUs gegenüber, die Modelldaten aus High‑Bandwidth‑Memory über kleinere On‑Chip‑Speicher und Caches bereitstellen.
Ein im Beitrag veröffentlichtes Diagramm zur Spitzen‑Speicherbandbreite vom 10. September 2026 listet das on‑chip‑SRAM von Cerebras WSE‑3 mit 21.000 TB/s pro Wafer auf, neben einem nicht namentlich genannten on‑chip‑SRAM‑Accelerator mit 150 TB/s und HBM4‑GPUs mit 23,3 und 22 TB/s. Das Diagramm weist darauf hin, dass SRAM‑Zahlen die lokale Speicherbandbreite über einen Prozessor summieren, während HBM‑Zahlen den Verkehr vom Off‑Chip‑Speicher messen; daher beschreiben die Werte unterschiedliche Speicherebenen und nicht gemessene Token‑Geschwindigkeiten.
Der Beitrag reproduziert außerdem die Artificial Analysis‑Daten vom 10. September 2026 für GPT‑oss‑120B, das hochgradiges Schließen mit 10.000 Eingabetoken ausführt. Er listet Cerebras mit 1.669 Ausgabetoken pro Sekunde, SambaNova mit 708, Groq mit 475, Microsoft Azure mit 319, Nebius mit 294 und Baseten mit 293 auf.
Cerebras erklärte, dass in einem herkömmlichen aggregierten System die Kapazitätserhöhung den Einsatz zusätzlicher Hardware erforderte und dass durch die Nutzung von Partner‑Acceleratoren zur Prompt‑Verarbeitung die Kapazität in frühen Tests mit derselben WSE‑Fläche um das Fünffache gesteigert wurde. Das Unternehmen sagte, es habe Partnerschaften mit mehreren Hardware‑Partnern angekündigt, um noch schnellere Token auf den Markt zu bringen, und ein Diagramm im Beitrag zeigt AWS Trainium‑ und AMD Helios Instinct‑GPU‑Systeme unter den Vorbefüllungs‑Hardware‑Optionen, die einen Cerebras‑Dekod‑Pool speisen.
Der Beitrag identifiziert agentische Anwendungen als eine überzeugende Passung für heterogene Disaggregation, da sie häufig lange, mehrstufige Workflows beinhalten, bei denen der Kontext über Modellaufrufe hinweg wächst und Verzögerungen in jedem Schritt sich kumulieren. Cerebras sagte, die nächsten Ausgaben werden die beteiligten Hardware‑ und Software‑Stacks sowie die wirtschaftlichen Abwägungen beim Einsatz von disaggregierter Inferenz im großen Maßstab behandeln.












