Modele i platformy AI

Cerebras informuje o 5‑krotnym wzroście przepustowości inferencji dzięki rozdzieleniu

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Cerebras Systems poinformowało 1 października 2026, że zwiększyło przepustowość inferencji pięciokrotnie w wstępnych wynikach, stosując technikę zwaną rozdzieleniem, przy tej samej liczbie systemów Cerebras i bez utraty prędkości generowania tokenów. Informacja pojawiła się w Rozdzielona inferencja od podstaw, wpisie na blogu firmowym autorstwa Isaac Tai i Zhenwei Gao, który otwiera planowaną serię na ten temat.

Wpis wprowadza serię dla czytelników, którzy słyszeli o terminie rozdzielenie lub o twierdzeniu, że wstępne wypełnianie (prefill) jest ograniczone przez moc obliczeniową, a dekodowanie przez pamięć, i zastanawiali się, co to właściwie oznacza. Buduje wyjaśnienie od podstaw, zaczynając od tego, jak akceleratory równoważą operacje arytmetyczne z ruchem danych.

Prefill i Decode nakładają różne wymagania na sprzęt

Wpis definiuje intensywność arytmetyczną jako liczbę operacji zmiennoprzecinkowych podzieloną przez liczbę bajtów przenoszonych pomiędzy pamięcią a jednostkami obliczeniowymi akceleratora. W jednym z przykładów dodawanie dwóch macierzy wykonuje 1 FLOP na każde 6 bajtów przesuniętych, co daje intensywność arytmetyczną 0,167 FLOP na bajt, a stosunek ten pozostaje stały w miarę wzrostu macierzy. Mnożenie macierzy zachowuje się inaczej: każda wartość wyjściowa jest budowana z całego wiersza jednego wejścia i całej kolumny drugiego, więc wczytane wartości przyczyniają się do większej liczby wyników, a intensywność arytmetyczna rośnie wraz z rozmiarem danych wejściowych.

Inferencja, wyjaśnia wpis, to łańcuch takich mnożeń macierzy pomiędzy stałymi wagami modelu a tokenami wejściowymi i przebiega w dwóch fazach o różnych profilach intensywności. Podczas prefill całe zapytanie jest przetwarzane równolegle jako duża operacja macierzowa, a rzeczywiste zapytania mogą zawierać tysiące, a nawet setki tysięcy tokenów. Podczas decode tokeny są generowane pojedynczo, a model korzysta z pamięci podręcznej KV, która przechowuje klucze i wartości obliczone dla wcześniejszych tokenów, aby mogły być ponownie użyte zamiast przeliczane od nowa.

Obie fazy muszą nadal przenosić wszystkie wagi modelu, potencjalnie setki gigabajtów lub terabajtów, do jednostek obliczeniowych przy każdym generowanym tokenie. Wpis pokazuje, że ruch pamięci pozostaje prawie stały, podczas gdy intensywność arytmetyczna spada po prefill, i wskazuje tę różnicę jako powód, dla którego zwiększenie surowej mocy obliczeniowej niekoniecznie przyspiesza przybywanie tokenów podczas decode.

Rozdzielenie dzieli inferencję na odrębne pule

W środowisku produkcyjnym typowy serwer inferencji obsługuje wiele żądań jednocześnie, a gdy prefill i decode działają na tym samym sprzęcie, intensywny pod względem obliczeń prefill może opóźniać aktywne żądania decode. Planery muszą więc wybierać pomiędzy szybkim dostarczeniem nowym żądaniom ich pierwszego tokenu, płynnym strumieniowaniem aktywnych odpowiedzi oraz maksymalizacją całkowitej przepustowości. Grupowanie pozwala równoczesnym żądaniom współdzielić pracę związaną z odczytem wag modelu, ale większe partie mogą wydłużać każdy krok decode, więc całkowita przepustowość może rosnąć, podczas gdy każdy użytkownik otrzymuje tokeny wolniej.

Wpis opisuje rozdzielenie jako wzorzec projektowy systemów, który uruchamia dwie fazy w odrębnych pulach sprzętowych. Po rozdzieleniu etapów operatorzy mogą przydzielać sprzęt, ustawiać polityki grupowania i niezależnie priorytetyzować opóźnienie lub przepustowość dla każdego etapu: system z rygorystycznymi celami czasu do pierwszego tokenu może zarezerwować większą pojemność dla prefill, podczas gdy system skoncentrowany na płynnym strumieniowaniu może przydzielić decode większą lub ściślej zaplanowaną pulę. Pule mogą być również skalowane indywidualnie.

Rozdzielenie wprowadza nowy wymóg. Po tym, jak prefill zbuduje pamięć podręczną KV, stan specyficzny dla żądania musi zostać przeniesiony do puli decode, gdzie zostaje załadowany do pamięci przed kontynuacją generacji, podczas gdy wagi modelu są już załadowane w obu pulach. Wpis zauważa, że przekazanie dodaje narzut sieciowy i koordynacyjny, że każda pula może pozostać bezczynna, jeśli pojemności nie odpowiadają zapotrzebowaniu, oraz że dodatkowe opóźnienie zależy od tego, czy pamięć podręczna przemieszcza się między współlokalizowanymi maszynami czy między regionami. Argumentuje, że rozdzielenie jest najbardziej przekonujące w dużej skali, gdzie korzyści z niezależnego dimensionowania i planowania pul mogą przewyższyć koszty transferu i eksploatacji, oraz że zmienia interfejs kontrolny systemu obsługi, a nie tylko wygładza strumieniowanie.

Różnorodny sprzęt, wstępne wyniki i partnerstwa

Cerebras oświadczyło, że prowadzi rozwój heterogenicznego rozdzielenia, łącząc wiele typów układów w jednym systemie inferencji i przydzielając różny sprzęt do segmentów, które są ograniczone pamięcią lub obliczeniami. Wpis zestawia projekt firmy oparty na skali wafla, który rozmieszcza SRAM razem z jednostkami obliczeniowymi na całym waflu, z GPU, które przesyłają dane modelu z pamięci o wysokiej przepustowości przez mniejsze pamięci i pamięci podręczne na chipie.

W opublikowanym wykresie szczytowej przepustowości pamięci w wpisie, datowanym na 10 września 2026, wymieniono on-chip SRAM Cerebras WSE‑3 z prędkością 21 000 TB/s na wafer, obok nieoznaczonego akceleratora on-chip SRAM z 150 TB/s oraz GPU HBM4 z 23,3 i 22 TB/s. Wykres ostrzega, że wartości SRAM sumują lokalną przepustowość pamięci w całym procesorze, podczas gdy wartości HBM mierzą ruch z pamięci poza chipem, więc liczby opisują różne poziomy pamięci, a nie zmierzone prędkości tokenów.

Post reprodukuje również dane Artificial Analysis z 10 września 2026 r. dla GPT-oss-120B działającego w trybie wysokiego rozumowania z 10 000 tokenami wejściowymi. Wymienia Cerebras z 1 669 tokenami wyjściowymi na sekundę, SambaNova z 708, Groq z 475, Microsoft Azure z 319, Nebius z 294 i Baseten z 293.

Cerebras oświadczył, że w tradycyjnym systemie scentralizowanym zwiększanie pojemności wymagało wdrażania większej liczby sprzętu, a wykorzystując akceleratory partnerów do obsługi przetwarzania promptów, zwiększył pojemność pięciokrotnie w wczesnych testach przy tym samym obszarze WSE. Firma poinformowała, że ogłosiła partnerstwa z wieloma partnerami sprzętowymi, aby wprowadzić na rynek jeszcze szybsze tokeny, a diagram w poście pokazuje systemy AWS Trainium i AMD Helios Instinct GPU jako opcje sprzętu prefill zasilające pulę dekodowania Cerebras.

Post wskazuje aplikacje agentowe jako atrakcyjne zastosowanie heterogenicznej dezintegracji, ponieważ często obejmują długie, wieloetapowe interakcje, w których kontekst rośnie w kolejnych wywołaniach modelu, a opóźnienia na każdym etapie się kumulują. Cerebras oświadczył, że kolejne części będą omawiać zaangażowane stosy sprzętowe i programowe oraz ekonomiczne kompromisy związane z wdrażaniem rozproszonego wnioskowania w skali.

Theo Nash jest specjalistą generowanym przez SI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami oraz systemami sprzętowymi napędzającymi współczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, akceleratorach, sieciach i stosach oprogramowania, które je łączą.

Z analitycznej i inżyniersko ukierunkowanej perspektywy Theo bada, jak postępy w GPU, niestandardowym krzemie, architekturach pamięci i systemach rozproszonych umożliwiają nowe generacje modeli AI. Szczególną uwagę zwraca na kompromisy wydajności, efektywność energetyczną, skalowalność oraz praktyczne ograniczenia kształtujące rzeczywiste wdrażanie infrastruktury AI.

Artykuły autorstwa Theo Nasha są generowane przez SI i przeglądane przez zespół redakcyjny Unite.AI, aby zapewnić techniczną precyzję, klarowność oraz odpowiedzialne relacjonowanie szybko rozwijającego się krajobrazu obliczeń AI.