AI-mallit ja alustat
Cerebras raportoi 5X:n inferenssin läpimeno-kyvyn kasvusta hajauttamisen avulla

Cerebras Systems ilmoitti 1. lokakuuta 2026, että se on nostanut inferenssin läpimenoa 5‑kertaisesti varhaisissa tuloksissa käyttäen hajauttamista kutsuttua tekniikkaa, käyttäen samaa määrää Cerebras-järjestelmiä eikä tokenien luontinopeudessa ole tapahtunut heikentymistä. Julkaisu löytyi Hajautettu inferenssi alusta alkaen, yrityksen blogikirjoituksena, jonka ovat kirjoittaneet Isaac Tai ja Zhenwei Gao, ja joka avaa suunnitellun sarjan aiheesta.
Kirjoitus asettaa sarjan kontekstiin lukijoille, jotka ovat kuulleet termistä hajauttaminen tai väitteestä, että esitäyttö on laskentarajoitteinen ja dekoodaus muistirajoitteinen, ja ovat pohtineet, mitä kumpikaan oikeastaan tarkoittaa. Se rakentaa selityksen alusta alkaen, aloittaen siitä, miten kiihdyttimet tasapainottavat aritmetiikkaa ja datansiirtoa.
Esitäyttö ja dekoodaus asettavat erilaisia vaatimuksia laitteistolle
Kirjoitus määrittelee aritmeettisen intensiteetin kelluvien pisteiden operaatioiden määränä jaettuna muistin ja kiihdyttimen laskentayksiköiden välillä siirrettyjen tavujen määrällä. Yhdessä esimerkissä kahden matriisin yhdisteleminen suorittaa 1 FLOP:n jokaiselle 6 tavulle, mikä vastaa aritmeettista intensiteettiä 0,167 FLOPia per tavu, ja tämä suhde pysyy vakiona matriisien kasvaessa. Matriisikertolasku käyttäytyy eri tavalla: jokainen tulosrakennus perustuu yhden syötteen kokonaisriviin ja toisen syötteen kokonais-sarakkeeseen, jolloin ladatut arvot vaikuttavat useampiin tuloksiin ja aritmeettinen intensiteetti kasvaa syötteen koon myötä.
Kirjoituksen mukaan inferenssi on tällainen matriisikertolaskujen ketju mallin kiinteiden painojen ja sen syötetokenien välillä, ja se toteutuu kahdessa vaiheessa erilaisilla intensiteettiprofiileilla. Esitäytön aikana koko kehotus käsitellään rinnakkain suurena matriisitoimintona, ja todellisessa maailmassa kehotukset voivat sisältää tuhansia tai jopa satoja tuhansia tokenia. Dekoodauksen aikana tokenit luodaan yksi kerrallaan, ja malli turvautuu KV‑välimuistiin, joka tallentaa aikaisemmin laskettujen tokenien avaimet ja arvot, jotta ne voidaan käyttää uudelleen sen sijaan, että ne laskettaisiin uudelleen.
Molempien vaiheiden on silti siirrettävä kaikki mallin painot, mahdollisesti satoja gigatavuja tai teratavuja, laskentayksiköille jokaiselle luodulle tokenille. Kirjoituksessa näytetään, että muistin siirto pysyy lähes vakiona, kun taas aritmeettinen intensiteetti laskee esitäytön jälkeen, ja tätä eroa käytetään perusteluna sille, että pelkän laskentatehon lisääminen ei välttämättä nopeuta tokenien saapumista dekoodauksen aikana.
Hajauttaminen jakaa inferenssin erillisiin ryhmiin
Tuotannossa inferenssipalvelin käsittelee tyypillisesti monia pyyntöjä samanaikaisesti, ja kun esitäyttö ja dekoodaus toimivat samassa laitteistossa, laskentaintensiivinen esitäyttö voi hidastaa aktiivisia dekoodauspyyntöjä. Aikatauluttajien on tällöin valittava, saako uusia pyyntöjä niiden ensimmäiseen tokeniin nopeasti, pidetäänkö aktiiviset vastaukset sujuvasti virtaavina, vai maksimoidaanko kokonaisläpäisykyky. Ryhmittäminen antaa samanaikaisten pyyntöjen jakaa mallin painojen lukutyön, mutta suuremmat erät voivat pidentää jokaisen dekoodausaskeleen kestoa, jolloin kokonaisläpäisykyky voi kasvaa, vaikka jokainen käyttäjä saa tokenit hitaammin.
Kirjoitus kuvaa hajauttamista järjestelmäsuunnittelumallina, jossa kaksi vaihetta ajetaan erillisissä laitteistoryhmissä. Kun vaiheet on erotettu, operaattorit voivat kohdistaa laitteistoa, asettaa ryhmittämiskäytäntöjä ja priorisoida viivettä tai läpäisykykyä kullekin vaiheelle itsenäisesti: järjestelmä, jonka tavoitteena on tiukka aika ensimmäiseen tokeniin, voi varata enemmän kapasiteettia esitäytölle, kun taas sujuvaa suoratoistoa varten suunniteltu järjestelmä voi antaa dekoodaukselle suuremman tai tiukemmin ajoitetun ryhmän. Ryhmiä voidaan myös skaalata erikseen.
Erottaminen tuo mukanaan uuden vaatimuksen. Kun esitäyttö on rakentanut KV‑välimuistin, kyseinen pyyntökohtainen tila on siirrettävä dekoodausryhmään, jossa se ladataan muistiin ennen kuin generointi voi jatkua, samalla kun mallin painot ovat jo ladattuina molemmissa ryhmissä. Kirjoituksessa todetaan, että siirto lisää verkko‑ ja koordinaatiokustannuksia, että kumpikin ryhmä voi olla käyttämättömänä, jos kapasiteetit eivät vastaa kysyntää, ja että lisäviive riippuu siitä, liikkuuko välimuisti samassa paikassa olevien koneiden välillä vai eri alueiden välillä. Väitetään, että hajauttaminen on erityisen houkuttelevaa suuressa mittakaavassa, jossa erillisesti mitoitetuista ja ajoitetuista ryhmistä syntyvät hyödyt voivat ylittää siirto‑ ja käyttökustannukset, ja että se muuttaa palvelujärjestelmän ohjausrajapintaa eikä pelkästään tasoita suoratoistoa.
Eriäinen laitteisto, varhaiset tulokset ja kumppanuudet
Cerebras ilmoitti johtavansa erilaisten hajauttamisratkaisujen kehitystä yhdistämällä useita sirutyyppejä yhteen inferenssijärjestelmään ja kohdentamalla eri laitteistoja segmentteihin, jotka ovat muistirajoitteisia tai laskentarajoitteisia. Kirjoituksessa verrataan yrityksen wafer‑scale‑suunnittelua, joka jakaa SRAM‑muistin laskennan rinnalle koko waferin alueella, GPU:ihin, jotka siirtävät mallidataa korkean kaistanleveyden muistista pienempiin sirun sisäisiin muisteihin ja välimuisteihin.
Julkaisussa oleva huippumuistikaistanleveyden kaavio, päivätty 10. syyskuuta 2026, listaa Cerebras WSE‑3 sirun sisäisen SRAM:n 21 000 TB/s per wafer, sekä nimetön sirun sisäinen SRAM‑kiihdytin 150 TB/s ja HBM4‑GPU:t 23,3 ja 22 TB/s. Kaavio varoittaa, että SRAM‑lukemat summaavat paikallisen muistikaistanleveyden prosessorin yli, kun taas HBM‑lukemat mittaavat liikennettä sirun ulkopuolisesta muistista, joten lukemat kuvaavat eri muistitasoja eikä mitattuja tokeninopeuksia.
Julkaisu toistaa myös Artificial Analysis -tiedot 10. syyskuuta 2026 GPT-oss-120B:lle, joka suorittaa korkean päättelyn 10 000 syötetunnisteella. Siinä listataan Cerebras 1 669 lähtötunnistetta sekunnissa, SambaNova 708, Groq 475, Microsoft Azure 319, Nebius 294 ja Baseten 293.
Cerebras totesi, että perinteisessä aggregoidussa järjestelmässä kapasiteetin kasvattaminen tarkoitti lisälaitteiston käyttöönottoa, ja että kumppaniakseleraattoreiden hyödyntäminen kehotteiden käsittelyyn lisäsi kapasiteettia viisi‑kertaiseksi varhaisissa testeissä saman WSE‑jalanjäljen kanssa. Yritys ilmoitti solmineensa kumppanuuksia useiden laitteistokumppaneiden kanssa tuodakseen markkinoille entistä nopeampia tunnisteita, ja julkaisun kaaviossa näkyvät AWS Trainium- ja AMD Helios Instinct -GPU-järjestelmät prefill‑laitteistovaihtoehtoina, jotka syöttävät Cerebras‑dekoodausaltaan.
Julkaisu pitää agenttisovelluksia houkuttelevana soveltuvuutena heterogeeniseen hajauttamiseen, koska ne usein sisältävät pitkiä, monivaiheisia työnkulkuja, joissa konteksti kasvaa mallikutsujen myötä ja jokaisessa vaiheessa syntyvät viiveet kasaantuvat. Cerebras kertoi, että seuraavissa osissa käsitellään mukana olevaa laitteisto‑ ja ohjelmistopinoa sekä taloudellisia kompromisseja, jotka liittyvät hajautetun inferenssin skaalaamiseen.












