Modelli e piattaforme di IA
Cerebras annuncia un aumento di 5X del throughput di inferenza grazie alla disaggregazione

Cerebras Systems ha dichiarato il 1 ottobre 2026 di aver aumentato il throughput di inferenza di 5 volte nei primi risultati utilizzando una tecnica chiamata disaggregazione, con lo stesso numero di sistemi Cerebras e senza perdita di velocità nella generazione dei token. L’annuncio è stato pubblicato in Inferenza Disaggregata dalla Base, un post sul blog aziendale di Isaac Tai e Zhenwei Gao che apre una serie pianificata sull’argomento.
Il post inquadra la serie per i lettori che hanno sentito il termine disaggregazione, o l’affermazione che il prefill sia limitato dal calcolo e il decode dalla memoria, e si chiedono cosa significhino realmente. Costruisce la spiegazione dalla base, iniziando con il modo in cui gli acceleratori bilanciano l’aritmetica rispetto al movimento dei dati.
Prefill e Decode impongono richieste diverse sull’hardware
Il post definisce l’intensità aritmetica come il numero di operazioni in virgola mobile diviso per il numero di byte trasferiti tra la memoria e le unità di calcolo di un acceleratore. In uno dei suoi esempi, l’addizione di due matrici esegue 1 FLOP per ogni 6 byte spostati, un’intensità aritmetica di 0,167 FLOP per byte, e quel rapporto rimane costante man mano che le matrici crescono. La moltiplicazione di matrici si comporta diversamente: ogni valore di output è costruito da un’intera riga di un input e da un’intera colonna dell’altro, quindi i valori caricati contribuiscono a più output e l’intensità aritmetica aumenta con la dimensione dell’input.
Il post spiega che l’inferenza è una catena di tali moltiplicazioni di matrici tra i pesi fissi di un modello e i suoi token di input, e si svolge in due fasi con profili di intensità differenti. Durante il prefill, l’intero prompt viene elaborato in parallelo come una grande operazione di matrice, e i prompt reali possono contenere migliaia o persino centinaia di migliaia di token. Durante il decode, i token vengono generati uno alla volta, e il modello si affida alla KV cache, che memorizza chiavi e valori calcolati per i token precedenti in modo che vengano riutilizzati anziché ricalcolati.
Entrambe le fasi devono comunque spostare tutti i pesi del modello, potenzialmente centinaia di gigabyte o terabyte, verso le unità di calcolo per ogni token generato. Il post mostra che il movimento di memoria rimane quasi costante mentre l’intensità aritmetica diminuisce dopo il prefill, e cita questa differenza come la ragione per cui l’aggiunta di capacità di calcolo grezzo non rende necessariamente più rapida l’arrivo dei token durante il decode.
La disaggregazione suddivide l’inferenza in pool separati
In produzione, un server di inferenza gestisce tipicamente molte richieste contemporaneamente, e quando prefill e decode vengono eseguiti sullo stesso hardware, il prefill ad alta intensità computazionale può bloccare le richieste di decode attive. Gli scheduler devono quindi scegliere tra far arrivare rapidamente il primo token delle nuove richieste, mantenere lo streaming fluido delle risposte attive e massimizzare il throughput totale. Il batching consente alle richieste concorrenti di condividere il lavoro di lettura dei pesi del modello, ma batch più grandi possono far durare più a lungo ogni passo di decode, quindi il throughput totale può aumentare mentre ogni utente riceve i token più lentamente.
Il post descrive la disaggregazione come un modello di progettazione di sistemi che esegue le due fasi in pool hardware separati. Una volta che le fasi sono separate, gli operatori possono assegnare hardware, impostare politiche di batching e dare priorità a latenza o throughput per ciascuna fase in modo indipendente: un sistema con obiettivi rigorosi di tempo al primo token può riservare più capacità al prefill, mentre uno progettato per uno streaming fluido può assegnare al decode un pool più grande o più strettamente programmato. I pool possono anche essere scalati individualmente.
La separazione introduce un nuovo requisito. Dopo che il prefill ha costruito la KV cache, quello stato specifico della richiesta deve essere trasferito al pool di decode, dove viene caricato in memoria prima che la generazione possa continuare, mentre i pesi del modello sono già caricati in entrambi i pool. Il post osserva che il passaggio aggiunge overhead di rete e di coordinamento, che ciascun pool può restare inattivo se le capacità non corrispondono alla domanda, e che la latenza aggiuntiva dipende dal fatto che la cache si sposti tra macchine co-localizzate o tra regioni. Sostiene che la disaggregazione è più convincente su larga scala, dove i guadagni derivanti dal dimensionamento e dalla programmazione indipendenti dei pool possono superare i costi di trasferimento e operativi, e che modifica l’interfaccia di controllo del sistema di servizio anziché limitarsi a rendere più fluido lo streaming.
Hardware eterogeneo, risultati preliminari e partnership
Cerebras ha dichiarato di guidare lo sviluppo della disaggregazione eterogenea, combinando più tipologie di chip in un unico sistema di inferenza e assegnando hardware diverso ai segmenti che sono limitati dalla memoria o dal calcolo. Il post confronta il design wafer-scale dell’azienda, che distribuisce SRAM insieme al calcolo su tutto il wafer, con le GPU, che gestiscono i dati del modello dalla memoria ad alta larghezza di banda attraverso memorie on-chip più piccole e cache.
Un grafico di picco di larghezza di banda della memoria pubblicato nel post, datato 10 settembre 2026, elenca la SRAM on-chip di Cerebras WSE-3 a 21.000 TB/s per wafer, accanto a un acceleratore SRAM on-chip non nominato a 150 TB/s e le GPU HBM4 a 23,3 e 22 TB/s. Il grafico avverte che i valori della SRAM sommano la larghezza di banda della memoria locale su un processore, mentre i valori dell’HBM misurano il traffico dalla memoria off-chip, quindi i dati descrivono tier di memoria diversi piuttosto che velocità di token misurate.
Il post riproduce anche i dati di Artificial Analysis del 10 settembre 2026 per GPT-oss-120B in modalità high reasoning con 10,000 token di input. Riporta Cerebras a 1,669 token di output al secondo, SambaNova a 708, Groq a 475, Microsoft Azure a 319, Nebius a 294 e Baseten a 293.
Cerebras ha dichiarato che, in un sistema aggregato tradizionale, aumentare la capacità significava distribuire più hardware, e che sfruttando gli acceleratori dei partner per gestire l’elaborazione dei prompt ha aumentato la capacità di 5x nei primi test con lo stesso ingombro WSE. L’azienda ha annunciato partnership con diversi partner hardware per portare sul mercato più token ultraveloci, e un diagramma nel post mostra i sistemi AWS Trainium e AMD Helios Instinct GPU tra le opzioni hardware di pre‑riempimento che alimentano un pool di decodifica Cerebras.
Il post individua le applicazioni agentiche come un caso d’uso convincente per la disaggregazione eterogenea, poiché spesso coinvolgono flussi di lavoro lunghi e multi‑turno in cui il contesto cresce tra le chiamate al modello e i ritardi in ogni fase si accumulano. Cerebras ha affermato che i prossimi aggiornamenti tratteranno gli stack hardware e software coinvolti e le considerazioni economiche legate al inferenza disaggregata su larga scala.












