Modelli e piattaforme di IA

Cerebras esegue GPT-5.6 Sol di OpenAI a 750 token al secondo nel nuovo livello Ultrafast

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Cerebras (CBRS ) sta ora eseguendo il modello di punta di OpenAI a una velocità che nessun cloud GPU ha ancora eguagliato pubblicamente. Il 13 agosto 2026, il produttore di chip wafer-scale ha annunciato che alimenta GPT-5.6 Sol su un nuovo livello di servizio di OpenAI chiamato Ultrafast, offrendo fino a 750 token in output al secondo e, secondo OpenAI, eseguendo il modello fino a 14× più veloce rispetto all’elaborazione Standard. Ultrafast viene lanciato inizialmente nell’API di OpenAI come anteprima limitata per un gruppo selezionato di clienti, con l’accesso che si espanderà man mano che la capacità crescerà.

La pretesa centrale è specifica: intelligenza di frontiera senza penalità di velocità. GPT-5.6 Sol è il modello più capace di OpenAI e, sul silicio di Cerebras, genera token abbastanza rapidamente da poter essere integrato in prodotti in tempo reale anziché dietro un lavoro batch notturno. Entrambe le aziende presentano il livello come una rimozione del compromesso tra un modello sufficientemente intelligente per lavori ad alta posta in gioco e uno sufficientemente veloce da usare mentre il lavoro è ancora in corso.

I Numeri di Velocità Dietro Ultrafast

La cifra di 750 token in output al secondo è il dato principale, ma i confronti più significativi sono le prove comparative pubblicate da Cerebras. Confrontando le velocità di output segnalate da Artificial Analysis, l’azienda afferma che GPT-5.6 Sol su Ultrafast è 11× più veloce di Claude Fable 5 e 5× più veloce di Opus 4.8 in modalità Fast.

Cerebras ha inoltre sottoposto il livello a una prova completa dell’Humanity’s Last Exam, un benchmark di 2.500 domande a difficoltà livello dottorato. GPT-5.6 Sol su Ultrafast ha risposto a tutte le 2.500 domande in 11 ore e 11 minuti; Claude Fable 5 ha impiegato 78 ore e 27 minuti per raggiungere conclusioni comparabili: quasi 7× più lento, secondo Cerebras. Su GDP-Val, un benchmark per il lavoro di conoscenza economicamente prezioso, l’azienda riporta un’accelerazione end-to-end di 5,6× rispetto all’elaborazione Standard senza degradazione della qualità.

Si tratta di valutazioni condotte dal fornitore, e Cerebras è esplicita al riguardo: il confronto Humanity’s Last Exam è stato benchmarkato da Cerebras il 10 luglio e dal 13 al 15 luglio 2026, e il dato GDP-Val proviene dal proprio test del 31 luglio 2026. Considerateli come misurazioni interne all’azienda, non risultati indipendenti.

Perché il Chip Wafer-Scale Vince in Latenza

Il meccanismo è importante qui, perché spiega perché un produttore di chip relativamente piccolo sta servendo il modello più grande di OpenAI a velocità che i concorrenti GPU non hanno eguagliato. L’inferenza rapida su un modello di grandi dimensioni è fondamentalmente un problema di movimento dei dati: sulle GPU, i pesi del modello devono essere trasferiti ripetutamente tra la memoria on-chip e lo storage off-chip per generare ogni token successivo, e la larghezza di banda della memoria diventa il collo di bottiglia.

La risposta di Cerebras è eliminare quel movimento. Il suo Wafer-Scale Engine integra 44 GB di SRAM su un unico chip delle dimensioni di un wafer, così i pesi del modello rimangono on-chip e i token fluiscono attraverso gli strati pipelined sui wafer senza interruzioni. Poiché i pesi non lasciano mai il silicio, l’approccio scala con la dimensione del modello — argomento dell’azienda secondo cui il vantaggio di velocità persiste con la crescita dei modelli di frontiera. Per l’economia dell’inferenza, questo è l’intero gioco: il costo e la latenza nel servire un modello sono dominati da quanto rapidamente si possono fornire i pesi al calcolo, e mantenere 44 GB residenti su un unico die colpisce direttamente questo aspetto.

Una Partnership da 10 Miliardi Raggiunge il Modello di Punta

Ultrafast è il prodotto più visibile finora di una relazione in sviluppo da mesi. OpenAI ha scelto Cerebras per 10 miliardi di calcolo a bassa latenza all’inizio del 2026, e questo lancio colloca quella capacità dietro il modello di punta dell’azienda anziché su uno più piccolo o specializzato. OpenAI descrive Ultrafast come “il prossimo passo” nella partnership per portare inferenza ultra‑bassa latenza sulla sua piattaforma.

Per Cerebras, questo posizionamento è significativo. La startup sostiene da tempo che la sua architettura wafer-scale è la forma ideale per l’inferenza anche se il centro di gravità del mercato è con i fornitori di GPU — una competizione che si svolge nel settore degli acceleratori mentre gli incumbenti passano a integrare i modelli direttamente nel loro silicio. Ottenere il livello di servizio per il modello di punta di OpenAI fornisce a Cerebras un account di riferimento di produzione al vertice del mercato. Il modello stesso è il fulcro della famiglia GPT-5.6 lanciata da OpenAI (Sol come modello di punta, insieme al bilanciato Terra e al conveniente Luna), così Ultrafast collega Cerebras alla parte anteriore di quella gamma.

Chi Lo Ottiene e Per Cosa

OpenAI posiziona il livello per lavori sensibili al tempo e ad alta posta in gioco: risposta a incidenti mentre un’interruzione è ancora in corso, ricerca finanziaria mentre le condizioni di mercato cambiano, supporto clienti e voce in tempo reale, commercio e cicli di ricerca live che prima venivano eseguiti durante la notte. L’accesso iniziale è stato concesso a società nei settori del coding, del commercio e della finanza, tra cui Jane Street, Podium, Basis e Rogo.

“L’incremento di velocità offerto da Cerebras è impressionante,” ha dichiarato John Crepezzi, AI Assistants presso Jane Street, nell’annuncio di OpenAI. “Consente diversi modi di utilizzare i modelli e rende pratico per gli sviluppatori lavorare in modo più concentrato e produttivo insieme a loro.”

OpenAI sta mantenendo il rollout limitato di proposito. L’azienda afferma di utilizzare il periodo di anteprima per capire dove un cambiamento di velocità di ordine di grandezza crea il maggior valore, e amplierà l’accesso man mano che la capacità crescerà. Sia OpenAI che Cerebras stanno raccogliendo iscrizioni per aggiornamenti man mano che l’anteprima si amplia.

Cosa Succederà Dopo

L’osservabile a breve termine è la capacità, non la capacità stessa. Ultrafast è un’anteprima limitata, e entrambe le aziende collegano qualsiasi disponibilità più ampia alla crescita della capacità piuttosto che a una data fissa — quindi il ritmo di espansione è ciò da monitorare. La domanda più ampia è se il vantaggio della memoria on-chip di Cerebras rimarrà valido con la scalata dei modelli di OpenAI, che è esattamente la scommessa su cui si basa l’architettura wafer-scale.

Theo Nash è uno specialista generato da AI presso Unite.AI, che copre l'infrastruttura AI, il calcolo e i sistemi hardware che alimentano l'intelligenza artificiale moderna. Il suo lavoro si concentra sulle fondamenta tecniche di grandi carichi di lavoro AI, tra cui data center, acceleratori, networking e gli stack software che li collegano.
Con una prospettiva analitica e ingegneristica, Theo esamina come i progressi nelle GPU, nel silicio personalizzato, nelle architetture della memoria e nei sistemi distribuiti consentono nuove generazioni di modelli AI. Presta particolare attenzione ai compromessi di prestazioni, all'efficienza energetica, alla scalabilità e alle limitazioni pratiche che influenzano il dispiegamento di infrastrutture AI nel mondo reale.
Gli articoli scritti da Theo Nash sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza tecnica, la chiarezza e la copertura responsabile del panorama in rapida evoluzione del calcolo AI.