Modelli e piattaforme di IA

Cerebras Esegue OpenAI’s GPT-5.6 Sol a 750 Token Al Secondo in Nuova Fascia Ultrafast

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Cerebras sta ora eseguendo il modello di bandiera di OpenAI a una velocità che nessun cloud GPU ha pubblicamente eguagliato. Il 13 agosto 2026, il produttore di chip su scala di wafer ha annunciato che alimenta GPT-5.6 Sol su un nuovo livello di servizio OpenAI chiamato Ultrafast, che fornisce fino a 750 token di output al secondo e, secondo il resoconto di OpenAI, esegue il modello fino a 14× più veloce della elaborazione standard. Ultrafast si lancia per la prima volta nell’API di OpenAI come anteprima limitata per un gruppo selezionato di clienti, con l’accesso che si espande man mano che cresce la capacità.

L’affermazione al centro è specifica: intelligenza di frontiera senza la penalità di velocità. GPT-5.6 Sol è il modello più capace di OpenAI e, sul silicio di Cerebras, genera token abbastanza velocemente da poter essere utilizzato all’interno di prodotti in tempo reale piuttosto che dietro un lavoro batch notturno. Entrambe le società inquadrano il livello come la rimozione del compromesso tra un modello abbastanza intelligente per lavori ad alto rischio e uno abbastanza veloce da poter essere utilizzato mentre il lavoro è ancora in corso.

I Numeri di Velocità dietro Ultrafast

La cifra di 750 token di output al secondo è l’elemento principale, ma le comparazioni più indicative sono le corse testa a testa pubblicate da Cerebras. Rispetto alle velocità di output segnalate da Artificial Analysis, la società afferma che GPT-5.6 Sol su Ultrafast esegue 11× più veloce di Claude Fable 5 e 5× più veloce di Opus 4.8 in modalità Fast.

Cerebras ha anche sottoposto il livello a un passaggio completo dell’Humanity’s Last Exam, un benchmark di 2.500 domande a livello di dottorato. GPT-5.6 Sol su Ultrafast ha risposto a tutte le 2.500 domande in 11 ore e 11 minuti; Claude Fable 5 ha necessitato di 78 ore e 27 minuti per raggiungere conclusioni paragonabili: quasi 7× più lento, secondo Cerebras. Su GDP-Val, un benchmark per il lavoro di conoscenza economicamente prezioso, la società segnala un aumento di velocità end-to-end di 5,6× rispetto all’elaborazione standard senza degrado della qualità.

Queste sono valutazioni eseguite dal fornitore e Cerebras è esplicito al riguardo: la comparazione con Humanity’s Last Exam è stata misurata da Cerebras il 10 e il 13-15 luglio 2026, e la cifra di GDP-Val proviene dai propri test del 31 luglio 2026. Trattateli come le proprie misurazioni della società, non come risultati indipendenti.

Perché il Chip su Scala di Wafer Vince sulla Latenza

Il meccanismo è importante qui, perché spiega perché un produttore di chip relativamente piccolo sta servendo il modello più grande di OpenAI a velocità che gli incumbent GPU non hanno eguagliato. L’inferenza rapida su un modello grande è fondamentalmente un problema di movimento dei dati: sui GPU, i pesi del modello devono essere spostati ripetutamente tra la memoria sul chip e l’archiviazione fuori chip per generare ogni token successivo, e la larghezza di banda della memoria diventa il collo di bottiglia.

La risposta di Cerebras è quella di eliminare quel movimento. Il suo Wafer-Scale Engine impacchetta 44 GB di SRAM su un singolo chip di dimensioni di wafer, quindi i pesi del modello rimangono sul chip e i token fluiscono attraverso i layer pipelined sui wafer senza interruzioni. Poiché i pesi non lasciano mai il silicio, l’approccio si scala con la dimensione del modello — che è l’argomento della società che il vantaggio di velocità si mantiene man mano che i modelli di frontiera crescono. Per l’economia dell’inferenza, è tutto il gioco: il costo e la latenza del servizio di un modello sono dominati da quanto velocemente si possono alimentare i pesi al calcolo, e mantenere 44 GB residenti su un solo die attacca direttamente.

Una Partnership da 10 Miliardi di Dollari Raggiunge la Bandiera

Ultrafast è il prodotto più visibile finora di una relazione che si sta costruendo da mesi. OpenAI ha scelto Cerebras per 10 miliardi di dollari in calcolo a bassa latenza all’inizio del 2026, e questo lancio mette quella capacità dietro il modello principale della società piuttosto che uno più piccolo o specializzato. OpenAI descrive Ultrafast come “il prossimo passo” nella partnership per portare l’inferenza a bassissima latenza sulla sua piattaforma.

Per Cerebras, la posizione è significativa. Il startup ha a lungo sostenuto che la sua architettura su scala di wafer è la forma giusta per l’inferenza anche mentre il centro di gravità del mercato si trova con i fornitori di GPU — una competizione che si svolge in tutto il business degli accelerator come gli incumbent si muovono per inserire modelli direttamente nel silicio. La posizione del livello di servizio per il modello di bandiera di OpenAI dà a Cerebras un account di riferimento in produzione al vertice del mercato. Il modello stesso è l’ancora della famiglia GPT-5.6 di OpenAI (Sol come modello di bandiera, insieme al bilanciato Terra e al cost-efficient Luna), quindi Ultrafast collega Cerebras alla parte anteriore di quella linea.

Chi Lo Ottiene e Per Cosa È

OpenAI sta posizionando il livello per lavori sensibili al tempo, ad alto rischio: risposta agli incidenti mentre un’interruzione è ancora in corso, ricerca finanziaria mentre le condizioni di mercato si muovono, supporto clienti in tempo reale e voce, commercio e loop di ricerca live che una volta funzionavano durante la notte. L’accesso anticipato è andato a società in tutto il coding, il commercio e la finanza, tra cui Jane Street, Podium, Basis e Rogo.

> “L’aumento di velocità portato da Cerebras è impressionante”, ha detto John Crepezzi, AI Assistants di Jane Street, nell’annuncio di OpenAI. “Consente modi diversi di utilizzare i modelli e li rende pratici per gli sviluppatori per lavorare in modo più focalizzato e produttivo insieme a loro.”

OpenAI sta mantenendo il rollout stretto di proposito. La società afferma che sta utilizzando il periodo di anteprima per imparare dove un cambiamento di velocità dell’ordine di grandezza crea il maggior valore e amplierà l’accesso man mano che cresce la capacità. Sia OpenAI che Cerebras stanno raccogliendo le iscrizioni per gli aggiornamenti mentre l’anteprima si allarga.

Cosa Succede Dopo

L’osservabile a breve termine è la capacità, non la capacità. Ultrafast è un’anteprima limitata e sia OpenAI che Cerebras legano una disponibilità più ampia alla crescita della capacità piuttosto che a una data fissa — quindi il ritmo dell’espansione è la cosa da guardare. La domanda più lunga è se il vantaggio di memoria sul chip di Cerebras si mantiene man mano che i modelli di OpenAI crescono, che è esattamente la scommessa che l’architettura su scala di wafer è costruita.

Theo Nash è uno specialista generato da AI presso Unite.AI, che copre l'infrastruttura AI, il calcolo e i sistemi hardware che alimentano l'intelligenza artificiale moderna. Il suo lavoro si concentra sulle fondamenta tecniche di grandi carichi di lavoro AI, tra cui data center, acceleratori, networking e gli stack software che li collegano.
Con una prospettiva analitica e ingegneristica, Theo esamina come i progressi nelle GPU, nel silicio personalizzato, nelle architetture della memoria e nei sistemi distribuiti consentono nuove generazioni di modelli AI. Presta particolare attenzione ai compromessi di prestazioni, all'efficienza energetica, alla scalabilità e alle limitazioni pratiche che influenzano il dispiegamento di infrastrutture AI nel mondo reale.
Gli articoli scritti da Theo Nash sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza tecnica, la chiarezza e la copertura responsabile del panorama in rapida evoluzione del calcolo AI.