Modelli e piattaforme di IA

Cerebras Presenta Qwen3‑235B: Una Nuova Era per la Velocità, la Scalabilità e il Costo dell’Intelligenza Artificiale

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Cerebras Systems (CBRS ) ha lanciato ufficialmente Qwen3‑235B, un modello di intelligenza artificiale all’avanguardia con supporto completo per 131.000 token di contesto, stabilendo un nuovo benchmark per le prestazioni in ragionamento, generazione di codice e applicazioni aziendali su larga scala. Ora disponibile tramite il Cerebras Inference Cloud, il modello offre capacità che rivaleggiano con i sistemi più avanzati attualmente disponibili—mentre opera a 30 volte la velocità e un decimo del costo dei modelli chiusi più avanzati attualmente disponibili.

Il Ragionamento dell’Intelligenza Artificiale in Tempo Reale Raggiunge una Velocità di Rottura

Il ragionamento dell’intelligenza artificiale è stato storicamente lento, con modelli grandi che spesso richiedono un minuto o più per rispondere a query complesse. Cerebras elimina questo collo di bottiglia. Potenziato dal suo motore Wafer-Scale Engine 3 (WSE‑3) di proprietà, Qwen3‑235B raggiunge 1.500 token al secondo, un record mondiale per l’inferenza dell’intelligenza artificiale di frontiera.

Questo livello di prestazioni trasforma l’esperienza dell’utente—riducendo la latenza da 60-120 secondi a solo 0,6 secondi, anche quando si elaborano attività di ragionamento avanzate o si eseguono flussi di lavoro multi-step come la generazione aumentata di recupero (RAG). Secondo i risultati dei benchmark di Artificial Analysis, nessun altro fornitore—aperto o chiuso—attualmente eguaglia questa velocità di inferenza per un modello di frontiera.

Un Nuovo Standard nel Contesto: 131K Token per Applicazioni nel Mondo Reale

In concomitanza con questo lancio, Cerebras ha ampliato la finestra di contesto del modello da 32K a 131K token supportati da Qwen3‑235B. Questo balzo nella dimensione del contesto consente al modello di inghiottire e ragionare su volumi massicci di dati—che spaziano su interi codici sorgente, repository di documenti multipli e materiale tecnico a lungo termine.

Mentre il contesto di 32K consente attività di generazione di base, 131K apre la porta allo sviluppo di produzione. L’intelligenza artificiale può ora funzionare come un collaboratore di codice profondo, sintetizzando decine di file e gestendo dipendenze complesse in tempo reale—rendendolo ideale per casi d’uso aziendali in ingegneria del software, analisi dei documenti e calcolo scientifico.

Perché Cerebras è Diverso: Hardware Progettato per l’Intelligenza Artificiale dalla Base

Fondata da un team di architetti di computer pionieristici, ricercatori di intelligenza artificiale e ingegneri di sistemi, Cerebras Systems ha adottato un approccio radicalmente diverso per risolvere le sfide della scalabilità dell’intelligenza artificiale generativa. Invece di affidarsi a cluster di GPU, Cerebras ha costruito un supercomputer di intelligenza artificiale specifico per il proprio chip: il Wafer-Scale Engine 3.

Questo chip è diverso da qualsiasi altro nel settore. Ha le dimensioni di un piatto da cena e ospita centinaia di migliaia di core ottimizzati per l’intelligenza artificiale con memoria sul chip misurata in decine di gigabyte. Quel design consente di collocare il calcolo e la memoria l’uno accanto all’altro—eliminando la latenza, le limitazioni di larghezza di banda e la complessità di orchestrazione delle soluzioni multi-GPU tradizionali.

Raggruppando i suoi sistemi CS-3, Cerebras può creare supercomputer di intelligenza artificiale in grado di eseguire modelli da trilioni di parametri con facilità, evitando al contempo l’onere tecnico del calcolo distribuito. Questo approccio unificato è il fondamento delle sue velocità di inferenza record e dell’abilitazione di nuove capacità ad alto contesto.

L’Efficienza di MoE Consente una Riduzione dei Costi Drammatica

Qwen3‑235B è costruito utilizzando un’architettura mixture-of-experts (MoE)—un design di modello che attiva solo un subset di esperti interni a seconda dell’input, risultando in un’efficienza computazionale notevolmente migliorata.

A causa di ciò, Cerebras può offrire il modello a un punto di prezzo che riduce significativamente i costi rispetto alle alternative a codice chiuso. In particolare, l’inferenza è disponibile a $0,60 per milione di token di input e $1,20 per milione di token di output, rappresentando una riduzione del costo superiore al 90% rispetto ai modelli proprietari di OpenAI, Anthropic o Google.

Integrazione Senza Soluzione di Continuità con Cline in VS Code

Per dimostrare la velocità e l’applicazione nel mondo reale di Qwen3‑235B, Cerebras ha collaborato con Cline, l’agente di codifica agente leader all’interno di Microsoft Visual Studio Code, attualmente installato da oltre 1,8 milioni di sviluppatori.

Gli utenti di Cline possono già accedere a Qwen3‑32B con contesto di 64K come parte del livello gratuito. Con l’annuncio di oggi, il supporto si estenderà per includere Qwen3‑235B e il suo contesto completo di 131K, abilitando un livello di ragionamento e generazione di codice all’interno dell’editor precedentemente irraggiungibile in tempo reale.

Saoud Rizwan, CEO di Cline, ha spiegato: “Con l’inferenza di Cerebras, gli sviluppatori che utilizzano Cline stanno ottenendo uno sguardo sul futuro, poiché Cline ragiona attraverso i problemi, legge le basi di codice e scrive codice in tempo reale. Tutto accade così in fretta che gli sviluppatori rimangono nel flusso, iterando alla velocità del pensiero. Questa sorta di inferenza veloce non è solo bella da avere—ci mostra cosa è possibile quando l’intelligenza artificiale tiene veramente il passo con gli sviluppatori.”

Un’Alternativa Aperta ai Modelli Chiusi

Le prestazioni di Qwen3‑235B sono pari a quelle di alcuni dei modelli di intelligenza artificiale più sofisticati sul mercato attualmente, tra cui Claude 4 Sonnet, Gemini 2.5 Flash e DeepSeek R1, come validato da benchmark indipendenti. Eppure, Cerebras consegna tutto ciò in un formato di accesso aperto, offrendo trasparenza e portabilità che i modelli chiusi mancano.

Questo approccio di modello aperto consente alle aziende di:

  • Personalizzare e ottimizzare su dati proprietari
  • Distribuire l’intelligenza artificiale su infrastrutture private o in ambienti cloud ibridi
  • Evitare il blocco del fornitore e i rischi per la privacy dei dati

In combinazione con la piattaforma cloud scalabile di Cerebras e il possibile deploy on-premise dei sistemi CS-3, le organizzazioni ottengono il pieno controllo su come l’intelligenza artificiale viene applicata a compiti mission-critici.

Cosa Significa Ciò per il Settore

Il lancio di Qwen3‑235B segna un punto di svolta. Cerebras ha ridefinito i confini di ciò che è possibile con i grandi modelli di linguaggio combinando l’intelligenza di frontiera con una velocità e un’efficienza dei costi senza precedenti.

È ora possibile costruire strumenti di intelligenza artificiale che:

  • Rispondono in tempo reale alle query degli sviluppatori
  • Ragionano su intere documentazioni o basi di conoscenza
  • Generano e debuggano codice di produzione all’interno dell’IDE in tempo reale
  • Si estendono ai casi d’uso aziendali senza spreco di GPU o fatture di inferenza mensili a sei cifre

Mentre la domanda di infrastrutture di intelligenza artificiale cresce, Cerebras dimostra che non è necessario compromettere tra prestazioni, prezzo e apertura. Il suo design di hardware e software, dal Wafer-Scale Engine al Cerebras Inference Cloud, punta verso un nuovo modello di distribuzione dell’intelligenza artificiale—uno che è più veloce, più semplice e molto più accessibile.

Pensiero Finale

Rilasciando Qwen3‑235B con contesto di 131K, inferenza ultra-veloce e prezzi dei token accessibili, Cerebras Systems si è posizionata come una delle poche vere sfide ai leader attuali basati su GPU. Per le aziende, i ricercatori e gli sviluppatori, questo lancio è più di un modello più veloce—è un punto di svolta che porta l’intelligenza artificiale in tempo reale, di produzione e aperta alla portata.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.