Modelli e piattaforme di IA

CoreWeave eseguirà la CPU NVIDIA Vera bare metal a scala rack

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

CoreWeave ha dichiarato il 30 settembre 2026 che amplierà il proprio portafoglio di calcolo con la NVIDIA Vera CPU, che ha descritto come la prima CPU progettata per agenti IA, e farà girare il processore su bare metal a scala rack per carichi di lavoro di AI agentica e apprendimento per rinforzo.

La notizia è stata condivisa durante Fully Connected, la conferenza cloud AI di CoreWeave a San Francisco, che l’azienda ha detto riunisce più di 4.500 clienti, partner, sviluppatori e leader dell’AI. Fully Connected 2026 si svolge dal 29 settembre al 1 ottobre 2026 presso Moscone South, 747 Howard Street.

Il lavoro della CPU dietro l’AI agentica

CoreWeave ha descritto l’AI agentica come operante attraverso un ciclo continuo di esecuzione, osservazione, curazione, miglioramento e valutazione. All’interno di questo ciclo, le GPU gestiscono l’addestramento e il ragionamento dei modelli, mentre le CPU eseguono le attività intorno a ciascuna fase: sandbox isolate, ambienti di apprendimento per rinforzo, chiamate a strumenti, esecuzione di codice e pipeline di dati.

CoreWeave ha definito la domanda di pipeline di pre‑elaborazione dei dati e di episodi di addestramento per apprendimento per rinforzo come irregolare e difficile da prevedere: un singolo passaggio nel ciclo può richiedere migliaia di ambienti per un’ora, per poi quasi non richiederne più fino alla successiva esecuzione. Con la crescita dei carichi di lavoro post‑addestramento e agentici, l’azienda ha affermato che tale lavoro intensivo per CPU determina sempre più il ritmo del ciclo AI, e l’infrastruttura necessita sia della densità per tale domanda sia della flessibilità per scalare al variare della domanda.

L’azienda ha dichiarato che la CPU Vera funziona allo stesso modo del resto della sua flotta su CoreWeave: su bare metal, con la stessa piattaforma, i medesimi modelli di consumo e la stessa economia.

Distribuzione a scala rack e CoreWeave Sandboxes

CoreWeave ha affermato che una misura di performance critica per l’AI agentica è il numero di ambienti agente isolati che un team può eseguire contemporaneamente, e se le prestazioni per sandbox rimangono costanti all’aumentare di tale conteggio. Il suo deployment Vera a scala rack ospita 128 CPU e 11.264 core in un unico rack, con BlueField-4 DPU e switch Ethernet Spectrum‑X che collegano i nodi Vera; l’azienda ha dichiarato che ciò fornisce capacità per più di 11.000 ambienti concorrenti.

CoreWeave ha dichiarato che il suo prodotto Sandboxes distribuisce questi agenti con completa isolazione hardware, posizionati direttamente accanto ai lavori di addestramento che supportano. Nei suoi test, l’azienda ha riportato che i tempi di avvio delle sandbox agente su NVIDIA Vera CPU erano più di 3 volte più rapidi rispetto a una CPU x86.

“L’infrastruttura generica ostacola l’AI agentica; Vera è la prima CPU progettata esplicitamente per accelerarla,” ha detto Chen Goldberg, vicepresidente esecutivo di prodotto e ingegneria di CoreWeave, nella l’annuncio dell’azienda. Goldberg ha affermato che la piattaforma di CoreWeave supporta nativamente Vera attraverso prodotti come CoreWeave Sandboxes, consentendo ai team di avviare immediatamente migliaia di ambienti isolati senza ulteriori attriti operativi.

Ryan Shrout, presidente e direttore generale di Signal65, ha dichiarato che una quota crescente di ogni ciclo agente è lavoro della CPU, e che tale quota aumenterà solo con la scalata dei deployment post‑addestramento e agentici. Ha affermato che la piattaforma circostante determina se i team possono effettivamente utilizzare quella capacità, e che la differenza operativa deriva dall’esecuzione del lavoro CPU su bare metal accanto alla flotta di addestramento sotto l’orchestrazione già esistente.

CoreWeave ha lanciato CoreWeave Sandboxes il 14 maggio 2026, come livello di esecuzione che fornisce ambienti sicuri e isolati dove ricercatori AI e team di piattaforma eseguono apprendimento per rinforzo, utilizzo di strumenti agente e valutazione di modelli. È disponibile sull’infrastruttura CoreWeave del cliente tramite CoreWeave Kubernetes Service o come runtime serverless tramite Weights & Biases, con un SDK Python che include gestione delle sessioni, integrazione di storage e strumenti di monitoraggio. CoreWeave afferma che, per impostazione predefinita, ogni sandbox opera in un proprio ambiente virtuale completamente isolato, così un guasto o un processo fuori controllo in uno non può propagarsi a un altro.

CoreWeave ha inoltre evidenziato i risultati dei benchmark MLPerf in inferenza e addestramento e la sua posizione di unico cloud AI a ottenere la classifica Platinum più alta in SemiAnalysis ClusterMAX per tre volte consecutive.

Specifiche della CPU NVIDIA Vera

La pagina del prodotto Vera CPU di NVIDIA descrive il processore come progettato per il lavoro della CPU dietro l’AI agentica e l’apprendimento per rinforzo: esecuzione di codice, utilizzo di strumenti, sandboxing, analisi, pipeline di dati e orchestrazione oltre il modello. Secondo NVIDIA, Vera integra 88 core Olympus personalizzati, e il suo Spatial Multithreading genera 176 thread con risorse di core partizionate.

La larghezza di banda della memoria raggiunge fino a 1,2 terabyte al secondo su LPDDR5X, con una capacità di memoria fino a 1,5 TB, afferma NVIDIA. Un NVIDIA Scalable Coherency Fabric di seconda generazione collega tutti gli 88 core, cache, memoria, I/O e NVLink‑C2C su un unico die di calcolo con 3,4 TB/s di larghezza di banda bisecante, e NVLink‑C2C fornisce fino a 1,8 TB/s di larghezza di banda coerente tra le CPU Vera e le GPU NVIDIA, secondo l’azienda.

NVIDIA afferma che Vera esegue i carichi di lavoro di compilazione, analisi del codice e catena di strumenti Python di un ciclo di ragionamento di un agente fino a 1,8 volte più velocemente rispetto alle principali CPU x86, e che il suo sottosistema di memoria LPDDR5X offre il doppio della larghezza di banda e tre volte la larghezza di banda per core rispetto alle principali CPU x86 con DDR5. La pagina del prodotto segnala che tali valori di prestazione relativi si basano su dati misurati, confrontati con la CPU x86 di ultima generazione, e sono soggetti a variazioni.

NVIDIA posiziona Vera sia come CPU host per sistemi accelerati, inclusi le piattaforme Vera Rubin NVL72 e HGX Vera Rubin NVL8, sia come CPU autonoma per IA agentica, apprendimento per rinforzo, elaborazione dati e analisi. Il Vera CPU Rack, basato su NVIDIA MGX, può contenere fino a 256 CPU Vera e gestire oltre 22,5 mila ambienti concorrenti, secondo l’azienda. Vera Rubin NVL72 combina 72 GPU Rubin, 36 CPU Vera, SuperNIC ConnectX‑9 e DPU BlueField‑4 in un’unica piattaforma a scala rack.

Theo Nash è uno specialista generato dall'IA presso Unite.AI, che si occupa di infrastruttura IA, calcolo e dei sistemi hardware che alimentano l'intelligenza artificiale moderna. Il suo lavoro si concentra sulle fondamenta tecniche dei carichi di lavoro IA su larga scala, inclusi i data center, gli acceleratori, le reti e gli stack software che li collegano.

Con una prospettiva analitica e orientata all'ingegneria, Theo esamina come i progressi nelle GPU, nel silicio personalizzato, nelle architetture di memoria e nei sistemi distribuiti consentano nuove generazioni di modelli IA. Presta particolare attenzione ai compromessi di prestazioni, all'efficienza energetica, alla scalabilità e alle limitazioni pratiche che modellano il dispiegamento reale dell'infrastruttura IA.

Articoli scritti da Theo Nash sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza tecnica, chiarezza e una copertura responsabile del panorama del calcolo IA in rapida evoluzione.