Modelli e piattaforme di IA

WEKA lancia NeuralMesh 6 e WEKApod 3 mentre l’infrastruttura AI si sposta verso l’inferenza

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

WEKA ha introdotto un coordinato aggiornamento software e hardware volto a risolvere uno dei problemi piÃđ costosi emergenti nell’industria dell’AI: mantenere le GPU produttive mentre i modelli si spostano dall’addestramento all’inferenza continua e su larga scala.

Gli annunci includono NeuralMesh 6, un importante aggiornamento della piattaforma di dati e memoria dell’azienda, insieme a elettrodomestici WEKApod di terza generazione progettati per nuvole AI, sviluppatori di modelli, organizzazioni di ricerca e imprese che operano su infrastrutture GPU.

Insieme, le uscite riflettono un cambiamento piÃđ ampio nel design dell’infrastruttura AI, con l’archiviazione che evolve da un repository passivo a un livello di memoria e consegna dei dati attivo.

Una spinta unificata verso la produzione AI

Le esigenze infrastrutturali dell’inferenza AI differiscono notevolmente da quelle dell’addestramento del modello. I lavori di addestramento di solito elaborano grandi set di dati attraverso pipeline relativamente prevedibili. I sistemi di generazione aumentata, ragionamento a lungo contesto e sistemi di ragionamento aumentato devono invece accedere a dati in cambiamento, mantenere il contesto attraverso interazioni ripetute e supportare molti utenti simultanei senza lasciare in attesa le costose GPU.

La risposta di WEKA ÃĻ quella di trattare l’archiviazione, l’estensione della memoria, l’accesso ai file, l’accesso agli oggetti e il movimento dei dati come parti della stessa piattaforma. NeuralMesh ÃĻ progettato per fornire una base di dati condivisa per l’addestramento, l’inferenza e l’elaborazione ad alte prestazioni in ambienti locali, nuvole pubbliche e distribuzioni ibride.

Il nuovo rilascio estende quell’architettura con multi-tenancy, archiviazione degli oggetti nativa, caching distribuito, riduzione dei dati automatizzata, operazioni Kubernetes e osservabilità centralizzata.

Al posto di posizionare gli annunci software e appliance come aggiornamenti non correlati, l’azienda li presenta come due parti dello stesso sistema. NeuralMesh 6 controlla come i dati vengono archiviati, spostati, isolati e consegnati, mentre WEKApod 3 fornisce un hardware progettato intorno a quelle funzioni.

NeuralMesh 6 unifica i carichi di lavoro dei file e degli oggetti

Una delle aggiunte piÃđ consequenziali in NeuralMesh 6 ÃĻ un’implementazione nativa S3 in esecuzione su archiviazione NVMe. Gli stessi blocchi di dati sottostanti possono essere accessibili attraverso protocolli di oggetto S3 e interfacce POSIX o Network File System senza mantenere copie separate.

Questo ÃĻ importante perchÃĐ le pipeline AI spesso spostano informazioni tra l’archiviazione degli oggetti, i sistemi di file ad alte prestazioni, gli ambienti di addestramento e i cluster di inferenza. Ogni copia consuma capacità, introduce ritardi e complica la governance. Uno spazio dei nomi unificato potrebbe consentire ai dati creati attraverso un protocollo di diventare immediatamente disponibili attraverso un altro.

WEKA afferma che la sua implementazione supporta tra 2.000 e 5.000 connessioni S3 concorrenti per nodo. Supporta anche S3 su Remote Direct Memory Access, che consente di spostare i dati verso la memoria GPU senza seguire il percorso convenzionale attraverso piÃđ livelli CPU e sistema operativo.

La piattaforma introduce due livelli di multi-tenancy. I cluster composti allocano risorse di processore, memoria e archiviazione dedicate a singoli tenant, mentre la multi-tenancy virtuale fornisce isolamento di rete, crittografia indipendente, autenticazione separata e controlli di qualità del servizio per tenant.

Gli ambienti virtuali possono supportare piÃđ di 1.000 tenant isolati per cluster, secondo l’azienda. Combinare i modelli fisici e virtuali potrebbe consentire a un grande operatore di infrastrutture di supportare decine di migliaia di clienti logicamente separati senza distribuire un cluster di archiviazione indipendente per ciascuno.

Questo ÃĻ particolarmente rilevante per i fornitori di servizi GPU e le nuvole AI sovrane che devono bilanciare un alto utilizzo dell’infrastruttura con una rigorosa isolamento dei clienti.

Spostare i dati ovunque siano disponibili le GPU

NeuralMesh 6 introduce anche la replica dei metadati e la memorizzazione nella cache remota per carichi di lavoro AI distribuiti tra data center, nuvole e regioni geografiche.

La replica tradizionale richiede generalmente che l’intero set di dati venga copiato prima che il carico di lavoro possa iniziare. NeuralMesh rende invece immediatamente visibili i metadati di destinazione, quindi trasferisce i dati sottostanti come richiesto.

Questo potrebbe consentire agli operatori di spostare i lavori verso la capacità GPU disponibile senza dover prima replicare ogni file associato al progetto. L’approccio ÃĻ destinato a supportare l’esplosione delle nuvole, l’infrastruttura AI distribuita e la collaborazione tra team di ricerca o ingegneria geograficamente separati.

Rappresenta anche un primo passo verso un modello di spazio dei nomi globale in cui i dati possono essere indirizzati in modo coerente indipendentemente da dove sono stati archiviati originariamente.

Un’altra nuova funzione applica l’impronta digitale, la somiglianza di hashing, la deduplicazione e la compressione in modo continuo, anzichÃĐ trattare la riduzione dei dati come un processo di sfondo opzionale.

WEKA afferma che NeuralMesh 6 puÃē fornire fino a sei volte i risparmi di capacità su dati di addestramento AI con meno del 5% di sovraccarico di scrittura. Le riduzioni effettive dipenderanno dal set di dati. I punti di controllo, i layer dei contenitori, le versioni del modello e i dati di addestramento iterativi possono contenere una ripetizione significativa, mentre altri tipi di dati potrebbero comprimere meno efficacemente.

L’azienda prevede di analizzare i dati dei clienti rappresentativi prima della distribuzione e di utilizzare la stima risultante come parte dei propri impegni di capacità e prestazioni.

Trasformare l’archiviazione in un livello di memoria AI esteso

NeuralMesh incorpora anche WEKA’s Augmented Memory Grid, che utilizza l’archiviazione NVMe come estensione persistente della memoria GPU per l’inferenza.

I grandi modelli linguistici creano una cache di chiave-valore che contiene informazioni calcolate da un prompt o una conversazione. Per contesti lunghi e flussi di lavoro agente, quella cache puÃē diventare estremamente grande. Quando non puÃē rimanere nella memoria GPU ad alta larghezza di banda, i sistemi potrebbero dover scartarla, ricomputarla o spostarla in infrastrutture piÃđ lente.

Augmented Memory Grid archivia quella cache in un livello persistente supportato da NVMe e utilizza Remote Direct Memory Access e NVIDIA GPUDirect Storage per spostarla nuovamente verso le GPU.

L’obiettivo ÃĻ quello di preservare il contesto riutilizzabile riducendo il prefiltro della computazione ripetuta, una delle fasi piÃđ risorse-intensive dell’inferenza a lungo contesto.

WEKA riporta che i test su Oracle Cloud Infrastructure utilizzando NVIDIA H100 GPU hanno prodotto dieci volte piÃđ token al secondo, dieci volte piÃđ utenti simultanei e sette volte piÃđ token per GPU.

Questi numeri sono benchmark specifici del carico di lavoro e non aspettative di prestazioni universali, ma illustrano perchÃĐ la gestione della cache persistente sta diventando una parte importante del design dell’infrastruttura di inferenza.

WEKApod 3 prende il controllo del livello hardware

Mentre i sistemi WEKApod precedenti combinavano il software WEKA con infrastrutture preconvalidate, la terza generazione si sposta ulteriormente nel design del sistema integrato verticalmente.

WEKA ha progettato il nuovo telaio a due unità di rack, l’interconnessione dei dischi, l’architettura di raffreddamento, i domini di guasto e il sistema di servizio. Gli elettrodomestici utilizzano PCI Express Gen 6 internamente e la connessione NVIDIA (NVDA ) ConnectX per la connessione all’infrastruttura Ethernet Spectrum-X.

La famiglia WEKApod ora consiste in tre sistemi configurabili. Nitro ÃĻ ottimizzato per carichi di lavoro di inferenza e AI ad alta intensità di banda. Prime combina cellule a tre livelli e cellule a quattro livelli flash per bilanciare prestazioni e capacità. Prime Max dà priorità alla massima densità di archiviazione, inserendo fino a 70 dischi NVMe in un telaio a due unità di rack.

A scala di rack completo, WEKA afferma che Prime Max puÃē fornire 441,5 petabyte di capacità grezza e 1,1 exabyte di capacità effettiva dopo la riduzione dei dati NeuralMesh. Il sistema a livello di rack ÃĻ valutato per fino a 10,2 terabyte al secondo di throughput e 210 milioni di operazioni di input/output al secondo.

La distinzione tra capacità grezza ed effettiva ÃĻ importante. Il numero di exabyte dipende dalla riduzione ottenibile sui dati archiviati e non deve essere interpretato come piÃđ di un exabyte di flash fisico.

Anche cosÃŽ, una maggiore densità puÃē avere conseguenze significative in strutture in cui l’archiviazione compete con le GPU per spazio di rack, raffreddamento e capacità elettrica.

Progettato per data center vincolati

I nuovi sistemi affrontano anche le limitazioni fisiche che sempre piÃđ plasmano i progetti di infrastruttura AI.

I cluster GPU richiedono grandi quantità di elettricità, raffreddamento, networking e spazio sul pavimento. I sistemi di archiviazione che consumano queste risorse in modo inefficiente possono ridurre il numero di acceleratori che un’infrastruttura puÃē supportare.

WEKA afferma che i nuovi elettrodomestici forniscono una densità di capacità effettiva del 267% maggiore e una densità di prestazioni del 114% maggiore rispetto alle migliori alternative pubblicamente disponibili nelle rispettive categorie.

L’azienda ha anche progettato i sistemi per operare in temperature ambiente fino a 35 gradi Celsius. La limitazione della potenza controllata dal software ÃĻ destinata a ridurre gradualmente le prestazioni durante lo stress termico anzichÃĐ attivare un arresto.

Un design di disco senza backplane crea domini di guasto piÃđ piccoli, mentre i dischi di avvio a inserimento rapido e le procedure di sostituzione guidate sono destinati a ridurre il tempo di manutenzione. I clienti possono configurare il tipo di telaio, la memoria, la capacità del disco e il numero di dischi, con distribuzioni che vanno da meno di un petabyte a piÃđ di 100 petabyte.

Costruire un ecosistema intorno alle fabbriche AI

Gli annunci dei partner suggeriscono che la piattaforma raggiungerà i clienti attraverso integratori di infrastrutture, fornitori di servizi cloud e vendor di orchestrazione AI.

Spectro Cloud sta posizionando NeuralMesh come un livello di dati che puÃē essere combinato con PaletteAI per la distribuzione e l’esecuzione di fabbriche AI aziendali. World Wide Technology e Computacenter intendono incorporare i sistemi in progetti di infrastrutture piÃđ ampi, mentre Glocomp ha evidenziato la domanda dei clienti per prestazioni AI migliori e costi di infrastruttura piÃđ prevedibili.

Questa strategia di ecosistema ÃĻ significativa perchÃĐ la maggior parte delle organizzazioni non assembla ambienti AI di produzione da un singolo fornitore.

Una distribuzione tipica puÃē includere GPU, networking, archiviazione, Kubernetes, software di servizio del modello, osservabilità, sicurezza e prodotti di governance di piÃđ vendor. Le configurazioni convalidate congiuntamente possono ridurre il lavoro di integrazione, sebbene i clienti debbano comunque testare le prestazioni utilizzando i propri modelli, set di dati, reti e requisiti di concorrenza.

Cosa significa questo per l’infrastruttura AI

L’aspetto piÃđ importante dell’annuncio non ÃĻ alcun numero di capacità o throughput individuale. È la crescente convergenza di archiviazione, caching distribuito, gestione della memoria, mobilità dei dati e isolamento dei tenant.

Man mano che gli agenti AI mantengono storie piÃđ lunghe, accedono a piÃđ informazioni aziendali e operano in modo continuo, l’infrastruttura che circonda le GPU determinerà sempre piÃđ il costo di ogni risposta utile.

Aggiungere piÃđ acceleratori non risolverà i collo di bottiglia causati dall’elaborazione del contesto ripetuta, dal movimento lento dei dati, dai protocolli frammentati o dalla capacità di archiviazione inutilizzata. La prossima fase dell’infrastruttura AI dipenderà quindi tanto dal nutrire e gestire le GPU in modo efficiente quanto dall’aumentare la capacità di calcolo grezza.

NeuralMesh 6 ÃĻ previsto diventare disponibile nel secondo semestre del 2026, con i clienti esistenti idonei per l’aggiornamento attraverso il canale software standard. I nuovi sistemi WEKApod Nitro, Prime e Prime Max sono disponibili per l’ordine, con consegne previste per l’autunno del 2026.

Antoine ÃĻ un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà cosÃŽ disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, ÃĻ dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, ÃĻ il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.