Modelli e piattaforme di IA
WEKA lancia NeuralMesh 6 e WEKApod 3 mentre l’infrastruttura AI si sposta verso l’inferenza

WEKA ha introdotto un coordinato aggiornamento software e hardware volto a risolvere uno dei problemi piÃđ costosi emergenti nellâindustria dellâAI: mantenere le GPU produttive mentre i modelli si spostano dallâaddestramento allâinferenza continua e su larga scala.
Gli annunci includono NeuralMesh 6, un importante aggiornamento della piattaforma di dati e memoria dellâazienda, insieme a elettrodomestici WEKApod di terza generazione progettati per nuvole AI, sviluppatori di modelli, organizzazioni di ricerca e imprese che operano su infrastrutture GPU.
Insieme, le uscite riflettono un cambiamento piÃđ ampio nel design dellâinfrastruttura AI, con lâarchiviazione che evolve da un repository passivo a un livello di memoria e consegna dei dati attivo.
Una spinta unificata verso la produzione AI
Le esigenze infrastrutturali dellâinferenza AI differiscono notevolmente da quelle dellâaddestramento del modello. I lavori di addestramento di solito elaborano grandi set di dati attraverso pipeline relativamente prevedibili. I sistemi di generazione aumentata, ragionamento a lungo contesto e sistemi di ragionamento aumentato devono invece accedere a dati in cambiamento, mantenere il contesto attraverso interazioni ripetute e supportare molti utenti simultanei senza lasciare in attesa le costose GPU.
La risposta di WEKA ÃĻ quella di trattare lâarchiviazione, lâestensione della memoria, lâaccesso ai file, lâaccesso agli oggetti e il movimento dei dati come parti della stessa piattaforma. NeuralMesh ÃĻ progettato per fornire una base di dati condivisa per lâaddestramento, lâinferenza e lâelaborazione ad alte prestazioni in ambienti locali, nuvole pubbliche e distribuzioni ibride.
Il nuovo rilascio estende quellâarchitettura con multi-tenancy, archiviazione degli oggetti nativa, caching distribuito, riduzione dei dati automatizzata, operazioni Kubernetes e osservabilità centralizzata.
Al posto di posizionare gli annunci software e appliance come aggiornamenti non correlati, lâazienda li presenta come due parti dello stesso sistema. NeuralMesh 6 controlla come i dati vengono archiviati, spostati, isolati e consegnati, mentre WEKApod 3 fornisce un hardware progettato intorno a quelle funzioni.
NeuralMesh 6 unifica i carichi di lavoro dei file e degli oggetti
Una delle aggiunte piÃđ consequenziali in NeuralMesh 6 ÃĻ unâimplementazione nativa S3 in esecuzione su archiviazione NVMe. Gli stessi blocchi di dati sottostanti possono essere accessibili attraverso protocolli di oggetto S3 e interfacce POSIX o Network File System senza mantenere copie separate.
Questo ÃĻ importante perchÃĐ le pipeline AI spesso spostano informazioni tra lâarchiviazione degli oggetti, i sistemi di file ad alte prestazioni, gli ambienti di addestramento e i cluster di inferenza. Ogni copia consuma capacità , introduce ritardi e complica la governance. Uno spazio dei nomi unificato potrebbe consentire ai dati creati attraverso un protocollo di diventare immediatamente disponibili attraverso un altro.
WEKA afferma che la sua implementazione supporta tra 2.000 e 5.000 connessioni S3 concorrenti per nodo. Supporta anche S3 su Remote Direct Memory Access, che consente di spostare i dati verso la memoria GPU senza seguire il percorso convenzionale attraverso piÃđ livelli CPU e sistema operativo.
La piattaforma introduce due livelli di multi-tenancy. I cluster composti allocano risorse di processore, memoria e archiviazione dedicate a singoli tenant, mentre la multi-tenancy virtuale fornisce isolamento di rete, crittografia indipendente, autenticazione separata e controlli di qualità del servizio per tenant.
Gli ambienti virtuali possono supportare piÃđ di 1.000 tenant isolati per cluster, secondo lâazienda. Combinare i modelli fisici e virtuali potrebbe consentire a un grande operatore di infrastrutture di supportare decine di migliaia di clienti logicamente separati senza distribuire un cluster di archiviazione indipendente per ciascuno.
Questo ÃĻ particolarmente rilevante per i fornitori di servizi GPU e le nuvole AI sovrane che devono bilanciare un alto utilizzo dellâinfrastruttura con una rigorosa isolamento dei clienti.
Spostare i dati ovunque siano disponibili le GPU
NeuralMesh 6 introduce anche la replica dei metadati e la memorizzazione nella cache remota per carichi di lavoro AI distribuiti tra data center, nuvole e regioni geografiche.
La replica tradizionale richiede generalmente che lâintero set di dati venga copiato prima che il carico di lavoro possa iniziare. NeuralMesh rende invece immediatamente visibili i metadati di destinazione, quindi trasferisce i dati sottostanti come richiesto.
Questo potrebbe consentire agli operatori di spostare i lavori verso la capacità GPU disponibile senza dover prima replicare ogni file associato al progetto. Lâapproccio ÃĻ destinato a supportare lâesplosione delle nuvole, lâinfrastruttura AI distribuita e la collaborazione tra team di ricerca o ingegneria geograficamente separati.
Rappresenta anche un primo passo verso un modello di spazio dei nomi globale in cui i dati possono essere indirizzati in modo coerente indipendentemente da dove sono stati archiviati originariamente.
Unâaltra nuova funzione applica lâimpronta digitale, la somiglianza di hashing, la deduplicazione e la compressione in modo continuo, anzichÃĐ trattare la riduzione dei dati come un processo di sfondo opzionale.
WEKA afferma che NeuralMesh 6 puÃē fornire fino a sei volte i risparmi di capacità su dati di addestramento AI con meno del 5% di sovraccarico di scrittura. Le riduzioni effettive dipenderanno dal set di dati. I punti di controllo, i layer dei contenitori, le versioni del modello e i dati di addestramento iterativi possono contenere una ripetizione significativa, mentre altri tipi di dati potrebbero comprimere meno efficacemente.
Lâazienda prevede di analizzare i dati dei clienti rappresentativi prima della distribuzione e di utilizzare la stima risultante come parte dei propri impegni di capacità e prestazioni.
Trasformare lâarchiviazione in un livello di memoria AI esteso
NeuralMesh incorpora anche WEKAâs Augmented Memory Grid, che utilizza lâarchiviazione NVMe come estensione persistente della memoria GPU per lâinferenza.
I grandi modelli linguistici creano una cache di chiave-valore che contiene informazioni calcolate da un prompt o una conversazione. Per contesti lunghi e flussi di lavoro agente, quella cache puÃē diventare estremamente grande. Quando non puÃē rimanere nella memoria GPU ad alta larghezza di banda, i sistemi potrebbero dover scartarla, ricomputarla o spostarla in infrastrutture piÃđ lente.
Augmented Memory Grid archivia quella cache in un livello persistente supportato da NVMe e utilizza Remote Direct Memory Access e NVIDIA GPUDirect Storage per spostarla nuovamente verso le GPU.
Lâobiettivo ÃĻ quello di preservare il contesto riutilizzabile riducendo il prefiltro della computazione ripetuta, una delle fasi piÃđ risorse-intensive dellâinferenza a lungo contesto.
WEKA riporta che i test su Oracle Cloud Infrastructure utilizzando NVIDIA H100 GPU hanno prodotto dieci volte piÃđ token al secondo, dieci volte piÃđ utenti simultanei e sette volte piÃđ token per GPU.
Questi numeri sono benchmark specifici del carico di lavoro e non aspettative di prestazioni universali, ma illustrano perchÃĐ la gestione della cache persistente sta diventando una parte importante del design dellâinfrastruttura di inferenza.
WEKApod 3 prende il controllo del livello hardware
Mentre i sistemi WEKApod precedenti combinavano il software WEKA con infrastrutture preconvalidate, la terza generazione si sposta ulteriormente nel design del sistema integrato verticalmente.
WEKA ha progettato il nuovo telaio a due unità di rack, lâinterconnessione dei dischi, lâarchitettura di raffreddamento, i domini di guasto e il sistema di servizio. Gli elettrodomestici utilizzano PCI Express Gen 6 internamente e la connessione NVIDIA (NVDA ) ConnectX per la connessione allâinfrastruttura Ethernet Spectrum-X.
La famiglia WEKApod ora consiste in tre sistemi configurabili. Nitro ÃĻ ottimizzato per carichi di lavoro di inferenza e AI ad alta intensità di banda. Prime combina cellule a tre livelli e cellule a quattro livelli flash per bilanciare prestazioni e capacità . Prime Max dà priorità alla massima densità di archiviazione, inserendo fino a 70 dischi NVMe in un telaio a due unità di rack.
A scala di rack completo, WEKA afferma che Prime Max puÃē fornire 441,5 petabyte di capacità grezza e 1,1 exabyte di capacità effettiva dopo la riduzione dei dati NeuralMesh. Il sistema a livello di rack ÃĻ valutato per fino a 10,2 terabyte al secondo di throughput e 210 milioni di operazioni di input/output al secondo.
La distinzione tra capacità grezza ed effettiva ÃĻ importante. Il numero di exabyte dipende dalla riduzione ottenibile sui dati archiviati e non deve essere interpretato come piÃđ di un exabyte di flash fisico.
Anche cosÃŽ, una maggiore densità puÃē avere conseguenze significative in strutture in cui lâarchiviazione compete con le GPU per spazio di rack, raffreddamento e capacità elettrica.
Progettato per data center vincolati
I nuovi sistemi affrontano anche le limitazioni fisiche che sempre piÃđ plasmano i progetti di infrastruttura AI.
I cluster GPU richiedono grandi quantità di elettricità , raffreddamento, networking e spazio sul pavimento. I sistemi di archiviazione che consumano queste risorse in modo inefficiente possono ridurre il numero di acceleratori che unâinfrastruttura puÃē supportare.
WEKA afferma che i nuovi elettrodomestici forniscono una densità di capacità effettiva del 267% maggiore e una densità di prestazioni del 114% maggiore rispetto alle migliori alternative pubblicamente disponibili nelle rispettive categorie.
Lâazienda ha anche progettato i sistemi per operare in temperature ambiente fino a 35 gradi Celsius. La limitazione della potenza controllata dal software ÃĻ destinata a ridurre gradualmente le prestazioni durante lo stress termico anzichÃĐ attivare un arresto.
Un design di disco senza backplane crea domini di guasto piÃđ piccoli, mentre i dischi di avvio a inserimento rapido e le procedure di sostituzione guidate sono destinati a ridurre il tempo di manutenzione. I clienti possono configurare il tipo di telaio, la memoria, la capacità del disco e il numero di dischi, con distribuzioni che vanno da meno di un petabyte a piÃđ di 100 petabyte.
Costruire un ecosistema intorno alle fabbriche AI
Gli annunci dei partner suggeriscono che la piattaforma raggiungerà i clienti attraverso integratori di infrastrutture, fornitori di servizi cloud e vendor di orchestrazione AI.
Spectro Cloud sta posizionando NeuralMesh come un livello di dati che puÃē essere combinato con PaletteAI per la distribuzione e lâesecuzione di fabbriche AI aziendali. World Wide Technology e Computacenter intendono incorporare i sistemi in progetti di infrastrutture piÃđ ampi, mentre Glocomp ha evidenziato la domanda dei clienti per prestazioni AI migliori e costi di infrastruttura piÃđ prevedibili.
Questa strategia di ecosistema ÃĻ significativa perchÃĐ la maggior parte delle organizzazioni non assembla ambienti AI di produzione da un singolo fornitore.
Una distribuzione tipica puÃē includere GPU, networking, archiviazione, Kubernetes, software di servizio del modello, osservabilità , sicurezza e prodotti di governance di piÃđ vendor. Le configurazioni convalidate congiuntamente possono ridurre il lavoro di integrazione, sebbene i clienti debbano comunque testare le prestazioni utilizzando i propri modelli, set di dati, reti e requisiti di concorrenza.
Cosa significa questo per lâinfrastruttura AI
Lâaspetto piÃđ importante dellâannuncio non ÃĻ alcun numero di capacità o throughput individuale. à la crescente convergenza di archiviazione, caching distribuito, gestione della memoria, mobilità dei dati e isolamento dei tenant.
Man mano che gli agenti AI mantengono storie piÃđ lunghe, accedono a piÃđ informazioni aziendali e operano in modo continuo, lâinfrastruttura che circonda le GPU determinerà sempre piÃđ il costo di ogni risposta utile.
Aggiungere piÃđ acceleratori non risolverà i collo di bottiglia causati dallâelaborazione del contesto ripetuta, dal movimento lento dei dati, dai protocolli frammentati o dalla capacità di archiviazione inutilizzata. La prossima fase dellâinfrastruttura AI dipenderà quindi tanto dal nutrire e gestire le GPU in modo efficiente quanto dallâaumentare la capacità di calcolo grezza.
NeuralMesh 6 ÃĻ previsto diventare disponibile nel secondo semestre del 2026, con i clienti esistenti idonei per lâaggiornamento attraverso il canale software standard. I nuovi sistemi WEKApod Nitro, Prime e Prime Max sono disponibili per lâordine, con consegne previste per lâautunno del 2026.












