AI-modeller och plattformar
WEKA Lanserar NeuralMesh 6 och WEKApod 3 Medan AI-Infrastruktur Skiftar Mot Inferens

WEKA har introducerat en samordnad programvaru- och maskinvaruuppgradering riktad mot en av de mest kostsamma problemen i AI-branschen: att hålla GPU:er produktiva när modeller flyttas från utbildning till kontinuerlig, stor skala inferens.
Tillkännagivandena inkluderar NeuralMesh 6, en stor uppdatering av företagets data- och minnesplattform, tillsammans med tredje generationens WEKApod-applianser som är konstruerade för AI-moln, modellutvecklare, forskningsorganisationer och företag som kör GPU-infrastruktur.
Tillsammans reflekterar utgåvorna en bredare förändring i AI-infrastruktursdesign, där lagring utvecklas från ett passivt arkiv till ett aktivt minne och dataleveranslager.
En Enhets Push Till Produktions-AI
Infrastrukturkraven för AI-inferens skiljer sig avsevärt från dem för modellutbildning. Utbildningsjobb bearbetar vanligtvis stora datamängder genom relativt förutsägbara pipelines. Agenta AI, återvinning-förstärkt generering och långkontextuell resonemangssystem måste istället komma åt föränderlig data, upprätthålla kontext över upprepade interaktioner och stödja många samtidiga användare utan att lämna dyra GPU:er väntande på information.
WEKAs svar är att behandla lagring, minnesutvidgning, filåtkomst, objektsåtkomst och dataförflyttning som delar av samma plattform. NeuralMesh är utformat för att tillhandahålla en gemensam datagrund för utbildning, inferens och högpresterande beräkningar i lokala miljöer, offentliga moln och hybriddistributioner.
Den nya utgåvan utvidgar den arkitekturen med multi-tenancy, native objektlagring, distribuerad caching, automatisk datareducering, Kubernetes-åtgärder och centraliserad övervakning.
Snarare än att positionera programvaru- och apparatutgåvorna som orelaterade uppgraderingar presenterar företaget dem som två delar av samma system. NeuralMesh 6 kontrollerar hur data lagras, flyttas, isoleras och levereras, medan WEKApod 3 tillhandahåller maskinvara som är utformad runt dessa funktioner.
NeuralMesh 6 Förenar Fil- och Objektarbetsbelastningar
En av de mer betydande tilläggen i NeuralMesh 6 är en native S3-implementation som körs på NVMe-lagring. Samma underliggande datablock kan kommas åt via S3-objektprotokoll och POSIX- eller Network File System-gränssnitt utan att upprätthålla separata kopior.
Detta är viktigt eftersom AI-pipelines ofta flyttar information mellan objektlagring, högpresterande filsystem, utbildningsmiljöer och inferenskluster. Varje kopia konsumerar kapacitet, introducerar fördröjningar och komplicerar styrning. Ett förenat namnområde kunde tillåta data som skapats via en protokoll att bli omedelbart tillgängliga via en annan.
WEKA säger att deras implementation stöder mellan 2 000 och 5 000 samtidiga S3-anslutningar per nod. Den stöder också S3 via Remote Direct Memory Access, som tillåter data att flyttas mot GPU-minne utan att följa den konventionella vägen genom flera CPU- och operativsystemslager.
Plattformen introducerar två nivåer av multi-tenancy. Composable Clusters allokerar dedikerade processor-, minnes- och lagringsresurser till enskilda hyresgäster, medan virtuell multi-tenancy tillhandahåller nätverksisolering, oberoende kryptering, separat autentisering och per-hyresgäst kvalitetskontroll.
Virtuella miljöer kan stödja mer än 1 000 isolerade hyresgäster per kluster, enligt företaget. Att kombinera de fysiska och virtuella modellerna kunde tillåta en stor infrastrukturoperatör att stödja tiotusentals logiskt separerade kunder utan att distribuera en oberoende lagringskluster för var och en.
Detta är särskilt relevant för GPU-as-a-service-leverantörer och suveräna AI-moln som behöver balansera hög infrastrukturutnyttjande med strikt kundisolering.
Flytta Data Till Var GPU:er Finns Tillgängliga
NeuralMesh 6 introducerar också metadata-först-replikering och fjärrcaching för AI-arbetsbelastningar som distribueras över datacenter, moln och geografiska regioner.
Traditionell replikering kräver vanligtvis att en hel datamängd kopieras innan en arbetsbelastning kan börja. NeuralMesh gör istället metadata synliga på destinationen, och överför sedan de underliggande data som de begärs.
Detta kunde tillåta operatörer att flytta jobb mot tillgänglig GPU-kapacitet utan att först replikera varje fil som är associerad med projektet. Tillvägagångssättet är avsett att stödja moln-utbrott, distribuerad AI-infrastruktur och samarbete mellan geografiskt separerade forsknings- eller ingenjörsteam.
Det representerar också ett tidigt steg mot en globalt namnområdesmodell där data kan adresseras konsekvent oavsett var de ursprungligen lagrades.
En annan ny funktion applicerar fingeravtryck, likhets-hashing, deduplicering och komprimering kontinuerligt, snarare än att behandla datareducering som en valfri bakgrundsprocess.
WEKA hävdar att NeuralMesh 6 kan tillhandahålla upp till sexfaldig kapacitetssparande på AI-utbildningsdata med mindre än 5% skrivöverhuvud. Aktuella reduktioner kommer att bero på datamängden. Kontrollpunkter, containernivåer, modellversioner och iterativ utbildningsdata kan innehålla betydande upprepning, medan andra datatyper kan komprimera mindre effektivt.
Företaget planerar att analysera representativ kunddata innan distribution och använda den resulterande uppskattningen som en del av sina kapacitets- och prestandakommitment.
Omvandla Lagring Till En Utökad AI-Minneslager
NeuralMesh integrerar också WEKAs Augmented Memory Grid, som använder NVMe-lagring som en beständig utvidgning av GPU-minne för inferens.
Stora språkmodeller skapar en nyckel-värde-caché som innehåller information som beräknats från en prompt eller konversation. För långa kontexter och agenta arbetsflöden kan den cachén bli extremt stor. När den inte kan förbli i höghastighets-GPU-minne kan systemen behöva kassera den, omberäkna den eller flytta den till långsammare infrastruktur.
Augmented Memory Grid lagrar den cachén i en beständig NVMe-backad lager och använder Remote Direct Memory Access och NVIDIA GPUDirect Storage för att flytta den tillbaka till GPU:er.
Målet är att bevara återanvändbar kontext samtidigt som man minskar upprepad förkalkylationsberäkning, en av de mer resurskrävande stadierna i långkontextuell inferens.
WEKA rapporterar att tester på Oracle Cloud Infrastructure med NVIDIA H100-GPU:er producerade tio gånger högre token-genomströmning, tio gånger fler samtidiga användare och sju gånger fler token per GPU.
Dessa siffror är specifika för arbetsbelastningar och inte universella prestandaförväntningar, men de illustrerar varför beständig cachhantering blir en viktig del av inferens-infrastruktursdesign.
WEKApod 3 Tar Kontroll Över Maskinvarulagret
Medan tidigare WEKApod-system kombinerade WEKA-programvara med förvaliderad infrastruktur, flyttar tredje generationen sig längre in i vertikalt integrerad systemdesign.
WEKA designade den nya två-hyllors chassit, drive-interconnecten, kylarkitekturen, felområdena och service-systemet. Apparaterna använder PCI Express Gen 6 internt och NVIDIA ConnectX-nätverk för anslutning till Spectrum-X Ethernet-infrastruktur.
WEKApod-familjen består nu av tre konfigurerbara system. Nitro är optimerad för bandbreddsintensiv inferens och AI-fabriksarbetsbelastningar. Prime kombinerar trippel-nivå-cell och fyr-nivå-cell flash för att balansera prestanda och kapacitet. Prime Max prioriterar maximal lagringsdensitet och kan inrymma upp till 70 NVMe-enheter i en två-hyllors chassi.
Vid full rack-skala säger WEKA att Prime Max kan tillhandahålla 441,5 petabyte rå kapacitet och 1,1 exabyte effektiv kapacitet efter NeuralMesh-datareducering. Rack-nivåsystemet är klassificerat för upp till 10,2 terabyte per sekund genomströmning och 210 miljoner in-/ut-dataoperationer per sekund.
Distinktionen mellan rå och effektiv kapacitet är viktig. Exabyte-siffran beror på reduktionen som kan uppnås över lagrad data och bör inte tolkas som mer än en exabyte fysisk flash.
Ändå kan större densitet ha meningsfulla konsekvenser i anläggningar där lagring konkurrerar med GPU:er om rack-utrymme, kylning och elektrisk kapacitet.
Utformad För Begränsade Datacenter
De nya systemen tar också itu med de fysiska begränsningarna som alltmer formar AI-infrastrukturprojekt.
GPU-kluster kräver stora mängder el, kylning, nätverk och golvyta. Lagringssystem som konsumerar dessa resurser ineffektivt kan minska antalet acceleratorer som en anläggning kan stödja.
WEKA hävdar att de nya apparaterna tillhandahåller 267% större effektiv kapacitetsdensitet och 114% större prestandadensitet än de näst bästa offentligt tillgängliga alternativen i sina respektive kategorier.
Företaget har också utformat systemen för att fungera i omgivningstemperaturer på upp till 35 grader Celsius. Programvarukontrollerad effektbegränsning är avsedd att minska prestanda gradvis under termisk stress snarare än att utlösa en avstängning.
En bakplan-fri drive-design skapar mindre felområden, medan hot-pluggbara boot-enheter och guidade ersättningsförfaranden är avsedda att minska underhållstiden. Kunder kan konfigurera chassityp, minne, drive-kapacitet och drive-antal, med distributioner som sträcker sig från mindre än en petabyte till mer än 100 petabyte.
Bygga Ett Ekosystem Kring AI-Fabriker
De åtföljande partnermeddelandena antyder att plattformen kommer att nå kunderna genom infrastrukturintegratörer, molnleverantörer och AI-orchestreringsleverantörer.
Spectro Cloud positionerar NeuralMesh som en data-lager som kan kombineras med PaletteAI för att distribuera och köra företags-AI-fabriker. World Wide Technology och Computacenter planerar att integrera systemen i bredare infrastrukturprojekt, medan Glocomp betonade kundefterfrågan på bättre AI-prestanda och mer förutsägbara infrastrukturkostnader.
Denna ekosystemstrategi är betydande eftersom de flesta organisationer inte sätter samman produktions-AI-miljöer från en enda leverantör.
En typisk distribution kan inkludera GPU:er, nätverk, lagring, Kubernetes, modell-serverprogram, övervakning, säkerhet och styrningsprodukter från flera leverantörer. Jointly validerade konfigurationer kan minska integreringsarbetet, även om kunderna fortfarande behöver testa prestanda med hjälp av sina egna modeller, datamängder, nätverk och samtidighetskrav.
Vad Detta Betyder För AI-Infrastruktur
Det viktigaste aspekten av tillkännagivandet är inte något enskilt kapacitets- eller genomströmningsnummer. Det är den växande konvergensen av lagring, distribuerad caching, minneshantering, data-rörlighet och hyresgästisolering.
Som AI-agenter behåller längre historik, kommer åt mer företagsinformation och fungerar kontinuerligt, kommer den omgivande infrastrukturen kring GPU:er att alltmer bestämma kostnaden för varje användbar respons.
Att lägga till fler acceleratorer kommer inte att lösa flaskhalsar orsakade av upprepad kontextbearbetning, långsam dataförflyttning, fragmenterade protokoll eller outnyttjad lagringskapacitet. Nästa fas av AI-infrastruktur kommer därför att bero lika mycket på att mata och hantera GPU:er effektivt som det beror på att öka rå beräkning.
NeuralMesh 6 är planerad att bli allmänt tillgänglig under den andra halvan av 2026, med befintliga kunder som är berättigade att uppgradera genom den standardprogramvarukanalen. De nya WEKApod Nitro, Prime och Prime Max-systemen är tillgängliga för beställning, med leveranser som förväntas börja under hösten 2026.












