AI-modeller og platforme

WEKA Lancerer NeuralMesh 6 og WEKApod 3, da AI-Infrastruktur Skifter Mod Inference

mm
Føj Unite.AI til dine foretrukne kilder på Google

WEKA har introduceret en koordineret software- og hardware-opdatering rettet mod en af de dyreste opkomne problemer i AI-industrien: At holde GPU’er produktive, mens modellerne flytter fra træning til kontinuerlig, stort inference.

Meddelelserne inkluderer NeuralMesh 6, en større opdatering af virksomhedens data- og hukommelsesplatform, samt tredje generation WEKApod-applikationer, der er designet til AI-skyer, modeludviklere, forskningsorganisationer og virksomheder, der driver GPU-infrastruktur.

Sammen repræsenterer udgivelserne en bredere ændring i AI-infrastrukturdesign, hvor lagring udvikler sig fra en passiv lagring til en aktiv hukommelse og dataleveringslag.

En Samlet Push mod Produktion AI

Infrastrukturkravene til AI-inference adskiller sig væsentligt fra dem til modeltræning. Træningsjob typisk behandler store datasæt gennem relativt forudsigelige rørledninger. Agentic AI, retrieval-augmented generation og lang-kontekst resonanssystemer skal i stedet få adgang til ændrende data, opretholde kontekst på tværs af gentagne interaktioner og understøtte mange samtidige brugere uden at lade dyre GPU’er vente på information.

WEKA’s svar er at behandle lagring, hukommelsesudvidelse, filadgang, objektilgang og dataforsflytning som dele af samme platform. NeuralMesh er designet til at give en fælles datagrundlag for træning, inference og højpræstationsberegning på lokale miljøer, offentlige skyer og hybridinstallationer.

Den nye udgave udvider denne arkitektur med multi-tenancy, nativ objektlagring, distribueret cachelagring, automatiseret datareduktion, Kubernetes-operationer og central overvågning.

I stedet for at præsentere software- og appliance-meddelelser som ikke-relaterede opgraderinger, præsenterer virksomheden dem som to dele af samme system. NeuralMesh 6 styrer, hvordan data lagres, flyttes, isoleres og leveres, mens WEKApod 3 tilbyder hardware, der er designet omkring disse funktioner.

NeuralMesh 6 Samler Fil- og Objektarbejdsbyrder

En af de mere konsekvensfulde tilføjelser i NeuralMesh 6 er en naturlig S3-implementering, der kører på NVMe-lagring. De samme underliggende datablokke kan adgangs via S3-objektprotokoller og POSIX- eller Network File System-grænseflader uden at opretholde separate kopier.

Dette er vigtigt, fordi AI-rørledninger ofte flytter information mellem objektlagring, højpræstationsfilsystemer, træningsmiljøer og inference-kluster. Hver kopi forbruger kapacitet, introducerer forsinkelser og komplicerer styring. En samlet navneområde kunne tillade, at data, der er oprettet gennem en protokol, kan blive straks tilgængelige gennem en anden.

WEKA siger, at deres implementering understøtter mellem 2.000 og 5.000 samtidige S3-forbindelser per node. Den understøtter også S3 over Remote Direct Memory Access, hvilket tillader, at data flyttes mod GPU-hukommelse uden at følge den konventionelle vej gennem flere CPU- og operativsystemlag.

Platformen introducerer to niveauer af multi-tenancy. Composable Clusters allokerer dedikeret processor-, hukommelses- og lagerressourcer til enkeltlejer, mens virtuel multi-tenancy giver netværksisolering, uafhængig kryptering, separat godkendelse og lejer-specifik kvalitetsstyring.

Virtual miljøer kan understøtte mere end 1.000 isolerede lejere per cluster, ifølge virksomheden. At kombinere de fysiske og virtuelle modeller kunne tillade en stor infrastruktur-operatør at understøtte titusinder af logisk adskilte kunder uden at installere en uafhængig lagerkluster til hver enkelt.

Dette er særligt relevant for GPU-as-a-service-udbydere og suveræne AI-skyer, der skal balancere høj infrastruktur-udnyttelse med streng kundeisolering.

Flyt Data til Hvor Som Helst GPU’er Er Tilgængelige

NeuralMesh 6 introducerer også metadata-først-replikation og fjerncachelagring til AI-arbejdsbyrder, der er fordelt på tværs af datacentre, skyer og geografiske områder.

Traditionel replikering kræver normalt, at hele datasættet skal kopieres, før en arbejdsbyrde kan starte. NeuralMesh gør i stedet metadata synligt på destinationen og overfører herefter de underliggende data, som de anmodes.

Dette kunne tillade operatører at flytte job mod tilgængelig GPU-kapacitet uden først at replikere hver fil, der er forbundet med projektet. Tilgangen er designet til at understøtte cloud-bursting, distribueret AI-infrastruktur og samarbejde mellem geografisk adskilte forsknings- eller ingeniørhold.

Det repræsenterer også et tidligt skridt mod en global navneområdemodel, hvor data kan adgangs konsekvent uanset, hvor de oprindeligt blev gemt.

En anden ny funktion anvender fingeraftryk, lignende hashing, deduplikation og komprimering kontinuerligt i stedet for at behandle datareduktion som en valgfri baggrundsproces.

WEKA hævder, at NeuralMesh 6 kan give op til seksfoldige kapacitetsbesparelser på AI-træningsdata med mindre end 5% skriveoverhead. Aktuelle reduktioner afhænger af datasættet. Kontrolpunkter, containerlag, modelversioner og iterativ træningsdata kan indeholde betydelig gentagelse, mens andre datatyper kan komprimere mindre effektivt.

Virksomheden planlægger at analysere repræsentative kundedata før installation og bruge den resulterende vurdering som en del af deres kapacitets- og ydelsesforpligtelser.

Gør Lagring til en Udvidet AI-Hukommelseslag

NeuralMesh inkluderer også WEKA’s Augmented Memory Grid, der bruger NVMe-lagring som en varig udvidelse af GPU-hukommelse til inference.

Store sprogmodeller opretter en nøgle-værdi-cache, der indeholder information, der er beregnet fra en prompt eller samtale. For lange kontekster og agentic arbejdsprocesser kan denne cache blive ekstremt stor. Når den ikke kan forblive i højhastigheds-GPU-hukommelse, kan systemer være nødt til at frigøre den, genberegne den eller flytte den til langsommere infrastruktur.

Augmented Memory Grid gemmer denne cache i en varig NVMe-baseret lag og bruger Remote Direct Memory Access og NVIDIA GPUDirect Storage til at flytte den tilbage til GPU’er.

Målet er at bevare genbrugbar kontekst, mens man reducerer gentagen forfyldningsberegning, en af de mere ressourcekrævende stadier af lang-kontekstinference.

WEKA rapporterer, at test på Oracle Cloud Infrastructure med NVIDIA H100-GPU’er producerede ti gange højere token-gennemløb, ti gange flere samtidige brugere og syv gange flere tokens per GPU.

Disse tal er arbejdsbyrde-specifikke benchmark-resultater og ikke universelle ydelsesforventninger, men de illustrerer, hvorfor varig cachestyring er blevet en vigtig del af inference-infrastrukturdesign.

WEKApod 3 Tager Kontrol over Hardware-Laget

Mens tidligere WEKApod-systemer kombinerede WEKA-software med forudvalideret infrastruktur, flytter tredje generation længere ind i vertikalt integreret systemdesign.

WEKA designede den nye to-rack-unit-chassis, drive-interconnect, kølearkitektur, fejlområder og service-system. Applikationerne bruger PCI Express Gen 6 internt og NVIDIA (NVDA ) ConnectX-netværk til forbindelse til Spectrum-X-Ethernet-infrastruktur.

WEKApod-familien består nu af tre konfigurerbare systemer. Nitro er optimeret til båndbredde-intensiv inference og AI-fabriksarbejdsbyrder. Prime kombinerer triple-level cell og quad-level cell flash for at balancere ydelse og kapacitet. Prime Max prioriterer maksimal lagringsdensitet og kan indeholde op til 70 NVMe-drev i en to-rack-unit-chassis.

Ved fuld rack-skala siger WEKA, at Prime Max kan give 441,5 petabyte rå kapacitet og 1,1 exabyte effektiv kapacitet efter NeuralMesh-datareduktion. Rack-niveau-systemet er vurderet til op til 10,2 terabyte per sekund og 210 millioner input/output-operationer per sekund.

Forskellen mellem rå og effektiv kapacitet er vigtig. Exabyte-tallet afhænger af reduktionen, der kan opnås på lagrede data, og bør ikke fortolkes som mere end et exabyte fysisk flash.

Alligevel kan større densitet have betydelige konsekvenser i faciliteter, hvor lagring konkurrerer med GPU’er om rack-plads, køling og elektrisk kapacitet.

Designet til Begrænsede Datacentre

De nye systemer adresserer også de fysiske begrænsninger, der stadig mere former AI-infrastrukturprojekter.

GPU-kluster kræver store mængder elektricitet, køling, netværk og gulvplads. Lagringsystemer, der forbruger disse ressourcer ineffektivt, kan reducere antallet af acceleratorer, som en facilitet kan understøtte.

WEKA hævder, at de nye applikationer giver 267% større effektiv kapacitetsdensitet og 114% større ydelsesdensitet end den næstbedste offentligt tilgængelige alternativer i deres respektive kategorier.

Virksomheden har også designet systemerne til at fungere i omgivelsestemperaturer på op til 35 grader Celsius. Software-styret effekt-throttling er designet til at reducere ydelsen gradvist under termisk stress i stedet for at udløse en lukning.

En backplane-fri drive-design skaber mindre fejlområder, mens hot-pluggable boot-drev og guided erstattingsforskrifter er designet til at reducere vedligeholdelsestid. Kunder kan konfigurere chassis-type, hukommelse, drive-kapacitet og drive-antal, med installationer, der varierer fra mindre end ét petabyte til mere end 100 petabyte.

Opbygning af en Økosystem omkring AI-Fabrikker

De tilhørende partnermeddelelser antyder, at platformen vil nå kunder gennem infrastruktur-integratorer, cloud-udbydere og AI-orchestrations-virksomheder.

Spectro Cloud positionerer NeuralMesh som en data-lag, der kan kombineres med PaletteAI til at installere og operere enterprise AI-fabrikker. World Wide Technology og Computacenter planlægger at inkorporere systemerne i bredere infrastrukturprojekter, mens Glocomp fremhævede kundebehov for bedre AI-ydelse og mere forudsigelige infrastruktur-omkostninger.

Denne økosystem-strategi er betydelig, fordi de fleste organisationer ikke samler produktions-AI-miljøer fra en enkelt leverandør.

En typisk installation kan inkludere GPU’er, netværk, lagring, Kubernetes, model-server software, overvågning, sikkerhed og styringsprodukter fra multiple leverandører. Fælles validerede konfigurationer kan reducere integrationsarbejde, selv om kunder stadig skal teste ydelse ved hjælp af deres egne modeller, datasæt, netværk og samtidighedskrav.

Hvad Dette Betyder for AI-Infrastruktur

Det vigtigste aspekt af meddelelsen er ikke noget enkelt kapacitets- eller gennemløbsnummer. Det er den voksende konvergens af lagring, distribueret cachelagring, hukommelsesstyring, dataforsflytning og lejer-isolering.

Som AI-agenter bevare længere historier, får adgang til mere virksomhedsinformation og opererer kontinuerligt, vil infrastrukturen omkring GPU’er stadig mere bestemme omkostningerne ved hver nyttig respons.

Tilføjelse af flere acceleratorer vil ikke løse flaskeshals, der skyldes gentagen kontekstbehandling, langsom dataforsflytning, fragmenterede protokoller eller underudnyttet lagringskapacitet. Den næste fase af AI-infrastruktur vil derfor afhænge lige så meget af at føde og styre GPU’er effektivt som det gør af at øge rå beregning.

NeuralMesh 6 er planlagt til at blive generelt tilgængelig i anden halvdel af 2026, med eksisterende kunder, der er berettiget til at opgradere gennem den standard software-kanal. De nye WEKApod Nitro, Prime og Prime Max-systemer er tilgængelige til bestilling, med leverancer, der forventes at begynde i efteråret 2026.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.