AI-modeller og plattformer

WEKA Lanserer NeuralMesh 6 og WEKApod 3 Mens AI-Infrastruktur Skifter Mot Innsikt

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

WEKA har introdusert en koordinert programvare- og maskinvarerestrukturering rettet mot ett av AI-industriens mest kostbare nye problemer: å holde GPU-er produktive når modellene flyttes fra trening til kontinuerlig, storstilket innsikt.

Annonseringene inkluderer NeuralMesh 6, en større oppdatering av selskapets data- og minneplattform, samt tredje-generasjons WEKApod-applikasjoner designet for AI-skyer, modellutviklere, forskningsorganisasjoner og bedrifter som opererer GPU-infrastruktur.

Sammen reflekterer utgivelsene en større endring i AI-infrastrukturdesign, med lagring som utvikler seg fra et passivt repository til en aktiv minne- og dataleveringslag.

En Samlet Fremstøt Mot Produksjons-AI

Infrastrukturkravene til AI-innsikt skiller seg betraktelig fra de til modelltrening. Treningssystemer behandler vanligvis store datamengder gjennom relativt forutsigbare rørledninger. Agent-basert AI, retrieval-forbedret generering og lang-kontekst resonanssystemer må derimot aksessere endringsdata, opprettholde kontekst over gjentatte interaksjoner og støtte mange samtidige brukere uten å la dyre GPU-er vente på informasjon.

WEKAs respons er å behandle lagring, minneutvidelse, filaksess, objektaksess og dataflytting som deler av samme plattform. NeuralMesh er designet for å gi en felles datafoundation for trening, innsikt og høy-ytelsesregning over lokale miljøer, offentlige skyer og hybrid-distribusjoner.

Den nye utgivelsen utvider denne arkitekturen med multi-leie, nativ objektlagring, distribuert caching, automatisert datareduksjon, Kubernetes-operasjoner og sentralisert overvåking.

I stedet for å posisjonere programvare- og applikasjonsannonseringene som uavhengige oppgraderinger, presenterer selskapet dem som to deler av samme system. NeuralMesh 6 kontrollerer hvordan data lagres, flyttes, isoleres og leveres, mens WEKApod 3 tilbyr maskinvare designet rundt disse funksjonene.

NeuralMesh 6 Samler Fil- og Objektarbeidsbyrder

En av de mer konsekvensfulle tilleggene i NeuralMesh 6 er en innfødt S3-implementering som kjører på NVMe-lagring. De samme underliggende datablokkene kan aksesseres gjennom S3-objektprotokoller og POSIX- eller nettverksfilsystemgrensesnitt uten å opprettholde separate kopier.

Dette er viktig fordi AI-rørledninger ofte flytter informasjon mellom objektlagring, høy-ytelsesfilsystemer, treningsmiljøer og innsiktskluster. Hver kopi forbruker kapasitet, introduserer forsinkelser og kompliserer styring. En samlet navnerom kunne la data som er opprettet gjennom en protokoll bli umiddelbart tilgjengelig gjennom en annen.

WEKA sier at deres implementering støtter mellom 2 000 og 5 000 samtidige S3-tilkoblinger per node. Den støtter også S3 over fjern direkte minnehåndtering, som lar data flytte mot GPU-minne uten å følge den konvensjonelle veien gjennom flere CPU- og operativsystemlag.

Plattformen introduserer to nivåer av multi-leie. Komponerbarer cluster allokerer dedikert prosessor-, minne- og lagringsressurser til enkeltleie, mens virtuell multi-leie tilbyr nettverksisolering, uavhengig kryptering, separat autentisering og per-leie kvalitetsstyring.

Virtuelle miljøer kan støtte mer enn 1 000 isolerte leie per cluster, ifølge selskapet. Å kombinere de fysiske og virtuelle modellene kunne la en stor infrastruktur-operatør støtte titusener av logisk adskilte kunder uten å deployere en uavhengig lagringscluster for hver enkelt.

Dette er særlig relevant for GPU-til-tjeneste-tilbydere og suverene AI-skyer som må balansere høy infrastruktur-utnyttelse med streng kundeisolering.

Flytte Data til Hvor GPU-er er Tilgjengelige

NeuralMesh 6 introduserer også metadata-forst-replikering og fjern-caching for AI-arbeidsbyrder distribuert over data-sentre, skyer og geografiske regioner.

Tradisjonell replikering krever vanligvis at en hel datamengde kopieres før en arbeidsbyrd kan starte. NeuralMesh gjør i stedet metadata umiddelbart synlig på destinasjonsstedet, og overfører den underliggende data når den blir forespurt.

Dette kunne la operatører flytte arbeidsbyrder mot tilgjengelige GPU-kapasiteter uten å måtte replikere hver fil som er knyttet til prosjektet. Tilnærmingen er ment å støtte sky-utbrudd, distribuert AI-infrastruktur og samarbeid mellom geografisk adskilte forsknings- eller ingeniørteam.

Det representerer også et tidlig skritt mot en globalt navnerommodell hvor data kan adresseeres konsistent uavhengig av hvor den opprinnelig ble lagret.

En annen ny funksjon anvender fingeravtrykk, likhets-hashing, deduplisering og komprimering kontinuerlig, i stedet for å behandle datareduksjon som en valgfri bakgrunnsprosess.

WEKA hevder at NeuralMesh 6 kan gi opptil seksfoldige kapasitetsbesparelser på AI-treningdata med mindre enn 5% skrive-overhead. Aktuelle reduksjoner vil avhenge av datamengden. Kontrollpunkter, container-lag, modellversjoner og iterativ treningdata kan inneholde betydelig gjentakelse, mens andre datatyper kan komprimere mindre effektivt.

Selskapet planlegger å analysere representative kundedata før distribusjon og bruke den resulterende estimatet som en del av sine kapasitets- og ytelsesforpliktelser.

Omvandling av Lagring til Utvidet AI-Minne-Lag

NeuralMesh inkorporerer også WEKAs Augmented Memory Grid, som bruker NVMe-lagring som en varig utvidelse av GPU-minne for innsikt.

Store språkmodeller oppretter en nøkkel-verdi-cache som inneholder informasjon beregnet fra en prompt eller samtale. For lange kontekster og agent-basert arbeidsflyt kan denne cachen bli ekstremt stor. Når den ikke kan forbli i høy-båndbredds GPU-minne, kan systemer måtte kaste den, gjøre den om eller flytte den til langsommere infrastruktur.

Augmented Memory Grid lagrer denne cachen i en varig NVMe-bakket lag og bruker fjern direkte minnehåndtering og NVIDIA GPUDirect Storage for å flytte den tilbake til GPU-er.

Målet er å bevare gjenbrukbar kontekst mens man reduserer gjentatt forhåndsutfyllingsberegning, en av de mer ressurskrevende fasene i lang-kontekst-innsikt.

WEKA rapporterer at testing på Oracle Cloud Infrastructure med NVIDIA H100-GPU-er produserte ti ganger høyere token-gjennomstrømming, ti ganger flere samtidige brukere og syv ganger flere token per GPU.

Disse tallene er arbeidsbyrds-spesifikke benchmark-verdier, ikke universelle ytelsesforventninger, men de illustrerer hvorfor varig cacheløsning er blitt en viktig del av innsikts-infrastrukturdesign.

WEKApod 3 Tar Kontroll over Maskinvare-Laget

Mens tidligere WEKApod-systemer kombinerte WEKA-programvare med forhåndsvalideret infrastruktur, flytter tredje-generasjonen lenger inn i vertikalt integrert systemdesign.

WEKA designet den nye to-rack-enheten, drive-interconnect, kjølearkitektur, feilområder og service-system. Applikasjonene bruker PCI Express Gen 6 internt og NVIDIA (NVDA ) ConnectX-nettverk for tilkobling til Spectrum-X Ethernet-infrastruktur.

WEKApod-familien består nå av tre konfigurerbare systemer. Nitro er optimalisert for båndbreddsintensive innsikt og AI-fabrikk-arbeidsbyrder. Prime kombinerer trippel-nivå-celle og firedobbel-nivå-celle flash for å balansere ytelse og kapasitet. Prime Max prioriterer maksimal lagrings-tetthet og kan inneholde opptil 70 NVMe-enheter i en to-rack-enhet.

Ved full rack-skala sier WEKA at Prime Max kan tilby 441,5 petabyte rå kapasitet og 1,1 eksabyte effektiv kapasitet etter NeuralMesh-datareduksjon. Rack-nivå-systemet er ratet for opptil 10,2 terabyte per sekund gjennomstrømming og 210 millioner inn-/ut-dataoperasjoner per sekund.

Forskjellen mellom rå og effektiv kapasitet er viktig. Eksabyte-tallet avhenger av reduksjonen som kan oppnås over lagret data og bør ikke tolkes som mer enn en eksabyte fysisk flash.

Likevel kan større tetthet ha betydelige konsekvenser i fasiliteter hvor lagring konkurrrer med GPU-er om rack-plass, kjøling og elektrisk kapasitet.

Designet for Begrensede Data-Sentre

De nye systemene addreserer også de fysiske begrensningene som stadig former AI-infrastrukturprosjekter.

GPU-kluster krever store mengder elektrisitet, kjøling, nettverk og gulv-plass. Lagringsystemer som forbruker disse ressursene ineffektivt kan redusere antallet akseleratorer som en fasilitet kan støtte.

WEKA hevder at de nye applikasjonene tilbyr 267% større effektiv kapasitets-tetthet og 114% større ytelses-tetthet enn de neste beste offentlig tilgjengelige alternativene i sine respektive kategorier.

Selskapet har også designet systemene for å operere i omgivelsestemperaturer opptil 35 grader Celsius. Programvare-kontrollert effekt-drossling er ment å redusere ytelse gradvis under termisk stress i stedet for å utløse en nedtakning.

En bakplan-fri drive-design skaper mindre feilområder, mens varm-pluggbar boot-enheter og guidede erstattingsprosedyrer er ment å redusere vedlikeholds-tid. Kunder kan konfigurere chassis-type, minne, drive-kapasitet og drive-antall, med distribusjoner som varierer fra mindre enn ett petabyte til mer enn 100 petabyte.

Bygging en Økosystem Rundt AI-Fabrikker

De tilhørende partner-annonseringene antyder at plattformen vil nå kunder gjennom infrastruktur-integratorer, sky-tilbydere og AI-orkesetrerings-leverandører.

Spectro Cloud stiller NeuralMesh som en data-lag som kan kombineres med PaletteAI for å deployere og operere bedrifts-AI-fabrikker. World Wide Technology og Computacenter planlegger å inkorporere systemene i større infrastrukturprosjekter, mens Glocomp fremhevet kunde-etter-spørring etter bedre AI-ytelse og mer forutsigbare infrastruktur-kostnader.

Denne økosystem-strategien er betydelig fordi de fleste organisasjoner ikke samler produksjons-AI-miljøer fra en enkelt leverandør.

En typisk distribusjon kan inkludere GPU-er, nettverk, lagring, Kubernetes, modell-tjeneste-programvare, overvåking, sikkerhet og styring fra flere leverandører. Felles validerede konfigurasjoner kan redusere integreringsarbeid, selv om kunder fortsatt må teste ytelse ved hjelp av sine egne modeller, datamengder, nettverk og samtidighets-krav.

Hva Dette Betyr for AI-Infrastruktur

Det viktigste aspektet ved annonseringen er ikke noen enkelt kapasitets- eller gjennomstrømnings-tall. Det er den økende konvergeringen av lagring, distribuert caching, minnehåndtering, data-bevegelse og leie-isolering.

Som AI-agenter beholder lengre historier, aksesserer mer bedriftsinformasjon og opererer kontinuerlig, vil infrastrukturen rundt GPU-er stadig bestemme kostnaden av hver nyttig respons.

Tilføyelse av flere akseleratorer vil ikke løse flaskenhalser forårsaket av gjentatt kontekst-behandling, langsom data-bevegelse, fragmenterte protokoller eller underutnyttet lagringskapasitet. Neste fase av AI-infrastruktur vil derfor avhenge like mye av å mate og håndtere GPU-er effektivt som det gjør å øke rå-ytelse.

NeuralMesh 6 er planlagt å bli generelt tilgjengelig under andre halvår 2026, med eksisterende kunder berettiget til å oppgradere gjennom standard programvare-kanal. De nye WEKApod Nitro, Prime og Prime Max-systemene er tilgjengelige for bestilling, med leveranser forventet å starte høsten 2026.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.