AI-modellen en platforms

WEKA lanceert NeuralMesh 6 en WEKApod 3 terwijl AI-infrastructuur verschuift naar inferentie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

WEKA heeft een gecoördineerde software- en hardware-overhaul aangekondigd die gericht is op een van de duurste opkomende problemen in de AI-industrie: het productief houden van GPUs terwijl modellen van training naar continue, grote-schaal inferentie gaan.

De aankondigingen omvatten NeuralMesh 6, een belangrijke update van het data- en geheugenplatform van het bedrijf, naast derde-generatie WEKApod-appliances die zijn ontworpen voor AI-wolken, modelontwikkelaars, onderzoeksorganisaties en ondernemingen die GPU-infrastructuur exploiteren.

Samen weerspiegelen de releases een bredere verandering in AI-infrastructuurontwerp, waarbij opslag evolueert van een passieve repository naar een actieve geheugen- en datadeliverylaag.

Een geünificeerde push naar productie-AI

De infrastructuurvereisten van AI-inferentie verschillen aanzienlijk van die van modeltraining. Trainingsbanen verwerken meestal grote datasets via relatief voorspelbare pijplijnen. Agente AI, retrieval-augmented generatie en lange-context redeneringssystemen moeten daarentegen toegang krijgen tot veranderende data, context behouden over herhaalde interacties en ondersteuning bieden voor veel gelijktijdige gebruikers zonder dure GPUs te laten wachten op informatie.

WEKA’s reactie is om opslag, geheugenuitbreiding, bestandstoegang, objecttoegang en dataverplaatsing te behandelen als onderdelen van hetzelfde platform. NeuralMesh is ontworpen om een gedeelde datafoundation te bieden voor training, inferentie en high-performance computing in on-premises-omgevingen, openbare clouds en hybride implementaties.

De nieuwe release breidt deze architectuur uit met multi-tenancy, native objectopslag, gedistribueerde caching, geautomatiseerde datavermindering, Kubernetes-bewerkingen en centrale observabiliteit.

In plaats van de software- en appliance-aankondigingen te positioneren als ongerelateerde upgrades, presenteert het bedrijf ze als twee delen van hetzelfde systeem. NeuralMesh 6 regelt hoe data wordt opgeslagen, verplaatst, geïsoleerd en geleverd, terwijl WEKApod 3 hardware biedt die is ontworpen rondom die functies.

NeuralMesh 6 unificeert bestands- en objectworkloads

Een van de meer consequente toevoegingen in NeuralMesh 6 is een native S3-implementatie die draait op NVMe-opslag. Dezelfde onderliggende datablokken kunnen worden toegankelijk gemaakt via S3-objectprotocollen en POSIX- of Network File System-interfaces zonder separate kopieën te behouden.

Dat is belangrijk omdat AI-pijplijnen vaak informatie verplaatsen tussen objectopslag, high-performance bestandssystemen, trainingsomgevingen en inferentieclusters. Elke kopie verbruikt capaciteit, introduceert vertragingen en compliceert governance. Een unified namespace kan toelaten dat data die is gemaakt via een protocol onmiddellijk beschikbaar wordt via een ander protocol.

WEKA zegt dat hun implementatie ondersteuning biedt voor tussen 2.000 en 5.000 gelijktijdige S3-verbindingen per knooppunt. Het ondersteunt ook S3 via Remote Direct Memory Access, waardoor data kan worden verplaatst naar GPU-geheugen zonder de conventionele route via meerdere CPU- en besturingssysteemlagen te volgen.

Het platform introduceert twee niveaus van multi-tenancy. Composable Clusters alloceren toegewezen processor-, geheugen- en opslagbronnen aan individuele tenants, terwijl virtuele multi-tenancy netwerkisolatie, onafhankelijke encryptie, separate authenticatie en per-tenant kwaliteitscontrole biedt.

Virtuele omgevingen kunnen ondersteuning bieden voor meer dan 1.000 geïsoleerde tenants per cluster, volgens het bedrijf. Het combineren van de fysieke en virtuele modellen kan een grote infrastructuuroperator toelaten om tienduizenden logisch gescheiden klanten te ondersteunen zonder een onafhankelijk opslagcluster te implementeren voor elke klant.

Dit is bijzonder relevant voor GPU-as-a-service-aanbieders en soevereine AI-wolken die een balans moeten vinden tussen hoge infrastructuuruitbating en strikte klantisolatie.

Gegevens verplaatsen naar waar GPUs beschikbaar zijn

NeuralMesh 6 introduceert ook metadata-first replicatie en remote caching voor AI-workloads die zijn gedistribueerd over datacenters, clouds en geografische regio’s.

Traditionele replicatie vereist meestal dat een hele dataset wordt gekopieerd voordat een workload kan beginnen. NeuralMesh maakt de metadata van de bestemming onmiddellijk zichtbaar en verplaatst de onderliggende data wanneer deze wordt aangevraagd.

Dit kan operators toelaten om banen te verplaatsen naar beschikbare GPU-capaciteit zonder eerst elke bijbehorende bestand te kopiëren. De benadering is bedoeld om cloud bursting, gedistribueerde AI-infrastructuur en samenwerking tussen geografisch gescheiden onderzoeks- of ingenieurs teams te ondersteunen.

Het vertegenwoordigt ook een vroeg stadium van een globale namespace-model waarin data consistent kan worden toegewezen ongeacht waar deze oorspronkelijk is opgeslagen.

Een andere nieuwe functie past fingerprinting, similarity hashing, deduplicatie en compressie continu toe in plaats van datareductie te behandelen als een optionele achtergrondproces.

WEKA beweert dat NeuralMesh 6 tot zes keer meer capaciteit kan bieden op AI-trainingsdata met minder dan 5% schrijfoverhead. De werkelijke reducties zullen afhankelijk zijn van de dataset. Controlepunten, containerlagen, modelversies en iteratieve trainingsdata kunnen significante herhaling bevatten, terwijl andere datatypen minder effectief kunnen worden gecomprimeerd.

Het bedrijf plant om representatieve klantgegevens te analyseren voordat de implementatie plaatsvindt en het resulterende schatting te gebruiken als onderdeel van de capaciteits- en prestatieverbintenissen.

Opslag omzetten in een uitgebreid AI-geheugenlaag

NeuralMesh omvat ook WEKA’s Augmented Memory Grid, die NVMe-opslag gebruikt als een persistente uitbreiding van GPU-geheugen voor inferentie.

Grote taalmodellen creëren een key-value cache die informatie bevat die is berekend uit een prompt of conversatie. Voor lange contexten en agente workflows kan deze cache extreem groot worden. Wanneer deze niet in het high-bandwidth GPU-geheugen kan blijven, kunnen systemen deze moeten verwijderen, opnieuw berekenen of verplaatsen naar langzamere infrastructuur.

Augmented Memory Grid slaat deze cache op in een persistente NVMe-gebackede laag en gebruikt Remote Direct Memory Access en NVIDIA (NVDA ) GPUDirect Storage om deze terug te verplaatsen naar GPUs.

Het doel is om herbruikbare context te behouden en herhaalde prefill-berekeningen te verminderen, een van de meest resource-intensieve fasen van lange-context inferentie.

WEKA meldt dat tests op Oracle (ORCL ) Cloud Infrastructure met NVIDIA H100 GPUs tien keer hogere token-doorvoer, tien keer meer gelijktijdige gebruikers en zeven keer meer tokens per GPU produceerden.

Deze cijfers zijn workload-specifieke benchmarks en niet universele prestatieverbeteringen, maar ze illustreren waarom persistente cachebeheer een belangrijk onderdeel van inferentie-infrastructuurontwerp wordt.

WEKApod 3 neemt controle over de hardwarelaag

Terwijl eerdere WEKApod-systemen WEKA-software combineerden met vooraf gevalideerde infrastructuur, gaat de derde generatie verder in verticaal geïntegreerd systeemontwerp.

WEKA ontwierp de nieuwe twee-rack-unit behuizing, drive-interconnect, koelarchitectuur, foutdomeinen en serviceability-systeem. De appliances gebruiken PCI Express Gen 6 intern en NVIDIA ConnectX-netwerken voor verbinding met Spectrum-X Ethernet-infrastructuur.

De WEKApod-familie bestaat nu uit drie configureerbare systemen. Nitro is geoptimaliseerd voor bandbreedte-intensieve inferentie en AI-factory workloads. Prime combineert triple-level cell en quad-level cell flash om prestaties en capaciteit in balans te brengen. Prime Max prioriteert maximale opslagdichtheid en past tot 70 NVMe-schijven in een twee-rack-unit behuizing.

Bij volledige rack-schaal kan Prime Max 441,5 petabytes aan ruwe capaciteit en 1,1 exabytes aan effectieve capaciteit bieden na NeuralMesh-datareductie. Het rack-niveau systeem is gerated voor tot 10,2 terabytes per seconde aan doorvoer en 210 miljoen input/output-bewerkingen per seconde.

Het onderscheid tussen ruwe en effectieve capaciteit is belangrijk. Het exabyte-cijfer is afhankelijk van de reductie die kan worden bereikt over de opgeslagen data en mag niet worden geïnterpreteerd als meer dan een exabyte fysieke flash.

Toch kan grotere dichtheid significante gevolgen hebben in faciliteiten waar opslag concurreert met GPUs om rack-ruimte, koeling en elektrische capaciteit.

Ontworpen voor beperkte datacenters

De nieuwe systemen richten zich ook op de fysieke beperkingen die AI-infrastructuurprojecten steeds vaker vormgeven.

GPU-clusters vereisen grote hoeveelheden elektriciteit, koeling, netwerken en vloeroppervlak. Opslagsystemen die deze bronnen inefficiënt verbruiken, kunnen het aantal accelerators dat een faciliteit kan ondersteunen, verminderen.

WEKA beweert dat de nieuwe appliances 267% meer effectieve capaciteitsdichtheid en 114% meer prestatiesdichtheid bieden dan de beste openbaar beschikbare alternatieven in hun respectievelijke categorieën.

Het bedrijf heeft de systemen ook ontworpen om te functioneren bij omgevingstemperaturen tot 35 graden Celsius. Software-gestuurde vermogensbeperking is bedoeld om prestaties geleidelijk te verminderen tijdens thermische stress in plaats van een shutdown te activeren.

Een backplane-vrije schijfontwerp creëert kleinere foutdomeinen, terwijl hot-pluggable boot-schijven en geleide vervangingsprocedures zijn bedoeld om onderhoudstijd te verminderen. Klanten kunnen chassis-type, geheugen, schijfcapaciteit en schijfaantal configureren, met implementaties die variëren van minder dan één petabyte tot meer dan 100 petabytes.

Het opbouwen van een ecosysteem rond AI-fabrieken

De bijbehorende partneraankondigingen suggereren dat het platform klanten zal bereiken via infrastructuurintegrators, cloudproviders en AI-orchestratieaanbieders.

Spectro Cloud positioneert NeuralMesh als een datalaag die kan worden gecombineerd met PaletteAI voor het implementeren en exploiteren van enterprise AI-fabrieken. World Wide Technology en Computacenter plannen om de systemen op te nemen in bredere infrastructuurprojecten, terwijl Glocomp klantvraag naar betere AI-prestaties en meer voorspelbare infrastructuurkosten benadrukte.

Deze ecosysteemstrategie is belangrijk omdat de meeste organisaties productie-AI-omgevingen niet samenstellen uit één enkele leverancier.

Een typische implementatie kan GPUs, netwerken, opslag, Kubernetes, model-serving software, observabiliteit, beveiliging en governanceproducten van meerdere leveranciers omvatten. Gemeenschappelijk gevalideerde configuraties kunnen integratiewerk verminderen, hoewel klanten nog steeds prestaties moeten testen met hun eigen modellen, datasets, netwerken en gelijktijdigheidsvereisten.

Wat dit betekent voor AI-infrastructuur

Het meest belangrijke aspect van de aankondiging is niet elk individueel capaciteits- of doorvoercijfer. Het is de groeiende convergentie van opslag, gedistribueerde caching, geheugenbeheer, datamobiliteit en tenant-isolatie.

Naarmate AI-agents langer historie behouden, toegang krijgen tot meer bedrijfsinformatie en continu opereren, zal de infrastructuur om GPUs heen steeds meer bepalen wat de kosten zijn van elke nuttige reactie.

Het toevoegen van meer accelerators lost geen knelpunten op die worden veroorzaakt door herhaalde contextverwerking, langzame dataverplaatsing, gefragmenteerde protocollen of onderbenutte opslagcapaciteit. De volgende fase van AI-infrastructuur zal daarom evenzeer afhankelijk zijn van het efficiënt voeden en beheren van GPUs als van het verhogen van de ruwe berekeningscapaciteit.

NeuralMesh 6 is gepland om in de tweede helft van 2026 algemeen beschikbaar te worden, met bestaande klanten die in aanmerking komen voor een upgrade via het standaard softwarekanaal. De nieuwe WEKApod Nitro, Prime en Prime Max-systemen zijn beschikbaar voor bestelling, met leveringen die naar verwachting in het najaar van 2026 zullen beginnen.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.