AI-mallit ja alustat
WEKA julkaisee NeuralMesh 6:n ja WEKApod 3:n, kun tekoälyinfrastruktuuri siirtyy inferenceen

WEKA on esittänyt koordinoituneen ohjelmisto- ja laitteistouudistuksen, joka kohdistuu yhteen tekoälyteollisuuden kalleimmista nousevista ongelmista: pitämään GPU:t tuottavina, kun mallit siirtyvät koulutuksesta jatkuvaan, laajamittaiseen inferenceen.
Ilmoitukset sisältävät NeuralMesh 6:n, joka on merkittävä päivitys yrityksen data- ja muistiohjelmistoon, sekä kolmannen sukupolven WEKApod-laitteet, jotka on suunniteltu tekoälypilviin, mallikehittäjiin, tutkimuslaitoksiin ja yrityksiin, jotka toimittavat GPU-infrastruktuuria.
Nämä julkaisut heijastelevat laajempaa muutosta tekoälyinfrastruktuurin suunnittelussa, jossa tallennus kehittyy passiivisesta varastosta aktiiviseksi muisti- ja data-toimituskerrokseksi.
Yhtenäinen siirtyminen tuotantotekoälyyn
Tekoälyinferenceen liittyvät infrastruktuurin vaatimukset poikkeavat merkittävästi koulutuksen vaatimuksista. Koulutustehtävät käsittelevät tyypillisesti suuria tietoja suhteellisen ennustettavissa olevien putkien kautta. Agentic AI, retrieval-augmented generation ja long-context reasoning -järjestelmien on kuitenkin pystyttävä käyttämään muuttuvia tietoja, ylläpitämään kontekstia useiden toistuvien vuorovaikutusten ajan ja tukemaan useita samanaikaista käyttäjää ilman, että kalliit GPU:t joutuvat odottamaan tietoja.
WEKA:n vastaus on kohdella tallennusta, muistin laajentamista, tiedostoon käyttöä, objektiin käyttöä ja tietojen siirtämistä saman alustan osina. NeuralMesh on suunniteltu tarjoamaan jaettu dataläjä koulutukselle, inferenceille ja suorituskyvylle laskennassa sekä paikallisissa, julkisissa pilvissä että hybridiympäristöissä.
Uusi julkaisu laajentaa tätä arkkitehtuuria monen vuokraajan hallinnalla, alkuunpanemisella objektitallennuksella, hajautetulla välimuistilla, automaattisella datan vähentämisellä, Kubernetes-toiminnoilla ja keskitetyllä havainnollistamisella.
Yritys ei esitä ohjelmisto- ja laitteistojulkaisuja erillisinä päivityksinä, vaan esittää ne saman järjestelmän osina. NeuralMesh 6 hallitsee, miten data tallennetaan, siirretään, eristetään ja toimitetaan, kun taas WEKApod 3 tarjoaa laitteiston, joka on suunniteltu näiden toimintojen ympärille.
NeuralMesh 6 yhdistää tiedosto- ja objektiworkloadit
Yksi merkittävimmistä lisäyksistä NeuralMesh 6:ssa on alkuunpanemisella S3-toteutus, joka toimii NVMe-tallennuksella. Samat perustavat tietoblokkeja voidaan käyttää S3-objektiprotokollan kautta ja POSIX- tai Network File System -liittymien kautta ilman, että niitä on ylläpidettävä erillisinä kappaleina.
Tämä on merkittävää, koska tekoälyputket usein siirtävät tietoja objektisäilöstä suorituskykyisiin tiedostojärjestelmiin, koulutusympäristöihin ja inference-klustereihin. Jokainen kappale vie kapasiteettia, aiheuttaa viiveitä ja monimutkaistaa hallintaa. Yhdistetty nimiavaruus voisi mahdollistaa, että data, joka on luotu yhden protokollan kautta, voidaan tehdä välittömästi saataville toisen protokollan kautta.
WEKA ilmoittaa, että heidän toteutuksensa tukee 2 000 ja 5 000 rinnakkaisen S3-yhteyden välillä solmussa. Se tukee myös S3:aa Remote Direct Memory Accessin kautta, jolloin data voidaan siirtää GPU-muistiin ilman, että se kulkee useiden CPU- ja käyttöjärjestelmäkerrosten kautta.
Alusta esittelee kaksi tasoa monen vuokraajan hallinnalla. Composable Clusters varaa omat prosessori-, muisti- ja tallennusresursseja yksittäisille vuokraajille, kun taas virtuaalinen monen vuokraajan hallinta tarjoaa verkkueristystä, riippumattoman salausta, erillisen todennuksen ja vuokraajakohtaisia laadunvalvontatoimintoja.
Virtuaaliset ympäristöt voivat tukea yli 1 000 eristettyä vuokraajaa klusteri kohden, yrityksen mukaan. Yhdistämällä fyysisen ja virtuaalisen mallit voisi mahdollistaa suuren infrastruktuurin toimittajan tukea kymmeniä tuhansia loogisesti eristettyjä asiakkaita ilman, että jokaiselle asiakkaalle on käytettävä erillistä tallennusklusteria.
Tämä on erityisen merkittävää GPU-palveluntarjoajille ja suvereenille tekoälypilville, jotka tarvitsevat tasapainotella korkeaa infrastruktuurin käyttöä ja tiukkaa asiakaseroistusta.
Siirtäminen tietoja minne tahansa GPU:lle on saatavilla
NeuralMesh 6 esittelee myös metadata-ensin replikoinnin ja etävälimuistin tekoälytyökuormille, jotka on jakautunut tietokeskuksiin, pilviin ja maantieteellisiin alueisiin.
Perinteinen replikointi vaatii yleensä, että koko tietojoukko on kopioitava ennen kuin työkuorma voidaan aloittaa. NeuralMesh tekee kuitenkin kohde- metadataa heti näkyväksi ja siirtää perustiedot vasta, kun niitä pyydetään.
Tämä voisi mahdollistaa operaattorien siirtää työkuormia kohti saatavilla olevaa GPU-kapasiteettia ilman, että jokainen tiedosto on kopioitava ennen kuin projekti voidaan aloittaa. Tämä lähestymistapa on tarkoitettu tukemaan pilvipurkauksia, hajautettua tekoälyinfrastruktuuria ja yhteistyötä maantieteellisesti erillisten tutkimus- tai insinööritiimien välillä.
Se edustaa myös varhaisen askelen kohti globaalia nimiavaruusmallia, jossa data voidaan osoittaa johdonmukaisesti riippumatta siitä, missä se alun perin tallennettiin.
Toinen uusi ominaisuus soveltaa sormenjälkiä, samankaltaisuuden hajottamista, deduplikaatiota ja pakkaamista jatkuvasti eikä kohdella datan vähentämistä valinnaisena taustaprosessina.
WEKA väittää, että NeuralMesh 6 voi tarjota jopa kuusi kertaa suuremman kapasiteetin säästöt tekoälykoulutusdatasta alle 5 prosentin kirjoitusviiveellä. Todelliset vähennykset riippuvat tietojoukosta. Tarkistuspisteet, konttisivut, malliversiot ja iteraattorinen koulutusdata voivat sisältää merkittävää toistoa, kun taas muut tietotyypit voivat pakata vähemmän tehokkaasti.
Yritys aikoo analysoida edustavan asiakasdatan ennen käyttöönottoa ja käyttää tuloksena olevaa arviota osana kapasiteetti- ja suorituskykyvaatimuksiaan.
Muuttaminen tallennusta tekoälyn muistikerrokseksi
NeuralMesh sisältää myös WEKA:n Augmented Memory Gridin, joka käyttää NVMe-tallennusta kestävänä laajennuksena GPU-muistille inferenceä varten.
Isot kielimallit luo avain-arvoparikansion, joka sisältää tietoja, jotka on laskettu kehotteen tai keskustelun perusteella. Pitkien kontekstien ja agentic-työkalujen osalta tämä kansion voi tulla erittäin suureksi. Kun se ei voi olla korkean kaistanleveyden GPU-muistissa, järjestelmät saattavat joutua hylkäämään sen, laskemaan sen uudelleen tai siirtämään sen hitaampiin infrastruktuureihin.
Augmented Memory Grid tallentaa tämän kansion NVMe-tukevassa kerroksessa ja käyttää Remote Direct Memory Accessia ja NVIDIA GPUDirect Storagea siirtämään sen takaisin GPU:lle.
Tavoitteena on säilyttää uudelleen käytettävä konteksti vähentämällä toistuvaa esitietojen laskentaa, joka on yksi inferenceen liittyvän resursseja vaativimmista vaiheista.
WEKA raportoi, että testaus Oracle Cloud Infrastructurella käyttäen NVIDIA H100 -GPU:ita tuotti kymmenen kertaa suuremman tokenin läpimenoaikaa, kymmenen kertaa enemmän samanaikaista käyttäjää ja seitsemän kertaa enemmän tokenia GPU:lla.
Nämä luvut ovat työkuorma-kohtaisia vertailulukuja eikä yleisiä suorituskykyodotuksia, mutta ne havainnollistavat, miksi kestävä välimuistin hallinta on tuleva osa inference-infrastruktuurin suunnittelua.
WEKApod 3 ottaa hallinnan laitteistokerroksesta
Kun aiemmat WEKApod-järjestelmät yhdistivät WEKA:n ohjelmiston ennalta validoidun infrastruktuurin kanssa, kolmas sukupolvi siirtyy pidemmälle pystyyn integroidun järjestelmäsuunnittelun pariin.
WEKA on suunnitellut uuden kaksi rack-yksikköä sisältävän rungon, aseiden välisten yhteyksien, jäähdytysarkkitehtuurin, vikavirheitä ja huoltojärjestelmän. Laitteet käyttävät PCI Express Gen 6:ta sisäisesti ja NVIDIA ConnectX -verkkotekniikkaa yhteyden muodostamiseen Spectrum-X Ethernet -infrastruktuuriin.
WEKApod-perhe koostuu nyt kolmesta konfiguroitavasta järjestelmästä. Nitro on optimoitu bändileveydelle herkkään inferenceen ja tekoälytehtaan työkuormiin. Prime yhdistää triple-level cell – ja quad-level cell -flashin tasapainottaakseen suorituskyvyn ja kapasiteetin. Prime Max priorisoi enimmäistallennustiheyttä ja sopii jopa 70 NVMe-levyä kaksiin rack-yksikköön.
Täysin rack-koossa WEKA sanoo, että Prime Max voi tarjota 441,5 petatavun raakakapasiteetin ja 1,1 eksatavun tehokasta kapasiteettia NeuralMeshin datan vähentämisen jälkeen. Rack-tason järjestelmä on arvioitu 10,2 teratavun sekuntivaihdon ja 210 miljoonan syötteen ja tulon toiminnon nopeudelle.
Raw- ja tehokkaan kapasiteetin välinen ero on tärkeä. Eksatavun luku riippuu vähennyksestä, joka on saavutettavissa tallennetuissa tiedoissa, eikä sitä pidä tulkittavaksi enemmän kuin eksatavun fyysistä flash-muistia.
Jopa niinäkin, suurempi tiheys voi johtaa merkittäviin seurauksiin laitoksissa, joissa tallennus kilpailee GPU:iden kanssa rack-tilasta, jäähdytyskapasiteetista ja sähkökapasiteetista.
Suunniteltu rajoitettuihin tietokeskuksiin
Uudet järjestelmät ovat myös suunniteltu fyysisten rajoitusten mukaisesti, jotka muotoilevat yhä enemmän tekoälyinfrastruktuurin projekteja.
GPU-klusterit vaativat paljon sähköä, jäähdytystä, verkkoyhteyksiä ja lattiatilaa. Tallennusjärjestelmät, jotka kuluttavat näitä resursseja tehokkaasti, voivat vähentää kiihdyttimien määrää, jonka laitos voi tukea.
WEKA väittää, että uudet laitteet tarjoavat 267 prosenttia suuremman tehokkaan kapasiteetin tiheyden ja 114 prosenttia suuremman suorituskyvyn tiheyden verrattuna seuraavaksi parhaisiin julkisesti saatavilla oleviin vaihtoehtoihin niiden luokissa.
Yritys on myös suunnitellut järjestelmät toimimaan ympäristölämpötilassa jopa 35 asteessa Celsius. Ohjelmistotehokkaalla tehonsäätelyllä on tarkoitus vähentää suorituskykyä vähitellen lämpökuormituksen aikana eikä laukaista sammutusta. Runkoon perustuva aseiden suunnittelu luo pienemmät vikavirheet, kun taas kuumaan asennettavat käynnistyslevyt ja ohjatut korvausmenetelmät on tarkoitettu vähentämään huoltoaikaa. Asiakkaat voivat konfiguroida rungon tyypin, muistin, aseiden kapasiteetin ja aseiden määrän, ja käyttöönotot vaihtelevat alle yhden petatavun ja yli 100 petatavun välillä.
Rakentaminen ekosysteemiä tekoälytehtaiden ympärille
Sopimussopimusten ilmoitukset viittaavat siihen, että alusta tulee asiakkaisiin infrastruktuurin integraattorien, pilvipalveluntarjoajien ja tekoälyorkestraatiotoimittajien kautta.
Spectro Cloud asettaa NeuralMeshin datakerroksena, joka voidaan yhdistää PaletteAI:hin tekoälytehtaiden käyttöönottoon ja toimintaan. World Wide Technology ja Computacenter aikovat sisällyttää järjestelmät laajempiin infrastruktuuriprojekteihin, kun taas Glocomp korosti asiakkaiden tarvetta paremmalle tekoälysuorituskyvylle ja ennalta arvioitavammalle infrastruktuurin kustannuksille.
Tämä ekosysteemistrategia on merkittävä, koska useimmat organisaatiot eivät kokoaa tuotantotekoälyympäristöjä yhdestä toimittajasta.
Tyypillinen käyttöönotto voi sisältää GPU:ita, verkkotekniikkaa, tallennusta, Kubernetesia, mallipalveluohjelmistoa, havainnollistamista, turvallisuutta ja hallintaa useiden toimittajien tuotteista. Yhteisesti validoidut konfiguraatiot voivat vähentää integraatiotyötä, vaikka asiakkaat tarvitsevat edelleen testata suorituskykyä omien malliensa, tietojensa, verkkonsa ja samanaikaisuusvaatimustensa kanssa.
Mitä tämä merkitsee tekoälyinfrastruktuurille
Tärkein asia ilmoituksessa ei ole yksittäinen kapasiteetti- tai läpimenoaikaluku, vaan kasvava yhdistyminen tallennusta, hajautettua välimuistia, muistinhallintaa, tietoliikennettä ja vuokraajien eristystä.
Kun tekoälyagentit säilyttävät pitempiä historioita, käyttävät enemmän yritystietoja ja toimivat jatkuvasti, infrastruktuuri, joka ympäröi GPU:ita, määrittää yhä enemmän kunkin hyödyllisen vastauksen kustannukset.
Lisäämällä enemmän kiihdyttimiä ei voida ratkaista pullonkauloja, jotka johtuvat toistuvasta kontekstin prosessoinnista, hitaasta tietoliikenteestä, fragmentoiduista protokollista tai vähän käytetystä tallennuskapasiteetista. Tekoälyinfrastruktuurin seuraava vaihe riippuu yhtä lailla siitä, miten GPU:ita syötetään ja hallitaan tehokkaasti, kuin siitä, miten lisätään raakalaskentaa.
NeuralMesh 6 on tarkoitus tulla yleisesti saataville vuoden 2026 toisella puoliskolla, ja olemassa olevat asiakkaat ovat oikeutettuja päivittämään sen kautta standardia ohjelmistokanavaa. Uudet WEKApod Nitro, Prime ja Prime Max -järjestelmät ovat tilattavissa, ja toimitukset on odotettavissa alkavan syksyllä 2026.












