Modele și platforme AI

WEKA Lansează NeuralMesh 6 și WEKApod 3, în timp ce Infrastructura IA se Îndreaptă către Inferență

mm
Adaugă Unite.AI la sursele tale preferate pe Google

WEKA a introdus o revizuire coordonată a software-ului și hardware-ului, având ca scop una dintre cele mai scumpe probleme emergente din industria IA: menținerea productivității GPU-urilor pe măsură ce modelele trec de la antrenament la inferență continuă și la scară largă.

Anunțurile includ NeuralMesh 6, o actualizare majoră a platformei de date și memorie a companiei, alături de aplicații WEKApod de a treia generație, proiectate pentru nori AI, dezvoltatori de modele, organizații de cercetare și întreprinderi care exploatează infrastructura GPU.

Împreună, lansările reflectă o schimbare mai amplă în proiectarea infrastructurii IA, cu stocarea evoluând de la un depozit pasiv la un strat de memorie activ și de livrare a datelor.

O Pusă În Produçtie Unificată a IA

Cerințele de infrastructură ale inferenței IA diferă considerabil de cele ale antrenamentului modelului. Joburile de antrenament procesează de obicei seturi de date mari prin conducte relativ previzibile. Sistemele de generare augmentată, de raționament cu context lung și de generare agentică trebuie, în schimb, să aibă acces la date în schimbare, să mențină contextul de-a lungul interacțiunilor repetate și să susțină mulți utilizatori concurenți fără a lăsa GPU-urile scumpe să aștepte informații.

Răspunsul WEKA constă în a trata stocarea, extensia memoriei, accesul la fișiere, accesul la obiecte și deplasarea datelor ca părți ale aceleiași platforme. NeuralMesh este proiectat pentru a oferi o bază de date partajată pentru antrenament, inferență și calcul de înaltă performanță în medii locale, nori publici și implementări hibride.

Noua lansare extinde această arhitectură cu multi-locativitate, stocare de obiecte nativă, caching distribuit, reducere de date automată, operațiuni Kubernetes și observabilitate centralizată.

Mai degrabă decât a prezenta anunțurile de software și de aplicații ca actualizări nelegate, compania le prezintă ca două părți ale aceluiași sistem. NeuralMesh 6 controlează modul în care datele sunt stocate, mutate, izolate și livrate, în timp ce WEKApod 3 oferă hardware proiectat în jurul acestor funcții.

NeuralMesh 6 Unifică Încărcăturile de Fișiere și Obiecte

Una dintre adăugirile mai semnificative în NeuralMesh 6 este o implementare nativă S3 care rulează pe stocare NVMe. Aceleași blocuri de date subiacente pot fi accesate prin protocoale de obiect S3 și interfețe de fișiere POSIX sau Network File System fără a menține copii separate.

Acest lucru contează pentru că pipeline-urile IA adesea mută informații între stocarea de obiecte, sistemele de fișiere de înaltă performanță, mediile de antrenament și clusterelor de inferență. Fiecare copie consumă capacitate, introduce întârzieri și complică guvernanța. Un spațiu de nume unificat ar putea permite datelor create prin un protocol să devină imediat disponibile prin alt protocol.

WEKA afirmă că implementarea sa susține între 2.000 și 5.000 de conexiuni S3 concurente pe nod. De asemenea, susține S3 prin Remote Direct Memory Access, permițând datelor să se deplaseze către memoria GPU fără a urma calea convențională prin multiple straturi CPU și sistem de operare.

Platforma introduce două niveluri de multi-locativitate. Clusterelor Compozabile alocă resurse dedicate de procesor, memorie și stocare pentru chiriași individuali, în timp ce multi-locativitatea virtuală oferă izolare de rețea, criptare independentă, autentificare separată și controale de calitate a serviciului pe chiriaș.

Mediile virtuale pot susține peste 1.000 de chiriași izolați pe cluster, conform companiei. Combinarea modelelor fizice și virtuale ar putea permite unui operator de infrastructură mare să susțină zeci de mii de clienți logic separați fără a dezvolta un cluster de stocare independent pentru fiecare.

Acest lucru este deosebit de relevant pentru furnizorii de servicii GPU și nori suverani AI care trebuie să echilibreze utilizarea ridicată a infrastructurii cu izolarea strictă a clienților.

Mutarea Datelor În Orice Loc Unde Sunt Disponibile GPU

NeuralMesh 6 introduce, de asemenea, replicarea pe bază de metadate și cachingul la distanță pentru încărcăturile de lucru AI distribuite în centre de date, nori și regiuni geografice.

Replicarea tradițională necesită, de obicei, copierea întregului set de date înainte de a începe o încărcătură de lucru. NeuralMesh face, în schimb, metadatele destinației imediat vizibile, apoi transferă datele subiacente pe măsură ce sunt solicitate.

Acest lucru ar putea permite operatorilor să mute joburile către capacitatea GPU disponibilă fără a replica mai întâi fiecare fișier asociat cu proiectul. Abordarea este destinată să susțină explozia norului, infrastructura distribuită AI și colaborarea între echipele de cercetare sau inginerie separate geografic.

De asemenea, reprezintă un prim pas către un model de spațiu global de nume în care datele pot fi adresate în mod consecvent, indiferent de locul în care au fost stocate inițial.

O altă funcție nouă aplică amprentarea, hashing-ul de similitudine, deduplicarea și comprimarea continuă, mai degrabă decât a trata reducerea datelor ca un proces de fundal opțional.

WEKA afirmă că NeuralMesh 6 poate oferi economii de capacitate de până la șase ori pentru datele de antrenament AI cu mai puțin de 5% supraîncărcare de scriere. Reducerea reală va depinde de setul de date. Punctele de control, straturile de containere, versiunile de modele și datele de antrenament iterative pot conține repetiții semnificative, în timp ce alte tipuri de date pot comprima mai puțin eficient.

Compania intenționează să analizeze datele reprezentative ale clienților înainte de implementare și să utilizeze estimarea rezultată ca parte a angajamentelor sale de capacitate și performanță.

Transformarea Stocării Într-un Strat de Memorare AI Extins

NeuralMesh incorporează, de asemenea, WEKA’s Augmented Memory Grid, care utilizează stocarea NVMe ca o extensie persistentă a memoriei GPU pentru inferență.

Modelele de limbaj mare creează un cache de valoare-cheie care conține informații calculate dintr-un prompt sau conversație. Pentru contexte lungi și fluxuri de lucru agenți, acest cache poate deveni extrem de mare. Când nu poate rămâne în memoria GPU de înaltă bandă, sistemele pot fi nevoite să renunțe la acesta, să-l recalculăm sau să-l mute în infrastructură mai lentă.

Augmented Memory Grid stochează acest cache într-un strat persistent NVMe și utilizează Remote Direct Memory Access și NVIDIA GPUDirect Storage pentru a-l muta înapoi către GPU.

Obiectivul este de a păstra contextul reutilizabil, reducând în același timp recalcularea repetată a preumplerii, una dintre etapele mai resursivoare ale inferenței cu context lung.

WEKA raportează că testele pe Oracle Cloud Infrastructure, utilizând GPU-uri NVIDIA H100, au produs un flux de token de zece ori mai mare, zece ori mai mulți utilizatori concurenți și șapte ori mai multe tokenuri pe GPU.

Aceste cifre sunt benchmark-uri specifice încărcăturii de lucru, mai degrabă decât așteptări universale de performanță, dar ilustrează de ce gestionarea persistentă a cache-ului devine o parte importantă a proiectării infrastructurii de inferență.

WEKApod 3 Preia Controlul Stratului de Hardware

În timp ce sistemele WEKApod anterioare combinau software-ul WEKA cu infrastructura prevalidată, a treia generație se mută mai departe în proiectarea sistemului integrat vertical.

WEKA a proiectat noul chassis cu două unități de raft, interconectarea discurilor, arhitectura de răcire, domeniile de eșec și sistemul de service. Aparatele utilizează PCI Express Gen 6 în interior și conectivitatea NVIDIA ConnectX pentru conectarea la infrastructura Ethernet Spectrum-X.

Familia WEKApod cuprinde acum trei sisteme configurabile. Nitro este optimizat pentru inferență și încărcături de lucru AI intensive din punct de vedere al benzii. Prime combină celule triple-level și quad-level pentru a echilibra performanța și capacitatea. Prime Max prioritizează densitatea de stocare maximă, încălzind până la 70 de discuri NVMe într-un chassis cu două unități de raft.

La scară de raft complet, WEKA afirmă că Prime Max poate oferi 441,5 petabiți de capacitate brută și 1,1 exabiți de capacitate eficientă după reducerea datelor NeuralMesh. Sistemul de nivel rack este evaluat la până la 10,2 terabiți pe secundă de debit și 210 milioane de operații de intrare/ieșire pe secundă.

Diferența dintre capacitatea brută și cea eficientă este importantă. Cifra exabyte depinde de reducerea realizabilă pe datele stocate și nu ar trebui interpretată ca mai mult de un exabyte de flash fizic.

Chiar și așa, o densitate mai mare poate avea consecințe semnificative în facilitățile în care stocarea concurează cu GPU-urile pentru spațiu de raft, răcire și capacitate electrică.

Proiectat pentru Centre de Date Constrainate

Noile sisteme abordează, de asemenea, limitările fizice care devin din ce în ce mai mult o parte a proiectelor de infrastructură AI.

Clusterelor GPU necesită cantități mari de electricitate, răcire, rețelistică și spațiu de pardoseală. Sistemele de stocare care consumă aceste resurse în mod ineficient pot reduce numărul de acceleratoare pe care o facilitate o poate susține.

WEKA afirmă că noile aplicații oferă o densitate de capacitate eficientă de 267% mai mare și o densitate de performanță de 114% mai mare decât următoarele alternative public disponibile din categoriile respective.

Compania a proiectat, de asemenea, sistemele pentru a funcționa în temperaturi ambientale de până la 35 de grade Celsius. Limitarea puterii controlate de software este destinată să reducă treptat performanța în timpul stresului termic, mai degrabă decât a declanșa o închidere.

Un design de disc fără backplane creează domenii de eșec mai mici, în timp ce discurile de pornire cu conectare rapidă și procedurile de înlocuire ghidate sunt destinate să reducă timpul de întreținere. Clienții pot configura tipul de carcasă, memoria, capacitatea discurilor și numărul de discuri, cu implementări care variază de la mai puțin de un petabyte la peste 100 de petabiți.

Construirea unui Ecosistem În jurul Fabricilor de IA

Anunțurile de parteneriat însoțitoare sugerează că platforma va ajunge la clienți prin integratori de infrastructură, furnizori de nori și furnizori de orchestrare AI.

Spectro Cloud poziționează NeuralMesh ca un strat de date care poate fi combinat cu PaletteAI pentru implementarea și operarea fabricilor de IA enterprise. World Wide Technology și Computacenter intenționează să integreze sistemele în proiecte de infrastructură mai ample, în timp ce Glocomp a subliniat cererea clienților pentru o performanță AI mai bună și costuri de infrastructură mai previzibile.

Strategia de ecosistem este semnificativă, deoarece majoritatea organizațiilor nu asamblează medii de producție AI dintr-un singur furnizor.

O implementare tipică poate include GPU-uri, rețelistică, stocare, software de modelare, observabilitate, securitate și produse de guvernanță de la mai mulți furnizori. Configurațiile validate în comun pot reduce munca de integrare, deși clienții vor trebui totuși să testeze performanța utilizând propriile modele, seturi de date, rețele și cerințe de concurență.

Ce Înseamnă Acest Lucru pentru Infrastructura IA

Aspectul cel mai important al anunțului nu este niciun număr de capacitate sau debit individual. Este convergența crescândă a stocării, caching-ului distribuit, gestionării memoriei, mobilității datelor și izolării chiriașilor.

Pe măsură ce agenții IA păstrează istorii mai lungi, accesează mai multe informații ale întreprinderii și funcționează în mod continuu, infrastructura care înconjoară GPU-urile va determina din ce în ce mai mult costul fiecărei răspunsuri utile.

Adăugarea de acceleratoare suplimentare nu va rezolva blocajele cauzate de prelucrarea repetată a contextului, deplasarea lentă a datelor, protocoalele fragmentate sau capacitatea de stocare subutilizată. Prima fază a infrastructurii IA va depinde, prin urmare, la fel de mult de alimentarea și gestionarea eficientă a GPU-urilor, pe cât depinde și de creșterea calculelor brute.

NeuralMesh 6 este programat să devină disponibil în general în a doua jumătate a anului 2026, clienții existenți fiind eligibili pentru actualizare prin canalul standard de software. Noile sisteme WEKApod Nitro, Prime și Prime Max sunt disponibile pentru comandă, livrările urmând să înceapă în toamna anului 2026.

Antoine este un lider vizionar și partener fondator al Unite.AI, condus de o pasiune neclintită pentru modelarea și promovarea viitorului inteligenței artificiale și roboticii. Un întreprinzător serial, el crede că inteligența artificială va fi la fel de disruptivă pentru societate ca și electricitatea și este adesea prins vorbind entuziast despre potențialul tehnologiilor disruptive și AGI.

Ca futurist, el este dedicat explorării modului în care aceste inovații vor modela lumea noastră. În plus, el este fondatorul Securities.io, o platformă axată pe investiții în tehnologii de ultimă generație care redefinesc viitorul și reshapă întregi sectoare.