Modele i platformy AI
WEKA Wprowadza NeuralMesh 6 i WEKApod 3 jako Przesunięcie Infrastruktury AI w Kierunku Inferencji

WEKA wprowadził zintegrowaną aktualizację oprogramowania i sprzętu, skierowaną na jeden z najbardziej kosztownych problemów branży AI: utrzymanie produktywności GPU podczas przechodzenia modeli z fazy szkolenia do ciągłej, dużej skali inferencji.
Ogłoszenia obejmują NeuralMesh 6, znaczącą aktualizację platformy danych i pamięci firmy, oraz trzecią generację urządzeń WEKApod, zaprojektowanych dla chmur AI, deweloperów modeli, organizacji badawczych i przedsiębiorstw korzystających z infrastruktury GPU.
Wraz, te wydania odzwierciedlają szerszą zmianę w projekcie infrastruktury AI, gdzie magazynowanie ewoluuje z biernego repozytorium w aktywną warstwę pamięci i dostarczania danych.
Zjednoczony Push do Produkcji AI
Wymagania infrastrukturalne inferencji AI różnią się znacznie od tych szkolenia modeli. Zadania szkoleniowe zwykle przetwarzają duże zestawy danych przez względnie przewidywalne potoki. Agenty AI, systemy generacji zwiększonej przez odzyskiwanie i systemy rozumowania z długim kontekstem muszą zamiast tego uzyskać dostęp do zmieniających się danych, utrzymywać kontekst w trakcie wielokrotnych interakcji i obsługiwać wiele użytkowników jednocześnie bez pozostawiania kosztownych GPU w oczekiwaniu na informacje.
Odpowiedzią WEKA jest traktowanie magazynowania, rozszerzenia pamięci, dostępu do plików, dostępu do obiektów i przenoszenia danych jako części tej samej platformy. NeuralMesh jest zaprojektowany, aby zapewnić wspólną bazę danych dla szkolenia, inferencji i obliczeń o wysokiej wydajności w środowiskach lokalnych, chmurach publicznych i wdrożeniach hybrydowych.
Nowa wersja rozszerza tę architekturę o wielodostępność, natywny magazyn obiektów, rozproszone buforowanie, automatyczne zmniejszanie danych, operacje Kubernetes i scentralizowaną obserwację.
Zamiast prezentowania ogłoszeń oprogramowania i urządzeń jako niezwiązane ulepszenia, firma przedstawia je jako dwie części tego samego systemu. NeuralMesh 6 kontroluje, jak dane są przechowywane, przenoszone, izolowane i dostarczane, podczas gdy WEKApod 3 zapewnia sprzęt zaprojektowany wokół tych funkcji.
NeuralMesh 6 Ujednolica Prace z Plikami i Obiektami
Jednym z bardziej doniosłych dodatków w NeuralMesh 6 jest natywna implementacja S3 uruchomiona na magazynie NVMe. Te same podstawowe bloki danych mogą być dostępne za pośrednictwem protokołów obiektowych S3 i interfejsów POSIX lub Network File System bez utrzymywania oddzielnych kopii.
To ma znaczenie, ponieważ potoki AI często przenoszą informacje między magazynowaniem obiektów, systemami plików o wysokiej wydajności, środowiskami szkolenia i klastrami inferencji. Każda kopia zużywa pojemność, wprowadza opóźnienia i komplikuje zarządzanie. Ujednolicona przestrzeń nazw mogłaby pozwolić na to, aby dane utworzone za pomocą jednego protokołu stały się natychmiast dostępne za pomocą innego.
WEKA twierdzi, że jego implementacja obsługuje od 2 000 do 5 000 połączeń S3 na węzeł. Obsługuje również S3 za pośrednictwem Remote Direct Memory Access, co pozwala na przenoszenie danych w kierunku pamięci GPU bez podążania za konwencjonalną ścieżką przez wiele warstw CPU i systemu operacyjnego.
Platforma wprowadza dwa poziomy wielodostępności. Klaster Composable przydziela dedykowane zasoby procesora, pamięci i magazynu dla poszczególnych najemców, podczas gdy wirtualna wielodostępność zapewnia izolację sieciową, niezależne szyfrowanie, oddzielne uwierzytelnianie i kontrolę jakości usług na poziomie najemcy.
Środowiska wirtualne mogą obsługiwać ponad 1 000 izolowanych najemców na klaster, według firmy. Połączenie modeli fizycznych i wirtualnych mogłoby pozwolić dużemu operatorowi infrastruktury na obsługę dziesiątków tysięcy logicznie oddzielnych klientów bez wdrożenia niezależnego klastra magazynowania dla każdego z nich.
To jest szczególnie istotne dla dostawców usług GPU jako usługi i suwerennych chmur AI, które muszą balansować wysoką wydajność infrastruktury z surową izolacją klienta.
Przenoszenie Danych do Miejsca, w którym Dostępne są GPU
NeuralMesh 6 wprowadza również replikację opartą na metadanych i buforowanie zdalne dla obciążeń AI rozproszonych w centrach danych, chmurach i regionach geograficznych.
Tradycyjna replikacja zwykle wymaga, aby cały zestaw danych został skopiowany przed rozpoczęciem obciążenia. NeuralMesh zamiast tego sprawia, że metadane miejsca docelowego stają się natychmiast widoczne, a następnie przenosi dane podstawowe, gdy są one żądane.
To mogłoby pozwolić operatorom na przenoszenie zadań w kierunku dostępnej pojemności GPU bez konieczności replikowania każdego pliku skojarzonego z projektem. Podejście to ma na celu wspieranie chmury, rozproszonej infrastruktury AI i współpracy między zespołami badawczymi lub inżynieryjnymi rozproszonymi geograficznie.
Represents również wczesny krok w kierunku modelu globalnej przestrzeni nazw, w którym dane mogą być adresowane w sposób spójny, niezależnie od miejsca, w którym zostały pierwotnie przechowywane.
Inna nowa funkcja stosuje skróty, hashowanie podobieństwa, deduplikację i kompresję w sposób ciągły, zamiast traktowania redukcji danych jako opcjonalnego procesu w tle.
WEKA twierdzi, że NeuralMesh 6 może zapewnić do sześciokrotnych oszczędności pojemności na danych szkoleniowych AI z mniej niż 5% nakładem zapisu. Rzeczywiste redukcje będą zależały od zestawu danych. Punkty kontrolne, warstwy kontenerów, wersje modeli i dane szkoleniowe iteracyjne mogą zawierać znaczną powtarzalność, podczas gdy inne typy danych mogą kompresować mniej skutecznie.
Firma planuje przeanalizować reprezentatywne dane klientów przed wdrożeniem i wykorzystać wynikającą z tego szacunku jako część swoich zobowiązań dotyczących pojemności i wydajności.
Zmiana Magazynowania w Rozszerzoną Warstwę Pamięci AI
NeuralMesh zawiera również WEKA’s Augmented Memory Grid, który wykorzystuje magazyn NVMe jako trwałe rozszerzenie pamięci GPU dla inferencji.
Duże modele językowe tworzą pamięć podręczną zawierającą informacje obliczane z podpowiedzi lub rozmowy. Dla długich kontekstów i agentyckich przepływów ta pamięć podręczna może stać się niezwykle duża. Gdy nie może pozostać w pamięci GPU o wysokiej przepustowości, systemy mogą musieć ją odrzucić, ponownie obliczyć lub przenieść do wolniejszej infrastruktury.
Augmented Memory Grid przechowuje tę pamięć podręczną w warstwie trwałej, wspieranej przez NVMe, i wykorzystuje Remote Direct Memory Access oraz NVIDIA GPUDirect Storage do przenoszenia jej z powrotem do GPU.
Celem jest zachowanie ponownie wykorzystywanych kontekstów, jednocześnie redukując powtarzane obliczenia wstępne, jedną z bardziej zasobożernych faz inferencji o długim kontekście.
WEKA raportuje, że testy na Oracle Cloud Infrastructure przy użyciu NVIDIA H100 GPU wyprodukowały dziesięciokrotnie wyższy przepływ tokenów, dziesięciokrotnie więcej użytkowników jednoczesnych i siedmiokrotnie więcej tokenów na GPU.
Te liczby są specyficznymi dla obciążenia benchmarkami, a nie powszechnymi oczekiwaniami wydajności, ale ilustrują, dlaczego zarządzanie trwałą pamięcią podręczną staje się ważną częścią projektu infrastruktury inferencji.
WEKApod 3 Przejmuje Kontrolę nad Warstwą Sprzętową
Podczas gdy poprzednie WEKApod łączyły oprogramowanie WEKA z prewalidowaną infrastrukturą, trzecia generacja przechodzi dalej w kierunku pionowo zintegrowanego projektu systemu.
WEKA zaprojektował nowy dwurackowy chassis, połączenie napędu, architekturę chłodzenia, domeny awarii i systemy obsługi. Urządzenia wykorzystują PCI Express Gen 6 wewnętrznie i sieć NVIDIA ConnectX do połączenia z infrastrukturą Ethernet Spectrum-X.
Rodzina WEKApod składa się obecnie z trzech konfigurowalnych systemów. Nitro jest zoptymalizowany dla obciążeń inferencji i AI o wysokiej przepustowości. Prime łączy trójpoziomowe komórki i czteropoziomowe komórki flash, aby zrównoważyć wydajność i pojemność. Prime Max priorytetowo traktuje maksymalną gęstość magazynowania, mieszcząc do 70 napędów NVMe w dwurackowym chassis.
W pełnej skali szafy, WEKA twierdzi, że Prime Max może zapewnić 441,5 petabajtów surowej pojemności i 1,1 eksabajtów skutecznej pojemności po redukcji danych NeuralMesh. System na poziomie szafy jest oceniany na do 10,2 terabajtów na sekundę przepustowości i 210 milionów operacji wejścia/wyjścia na sekundę.
Różnica między surową a skuteczną pojemnością jest istotna. Wskaźnik eksabajtów zależy od redukcji osiągalnej w przechowywanych danych i nie powinien być interpretowany jako więcej niż eksabajt fizycznej pamięci flash.
Nawet tak, większa gęstość może mieć znaczące konsekwencje w obiektach, w których magazynowanie konkurowało z GPU o miejsce w szafie, chłodzenie i pojemność elektryczną.
Zaprojektowane dla Ograniczonych Centrów Danych
Nowe systemy również adresują fizyczne ograniczenia, które coraz częściej kształtują projekty infrastruktury AI.
Klastry GPU wymagają dużej ilości energii, chłodzenia, sieci i miejsca na podłodze. Systemy magazynowania, które zużywają te zasoby w sposób nieefektywny, mogą zmniejszyć liczbę akceleratorów, które obiekt może obsłużyć.
WEKA twierdzi, że nowe urządzenia zapewniają 267% większą gęstość skutecznej pojemności i 114% większą gęstość wydajności niż najlepsze publicznie dostępne alternatywy w ich odpowiednich kategoriach.
Firma również zaprojektowała systemy do pracy w temperaturach otoczenia do 35 stopni Celsjusza. Ograniczanie mocy sterowane oprogramowaniem ma na celu stopniową redukcję wydajności podczas stresu termicznego, zamiast wyzwania awarii.
Bezszynowy projekt napędu tworzy mniejsze domeny awarii, podczas gdy wymienniki rozruchu i procedury wymiany są przeznaczone do skrócenia czasu konserwacji. Klienci mogą konfigurować typ szafy, pamięć, pojemność napędu i liczbę napędów, z wdrożeniami od mniej niż jednego petabajta do ponad 100 petabajtów.
Budowanie Ekosystemu wokół Fabryk AI
Towarzyszące ogłoszenia partnerskie sugerują, że platforma będzie dostępna dla klientów za pośrednictwem integratorów infrastruktury, dostawców chmury i dostawców orkiestracji AI.
Spectro Cloud przedstawia NeuralMesh jako warstwę danych, która może być połączona z PaletteAI w celu wdrożenia i obsługi przedsiębiorczych fabryk AI. World Wide Technology i Computacenter planują włączyć systemy do szerszych projektów infrastrukturalnych, podczas gdy Glocomp podkreślił popyt klientów na lepszą wydajność AI i bardziej przewidywalne koszty infrastruktury.
Ta strategia ekosystemu jest istotna, ponieważ większość organizacji nie montuje środowisk produkcyjnych AI z jednego dostawcy.
Typowe wdrożenie może obejmować GPU, sieci, magazynowanie, Kubernetes, oprogramowanie do obsługi modeli, obserwację, zabezpieczenia i produkty zarządzania z wielu dostawców. Wspólnie zwalidowane konfiguracje mogą zmniejszyć pracę integracyjną, chociaż klienci nadal będą musieli przetestować wydajność przy użyciu własnych modeli, zestawów danych, sieci i wymagań dotyczących współbieżności.
Co to Oznacza dla Infrastruktury AI
Najważniejszym aspektem ogłoszenia nie jest żadna pojedyncza liczba pojemności lub przepustowości. Jest to rosnąca konwergencja magazynowania, rozproszonego buforowania, zarządzania pamięcią, mobilności danych i izolacji najemców.
Podczas gdy agenci AI zachowują dłuższe historie, dostęp do więcej informacji przedsiębiorstwa i działają w sposób ciągły, infrastruktura otaczająca GPU będzie coraz bardziej determinowała koszt każdej przydatnej odpowiedzi.
Dodanie więcej akceleratorów nie rozwiązuje wąskich gardeł spowodowanych przez powtarzane przetwarzanie kontekstu, wolne przenoszenie danych, fragmentaryzowane protokoły lub niewykorzystaną pojemność magazynowania. Następna faza infrastruktury AI będzie zatem zależała tak samo od efektywnego karmienia i zarządzania GPU, jak i od zwiększania surowej wydajności obliczeniowej.
NeuralMesh 6 jest zaplanowany do ogólnej dostępności w drugiej połowie 2026 roku, z istniejącymi klientami uprawnionymi do uaktualnienia za pośrednictwem standardowego kanału oprogramowania. Nowe systemy WEKApod Nitro, Prime i Prime Max są dostępne do zamówienia, z dostawami, które mają się rozpocząć w jesieni 2026 roku.












