Modele i platformy AI

OceanStor M900 wprowadza pamięć kontekstową o skali PB do Huawei SuperPoDs

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Huawei przedstawiło OceanStor M900 Pamięć kontekstowa na HUAWEI CONNECT 2026 w Szanghaju 17 września 2026 r., prezentując system przechowywania zaprojektowany do inferencji AI w centrach danych o hiperskali. David Wang, wiceprzewodniczący zarządu i rotujący przewodniczący Huawei, zaprezentował produkt podczas swojego wystąpienia głównego, a Huawei podaje, że pojedynczy klaster zapewnia 64 PB pojemności pamięci podręcznej KV.

Według Huawei system zapewnia SuperPoDs w pełni współdzieloną przestrzeń pamięci oferującą pojemność o skali PB i wydajność na poziomie TB/s, zbudowaną na sieci połączeń UnifiedBus firmy. Wystąpienie Wang nosiło tytuł “Advancing the Agentic World, Building a Solid Silicon Foundation”, a Huawei opisuje premierę jako oznaczającą zmianę w infrastrukturze AI od modelu skoncentrowanego na obliczeniach w kierunku głębszej współpracy między obliczeniami, siecią i przechowywaniem.

Ograniczenia pamięci w wielkoskalowej inferencji AI

W swoim ogłoszeniu Huawei opisuje rok 2026 jako rok, w którym AI przeszło od przełomów technologicznych do wdrożeń na dużą skalę, a aplikacje ewoluowały od chatbotów do agentów zdolnych do samodzielnego realizowania złożonych zadań. Firma podaje, że agenci ci są szeroko stosowani w sektorach takich jak badania naukowe, opieka zdrowotna, finanse i usługi publiczne, i określa tę zmianę jako początek ery agentowej AI.

Huawei informuje, że duże modele rosną do skali 10 bilionów parametrów, podczas gdy modele główne już obsługują okna kontekstowe przekraczające milion tokenów, co czyni inferencję wieloetapową i złożone zadania normą oraz napędza dalszy wzrost danych pamięci podręcznej KV. W miarę gromadzenia się tych danych, firma twierdzi, że pamięć na chipie i DRAM zostały wyczerpane pod względem pojemności i opłacalności. FAQ dołączone do ogłoszenia definiuje pamięć podręczną KV jako przechowywanie danych klucza i wartości generowanych podczas inferencji dużych modeli, aby mogły być ponownie wykorzystane w kolejnych inferencjach, unikając redundantnych obliczeń. Huawei opisuje konsensus branżowy dotyczący budowy wielopoziomowego przechowywania, które koordynuje pamięć na chipie, DRAM i SSD w w pełni współdzieloną przestrzeń pamięci, i podaje, że M900 został zaprojektowany, aby pokonać wąskie gardła pojemności pamięci w ultra-długim kontekście i inferencji wieloetapowej. Firma również określa SuperPoDs jako optymalny wybór dla infrastruktury AI w miarę skalowania modeli.

Trzy technologie stojące za M900

Pod względem pojemności Huawei podaje, że połączenie UnifiedBus umożliwia OceanStor M900 zbudowanie globalnej, wielopoziomowej pamięci podręcznej KV o skali PB z połączeniami jednoprzeskokowymi, grupując i udostępniając pamięć podręczną w klastrze z warstwowym przechowywaniem. Projekt rozszerza pamięć podręczną KV SuperPoD z pamięci na chipie i DRAM na SSD, umożliwiając pojedynczemu klastrowi zapewnienie 64 PB pojemności, według firmy. Huawei informuje, że dostępna pojemność pamięci podręcznej KV na NPU rośnie z gigabajtów do terabajtów, co pozwala na przechowywanie, udostępnianie i ponowne wykorzystanie większej ilości kontekstu, co, jak podkreśla firma, znacząco zwiększa wskaźnik trafień pamięci podręcznej KV.

Pod względem wydajności Huawei opisuje OceanStor M900 jako pierwszą w branży architekturę integrującą CPU, jednostkę kontrolera sieci oraz jednostkę kontrolera NAND, zapewniającą natywne semantyki KV, które umożliwiają połączenia jednoprzeskokowe z NPU SuperPoD do SSD. Firma podaje, że eliminacja konwersji protokołów i przekazywania przez CPU skraca opóźnienie dostępu z milisekund do 60 mikrosekund, co stanowi redukcję o 90 %. Huawei informuje również o 40 TB/s łącznej przepustowości dostępu dla pojedynczego klastra, co według niej jest 1,5‑krotnie wyższe niż rozwiązania konkurencyjne. W typowych scenariuszach programowania AI firma twierdzi, że architektura podwaja przepustowość tokenów klastra inferencji i skraca o połowę czas do pierwszego tokenu.

Pod względem kosztów Huawei podaje, że M900 wykorzystuje pierwszą w branży technologię adaptacyjnego przechowywania świadomego KV, która przewiduje cykle życia pamięci podręcznej KV na podstawie wartości danych i odpowiednio dystrybuuje dane pomiędzy nośnikami. Firma informuje, że technologia obsługuje do 24 zapisów na dysku dziennie, wydłuża trwałość SSD 16‑krotnie i zapewnia stabilność przez trzy lata, redukując koszty wymiany mediów oraz operacji i utrzymania w infrastrukturze inferencji na dużą skalę.

Pozycjonowanie produktu i szczegóły wydarzenia

W FAQ Huawei opisuje pamięć kontekstową, reprezentowaną przez M900, jako nową infrastrukturę danych dla SuperPoDs w hiperskalowych centrach danych, zapewniającą w pełni współdzieloną pamięć o skali PB oraz umożliwiającą warstwowe przechowywanie i efektywne planowanie pamięci podręcznej KV pomiędzy pamięcią na chipie, DRAM i SSD. Firma stwierdza, że pamięć kontekstowa będzie niezbędna do ciągłego zwiększania pojemności i efektywności dostępu do hiperskalowych pamięci podręcznych KV inferencji. Huawei dodaje, że będzie kontynuować rozwijanie synergii sprzętowo‑programowej oraz innowacji na poziomie systemu, aby zapewnić otwartą, wydajną i zrównoważoną infrastrukturę AI dla inteligentnej transformacji w różnych branżach.

HUAWEI CONNECT 2026, pod hasłem “Advancing the Agentic World”, odbywa się w dniach 17‑19 września 2026 r. w Shanghai World Expo Exhibition & Convention Center oraz Shanghai Expo Center, a ogłoszenie podaje, że wydarzenie analizuje AI pod kątem strategii, technologii i ekosystemów. Oficjalna strona wydarzenia wymienia program obejmujący trzy wystąpienia główne, 20 szczytów, ponad 60 sesji i ponad 200 otwartych prelekcji, z zaplanowanymi prelegentami takimi jak dyrektor generalny Linux Foundation Jim Zemlin, przewodniczący iFLYTEK Liu Qingfeng oraz dyrektor generalny Huawei Cloud Peter Zhou.

Theo Nash jest specjalistą wygenerowanym przez AI w Unite.AI, zajmującym się infrastrukturą AI, obliczeniami i systemami sprzętowymi, które napędzają nowoczesną sztuczną inteligencję. Jego praca koncentruje się na technicznych podstawach dużych obciążeń AI, w tym centrach danych, przyspiesznikach, sieciach i stosach oprogramowania, które je łączą.
Z analitycznej i inżynierskiej perspektywy Theo analizuje, jak postępy w zakresie GPU, niestandardowego krzemowego, architektur pamięci i systemów rozproszonych umożliwiają nowe pokolenia modeli AI. Zwraca szczególną uwagę na wymiany pomiędzy wydajnością, efektywnością energetyczną, skalowalnością i praktycznymi ograniczeniami, które kształtują wdrożenie infrastruktury AI w świecie rzeczywistym.
Artykuły napisane przez Theo Nasha są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI w celu zapewnienia technicznej dokładności, klarowności i odpowiedzialnego pokrycia szybko ewoluującego krajobrazu obliczeń AI.