Modele și platforme AI

OceanStor M900 aduce memorie contextuală la scară PB pentru Huawei SuperPoDs

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Huawei a prezentat OceanStor M900 Stocare Memorie Contextuală la HUAWEI CONNECT 2026 în Shanghai, pe 17 septembrie 2026, dezvăluind un sistem de stocare conceput pentru inferență AI în centre de date hiperscalare. David Wang, vicepreședinte al consiliului și președinte rotativ la Huawei, a prezentat produsul în cadrul discursului său principal, iar Huawei afirmă că un singur cluster oferă 64 PB de capacitate de cache KV.

Potrivit lui Huawei, sistemul oferă SuperPoDs un spațiu de memorie complet partajat, cu capacitate la scară PB și performanță la nivel de TB/s, construit pe rețeaua de interconectare UnifiedBus a companiei. Discursul lui Wang a purtat titlul „Advancing the Agentic World, Building a Solid Silicon Foundation” și Huawei descrie lansarea ca marcând o tranziție în infrastructura AI de la un model centrat pe calcul către o colaborare mai profundă între calcul, rețea și stocare.

Limitele de memorie în inferența AI la scară largă

În anunțul său, Huawei descrie anul 2026 ca fiind un an în care AI a trecut de la descoperiri tehnologice la implementare la scară largă, cu aplicații care evoluează de la chatboturi la agenți capabili să finalizeze în mod autonom sarcini complexe. Compania afirmă că acești agenți sunt adoptați pe scară largă în sectoare precum cercetarea științifică, sănătatea, finanțele și serviciile publice, și caracterizează această tranziție ca începutul erei AI agentice.

Huawei afirmă că modelele mari cresc până la parametri la scară de 10 trilioane, în timp ce modelele principale susțin deja ferestre de context care depășesc un milion de tokenuri, făcând inferența multi-turn și sarcinile complexe norma și impulsionând creșterea continuă a datelor de cache KV. Pe măsură ce aceste date se acumulează, compania spune că memoria integrată pe cip și DRAM-ul au fost împinse dincolo de limitele lor atât în capacitate, cât și în eficiență de cost. Un FAQ atașat anunțului definește cache-ul KV ca stocarea datelor Key și Value generate în timpul inferenței modelelor mari, pentru a putea fi reutilizate în inferențe ulterioare, evitând calculul redundant. Huawei descrie un consens în industrie privind construirea unui sistem de stocare multi-tier care coordonează memoria pe cip, DRAM-ul și SSD-urile într-un spațiu de memorie complet partajat și afirmă că M900 a fost conceput pentru a depăși blocajele de capacitate de memorie în contextul ultra-lung și inferența multi-turn. Compania caracterizează, de asemenea, SuperPoDs ca alegerea optimă pentru infrastructura AI pe măsură ce modelele se dimensionează.

Trei tehnologii din spatele M900

Pentru capacitate, Huawei afirmă că interconectarea UnifiedBus permite OceanStor M900 să construiască un cache KV multi-tier global la scară PB, cu conexiuni one-hop, agregând și partajând cache-ul într-un cluster cu stocare pe niveluri. Designul extinde cache-ul KV al SuperPoD de la memoria integrată pe cip și DRAM la SSD-uri, permițând unui singur cluster să ofere 64 PB de capacitate, conform companiei. Huawei spune că capacitatea de cache KV disponibilă per NPU crește de la gigabytes la terabytes, permițând stocarea, partajarea și reutilizarea unui context mai mare, ceea ce, potrivit lor, sporește semnificativ rata de hit a cache-ului KV.

Pentru performanță, Huawei descrie OceanStor M900 ca fiind prima arhitectură din industrie care integrează CPU-ul, unitatea de control al rețelei și unitatea de control NAND, oferind semantici native KV care permit conexiuni one-hop de la NPU-urile unui SuperPoD la SSD-uri. Compania raportează că eliminarea conversiei de protocol și a redirecționării prin CPU reduce latența de acces de la milisecunde la 60 microsecunde, o reducere de 90 %. Huawei raportează, de asemenea, 40 TB/s de lățime de bandă agregată pentru un singur cluster, o valoare pe care o descrie ca fiind de 1,5 ori mai mare decât soluțiile concurente. În scenariile tipice de programare AI, compania afirmă că arhitectura dublează debitul de tokeni al unui cluster de inferență și înjumătățește timpul până la primul token.

Din punct de vedere al costului, Huawei afirmă că M900 utilizează prima tehnologie de stocare adaptivă conștientă de KV din industrie, care prezice ciclurile de viață ale cache-ului KV pe baza valorii datelor și distribuie datele în funcție de mediul de stocare. Compania raportează că tehnologia suportă până la 24 de scrieri pe disc pe zi, extinde durata de viață a SSD-urilor de 16 ori și asigură stabilitate timp de trei ani, reducând costurile de înlocuire a mediilor și de operare și mentenanță în infrastructura de inferență la scară largă.

Poziționarea produsului și detalii despre eveniment

În FAQ-ul său, Huawei descrie Stocarea Memoriei Contextuale, reprezentată de M900, ca o nouă infrastructură de date pentru SuperPoDs în centre de date hiperscalare, oferind memorie complet partajată la scară PB și permițând stocare pe niveluri și programare eficientă a cache-ului KV între memoria pe cip, DRAM și SSD-uri. Compania afirmă că stocarea memoriei contextuale va fi esențială pentru îmbunătățirea continuă a capacității și eficienței de acces ale cache-urilor KV de inferență hiperscalare. Huawei mai spune că va continua să promoveze sinergia hardware-software și inovația la nivel de sistem pentru a oferi o infrastructură AI deschisă, eficientă și sustenabilă pentru transformarea inteligentă în toate industriile.

HUAWEI CONNECT 2026, cu tema „Advancing the Agentic World”, are loc în perioada 17‑19 septembrie 2026, la Shanghai World Expo Exhibition & Convention Center și Shanghai Expo Center, iar anunțul precizează că evenimentul analizează AI din perspectiva strategiei, tehnologiei și ecosistemelor. Pagina oficială a evenimentului enumeră un program de trei discursuri principale, 20 de summituri, peste 60 de sesiuni și peste 200 de prezentări deschise, cu vorbitori principali programați, inclusiv CEO-ul Linux Foundation, Jim Zemlin, președintele iFLYTEK, Liu Qingfeng, și CEO-ul Huawei Cloud, Peter Zhou.

Theo Nash este un specialist generat de inteligență artificială la Unite.AI, care acoperă infrastructura de inteligență artificială, calcul și sistemele hardware care alimentează inteligența artificială modernă. Lucrarea sa se concentrează pe fundamentele tehnice ale sarcinilor de lucru cu inteligență artificială la scară largă, incluzând centre de date, acceleratoare, rețele și stivele de software care le leagă împreună.
Cu o perspectivă analitică și inginerice, Theo examinează modul în care progresele în domeniul unităților de procesare grafică, siliciului personalizat, arhitecturilor de memorie și sistemelor distribuite permit noi generații de modele de inteligență artificială. El acordă o atenție deosebită schimburilor de performanță, eficienței energetice, scalabilității și constrângerilor practice care influențează implementarea în lumea reală a infrastructurii de inteligență artificială.
Articolele scrise de Theo Nash sunt generate de inteligență artificială și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea tehnică, claritatea și o acoperire responsabilă a peisajului de calcul cu inteligență artificială în evoluție rapidă.