Modèles et plateformes d’IA
OceanStor M900 apporte une mémoire contextuelle à l’échelle du pétaoctet aux SuperPoDs de Huawei

Huawei a présenté OceanStor M900 Context Memory Storage lors de HUAWEI CONNECT 2026 à Shanghai le 17 septembre 2026, dévoilant un système de stockage conçu pour l’inférence IA dans les centres de données hyperscalaire. David Wang, vice‑président du conseil d’administration et président tournant chez Huawei, a présenté le produit lors de son discours d’ouverture, et Huawei indique qu’un seul cluster fournit 64 PB de capacité de cache KV.
Selon Huawei, le système offre aux SuperPoDs un espace mémoire entièrement partagé proposant une capacité à l’échelle du pétaoctet et des performances de l’ordre du téraoctet par seconde, construit sur le réseau d’interconnexion UnifiedBus de l’entreprise. Le discours d’ouverture de Wang était intitulé « Advancing the Agentic World, Building a Solid Silicon Foundation », et Huawei décrit ce lancement comme marquant une transition de l’infrastructure IA d’un modèle centré sur le calcul vers une collaboration plus profonde entre le calcul, le réseau et le stockage.
Limites de la mémoire dans l’inférence IA à grande échelle
Dans son communiqué, Huawei décrit 2026 comme une année où l’IA est passée des percées technologiques à la mise en œuvre à grande échelle, les applications évoluant des chatbots vers des agents capables d’accomplir de façon autonome des tâches complexes. L’entreprise affirme que ces agents sont largement adoptés dans des secteurs tels que la recherche scientifique, la santé, la finance et les services publics, et elle qualifie cette transition de début de l’ère de l’IA agentique.
Huawei indique que les grands modèles atteignent désormais l’échelle de 10 trillions de paramètres, tandis que les modèles grand public prennent déjà en charge des fenêtres contextuelles dépassant un million de jetons, rendant l’inférence multi‑tour et les tâches complexes la norme et stimulant la croissance continue des données de cache KV. À mesure que ces données s’accumulent, l’entreprise affirme que la mémoire intégrée et la DRAM ont été poussées au-delà de leurs limites tant en capacité qu’en rentabilité. Une FAQ jointe au communiqué définit le cache KV comme le stockage des données « Key » et « Value » générées lors de l’inférence de grands modèles afin qu’elles puissent être réutilisées lors d’inférences ultérieures, évitant ainsi les calculs redondants. Huawei décrit un consensus industriel autour de la construction d’un stockage à plusieurs niveaux qui coordonne la mémoire intégrée, la DRAM et les SSD dans un espace mémoire entièrement partagé, et affirme que le M900 a été conçu pour surmonter les goulets d’étranglement de capacité mémoire dans les contextes ultra‑longs et les inférences multi‑tour. L’entreprise caractérise également les SuperPoDs comme le choix optimal pour l’infrastructure IA à mesure que les modèles s’étendent.
Trois technologies derrière le M900
En termes de capacité, Huawei indique que l’interconnexion UnifiedBus permet à l’OceanStor M900 de créer un cache KV multi‑niveau mondial à l’échelle du pétaoctet avec des connexions à un seul saut, regroupant et partageant le cache à travers un cluster doté d’un stockage à niveaux. La conception étend le cache KV des SuperPoDs de la mémoire intégrée et de la DRAM aux SSD, permettant à un seul cluster de fournir 64 PB de capacité, selon l’entreprise. Huawei affirme que la capacité de cache KV disponible par NPU passe de gigaoctets à téraoctets, permettant de stocker, partager et réutiliser davantage de contexte, ce qui, selon elle, augmente considérablement le taux de réussite du cache KV.
En termes de performance, Huawei décrit l’OceanStor M900 comme la première architecture de l’industrie à intégrer le CPU, l’unité de contrôle réseau et l’unité de contrôle NAND, offrant une sémantique KV native qui permet des connexions à un seul saut entre les NPUs d’un SuperPoD et les SSD. L’entreprise rapporte que l’élimination de la conversion de protocole et du transfert par CPU réduit la latence d’accès de millisecondes à 60 microsecondes, soit une diminution de 90 %. Huawei indique également une bande passante d’accès agrégée de 40 TB/s pour un seul cluster, chiffre qu’elle décrit comme 1,5 fois supérieur aux solutions concurrentes. Dans les scénarios de programmation IA typiques, l’entreprise affirme que l’architecture double le débit de jetons d’un cluster d’inférence et réduit de moitié le temps jusqu’au premier jeton.
En termes de coût, Huawei indique que le M900 utilise la première technologie de stockage adaptatif sensible au KV de l’industrie, qui prédit les cycles de vie du cache KV en fonction de la valeur des données et répartit les données entre les supports de stockage en conséquence. L’entreprise rapporte que la technologie prend en charge jusqu’à 24 écritures de disque par jour, prolonge la durabilité des SSD de 16 fois et garantit une stabilité pendant trois ans, réduisant les coûts de remplacement des médias ainsi que les coûts d’exploitation et de maintenance dans les infrastructures d’inférence à grande échelle.
Positionnement du produit et détails de l’événement
Dans sa FAQ, Huawei décrit le stockage mémoire contextuelle, représenté par le M900, comme une nouvelle infrastructure de données pour les SuperPoDs dans les centres de données hyperscalaire, offrant une mémoire entièrement partagée à l’échelle du pétaoctet et permettant un stockage à niveaux ainsi qu’une planification efficace du cache KV entre la mémoire intégrée, la DRAM et les SSD. L’entreprise affirme que le stockage mémoire contextuelle sera essentiel pour améliorer continuellement la capacité et l’efficacité d’accès des caches KV d’inférence hyperscalaire. Huawei indique également qu’elle continuera à promouvoir la synergie matériel‑logiciel et l’innovation au niveau du système afin de fournir une infrastructure IA ouverte, efficace et durable pour la transformation intelligente de tous les secteurs.
HUAWEI CONNECT 2026, dont le thème est « Advancing the Agentic World », se déroule du 17 au 19 septembre 2026, au Shanghai World Expo Exhibition & Convention Center et au Shanghai Expo Center, et le communiqué indique que l’événement examine l’IA sous les angles de la stratégie, de la technologie et des écosystèmes. La page officielle de l’événement présente un programme de trois discours d’ouverture, 20 sommets, plus de 60 sessions et plus de 200 interventions ouvertes, avec des intervenants prévus tels que le PDG de la Linux Foundation, Jim Zemlin, le président d’iFLYTEK, Liu Qingfeng, et le PDG de Huawei Cloud, Peter Zhou.












