Modelos e plataformas de IA
OceanStor M900 traz memória de contexto em escala de PB para SuperPoDs da Huawei

A Huawei apresentou Armazenamento de Memória de Contexto OceanStor M900 no HUAWEI CONNECT 2026 em Xangai em 17 de setembro de 2026, revelando um sistema de armazenamento projetado para inferência de IA em data centers hiperescaláveis. David Wang, Vice‑Presidente do Conselho e Presidente Rotativo da Huawei, apresentou o produto durante sua palestra principal, e a Huawei afirma que um único cluster fornece 64 PB de capacidade de cache KV.
Segundo a Huawei, o sistema oferece aos SuperPoDs um espaço de memória totalmente compartilhado, proporcionando capacidade em escala de PB e desempenho em nível de TB/s, construído sobre a rede de interconexão UnifiedBus da empresa. A palestra de Wang foi intitulada “Advancing the Agentic World, Building a Solid Silicon Foundation”, e a Huawei descreve o lançamento como um marco na mudança da infraestrutura de IA, passando de um modelo centrado em computação para uma colaboração mais profunda entre computação, rede e armazenamento.
Limites de Memória na Inferência de IA em Grande Escala
Em seu anúncio, a Huawei descreve 2026 como um ano em que a IA passou de avanços tecnológicos para implementação em grande escala, com aplicações evoluindo de chatbots para agentes capazes de concluir tarefas complexas de forma autônoma. A empresa afirma que esses agentes são amplamente adotados em setores como pesquisa científica, saúde, finanças e serviços públicos, e caracteriza essa mudança como o início da era da IA agente.
A Huawei afirma que os grandes modelos estão crescendo para parâmetros na escala de 10 trilhões, enquanto os modelos convencionais já suportam janelas de contexto que excedem um milhão de tokens, tornando a inferência de múltiplas interações e tarefas complexas a norma e impulsionando o crescimento contínuo dos dados de cache KV. Conforme esses dados se acumulam, a empresa afirma que a memória on‑chip e a DRAM foram levadas além de seus limites tanto em capacidade quanto em relação custo‑benefício. Um FAQ anexado ao anúncio define cache KV como o armazenamento dos dados de Chave e Valor gerados durante a inferência de grandes modelos, de modo que possam ser reutilizados em inferências subsequentes, evitando computação redundante. A Huawei descreve um consenso da indústria sobre a construção de armazenamento de múltiplas camadas que coordena memória on‑chip, DRAM e SSDs em um espaço de memória totalmente compartilhado, e afirma que o M900 foi desenvolvido para superar gargalos de capacidade de memória em contextos ultra‑longos e inferência de múltiplas interações. A empresa também caracteriza os SuperPoDs como a escolha ideal para a infraestrutura de IA à medida que os modelos escalam.
Três Tecnologias por Trás do M900
Em termos de capacidade, a Huawei afirma que a interconexão UnifiedBus permite que o OceanStor M900 construa um cache KV global de múltiplas camadas em escala de PB, com conexões de um salto, agrupando e compartilhando o cache em todo o cluster com armazenamento em camadas. O design expande o cache KV dos SuperPoDs da memória on‑chip e DRAM para SSDs, permitindo que um único cluster forneça 64 PB de capacidade, segundo a empresa. A Huawei afirma que a capacidade de cache KV disponível por NPU aumenta de gigabytes para terabytes, permitindo que mais contexto seja armazenado, compartilhado e reutilizado, o que, segundo a empresa, eleva significativamente a taxa de acerto do cache KV.
Em termos de desempenho, a Huawei descreve o OceanStor M900 como a primeira arquitetura da indústria a integrar a CPU, a unidade controladora de rede e a unidade controladora NAND, fornecendo semântica KV nativa que permite conexões de um salto dos NPUs de um SuperPoD para SSDs. A empresa relata que a eliminação da conversão de protocolos e do encaminhamento pela CPU reduz a latência de acesso de milissegundos para 60 microssegundos, uma redução de 90 %. A Huawei também informa 40 TB/s de largura de banda de acesso agregada para um único cluster, um valor que descreve como 1,5 vezes maior que as soluções concorrentes. Em cenários típicos de programação de IA, a empresa afirma que a arquitetura duplica a taxa de processamento de tokens de um cluster de inferência e reduz à metade o tempo até o primeiro token.
Em termos de custo, a Huawei afirma que o M900 utiliza a primeira tecnologia de armazenamento adaptativo consciente de KV da indústria, que prevê os ciclos de vida do cache KV com base no valor dos dados e distribui os dados entre os meios de armazenamento de acordo. A empresa relata que a tecnologia suporta até 24 gravações por dia em cada unidade, estende a durabilidade dos SSDs em 16 vezes e garante estabilidade por três anos, reduzindo os custos de substituição de mídia e de operações e manutenção em infraestruturas de inferência em grande escala.
Posicionamento do Produto e Detalhes do Evento
Em seu FAQ, a Huawei descreve o Armazenamento de Memória de Contexto, representado pelo M900, como uma nova infraestrutura de dados para SuperPoDs em data centers hiperescaláveis, oferecendo memória totalmente compartilhada em escala de PB e permitindo armazenamento em camadas e agendamento eficiente do cache KV entre memória on‑chip, DRAM e SSDs. A empresa afirma que o armazenamento de memória de contexto será essencial para aprimorar continuamente a capacidade e a eficiência de acesso dos caches KV de inferência em hiperescalas. A Huawei também declara que continuará a impulsionar a sinergia hardware‑software e a inovação em nível de sistema para oferecer uma infraestrutura de IA aberta, eficiente e sustentável para a transformação inteligente em todos os setores.
O HUAWEI CONNECT 2026, com o tema “Advancing the Agentic World”, ocorre de 17 a 19 de setembro de 2026, no Shanghai World Expo Exhibition & Convention Center e no Shanghai Expo Center, e o anúncio afirma que o evento examina a IA em termos de estratégia, tecnologia e ecossistemas. A página oficial do evento lista um programa com três palestras principais, 20 cúpulas, mais de 60 sessões e mais de 200 palestras abertas, com palestrantes principais programados, incluindo o CEO da Linux Foundation, Jim Zemlin, o presidente da iFLYTEK, Liu Qingfeng, e o CEO da Huawei Cloud, Peter Zhou.












