AI 모델 및 플랫폼

OceanStor M900, PB 규모 컨텍스트 메모리를 Huawei SuperPoDs에 제공

mm
Unite.AI를 Google의 선호 소스에 추가

Huawei는 2026년 9월 17일 상하이에서 열린 OceanStor M900 Context Memory StorageHUAWEI CONNECT 2026에서 소개하며, 초대규모 데이터 센터의 AI 추론을 위해 설계된 스토리지 시스템을 공개했습니다. Huawei의 이사회 부의장 겸 순환 의장인 David Wang이 기조연설에서 제품을 발표했으며, Huawei에 따르면 단일 클러스터가 64 PB의 KV 캐시 용량을 제공한다고 합니다.

Huawei에 따르면, 이 시스템은 UnifiedBus 인터커넥트 네트워크를 기반으로 PB 규모 용량과 TB/s 수준 성능을 제공하는 완전 공유 메모리 공간을 SuperPoDs에 제공합니다. Wang 의 기조연설 제목은 “Advancing the Agentic World, Building a Solid Silicon Foundation”이며, Huawei는 이번 출범이 컴퓨팅 중심 모델에서 컴퓨팅, 네트워크, 스토리지를 보다 깊게 협업하는 AI 인프라로의 전환을 의미한다고 설명합니다.

대규모 AI 추론에서의 메모리 한계

Huawei는 발표에서 2026년을 AI가 기술적 돌파구에서 대규모 구현 단계로 전환한 해로 설명하며, 애플리케이션이 챗봇에서 복잡한 작업을 자율적으로 수행할 수 있는 에이전트로 진화했다고 밝혔습니다. 이 에이전트들은 과학 연구, 의료, 금융, 공공 서비스 등 다양한 분야에 널리 도입되고 있으며, Huawei는 이러한 변화를 에이전시 AI 시대의 시작이라고 규정합니다.

Huawei는 대형 모델이 10조 규모 파라미터까지 성장하고 있으며, 주류 모델은 이미 백만 토큰을 초과하는 컨텍스트 윈도우를 지원해 다중 턴 추론 및 복잡한 작업이 일반화되고 KV 캐시 데이터가 지속적으로 증가하고 있다고 말합니다. 이러한 데이터가 축적됨에 따라, 온칩 메모리와 DRAM은 용량 및 비용 효율성 측면에서 한계를 넘어섰다고 회사는 강조합니다. 발표에 첨부된 FAQ에서는 KV 캐시를 대형 모델 추론 중 생성된 키와 값 데이터를 저장하여 이후 추론에서 재사용함으로써 중복 계산을 방지하는 저장소로 정의합니다. Huawei는 온칩 메모리, DRAM, SSD를 조정해 완전 공유 메모리 공간을 구현하는 다계층 스토리지를 구축하는 것이 업계 합의라고 설명하고, M900이 초장기 컨텍스트와 다중 턴 추론에서의 메모리 용량 병목을 해소하도록 설계되었다고 밝혔습니다. 또한 회사는 모델이 확장됨에 따라 SuperPoDs가 AI 인프라에 최적의 선택이라고 평가합니다.

M900을 이끄는 세 가지 기술

용량 측면에서 Huawei는 UnifiedBus 인터커넥트가 OceanStor M900이 1홉 연결을 통해 PB 규모의 전 세계 다계층 KV 캐시를 구축하고, 클러스터 전반에 걸쳐 캐시를 풀링 및 공유하도록 한다고 설명합니다. 이 설계는 SuperPoD KV 캐시를 온칩 메모리와 DRAM에서 SSD로 확장해 단일 클러스터가 64 PB 용량을 제공할 수 있게 합니다. Huawei에 따르면 NPU당 사용 가능한 KV 캐시 용량이 기가바이트에서 테라바이트로 증가해 더 많은 컨텍스트를 저장·공유·재사용할 수 있게 되며, 이는 KV 캐시 적중률을 크게 향상시킨다고 합니다.

성능 측면에서 Huawei는 OceanStor M900이 CPU, 네트워크 컨트롤러 유닛, NAND 컨트롤러 유닛을 통합한 업계 최초의 아키텍처이며, SuperPoD의 NPU와 SSD 간 1홉 연결을 가능하게 하는 네이티브 KV 의미론을 제공한다고 설명합니다. 프로토콜 변환 및 CPU 포워딩을 제거함으로써 접근 지연 시간이 밀리초에서 60 마이크로초로 감소했으며, 이는 90% 감소에 해당합니다. 또한 단일 클러스터에 대해 40 TB/s의 총 접근 대역폭을 제공한다는 점을 밝혔으며, 이는 경쟁 솔루션보다 1.5배 높다고 합니다. 일반적인 AI 프로그래밍 시나리오에서 이 아키텍처는 추론 클러스터의 토큰 처리량을 두 배로 늘리고 첫 토큰까지의 시간을 절반으로 줄인다고 회사는 말합니다.

비용 측면에서 Huawei는 M900이 업계 최초의 KV 인식 적응형 스토리지 기술을 사용한다고 밝히며, 이 기술은 데이터 가치를 기반으로 KV 캐시 수명을 예측하고 스토리지 매체에 데이터를 적절히 분산합니다. 하루에 최대 24회 드라이브 쓰기를 지원하고 SSD 내구성을 16배 연장하며 3년 동안 안정성을 보장해 대규모 추론 인프라에서 매체 교체 및 운영·유지보수 비용을 절감한다고 회사는 보고합니다.

제품 포지셔닝 및 행사 세부 정보

FAQ에서 Huawei는 M900이 대표하는 컨텍스트 메모리 스토리지를 초대규모 데이터 센터의 SuperPoDs를 위한 새로운 데이터 인프라로 설명하며, PB 규모의 완전 공유 메모리를 제공하고 온칩 메모리, DRAM, SSD 전반에 걸친 KV 캐시의 계층형 스토리지와 효율적인 스케줄링을 가능하게 한다고 밝혔습니다. 회사는 컨텍스트 메모리 스토리지가 초대규모 추론 KV 캐시의 용량 및 접근 효율성을 지속적으로 향상시키는 데 필수적일 것이라고 주장합니다. 또한 Huawei는 하드웨어·소프트웨어 시너지와 시스템 수준 혁신을 지속해 산업 전반의 지능형 전환을 위한 개방형, 효율적이며 지속 가능한 AI 인프라를 제공하겠다고 말합니다.

HUAWEI CONNECT 2026은 “Advancing the Agentic World”를 주제로 2026년 9월 17일부터 19일까지 상하이 월드 엑스포 전시·컨벤션 센터와 상하이 엑스포 센터에서 진행되며, 이번 발표에 따르면 행사는 전략, 기술, 생태계 전반에 걸친 AI를 조명한다고 합니다. 공식 행사 페이지에는 3개의 기조연설, 20개의 서밋, 60개 이상의 세션, 200개 이상의 공개 연설 프로그램이 나열되어 있으며, 예정된 기조연설자로는 Linux Foundation CEO Jim Zemlin, iFLYTEK 회장 Liu Qingfeng, Huawei Cloud CEO Peter Zhou가 포함됩니다.

테오 내쉬유나이트.AI의 AI 생성 전문가로, AI 인프라, 컴퓨팅, 및 현대적인 인공 지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드를 위한 기술적 기초에 중점을 두고 있으며, 데이터 센터, 가속기, 네트워킹, 및 이를 연결하는 소프트웨어 스택을 포함합니다.
분석적이고 엔지니어링 중심의 관점에서 테오 내쉬는 GPU, 커스텀 실리콘, 메모리 아키텍처, 및 분산 시스템의 발전에 따라 새로운 세대의 AI 모델이 어떻게 가능해지는지 조사합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성, 및 실제로 AI 인프라를 배치하는 실질적인 제약에 특별한 주의를 기울입니다.
테오 내쉬가 작성한 기사들은 AI로 생성되어 유나이트.AI의 편집 팀에 의해 검토되어 기술적 정확성, 명확성, 및 급변하는 AI 컴퓨팅 환경에 대한 책임 있는 보도를 보장합니다.