AI 모델 및 플랫폼
WEKA, NeuralMesh 6 및 WEKApod 3 출시: AI 인프라의 새로운 전환

WEKA는 AI 산업에서 가장 비싼 문제 중 하나인 GPU의 생산성을 유지하는 데 도움이 되는 소프트웨어와 하드웨어를 통합한 새로운 솔루션을 발표했습니다.
이번 발표에는 NeuralMesh 6가 포함되어 있습니다. 이는 데이터와 메모리 플랫폼의 주요 업데이트이며, AI 클라우드, 모델 개발자, 연구 기관 및 기업의 GPU 인프라를 운영하는 WEKApod 어플라이언스를 포함합니다.
이gether, 이러한 출시들은 AI 인프라 디자인의 더广泛한 변화를 반영하며, 저장소가 수동 저장소에서 활성 메모리 및 데이터 전달 레이어로 진화하고 있습니다.
프로덕션 AI로의 통합적인 推進
AI 추론의 인프라 요구사항은 모델 훈련과 크게 다릅니다. 훈련 작업은 일반적으로 예측 가능한 파이프라인을 통해 대규모 데이터셋을 처리합니다. 반면에, 에이전트 AI, 검색 보강 생성 및 장기간 맥락 추론 시스템은 변경되는 데이터에 접근해야 하며, 반복되는 상호 작용에서 맥락을 유지하고, 비싼 GPU가 정보를 기다리는 동안 많은 동시 사용자를 지원해야 합니다.
WEKA의 응답은 저장소, 메모리 확장, 파일 접근, 객체 접근 및 데이터 이동을 동일한 플랫폼의 일부로 취급하는 것입니다. NeuralMesh는 온프레미스 환경, 공용 클라우드 및 하이브리드 배포에서 훈련, 추론 및 고성능 컴퓨팅을 위한 공유 데이터 재단을 제공하도록 설계되었습니다.
새로운 릴리스는 멀티 테넌시, 네이티브 객체 저장소, 분산 캐싱, 자동 데이터 감소, 쿠버네티스 작업 및 중앙 집중식 관찰 가능성을 통해 아키텍처를 확장합니다.
소프트웨어 및 어플라이언스 발표는 별개의 업그레이드가 아닌 동일한 시스템의 두 부분으로 제시됩니다. NeuralMesh 6는 데이터가 저장, 이동, 분리 및 전달되는 방식을 제어하며, WEKApod 3는 이러한 기능을围绕한 하드웨어를 제공합니다.
NeuralMesh 6, 파일 및 객체 워크로드 통합
NeuralMesh 6의 가장 중요한 추가 기능 중 하나는 NVMe 저장소에서 실행되는 네이티브 S3 구현입니다. 동일한 기본 데이터 블록은 S3 객체 프로토콜 및 POSIX 또는 네트워크 파일 시스템 인터페이스를 통해 접근할 수 있으며 별도의 복사본을 유지할 필요가 없습니다.
이것은 AI 파이프라인이 종종 정보를 객체 저장소, 고성능 파일 시스템, 훈련 환경 및 추론 클러스터 사이에서 이동시키기 때문입니다. 각 복사본은 용량을 소비하며, 지연을 도입하며, 거버넌스를 복잡하게 만듭니다.統一 네임스페이스는 한 프로토콜을 통해 생성된 데이터가 다른 프로토콜을 통해 즉시 사용할 수 있도록 할 수 있습니다.
WEKA는 노드당 2,000~5,000개의 동시 S3 연결을 지원하는 구현을 제공한다고 합니다. 또한 S3를 원격 직접 메모리 액세스(RDMA)로 지원하여 데이터를 GPU 메모리로 이동하는 데 필요한 CPU 및 운영 체제 계층을 건너뛸 수 있습니다.
플랫폼은 두 수준의 멀티 테넌시를 도입합니다. 구성 가능한 클러스터는 개별 테넌트에 전용 프로세서, 메모리 및 저장소 리소스를 할당하며, 가상 멀티 테넌시에서는 네트워크 분리, 독립적인 암호화, 별도의 인증 및 테넌트당 품질 서비스 제어를 제공합니다.
가상 환경은 클러스터당 1,000개 이상의 분리된 테넌트를 지원할 수 있다고 회사 측은 밝혔습니다. 물리적 및 가상 모델을 결합하면 대규모 인프라 운영자가 독립적인 저장소 클러스터를 배포하지 않고도 수만 개의 논리적으로 분리된 고객을 지원할 수 있습니다.
이것은 특히 GPU를 서비스 형태로 제공하는 제공자와 주권 AI 클라우드에 중요합니다. 이들은 높은 인프라 사용률과 엄격한 고객 분리 사이에서 균형을 유지해야 합니다.
GPU가 사용 가능한 곳으로 데이터 이동
NeuralMesh 6은 또한 AI 워크로드에 대한 메타데이터 우선 복제 및 원격 캐싱을 도입합니다. 이러한 기능은 데이터 센터, 클라우드 및 지리적 지역에 걸쳐 분산된 워크로드를 지원합니다.
전통적인 복제는 일반적으로 작업을 시작하기 전에 전체 데이터셋을 복사해야 합니다. NeuralMesh는 대신 대상의 메타데이터를 즉시 표시한 다음 요청된 데이터를 전송합니다.
이 접근 방식은 작업을 사용 가능한 GPU 용량으로 이동시키기 위해 프로젝트와 관련된 모든 파일을 복사할 필요가 없도록 할 수 있습니다. 이 기능은 클라우드 버스팅, 분산 AI 인프라 및 지리적으로 분산된 연구 또는 엔지니어링 팀 간의 협력을 지원하도록 설계되었습니다.
또한 이것은 데이터가 원래 저장된 위치와 상관없이 일관되게 주소할 수 있는 글로벌 네임스페이스 모델의 초기 단계를 나타냅니다.
또 다른 새로운 기능은 지문, 유사성 해싱, 중복 제거 및 압축을 연속적으로 적용하는 것입니다. 이는 데이터 감소가 배경 프로세스로 처리되는 것이 아니라 데이터를 처리하는 동안 지속적으로 발생합니다.
WEKA는 NeuralMesh 6이 AI 훈련 데이터에서 최대 6배의 용량 절약을 제공할 수 있으며, 쓰기 오버헤드는 5% 미만이라고 주장합니다. 실제 감소는 데이터셋에 따라 다를 수 있습니다. 체크포인트, 컨테이너 레이어, 모델 버전 및 반복적인 훈련 데이터에는 상당한 반복이 포함될 수 있지만 다른 데이터 유형은 덜 압축될 수 있습니다.
회사 측은 배포 전에 대표적인 고객 데이터를 분석하여 용량 및 성능 약속의 일부로 사용할 계획입니다.
저장소를 확장된 AI 메모리 레이어로 전환
NeuralMesh는 또한 WEKA의 Augmented Memory Grid를 포함합니다. 이는 NVMe 저장소를 사용하여 추론을 위한 GPU 메모리의 지속적인 확장으로 작동합니다.
대규모 언어 모델은 프롬프트 또는 대화에서 계산된 정보를 포함하는 키-값 캐시를 생성합니다. 장기간 맥락 및 에이전트 워크플로우의 경우 이 캐시가 매우 커질 수 있습니다. GPU 메모리에서 유지할 수 없을 때 시스템은 캐시를 폐기하거나, 다시 계산하거나, 더 느린 인프라로 이동해야 할 수 있습니다.
Augmented Memory Grid는 캐시를 지속적인 NVMe 백업 레이어에 저장하고 Remote Direct Memory Access 및 NVIDIA GPUDirect Storage를 사용하여 캐시를 GPU로 다시 이동합니다.
목표는 반복되는 전환 계산을 줄이면서 재사용 가능한 맥락을 유지하는 것입니다.
WEKA는 Oracle Cloud Infrastructure에서 NVIDIA H100 GPU를 사용하여 테스트한 결과, 토큰 처리량이 10배, 동시 사용자 수는 10배, GPU당 토큰 수가 7배 증가했다고 보고했습니다.
이러한 수치는 보편적인 성능 예상치가 아닌 워크로드별 벤치마크입니다. 그러나 추론 인프라 설계에서 지속적인 캐시 관리가 중요한 이유를 설명합니다.
WEKApod 3, 하드웨어 레이어 제어
이전 WEKApod 시스템은 WEKA 소프트웨어와 사전 검증된 인프라를 결합한 반면, 3세대 시스템은 수직적으로 통합된 시스템 설계로 더 나아갑니다.
WEKA는 새로운 2개 랙 유닛의 샤시, 드라이브 인터커넥트, 냉각 아키텍처, 고장 도메인 및 서비스 가능성을 설계했습니다. 어플라이언스는 내부적으로 PCI Express Gen 6을 사용하며 NVIDIA (NVDA ) ConnectX 네트워킹을 통해 Spectrum-X 이더넷 인프라에 연결됩니다.
WEKApod 제품군은 현재 세 가지 구성 가능한 시스템으로 구성됩니다. Nitro는 대역폭 집약적인 추론 및 AI 팩토리 워크로드에 최적화되어 있습니다. Prime은 성능과 용량을 균형 있게 조정하기 위해 트리플 레벨 셀과 쿼드 레벨 셀 플래시를 결합합니다. Prime Max는 2개 랙 유닛의 샤시에 최대 70개의 NVMe 드라이브를 장착하여 최대 저장소 밀도를 제공합니다.
전체 랙 규모에서 Prime Max는 441.5 페타바이트의 원시 용량과 NeuralMesh 데이터 감소 후 1.1 엑사바이트의 효과적인 용량을 제공할 수 있다고 WEKA는 밝혔습니다. 랙 수준 시스템은 초당 10.2 테라바이트의 처리량과 초당 210만 개의 입출력 작업을 지원할 수 있습니다.
원시 용량과 효과적인 용량 사이의 구별은 중요합니다. 엑사바이트 수치는 저장된 데이터에서 달성 가능한 감소에 따라 다르며, 물리적인 플래시보다 더 많은 용량으로 해석되어서는 안 됩니다.
그러나 더 높은 밀도는 저장소가 GPU와 함께 랙 공간, 냉각 및 전기 용량을 경쟁하는 시설에서 의미 있는 결과를 가질 수 있습니다.
제한된 데이터 센터를 위한 설계
새 시스템은 또한 AI 인프라 프로젝트를 형성하는 물리적 제한을 해결합니다.
GPU 클러스터는大量의 전기, 냉각, 네트워킹 및 바닥 공간을 필요로 합니다. 저장소 시스템이 이러한 자원을 비효율적으로 소비하면 시설에서 지원할 수 있는 가속기의 수를 줄일 수 있습니다.
WEKA는 새로운 어플라이언스가 해당 카테고리에서 다음으로 좋은 공개적으로 사용 가능한 대안보다 267% 더 높은 효과적인 용량 밀도와 114% 더 높은 성능 밀도를 제공한다고 주장합니다.
회사는 또한 시스템을 35도까지의 주변 온도에서 작동하도록 설계했습니다. 소프트웨어 제어 전력 제한은 성능을渐進적으로 줄이는 것을 목표로 하며, 熱 스트레스 동안 종료를 트리거하는 것을 피합니다.
백플레인 없는 드라이브 설계는 더 작은 고장 도메인을 생성하며, 핫 플러그 가능한 부트 드라이브 및 안내된 교체 절차는 유지 보수 시간을 줄이는 것을 목표로 합니다. 고객은 샤시 유형, 메모리, 드라이브 용량 및 드라이브 수를 구성할 수 있으며, 배포는 1 페타바이트 미만에서 100 페타바이트 이상까지 다양할 수 있습니다.
AI 팩토리周辺의 에코시스템 구축
동반하는 파트너 발표는 플랫폼이 인프라 통합업체, 클라우드 제공업체 및 AI 오케스트레이션 벤더를 통해 고객에게 도달할 것임을 시사합니다.
Spectro Cloud는 NeuralMesh를 PaletteAI와 결합하여 기업 AI 팩토리를 배포하고 운영할 수 있는 데이터 레이어로 пози션하고 있습니다. World Wide Technology와 Computacenter는 시스템을 더广泛한 인프라 프로젝트에 통합할 계획이며, Glocomp는 고객이 더 나은 AI 성능과 더 예측 가능한 인프라 비용을 요구하고 있음을 강조했습니다.
이 에코시스템 전략은 대부분의 조직이 단일 공급업체에서 생산 AI 환경을 조립하지 않는다는 사실 때문에 중요합니다.
일반적인 배포에는 여러 벤더의 GPU, 네트워킹, 저장소, 쿠버네티스, 모델 제공 소프트웨어, 관찰 가능성, 보안 및 거버넌스 제품이 포함될 수 있습니다. 공동으로 검증된 구성은 통합 작업을 줄일 수 있지만, 고객은 자신의 모델, 데이터셋, 네트워크 및 동시성 요구 사항을 사용하여 성능을 테스트해야 합니다.
AI 인프라에 대한 의미
이 발표의 가장 중요한 측면은 개별 용량 또는 처리량 수치가 아닙니다. 저장소, 분산 캐싱, 메모리 관리, 데이터 이동성 및 테넌트 분리의 수렴이 증가하고 있습니다.
에이전트가 더 긴 기록을 유지하고, 더 많은 기업 정보에 접근하며, 지속적으로 작동함에 따라, GPU를 둘러싼 인프라는 각 유용한 응답의 비용을 점점 더 결정할 것입니다.
추가적인 가속기를 추가하는 것은 반복되는 컨텍스트 처리, 느린 데이터 이동, 단편적인 프로토콜 또는 사용되지 않는 저장소 용량으로 인한 병목 현상을 해결하지 못합니다. 따라서 AI 인프라의 다음 단계는 원시 컴퓨팅을 증가시키는 것만큼 효율적으로 GPU를 공급하고 관리하는 것에 의존할 것입니다.
NeuralMesh 6은 2026년 하반기에 일반적으로 उपलब성이 예정되어 있으며, 기존 고객은 표준 소프트웨어 채널을 통해 업그레이드할 수 있습니다. 새로운 WEKApod Nitro, Prime 및 Prime Max 시스템은 주문 가능하며, 출하는 2026년 가을에 시작될 예정입니다.












