AIモデルとプラットフォーム

WEKA、NeuralMesh 6とWEKApod 3を発表し、AIインフラストラクチャーが推論に向けてシフト

mm
Unite.AI を Google の優先ソースに追加

WEKAは、AI業界で最も高価な新興問題の1つである、モデルがトレーニングから継続的な大規模な推論に移行するにつれて、GPUを生産的に保つためのソフトウェアとハードウェアの統合されたオーバーホールを発表しました。

発表には、NeuralMesh 6が含まれており、会社のデータとメモリープラットフォームのメジャーアップデートであり、AIクラウド、モデル開発者、研究機関、GPUインフラストラクチャーを運用する企業向けに設計された第3世代のWEKApodアプライアンスが含まれています。

これらは、ストレージが受動的なリポジトリからアクティブなメモリとデータ配信レイヤーに進化する、AIインフラストラクチャーデザインの変化を反映しています。

統一されたプロダクションAIへのプッシュ

AI推論のインフラストラクチャー要件は、モデルトレーニングとは大きく異なります。トレーニングジョブは通常、予測可能なパイプラインを介して大規模なデータセットを処理します。一方、エージェントAI、リトリーバーオーグメンテーション生成、長文脈推論システムは、変更されるデータにアクセスし、繰り返しインタラクション全体でコンテキストを維持し、コストのかかるGPUを待たせることなく、多数の同時ユーザーをサポートする必要があります。

WEKAの対応策は、ストレージ、メモリー拡張、ファイルアクセス、オブジェクトアクセス、データ移動を同じプラットフォームのパーツとして扱うことです。NeuralMeshは、オンプレミス環境、パブリッククラウド、ハイブリッド展開全体でトレーニング、推論、高性能コンピューティングのための共有データ基盤を提供するように設計されています。

新しいリリースでは、マルチテナンシー、ネイティブオブジェクトストレージ、分散キャッシング、自動データ削減、Kubernetes操作、集中監視が拡張されています。

ソフトウェアとアプライアンスの発表は、無関係なアップグレードではなく、同じシステムの2つのパーツとして提示されています。NeuralMesh 6は、データがどのように保存、移動、分離、配信されるかを制御します。一方、WEKApod 3は、これらの機能を中心に設計されたハードウェアを提供します。

NeuralMesh 6がファイルとオブジェクトワークロードを統一する

NeuralMesh 6の最も重要な追加機能の1つは、ネイティブS3実装で、NVMeストレージ上で実行されます。この同じ基礎となるデータブロックは、S3オブジェクトプロトコルとPOSIXまたはネットワークファイルシステムインターフェイスの両方を介してアクセスできますが、個別のコピーを維持する必要はありません。

これは、AIパイプラインがオブジェクトストレージ、高性能ファイルシステム、トレーニング環境、推論クラスター間で情報を移動することが多いために重要です。各コピーは容量を消費し、遅延を導入し、ガバナンスを複雑にします。統一された名前空間により、1つのプロトコルで作成されたデータが、別のプロトコルですぐに利用できるようになります。

WEKAによると、この実装はノードあたり2,000〜5,000の同時S3接続をサポートし、S3 over Remote Direct Memory Accessもサポートし、データをGPUメモリに直接移動できるため、CPUとオペレーティングシステムの複数のレイヤーを介して移動する必要がありません。

プラットフォームには、2つのレベルのマルチテナンシーがあります。Composable Clustersは、個々のテナントに専用のプロセッサ、メモリー、ストレージリソースを割り当て、仮想マルチテナンシーは、ネットワーク分離、独立した暗号化、個別の認証、およびテナントごとのサービス品質コントロールを提供します。

仮想環境はクラスタあたり1,000以上の分離テナントをサポートできると会社は述べています。物理モデルと仮想モデルの組み合わせにより、大規模なインフラストラクチャーオペレーターは、独立したストレージクラスタを各テナントに展開することなく、10,000以上の論理的に分離された顧客をサポートできます。

これは、GPU-as-a-Serviceプロバイダーと主権AIクラウドにとって特に重要です。彼らは、高いインフラストラクチャーの活用率と厳格な顧客分離のバランスを取る必要があります。

GPUが利用可能な場所にデータを移動する

NeuralMesh 6では、AIワークロード用のメタデータファーストレプリケーションとリモートキャッシングが導入され、データセンター、クラウド、地理的な地域全体にわたる分散AIインフラストラクチャーをサポートします。

従来のレプリケーションでは、ワークロードを開始する前に、データセット全体をコピーする必要があります。一方、NeuralMeshでは、宛先のメタデータをすぐに可視化し、データを要求されたときに転送します。

これにより、オペレーターは、プロジェクトに関連するすべてのファイルをレプリケートすることなく、ジョブを利用可能なGPU容量に向けて移動できます。このアプローチは、クラウドバースト、分散AIインフラストラクチャー、地理的に分離された研究またはエンジニアリングチーム間のコラボレーションをサポートすることを目的としています。

また、データが元々保存されていた場所に関係なく、データを一貫した方法でアドレスできるグローバル名前空間モデルの初期段階を表します。

別の新機能は、フィンガープリント、類似ハッシュ、デジタルサイン、データ圧縮を連続して適用し、データ削減をバックグラウンドプロセスとしてではなく、常に実行するようにします。

WEKAは、NeuralMesh 6がAIトレーニングデータで6倍の容量節約を提供できると主張しています。ただし、実際の削減はデータセットによって異なります。チェックポイント、コンテナレイヤー、モデルバージョン、反復トレーニングデータには、重要な繰り返しが含まれる場合がありますが、他のデータタイプは効果的に圧縮できない場合があります。

会社は、展開前に代表的な顧客データを分析し、結果として得られる見積もりを容量とパフォーマンスのコミットメントの一部として使用する予定です。

ストレージを拡張されたAIメモリーレイヤーにする

NeuralMeshには、WEKAのAugmented Memory Gridも含まれており、NVMeストレージをGPUメモリの永続的な拡張として使用します。

大規模な言語モデルは、プロンプトまたは会話から計算された情報を含むキーバリューキャッシュを作成します。長いコンテキストとエージェントワークフローでは、このキャッシュは非常に大規模になる可能性があります。GPUメモリに収まらない場合は、システムはそれを破棄する、再計算する、または遅いインフラストラクチャーに移動させる必要があります。

Augmented Memory Gridは、このキャッシュを永続的なNVMeバックされたレイヤーに保存し、Remote Direct Memory AccessとNVIDIA GPUDirect Storageを使用してそれをGPUに戻します。

目的は、繰り返しプレフィル計算の1つであるリソースを大量に消費するステージを削減しながら、再利用可能なコンテキストを維持することです。

WEKAは、Oracle Cloud InfrastructureでNVIDIA H100 GPUを使用したテストで、トークンあたりのスループットが10倍、同時ユーザー数が10倍、GPUあたりのトークン数が7倍になったと報告しています。

これらの数字は、普遍的なパフォーマンス期待ではなく、ワークロード固有のベンチマークですが、推論インフラストラクチャー設計における永続的なキャッシュ管理の重要性を示しています。

WEKApod 3がハードウェアレイヤーのコントロールを取り戻す

以前のWEKApodシステムは、WEKAソフトウェアと事前に検証済みのインフラストラクチャーを組み合わせたものでしたが、第3世代は、垂直統合システム設計にさらに踏み込みました。

WEKAは、新しい2ユニットのシャーシ、ドライブインターコネクト、クーリングアーキテクチャ、障害ドメイン、サービスシステムを設計しました。アプライアンスは、内部にPCI Express Gen 6を使用し、NVIDIA (NVDA ) ConnectXネットワーキングをSpectrum-X Ethernetインフラストラクチャーに接続します。

WEKApodファミリーは現在、3つの構成可能なシステムで構成されています。Nitroは、バンド幅を必要とする推論とAIファクトリーワークロードに最適化されています。Primeは、トリプルレベルセルとクアッドレベルセルのフラッシュを組み合わせて、パフォーマンスと容量のバランスをとります。Prime Maxは、最大のストレージ密度を優先し、2ユニットのシャーシに最大70個のNVMeドライブを収容できます。

フルラックスcaleでは、WEKAはPrime Maxが441.5ペタバイトの生容量と、NeuralMeshデータ削減後の1.1エクサバイトの有効容量を提供できると述べています。ラックスcaleシステムは、10.2テラバイト/秒のスループットと210百万の入出力操作/秒で評価されています。

生容量と有効容量の区別は重要です。エクサバイトの数字は、保存されたデータ全体で達成可能な削減量に依存し、物理フラッシュのエクサバイト以上を意味するものではありません。

しかし、ストレージとGPUがラックスペース、冷却、電力容量を争う施設では、密度の増加は重大な影響を与える可能性があります。

制約付きデータセンターの設計

新しいシステムは、物理的な制限にも対応しています。これは、AIインフラストラクチャープロジェクトを形作る上で重要な要素です。

GPUクラスタは、大量の電力、冷却、ネットワーキング、床面積を必要とします。ストレージシステムがこれらのリソースを効率的に消費すると、施設がサポートできるアクセラレーターの数が減少する可能性があります。

WEKAは、新しいアプライアンスが、各カテゴリの公開されている次に良い代替品よりも、267%の有効容量密度と114%のパフォーマンス密度を提供することを主張しています。

会社はまた、アプライアンスを35度セルシウスまでの周囲温度で動作させるように設計しました。ソフトウェア制御のパワーサージは、シャットダウンをトリガーするのではなく、熱ストレス中にパフォーマンスを段階的に低下させることを目的としています。

バックプレーンのないドライブ設計により、障害ドメインが小さくなり、ホットプルグ可能なブートドライブとガイド付きの交換手順により、メンテナンス時間が短縮されます。顧客は、シャーシタイプ、メモリ、ドライブ容量、ドライブ数を構成でき、展開は1ペタバイト未満から100ペタバイトを超える範囲になります。

AIファクトリーの周りのエコシステムを構築する

パートナー発表は、プラットフォームがインフラストラクチャーインテグレーター、クラウドプロバイダー、AIオーケストレーションベンダーを介して顧客に届けられることを示唆しています。

Spectro Cloudは、NeuralMeshをデータレイヤーとして位置付け、PaletteAIと組み合わせてエンタープライズAIファクトリーを展開および運用できるようにしています。World Wide TechnologyとComputacenterは、システムをより広範なインフラストラクチャープロジェクトに組み込む予定です。一方、Glocompは、顧客がより優れたAIパフォーマンスとより予測可能なインフラストラクチャーコストを求めていることを強調しています。

このエコシステム戦略は重要です。ほとんどの組織は、プロダクションAI環境を単一のサプライヤーから構築していないからです。

典型的な展開では、GPU、ネットワーキング、ストレージ、Kubernetes、モデル提供ソフトウェア、監視、セキュリティ、ガバナンス製品が複数のベンダーから提供されます。共同で検証された構成は、統合作業を減らすことができますが、顧客は、独自のモデル、データセット、ネットワーク、同時実行要件を使用してパフォーマンスをテストする必要があります。

AIインフラストラクチャーへの意味

発表の中で最も重要な点は、個々の容量やスループットの数字ではなく、ストレージ、分散キャッシング、メモリ管理、データ移動、テナント分離の収束です。

AIエージェントがより長い履歴を保持し、企業情報にアクセスし、継続的に動作するにつれて、GPUを取り巻くインフラストラクチャーが、各有用な応答のコストを決定するようになります。

アクセラレーターの数を増やすだけでは、繰り返しコンテキスト処理、遅いデータ移動、断片化されたプロトコル、または未使用のストレージ容量によって引き起こされるボトルネックを解決することはできません。したがって、AIインフラストラクチャーの次の段階は、生のコンピューティングを増やすのと同じくらい、GPUを効率的にフィードして管理することに依存することになります。

NeuralMesh 6は、2026年下半期に一般提供される予定です。既存の顧客は、標準のソフトウェアチャネルを介してアップグレードする資格があります。新しいWEKApod Nitro、Prime、Prime Maxシステムは注文可能で、出荷は2026年秋に開始される予定です。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。