AIモデルとプラットフォーム

CoreWeave、数百台のRubin GPUを単一のマルチラッククラスターに接続

mm
Unite.AI を Google の優先ソースに追加

CoreWeaveは2026年9月16日に発表した、CoreWeave Cloud上でマルチラックNVIDIA Vera Rubin NVL72を立ち上げ、数百台のNVIDIA Rubin GPUをエージェントAI向けの単一スケールアウトクラスターに配置したことを。 同社はまた、CoreWeave AI Object Storageに2つの新機能、クロスリージョン書き込み加速と新しいArchiveティアを導入した。

CoreWeaveの製品・エンジニアリング担当エグゼクティブ・バイスプレジデントであるChen Goldbergは、CoreWeaveがVera Rubin NVL72を検証し立ち上げた初のAIクラウドプロバイダーであり、ラックスケールアーキテクチャが信頼性の高い高性能クラウドサービスとして機能することを実証したと述べた。 「マルチラックVera Rubinにより、数百台のRubin GPUを単一のスケールアウトクラスターとして接続しています」とGoldbergは語り、エージェントAIを構築する顧客にとっては、規模の拡大、イテレーションの高速化、モデルとエージェントが継続的に学習・改善することで生産性が向上すると付け加えた。

マルチラックアーキテクチャと立ち上げ

単一のVera Rubin NVL72ラックは、72台のRubin GPUと36台のVera CPU、NVIDIA NVLink 6、ConnectX-9 SuperNIC、BlueField-4 DPUを組み合わせて構成される。マルチラックVera Rubin NVL72を使用することで、CoreWeaveはNVIDIA Spectrum-X Ethernetネットワークを用いて数百台のアクセラレータを単一のスケールアウトクラスターに統合する。CoreWeaveによれば、このシステムはより大規模なモデルの訓練、より要求の高い推論ワークロードの提供、そしてスケールでの強化学習の実行能力を提供する。

同社によると、数百台のRubin GPUにまたがって訓練および推論ジョブを実行することは、データアクセスレイテンシに敏感なマルチステップエージェントワークロードにとって重要であり、遅延はモデル呼び出しやツール使用の繰り返しで累積する可能性がある。

CoreWeaveは、複数のラックを自動化されたラックライフサイクル管理、システムレベルの検証、ネットワークスケーリングにより単一システムとして立ち上げると述べた。CoreWeave Mission ControlはRack LifeCycle Controllerを通じてラック設定を自動化し、ハードウェア検出、ファームウェア更新、検証、電源、冷却といった設定作業を実行する。Rackyがラックレベルの制御を担当し、Valveyが冷却操作を実行する。ラックが本番に入る前に、CoreWeaveはNVIDIAのフィールド診断とフルラックワークロードテストを組み合わせ、すべての結果を比較し、システムとして基準をクリアしたラックのみが本番に移行する。

ネットワーク側では、各Rubin GPUが2つのConnectX-9 SuperNICを搭載し、マルチプレーン・マルチレール経路でGPUあたり1.6 Tb/sのスケールアウト接続性を提供する。CoreWeaveは、この設計がノンブロッキングファブリックでレールあたり約128,000台のGPUをサポートし、モジュラートポロジーにより拡張時にファブリックを再設計せずにラックを追加できると述べた。

リージョン横断AIオブジェクトストレージ

CoreWeave AI Object Storageは、LOTA(ローカルオブジェクトトランスポートアクセラレータ)を通じてデータをワークロードに近づけ、各CoreWeave Kubernetes Serviceノードで管理キャッシュを適用する。CoreWeaveによれば、LOTAはローカルNVMe速度での読み取りを実現し、従来のストレージクラスターからの読み取りに比べてレイテンシを8倍削減し、クラスターが拡大するにつれて線形にスケールしながらGPUあたり最大7 GB/sのスループットを提供する。

新しいクロスリージョン書き込み加速機能により、チェックポイントはリージョン内でローカルに書き込まれ、ローカルレイテンシで処理される間にデータはバックグラウンドで第二のリモートリージョンへ移行する。アプリケーションは単一バケットを見るだけなのでコード変更は不要で、書き込み元のリージョンに関係なく権限や保持ポリシーは同様に機能する。CoreWeaveは、この機能により訓練の中断が最小化され、リージョン間でデータを手動でコピーまたは移動する必要がなくなると述べた。

第二の追加機能であるArchiveは、データ取得時、早期削除時、階層からの読み取り時に料金が発生しない低コストのストレージティアである。CoreWeaveは、これはチームが本来削除してしまうようなデータ、たとえばほぼ成功した実行のチェックポイント、結果再現に必要なデータセット、あるいは6か月後に問い合わせが予想されるモデルバージョンなどのために構築されたと説明した。

「当社のデータセットは複数のリージョンにまたがっており、クロスリージョン取得の遅延で訓練スケジュールが左右される余裕はありません」とCohereの内部インフラ担当ディレクター、Cécile Robert-Michonは述べた。「CoreWeave AI Object Storageは、リージョン間で統一されたデータセットフットプリントを提供し、読み取りはローカルにキャッシュされるため、ネットワークで待たされることがありません。」

NVIDIA Vera Rubin NVL72 仕様

NVIDIAのVera Rubin NVL72 製品ページでは、システムは第3世代MGX NVL72ラック設計に基づくラックスケールのエージェントAIスーパコンピュータで、現在フルプロダクションであると説明されている。NVIDIAが公開した仕様では、HBM4 GPUメモリが20.7 TB、帯域幅が1,400 TB/s、第6世代NVLink上のNVLink帯域幅が216 TB/s、ラックあたりのスパースNVFP4推論計算が3,600 PFLOPSと記載されている。ラックの36台のVera CPUは3,168個のカスタムOlympusコアと最大54 TBのLPDDR5Xメモリを供給する。

NVIDIAは、Vera Rubin NVL72がGB200 NVL72と比較してGPU数を4分の1に抑えてMixture-of-Expertsモデルを訓練でき、非常にインタラクティブで深い推論を行うエージェントAIにおいて、100万トークンあたりの推論コストを10分の1に削減し、メガワット当たりのトークン数を最大10倍に増やすと述べている。ページの脚注では、推論数値は変更される可能性があること、訓練比較は予測パフォーマンスであることが記されている。

発表において、CoreWeaveはそのパフォーマンス実績を指摘し、推論とトレーニングの両方で記録的なMLPerfベンチマーク結果を示したこと、そしてSemiAnalysis ClusterMAX 1.0 と 2.0 の両方でトップのプラチナランクを獲得した唯一のAIクラウドであることを挙げました。同社はまた、Artificial Analysis が実施した独立した推論ベンチマークにおいて、Moonshot AI の Kimi K2.6 および Kimi K2.7 Code モデルが推論速度と価格性能でそれぞれ #1 のランキングを獲得したことも引用しました。

テオ・ナッシュは、Unite.AIのAI生成専門家で、AIインフラストラクチャ、コンピューティング、そしてモダンな人工知能を支えるハードウェアシステムについて取り上げています。彼の仕事は、大規模なAIワークロードの背後にある技術的基礎に焦点を当てており、データセンター、加速器、ネットワーク、そしてそれらを結びつけるソフトウェアスタックを含みます。
分析的かつエンジニアリング主導の視点から、テオは、GPU、カスタムシリコン、メモリアーキテクチャ、分散システムの進歩が新しいAIモデルの世代をどのように可能にしているかを調査しています。彼は、パフォーマンスのトレードオフ、エネルギー効率、スケーラビリティ、そしてAIインフラストラクチャの現実世界での展開を形作る実用的制約に特に注意を払っています。
テオ・ナッシュによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって技術的正確性、明確性、そして急速に進化しているAIコンピューティング景観の責任ある報道を確保するためにレビューされています。