インタビュー

ケン・クラフィー、VDURAのCEO – インタビュー・シリーズ:再訪の対話

mm
Unite.AI を Google の優先ソースに追加

ケン・クラフィー、VDURAのCEO兼社長は、クラウドとエンタープライズインフラストラクチャ、ハードウェアとソフトウェアの開発、戦略的成長を牽引するカスタマーセントリックなビジネスと製品のリーダーです。彼のキャリアを通じて、ハイパフォーマンスのグローバルチームを構築してリードし、企業戦略を実行し、収益性のある収入成長と製品イノベーションを牽引し、低調なビジネスを立て直してきました。VDURAの指揮をとる前に、クラフィーはシーゲイト・テクノロジーでシニアリーダーシップの役割を担い、エンタープライズシステムとP&Lを担当するSVP兼ゼネラルマネージャーを務め、さらにXyratex、Adaptec、Eurologicでのリーダーシップの役割を務め、エンタープライズストレージとハイパフォーマンスコンピューティングで数十年の経験を持っています。

(STX )

VDURAは、ソフトウェア定義のデータインフラストラクチャ企業で、モダンなストレージソリューションを開発し、人工知能とハイパフォーマンスコンピューティングワークロードに最適化しています。同社のフラグシップ製品であるVDURA Data Platformは、フラッシュファーストの並列ファイルシステムのパフォーマンスとオブジェクトストレージの耐久性を統合したアーキテクチャで、数千のクライアントとノードにわたって線形にスケールし、運用を簡素化し、総所有コストを削減します。もともとPanasasとして設立され、2024年にブランド名を変更したVDURAのプラットフォームは、オンプレミス、クラウド、ハイブリッド環境をサポートし、先進的な自動化、メタデータの高速化、スケーラブルなパフォーマンスを提供し、エンタープライズ、研究、ミッションクリティカルなAIとHPCのユースケースでGPUクラスターを供給し、データを保護します。

あなたのHPCとエンタープライズストレージのキャリアは、ストレージがAIインフラストラクチャの決定的な制約になるというあなたの見方をどのように形作ってきたのか。

世界で最も要求の厳しいコンピューティング環境のストレージシステムを構築することで、ボトルネックが実際にどこにあるのか、どこにあると思っているのかを直感的に理解するようになります。XyratexとシーゲイトでのClusterStorの仕事を通じて、スーパーコンピューターのストレージの問題を解決していました。そこでは物理学が容赦しません。コンピューティングを供給するか、供給しないかのどちらかです。

現在、AIインフラストラクチャで見ているのは、同じ根本的な制約ですが、経済的な側面が異なります。Neocloud市場でのGPUへの熱狂は理解できます。NVIDIA (NVDA ) は希少で変革的なリソースを作りました。しかし、ストレージが簡単にスケールするという仮定は、いつか破綻することになりました。破綻しています。ストレージは、オールフラッシュの展開では、AIインフラストラクチャの予算の20〜30パーセントに急成長し、他のコンポーネントよりも速く成長しています。大規模なコンピューティング環境でキャリアを積むと、ストレージが常にボトルネックになるという現実に気付くようになります。

Neocloudインフラストラクチャの土地勘定の際に、ストレージの計画が優先されなかったのはなぜですか。

いくつかの構造的な仮定が、ちょうど悪いタイミングで一致しました。まず、フラッシュの価格が一時的に好調でした。NVMe SSDは、手頃な価格で豊富にあり、オールフラッシュにすると妥当なデフォルトのように思えました。ただし、これはアーキテクチャーの知恵ではなく、暂定的経済的ウィンドウの産物でした。このウィンドウは、オペレーターが恒久的な条件と勘違いしていました。

2つ目は、競争のダイナミクスがGPUの数よりも他のすべてを優先していました。Neocloud市場は、ラックス内のNVIDIAチップの数で評価されていました。ストレージは、約10パーセントの行項目でした。手続きを簡単に通過することができました。3つ目は、オールフラッシュの決定は複雑さを排除するため、安全に感じられました。1つの階層、1つのメディアタイプ、調達と運用が簡単でした。問題は、「簡単」なことと「経済的に持続可能」なことが、NANDの供給が逼迫し、価格が急騰したときに同じものではなくなったことです。そのときには、すでにインフラストラクチャの決定は既に固定されていました。

オペレーターがストレージがGPUの活用に与える影響を確認したときに、どれが最も驚かされることですか。

関係は、多くのオペレーターがアイドル状態のGPUを見ているまで直感的にわかりません。頻繁なチェックポイントの作成によるバースト書き込みの要求は、ストレージレイヤーがそれらを十分に吸収できない場合、コンピューティングを停止させる可能性があります。前処理とインジェストのためのデータパイプラインは、コンピューティングを餌にするために、持続的な読み取りスループットの要件を生み出します。これらが満たされない場合、GPUは仕事を奪われます。

NVIDIAのDGXガイダンスは、テキストベースのLLMトレーニングには約0.5 GB/sの読み取りスループットが必要であることを示していますが、物理的なAIと視覚化のワークロードには、GPUごとに約4 GB/sの読み取りと2 GB/sの書き込みが必要です。ストレージアーキテクチャがそれを提供できない場合、GPUは容量で動作していません。ストレージが許可する分数で動作しています。

アーキテクチャーはクラスタースケールで非常に重要です。ドライブとクライアントの間に中間者を配置するストレージシステムは、単一のドライブで同等のヘッドラインスループットを示す可能性がありますが、スケールでは、GPUフリートを飽和させるために3倍のドライブが必要になる可能性があります。3倍のSSD、3倍の電力、3倍のラックスペース。利用率の数学は急速に複雑になります。

ヘッドラインスループットのメトリクスが類似している場合でも、SSDの選択とアーキテクチャーの設計によって生じる可能性のあるコスト差は何ですか。

これは、オペレーターが深刻な問題に陥る場所です。ヘッドラインの数字は、実際に欺瞞的です。代表的な例を取ります。122.88 TBのQLC NVMe SSDのコストは約27,000ドルです。同じ世代の7.68 TBのドライブは、約1,800ドルで同等のシーケンシャルスループットを提供します。NVIDIAのEnhanced仕様の4,096 GPUクラスターの場合、この1つの容量選択の決定は、60万ドルから960万ドルのフラッシュ請求書を生み出します。スループットは実質的に同等ですが、変数は、どれだけの冷たいデータをプレミアムメディアに駐車するかです。

さらに、アーキテクチャーの設計はクラスタースケールでのドライブ数を決定します。約5.8 GB/sの測定読み取りスループットを提供するアーキテクチャーでは、4,096 GPUクラスターを飽和させるために約353のドライブが必要です。約1.9 GB/s/SSDを提供するアーキテクチャーでは、中間者オーバーヘッドにより、1,000を超えるドライブが必要になります。30 TBのドライブあたり12,000ドルの場合、この違いは丸め誤差ではありません。ビジネスモデルの質問です。

オペレーターは、フラッシュの価格が上昇し、NANDの供給が逼迫している状況で、オールフラッシュと階層化ストレージをどのように再考するべきですか。

出発点は、オールフラッシュAIインフラストラクチャーの背後にある経済的前提が、常在的なものではなく、偶発的なものであったことを受け入れることです。PhisonのCEOは、NANDの生産能力が2026年までに実質的に割り当てられていると述べています。ゴールドマンサックスは、同じ期間中にDRAMの価格が四半期ごとに二桁の増加を予測しています。オールフラッシュのデフォルトは、フラッシュが安価で豊富にあったときに意味がありました。現在はそうではありません。

(GS )

正しいフレームワークは、フラッシュが実際に何のためにあるかを問うことです。フラッシュはパフォーマンスメディアです。GPUのスループット要件を飽和させるためにのみサイズ設定する必要があります。残り、チェックポイント、読み取りが活発にされていないチェックポイント、アーカイブされたトレーニングセットなどは、高密度HDDに属します。これは、テラバイトあたりではるかに安価です。

オペレーターが陥る罠は、階層化をボルトオンとして扱うことです。オールフラッシュのプライマリーレイヤーを購入し、冷たいデータ用のオブジェクトストアを追加し、外部データムーバーでそれらを接続します。これにより、2番目のソフトウェアスタック、2番目のデータプレーン、ネットワークの複雑さ、運用のオーバーヘッドが導入されます。ハイパースケーラーのアプローチでは、同じソフトウェアスタック内でSSDとHDDを実行し、ネイティブのハイパフォーマンス階層化と外部データムーバーなしで、ストレージを10パーセントのインフラストラクチャ予算に保ちながら、GPUを飽和させます。

Neocloud層は、ハイパースケーラーのストレージ設計の選択からどのような教訓を得ることができますか。

最も重要な教訓は、Google (GOOGL ) 、Meta、Microsoft (MSFT ) がオールフラッシュではありませんが、AIワークロードの経験は誰よりも豊富であるということです。彼らは、GPUのスループットを飽和させるのに十分なNVMeフラッシュと、高密度HDDへの速やかな排水を組み合わせた、混合階層アーキテクチャーを展開しています。これは哲学的な好みではありません。経済的必然性によって推進されています。AIワークロードの物理学を明確に理解しているからです。

2番目の教訓は、アーキテクチャーの統合です。ハイパースケーラーは、階層化を別々のシステムを組み合わせて解決しません。同じソフトウェアスタック、同じデータプレーンでSSDとHDDを実行し、階層化はストレージシステム内で第一級の操作として、別のツールで管理されるバッチジョブではありません。この統合が、パフォーマンス保証を維持しながら、巨大なスケールでストレージを経済的に維持できることを可能にします。

3番目の教訓は、耐久性の保証です。AWS S3は11の9の耐久性を提供し、Azure Blobは12以上の耐久性を提供します。スケールでのローカルRAIDに基づくレガシーハイパフォーマンスコンピューティングストレージは、ドライブ障害率とリビルドウィンドウに応じて5の9を下回る可能性があり、1億ファイルのコーパス全体で年間数千のファイルが失われる可能性があります。ネットワーク消去符号化によるマルチレベル保護は、11の9を超えることができます。これらの2つの現実のギャップは、SLAを裏付けることができるストレージシステムとできないストレージシステムの違いです。

インフラストラクチャチームは、GPUフリートに対するストレージの可用性の経済的影響をどのように量化するべきですか。

数値を正直に実行すると、結果は厳しいものになります。共有ストレージの障害は、比例したSLAの短落を生み出すのではなく、接続されたすべてのGPUラックス全体にわたって同時にSLAの違反を生み出します。5,000 GPUクラスターで98パーセントのストレージ可用性があると、876,000 GPU時間の喪失コンピューティングが年間発生します。代表的なGPU時間のコストでは、毎年数百万ドル相当のアイドルコンピューティングに加えて、影響を受けるすべてのラックスに対してSLAクレジットが発生します。

大規模クラスターでのストレージ障害の爆発半径は、クラスター全体です。インフラストラクチャチームは、明示的にこれをモデル化する必要があります。現在のストレージ可用性の数字に基づいて、毎年どれくらいのアイドルコンピューティングのコストが発生するか、どのようなSLAクレジットの義務が各可用性階層に付随するか、SLAの障害からの顧客流失のリスクは何ですか。CoreWeave (CRWV ) とOracle (ORCL ) はすでに99パーセントのラックレベルのアップタイムを提供しています。99パーセントに一致できないプロバイダーは、すでに取引を失っています。そして失われている取引は、Neocloud市場が長期的な経済性を証明するために必要な、高価値のエンタープライズ契約です。

電力制約のある環境では、さまざまなストレージアーキテクチャーは、1ワットあたりのパフォーマンスでどのように比較されますか。

これは、ほとんどの深刻なインフラストラクチャーの会話で出てきます。差は、微小ではありません。約1,340 GB/sの読み取りスループットを提供するに基づいて、1つのアーキテクチャーは55 kWを消費しますが、別のアーキテクチャーは約16 kWで同等の出力を達成します。これは、1ワットあたりのパフォーマンスで3.4倍の差です。AIワークロードがラックスあたり40〜250キロワットを消費するデータセンターでは、無駄になったストレージワットは、展開できないGPUです。NVIDIAのBlueField-4のドキュメントでは、電力の可用性がAIファクトリーのスケーリングの主な制約であると明示的に述べられています。

2次的な効果もありますが、オペレーターはほとんど考慮しません。いくつかのストレージアーキテクチャーでは、GPUノードごとに5 GBのDRAMと1〜4個の専用CPUコアを永久的にロックする必要があります。500ノードのクラスターでは、これは2.5 TBのDRAMと最大2,000個のCPUコアがAIワークロードに利用できないことを意味します。GPUあたり30,000ドル以上を支払っている場合、盗まれたコアとロックされたギガバイトは、コンピューティングへの投資に対する直接的な税金です。

ストレージアーキテクチャーは、99パーセントに近づくアップタイム保証に対するSLAの競争力をどのように直接影響しますか。

ストレージは、GPUクラスターで最も大きな爆発半径です。これは、ストレージが、誠実なSLAコミットメントにおける最も重要な変数であることを意味します。SemiAnalysis ClusterMAX 2.0の評価システムは、Neocloudの調達で影響力を持ち始めています。SLAは価格交渉における明示的な要素です。競争的なSLAを持たないプロバイダーは、すでに取引を失っています。

耐久性の次元も同様に重要ですが、議論は少ないです。エンタープライズ顧客は、AWS S3とAzure Blobから11〜12の9の耐久性を期待するように教育されてきました。スケールでのローカルRAIDに基づくレガシーハイパフォーマンスコンピューティングストレージは、ドライブ障害率とリビルドウィンドウに応じて5の9を下回る可能性があり、1億ファイルのコーパス全体で年間数千のファイルが失われる可能性があります。ネットワーク消去符号化によるマルチレベル保護は、11の9を超えることができます。これらの2つの現実のギャップは、SLAを裏付けることができるストレージシステムとできないストレージシステムの違いです。

Neocloudの長期的な生存を決定する可能性のあるストレージ機能は何ですか。

生き残るオペレーターは、GPUの調達の式だけではなく、インフラストラクチャスタック全体の総所有コストの式を解決したものです。つまり、次の特定の機能が必要です。

最初に、フラッシュとディスクを単一のデータプレーンで実行し、ネイティブのハイパフォーマンス階層化を実現する、統一されたソフトウェア定義アーキテクチャーが必要です。外部データムーバーはありません。2番目のソフトウェアスタックはありません。別々のシステムを組み合わせることで導入される運用の複雑さはありません。2番目に、フラッシュとディスクの独立したコスト曲線に乗るストレージが必要です。市場は、それらが独立して動きます。3番目に、専用の管理者が3時に手動で回復する必要のない、自己回復システムが必要です。運用の複雑さは、スケールで累積する非可視的なコストです。4番目に、ハイパースケーラーのベンチマークに対して信頼性を裏付けることができる耐久性が必要です。

より広い点は、統合の波が、最初の日のベンチマークのために構築されたインフラストラクチャーと、3年目の経済性のために構築されたインフラストラクチャーを分離しているということです。H100のレンタル料金は、ピーク時から60パーセント以上下落しました。市場は、GPUの蓄積を報復するのではなく、投資された資本のリターンを証明することを要求しています。ストレージアーキテクチャーは、GPUの活用率、SLAのコミットメント、電力効率、長期的なコスト構造がすべて集まる場所です。

現在ストレージ戦略を評価しているNeocloudオペレーターに、あなたは何を伝えたいですか。

ストレージの決定を、デフォルトで行った決定としてしないでください。インフラストラクチャスタックの他のすべての部分は、厳格なエンジニアリングと財務の検討を受けます。ストレージも同じです。3年以内にここにいるオペレーターは、実際のコストを計算し、真の可用性の姿勢を理解し、ワークロードにサイズ設定されたオペレーターです。プロキュアメントのショートカットにサイズ設定されたのではありません。

このことを正しく行うための時間枠は狭まりつつあります。統合はすでに進行中であり、経済性は容赦しません。しかし、ストレージレイヤーをGPUの選択と同じ厳格さで再考することに取り組むオペレーターにとって、機会は大きいです。ストレージを正しく行うと、コストが削減されるだけでなく、ラックス内のすべてのGPUの価値が解放されます。

素晴らしいインタビュー、ありがとうございます。読者がこのテクノロジースタックについてさらに詳しく知りたい場合は、VDURAを訪けてください。また、ケン・クラフィーとの前のインタビューも読むことができます。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。