ソートリーダー

GPU中心にAIインフラを設計するのはやめよう

mm
Unite.AI を Google の優先ソースに追加

MSPはハードウェアではなくワークロードから始めるべき理由

AIカンファレンスでたった5分過ごすだけで、すべての成功したAI導入はGPUをもっと購入することから始まると信じてしまいがちです。これは理解しやすいことです。ハードウェアが会話の中心にあります。顧客はBlackwellシステム、InfiniBandファブリック、ハイパースケールクラウド、そしてますます巨大化するAIクラスターについて耳にします。ベンダーは新しいアクセラレータや高速システムに自然と引き寄せられます。これらは刺激的で、関連性が高く、市場に出しやすいからです。

問題は、計算リソースが重要でないということではありません。計算は非常に重要です。

問題は、そこから始めると組織が間違った質問をしてしまうことです。AI市場はもはや実験段階ではありません。AIは本番環境に導入され、企業は実際の資金を投入し、測定可能なビジネス成果を期待しています。インフラの決定は、2年前に比べてはるかに重要になっています。しかし、十分にビジネス要件に基づいて決定が行われているとは言えず、技術主導の決定が依然として主流です。

最初に問うべき質問は「どのGPUを買うべきか?」ではありません。

「どのワークロードを支援するのか?」が焦点になるべきです。

このささいに見える変化が、以降のほぼすべてのインフラ決定に影響を与えます。

標準的なAIインフラは存在しない

市場で最大の誤解のひとつは、AIインフラに標準的な設計図があるということです。実際にはありません。

私たちはAIを単一のワークロードのように語りますが、実際にはAIは非常に幅広いビジネスアプリケーションを包含し、要求は大きく異なります。音声AIプラットフォームは医療画像処理と同じインフラ要件を持ちません。ナレッジリトリーバルは画像生成と異なります。詐欺検出は予測分析とは形が違い、動画処理とも似ていません。すべてがAIを利用していますが、インフラの使い方が異なるだけです。

「AI」のためにインフラを設計しているわけではなく、AIを利用するビジネスアプリケーションのためにインフラを設計しているのです。この区別は重要です。各ワークロードはインフラに対して固有の要求を課します。あるものは大量の計算リソースを必要とし、あるものは大規模データセットを継続的に取得するためストレージ性能に依存します。ネットワークスループットに制約があるものや、レイテンシが顧客体験に直結するものもあります。

実務上の現実もあります。モデルが設計されたインフラが、実際に導入する時に利用可能であるとは限りません。ハードウェアの入手状況や長いリードタイム、導入期限により、当初計画したGPUやアクセラレータ、インフラ構成と異なるものを使用せざるを得ないことがあります。その場合、モデルの再最適化や、実際に展開できるハードウェアに合わせた再設計が必要になることもあります。

セキュリティとガバナンスの要件もワークロード固有です。公開情報を処理するアプリケーションと、金融取引、医療記録、または機密知的財産を扱うアプリケーションでは要求が大きく異なります。データ保護、ID・アクセス管理、コンプライアンス、主権、バックアップ、リカバリ、可用性は、導入後に付け足すことができるものではなく、設計段階で決めるべき事項です。

ビジネス要件も別の層を加えます。アプリケーションはどれだけ速くスケールする必要があるか?持続可能な運用コストはどれくらいか?求められる可用性レベルは?組織が現実的に管理できる複雑性はどれほどか?これらの質問への答えは顧客ごとに異なります。したがって、すべての顧客に当てはまる「ワンサイズフィットオール」のAIインフラは存在しません。

好みのクラウド、ハードウェアプラットフォーム、ベンダーから始める組織は、AIインフラを正しく設計できていません。リーダーはワークロードから出発し、ビジネス目標に合わせたアーキテクチャを設計しています。

トレーニングが見出しを飾り、インファレンスがビジネス価値を提供する

業界がトレーニングに執着することも、AIインフラの議論が誤った方向に向かう原因のひとつです。

大規模言語モデルのトレーニングは並外れたエンジニアリング課題です。膨大なデータセット、巨大なGPUクラスター、莫大な電力、そして数日・数週間・場合によっては数か月にわたってフル稼働できるインフラが必要です。コストがかかり、技術的に印象的であるため、自然と注目を集めます。

しかし、多くの組織は次世代のフロンティアモデルを構築しているわけではありません。すでにトレーニング済みのモデルを活用し、カスタマーサービスアプリ、音声AIシステム、従業員コパイロット、ナレッジアシスタント、検索ツール、文書要約プラットフォーム、詐欺検出システムなど、実務的なアプリケーションを構築しています。

これらはインファレンスワークロードであり、インファレンスはインフラの方程式を変えます。最大計算性能だけに最適化するのではなく、高速な応答時間、低レイテンシ、予測可能な運用コスト、一貫したパフォーマンスを最適化する必要があります。

チャットボットの応答に5秒かかるだけで、顧客はGPUの性能がどれほど高くても気にしません。音声アシスタントがリクエストを頻繁に誤解したり、会話中に躊躇したりすれば、呼び出し元はAIクラスターの仕様に関心を持ちません。彼らが感じているのは「アプリケーションのパフォーマンスが悪い」ということだけです。

したがって、すべてのAI環境を基礎モデルのトレーニング用に設計することは、ほとんどの場合誤ったアプローチであり、過剰にコストがかかります。

多くのMSP顧客の目的は、世界最大のGPUクラスターを構築することではありません。AIアプリケーションを迅速かつ信頼性・安全・経済的に本番環境へ導入することが目標です。

課題は、実際に稼働させているワークロードに対して、パフォーマンス、セキュリティ、スケーラビリティ、レジリエンス、コストのバランスを取ることです。

GPUがボトルネックでない可能性もある

GPUはAIインフラの有名人です。高価で入手が難しく、比較しやすいことから、数多くのインフラ議論の中心になっています。しかし、AIアプリケーションが本番に達したときに、ボトルネックになるのは必ずしもGPUではありません。

「何枚のGPUが必要か?」という質問ではなく、「6か月後にこのアプリケーションの速度を遅くする要因は何か?」を問うべきです。

答えはアーキテクチャの他の部分にあるかもしれません。

ストレージは好例です。AIワークロードは膨大なデータを消費し、データセットは時間とともに増大します。たとえ非常に強力なGPUでも、ストレージが情報を十分に速く提供できなければ、計算が待機状態になることがあります。また、そのデータはライフサイクル全体で保護、バックアップ、保持、セキュリティ、管理が必要です。

ネットワークも同様に重要です。スループット、レイテンシ、東西トラフィック、AIクラスター間の通信はすべてアプリケーションのパフォーマンスに影響します。設計が不十分なネットワークを、優れたコンピュート環境だけで永続的に補うことはできません。

さらに、セキュリティは最初からアーキテクチャに組み込む必要があります。製品化前に回答すべき質問は、機密データの所在、ネットワークの分割方法、プライベートまたはパブリック接続でワークロードが通信するか、コンプライアンスや主権要件への対応方法です。

見落としがちなのは接続性です。派手な見出しは出さないものの、ファイバーダイバーシティ、ルートダイバーシティ、ピアリング関係、地理的近接性はユーザー体験に決定的に影響し、プラットフォームのレジリエンスにも関わります。

エンドユーザーはラックにどのGPUが搭載されているかは知らず、気にもしません。彼らが関心を持つのは、アプリケーションが即座に応答するか、待たされるかです。

物理インフラも無視できません。電源供給、冷却容量、ラック密度、拡張性は今日の成功した導入が明日の成長に対応できるかどうかを判断する要素です。

さらにデータ重力があります。データセットが拡大するにつれ、計算リソースが別の場所にあるだけでペタバイト単位のデータを移動させるのは非効率になります。多くの場合、計算をデータに近づける方が実用的でコストも抑えられます。

これがアーキテクチャが重要である理由です。

レースカーを例に考えてみましょう――最高のエンジンを搭載しているからといって必ず勝つわけではありません。トランスミッション、タイヤ、サスペンション、コース、そして何よりドライバーが重要です。AIインフラも同様です。

AIから最大の価値を引き出す組織は、必ずしも最大のGPUクラスターを持つわけではありません。インフラのすべての層がどのように連携するかを理解している企業になるでしょう

これは、インフラを購入することと設計することの違いです。

ワークロード優先の計画フレームワーク

MSPにはインフラ議論を変えるチャンスがあります。

以下のように始めるのではなく:

  • どのGPUか?
  • どのクラウドか?
  • どのベンダーか?

ワークロードから始めましょう:

  • 解決すべきビジネス課題は何か?
  • トレーニングワークロードかインファレンスワークロードか?
  • アプリケーションが許容できるレイテンシはどれくらいか?
  • データはどこにあり、どれくらい速く増加するか?
  • 適用されるセキュリティ、コンプライアンス、主権要件は何か?
  • ワークロードはどのようにスケールするか?
  • ビジネスが要求する可用性レベルはどれか?
  • 許容できる運用リスクのレベルはどれか?
  • 使用量が増加したときの運用コストはどれくらいか?

答えがアーキテクチャを決定すべきであり、逆ではありません。

MSPにとっての機会

このシフトはMSPの役割を変えます。

顧客はインフラを販売できる別のパートナーを必要としているわけではありません。より良いインフラ決定を支援できるパートナーが求められています。

ワークロード優先のアプローチは必須です。これにより、MSPはコンピュート、ストレージ、ネットワーク、接続性、セキュリティ、データ所在地、可用性、コストを単一のアーキテクチャの一部として評価でき、個別の購買決定に分割する必要がなくなります。

この方法で、コストを管理し、パフォーマンスを向上させ、アプリケーションが本番に達する前に運用上およびセキュリティ上のリスクを特定できます。

MSPにとっても、より価値の高い継続的サービスモデルが構築できます。アーキテクチャ、デプロイ、最適化、セキュリティ、ライフサイクル管理、容量計画、継続的改善といった領域でのサービス提供にシフトし、ハードウェアマージンの縮小競争から抜け出すことができます。

価値は最新のGPUや新しいクラウドプラットフォームを推奨することにあるのではなく、顧客がそれらを必要とする時、必要としない時、そしてそれらを取り巻く設計が何であるかを知っていることにあります。

AIインフラは最終的にハードウェアの決定ではありません。ワークロード、データ、そして顧客が達成しようとするビジネス成果に基づくアーキテクチャの決定です。

この区別を理解しているMSPは、単なるインフラ供給者以上に価値の高い存在になるでしょう。

顧客が実際に必要とするインフラを決定する手助けを信頼できるパートナーとして、彼らの信頼を得ることになるのです。

Richard CopelandはLeaseweb USAの最高経営責任者です。彼は米国内の9つのデータセンター拠点にわたる同社の事業を管理し、地域におけるビジョンと戦略の実行・策定を担当しています。20年以上にわたり、RichardはLeaseweb USAおよびVerizon Businessで主要な営業リーダーシップとアカウントマネジメントの役割を務めてきました。Richardはバージニア・コモンウェルス大学で理学士号を取得しています。彼はチームと協力して会社の目標を達成し、従業員のワークライフバランスを維持し、顧客満足を確保することに情熱を注いでいます。余暇には、運動や映画・スポーツ観賞、家族や友人との時間を楽しんでいます。