ソートリーダー

次のAIインフラストラクチャの段階では、ハイパースケールデータセンターだけでは十分ではない

mm
Unite.AI を Google の優先ソースに追加

人工知能は、インフラストラクチャ戦略がモデル能力と切り離せない時代に入っています。数年間、ハイパースケールデータセンターは大規模なトレーニングの台頭を支え、最先端のモデルを数百万から数兆のパラメータに成長させることができました。しかし、企業、業界、リアルタイムシステム全体でAIの採用が進むにつれて、推論がトレーニングに代わって主なワークロードになっている、そして推論には根本的に異なる要件があります。

次のAI時代は、ハイパースケール施設だけで支えられません。代わりに、トレーニングの集中キャンパスと推論の分散型、電力に合った商業規模のデータセンターが組み合わさるハイブリッドモデルが登場しています。この変化は、待ち時間の制約、データ主権の必要性、エネルギーの現実、そしてハイパースケール拡張の物理的な限界によって推進されています。

トレーニングと推論の分岐

トレーニングはまだ集中型の活動です。それには大量のクラスター、高速のデータパイプライン、そして長時間のジョブが必要であり、経済的な利益を得るためにスケールの経済が役立ちます。ハイパースケールキャンパスは、密なコンピューティング、特殊なネットワークファブリック、そしてグローバルな可用性で最適化されています。しかし、推論は異なります。推論は短時間で大量のデータを処理し、待ち時間に敏感で、地理的または企業の境界に結び付けられることがよくあります。Akamaiのエージェントシステムに関する最近の研究によると、ほとんどの組織は、重要なAIユースケースのエンドツーエンドの待ち時間を500ミリ秒未満に抑えることを目標としています。マルチエージェントワークフローは、ネットワークの遅延とCPUの実行によってしばしばそのしきい値を超えています。

待ち時間は抽象的な指標ではありません。ロボティクスと自律システムでは、制御ループは1〜10ミリ秒ごとに100〜1000ヘルツで実行されます。オフボードの知能はそれらのタイミング制約を尊重する必要があります。遠隔のデータセンターへの50ミリ秒のラウンドトリップは、制御レジームを完全に破壊します。金融取引や不正検出では、ミリ秒が経済的な結果を決定します。産業自動化では、推論の遅延はプロセスを不安定にしたり、安全性を損なう可能性があります。インタラクティブな体験 seperti ゲーム、AR / VR、リアルタイムコパイロットでは、100〜150ミリ秒を超えると応答性が低下します。

現代のAIシステムは、多くの順次的な呼び出しの連なりであるマルチエージェントワークフローに依存することが増えています。Akamaiの分析によると、CPU側の実行が合計待ち時間の多くを占めることがあり、ネットワークのラウンドトリップごとに追加の遅延が発生します。50の順次呼び出しのあるワークフローは、遠隔のハイパースケールリージョンにルーティングされると、数秒の輸送待ち時間が発生します。そのワークフローを同じキャンパスまたはメトロエリアにあるハイパーローカルデータセンターに配置すると、物理学が変わります。ローカルの推論は1〜5ミリ秒のラウンドトリップ待ち時間を提供できます。遠隔リージョンでは数秒かかる50ステップのワークフローは、50〜250ミリ秒で完了し、企業の待ち時間予算内に収まります。

データ主権とグリッドの現実がローカル展開を推進

待ち時間は物語の1つだけです。ヘルスケア、金融、公共セクターなどの規制対象業界では、データ主権がローカルの推論の主な推進力です。企業のファイアウォールの背後でAIワークロードを実行すると、既存のセキュリティ周辺を維持し、多テナントの露出を減らし、コンプライアンスを簡素化し、機密データを共有クラウドインフラストラクチャから除外できます。ハイパースケールプロバイダーは強力なセキュリティを提供しますが、攻撃面と信頼チェーンは本質的に広くなります。企業は、既存のセキュリティポストに合った推論アーキテクチャをより好みます。

待ち時間とセキュリティに関する懸念に加えて、電力の可用性は同等の重要な制約になりつつあります。ハイパースケールキャンパスは、伝送制約やインターコネクションキューにより、多年にわたる遅延に直面することがよくあります。特に既存の負荷や分散型発電に近い場所に配置された小規模な商業用データセンターは、はるかに迅速にエネルギーを供給できます。これは重要です。AIの需要は、奇妙なパラドックスと衝突しています。

オペレーターが新しいグリッド接続を確保するのに苦労しているのと同時に、大量の再生可能エネルギーが制限されています。世界では、再生可能エネルギーの制限は年間200テラワット時を超えています。アメリカでは、制限は約20テラワット時と推定されています。ERCOTだけが、最近の1年間に9テラワット時の風力と太陽光発電を制限しました。CAISOは2024年に3.4テラワット時の太陽光と風力を廃棄しました。太陽光はすべてのクリップされた出力の93%を占めました。エネルギーシステムの調査によると、太陽光と風力は、グリッドの容量を超える生成時に大きな制限に直面することがわかりました。太陽光の制限は、特に真昼のピークが強い地域で一般的です。一方、風力の制限は、非ピーク時間や制約されたコリドーで発生することがあります。発電に近い場所に配置された分散型データセンター、特に太陽光が豊富な地域では、取り残されたエネルギーを有用な推論能力に変えることができます。

ハイパースケールキャンパスはトレーニングに不可欠ですが、物理的および経済的な限界に直面しています。送電グリッドへの接続は、新しい変電所、送電アップグレード、複数の機関による許可、コミュニティのレビューが必要なため、通常数年かかります。ハイパースケール施設には、大きな土地、多くの水、複雑な環境許可が必要です。コミュニティは、騒音、水の使用、土地への影響により、新しいデータセンターの開発に抵抗しています。また、集中キャンパスはリスクを集中させ、天候のイベント、グリッドの停電、または地政学的混乱により、世界的なコンピューティング能力の多くが影響を受ける可能性があります。分散アーキテクチャは、地理的冗長性と運用の回復力を提供します。

未来はマルチティアAIアーキテクチャ

推論コンピューティングが無邪気に実行されることを保証する場合、効率は生の容量と同等の重要性を持つようになります。推論はエネルギーを継続的に消費し、業界の分析家によると、推論は最終的にAI関連のエネルギー消費の多くを占める可能性があります。ローカルな再生可能エネルギー統合、伝送損失の削減、適切な展開、改善された熱特性、利用率の向上による効率の向上は、持続可能な方法で世界的なAI需要を満たすために不可欠になります。分散型の商業用データセンターは、これらの効率の向上を提供するために適しています。エネルギーが豊富にあり、安価で、または未使用である場所に配置できます。

次のAIインフラストラクチャの段階は、ハイパースケールキャンパスがトレーニングを支配し、分散型の商業用データセンターが推論を提供し、エッジデバイスが超ローカルなワークロードを提供するハイブリッドミックスになります。このマルチティアアーキテクチャは、電力、待ち時間、セキュリティ、スケールの物理的な現実を反映しています。AIが各業界のリアルタイムシステムに埋め込まれるにつれて、インフラストラクチャは推論をサービングする世界に近づけるために進化する必要があります。

ジェフ・スラマン博士は、130以上の特許に名前が記載された発明家であり、6つの会社を設立して退社しています。LT350の創設者兼CEOとして、彼は、分散コンピューティングアーキテクチャと次世代のデータセンター設計に焦点を当てた医師起業家であり、AIインフラストラクチャ戦略家です。その設計は、既存のインフラストラクチャを活用してデータセンターの影響を最小限に抑えることを目的としています。