ソートリーダー

より速いAIの秘密は、より多くのGPUではなく、賢いネットワーキングにある

mm
Unite.AI を Google の優先ソースに追加

AIは、ヘルスケア、金融、製造、小売業など、様々な業界で何が可能かを再定義しています。しかし、多大な潜在性を持つ一方で、巨大なインフラストラクチャの需要も生み出しています。

世界中の組織は、AIのトレーニングと推論を加速するために、前例のない規模でGPUに投資しています。2028年までに、ガートナーは予測により、ジェネレーティブAIのIT支出が1兆ドルを超えることを予測しています。Hyperion Researchは予測により、HPC市場の支出が同期間に100億ドルを超えることを予測しています。しかし、最先端のアクセラレータに投資しているにもかかわらず、多くのCIOは、GPUの利用率が35%以下に低迷していることを確認しています。これにより、パフォーマンスが低下し、エネルギーが無駄になり、コストが増大します。

多くのAIプロジェクトは、GPUやコンピューティングパワーが不足しているのではなく、ネットワークが追いつかないため停滞しています。そこで、スケールでのAI設計に対する新しいアプローチが必要です。

ネットワークボトルネックの隠れたコスト

ネットワークがデータを十分に速く提供できない場合、組織は以下のような重大な影響を経験します:

  • データ転送のボトルネックにより、GPUとCPUが未使用になる:GPUは大量の並列計算を実行するように設計されていますが、データが提供される速度に応じてのみ処理できます。ネットワークファブリックが追いつかない場合、GPUはデータを待っている間アイドル状態になります。CPUもタスクの調整とデータの移動を担当しているため、低利用率になります。
  • 非効率的なネットワークによる推論パフォーマンスの不一致:ネットワークの非効率性により、データフローが不均一になり、GPUがフルスピードとアイドル状態の間で揺れ動きます。これにより、AIアプリケーションを生産環境で使用できないほど、推論パフォーマンスが予測不能になります。
  • ネットワークのボトルネックにより、トレーニングサイクルが長くなる:AIモデルをトレーニングするには、巨大なデータセットをサーバー、GPU、ストレージ間で移動する必要があります。ネットワークのボトルネックにより、このプロセスが遅くなり、GPUはトレーニングではなく待機に費やす時間が増えます。これにより、製品の開発と展開のスケジュールが直接遅れます。
  • 電力と運用コストの増加:GPUと周辺のインフラストラクチャは、アイドル状態でも大量の電力を消費します。ネットワークの非効率性により、GPUが未使用になる場合、組織は高電力消費に対して比例しないパフォーマンスを得ることになります。運用コストも増加します。施設はピーク電力と冷却負荷をサポートする必要があるため、コンピューティングのスループットが人為的に制限されます。

企業は、より多くのGPUに投資し続けることができますが、適切なネットワークの強化がない場合、ボトルネックと非効率性は悪化します。

ネットワークとしてのアクセラレータ:パラダイムシフト

解決策は、ネットワークアーキテクチャを根本的に再考することです。「ネットワークとしてのアクセラレータ」のモデルは、HPCとAIのパフォーマンスについての従来の考え方を覆し、新しい機能を解放します。

GPUとCPUに追加のコンピューティングを加えることに主に焦点を当てるのではなく、「ネットワークとしてのアクセラレータ」のアプローチは、インターコネクトファブリックをパフォーマンスの乗数として扱います。結果として、ネットワークは高密度コンピューティングをよりよくサポートし、ボトルネックを排除し、コンピューティングの需要に応じてスケーリングし、ハードウェア投資を適切にサイズ設定することで、ROIを加速することができます。スローダウンなしでより大きなワークロードを実行し、結果を早く取得し、余分なハードウェアへの投資を避けることができます。

ネットワークとしてのアクセラレータモデルがどのように機能するか

このモデルはどのように機能し、組織がネットワークをパッシブなデータムーバーからアクティブなコンピューティングエナブラーに変換し、利点を実現し始めることができるのでしょうか? 伝統的なネットワークが欠けている4つの重要な機能を提供します:

  • ハードウェアレベルでの保証付きの配信:伝統的なネットワークは、パケットの追跡、再送信、再配置のオーバーヘッドをCPUとGPUに負担します。これにより、トレーニングまたは推論に使用できるコンピューティングサイクルが消費されます。ハードウェアレベルでの保証付きの配信を提供するネットワークファブリックにより、これらのタスクはコンピューティングノードから外部にシフトされ、CPUとGPUのオーバーヘッドが削減され、パフォーマンスが予測可能かつ一貫性があり、プログラミングとクラスタオーケストレーションが簡素化されます。
  • インテリジェントなダイナミックルーティング:従来のルーティングは、固定または最適化されていないパスに依存し、ネットワークの一部が未使用になるか、同時に大量のデータが流れる場所でボトルネックが発生する可能性があります。インテリジェントなルーティングは、すべての利用可能なパスを動的に活用してトラフィックフローを最適化します。複数のアクティブルートを使用してトラフィックをバランスさせ、最適なパス選択により待ち時間が短縮され、リンクまたはノードの障害の周りにネットワークトラフィックが自動的にルーティングされることで回復性が向上します。これにより、アイドル時間が短縮され、GPUがデータで完全に供給されます。
  • リンクレベルでの自動再送信:パケットが失われたり破損したりした場合、標準ネットワークはコンピューティングレイヤーに依存してこれらを検出して再送信しますが、これにより大きな待ち時間が発生し、コンピューティングフローが中断されます。ネットワーク自体に組み込まれたリンクレベルでの自動再送信機能を備えたファブリックにより、再送信がネットワーク内で処理され、コンピューティングノードに対するパケット損失がほぼ透過的に見え、待ち時間への影響が軽減され、ローカルでリンクレベルで再送信が行われるため、ネットワークスタック全体をまたがないためです。また、複雑なアプリケーションレベルのエラーハンドリングの必要性も排除されます。自動再送信機能により、効率的な分散コンピューティングが中断されずに実行され、数千のGPUにわたるスケーリングで重要になります。
  • ネットワーク内でのコンピューティング:従来のネットワークファブリックは主にデータを移動しますが、ネットワーク内でのコンピューティングにより、ネットワークがコプロセッサとして機能し、特定の操作をネットワーク自体内で実行できます。NVIDIA SHARPはその一例であり、ネットワークスイッチ自体で減算を実行できるようにします。これにより、分散操作が加速され、データがネットワークを通過するにつれて集約されるため待ち時間が短縮され、コンピューティングノードが集約タスクから解放され、トレーニングとシミュレーションにサイクルをより多く割り当てることができるため、効率が向上します。

これらの機能をすべて合わせると、「ネットワーク主導のコンピューティング」が次世代のAIとHPC環境をスケールするための基盤となります。ネットワーク中心のアプローチにより、データの飢餓を排除するGPUの利用率の向上、トレーニングサイクルと推論パフォーマンスの安定化によりインサイトまでの時間が短縮される、リソース効率の改善、所有コストの削減など、有形なリターンがもたらされます。

真のネットワークパワーを発見する

スケールでのAIは、コンピューティングの問題だけでなく、システムレベルのエンジニアリング課題であり、ネットワークが中心にあります。ネットワークをアクセラレータとして扱うことで、コンピューティングの乗数となり、HPCとAIデータセンターが密度を上げるにつれてパフォーマンスを犠牲にすることなくスケールできます。ボトルネックを排除し、利用率を向上させ、予測可能なパフォーマンスを提供することで、既存のインフラストラクチャから最大の価値を早期に抽出することができます。

ボトルネックを排除し、利用率を向上させ、予測可能なパフォーマンスを提供することで、賢いネットワーキングにより、AIチームの生産性が向上し、GPUインフラストラクチャへのROIが改善され、インサイト、イノベーション、市場リーダーシップへの時間が短縮されます。組織は、ネットワークが本当に何ができるかを発見し、AIの力を新しい方法で活用できるようになります。

ニシャント・ローダは、コーネリス・ネットワークスのAIネットワーキングのシニアディレクターです。コーネリスに入社する前は、インテル株式会社とマーベルでディレクター級の役職を歴任しました。データセンターのネットワーキング、ストレージ、コンピューティング技術に関する25年以上の経験を持っており、製品マーケティング、ソリューションおよびテクニカルマーケティング、ネットワークエンジニアなどの役割を務めてきました。シリコンバレーを拠点としています。