ソートリーダー

AIの最大の制約を競争上の優位性に変えるための5つのステップ

mm
Unite.AI を Google の優先ソースに追加

過去数年間、AIインフラストラクチャは、他のメトリクスよりもコンピュートを優先してきました。より多くのアクセラレータ、より大きなクラスター、より高性能のFLOPSが、GPUを最大限に活用するための会話を推進してきました。このアプローチは、モデル進歩が主にトレーニングスケールに依存していたときには妥当でした。ただし、現在はAIの本番展開が優先されており、新しいボトルネックに焦点を当てる必要があります。つまり、メモリです。

今日、多くの厳しい制約はメモリ容量、帯域幅、待機時間、およびシステムを介してデータを移動する際の時間とエネルギーのコストで発生しています。コンテキストウィンドウは拡大し続けており、アンソロピックなどの企業は、標準価格設定のオファーで100万トークンのウィンドウを提供しています。推論ワークロードは増加しています。マルチエージェントシステムの成長により、AIシステムはステージ間でより大きなデータ量を交換しています。オペレーターは、さらに多くのGPUを追加し続けることができますが、各サーバーはシステム内RAMに限定されているため、アクセラレータを効率的に供給するために十分なRAMが不足しているため、期待されるパフォーマンスに達することができません。

この変化は、スループットとコストの両方に影響します。メモリが制限要因になると、組織は通常、高価なハードウェアを過剰にプロビジョニングし、GPU容量が未使用になり、電力とインフラストラクチャのコストが増加します。AIスケールの次の段階は、生産性を向上させるために、生産AIが実際に実行される方法に合わせてメモリアーキテクチャを構築することに依存することになります。

ここでは、インフラストラクチャのリーダーが、いつまでも増え続けるメモリの需要に備えるために今すぐ取り組める5つのステップを紹介します。

1. 実際のボトルネックを測定することから始める

多くの組織はまだ、コンピュートを優先する視点からAIのパフォーマンスを評価しています。クラスタの使用率、アクセラレータの数、トップラインのスループットを追跡し、改善はさらに多くのGPUアクセラレータを追加することから来ると想定しています。その視点は、実際の問題を見逃すことがよくあります。

メモリの圧力は、停止したアクセラレータ、トークンあたりの待機時間の増加、負荷下でのスループットの低下として現れます。メモリの別の階層、別のサーバー、またはアプリケーションの別のステージからデータが到着するのを待っている場合、GPUは使用率が低いように見えることがあります。推論により、KVキャッシュのサイズが増加し、同時にセッションが増えて帯域幅を競合するため、この問題がより明らかになります。

オペレーターは、メモリの使用状況、トークンあたりの移動バイト、スタール時間、アクセラレータ、CPU、GPU、および隣接するメモリ階層全体のメモリアクセスパターンに関するより良い可視性が必要です。さらに、ネットワークまたはストレージの問題からメモリ関連の遅延を区別できるパイプライントレースが必要です。その可視性がなければ、チームは実際の遅延の原因に対処せずにコンピュートにさらに多くの費用を費やす可能性があります。

2. 容量を追加する前にデータの移動を削減する

大規模なAIシステムでは、データを移動することはデータを処理することと同じくらいのオーバーヘッドを生み出すことがあります。

これは特に推論の場合に当てはまります。コンテキストウィンドウが拡大すると、KVキャッシュはスタックでシステムメモリの最大の消費者になる可能性があります。マルチテナントの提供とマルチエージェントのワークフローを追加すると、さらに多くのデータが移動することになります。最初のステージが出力を生成し、別のステージがそれを消費し、インフラストラクチャがGPU間、サーバー間、またはフレームワークレベルのシリアライゼーションを介して大きなデータブロックをコピーすることでハンドオフを処理します。

そのコピーには実際のコストがかかります。帯域幅を消費し、待機時間を追加し、次の転送が完了するまでに高価なコンピューティングリソースを待たせることになります。また、ワークロードが実際に必要とするよりも多くの高価なメモリを購入するようにオペレーターを促すことにもなります。

さらにアクセラレータを投資する前に、チームはシステム内でデータが不必要に移動している場所を特定する必要があります。GPU間の転送、サーバー間のコピー、エージェントパイプライン全体で中間状態を繰り返し移動することは、開始点として適しています。多くの環境では、不要な移動を削減することで、別のサーバーを追加するよりも多くの実用的なパフォーマンスが得られます。

3. ワークロードの動作に基づいてメモリ階層を構築する

AIインフラストラクチャは、メモリを単一のソースではなく、異なる役割を持つ階層として扱うようになったときに、より効果的に機能します。

最もホットなデータは、アクセラレータに最も近い場所に保持する必要があります。つまり、最も低い待機時間と最高の帯域幅を必要とする作業セットが含まれます。他のアクティブバッファと頻繁にアクセスされる状態は、DRAMに配置できます。スケールよりも絶対的な速度が必要な大きな構造は、プールされたメモリに移動できます。冷たいデータと、サービス品質に影響を与えることなく適度な待機時間のトレードオフを許容できるモデルの場合は、スタックの下の方に配置できます。

このアプローチでは、チームがどのデータが不断に変更されるか、どのデータが多くのプロセスで共有されるか、どのデータがサービス品質に影響を与えることなく適度な待機時間のトレードオフを許容できるかを理解する必要があります。多くの展開では、すべてのものを最も高速なHBM階層にプッシュすることをデフォルトとしています。コストが高くなるため、通常は効率が損なわれます。

階層化されたメモリ戦略により、オペレーターはパフォーマンスと経済性の両方をより制御できます。生産AIでは、このバランスがコアの設計要件となっています。

4. エージェントAIのアーキテクチャの一部として共有メモリを扱う

マルチエージェントAIは、断片化されたメモリ設計のコストを高めています。

多くのエージェントシステムでは、1つのエージェントが別のエージェントがすぐに使用する出力を生成します。3番目のサービスは、その出力をランク付けしたり、コンテキストを追加したり、別のモデルにルーティングしたりすることができます。各ステップで同じ状態の新しいコピーを作成すると、トラフィックが急激に増加します。コンテキストが増加すると、コピーされたデータのサイズも増加します。システムは、データを移動する時間よりもデータを処理する時間を費やします。

ここで、共有メモリが特に重要になります。共有KVキャッシュや複数のエージェント/サービスがアクセスする必要がある他の状態に特に重要です。共有メモリは、冗長なコピーを削減し、ネットワークトラフィックを削減し、アプリケーションパス全体で利用率を向上させることができます。共有メモリを使用すると、エージェントシステムが効率的にスケールできるように、異なるノードまたはエージェントがKVキャッシュを共有メモリで再利用できるようになります。

ハイパースケーラーにとって、これはもはやエッジケースではありません。エージェントAIが成熟するにつれて、共有メモリは効率的な展開の実用的な要件となっています。

5. 生産インフラストラクチャのためにCXLを採用する

業界は、CXLを、成熟する必要があると見なしてきました。CXLはバージョン1から2に急速に移行し、現在は3.xハードウェアが利用可能になり、機能が完成し、後方互換性があり、生産負荷に耐えられるレベルに達しています。

CXLは、メモリの拡張、プール化、共有メモリアーキテクチャの実用的な選択肢として、ハイパースケーラーとデータセンターのオペレーターが考慮すべきレベルに達しています。特に、より柔軟なメモリスケーリングと推論の経済性を必要とする環境では、真剣にインフラストラクチャ計画を検討する必要があります。

これは、すべてのワークロードがCXLベースのメモリに移行する必要があることを意味しません。最もホットで待機時間に敏感なデータには、ローカルメモリが必須のままです。しかし、オペレーターは、将来の標準のバージョンが出るのを待つ必要はありません。より有用な質問は、CXLが現在の生産問題を解決できる場所です。

最も明確な機会は、メモリの拡張、プール化、共有メモリ設計で、AIワークフロー全体で不要なコピーを削減することです。これらのユースケースは、KVキャッシュの需要の増加、エージェント間のデータ転送の増加、GPUの利用率の向上と所有コストの削減の必要性と直接一致しています。

オペレーターは、まだ慎重に設計する必要があります。待機時間、予測可能性、ソフトウェアのサポートはまだ重要です。メモリ管理ポリシーは、データを適切なタイミングで適切な階層に配置する必要があります。しかし、これらは実装の質問であり、計画を延期する理由ではありません。

XCENAでは、メモリ、データの移動、利用率が生産AIインフラストラクチャの中心的な制約であると見なしています。したがって、CXLベースの計算メモリと、不要なコピーを削減し、共有アクセスをサポートし、オペレーターが高価なコンピューティングリソースをより効果的に利用できるようにするアーキテクチャに重点を置いています。

業界は、メモリをAI進歩の背後にあるサポートリソースとして扱ってきました。ただし、その見方は、生産展開の現実に適合しません。メモリは、スタックのすべてのレベルで利用率、効率、コストを形作るようになりました。早期にこの変化を認識するオペレーターは、パフォーマンスだけでなく、実世界でAIをどのようにスケールするかという点で、パフォーマンスと測定可能なアドバンテージを獲得することになります。

ジン・キムは、XCENAのCEO兼共同創設者です。XCENAは、韓国に拠点を置くファブレス半導体会社で、AIと大規模データ処理向けの次世代メモリソリューションの開発に注力しています。SK Hynixでのシニアリーダーシップ経験を持ち、同社で最も若い取締役の一人であったキムは、データ中心のコンピューティングと半導体アーキテクチャに関する深い専門知識を持ちます。