ジン・キムは、XCENAのCEO兼共同創設者です。XCENAは、韓国に拠点を置くファブレス半導体会社で、AIと大規模データ処理向けの次世代メモリソリューションの開発に注力しています。SK Hynixでのシニアリーダーシップ経験を持ち、同社で最も若い取締役の一人であったキムは、データ中心のコンピューティングと半導体アーキテクチャに関する深い専門知識を持ちます。
過去数年間、AIインフラストラクチャは、他のメトリクスよりもコンピュートを優先してきました。より多くのアクセラレータ、より大きなクラスター、より高性能のFLOPSが、GPUを最大限に活用するための会話を推進してきました。このアプローチは、モデル進歩が主にトレーニングスケールに依存していたときには妥当でした。ただし、現在はAIの本番展開が優先されており、新しいボトルネックに焦点を当てる必要があります。つまり、メモリです。 今日、多くの厳しい制約はメモリ容量、帯域幅、待機時間、およびシステムを介してデータを移動する際の時間とエネルギーのコストで発生しています。コンテキストウィンドウは拡大し続けており、アンソロピックなどの企業は、標準価格設定のオファーで100万トークンのウィンドウを提供しています。推論ワークロードは増加しています。マルチエージェントシステムの成長により、AIシステムはステージ間でより大きなデータ量を交換しています。オペレーターは、さらに多くのGPUを追加し続けることができますが、各サーバーはシステム内RAMに限定されているため、アクセラレータを効率的に供給するために十分なRAMが不足しているため、期待されるパフォーマンスに達することができません。 この変化は、スループットとコストの両方に影響します。メモリが制限要因になると、組織は通常、高価なハードウェアを過剰にプロビジョニングし、GPU容量が未使用になり、電力とインフラストラクチャのコストが増加します。AIスケールの次の段階は、生産性を向上させるために、生産AIが実際に実行される方法に合わせてメモリアーキテクチャを構築することに依存することになります。 ここでは、インフラストラクチャのリーダーが、いつまでも増え続けるメモリの需要に備えるために今すぐ取り組める5つのステップを紹介します。 1. 実際のボトルネックを測定することから始める 多くの組織はまだ、コンピュートを優先する視点からAIのパフォーマンスを評価しています。クラスタの使用率、アクセラレータの数、トップラインのスループットを追跡し、改善はさらに多くのGPUアクセラレータを追加することから来ると想定しています。その視点は、実際の問題を見逃すことがよくあります。 メモリの圧力は、停止したアクセラレータ、トークンあたりの待機時間の増加、負荷下でのスループットの低下として現れます。メモリの別の階層、別のサーバー、またはアプリケーションの別のステージからデータが到着するのを待っている場合、GPUは使用率が低いように見えることがあります。推論により、KVキャッシュのサイズが増加し、同時にセッションが増えて帯域幅を競合するため、この問題がより明らかになります。 オペレーターは、メモリの使用状況、トークンあたりの移動バイト、スタール時間、アクセラレータ、CPU、GPU、および隣接するメモリ階層全体のメモリアクセスパターンに関するより良い可視性が必要です。さらに、ネットワークまたはストレージの問題からメモリ関連の遅延を区別できるパイプライントレースが必要です。その可視性がなければ、チームは実際の遅延の原因に対処せずにコンピュートにさらに多くの費用を費やす可能性があります。 2. 容量を追加する前にデータの移動を削減する 大規模なAIシステムでは、データを移動することはデータを処理することと同じくらいのオーバーヘッドを生み出すことがあります。 これは特に推論の場合に当てはまります。コンテキストウィンドウが拡大すると、KVキャッシュはスタックでシステムメモリの最大の消費者になる可能性があります。マルチテナントの提供とマルチエージェントのワークフローを追加すると、さらに多くのデータが移動することになります。最初のステージが出力を生成し、別のステージがそれを消費し、インフラストラクチャがGPU間、サーバー間、またはフレームワークレベルのシリアライゼーションを介して大きなデータブロックをコピーすることでハンドオフを処理します。 そのコピーには実際のコストがかかります。帯域幅を消費し、待機時間を追加し、次の転送が完了するまでに高価なコンピューティングリソースを待たせることになります。また、ワークロードが実際に必要とするよりも多くの高価なメモリを購入するようにオペレーターを促すことにもなります。 さらにアクセラレータを投資する前に、チームはシステム内でデータが不必要に移動している場所を特定する必要があります。GPU間の転送、サーバー間のコピー、エージェントパイプライン全体で中間状態を繰り返し移動することは、開始点として適しています。多くの環境では、不要な移動を削減することで、別のサーバーを追加するよりも多くの実用的なパフォーマンスが得られます。 3. ワークロードの動作に基づいてメモリ階層を構築する AIインフラストラクチャは、メモリを単一のソースではなく、異なる役割を持つ階層として扱うようになったときに、より効果的に機能します。 最もホットなデータは、アクセラレータに最も近い場所に保持する必要があります。つまり、最も低い待機時間と最高の帯域幅を必要とする作業セットが含まれます。他のアクティブバッファと頻繁にアクセスされる状態は、DRAMに配置できます。スケールよりも絶対的な速度が必要な大きな構造は、プールされたメモリに移動できます。冷たいデータと、サービス品質に影響を与えることなく適度な待機時間のトレードオフを許容できるモデルの場合は、スタックの下の方に配置できます。 このアプローチでは、チームがどのデータが不断に変更されるか、どのデータが多くのプロセスで共有されるか、どのデータがサービス品質に影響を与えることなく適度な待機時間のトレードオフを許容できるかを理解する必要があります。多くの展開では、すべてのものを最も高速なHBM階層にプッシュすることをデフォルトとしています。コストが高くなるため、通常は効率が損なわれます。 階層化されたメモリ戦略により、オペレーターはパフォーマンスと経済性の両方をより制御できます。生産AIでは、このバランスがコアの設計要件となっています。 4. エージェントAIのアーキテクチャの一部として共有メモリを扱う マルチエージェントAIは、断片化されたメモリ設計のコストを高めています。 多くのエージェントシステムでは、1つのエージェントが別のエージェントがすぐに使用する出力を生成します。3番目のサービスは、その出力をランク付けしたり、コンテキストを追加したり、別のモデルにルーティングしたりすることができます。各ステップで同じ状態の新しいコピーを作成すると、トラフィックが急激に増加します。コンテキストが増加すると、コピーされたデータのサイズも増加します。システムは、データを移動する時間よりもデータを処理する時間を費やします。 ここで、共有メモリが特に重要になります。共有KVキャッシュや複数のエージェント/サービスがアクセスする必要がある他の状態に特に重要です。共有メモリは、冗長なコピーを削減し、ネットワークトラフィックを削減し、アプリケーションパス全体で利用率を向上させることができます。共有メモリを使用すると、エージェントシステムが効率的にスケールできるように、異なるノードまたはエージェントがKVキャッシュを共有メモリで再利用できるようになります。...