パートナーシップ
インフィニオン・テクノロジーとd-Matrix、低遅延AIインフラストラクチャで提携
インフィニオン・テクノロジーは、発表により、d-Matrixとの間で、モダンなデータセンターで使用されるAI推論システムのパフォーマンスとエネルギー効率を向上させることを目的とした提携を開始した。パートナーシップの中心は、d-MatrixのCorsair AI推論アクセラレータプラットフォームと、インフィニオンのOptiMOS双相パワーモジュールであり、インタラクティブなAIワークロード用の高密度コンピューティング環境をサポートするように設計されている。
この発表は、AIハードウェア業界の中で起こっている大きな変化を強調している。過去数年間でAIインフラストラクチャのブームの多くは、ますます大きなAIモデルをトレーニングすることに焦点を当てていたが、業界は現在、実際にモデルを実世界のアプリケーションで実行する推論プロセスに急速に拡大している。このようなアプリケーションには、チャットボット、エージェントAIシステム、コピロット、検索、金融分析、ヘルスケアの意思決定サポートなどがあり、これらのワークロードは、特に遅延、レスポンス、電力消費に関してハードウェアに異なる要求を課す。
AI推論がハードウェアの大きな戦場になる理由
AI推論は、インタラクティブなAIシステムがミリ秒単位のレスポンスを必要とするため、AIインフラストラクチャ市場で最も急成長を遂げているセグメントの1つとなっている。d-Matrixは、Corsairを特にこれらのワークロード用にポジショニングしており、超低遅延とエネルギー効率の高い推論を強調している。
According to d-Matrix、Corsairは、生成的なAI推論を遅くすることが多いメモリボトルネックを軽減するために、デジタルインメモリコンピューティングアーキテクチャを中心に設計された。同社は、このプラットフォームが、特にインタラクティブなアプリケーションの場合、従来のGPU中心の推論システムと比較して、遅延を大幅に低減し、スループットを向上させることができると主張している。
インフィニオンとのパートナーシップは、もう1つの急速に重要性を増している課題に対処するものである。AIサーバーの密度が増加するにつれて、アクセラレータへの電力供給を効率的に行うことが、インフラストラクチャのスケーリングの限界要因となっている。インフィニオンのOptiMOS TDM2254xxモジュールは、コンパクトなサーバーシステム内で電気的損失を軽減し、電力密度を向上させるために、垂直電力供給アーキテクチャ用に設計されている。
リアルタイムAIシステムへのシフト
両社は、推論システムが極めて低遅延で出力を連続的に生成する必要がある「インタラクティブAI」の台頭を中心に、コラボレーションを説明した。これには、会話AI、エージェントAI、リアルタイム推論システム、および大規模言語モデルからのトークン生成が必要なアプリケーションが含まれる。
d-Matrixの創設者兼CEOであるSid Shethは、Corsairのアーキテクチャが、2ミリ秒未満のトークン遅延を実現するために特別に設計されたと述べた。これは、企業がAIシステムを実験から顧客向け環境に移行するにつれて、ますます重要性を増している指標となっている。
より広いAI業界も、推論インフラストラクチャがトレーニングインフラストラクチャとは異なる方法で進化する可能性があることを認識し始めている。GPUクラスターが生成的なAIの最初の段階で支配的であったのに対し、推論は、生のコンピューティング能力だけでなく、メモリ帯域幅、遅延、ネットワーク、エネルギー効率を最適化したアーキテクチャに報いるようになっている。
パワー効率がAIスケーリングの中心となる
ハイパースケーラーとAIクラウドプロバイダーが直面している最大の制約の1つは、電力需要である。AI推論ワークロードは、1日あたり数百万のリクエストを処理するため、運用効率がデプロイコストに重要となる。
インフィニオンは、シリコン、シリコンカーバイド(SiC)、ガリウムニトライド(GaN)ベースの半導体技術を通じて、AIインフラストラクチャ内での地位を拡大してきた。同社は、AIアクセラレータとサーバーインフラストラクチャの下にある電力供給レイヤーを提供することに重点を置いてきた。
d-Matrixとのコラボレーションは、半導体企業がAIアクセラレータスタートアップとより緊密に統合される方法を反映している。業界は、従来のGPU重視のアーキテクチャに代わる代替手段を模索している。
AIインフラストラクチャが従来のGPUを超えて拡大する
パートナーシップは、AIハードウェアの実験の波の中で到来した。多くのスタートアップが、推論、メモリ中心のコンピューティング、またはAIネットワークに特化した専用アクセラレータを開発している。
d-Matrixは、コンピューティングインメモリ技術と、生成的なAIに最適化された低遅延推論システムに重点を置くことで、独自の道を切り開いてきた。同社は、最近、アクセラレータチップだけでなく、ネットワーク、構成可能なインフラストラクチャ、および推論クラスターのフルシステム最適化にも重点を置いている。
AIアプリケーションがますますエージェント的でインタラクティブになるにつれて、インフラストラクチャプロバイダーは、生の処理能力だけでなく、全データセンターのスタック全体で遅延を削減し、エネルギー消費を削減し、システムレベルの効率性を向上させることに重点を置くことが期待される。nferenceクラスター。AIアプリケーションがますますエージェント的でインタラクティブになるにつれて、インフラストラクチャプロバイダーは、遅延を削減し、エネルギー消費を削減し、データセンターのスタック全体でシステムレベルの効率性を向上させることに重点を置くことが期待される。












