ソートリーダー
AIチップレースは今ソフトウェアで行われている理由

新しいAIアクセラレータは、ベンチマークの物語とともに登場します: ピークスループット、ワットあたりのテラ演算、印象的な数字がこのチップがすべてを変えることを約束しています。しかし、これらの数字は、顧客が実際にチップを使用できるかどうかを省略しています。ほとんどの場合、顧客は使用できないのです。これが、今日のAIハードウェア業界の実際の状況です。ソフトウェアの成熟度の問題に直面していますが、ほとんどの会社はまだ公にそう言っていません。
誰も話さないギャップ
シリコンの開発サイクルは2〜4年ですが、AIモデルランドスケープは数ヶ月のサイクルで進化しており、週に近づいています。これらの下には、価値チェーンの問題があります: 車、工場、病院、デバイスなどのエンドユーザーケースは、機能的に成熟し、計測可能なP&L影響を生み出しています。この成熟度は、ソフトウェアの適応を要求し、それがハードウェアの変更を必要とします。これらの3つのレイヤーは、根本的に異なる速度で動作し、そのミスアラインメントが市場全体に広がる摩擦の根本原因です。大量言語モデル推論を実行するために必要なソフトウェアスタックは、以前の機械学習ワークロードのために構築されたものとは根本的に異なります。ハードウェアの開発タイムラインは、このサイクルに合わせて圧縮されていません。現在新しいシリコンを出荷している会社は、顧客にソフトウェアがチップの能力を完全に解放できない状態でハンドオーバーしています。これにより、市場全体で繰り返されるパターンが生まれます: 印象的なシリコン、未熟なソフトウェア、遅い採用、収益の喪失。チップは設計通りに動作します。問題は、顧客が簡単に使用できないことです。
自動車業界に何が起こったかを考えてみましょう。車自体は20世紀半ばまでにほとんど解決された問題でしたが、ソフトウェアが差別化要因になったとき、最も深い製造伝統を持つ会社が最も適応するのに苦労しました。フォードとGMはエンジンを製造する方法を知っていましたが、オペレーティングシステムを構築する方法については「筋肉の記憶」がなかったのです。AIハードウェア業界は今、同じ転換期を経験しています。この類似性は、不快に思えるほど正確です。NVIDIA (NVDA ) はソフトウェアネイティブの破壊者としての役割を果たしていますが、伝統的な半導体会社はまだ、シリコンとともに開発者エコシステムを販売する方法を模索しています。
NVIDIAの優位性は、最も優れたチップを持っていることとほとんど関係ありません。CUDA(Compute Unified Device Architecture)は20歳で、すべての技術的負債を含みますが、NVIDIAが実際に構築したのはAIコンピューティングのオペレーティングシステムです: 予測可能で成熟したエコシステムが、開発者とOEMが本番で頼ることができるものです。
顧客は、ソフトウェアの成熟度と統合リスクに基づいてプラットフォームを選択します。新しいアクセラレータが本番レベルのソフトウェアスタックなしで到着すると、商業的な会話は開始される前に終了します。
最初のモデルまでの時間、つまり顧客が特定のアクセラレータで実際のAIワークロードを実行するまでにかかる時間は、ピークスループットよりもはるかに意味のある商業メトリックです。これが、ほとんどのハードウェア会社が最も話しにくい会話です。
インファレンスが実際の市場である
ビジネスのネイティブ言語はP&Lです。AIを展開するすべての会社は、同じ質問に答える必要があります: お金はどこにあり、どれが私を捕まえるのを妨げているのか? トレーニングは必要なステップですが、商業的なAIはインファレンスにあります。その市場はほとんど始まったばかりです。
ここでの非対称性は驚くべきものです。トレーニングは1つのユースケースをカバーしますが、インファレンスは無限のユースケースをカバーします。車、工場、病院、電話、倉庫でのAIのすべての応用にはインファレンスが必要です。車の安全システムを実行するチップはデータセンターの電力を使用できず、工場の床でリアルタイムインファレンスを実行するデバイスは高遅延を許容できません。 エッジインファレンス市場では、電力効率、物理的制約、そしてインダストリーが展開する安全性と信頼性の要件に特化したシリコンが必要です。
Googleの最近の決定は、8世代目のTPUをトレーニングとインファレンスの2つの異なるチップに分割することで、価値があります。このアーキテクチャの選択は、2つのワークロードが大きく発散し、1つの設計で両方を最適化することは、どちらもすぐれていないことを意味します。世界最大のAIインフラストラクチャを実行している会社が、特化が統合よりも重要であることを示しています。これは、市場が向かっている方向を示しています: エッジで大量に展開される、目的のあるインファレンスシリコン、現実の制約で、データセンターのベンチマークでは測定できないものです。
私たちはインファレンスの土地収用競争の真っ只中です。しかし、市場のほとんどはまだトレーニングを中心に組織されています。
レガシーの構造的限界
大量生産できる企業は、インファレンスが存在する市場にサービスを提供することが構造的にできません。自動車顧客は、10年間のコンポーネントの入手可能性を保証するサプライヤーが必要です。Intel (INTC ) のような汎用半導体会社は、そのようなコミットメントを与えることはできません。この構造的な制約により、業界全体が未提供のまま残り、交渉では何も変わりません。
NVIDIAのエッジAIプラットフォームは、ソフトウェアスタックに変更を加えることなく、ワットあたりのパフォーマンスが向上したPIN互換の代替品に挑戦されています。顧客はチップを交換し、すべての他のものを維持することができ、これはNVIDIAのエッジポジションの最も防御可能な部分に対する直接的な商業攻撃です。
CUDAで概念を証明した会社は、経済的な展開が大量のデバイスを展開することを要求することを発見しています。組織が数千のデバイスを展開するとき、ユニットあたりのコストと消費電力が決定的な要因になります。インファレンス市場で展開しているシーケンスは、シンプルです: 動作するものを使い、テストし、経済的に展開する方法を見つける必要があります。AIの採用のペースを考えると、ソフトウェアとエコシステムの優位性を確立するためのウィンドウは四半期で測定されます。
ほとんどの会社が省略しているエンジニアリング投資
AIハードウェア会社は、ソフトウェアが完全に実行できない強力なチップを出荷し続けています。インファレンスランタイム、コンパイル最適化、ワークロード有効化をカバーする本番レベルのシステムソフトウェアには、ほとんどのハードウェア会社が社内に持っていない、深い専門的なエンジニアリングが必要です。
その能力を構築するには、チップが理論的に可能なことと顧客が実際に展開できることの間のギャップを埋めることができるコンパイルエンジニアとランタイムアーキテクトを雇用する必要があります。会社はまた、収益がそれを正当化する前にツールチェーンに投資する必要があります。収益が到着するまでに、ウィンドウは閉じます。投資を省略する会社は、後れを取るだけではありません。取引を失います。
大量に展開されるチップは、最も展開可能なチップです。展開可能性はソフトウェアの品質の関数です。主要な下流の購入者、OEM、ハイパースケーラー、エンタープライズ顧客は、ベンチマークが優れているが統合が悪いシリコンによって以前焼き付きました。彼らはエコシステムの成熟度と統合リスクに基づいて選択します。ソフトウェアを第一級のエンジニアリング優先事項として扱う会社は、より多くのパイロットを本番契約に変え、収益に到達します。ソフトウェアを出荷後の余分なものとして扱う会社は、技術的に優れたシリコンが、より成熟したスタックを備えた劣等なチップに取引を失うのを見ています。
時計はすでに動いている
AIハードウェア会社は、次の段階で重要なシェアを獲得するために、今日エコシステムの優位性を構築しています。これは、後から参入する会社が複製するのが難しいものです。ソフトウェアの柔軟性、次のテープアウトを待たずに新しいモデルアーキテクチャに適応する能力は、商業的に関連性のあるシリコンと、収益を必要とする次の世代のサイクルを通じて関連性のないシリコンを区別します。
現在、エンジニアリングチーム、パートナーシップ契約、商業パイロット全体で行われている決定は、どの会社が2028年にまだ関連性があるかを決定します。CUDAの20年の先行は、エコシステムの深さに基づく護城河ですが、ソフトウェアを継続的なエンジニアリングの優先事項として扱う会社は、同じ深さを構築できます。
業界が答える必要がある質問は、どの会社が、他社のものが置き換えにくいほど根付く前に、チップをデフォルトの選択肢にするエコシステムの深さを構築するのに十分に速く動いているかです。












