ソートリーダー

AIインフラストラクチャーは壊れている。トークンが新しい価値の尺度になっている。

mm
Unite.AI を Google の優先ソースに追加

AI業界には測定問題がある。

数年間、成功はコンピューティングへのアクセスによって定義されてきた。誰が最も多くのGPUを持っているか、最大のクラスターを持っているか、最速のトレーニングランを持っているかである。インフラストラクチャーに数十億ドルが投資されたが、このレースに勝つために。

しかし、AIが実験から本格的な生産へと移行するにつれて、このモデルは壊れ始めている。

企業はGPUを購入していない。推論能力を購入していない。サマリー、推奨、決定、コンテンツなどの成果を購入している。つまり、トークンを購入している。

しかし、ほとんどのAIインフラストラクチャーはまだ、コンピューティングが最終目標であるという前提で設計されている。これは事実ではない。

AIの真の価値単位はトークンである。早期にこの変化を認識する企業が、市場の次の時代を定義することになる。

AIトークンファクトリーの台頭

トークンが製品である場合、AIインフラストラクチャーは生産システムのように動作する必要がある。科学プロジェクトのように動作するのではなく。そこで、AIトークンファクトリーの概念が登場する。

AIトークンファクトリーは、単にソフトウェアスタックの別の層ではない。スタック自体を再考したものである。分離されたモデル性能や生のハードウェア利用率を最適化するのではなく、効率的なトークン生成を目指す。

今日のモデルは基本的にGPUのレンタルである。組織は高価なハードウェアをプロビジョニングし、断片的なツールをまとめ、利用率が最終的に投資を正当化することを願っている。

トークンファクトリーはこの式を完全に逆転させる。インフラストラクチャーではなく、出力を提供し、効率性を最初からコア設計原則として扱う。これは漸進的な進歩ではなく、インフラストラクチャーを容量から生産へとシフトすることである。

古いモデルの限界

現在のAIインフラストラクチャーモデルは、単に非効率的なだけでなく、持続不可能である。

GPUの不足が最初の亀裂を露呈した。需要は供給を上回り、組織は断片的な、マルチベンダーの展開を強いられている。暫定的な対策として始まったものが、すぐに常態化した。統一的な運用レイヤーなしに、異質な環境がまとめられている。

問題は、ほとんどの既存のスタックがこの現実に対応するように設計されていないことである。アーキテクチャー間で効果的に最適化したり、リアルタイムで適応したり、パフォーマンスとコストに関する明確な可視性を提供したりできない。

結果として、複雑さはスケールよりも速く増大する。

新しいモデル、フレームワーク、加速器、またはクラウドプラットフォームごとに、運用上のオーバーヘッドが追加される。チームは、オーケストレーション、互換性、ルーティング、スケジューリング、観測可能性の問題を管理するのに多大な時間を費やし、成果の改善よりも忙しい。

スケールアップするはずのものが、調整問題になる。

同時に、経済的側面も無視できない。初期のAI展開では、成長と実験の後ろ盾で非効率性を隠せた。だが、その期間は終わりに近づいている。

幹部は、より難しい質問をしている。なぜ推論コストが予測できないのか。なぜGPUの利用率がまだ低いのか。なぜ高価なハードウェアがしばしばアイドル状態にあるのか。なぜインフラストラクチャーの支出をビジネス成果と結びつけるのが難しいのか。

答えは簡単である。システムはアクセスに対して設計されたのであって、効率性に対してではない。

コンピューティング中心からトークン中心へのアーキテクチャー

トークンファクトリーへの移行は、哲学的にも建築的にも重要である。

まず、市場はGPU-as-a-Serviceから成果物-as-a-Serviceへと移行している。顧客はインフラストラクチャーを管理したいのではなく、成果物を得たい。論理的な最終状態は、出力に基づく消費である。

次に、断片的なスタックは統一されたコントロールプレーンに取って代わられている。異質な環境では、可視性とコントロールがすべてである。トークンファクトリーは、使用状況、コスト、パフォーマンスに関するリアルタイムの洞察と、それに対する対応能力を提供する。組織は理解する必要がある。誰がトークンを生成しているのか。どのコストで。どのハードウェアで。どのワークロードで。どの効率性で。そうでなければ、最適化は推測になる。

最後に、業界の焦点は実行から継続的な最適化へとシフトしている。課題は、モデルを実行することだけではなく、賢く実行することである。組織は、どのワークロードをどのハードウェアで実行するか。どのようにしてスループットを最大化しながらコストを制御するか。どのようにしてトークンの使用を制限するか。

トークンファクトリーは、これらの質問を第一の課題として扱う。

今日のAIデリバリーモデルは不足している

従来のAIスタック(ハードウェアベンダー、クラウドプラットフォーム、推論サービス)は、主に急速な成長のために構築されたのであって、システム的な効率性のために構築されたのではない。

各レイヤーは価値を加えるが、同時にコスト、抽象化、運用の断片化も加える。結果として、積み上げられたマージン、透明性の欠如、ベンダーロックインの増大が生じる。組織はシステム全体ではなく、シロの中で最適化している。

トークンファクトリーは、このモデルに根本的に異議を唱える。

ハードウェアと価値の提供を切り離すことで、エンドツーエンドの最適化を可能にする。ワークロードは環境を流動的に移動できる。アーキテクチャーは、大きな書き換えを必要とせずに進化できる。効率性は、測定可能、管理可能、継続的に改善可能になる。

これが、企業や新興のネオクラウドが、ハイパースケーラーと比べてより効果的に競争できる方法である。スケールを合わせるのではなく、効率性で勝つことによって。

誰が勝つのか

おそらく、この移行の最も破壊的な側面は、誰が力を得るかである。データセンターを所有する必要はない。GPUを所有する必要もない。重要なのは、オーケストレーション、最適化、デリバリーを制御することである。

これにより、より広範なプレイヤーが参加できる。重要なのは、

  • 大規模で永続的なAIワークロードを持つ企業。
  • 特定の垂直市場やユースケースに最適化されたネオクラウドプロバイダー。
  • スタックを上に移動するインフラストラクチャーベンダー。

このモデルでは、競争上の優位性はコンピューティングを独占することによって得られるのではなく、トークンをより良く、より速く、より安く生成することによって得られる。

新たな戦場:トークンあたりのコスト

次のAI競争の段階は、モデル品質だけで勝つことができない。効率性で勝つ必要がある。特に、トークンあたりのコストで。

誰が同等または優れた出力を、コストの小さな部分で提供できるのか。誰がインフラストラクチャーの支出を制御しながらスケールアップできるのか。誰がAIを予測可能で、利益率の高いビジネスに変えることができるのか。

これらはインフラストラクチャーの質問ではない。生産に関する質問であり、生産に関する心構えが必要である。

未来はGPUに基づいていない

GPUは消え去ることはないが、もうそれが中心ではない。トークンが中心である。

コンピューティングに焦点を当てている組織は、コストの増加と利益の減少に直面する。トークン中心のシステムに移行する組織は、根本的に異なるモデルを解放する。インフラストラクチャーと成果を一致させ、コストと価値を一致させるモデルである。

AIトークンファクトリーは、遠い将来の概念ではない。市場の必然的な進化である。本当の質問は、誰が最初にこれを構築するか、誰が後れを取るかである。

ガウラブ・シャーは、NeuRealityのビジネス開発および戦略担当副社長であり、AI推論の革新と金融、ヘルスケア、政府を含む各分野でのその採用の促進を顧客にリードしています。ガウラブは、NVIDIA、Marvell、Tenstorrent、GlobalFoundriesでの製品マーケティングおよび管理役職での30年以上のテクノロジー業界の経験を持っています。彼はサンフランシスコ湾エリアに住んでいます。