ソートリーダー
AIの新しい経済はトークンで構築されているが、間違った方法で測定している

AIでは、ほとんどの人がまだ完全に理解していないが、重要な変化が起こっている:リクエストの数を数えるのではなく、トークンの数を数えることに移行した。
ウェブ時代には、1秒あたりのリクエスト数でシステムを測定していた。そうすることで、インフラストラクチャをスケーラブルにし、クリーンで直感的で、ほとんど正確なシステムを作ることができた。
しかし、その抽象化はもうない。
AIでは、基本的な単位はリクエストではなく、トークンである。すべてのプロンプト、すべてのレスポンス、すべての推論チェーンはトークンに分解され、システムが行っている作業、発生するコスト、そして、増え続ける価値を表す。
当然のように、業界はこの変化を受けて、トークン毎のコストやトークン毎の収益などのメトリクスを導入した。そうすることで、AIシステムを量化する方法が見つかったと思われる。しかし、そのフレーミングは不完全である。
業界のショートカット:トークンは価値を表す
トークンはAIの新しい通貨であるという物語が広がっている:より多くのトークンはより多くの知能を意味し、拡張するとより多くの収益をもたらす。そうした考えは魅力的だが、実際に起こっていることを単純化しすぎている。
すべてのトークンは等しくない。いくつかのトークンは実際の作業を表す:データの分析、洞察の生成、ワークフローの自動化、ビジネス成果を支える決定のサポート。他のトークンは、より意味のないものである:カジュアルなコンテンツ生成、実験、または本格的なプロダクションに移行しないユースケース。
企業内でこれをすでに見ることができる。あるチームは、開発者の生産性や顧客の運用をサポートするために、数百万のトークンを生成するかもしれない。直接的には効率と収益に影響する。別のチームは、内部でのみ探索されるツールを使用して、同じ量のトークンを生成するかもしれない。紙上では、トークンの数は同じに見える。現実には、ビジネス価値は完全に異なる。
すべてのトークンを交換可能な価値の単位として扱うと、組織内でAIが実際に何をしているかについて、歪んだ見方を作り出す。
その違いを理解するには、システムが実際にどのように動作しているかを、表面下に注目する必要がある。
2回目のプロンプトは1回目のプロンプトよりも速い理由
ChatGPTのようなツールを使用したことがある人は、2回目の質問が1回目の質問よりも速いことが多いことに気が付いたことがあるだろう。その動作は、モデルが賢くなったことではなく、システムが前のプロンプトからのコンテキストを再利用していることによる。
現代のAIシステムは、各リクエストを独立して処理しない。コンテキストを構築し、前のプロンプトとレスポンスをメモリに保存する。そうしたキャッシュは、GPUに近い場所に配置され、フォローアップのレスポンスを生成するときに迅速にアクセスできる。
最初のリクエストは、高価なものである。状態を初期化するからだ:メモリを割り当て、入力を処理し、コンテキストを構築する。後のリクエストは、状態を再利用する。そうすることで、待ち時間が短くなり、レスポンスが速くなる。
このダイナミクスは、コンテキストウィンドウが数千から数十万、または数百万のトークンに拡大するにつれて、より重要になる。システムが保持するコンテキストが多いほど、メモリとインフラストラクチャに圧力がかかり、保存、圧縮、または破棄するものを決定することが重要になる。
ユーザーから見ると、システムが速くなっているように感じられる。インフラストラクチャから見ると、メモリ、待ち時間、コストの複雑なトレードオフである。
ここで、実際の作業が行われている:モデル自体ではなく、モデルを囲むシステムの中である。
究極の制約:エネルギー
モデル性能を超えて話を進めると、会話はすぐに変化する。
大規模なAIを実行しているチームは、どのモデルが最適かということよりも、どのように維持するかということを尋ねている。
AIインフラストラクチャは物理的な限界に挑戦している:エネルギーの可用性、冷却能力、メモリ帯域幅。データセンターはこれらの制約を中心に再設計されており、大規模なAIシステムを展開している組織は、従来のソフトウェア会社ではなく、ユーティリティ会社のように動作し始めている。
すでに、大企業がAIインフラストラクチャを構築しているのをみて、これが起こっているのをみることができる。電力と冷却が、モデル機能ではなく、主な制約になっている。
AIワークロードはクリーンに拡張されず、予測もできない。コンピューティング、メモリ、ネットワーキングの需要が同時に増加する。より多くのトークンを生成することは、単にGPUを追加することではなく、効率的に動作し続けるために必要なエネルギーと熱負荷をインフラストラクチャが維持できるかどうかということである。
トークンを生成するコストは、コンピューティングを超えて、電気代、冷却、物理インフラストラクチャ、負荷下でのパフォーマンスを劣化させずに維持する能力を含む。
「トークンあたりのコスト」に関するほとんどの議論は、この現実を完全に反映していない。規模では、エネルギーが予算ではなく、単なる項目になる。
将来はより大きなモデルではなく、より優れたシステム
過去2年間、業界はモデル比較に焦点を当ててきた。ベンチマーク、ランキング、機能のインクリメンタルな改善をみてきた。
しかし、その焦点は変わり始めている。
実稼働環境では、パフォーマンスはどのモデルを選択することよりも、どのように使用するかによって決まる。組織はモデルシステムに向かっている:大きなモデルと小さなモデルを組み合わせ、タスクを賢くルーティングし、コスト、待ち時間、スループットを最適化している。
すべてのリクエストを単一の大きなモデルに送信するのではなく、システムはワークロードを小さなコンポーネントに分割する。よりシンプルなタスクは、より効率的なモデルによって処理される。一方、より複雑な推論は、大きなモデルに予約される。コンテキストは、可能な限り再利用され、キャッシング戦略が積極的に適用される。
これらの決定は、モデルを切り替えることよりも、パフォーマンスとコストに大きな影響を与える。そうした意味で、トークンは作業の単位のままであるが、トークンを生成し管理するシステムが、実際の違いを作り出す。
AIシステムで最も見過ごされている層
AIは、モデルとアプリケーションの両側で説明されることが多いが、両者の間に存在する層が、ほとんどの複雑さと機会を抱えている。
この層は、リクエストを単に移動させるのではなく、それを形作る。トラフィックの流れ方、決定の適用方法、システムの動作を決定する。
配信とセキュリティは、ここで別々の懸念事項として扱うことができない。リクエストをルーティングし、コンテキストを管理する層は、ポリシーを適用し、リスクを軽減し、信頼を確立する層でもある。
複雑さが増すにつれて、ポイントソリューションは壊れる。必要なのは、リアルタイムでこれらの機能を調整できる統一されたプラットフォームである。事後的にそれらをまとめるのではなく、事前に調整する必要がある。
ここで、トレードオフが行われる。ここで、コストが制御され、パフォーマンスが最適化され、セキュリティの決定がリアルタイムで適用される。AIシステムが拡大するにつれて、この層はますます重要になる。これは、デモではうまく動作するシステムと、実稼働環境で信頼性と効率性を維持するシステムの違いである。
組織にとっての意味
企業がAIを本格的に導入するにつれて、どのモデルを使用するかという質問ではなく、モデルを囲むシステムがどのように設計されているかということが重要になる。
つまり、トークンメトリクスやモデルベンチマークだけに焦点を当てるのではなく、リクエストのルーティング方法、コンテキストの管理方法、ワークフロー全体でのポリシーの適用方法について考える必要がある。
ほとんどの組織はまだこれらのピースをまとめているが、このアプローチは本格的な生産圧力に耐えられない。
間違ったものを測定している
トークンは有用な抽象化を提供する。AIの何か無形なものを量化する方法を業界に与える。しかし、トークンは全貌を表していない。
現在、業界は最も簡単に測定できるもの、つまりトークン数、スループット、コストメトリクスに惹かれがちであるが、最も重要なものではなく、コンテキストがなければ、これらの数字は誤解を招くものとなる。
AIの次の段階は、最も多くのトークンを生成することによって定義されるのではなく、トークンが何を表すかを理解し、トークンを意味のある、効率的な、スケーラブルな成果に変えるシステムを構築することができるものによって定義される。
最終的には、トークンは製品ではない。知能が創造されることの副産物にすぎない。












