Andersonの視点

AIチャットの新研究論文:「トークン」価格設定に疑問を投げかけ

mm
Unite.AI を Google の優先ソースに追加
ChatGpT-40 + Adobe Firefly

新しい研究によると、AIサービスがトークン単位で請求する方法は、実際のコストをユーザーから隠していることが明らかになった。プロバイダーは、トークン数を操作したり、隠れたステップを追加したりすることで、請求額を秘密に増やせる。 一部のシステムでは、出力に影響しないが請求書に表示される内部プロセスが実行される。監査ツールの提案はなされたが、実際の監視なしでは、ユーザーは実際に支払っているよりも多く支払わされることになる。

 

ほとんどの場合、我々が消費者として支払うAIチャットインターフェイス、たとえばChatGPT-4oのようなもののコストは、現在、トークンと呼ばれる、使用中に気づかないテキストの単位で測定されている。これらの単位は請求目的で正確に数えられるが、ユーザーは直接確認する方法がない。

私たちのトークンベースの請求の理解は、不完全である(最善の場合)。トークンベースの請求は、プロバイダー全体で標準的なアプローチとなり、信頼の前提に基づいているが、これはもしかしたら不安定な仮定であるかもしれない。

トークンワード

トークンは、単語とまったく同じではありませんが、よく似た役割を果たします。ほとんどのプロバイダーは、単語、句読点、単語の断片などのテキストの小さな単位を説明するために「トークン」という用語を使用します。たとえば、単語 ‘信じられない’ は、1 つのトークンとして 1 つのシステムで数えられるかもしれませんが、別のシステムでは unbelievable の 3 つのピースに分割され、各ピースがコストを増やします。

このシステムは、ユーザーが入力するテキストとモデルの応答の両方に適用され、コストはこれらの単位の合計数に基づいて決定されます。

問題は、ユーザーが このプロセス を見ることができないことです。ほとんどのインターフェイスは、会話中にトークン数を表示せず、トークンが計算される方法は再現が難しい。応答の にトークン数が表示される場合でも、公平であったかどうかを判断するには遅すぎます。ユーザーが見るものと請求されるものの間に矛盾が生じます。

最近の研究は、より深い問題を示唆しています:1 つの研究は、プロバイダーがルールを破ることなく、トークン数を操作して過剰請求できる方法を示しています。 別の研究は、インターフェイスが表示するものと実際に請求されるものの間に矛盾があることを明らかにし、ユーザーは効率性の幻想に陥ることになります。 3 番目の研究は、モデルがユーザーに表示されない内部推論ステップを生成することを暴露し、これらは請求書に表示されます。

これらの調査結果は、精度のある数字で示されるように、正確性を示唆するシステムを描きますが、その根底にある論理は隠れています。設計によるものか、構造的な欠陥か、結果は同じです。ユーザーは見ることができないものよりも多く支払い、そして多くの場合、予想よりも多く支払います。

12 個で安いか?

これらの論文の 最初 の論文 – マックス・プランク・ソフトウェア・システム研究所の 4 人の研究者による「あなたの LLM があなたに過剰請求しているか?トークン化、透明性、インセンティブ」 – 著者は、トークンベースの請求のリスクが不透明性を超えて存在することを主張し、プロバイダーにトークン数を膨張させるインセンティブがあることを指摘しています:

‘問題の核心は、文字列のトークン化が一意的ではないという事実にある。たとえば、ユーザーがプロンプト「次の NeurIPS はどこで開催されるか」をプロバイダーに提出し、プロバイダーがそれを LLM に入力し、モデルが「|San| Diego|」という 2 つのトークンで構成される出力を生成したとします。 ‘

‘ユーザーは生成プロセスを認識していないため、プロバイダーはトークン化をユーザーに報告することなく、出力のトークン化を「|S|a|n| |D|i|e|g|o|」に変更し、2 つのトークンの代わりに 9 つのトークンを請求することができます!’

この論文では、通常のデコーディング設定下で、可信性を損なうことなく、このような不誠実な計算を実行できるヒューリスティックが提示されます。LLaMA、Mistral、Gemma シリーズのモデルを使用して、実際のプロンプトでテストされ、通常の設定下で異常と見なされることなく、過剰請求が達成されます。

「信頼できる不正報告」を使用したトークンインフレ。各パネルは、プロバイダーがアルゴリズム 1 を 400 の LMSYS プロンプトの出力に適用したときの過剰請求トークンの割合を、さまざまなサンプリング パラメータ (m と p) で示しています。すべての出力は温度 1.3 で生成され、5 回の繰り返しで 90% の信頼区間を計算しました。ソース: https://arxiv.org/pdf/2505.21627

「信頼できる不正報告」を使用したトークンインフレ。各パネルは、プロバイダーがアルゴリズム 1 を 400 の LMSYS プロンプトの出力に適用したときの過剰請求トークンの割合を、さまざまなサンプリング パラメータ (m と p) で示しています。ソース: https://arxiv.org/pdf/2505.21627

問題に対処するために、研究者は、トークンの代わりに 文字数 に基づいて請求することを提案しています。著者は、これがプロバイダーに正直に使用状況を報告する理由を与える唯一のアプローチであると主張し、公平な価格設定の目的であれば、コストを隠れたプロセスではなく、可視的な文字に結び付けることが検証に耐える唯一の選択肢であると主張しています。文字ベースの価格設定では、不正報告の動機が除去され、より短く効率的な出力が報奨されるでしょう。

ここにはいくつかの追加の考慮があります(ほとんどの場合、著者によって認められています)。まず、提案された文字ベースのスキームは、ベンダーが消費者よりも優先される可能性のある追加のビジネス ロジックを導入します。

‘[問題の核心は]、トークン化された文字列が一意的ではないという事実にある。たとえば、プロバイダーがトークン化を「|S|a|n| |D|i|e|g|o|」に変更し、2 つのトークンの代わりに 9 つのトークンを請求することができる。[この場合]、プロバイダーはトークン化アルゴリズム (たとえば BPE) を改善することで、トークン シーケンスをできるだけ圧縮するインセンティブがあります。 ‘

楽観的なテーマは、ベンダーがよりコンパクトで、より有意義で、より貴重な出力を生成するよう奨励されることです。実践では、テキスト数を減らすために、より徳のない方法が存在することは明らかです。

2 番目に、著者は、企業がトークン システムからより明確なテキストベースの請求方法に移行するには、法的措置が必要になるだろうと述べています。将来、スタートアップがこのような価格設定モデルで製品を立ち上げて差別化を図る可能性がありますが、真に競争力のある製品 (EEE カテゴリーよりも小規模なもの) を提供している場合は、インセンティブが欠けます。

最後に、著者が提案するような不正なアルゴリズムは、計算コストを伴うでしょう。過剰請求の潜在的な利益がアルゴリズムのコストを上回らない場合、スキームは明らかに価値がありません。しかし、研究者は、提案されたアルゴリズムは効果的で経済的であると強調しています。

著者は、GitHub の コード を提供しています。

スイッチ

2 番目の 論文 – メリーランド大学とバークレーの研究者による「不可視トークン、可視請求書:不透明な LLM サービスでの隠れた操作の監査の緊急性」 – 商用言語モデル API のインセンティブがトークン分割のみに限定されていないことを主張していますが、隠れた操作の全クラス にまで及んでいます。

これらには、内部モデル呼び出し、推論、ツールの使用、多エージェントのやり取りが含まれます。これらはすべて、ユーザーに表示されることなく請求される可能性があります。

主要プロバイダーの推論 LLM API の価格設定と透明性。リストされているすべてのサービスは、ユーザーに表示されることなく、隠れた内部推論トークンに料金を請求します。コストは大きく異なり、OpenAI の o1-pro モデルは、Claude Opus 4 または Gemini 2.5 Pro と比較して、1,000 万トークンあたり 10 倍の料金を請求します。ソース: https://www.arxiv.org/pdf/2505.18471

主要プロバイダーの推論 LLM API の価格設定と透明性。リストされているすべてのサービスは、ユーザーに表示されることなく、隠れた内部推論トークンに料金を請求します。ソース: https://www.arxiv.org/pdf/2505.18471

従来の請求と異なり、サービスと品質が検証可能であるのに対し、著者は、今日の LLM プラットフォームは、構造的な不透明性 のもとで運営されていると主張しています。ユーザーは、トークンと API の使用状況に基づいて請求されるが、これらのメトリックが実際の作業を反映していることを確認する方法がない。

この論文では、2 つの重要な操作形式が特定されています: 数量のインフレーション、トークンまたは呼び出しの数がユーザーに利益をもたらすことなく増加する; および 品質のダウングレード、低性能のモデルまたはツールがプレミアム コンポーネントの代わりに秘密裏に使用される:

‘推論 LLM API では、プロバイダーは同じモデル ファミリーの複数のバリアントを維持することがよくあります。これらは容量、トレーニング データ、または最適化戦略 (たとえば、ChatGPT o1、o3) で異なります。モデル ダウングレードとは、低コストのモデルを秘密裏に代入することを指します。これにより、期待されるサービス品質と実際のサービス品質の間に齟齬が生じる可能性があります。 ‘

‘たとえば、プロンプトが小さいサイズのモデルで処理される可能性がありますが、請求は変更されません。この慣行は、最終的な答えが多くのタスクに対してまだ妥当であるため、ユーザーが検出するのが難しい。 ‘

この論文では、請求されるトークンの 90% がユーザーに表示されないという事例が記載されており、内部推論によってトークンの使用量が 20 倍以上増加しています。正当化されていようがしまいが、内部ステップの不透明性により、ユーザーは関連性や正当性を評価するための基準を失います。

エージェント システムでは、不透明性が増大し、AI エージェント間の内部やり取りは、出力に影響を与えることなく、請求されることがあります:

‘内部推論を超えて、エージェントはプロンプト、サマリー、計画指令の交換を通じて通信します。各エージェントは、他のエージェントからの入力を受け取り、ワークフローを導く出力を生成します。これらのエージェント間のメッセージは、多くのトークンを消費する可能性がありますが、通常はユーザーには表示されません。 ‘

‘エージェント間のすべてのメッセージ、生成されたプロンプト、応答、ツール関連の指令は、通常、ユーザーには表示されません。エージェント自体が推論モデルを使用する場合、請求はさらに不透明になります。 ‘

これらの問題に対処するために、著者は、内部アクティビティの暗号化証明、モデルまたはツールの ID の検証可能なマーカー、および独立した監視を含む階層的な監査フレームワークを提案しています。根本的な懸念は、構造的なものです: 現在の LLM 請求スキームは、情報の非対称性に依存しており、ユーザーが検証または分解できないコストにさらされることになります。

不可視のカウント

最終的な論文 – メリーランド大学の研究者による「CoIn: 商用不透明 LLM API の不可視推論トークンのカウント」 – 請求問題を、不正使用または不正報告の問題ではなく、構造の問題として再定式化しています。この論文では、ほとんどの商用 LLM サービスが、モデルが出力に貢献する 中間推論 を隠しているにもかかわらず、これらのトークンに課金 していることを観察しています。

この論文では、このことが 観察できない請求表面 を作成し、シーケンス全体が検出せずに作成、挿入、または膨張できることを主張しています:

‘[これは] トークン数またはトークンを報告することを許可し、または低コストで作成された推論トークンを人為的にトークン数を膨張させるために挿入することを許可します。 ‘

‘たとえば、OpenAI の o3 モデルで実行された単一の高効率 ARC-AGI ランは、1,110 万トークンを消費し、66,772.3 ドルかかりました。この規模では、わずかな操作でも大きな金銭的な影響を及ぼす可能性があります。 ‘

‘このような非対称性により、AI企業はユーザーに多大な過剰請求を行うことができ、ユーザーの利益を損なうことになります。 ‘

この非対称性に対処するために、著者は、隠れたトークンを検証するために、トークン数を検証するためにハッシュ化されたフィンガープリントとセマンティック チェックを使用する、CoIn と呼ばれる第三者監査システムを提案しています。

不透明な商用 LLM の CoIn 監査システムの概要。パネル A は、トークン数を検証するためにトークン埋め込みをマークル ツリーにハッシュ化する方法を示しています。パネル B は、軽量なニューラル ネットワークが推論ブロックを最終的な答えと比較するセマンティック有効性のチェックを示しています。両方のコンポーネントを組み合わせることで、第三者監査者は、機密性の高いモデル動作を維持しながら、隠れたトークンインフレを検出できます。ソース: https://arxiv.org/pdf/2505.13778

不透明な商用 LLM の CoIn 監査システムの概要。パネル A は、トークン数を検証するためにトークン埋め込みをマークル ツリーにハッシュ化する方法を示しています。パネル B は、軽量なニューラル ネットワークが推論ブロックを最終的な答えと比較するセマンティック有効性のチェックを示しています。ソース: https://arxiv.org/pdf/2505.13778

1 つのコンポーネントは、メルクトリを使用してトークン数を暗号化で検証します。もう 1 つのコンポーネントは、隠れたコンテンツの関連性を、答えの埋め込みと比較することで評価します。これにより、監査者はパディングまたは無関係性 (トークンが請求書を増やすために挿入される兆候) を検出できます。

テストで展開されたとき、CoIn は、特定の種類のインフレーションの検出成功率で約 95% を達成しました。限界はありますが、より広範な点は明らかです: 現在の LLM 請求アーキテクチャは、検証できない誠実さを前提としています。

結論

スクリプトベースの通貨 (CivitAI の「ブズ」システムなど) がユーザーから事前に支払いを得ることの利点に加えて、ユーザーが支払っている通貨または商品の実際の価値からユーザーを抽象化するのに役立ちます。同様に、ベンダーが独自の測定単位を定義することを許可することは、消費者が実際に何を支払っているかについてさらに不明瞭にします。

ラスベガスのカジノに時計や窓がないのと同様に、このような措置は、ユーザーがコストに無頓着または無神経になるように設計されています。

トークンは、消費され、定義され、さまざまな方法で使用できるため、LLM 消費の適切な測定単位ではないかもしれません。少なくとも、トークンは、非英語のセッションと比較して英語のセッションで、LLM 結果の計算に何倍も多くのトークンがかかる可能性があるためです。

しかし、Max Planck 研究者が提案したように、文字ベースの出力は、より簡潔な言語を優遇し、自然に冗長な言語を罰する可能性があります。視覚的な指標 (たとえば、減少するトークン カウンター) があれば、LLM セッションで少しでも浪費家になるかもしれませんが、そんなに便利な GUI アドオンが近いうちに登場する可能性は低いです。少なくとも、立法措置がない限りはそうです。

 

* 著者の強調。著者のインライン引用をハイパーリンクに変換したもの。初めて 2025 年 5 月 29 日に公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai