Andersonの視点
不作法なクエリは企業のChatGPTコストを高める可能性がある

ChatGPTは不作法なクエリに対してより多くのトークンを使用するため、企業の請求額が高くなる可能性があるが、「ください」などの敬語を使用するとコストを削減できる。
礼儀正しさは何もかもコストがないと言われているが、不作法なクエリはChatGPTのコストを高める可能性がある。アメリカの新しい研究によると、ChatGPTに対して不作法なクエリを投げかけると、コストが高くなることが分かった。研究では、ChatGPTの回答は、クエリが礼儀正しいか不作法なかに関係なく同じだったが、不作法なクエリの場合、回答のトークン数が多くなった。
研究者は次のように述べている:
‘GPT4の出力トークンの価格は100万トークンあたり12ドルです。礼儀正しさのないプロンプトは、平均して14トークン以上多く使用され、プロンプトあたり0.000168ドルの追加コストが発生します。OpenAIのAPIへの平均日次クエリ数は22億を超えています。’
‘礼儀正しいプロンプトと礼儀正しさのないプロンプトを比較すると、礼儀正しさのないプロンプトは、結果として発生するトークンの増加により、1日あたり369,000ドルの追加収益を生み出す。’
この結果は興味深いものではあるが、研究者は、このような不作法なクエリのコスト増加は、人間とAIの設定におけるまだ発見されていない多くの奇妙な特性の1つである可能性があると強調している。研究者は、不作法なクエリがなぜ追加のトークンを使用するのかについては推測していない。
この現象の妥当性を確立するために、研究者は実際のChatGPTプロンプトを、礼儀正しさの値を交互に変更しながら、意味を保持したまま書き直した。両方のバージョンをGPT-4-Turboにフィードし、出力トークンの数の違いを測定した。
今年の初めに、Sam Altmanは、礼儀正しさがOpenAIに数十億ドルの損失をもたらしている可能性があると主張した。同じ時期に発表された研究では、礼儀正しさが回答の質に影響しないことも示唆された。しかし、回答のコストについては触れられなかった。
新しい研究の結論が正しい場合、企業のChatGPTユーザーは、ChatGPTとのやり取りで最低限の礼儀正しさを示さなかった場合、2025年にChatGPTの推論に多くのお金を費やしたことになる。
研究者は、1つの可能な解決策として、応答に対するトークン上限を設定することを提案している。しかし、LLMシステムではこのアプローチを簡単に実装することはできない。研究者は、プロンプトはコスト制御のための弱いツールであると観察している。LLMは明示的な長さの指示に従うことができないからである。ほとんどの場合、この「制限」ディレクティブは従われない。さらに、応答は切り捨てられる可能性がある。LLMは、基本的に次の最も可能性の高い単語を推測しているからである。文または段落の終わりを知ることはできない。したがって、進行中の処理を要求に応じて「巻き上げる」ことができない。
正確な解決策がないものの、研究者は、透明性のある価格設定アプローチをこのようなケースで強制することを提案している。研究者は次のように結論付ける:
‘従来の知恵によれば、LLMとやり取りするときのプロンプトの礼儀正しさは不要である。’
‘しかし、私たちの研究は、礼儀正しさのないプロンプトが出力トークンを増やし、企業のAI採用者に追加のコストを生み出すことを示している。’
新しい研究は、企業AI採用のコスト透明性というタイトルで、アイオワ大学の3人の研究者によって行われた。
方法
システムのデータは、WildChatデータセットから抽出された。WildChatデータセットは、100万のユーザーとChatGPTの会話からなるコレクションで、250万を超えるインタラクションターンを特徴とする:

WildChatプロジェクトのサポートサイトからの、検索可能なChatGPTのインタラクションの例。 ソース
研究者は、WildChatには、より高度にキュレーションされたセットよりも自然なインタラクションが多く含まれていることを指摘している。
研究者は、GPT-4交換からの20,000の英語プロンプトをコレクションから選択し、各ケースの出力を破棄した(プロンプトをもう一度フィードするために)。長い交換からも、最初のインタラクションだけを選択した。
結果のセットは、礼儀正しいまたは礼儀正しさのないカテゴリに分類された。すべてのプロンプトは、GPT-4-Turboによって分類された。研究者は、モデル自体が礼儀正しさを判断するために使用した。実験の中心は、モデルの礼儀正しさの認識だったからである。
「ください」などの明確なヒントを含むプロンプトは、礼儀正しいと分類された。間接的に礼儀正しいプロンプトも、礼儀正しいと分類された。認識されていないものは、礼儀正しさのないと分類された。中立的な言葉遣いであった場合でも、礼儀正しさのないと分類された。
礼儀正しさがモデルに与える影響を調べるために、標準的な方法(テキストを測定可能な特徴のセットとして扱う)を使用することはできなかった。礼儀正しさは単語自体に埋め込まれているため、プロンプトを特徴のリストにまとめると、重要なコンテキストが失われるからである。
代わりに、各プロンプトは、他の要素を可能な限り似たままに、トーンを逆転させて書き直された。礼儀正しさだけが異なるペアの比較を可能にした。

礼儀正しいプロンプトと礼儀正しさのないプロンプトを、意味を保ったまま反事実的なバージョンに変換した例。 ソース
テスト
各元のプロンプトは、礼儀正しさのレベルだけが異なる書き直されたバージョンとペアになった。両方のバージョンは、同じGPT-4-Turboモデルに別々のAPIコールで提出された。各バージョンに対する応答で使用されたトークンの数が記録され、両者の違いはトークンコストに影響を与えるトーンの尺度として扱われた。
温度は一定に保たれた。ランダムな変動を防ぐためである。プロンプトのペアは、書き直しが入力を5トークン以上変更しない場合にのみ保持された。これにより、研究対象の効果はトーンから生じ、より広範な言葉遣いの変化から生じるものではなかった。

礼儀正しいプロンプトは、平均して、礼儀正しさのないプロンプトよりも出力トークンが少ないという、要約統計。
最初のテストラウンドの主な結果は、礼儀正しいプロンプトがトークン出力長を14.426トークン削減することを示した。

礼儀正しいプロンプト形式が生成された出力長(トークン)に与える影響を示す推定結果。
分析は、礼儀正しいプロンプトの3つのサブセットを使用して、頑健性をテストするために繰り返された。プロンプトは、明示的なマーカー(「ください」や「ありがとう」)を使用したもの、ただ「ください」を使用したもの、または「できるか」や「できますか」などの暗黙の礼儀正しさを持つものだった。

礼儀正しさの種類に基づく推定結果。
主な結果の頑健性を検証するために、プロンプトの礼儀正しさの二次的な分類が、LIWCフレームワークを使用して実行された。LIWCフレームワークは、言語的特徴に決定的なスコアを提供する。
LIWCは、GPTの確率的な分類とは異なり、各プロンプトに安定した礼儀正しさスコアを割り当てることができる。さまざまな方法間の整合性を評価することができる。プロンプトは、LIWCの礼儀正しさスコアが0より大きい場合、礼儀正しいと分類され、さもなくば礼儀正しさのないと分類された。
LIWCとGPTの分類の一致は81%で、システム間の整合性を支持した。
LIWCとGPTの分類が一致するプロンプトのみを分析した場合、礼儀正しいプロンプトは依然として14トークン少ない出力トークンを生み出し、礼儀正しさをスライディングスケールで測定した場合、礼儀正しさの各ステップは平均で5トークンの出力削減をもたらした。

LIWCで再分類された場合でも、礼儀正しさによるトークンの節約が維持された。
堅牢性
礼儀正しさの影響がさまざまな種類のプロンプトにわたって変化するかどうかを評価するために、各プロンプトは、情報検索、テキスト生成、編集と書き直し、分類、要約、技術タスクなどのいくつかの事前に定義されたタスクカテゴリの1つに割り当てられた。
各プロンプトは、all-MiniLM-L6-v2 Sentence Transformersモデルを使用して、事前に定義されたタスク説明の埋め込みと比較することで、タスクラベルが割り当てられた。
コサイン類似度スコアは、各プロンプトとタスク定義のセットの間で計算され、最も類似しているラベルが割り当てられた。
タスクの種類は、礼儀正しさの影響がタスクのカテゴリによって変化するかどうかをテストするために、回帰分析の制御変数として使用された。タスクと処理の間の相互作用項も導入された。差別的な影響を確認するためである。
両方の場合、礼儀正しいプロンプトは一貫して短い出力を生み出し、タスクの種類間で有意な変化は見られなかった。

礼儀正しいプロンプトがすべてのタスクの種類で出力長を短縮したことを示す回帰分析の結果。
礼儀正しいプロンプトが短い応答を生み出すのは、質の低下によるものかどうかをテストするために、元のプロンプトと反事実的なプロンプトの出力を意味的類似性で比較した。all-MiniLM-L6-v2モデルを使用して、各応答を意味的ベクトル空間に埋め込み、ペア間のコサイン類似度を計算し、0.78の平均類似度を得た。つまり、意味はトーンが変わっても一貫していた。
ストップワード
短い出力で削減されるコンテンツの種類を理解するために、最も頻繁に削除される単語を調べた。これらは、「持っている」、「もっと」、「どこ」、「に」などの一般的なストップワードであり、文法的な役割を果たすよりは、意味的な役割を果たすものである。
トークンの削減が意味のあるコンテンツの喪失によって生じているかどうかを確認するために、ストップワードを削除し、最大4単語のフレーズを分析して、体系的な消失パターンを探したが、整合性のあるまたは意味のあるパターンは見つからなかった。礼儀正しい表現による削減は、意味のあるコンテンツを剥奪するのではなく、削減されていた。
したがって、礼儀正しさのないプロンプトに対する応答でより多くのトークンが使用されているように見えた。礼儀正しさのないプロンプトに対して、礼儀正しいプロンプトよりも多くのトークンが「課税」されているかのように。
人間の研究
出力の質がプロンプトのトーンによって影響を受けるかどうかをテストするために、人間の評価も実施された。20の礼儀正しいプロンプトと20の礼儀正しさのないプロンプトのペアをランダムに抽出した。
機密性の高い、または技術的なトピックに関するプロンプトを除外した後、401人の参加者が、7点満点で各応答を評価した。各参加者は、4つの条件の1つから、礼儀正しいまたは礼儀正しさのない、元のまたは反事実的なのいずれかから応答を1つだけ見た。
どの条件でも、感覚的な質の違いは見られなかった。 礼儀正しいと礼儀正しさのない出力はほぼ同じスコアを受け、元のと反事実的なバージョンも同じスコアを受けた。
研究者は、これらの結果は、トークンの削減が質の喪失によって生じたのではなく、言い換えや、意味を保ったままの構造的な変化によって生じたことを示唆していると主張している。
企業の請求額の差は、有用性や明瞭性の変化を反映するものではなく、課税は依然として機能している。
結論
新しい研究は、企業でのChatGPTの使用に焦点を当てているが、下位のユーザーもこの症状の影響を受ける。下位のユーザーも、トークンの使用制限があるため、ChatGPTに無礼に対応すると、トークンの割り当てが早く消費される可能性がある。
新しい研究は、人間とAIのやり取りにおける、注目を集める未解決問題に焦点を当てているが、研究者は、礼儀正しさの問題は、まだ発見されていない可能性のある、言語の奇妙な特性の1つである、より深い潜在的な問題の兆候であると強調している。推論のコストに影響を与える可能性がある。
2025年11月19日初版












