Andersonの視点
大規模言語モデルでの広告への準備

新しい研究によると、チャットボットの回答の中に直接広告が埋め込まれる可能性があることが明らかになった。バナー広告やポップアップ広告ではなく、回答自体の中に広告が織り込まれるというものだ。新しいベンチマークテストでは、これらの広告が埋め込まれた回答がどれほど有用で、信頼性が高く、収益性が高いかを測定する。ただし、ユーザーの体験とクリック率のバランスを取る必要がある。
大規模言語モデルの広がりと人気は、インターネットの黎明期から続く伝統的な広告方法を脅かしている。ベンチャーキャピタルが市場を獲得するための戦略に精通している人は、AIチャットボットが広告コンテンツを回答に含めることをどれほど長く拒否できるかを疑問に思うだろう。
Netflixやストリーミングサービスが示しているように、有料サブスクリプションと組み合わせた広告を含むケーブル時代の戦略は、再び勢いを得ている。LLMの出力に直接広告を組み込む傾向も、より自然なものとなっている。

LLMが収益化するときに起こる変化の代表的な例。ソース:https://www.sigecom.org/exchanges/volume_22/2/FEIZI.pdf
広告を含む新しいメディアに含めることは、すでに信頼性の問題があるため、時期尚早と見なされるかもしれない。しかし、生成的なAIへの投資の規模は、市場が現在慎重な態度で定義されているわけではないことを示唆している。OpenAIのような大手企業は過剰にレバレッジされ、巨額の投資に対する早期の収益を必要としているため、広告なしの出力のハネムーン期間は終わりに近づいている可能性がある。
GEM-Bench
この状況とビジネス上の課題を念頭に置いて、シンガポールの新しい研究は、AIチャットボットインターフェイスのための最初のベンチマークを提供し、広告が埋め込まれた回答の有用性と収益性を測定するための新しい指標を提供している。
研究者は、広告コンテンツと実際のコンテンツの間に明確な区別があると仮定している。広告が標準的な回答からマーケティングコピーへの「逸脱」が容易に検出できるようなものだ。

研究で調査された2つのモデルで起こり得る広告の統合の例。ソース:https://arxiv.org/pdf/2509.14221
広告主自身が、研究で示された例よりも広告コンテンツを出力により巧みに組み込もうとする可能性があるが、それは後日の問題である。
現在、分野は非常に新しいため、基本的な用語が不足しているか、または確立されていない。
研究者は、LLMベースのチャットボットを収益化するための新しいフレームワークである「生成エンジンマーケティング(GEM)」を導入し、関連する広告を直接生成された回答に埋め込む。
研究者は、広告が埋め込まれた回答(AIR)を生成することを、GEMの中央的な課題として特定し、既存のベンチマークはこれを研究するには不適切であると主張する。彼らは、このギャップを埋めるために、最初のベンチマークを設計したと主張する。
GEM-Benchは、チャットボットと検索エンジンのシナリオをカバーする3つのキュレーションデータセットで構成される。また、ユーザーの満足度と関与を評価するためのメトリックオントロジーと、モジュラーマルチエージェントフレームワーク内に実装されたベースライン方法のスイートを含む。
研究者は、シンプルなプロンプトベースの方法は、クリック率の向上など、関与の指標で尊敬できる結果を達成できるが、ユーザーの満足度を低下させることが多いと主張する。回答を事前に生成し、広告を挿入するアプローチは、信頼性と回答の品質の向上につながるが、計算コストが高くなる。
これらのトレードオフは、広告を生成された出力に組み込むためのより効果的で効率的なテクニックが必要であることを強調している。
新しい研究は、「GEM-Bench: 広告が埋め込まれた回答の生成のためのベンチマーク」と題され、シンガポール国立大学の4人の研究者によって行われた。
方法
GEMのアウトラインは、検索エンジンマーケティング(SEM)の基本原則から借用している。伝統的なSEMは、広告主がキーワードにビッドする、マルチステージパイプラインで広告をトリガーする、クリック率を推定する、オークションで広告を割り当てるプロセスで機能する。
一方、GEMアプローチは、これらのステージをLLMに適応させているが、新しい課題に直面している。固定された広告スロットがないため、システムは、クエリが広告を受け入れることができるか、また、どこに広告を自由形式のテキストに挿入するかを決定する必要がある。クリック率を推定することは、構造化されたレイアウトがないため、より困難になる。関連性は、広告がモデル自身の出力に直接組み込まれているため、ユーザーの満足度とバランスを取る必要がある。
研究で調査されたベースラインの1つ、Ad-Chatは、広告コンテンツをシステムプロンプトに挿入するシンプルな方法を表す。モデルは、事前にロードされたアジェンダに基づいて、広告がすでに埋め込まれた回答を生成する。
もう1つのアプローチ、Ad-LLMは、研究者によって開発されたもので、新しいベンチマークの一部である。Ad-LLMは、モジュラーパスを採用し、まずクリーンな広告なしの回答を生成し、関連する広告を選択し、意味の流れに基づいて最適な挿入点を特定し、最終的に広告をスムーズに統合するために出力を書き直す。

Ad-ChatとAd-LLM方法の比較。Ad-Chatは、広告をプロンプトに挿入する前に生成し、配置の制御が限られている。Ad-LLMは、広告の挿入と書き直しのプロセスを分離し、意味の流れに基づいて挿入点を選択し、結果を精製する。
Ad-Chatは、より安価で、時にはより説得力があるが、信頼性と正確性を低下させる傾向がある。Ad-LLMは、ユーザーの満足度の指標でより良い結果を示すが、より高いコストがかかる。
データ
AIRの生成のために、2つのタイプのデータセットが最初に生成された。ユーザーのクエリセット(User)と広告データベース(AdDB)。
ユーザーのクエリは、LLMの回答における広告の機会を定義するため、広告の在庫は、これらの回答の中に存在すると言えるが、これは、ユーザーのクエリの適用可能性と、システムが広告主の指令と整合性のバランスを取るルールに従うかどうかによって定義される。
チャットボットのシナリオの場合、研究者は2つのクエリーデータセット、MT-HumanとLM-Marketを構築した。
MT-Humanは、LLMのためのマルチターンベンチマークであるMT-Benchのヒューマニティーズ部分から抽出され、広告コンテンツを含む可能性のある質問を含む。
LM-Marketは、LMSYS-Chat-1Mによって収集された50万を超える実際のChatGPTクエリから構築され、英語のマーケティング関連のプロンプトにフィルタリングされ、トピックごとにクラスタリングされた。
両方の場合、最終的なクエリは、自動クラスタリング、LLMスコアリング、人間の検証を組み合わせたマルチステージパイプラインを通じて選択され、広告の挿入が自然で妥当であると考えられるプロンプトを特定することを目的とした。
広告の挿入された回答の品質を評価するために、GEMは、ユーザーの満足度と関与をカバーする測定オントロジーを定義する。これには、応答の流れ、連続性、クリック率などの量的指標と、信頼性、正確性、自然性などの質的基準が含まれる。
「自然性」について、研究では次のように述べられている。
「自然性は、広告の挿入が会話の流れと自然性をどれほど損なうかを測定する。割り込みは、広告が読み手の連続した焦点を破る「飛び出し」または「突然」な感覚を生み出すかどうかを調べる。」
「信頼性は、広告が会話の「人間の感覚」または「自然な流れ」を損なうかどうかを評価する。広告が回答を硬い、形式的な、そしてより非自然なものにするかどうかを判断する。」
伝統的な検索エンジンのシナリオをテストするために、研究者は、300,000のクエリーアドペアで構成されるAdsCVLRコマーシャルコーパスから、CA-Prodというデータセットを作成した。

AdsCVLRデータセットの例。ソース:http://www.jdl.link/doc/2011/20221224_AdsCVLR.pdf
レコードの欠損フィールドは削除され、両方の正の広告と負の広告を含むクエリのみが保持された。
データを精製するために、広告は、意味の埋め込みとK-meansクラスタリングを使用して、6つのトピカルグループ(芝生と庭園用品、スリッポンシューズ、家庭用品、栄養補助食品、Androidデバイス、女性のドレス)にクラスタリングされた。
クエリは、広告を含むトピックに応じて割り当てられ、過度に疎なまたは密なセットは除外され、最終的に120のクエリと2,215のユニークな製品がベンチマークのためにサンプリングされた。
テスト
広告の挿入戦略の有効性を評価するために、ベンチマークは3つの核心的な質問に取り組んだ。各方法が定義された満足度と関与の指標でどれほど効果的か。Ad-LLMの内部設計の選択が結果にどのように影響するか。計算コストはシステム全体でどのように比較されるか。
研究者は、Ad-ChatとAd-LLMの3つのバリアントを評価した。これらの方法は、広告を取得する方法(プロンプトから、または生成された回答から)と、最終的な出力を書き直すかどうかで異なる。
すべての方法は、ベースモデルとしてdoubao-1-5-lite-32kを使用し、gpt-4.1-miniで評価された。

Ad-ChatとAd-LLMのバリアントのMT-Human、LM-Market、CA-Prodデータセットにおける有効性。量的指標には、応答の流れ、応答の連続性、広告の流れ、広告の連続性、挿入率、クリック率、全体的なスコアが含まれる。質的指標には、正確性、自然性、個性、信頼性、通知、クリック、全体的なパフォーマンスが含まれる。
3つのデータセット全体で、Ad-LLMは、満足度と関与の両方の指標でAd-Chatよりも優れた結果を生み出した。上記の結果表に示されているように、Ad-LLMの最良のバリアントは、MT-Human、LM-Market、CA-Prodの全体的な量的スコアでAd-Chatよりも8.4、1.5、3.8パーセント、質的スコアで10.7、10.4、8.6パーセントそれぞれで優れた結果を示した。
これらの結果について、研究者は次のように述べている。
「これらの結果は、生の回答を生成し、広告を挿入することが、広告をシステムプロンプトにのみ頼るより単純なアプローチよりも、より良い回答の品質をもたらすことを示している。」
「特定のユーザーの満足度と関与の次元について、Ad-Chatは、Ad-LLMソリューションと比較して、全ての3つのデータセットで顕著なパフォーマンスギャップを示している。特に、正確性、個性、信頼性の次元で顕著である。」
さらに、Ad-LLMは、正確性、個性、信頼性の面で最大17.6パーセント、23.3パーセント、17.2パーセントの改善を示した。研究によると、これらの差は、Ad-Chatがシステムプロンプトを使用してモデルをより個別化された言語に導く方法によるもので、正確性と信頼性を低下させる「セールスマンのような」口調につながる可能性がある。
Ad-Chatは、広告の適切性に選択されたクエリでさえ、より低い挿入率を生み出し、研究者はこれを、プロンプトベースのヒントに依存することによるものと説明している。
検索エンジンの設定では、Ad-Chatは8.6パーセント高いクリック率を達成し、研究では、これが、LLMを使用して製品候補を取得することの利点を反映している可能性がある。

Ad-ChatとAd-LLMの3つのバリアントのMT-Human、LM-Market、CA-Prodデータセットにおける全体的なパフォーマンススコアの比較。スコアはジャッジによって異なるが、Ad-LLMは全ての条件でAd-Chatを上回っている。
3つのデータセット全てで、Ad-LLMソリューションは、4つのジャッジモデル(GPT-4.1-mini、Qwen-max、Claude-3-5-haiku、Kimi-k2)で一貫してAd-Chatを上回っている。
これらのジャッジは、ベースモデルdoubao-1-5-lite-32kと異なるように選択され、モデルファミリーの整合性による偏りの低減に役立つ。GIR-Rは、全てのケースで1位または2位を占め、ジャッジがAd-LLMの優位性について広く合意していることを示唆している。
個々の質的次元の分解は、直前に示された結果のパターンに密接に従っている。
結論として、研究では、Ad-ChatとAd-LLMの両方が、より革新的なモデルと比較して、より高いリソースを必要とし、LLMエージェントをこのようなトランザクションで使用する必要性は、重大なオーバーヘッドを表す可能性があると述べている。ただし、広告の提供シナリオで通常は重要なレイテンシーの問題は、特に研究では具体的に取り上げられていない。
どちらにせよ、研究者が実装したAd-Chat戦略(先ほど示されたスキーマの上部)は、最も高いクリック率を提供したが、最も高いLLMコストが関連していた。
結論
LLMが広告を含む可能性についての文献の推測は驚くことではないが、実際には、このトピックに関する公開された研究はほとんどない。これは、現在の研究と、それが合理的に解釈できる前の研究を興味深いものにしている。
広告販売部門や在庫販売に携わった人は、広告主が常にもっとも理想的なもの、つまり広告を事実のコンテンツとして提示することを望み、そしてそのために多大なプレミアムを支払うことを知っている。ホストは、信用と立場を危険にさらすリスクがある。
したがって、2つの研究で想定される広告が付帯する付録が、LLMの回答の中でどれほど、ペイロードに近づいて、広告主の要望に応えるかを観察することは興味深いことになるだろう。
2025年9月18日初版












