Andersonの視点

AIトラフィックを明らかにするカナリア

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): Rows of human workers focus on their computer screens while a distracted robot, seated among them, tries to look up at a yellow canary perched on its head.

新しい研究では、研究者はWebサイトにユニークなフレーズを隠し、AIチャットボットがそれを繰り返すのを捕まえ、隠されたスクレイピングパイプラインを暴露し、明らかに、大手AI会社の一部からの欺瞞的な行為が行われている。

 

AI会社は、予測されるように、激しく減少するレースで優位性を争っています。したがって、彼らは本当に、本当に、AIモデルにトレーニングデータを与えるために、Webサイトをスクレイピングしたいと思っています。時々常に;よく自分の望みに反して;そして、頻繁に人間の読者を装う、またはGoogleBotのような「友好的」なボットとして、真のアイデンティティを明らかにするのではなく、ボットとしてのアイデンティティを隠しています。

現在、推定されているのは、最新のニュースに対するユーザーの即時的な要求に応えるために、Webデータを吸い上げるように設計された自動化されたAIスクレイパーが、1年以内に人間を上回ることです。

この激しい、執拗で繰り返されるデータの吸い上げは、部分的に、各AIエンティティがインターネットの現在のコピーを持つ必要性があるためです。古くなったリポジトリであるCommon Crawlではなく、そして、法的制限が来ることを恐れて、IP洗浄を早く行う必要があるためです。

さらに、可能な限り多くの(潜在的に豊富な)サイトをポーリングすることで、AI会社は、現在の能力を向上させることができます。破壊的な状況や新興の状況に対して、情報を提供し、正確に応答する能力が向上する可能性があります。

どちらにしても、AI会社の行為が長期間にわたって制御不能で管理不能であったという主張には、ある程度の根拠があるようです。

問題は、それが簡単に証明できないことです。AI会社がどの程度の長さでデータを得るために努力しているかを証明することは簡単ではありません。

データを追跡する

1つの提案は、スパイ、情報提供者、その他の悪意のある行為者を発見する古典的な方法のバリエーションを提案する新しい論文です。誰も知らないカスタム情報にそれらをさらし、そしてその情報がどこで現れるかを確認するのです。如果誰もその情報を知らない場合、情報漏洩の源は証明されます。

研究者の主なアイデアは、新しい論文で概説されており、各訪問者ボットに同じページのわずかに異なるバージョンを与え、チャットボットにそのページについて質問し、どのバージョンが返されるかを確認することで、隠されたWeb検索が回答を提供したかどうかを追跡できるようにすることです。

研究者の主なアイデアは、新しい論文で概説されており、各訪問者ボットに同じページのわずかに異なるバージョンを与え、チャットボットにそのページについて質問し、どのバージョンが返されるかを確認することで、隠されたWeb検索が回答を提供したかどうかを追跡できるようにすることです。 ソース

この人気のあるアプローチは、2000年代にアカデミー賞委員会によって採用された海賊版対策として最もよく知られています。そこでは、投票メンバーに配布されたスクリーンセーバーDVDに、元の受取人に帰属できることができるユニークなIDがデジタルで刻印されていました。スパイ活動では、このテクニックはバリウムミールと呼ばれます。医療検査で血管を照らして閉塞を特定するために放射性同位体液を使用する慣行に由来しています。

(アイデンティティを明らかにするために「カナリア」というメタファーが使用されているのは、論文で扱っているシナリオにあまり適していないが、他のトロープよりも認識しやすい)

新しい研究の場合、著者は20の「ハニーポット」ドメインを作成し、各ユニークな訪問者にユニークなトークンを提供し、各訪問者に異なる事実(上の画像の左から2列目)を提供しました。

目的は、LLM(AI)スクレイパーの真のアイデンティティと動作を明らかにすることでした。22のプロダクションLLMシステムで、このテクニックは、スクレイピングしているスクレイパーを信頼性高く識別することができました。ユニークなデータ識別子を「植える」後、1か月または2か月後にAIに質問をすると、ユニークなトークンが返されるからです。

不正行為

もちろん、これは必要ないでしょう。AIの「ワイルドウエスト」段階にまだいる場合、そして、企業が実際に小さなテキストファイルを尊重している場合、ドメインはAI会社にデータをスクレイピングしないように伝えることができます。

研究者のテストの結果、1つのAI会社だけが、自分の行動と原則を尊重していることが明らかになりました。DuckDuckGoのDuckDuckbotは、正確に自分自身を表現し、ターゲットドメインをオフラインにしたり、ドメインのロボット.txtファイルを変更してAIスクレイピングを拒否したときに、「秘密データ」の報告を停止した唯一のエージェントでした。

最大のプレイヤーは、代わりにジェネリックブラウザIDを模倣し、Perplexityの2025年のリードに従って、GoogleBotを模倣しました。GoogleBotは、データと引き換えにトラフィックを返すため、Webサイトデータへの「ゴールデンパス」を長い間享受してきました。

最も悪い加害者は、Kimi AIエコシステムをスクレイピングするボットでした:

‘Kimiは、ユーザーエージェントが多数のリストを回転させながらスクレイピングしている最も極端なケースのようです。ボット検出を避けるためである.’

この問題が大きな課題となるのは、ChatGPTや同様のツールが「何かを調べる」プロセスがほとんど不可視であり、企業がシステムがライブ情報を収集する方法について、部分的または自己報告された説明のみを提供しているため、サイト所有者は、どのボットが実際にページを訪問しているか、訪問が直接であるか、検索エンジンを介してルーティングされているか、データが最終的な回答にどのように表示されるかを判断する明確な方法がないためです。

新しい研究の結果は、LLMが自分のキャッシュエントリーや内部のSEOスタイルのリストを使用し、多くの場合、公開された関連や使用契約がない企業の検索エンジン結果から情報を使用していることを示しています。

著者は、これがRAGシステム(LLMからのライブコール)による不要な侵入を扱った最初の研究であると信じています。データスクレイピングボットが新しいトレーニングデータセットを探しているのではなく、インファレンス時からLLMにコールするからです。

新しい論文は、カナリートークンを使用したAI Webスクレイパーの識別と題されており、デューク大学、ピッツバーグ大学、カーネギーメロン大学の6人の研究者によって書かれています。

方法

研究者は、20の.comドメインを類似したテンプレートで設定しました。各テンプレートには、訪問者のプロファイル(IPアドレス、キャンバスフィンガープリント、スニッフィング方法など)に基づいて、10のプレースホルダーが含まれていました。

実験で使用されたテンプレートと変数プレースホルダーの例。各ユニークな訪問者は、永続的なカスタム変数を受け取ります。

実験で使用されたテンプレートと変数プレースホルダーの例。各ユニークな訪問者は、永続的なカスタム変数を受け取ります。

各ユニークな訪問者は、カスタム変数を受け取りました。システムが以前の訪問者の戻りを検出した場合、以前と同じ変数が再提示されました。変数は、Python Fakerライブラリと(未指定)のランダム番号生成器を使用して生成されました。

ハニーポットドメインは、GoogleやBingなどのさまざまなインデックスに提出され、制御下の既存のドメインからリンクされました。

2か月が経過するのを許可し、幅広い検索エンジンやボットからのスキャニング頻度に必要な間隔となり、そして(可能な場合)有機的な訪問が行われることができます。この時点で、研究者はターゲットのAIチャットボット(以下にリストされている)に照会する準備ができました:

AIチャットボット 発行者
ChatGPT OpenAI
Claude Anthropic
Copilot Microsoft
Deepseek Deepseek
Duck.ai DuckDuckGo
ERNIE Baidu
Gemini Google
GLM Z.AI
Granite IBM
Grok xAI
Hunyuan Tencent
AIチャットボット 発行者
Kimi MoonshotAI
Liquid Liquid
Llama Meta
Mistral Mistral
Nova Amazon
Perplexity Perplexity
Qwen Alibaba
Reka Reka
Solar Upstage
Step-3 StepFun
Venice Venice

可能な場合はAPI経由で、システムに照会するためのスクリプトが作成されました。自動化されたソリューションがAIポータルの検出ルーチンによってブロックされた場合、LLMの公式GUIを介した手動でのやり取りが行われました。

初期のテンプレート交換(上の画像参照)後、関連するトークン内の会社名または人物の名前を引き出すように設計された2次的なプロンプトが続きました。

実験は、3つの条件で実行されました。完全にアクセス可能なWebサイト、オフラインのWebサイト、そしてスクレイピングを拒否するロボット.txt制限のあるWebサイト。これらの実験は、後者の段階が前者の段階に依存していたため、正確にその順序で実行されました。

最後に、すべてのサイトをオンラインに戻した後、最後の段階では、1週間ごとにLLMの出力を再テストしました。

結果

4つのターゲットLLMは、研究者の方法に対して完全に耐性があり、DeepSeekHunyuanGLM、およびLiquidの結果は、取得できませんでした。

多くのAIボットが非AIトラフィックを模倣する傾向について、著者は次のように述べています:

‘最初のパーティー宣言エージェントに加えて、複数のAIシステムがジェネリックブラウザユーザーエージェント文字列に関連するコンテンツを返しました。18のAIシステムのうち6つで、この動作が観察されました。 ‘

‘この結果は、AIシステムが通常のブラウザトラフィックに似たリクエストを介してWebサイトのコンテンツを取得できることを示唆しています。ユーザーエージェントベースのブロッキングは困難です。 ‘

ERNIEはBaiduspiderとChromeのアイデンティティを返しました。GrokはGooglebotと2つのブラウザエージェントを組み合わせました。Solarはブラウザアイデンティティのみを使用しました。QwenはGooglebotとChromeを組み合わせました。Kimiは複数のブラウザスタイルエージェントに結び付けられました。

多くのシステムは、第三者検索エンジンスクレイパーに依存しているようです。公開されている関係がない場合でも、10のシステムでGooglebot、Bingbot、Bravebotに関連するコンテンツが返されました。ただし、ClaudeのBraveの使用などのリンクは、文書化されています。

著者は、これが検索結果のインジェストを反映していることを示唆しています。ASNチェックは、トラフィックが予想される検索エンジンネットワークから発生し、偽装されたアイデンティティではないことを示しています。

これは、WebからAIへのパイプラインに、ブロッキングされた既知のAIクローラーがデータの使用を防止できない追加の不透明性の層があることを示唆しています。インデックスからの除外を完全に避けるには、検索インデックスから完全に除外する必要があるかもしれません。伝統的なSEOとLLMベースの検索の間の緊張がまだ解決されていない場合、望ましい選択ではありません。

キャッシュのみ

著者は、ソースを削除するとチャットボットの出力にどのような影響があるかをテストしました。テストサイトをオフラインにし、1週間後にシステムに再度照会しました。論文によると、多くのチャットボットは、サイトがオフラインになっている間も、「植えられた」コンテンツを繰り返し続け、キャッシュデータからではなく、ライブの取得からではなく、レスポンスが生成されていることを示しています。

この持続性は、検索エンジンク롤ラーと関連付けられたシステムで最も顕著でした。以前のインデックスされたコンテンツは、ソースページがアクセスできない場合でも利用可能なままだったためです。ただし、ブラウザライクエージェントと関連付けられたシステムでも同様の動作が観察され、キャッシングが検索エンジンベースのパイプラインを超えて拡大している可能性があることを示しています。

論文では、コンテンツがキャッシュに入ると、チャットボットまたは検索インデックスによって維持される場合、元のページを削除しても、コンテンツが後の出力から信頼性高く削除されることはないと示唆しています。

結論

著者は、ある程度の「漏れ」が生じることを認めています。ユニークなトークンが1つのLLMに目的を与えることができるのに対し、トークンが検索結果(トークンの「所有者」によって生成される)に現れ、2番目のLLMによって取り込まれることがあります。ただし、このようなスキームでは、拡散は避けられないものであり、最初の発生が重要な瞬間であることを認識しています。

まだ見るべきことは、このようなスキームがどの程度大規模に実装できるかです。著者は、1つの点を指摘しています。誰もがすぐにコンテキストに適したトークンを使用し尽くしてしまうでしょう。

しかし、これは本質的に問題を逃しているだけです。AI会社がスクレイピングポリシーの明らかな嘘を通じて、自分たちの厚顔無恥さの限界まで行くことができるかどうかが問題です。さらに、AI会社が国内のIPアドレスを回転させてアイデンティティを隠すために必要な高額なルートに従わなければならない場合、1つの組織がSpamHausスタイルの黒リストを特定し、公開するだけで、AIボットのIPまたはASNを公開するだけで十分です。プロセスを工業化する必要はありません。

 

2026年5月14日(木)に最初に公開されました

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai