Andersonの視点

AIはウェブ検索を3つの異なる現実に分割する

mm
Unite.AI を Google の優先ソースに追加
AI-generated image (GPT-2): Three very different library staff members, a traditional librarian, a friendly service robot, and a salesman-like attendant, compete for a visitor's attention at a public library help desk.

新しい研究によると、Googleは自身の検索帝国の中で3つの異なる情報システムを使用しており、通常の検索、AI概要、Geminiはそれぞれ異なるソース、ランキング、コンテンツを優先している。

 

還元主義が支配的である。過去12ヶ月間にわたって、‘私にGoogle検索をさせてください’というメームは、新しい‘私にGoogle検索結果を要約してください’トレンドに取って代わられ、検索結果でAI概要が増えてきている。これにより、読者は検索リンクをクリックする手間を省けるが、同時に、元のサイトの収益を減らしている可能性もある。

誰もが考えるとおり、コアな知識、知識を得るためのサイトの選択は、伝統的なウェブ検索、AI概要、LLMの使用によるウェブ検索の3つの最も人気のある方法で相対的に似ていると思われる。しかし、最近の研究によると、これは驚くほど遠いことである。

三つに分割

ニュージャージー工科大学の6人の研究者による新しい論文では、3つの検索方法がどのように分岐しているかを示し、いくつかの理論的な説明を提供している。

論文では次のように述べられている。

‘[まず、私たちは] 51.5%の代表的な、実際のユーザーのクエリに対して、AIOが生成され、有機検索結果の上に表示されることを発見した。論争的な質問は頻繁にAIOを引き起こす。 ‘

‘2番目に、私たちは、検索エンジンごとに取得されるソースが大きく異なることを示した(平均ジャカード類似度は0.2未満)。伝統的なGoogle検索は、政府や教育機関の人気サイトや機関サイトから情報を取得する可能性が高く、生成的な検索エンジンはGoogle所有のコンテンツを取得する可能性が高くなる。 ‘

‘3番目に、私たちは、GoogleのAIクローラをブロックするウェブサイトは、AIOによって取得される可能性が低いことを観察した。 ‘

この論文は、通常の線形的なワークフローに従わない、多くの面白い洞察を提供している。そこで、これらの洞察と他のいくつかの洞察を詳しく見ていくことにする。

古い’2-1′

研究の1つの興味深い発見は、GoogleのAI概要が突然のニュースイベントの場合に抑制されることを示唆している。なぜなら、最初の情報源は最も正確なものではない可能性があるからである。

このシステムは常に機能するわけではない。研究者によって指摘された以下の例では、GoogleのAI概要はボクシングマッチの結果を誤って報告していた。誤った結果を報告していた唯一の情報源は、Facebookの風刺スポーツフィードだった。

GoogleのAI概要は時間 крит的な要約を避ける理由の1つは、初期の情報が不完全または不正確である可能性があることである。この場合、ボクサーJake Paulは実際に試合に負けていた。ソース - https://arxiv.org/pdf/2604.27790

GoogleのAI概要は時間 крит的な要約を避ける理由の1つは、初期の情報が不完全または不正確である可能性があることである。この場合、ボクサーJake Paulは実際に試合に負けていた。ソース – https://arxiv.org/pdf/2604.27790

研究者は、AIOが質問記号で終わるクエリの場合に生成される可能性が高く、クエリの意図がAIOが提示されるかどうかの要因であることを指摘している。

研究者のテストの1回でAI検索要約が生成された割合。ここで'情報提供'は直接の質問を示し、他のタイプのインタラクションよりもAIOを生成する可能性が高い。

研究者のテストの1回でAI検索要約が生成された割合。ここで’情報提供’は直接の質問を示し、他のタイプのインタラクションよりもAIOを生成する可能性が高い。

さらに、論文では、長いクエリはAI概要を生成する可能性が高く、ただし、研究者はこれに説明を提供していない。

分裂した王国

新しい研究から得られた最も驚くべき結果の1つは、Googleの3つの検索プラットフォーム間の結果の質/タイプの重複が相対的に小さいことである。

論文では、通常のGoogle検索、AI概要、Gemini(LLM)が同じクエリに対して明らかに異なるソースを取得することを繰り返し示している。重複スコアは低く、Google内に3つの競合する取得ロジックを示唆している。ユーザーは、Googleが1つの権威あるインデックスと1つのランキング哲学を持っていることを想定するかもしれないが、

Googleのエコシステム内でさえ、伝統的な検索、AI概要、Geminiの重複は驚くほど小さかった。同じクエリに対して、3つのシステムはしばしば大きく異なるソースリストを生成した。この比較では、ショッピング、論争、ローカル検索、一般知識の質問など、数千の検索クエリに対して、3つのシステムがどれだけ一致したかを示している。スコアが低いほど、選択されたソース間の合意が少ないことを示す。

Googleのエコシステム内でさえ、伝統的な検索、AI概要、Geminiの重複は驚くほど小さかった。同じクエリに対して、3つのシステムはしばしば大きく異なるソースリストを生成した。この比較では、ショッピング、論争、ローカル検索、一般知識の質問など、数千の検索クエリに対して、3つのシステムがどれだけ一致したかを示している。スコアが低いほど、選択されたソース間の合意が少ないことを示す。

この分析のセクションについて、著者は次のように述べている。

‘[上の表]は、ベンチマークデータセットの各クエリに対して、AIO、Gemini、伝統的なSERPによって返されるソースのリストの平均類似度を示している。 ‘

‘主な結論は、クエリのサブセットや比較される検索エンジンのペアに関係なく、取得されるリストは似ていないということである。 ‘

研究者は、検索方法のどれもランクバイアスオーバーラップ(RBO)が0.27を超えることがないことを指摘し、これは非常に低いスコアである。Amazon Retailやローカライズされたクエリ(例:‘私の近くに店舗’)が検索方法間で最も類似性が低かったことを報告している。

自己サービス..?

特定のウェブサイトまたはウェブサイトのカテゴリは、AI概要とLLMベースの検索の出現によって、好影響または悪影響を受けた。

伝統的なGoogle検索と比較して、AI概要とGeminiは多くの主要ウェブサイトからの引用を減らし、より少数の優先ドメインの可視性を高めた。YouTubeは両方のシステムで最大の利益者となったが、Reddit、Wikipedia、Facebook、多くの機関ソースはAI生成の取得でより頻繁に表示されなかった。

伝統的なGoogle検索と比較して、AI概要とGeminiは多くの主要ウェブサイトからの引用を減らし、より少数の優先ドメインの可視性を高めた。YouTubeは両方のシステムで最大の利益者となったが、Reddit、Wikipedia、Facebook 、多くの機関ソースはAI生成の取得でより頻繁に表示されなかった。

著者は、テスト中にいくつかの予期せぬ好みが現れたことを指摘している。

‘[上のグラフ]から3つの主な結論を導き出すことができる。まず、大きな有名なウェブサイトが最も影響を受ける。これは、ウェブサイトが多くの異なるクエリに関連する評判とコンテンツの多様性を持っているため、当然と言える。 ‘

‘2番目に、生成的な検索エンジンは情報源としてよりニッチなソースを使用する傾向がある。 ‘

‘3番目に、GoogleのAIOはGoogleのウェブサイト(google.comとyoutube.comドメイン)を優先する。 ‘

‘GeminiもYouTubeを優先するが、絶対的な差は小さくなる。 ‘

ブロッカーはありますか..?

研究では、GoogleのAIクローラをブロックする出版社は、AI概要に表示される可能性が低いことが発見された。

これは、明らかな自殺行為のように見えるかもしれないが、実際には、Googleはコンテンツがブロックされている場合でも、コンテンツはAI概要に表示されないことを公に述べている。ただし、出版社はデータをスクラップされず、次のAIトレーニングラウンドに使用されないだけである。

しかし、これが新しい論文の研究者によって得られた結論ではなかった。代わりに、彼らは、人気のあるAIバンを実施している出版社は、Geminiによってほとんど引用されないことを発見した。’実質的にブロックされた’出版社は、NYTimes、CNN、BBC、ScienceDirect、Reuters、Wiley、Nature、ESPN、Business Insider、CNBC、NPR、WIRED、USA Today 、NBC News、Genius、National Geographic、The Conversation、U.S. News & World Report、Scientific American、Consumer Reports、STATであった。

上記にリストされている出版社によって実施されたいくつかのrobots.txt AIスクレイピングブロック。ただし、これがGoogleによるより広範な非難につながったのでしょうか?

上記にリストされている出版社によって実施されたいくつかのrobots.txt AIスクレイピングブロック。ただし、これがGoogleによるより広範な非難につながったのでしょうか?

著者は次のように述べている。

‘分析の最も影響を受けたドメインについて、21の人気の出版社(Google検索とAIOによって少なくとも20のユニークなクエリで取得される)はGeminiによって引用されることはなかった。 ‘

‘Facebook、Instagram、TikTok、IMDb、Yelp、Tripadvisorなどのいくつかの人気のあるソーシャルメディアとレビューサイトも、Geminiによって引用されることはなかった。さらに調査したところ、これらのウェブサイトはすべて、robots.txtファイルでGoogle-Extendedボットをブロックしていることがわかった。 ‘

これらの結果が他の場所で検証され、持続する場合、企業がGoogleのAI操作と協力するように圧力をかけられている可能性があると推測できる。ただし、新しい研究の結果は、計画よりも混沌を示唆しており、結果は表面的に「復讐的」に見えるが、実際には何が原因なのかは不明である。

結論

意見 この論文は、10ページの論文ながら、驚くほど多くの新しい発見を提供している。私たちはまだこれらの発見の小さな部分しか扱っていないので、読者には元のPDFを読むことをお勧めする。

『黄色い』態度で、この研究の発見に多くの否定的な解釈を与えることは可能だが、この研究は、世界的なテクノロジー企業が、AIベースの検索で世界的なリーダーシップを獲得し、維持しようとしていることを示唆している。検索方法は3つあるが、論争は伝統的な検索エンジンの結果と、データのキュレーションとAIトレーニングを支配する、対照的な分散型選択方法の間にある。

AI Like It’s 1999

Googleの登場以前、検索結果を大量のデータで操作することができ、Googleのより洗練された検索ランキングアルゴリズムによってこの「数字のゲーム」は2002年頃に終焉した。ただし、高容量で低品質のコンテンツは、重要な利害関係があるため、実質的に消滅しなかった。

したがって、Common Crawlなどのハイパースケールコレクションが現代のAI革命の基礎を築いたとき、データの優位性は、自動化されたプロセスがフィルタリングとランキングする入力データの品質をどれだけ行えるか、そして、データをランク付けするために人に支払うお金がどれだけ利用できるかによって決まることになった。

大量のコレクションには、多くの悪質または低品質のデータが含まれており、これらは、トレーニングデータセットから簡単にフィルタリングできるものではないが、非倫理的または人種差別的なものではなかった。ただし、1999年から2001年頃のインターネット検索の結果と同様に、自己利益と大量のデータであった。

データの導入プロセスがまだ優れていないため、GoogleのAIをビジネスライクに動作させることは非常に難しい。GeminiのPageRankスタイルの決定は、Googleの政策エンジニアによってではなく、AIモデルをトレーニングする際のハイパースケールデータの変換と潜在的な埋め込みの不完全な理解によって決まるからである。

 

* 検索エンジン結果ページ。

著者の強調、ただし、引用符の中でイタリック強調が機能しないため、太字に置き換えました。

2026年5月13日初出。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai