レポート
AIが読むものは何か?生成的な引用の隠れたメカニズムの中に

生成的なAIがデジタルランドスケープを再定義するにつれて、コンテンツの創作と発見の中心で新しい質問が浮上しています:AIは実際に何を読むのでしょうか?Muck Rackによる「AIが読むものは何か?」というタイトルの画期的な研究では、OpenAIのChatGPT(4oと4o-mini)、GoogleのGemini(FlashとPro)、AnthropicのClaude(SonnetとHaiku)などの主要なAIシステムからの100万件以上の引用を分析し、モデルが生成された回答で使用するリンクの背後にある隠れたダイナミクスを明らかにしました。
その発見は、ジャーナリズム、企業コミュニケーション、SEO、ブランド戦略に関わるすべての人にとって、明らかながらも変革的なものです。
引用は単なる付加物ではなく、AIの行動を再定義する
AIの世界に浸る人なら誰でも明らかなように、単に引用機能を有効または無効にするだけで、回答自体が変わります。引用が無効になっている場合、AIは静的なトレーニングデータに頼ります。しかし、引用が有効になっている場合、モデルはリアルタイムで取得するソースによって直接形成される、物質的に異なる出力を生成します。
重要な例:メジャーリーグベースボールで最も悪いチームについて尋ねられた場合、引用が無効になっているAIは1962年のメッツを思い出します。しかし、引用が有効になっている場合、2024年のシカゴ・ホワイトソックスを含む、記録的な41勝121敗のシーズンについて更新された回答を出します。CBSスポーツを明示的に引用しています。
獲得メディアの優位性
全引用元の95%以上が、非課金メディアから来ています。これには以下が含まれます:
- 27%のジャーナリズムコンテンツ(例:ロイター、AP、フィナンシャル・タイムズ)
- 18%の政府/NGOサイト
- 13%の学術的または研究用ソース
- 10%のアグリゲーター/百科事典プラットフォーム(ウィキペディアまたはビジュアルキャピタリストなど)
対照的に、課金または広告コンテンツは、5%未満の引用を占めています。これは、AIモデルがマーケティング主導のコンテンツに系統的に偏っていることを示しています。
新鮮度バイアス:新しいコンテンツが勝つ理由
新鮮度は重要です。特にOpenAIのモデルでは、ジャーナリズムコンテンツの56%の引用がChatGPTによって行われ、過去12ヶ月以内に公開されたものでした。これは、36%のClaudeと比較されます。この傾向は、新しい、最近公開されたソースを古いソースよりも好むことを指します。
生成的なAIの文脈では、新鮮度バイアスは、言語モデルが、特にリアルタイムデータに接続されているものが、新しく公開された資料を参照して信頼する可能性が高いことを意味します。現在の出来事、新興技術、または政策変更に関するクエリに対しては、過去数ヶ月間に公開されたコンテンツが、より関連性の高い、または最新の洞察を提供するものとみなされます。
これは、コンテンツクリエイターとブランド戦略家にとって重要な洞察です:あなたの資料が古くなっている場合、たとえ1年だけでも、AI生成の回答に表示される可能性は大幅に低くなります。コンテンツを新鮮に保つことは、単にSEOのための良いことではなく、AIの時代に可視性を維持するために不可欠です。
異なるプロンプトが異なるソースを呼び起こす
AIモデルは、ランダムにソースを引用しません。質問のタイプに基づいて選択します。異なるプロンプトスタイルは、異なるタイプのソースを参照することにつながります:
- 事実の照会と百科事典的なクエリは、ウィキペディアやブリタニカなどの静的な参照サイトから情報を引き出します。
- 最近の出来事に関する質問は、AP、ロイター、またはアクシオスなどの主要なニュースルームからの引用を引き起こします。
- アドバイスまたは意見を求めるプロンプトは、モデルをよりダイナミックで会話的なソース、たとえばブログ、フォーラム、またはRedditやMediumなどのプラットフォームに向けます。
- 学術的または研究向けのタスクは、AIをarXivやPubMedなどのジャーナル、プレプリントサーバー、または政府が後援するリポジトリに導きます。
- 創造的なリクエストまたはステップバイステップの指示は、Quoraやニッチなテクノロジーフォーラムなどのプラットフォームからのユーザー生成コンテンツ、非公式なチュートリアル、またはコミュニティディスカッションスレッドを浮き彫りにします。
このバリエーションは、質問の表現方法が、どのドメインが浮き彫りになるか、どのドメインが見落とされるかを直接影響することを意味します。
たとえば、Claudeは、ChatGPTやGeminiよりも、メジャーなアウトレットであるロイターを50倍も頻繁に引用しません。
権威とドメインの重要性
高権威のアウトレットが支配的ですが、それらだけではありません。トップの引用元の15%のみが、複数の業界でトップ10に現れます。これは、ニッチ特有のコンテンツが報奨されていることを意味します。たとえば:
- 金融では、BankrateやNerdWalletなどのソースが好まれます。
- ヘルスケアでは、CDC.govやNIH.govなどの政府ソースが支配的です。
- テクノロジーでは、Udemy、Coursera、Mediumなどの学習プラットフォームがトップに立っています。
15ページ目には、Claudeが最もドメイン固有の多様性を示し、業界固有のソースを頻繁に選択していることが、ビジュアルヒートマップで示されています。一方、ChatGPTとGeminiは、一般的なメディアに頼りすぎています。
業界別の洞察:AIが各セクターで引用するもの
金融と保険
- ジャーナリズムは、37%の引用で、他の業界よりも多くなります。
- Claudeのトップ10ソースは、90%がユニークであり、より深いニッチの探索を示しています。
ヘルスケア
- 政府およびNGOサイトは、18%の引用で、業界横断的平均よりも2倍以上になります。
- Geminiは、このセクターでソースの多様性をリードしています。
旅行と航空
- 驚くことに、学術的な引用はほとんどありません(0.7%のみ)。
- FAA.govやIATA.orgなどのソースが支配的です。ニュースアウトレットへの依存度は低いです。
小売と電子商取引
- アグリゲーターは、他の業界よりも少なく、36%対28%です。
- Claudeは、最もニッチなコンテンツを引用しています。
メディアとエンターテインメント
-
ジャーナリズムが再び37%で首位に立ち、TVTechnologyやRadiokingなどのニッチプラットフォームがClaudeによって頻繁に引用されています。
テクノロジー
- ほとんどの百科事典的または学術的なソースは使用されません。
- Medium、Coursera、SproutSocialなどのプラットフォームは、実践者ベースの知識への傾向を反映して、目立つように現れます。
コミュニケーションとSEOチームへの影響
このレポートの発見は、生成エンジン最適化(GEO)が従来のSEOと同等の重要性を持つことを示しています。AIは、静的なデータベースを要約するだけでなく、リアルタイムでソースにリンクしています。そして、それらのリンクは以下の要因によって影響を受けます:
- 新鮮度:コンテンツを定期的に更新します。
- ドメイン権威:バックリンクを構築し、信頼を築きます。
- ニッチの関連性:業界に特化したコンテンツを作成します。
- コンテンツの種類:マーケティングページではなく、獲得メディアや情報提供コンテンツに焦点を当てます。
これは、コンテンツマーケター、PR専門家、パブリッシャーにとって、計算を変えるものです。如果あなたの目標はAI生成の結果に表示されることである場合、あなたはユーザーまたはGoogleだけではなく、AIが価値があると考えるコンテンツを作成する必要があります。
結論:AIによって読まれること(または無視されること)の結果
このレポートは、オンラインで情報が提示される方法における基本的な変化を強調しています:AIモデルはコンテンツを単に取得するのではなく、選択的にキュレーションします。而且、そのキュレーションはデジタル時代の可視性を再定義しています。
パブリッシャー、研究者、ブランドにとって、AIによって引用されることは、次の世代の検索の一部になることを意味します。ユーザーがあなたのサイトを訪問することはないかもしれませんが、モデルがそれを参照することを信頼するユーザーに、あなたのコンテンツを提示することになります。引用されるソースは拡大されます。そうでないものは、質に関係なく、完全に除外される危険があります。
この変化は、新しい勝者と敗者を生み出します。高権威のアウトレットや、タイムリーな獲得メディアが好まれる一方で、課金コンテンツ、軽く更新されたブログ、またはあまり知られていない声は、人によって読まれるだけでなく、人々が見るものを形作るシステムによっても読まれない可能性があります。
生成的なAIが知識の提供方法で中心的な役割を果たし続けるにつれて、重要な質問は、検索結果のランキング方法ではなく、AIが引用するに値するものになる方法についてになりますか。












