报告
什么是AI正在阅读的内容?——揭秘生成性引用机制

随着生成性AI重塑数字化格局,内容创作和发现的中心出现了一个新的问题:AI到底在阅读什么?一项开创性的研究《什么是AI正在阅读的内容》由Muck Rack的Generative Pulse进行,分析了超过100万个引用,来自主要的AI系统,包括OpenAI的ChatGPT(4o和4o-mini)、Google的Gemini(Flash和Pro)以及Anthropic的Claude(Sonnet和Haiku),以揭示这些模型在生成响应时使用的链接背后的隐藏动态。
研究结果不仅令人启示,而且对于新闻、企业沟通、SEO或品牌战略领域的人来说具有变革性的意义。
引用不仅仅是附加项——它们重塑了AI的行为
对于任何沉浸在AI世界中的人来说,很明显,简单地启用或禁用引用功能就能改变答案本身。当引用被禁用时,AI更依赖静态训练数据。但当引用被启用时,模型生成的输出会有明显的变化,直接受到它们拉取的实时来源的影响。
关键示例:当被问及最差的美国职业棒球大联盟球队时,一个禁用了引用的AI提到了1962年的纽约大都会队。但是,当引用被启用时,它更新了答案,包括2024年的芝加哥白袜队,创下了41胜121负的记录,并明确引用了CBS Sports。
获得媒体的主导地位
超过95%的所有引用来源来自非付费媒体,包括:
- 27%的新闻内容(例如路透社、美联社、金融时报)
- 18%的政府/非政府组织网站
- 13%的学术或研究来源
- 10%的聚合器/百科全书平台,如维基百科或Visual Capitalist
相比之下,付费或广告内容占比不到5%,这表明AI模型系统地偏向反对营销驱动的内容。
新鲜度偏见:为什么新内容更胜一筹
新鲜度很重要,特别是对于OpenAI的模型。在新闻内容中,56%的引用由ChatGPT生成,这些引用是在过去12个月内发布的,相比之下,Claude的比例为36%。这种趋势被称为新鲜度偏见,指的是模型更喜欢新的、最近发布的来源,而不是旧的,即使旧的来源可能仍然准确或相关。
在生成性AI的背景下,新鲜度偏见意味着语言模型,尤其是那些与实时数据相连的模型,如ChatGPT,更有可能引用和信任新近发布的材料,特别是在处理当前事件、新兴技术或政策变化等问题时。对于时间敏感的提示,如“最新的门诊治疗进展”或“最近的音频录制创新”,模型会大量权重在过去几个月内发布的内容,假设这些内容具有更相关或更新的见解。
这是对内容创作者和品牌战略师的一个关键洞察:如果您的材料已经过时,即使只过了一年,它也很可能不会出现在AI生成的答案中。保持您的内容新鲜不仅仅是好的SEO——在AI时代,这是可见性的必要条件。
不同提示触发不同的来源
AI模型不会随机引用来源——它们会根据被问的问题类型进行选择。不同提示风格会导致不同类型的来源被引用:
- 事实查找和百科全书查询往往会从静态参考网站如维基百科和大英百科全书中获取信息,依赖于已建立但往往较旧的信息。
- 最近事件问题通常会触发来自主要新闻机构如美联社、路透社或Axios的引用,在那里,速度和新鲜度至关重要。
- 建议或意见寻求提示会将模型转向更动态和对话式的来源,如博客、论坛或平台,如Reddit或Medium。
- 学术或研究导向任务会导致AI引用来自期刊、预印本服务器如arXiv,或政府支持的仓库,如PubMed或NCBI的内容。
- 创意请求或分步指南通常会出现用户生成的内容、非正式的教程或社区讨论线程,从平台如Quora或技术论坛中出现。
这种变化意味着问题的措辞方式会直接影响哪些域名被提升,哪些被忽略。
例如,Claude不太可能引用主要媒体如路透社,而ChatGPT或Gemini则更频繁地引用,Claude引用路透社的频率是ChatGPT的50倍。
权威和域名很重要——但并非统一
虽然高权威媒体占主导地位,但它们并不是唯一的参与者。只有15%的顶级引用来源在多个行业中都排名前10。这意味着细分领域内容被奖励。例如:
- 在金融领域,来源如Bankrate和NerdWallet更受青睐。
- 在医疗保健领域,政府来源如CDC.gov和NIH.gov占主导地位。
- 在技术领域,学习平台如Udemy、Coursera和Medium脱颖而出。
在第15页上,一个视觉热图显示Claude表现出最大的域名多样性,经常选择行业独特的来源,而ChatGPT和Gemini则更依赖一般媒体。
行业特定洞察:AI引用哪些来源
金融和保险
- 新闻占比为37%,超过其他任何行业。
- Claude的前10个来源中有90%是独特的,表明对细分领域有更深入的探索。
医疗保健
- 政府和非政府组织网站被引用18%的时间,超过跨行业平均值的两倍。
- Gemini在该领域的来源多样性方面领先。
旅行和航空
- 令人惊讶的是,学术引用几乎不存在(仅0.7%)。
- 来源如FAA.gov和IATA.org占主导地位,较少依赖新闻媒体。
零售和电子商务
- 聚合器如维基百科的引用较少,在这里比其他行业少(36%对28%)。
- Claude引用了最多的细分内容。
媒体和娱乐
-
新闻领先于37%,Claude经常引用TVTechnology和Radioking等细分平台。
技术
- 几乎没有百科全书或学术来源被使用。
- 像Medium、Coursera和SproutSocial这样的平台被突出,反映出对实践者基础知识的偏好。
对沟通和SEO团队的影响
该报告的发现表明,生成引擎优化(GEO)变得与传统SEO一样重要。AI不仅仅是总结静态数据库——它实时链接到来源。这些链接受到以下因素的影响:
- 新鲜度:定期更新您的内容。
- 域名权威:建立反向链接和信任。
- 细分相关性:创建适合您行业的内容,而不仅仅是通用主题。
- 内容类型:专注于获得媒体和信息内容,而不是纯粹的营销页面。
这改变了内容营销人员、公关专业人员和出版商的计算。如果您的目标是出现在AI生成的结果中,您必须创建AI认为有价值的内容——不仅仅是用户或谷歌。
结论:被AI阅读(或忽略)的后果
该报告强调了信息在线呈现方式的根本转变:AI模型不仅检索内容——它们有选择性地策划内容。这种策划正在重新定义数字时代的可见性。
对于出版商、研究人员和品牌来说,被AI引用意味着成为下一代搜索的一部分。这使您的内容面向可能永远不会访问您网站但信任模型引用的用户。被引用的来源被放大。那些没有被引用的来源,无论质量如何,都有可能被完全排除在对话之外。
这种转变创造了新的赢家和输家。高权威媒体和及时、应得的媒体受到青睐。同时,付费内容、轻微更新的博客或不太知名的声音往往被忽略——不仅仅是被人忽略,还被塑造人们视野的系统所忽略。
随着生成性AI继续在知识传递中发挥核心作用,问题不再是如何在搜索中排名,而是如何成为AI认为值得引用的内容的一部分?












