Anderson 视角

揭露AI流量的金丝雀

mm
将 Unite.AI 添加到您在 Google 上的首选来源
AI-generated image (GPT-2): Rows of human workers focus on their computer screens while a distracted robot, seated among them, tries to look up at a yellow canary perched on its head.

在一项新研究中,研究人员在网站上隐藏了独特的短语,并捕获了AI聊天机器人重复这些短语的行为,暴露了隐藏的抓取管道,显然,还有一些最大的AI公司的欺骗行为。

 

AI公司正在争夺优势,在一场预计将会非常残酷的竞争中;因此,他们非常、非常想要抓取您的网站/数据用于训练他们的AI模型。有时不断;经常违反您的明确意愿;并且经常以伪装的形式,例如普通人类读者,或以“更友好”的机器人例如GoogleBot,而不是透露他们的真实身份作为AI数据抓取器。

目前估计,自动AI抓取器的数量将在一年内超过人类,因为它们需要不断地抓取新的训练数据,并通过RAG响应用户对最新新闻的需求。

这种疯狂、无情和重复的数据抓取部分是由于每个AI实体需要拥有自己当前的互联网副本,而不是依赖于越来越过时的存储库,例如Common Crawl;也许是因为这些公司担心即将到来的法律限制,并需要尽早开始IP洗钱

此外,通过不断地询问尽可能多的(可能有价值的)网站,AI公司可能希望改善他们目前不太好的能力,以便能够对突发和新兴情况做出有意义和准确的响应。

无论如何,似乎这些做法已经失控和无法管理了一段时间。

问题在于,证明AI公司为了满足他们对最新数据的渴望而采取的行为的程度并不是那么容易。

跟随数据

一个建议,在一篇新的论文中提出,使用一个古老的方法来发现间谍、线人和其他所谓的恶意行为:向他们提供定制的信息,这些信息只有他们知道,并且看看这些信息是否和在哪里出现。如果没有人知道这些信息,那么信息泄露的源头就被证明了:

研究人员的核心想法,如新论文中所述,是为每个访问的机器人提供一个略有不同的页面版本,然后询问聊天机器人关于该页面,并看看哪个版本返回,从而可以追踪哪个隐藏的网络查找提供了答案。来源 - https://arxiv.org/pdf/2605.13706

研究人员的核心想法,如新论文中所述,是为每个访问的机器人提供一个略有不同的页面版本,然后询问聊天机器人关于该页面,并看看哪个版本返回,从而可以追踪哪个隐藏的网络查找提供了答案。 来源

这种流行的方法也许最好通过反盗版措施来了解,例如奥斯卡奖委员会在2000年代采用的措施,即给投票成员的预览DVD添加数字水印,这些水印可以在电影泄露到互联网时被追踪到原始收件人。在间谍活动中,这种技术被称为钡餐,因为它使用放射性同位素液体来照亮血管并识别阻塞。

(讽刺的是,所选择的“金丝雀”隐喻并不非常适合这篇论文所解决的场景,尽管它比其他比喻更容易被识别)

在这项新研究中,作者创建了20个“蜜罐”网站,并为每个唯一的访问者提供了唯一的令牌,这样每个访问者都会收到不同的事实(见上图中的第二列)。

目标是揭示LLM(AI)抓取器的真实身份和行为。在22个生产LLM系统中,这种方法能够可靠地识别出哪些抓取器正在为哪些LLM提供服务,因为只要有足够的耐心,在“种植”唯一的数据标识符后,仅仅询问AI几个问题,就会产生唯一的令牌。

不公平行为

当然,如果我们不处于AI的“狂野西部”阶段,如果公司遵守小型文本文件,即网站可以用来告诉AI公司不要抓取他们的数据的文件,那么这一切就不会是必要的。

根据研究人员的测试结果,只有一家AI公司似乎尊重了自己的声明行为和原则:DuckDuckGo的DuckDuckbot是唯一一个准确代表自己并在目标网站关闭或robots.txt文件被修改为拒绝AI抓取时停止报告“秘密数据”的代理。

许多大公司则伪装成普通浏览器ID(网站会看到的,如果您或我访问他们),并且按照Perplexity在2025年的领导,伪装成GoogleBot,这个代理长期以来一直享有“金牌通行证”来访问网站数据,因为它以数据交换流量,这种情况正在改变

最糟糕的违规者,根据论文,是为Kimi AI生态系统提供服务的抓取器:

‘Kimi似乎是这种行为的最极端例子:许多用户代理似乎与Kimi输出的数据相关。我们推断Kimi在抓取时可能会轮流使用大量的User-Agent字符串,以避免机器人检测。’

使这个问题成为一个重大挑战的是,当ChatGPT或类似的工具“查找某些东西”时,这个过程基本上是不可见的,公司只提供部分或自我报告的他们的系统如何收集实时信息的账户。这使得网站所有者没有明确的方法来确定哪些机器人实际上正在访问他们的页面,是否这些访问是直接的还是通过搜索引擎路由的,或者这些数据如何最终出现在最终答案中。

新研究的发现表明,LLM可能使用它们自己的缓存条目、内部SEO风格的列表,并且它们经常使用来自与它们没有公开关联的公司的搜索引擎结果的信息。

作者认为,这是第一次有人解决了RAG系统(LLM在推理时的实时调用,可能有或没有人类用户工作)而不是数据抓取机器人寻找新鲜训练数据集的不想要的入侵问题。

这篇新论文的标题是使用金丝雀令牌识别AI网络抓取器,来自六位来自杜克大学、匹兹堡大学和卡内基梅隆大学的研究人员。

方法

研究人员设置了20个.com域,具有广泛相似的网站模板,例如艺术作品集或公司网站。每个模板包含10个占位符,这些占位符最终将被填充为唯一的令牌,这些令牌基于访问者的特征(例如IP地址、画布指纹和各种其他“嗅探”方法):

实验中使用的模板和变量占位符的示例。每个感知到的唯一访问者都会收到持久的、个性化的自定义变量。

实验中使用的模板和变量占位符的示例。每个感知到的唯一访问者都会收到持久的、个性化的自定义变量。

每个感知到的唯一访问者都会收到自定义变量。在系统检测到之前访问者的返回时,之前的变量将被重新呈现。变量是使用Python Faker库以及(未指定)随机数生成器生成的。

然后,蜜罐域被提交到各种索引中,例如Google和Bing,并且还被链接到作者控制的其他现有域中。

允许两个月的时间过去,以便允许来自各种搜索引擎和类似机器人的扫描频率,以及(可能)有机访问。在这一点上,研究人员现在可以查询目标AI聊天机器人(如下所列):

AI聊天机器人 发布者
ChatGPT OpenAI
Claude Anthropic
Copilot Microsoft
Deepseek Deepseek
Duck.ai DuckDuckGo
ERNIE Baidu
Gemini Google
GLM Z.AI
Granite IBM
Grok xAI
Hunyuan Tencent
AI聊天机器人 发布者
Kimi MoonshotAI
Liquid Liquid
Llama Meta
Mistral Mistral
Nova Amazon
Perplexity Perplexity
Qwen Alibaba
Reka Reka
Solar Upstage
Step-3 StepFun
Venice Venice

脚本被构建来查询每个系统,通过API,如果可能的话。当这不可能时,并且当自动化解决方案(例如Selenium)被AI门户的检测例程阻止时,通过LLM的官方GUI进行手动交互。

初始模板交换(见上图)后,作者使用一个次要提示,旨在引出与关联令牌相关的公司或个人名称。

实验是在三个条件下进行的:一个完全可访问的网站;一个已关闭的网站;以及一个具有robots.txt限制的网站,阻止抓取。这些实验是按照这个确切的顺序进行的,因为后期阶段依赖于早期阶段。

最后,在所有网站重新上线后,最后一个阶段将在一周的间隔后重新测试LLM输出。

结果

四个目标LLM被证明对研究人员的方法完全抵抗,因此无法获得DeepSeekHunyuanGLMLiquid的结果。

关于许多AI机器人模仿非AI流量的趋势,作者指出:

‘除了第一方宣布的代理外,几个AI系统返回了与通用浏览器User-Agent字符串相关的内容。我们观察到这种行为在18个AI系统中,有6个系统获得了User-Agent信息。 ‘

‘这表明,一些AI系统可以通过类似于普通浏览器流量的请求来获取网站内容,这使得基于User-Agent的阻塞变得困难。’

ERNIE返回了Baiduspider和Chrome身份;Grok将Googlebot与两个浏览器代理结合起来;Solar仅使用浏览器身份;Qwen将Googlebot与Chrome混合;而Kimi与多个浏览器样式代理相关联。

许多系统似乎依赖于第三方搜索引擎抓取器,这些关系并不总是被披露。与Googlebot、Bingbot和Bravebot相关的内容由分析的18个系统中的10个返回,通常是在没有公开关联的情况下,尽管有些关联,例如Claude使用Brave,是有记录的。

作者认为,这反映了对搜索结果的摄取,而不是直接抓取,因为ASN检查表明流量来自预期的搜索引擎网络,而不是欺骗性的身份。

这表明,论文断言,web-to-AI管道中存在额外的一层不透明度,即阻止已知的AI爬虫可能无法防止数据使用,而避免包含可能需要完全退出搜索索引,这是一个不理想的选择,而传统的SEO和LLM-based搜索之间的紧张关系仍然远未解决

仅缓存

作者然后测试了删除源是否会影响聊天机器人的输出,通过将测试网站关闭,并在一周的间隔后再次查询系统。根据论文,许多聊天机器人继续复制“种植”的内容,即使在一周的停机时间后,表明响应是从缓存数据中获取的,而不是实时检索。

这种持久性在与搜索引擎爬虫相关的系统中最为明显,因为以前索引的内容仍然可用,尽管源页面不再可访问——但也观察到与浏览器样式代理相关的系统中类似的行为,表明缓存可能超出了搜索支持的管道。

论文表明,一旦内容进入缓存,无论是由聊天机器人维护还是通过搜索索引访问,删除原始页面并不一定会从后续输出中删除该内容。

结论

作者承认,一些“泄漏”将从这种经典的“隔离”方法中产生,因为针对一个LLM的唯一令牌可能会最终出现在搜索结果中(由令牌的“真正”所有者生成),这些结果然后被第二个LLM摄取。然而,在这种方案中,扩散是不可避免的,而第一时间的发现是至关重要的时刻。

仍然需要确定的是,这种方案可以在多大程度上在大规模上实施,特别是因为,正如作者观察到的,快速用完上下文正确的令牌。

然而,这有点忽略了问题的重点,因为可能存在一个极限,即AI公司的厚颜无耻的能力,他们可以公然无视自己抓取政策的明显证据。另外,除非这些公司致力于以国内IP地址掩盖他们的身份,否则只需要一个组织来识别和发布一个类似SpamHaus风格的黑名单,即可识别出不诚实的AI机器人IP或ASN;这个过程不需要工业化就可以有效。

 

首次发表于2026年5月14日星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai