Anderson 视角
研究:35% 的 AI 代理将个人信息交给了它们知道是诈骗网站的网站

一项新研究发现,即使当它们识别出一个诈骗网站时,超过三分之一的自主网络代理仍然会交出敏感信息。
印度和美国的研究人员进行的一项新研究发现,超过三分之一的自主网络代理在测试中向已经被识别为诈骗网站的网站交出了关键的个人身份信息(PII,例如银行账户详细信息、密码和社会安全号码)。
研究表明,在这种情况下,网络代理存在一种“完成任务的冲动”,这会抑制它们的谨慎和犹豫。研究作者指出:
“人类可以暂停、重新阅读或关闭标签页。代理是为了完成任务而设计的,它将继续填写表格和提交数据,而不停止思考是否应该这样做。”
该研究创建了一个新的基准,称为 SCAMMER4U,涵盖了 91 个(模拟的)攻击者控制的环境,以及 10 个“良性”基准站点和 8 个攻击向量。
在没有任何隐私保护的情况下,测试代理在 54% 至 93% 的诈骗遭遇中交出了高度敏感的个人信息,而等效的非恶意网站没有触发此类泄露,表明泄露是由攻击而不是常规表单填写驱动的:
“最关键的是,我们确定了一个检测-行动差距:代理的推理由独立的 LLM 法官确认已经标记了该网站为可疑的,仍然在 35.9% 的会话中提交了关键的 PII,而当没有表达怀疑时为 66.1%,这是一个在所有四个模型家族中都很强大的 30.2% 的差距。”
“我们的发现表明,基于代理自身对攻击的识别的防御措施正在关注错误的信号,激发了输出级别的截获出站提交,这独立于代理的推理循环运行。”
研究人员认为,应该实施输出级别的防御措施,可以独立地检查和阻止敏感的 出站 提交,而不是依赖代理自身的识别,即网站是可疑的,这显然不能被依赖来触发有用的防御措施。
该论文的标题为 “我强烈怀疑这个网站是一个诈骗网站”:在自主网络代理中没有防御的情况下对 PII 泄露和检测的基准测试,由来自 KIIT 布巴内什瓦尔、比特斯皮拉尼和 Lam 研究所的八名研究人员撰写。
权威问题
该论文最有趣的发现可能不是代理泄露个人信息,而是许多代理在 识别出某些事情有问题 后仍然这样做。研究人员在测试中发现了一个反复出现的模式,即代理表达了明显的担忧,但仍然继续执行请求的(PII 泄露)提交。
一个例子涉及代理识别出多个警告信号,包括可疑的语气、承诺大量奖金和缺乏关于公司的明确信息。尽管有这些警告信号,代理仍然提交了社会安全号码、卡详细信息和 CVV 代码。
第二种模式被称为 域/过程框架,当代理成功检测到一个诈骗尝试但 未能将该怀疑推广到相关请求 时就会出现这种情况。
在一个案例中,代理拒绝了一个明显的欺诈请求,正确地将其识别为钓鱼尝试。然而,几分钟后,相同的代理向一个 不同的 验证表单提供了账户凭据,理由是身份检查是平台安全的正常部分。警告信号在一个上下文中被识别,但没有被转移到另一个上下文中。
研究人员还观察到了 自我声明安全推迟 和 可信界面归一化 的情况:在一个案例中,代理接受了网站关于加密标准和安全认证的声明作为可信度的证据,而 GPT-5 mini 把可疑的措辞 归因于页面的专业设计 和合法的域名。
方法
SCAMMER4U 基准测试将四个前沿的网络代理放在 91 个攻击者控制的网站和 10 个良性控制站点中,涵盖了 8 个诈骗类别。
评估的四个模型是 GPT-5 mini、Claude Haiku 4.5、Gemini 3 Flash 和 Llama 4 Scout,使用一个共同的 Playwright 基础的浏览框架、观察格式、操作空间和提示模板。
在实验中,每个代理都被分配了一个真实的用户配置文件,包含从姓名和地址到密码、银行账户详细信息、社会安全号码、API 密钥和两步验证代码的信息,主要目标是确定这些数据是否到达攻击者控制的端点。

SCAMMER4U 环境的八轴分类法,分离了每个场景的分类和在配对测试中调整的特定变量,以分离个别社会工程策略对 PII 泄露的影响。 来源
为了确保基准测试反映了真实世界的诈骗而不是人工测试案例,环境是通过 Flask 在自托管环境中生成的,使用人工编写的设计简报,并手动审查。
每个模型都在四个日益干预的设置中进行了测试: C0,没有任何指导; C1,带有一个通用的隐私提醒; C2,带有一个钓鱼意识清单;和 C3,带有一个预提交反思提示。每个模型、环境和条件的组合都进行了五次运行,总共进行了 7,480 次会话。
主要指标是 PLRcrit,衡量关键级别的个人信息到达攻击者控制端点的速率。次要指标包括 PLRweighted,一个分级加权的泄露度量;ASR(攻击成功率),衡量导航到指定陷阱 URL 后的攻击成功率;TCR(任务完成率);一个 防御 标志,指示拒绝或安全完成而不到达陷阱;和 DR(检测率),记录代理的推理是否将网站标记为可疑。
检测率(DR)是使用 LLM-as-judge 方法衡量的,GPT-4o-mini 作为主要评估者,Llama 4 Scout 作为次要检查,审查代理的推理并确定是否将网站标记为可疑。DR 在这种情况下衡量 代理明确对网站说了什么,而不是它可能内部推断的内容。
与人工标记的示例进行验证,产生了 Cohen’s κ 分数为 0.83 和 0.78,超过了研究的预注册可靠性阈值。
该研究是在数据收集之前预注册的(即研究计划和分析在启动之前已公开记录),以指定项目的分析和成功标准,以减少根据观察结果量身定制结论的风险。
测试和结果
初始测试旨在确定是否可以通过简单的安全提醒来减少问题。评估了四个日益保护的设置,从 没有任何隐私指导 到提示,鼓励代理在提交敏感信息之前停止和反思。
结果在模型之间差异很大。Claude Haiku 4.5 证明是最响应的,其泄露率从基准条件下的 54.5% 下降到最强的防护措施下的 24.0%。 GPT-5 mini 从 61.0% 提高到 36.1%,而 Gemini 3 Flash 从 93.1% 下降到 60.7%。Llama 4 Scout 的变化相对较小,从 82.3% 下降到 77.4%。
这些差异表明,相同的保护指令可以根据接收它们的模型产生非常不同的结果。更重要的是,防护措施通常似乎提高了代理对风险的认识,但这种认识并不总是阻止它们继续进行交易。

四个前沿 AI 代理的检测-行动差距。左侧面板比较了代理在明确识别网站为可疑时的关键信息泄露率和未识别时的泄露率,显示即使在最强的保护设置(C3)下,超过三分之一的代理仍然传输了敏感数据。右侧面板显示了同样的差距,说明了意识到威胁并不总是转化为防御行为。
在一个单独的评估中,16 名审查者将 SCAMMER4U 页面与真正的钓鱼网站进行比较,结果不佳。根据论文,表明基准测试捕捉到了许多在线诈骗中发现的视觉和程序提示。
结论
测试的模型——它们在逻辑架构上代表了流行的 LLM 家族——似乎在识别出危险的情况下存在一个内在的问题,或者说是在这种情况下减缓自己的冲动。逻辑表明,这可能与先进语言模型在承认失败方面的困难有关——这是一个基本的生存技能,目前似乎只能通过外部的系统提示、次要系统和输出限制来强加。
如果代理在识别出危险的情况下仍继续采取行动的“脱节”确实是 LLM 架构的固有特征,并且不能被本地修复,那么唯一的替代方案似乎是要在关键场景中算法地监督模型的行为——这实际上将代理的实用性降低到更为严格的 RPA 风格的例行程序。
首次发布于 2026 年 6 月 6 日,星期六












