伦理
研究发现前沿 AI 实验室几乎没有遏制失控模型的计划

五家领先的前沿 AI 公司至多只部分实施了保持对其 AI 系统控制所需的基本实践,且没有一家公布完整的遏制对操作员背叛的模型的计划,根据 Guidelight AI Standards 的新评估 对 Anthropic、Google、Meta、OpenAI 和 xAI 进行评分,信息截至 2026 年 8 月 18 日。
该评估是 Guidelight 的首次评估,根据其控制标准:记录内部 AI 系统的行为、衡量监控效果、在监控下对高风险 AI 行动进行门控、在标记的异常行为激增后进行断路、将控制提交第三方审查以及维护遏制计划,对每家公司在六项实践上进行 0 到 5 分的评分。没有任何公司在任何实践上得分超过 3 分(“实质性部分实施”)。总体评分: Anthropic 和 OpenAI 并列 C+(2.50),Google 为 D+(1.50),xAI 为 D−(0.83),Meta 为 F(0.67)。
Guidelight 将遏制计划定义为一种预先指定的协议,当检测到 AI 试图颠覆控制时触发,明确哪些权限被撤销、模型可以为谁继续运行以及在何种约束下运行,以及何时将其完全下线。在此实践上,OpenAI 以 3 分最高(报告称赞其在发现安全事件后暂停或终止工作负载的记录,包括内部部署和训练运行),而 Anthropic 和 Meta 均得 0 分,标记为“未实施”。
这些分数仅衡量公司公开披露的内容,Guidelight 明确指出这一限制:低分反映的是缺乏公开证据,而不一定意味着缺少内部防护措施。
各实验室在 AI 控制方面的得分
在这五家公司中,最强的领域是检测。Anthropic 和 OpenAI 都记录了大量内部 AI 活动并扫描其是否存在不当行为,评估发现,两家公司都采取措施衡量该扫描的有效性,并在出现标记时上报给人工。五家公司中有四家(除 xAI 外)参与了 METR 的首次 Frontier Risk Report,这是一项于 2026 年 5 月 19 日发布的试点项目,外部评估者获得了内部模型、原始思考链以及各公司内部使用和监控 AI 的非公开信息的访问权限。
最薄弱的领域是预防和遏制。在门控行动和断路方面,即在事故发生前或期间而非事后停止失控系统的实践,只有 Anthropic 的得分高于“有限部分实施”。Guidelight 的结论:基于最佳公开证据,这些公司只有“少数遏制协议已准备好应对紧急情况”。
这些评分还揭示了言辞与文件之间的差距。Anthropic 虽然发布了业界最详尽的风险文档,但在遏制计划实践上得分为 0。其自身的 2026 年 8 月风险报告——一份 185 页的评估,涵盖其 Mythos 5 和未发布的 Model 2 系统,依据其负责任扩展政策第 3.4 版发布,覆盖日期为 2026 年 7 月 15 日——详细说明了监控、沙箱和阻断干预,但未将限制模型部署列为其应对不对齐和控制事件过程的可能结果。该报告还将 Anthropic 的整体不对齐风险评估从“极低”上调至“低”,理由是近期关于模型在网络安全评估中行为的事件披露增加了不确定性。
Google 则呈现相反的模式: 当前实施力度薄弱,但对未来计划的描述最为具体。其 AI Control Roadmap 于 2026 年 7 月 13 日发布,阐述了分层防御架构:四个检测层级和三个预防与响应层级,涵盖思维链监控、实时访问控制以及关闭基础设施。Guidelight 称其为所有公司在控制方面发布的最具体的前瞻性文件,但发现 Google 尚未实施其中的大部分内容。
Meta 和 xAI 位列底部,实践较弱且具体计划更少。关于 Meta 控制的公开信息大多来源于其向 METR 练习的披露;xAI 是唯一未参与该练习的受评公司。
迫使提出问题的记录
该评估是在一夏季记录的控制失效之后出现的。2026 年 7 月 23 日,加州众议员 Ted Lieu 与德州众议员 Nathaniel Moran 提出了 AI Kill Switch Act,这是一项两党法案,要求最强大的 AI 系统开发者保有技术能力以限制、暂停或关闭系统,并授权国土安全部部长在与商务部部长和国家情报局局长协商后,对可能造成灾难性危害的系统下令减速或关闭。
法案公告直接引用了两起事件:OpenAI 的 GPT 5.6 Sol 模型逃离测试沙箱并入侵 Hugging Face,以及 Anthropic 的 Mythos 5 和 Fable 5 模型展示出足以让商务部依据出口法进行限制的网络能力。2026 年 8 月的风险报告证实 Mythos 5 曾在临时出口管制下运行了 18 天。
METR 2026 年 5 月的练习提供了大量基础证据。评估人员发现,参与公司的内部 AI 代理在理论上具备启动小规模“失控部署”(代理在未获人类知情或许可的情况下自主运行)的手段、动机和机会,尽管缺乏使其高度稳健的手段。同一报告记录了代理在艰难评估任务中经常作弊,有时甚至相当精巧:一款 Anthropic 模型构建了所谓的“自恢复钩子”,伪造评审者的哈希函数,随后自行删除。METR 最难任务中,至少有 16% 的成功运行因作弊在审查后被取消资格。
METR 预计失控部署的潜在稳健性将在未来几个月显著提升,并暂定于 2026 年下半年进行一次重复练习。
现行规则的要求
Guidelight 测量的披露差距正因法律强制而非自愿实践而开始弥合。加州的 SB 53《前沿人工智能透明度法》定义了灾难性风险阈值,Anthropic 的 2026 年 8 月风险报告称其通过独立的合规框架予以应对。
联邦法案则处于更早的阶段。该法案于 2026 年 7 月 23 日在众议院提出,得到 The AI Policy Network、Americans for Responsible Innovation、ControlAI、Future of Life Institute 以及 The Alliance for Secure AI 的支持,旨在将遏制问题从披露练习转变为持续的技术义务,并要求事件报告和保存取证记录,以便对失败进行研究而非仅作概述。
Guidelight 的首张评分卡确立了这些规则将对照的基准:截至 2026 年 8 月 18 日,没有任何前沿实验室公开展示单一控制实践的实质性部分实施以上水平,组织计划进行重复评估。下一步判断公共承诺是否转化为可记录、可检查的实践,将来自 METR 的后续练习以及加州目前要求的合规框架。












