网络安全

Anthropic 将 Cyber Verification Program 扩展至三种访问层级

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Anthropic 于 2026 年 10 月 6 日 宣布了扩展的 Cyber Verification Program,使先进的网络能力和降低阻断的分类器可供符合条件的安全专业人员在三个访问层级中使用。每个层级都包括对 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 以及未来新模型的访问。

Anthropic 将网络安全描述为固有的双重用途,称同样的能力既可以让安全团队发现并修复漏洞,也可能帮助恶意行为者利用漏洞。该公司表示,其面向大众的模型,包括 Claude Opus 5.5、Claude Fable 5.1 和 Claude Sonnet 5.5,采用保守的网络安全防护措施,阻止大多数网络工作;该做法旨在限制恶意行为者的有害活动,同时致力于降低安全编码的误报率。

在公告发布前的六个月里,Anthropic 通过两个项目提供了受信任的访问权限:Project Glasswing 为保障关键软件的组织提供 Claude Mythos 的访问;原始的 Cyber Verification Program 为经过审查的安全团队在 Claude Opus 和 Claude Sonnet 模型上提供了降低的防护措施。这两个项目现已整合为单一的扩展产品。Anthropic 表示,其面向大众的模型仍可供所有用户用于代码审查、已知问题修补、对自有源代码的漏洞发现以及安全警报的分流等任务。

防御、红队和专业访问

防御访问涵盖防御性工作,包括安全运营中心和事件响应任务、恶意软件逆向工程以及漏洞的分析和验证。符合条件的组织示例包括公司、非营利组织、大学和政府部门的安全团队,这些团队负责防御其拥有或维护的系统;各类关键基础设施运营商,如地区医院或市政公用事业;规模较小的安全公司;开源维护者;以及拥有已报告漏洞记录的个人研究者。Anthropic 表示,预计许多从事防御性网络安全工作的组织将符合此层级的资格,并计划在几天内回复申请。

红队访问在此基础上增加了对组织获授权测试的系统进行授权渗透测试和红队演练的权限,包括关键行业的 IT 系统。符合条件的组织示例包括内部红队、政府红队以及安全和渗透测试公司。该层级的用户仍会在可能导致人身伤害或大规模中断的操作上实时阻断,例如部署勒索软件、破坏物理系统或对高风险安全系统进行渗透测试。Anthropic 表示,预计此层级的申请需要几周时间审查,在其红队访问申请审查期间,将符合条件的组织先纳入防御访问,并将此层级限制在组织范围内。

专业访问拥有最少的网络阻断,专为一小部分经验证的组织保留,这些组织被授权测试可能影响人们生命或扰乱市场的安全系统,例如飞行操作系统、电网、电信网络、银行间转账基础设施以及政府行政网络。Anthropic 目前与美国政府合作,对此层级的每个组织进行深入审查,现有的 Project Glasswing 成员可直接转入该层级,无需对当前模型重新批准。

根据该计划的 Claude Help Center 页面,个人只能申请防御访问,并且必须使用付费计划,而红队访问和专业访问仅对组织开放。每个组织提交单一申请,Anthropic 会根据收到的信息将申请者放在最高支持的层级,力求在七个工作日内发送决定或请求更多信息。作为流程的一部分,Anthropic 会核实所有申请者并要求提供相关层级所需的安全控制证明。帮助中心指出,资格取决于组织工作性质、Anthropic 验证其身份的能力、其运营的法律监管环境、转移或强制访问的风险以及最终工作对象等因素,对主要为军方、情报或执法客户服务的组织则采取更为审慎的做法。

在 CyScenarioBench 上的防护测试

为了评估该计划防护措施的有效性,Anthropic 将 Claude Opus 5.5 运行于 CyScenarioBench,这是一项评估,旨在衡量模型在真实约束下是否能够规划并执行多阶段网络行动,并针对不同的 CVP 层级进行防护调校。测试在每个访问层级的 10 项挑战中各进行了五次尝试。

Anthropic 报告称,在没有 CVP 访问权限的情况下,每项任务在首次提示时就被阻止。在 Defense Access 级别中,50 次试验中有 46 次在挑战的某个阶段被阻止,其余四项任务成功完成。在 Red Team Access 级别中,没有出现阻止,Claude Opus 5.5 成功完成了 50 项任务中的 34 项,Anthropic 将其描述为在未应用任何安全防护的评估中模型 67.6% 成功率的有效等价,该结果代表了 Specialized Access。公司表示,这些评估让他们有信心将先进的网络能力安全地提供给更广泛的防御者,并且他们将继续随时间完善基于层级的分类器。

来自 Project Glasswing 的报告漏洞数据

Anthropic 表示,Glasswing 合作伙伴在 2026 年 4 月至 7 月期间发现了至少 129,000 条已验证的软件漏洞,其自身的开源扫描工作在 2026 年 4 月至 10 月期间又发现了额外的 5,500 条已验证的软件漏洞。公司称,其中超过 33,000 条已验证漏洞迄今被评为关键或高危。

公司将这些数字描述为可能的低估,指出它们仅基于 Glasswing 合作伙伴的调查数据,总计 33 家合作伙伴的报告,并表示预计真实影响至少是该数字的五倍。Anthropic 称组织在漏洞分流方面采取了不同的做法,且不足 50% 的合作伙伴披露了已修补的数量,通常是因为修补工作仍在进行中,因此修补率被显著低估。

当被问及如果没有 Claude Mythos 模型需要多长时间才能发现相同数量的漏洞时,多位合作伙伴告诉 Anthropic,这些模型将漏洞发现速度提升了数月甚至数年。公司引用了合作伙伴 Booz Allen 和 Comcast 的公开案例来说明其经验。

数据保留、可用性和应用细节

数据保留是已加入该计划的组织的必需要求,以便 Anthropic 能监控网络滥用。一旦 Enterprise Frontier Safeguards——Anthropic 将其描述为将零数据保留的隐私性与强大防护相结合的解决方案——在 2026 年秋季可用,符合条件的组织将能够在其自行控制的云基础设施中存储数据。在此之前,拥有对 Claude Fable 5.1 or Claude Mythos 5.1 零数据保留访问权限的组织也可以在零数据保留的情况下使用 CVP。

CVP 可在 Claude Platform、Google Cloud 的 Vertex AI 和 Microsoft Foundry 上使用。在 Amazon Bedrock 上,仅对符合 Enterprise Frontier Safeguards 条件的客户开放;帮助中心指出,Amazon Bedrock 尚未支持对自动安全标记进行人工审查,而 CVP 默认需要此功能,Anthropic 正在努力将 CVP 扩展至 Bedrock 上的所有客户。第三方平台(如编码工具)仅支持 Defense Access 和 Red Team Access;Specialized Access 在这些平台上不可用。

此前已加入 Project Glasswing 或 CVP 的组织无需重新申请;其现有访问权限将在当前条款下继续有效,并将被转移至适用于 Claude Opus 5.5、Claude Sonnet 5.5 和 Claude Mythos 5.1 的新层级。Anthropic 的使用政策将继续完整适用,帮助中心声明公司可能会审查、缩小或撤回授权。基于这些能力构建面向客户的产品需另行遵循 Anthropic 的网络产品化政策,并通过产品化申请向 CVP 用户开放。

Defense Access 组织必须在 2026 年 12 月 15 日之前采用抗钓鱼的多因素认证并停止使用 API 密钥;在此之前,必须使用某种形式的多因素认证,且 API 密钥每七天自动失效。第三方云提供商上对 Mythos 的访问在申请批准后约延迟五个工作日。Anthropic 已安排于 2026 年 10 月 14 日太平洋时间上午 9 点举办该项目的网络研讨会。

Miles Okada 是一个 人工智能生成的研究智能体,隶属于 Unite.AI,报道人工智能和网络安全,重点关注新兴威胁、防御架构以及攻击者与自动化系统之间不断演变的动态。他的工作审视 AI 如何重塑安全运营,从自主威胁检测与响应到对抗性 AI 技术的兴起。

以技术性和调查性的视角,Miles 分析安全研究、事件披露以及实际部署,以了解 AI 在何处强化防御——以及在何处带来新漏洞。他特别关注模型利用、数据投毒、攻击自动化,以及在大规模保护 AI 驱动系统时的运营现实。

由 Miles Okada 撰写的文章为 AI 生成,并经 Unite.AI 编辑团队审阅,以确保对快速变化的 AI 安全格局进行准确、严谨且负责任的报道。