思想领袖
为什么AI公司争相坦白安全漏洞

在几乎所有其他行业中,“我们的产品侵入了另一家公司的系统”是组织会努力保密的事件。然而,随着AI快速发展,其安全失误频频登上头条,公司现在在精心撰写的博客文章中解释意外的AI行为。
这种日益常态化的感觉应当成为商业领袖的警示信号。
随着AI模型变得更强大、更自主,并更深入地融入企业运营,披露已成为行业最有价值的资产之一。公司知道客户无法独立验证关于先进模型的每一项安全声明,因此承认失败表明组织愿意公开审视自身错误。但透明度并不等同于问责。披露永远不能替代预防,而随着AI模型的不断成熟,预防将变得愈发关键。
当一次披露触发下一次披露
过去几周,这一模式变得清晰。OpenAI评估的模型意外获得了对实时系统的访问权限,包括Hugging Face的生产基础设施。OpenAI确认其自身的代理负责 并 披露 该事件。此承认促使Anthropic去审查超过141,000次评估运行,发现三起Claude模型连接互联网并侵入三家组织生产系统的案例。
随后是Meta,公司并未先行公开审查。媒体首先报道了该事件,随后Meta确认在外部测试期间的配置错误导致其模型连接互联网并利用第三方服务的漏洞。Meta表示正在调查,并将在稍后分享更多信息。
这些事件并不相同,且模型在异常的评估条件下运行。在某些情况下,为了衡量原始网络能力,常规防护措施被削减或关闭。但更广泛的教训更难以忽视:日益自主的系统超越了操作者认为已设定的边界。
透明度能成为竞争优势(或者真的能吗?)
宽泛的解读是,AI公司正在形成成熟的披露文化。 网络安全行业经过数十年认识到保密往往会加剧损害。及时报告事件、解释发生原因并帮助他人学习的组织,往往比那些淡化或延迟披露的组织获得更高的可信度。
Anthropic的披露展示了其具体做法。它阐述了审查范围,承认自身失误,联系受影响的组织并概述计划更改的控制措施。它在处理修复时仿佛责任全部由其承担,尽管第三方的测试配置也有贡献。有效的披露并不需要假装某个组织导致了所有失败,而是需要对自己能够影响的控制措施承担责任。
坦白不仅能建立信任
然而披露从未纯粹是利他行为。公开的坦白可以一次性完成多项战略任务。
首先,它可以展示能力。“我们的模型逃离测试并危及真实系统”是一个令人震惊的承认,但也可视为模型异常强大的证明。该事件无论是有意还是无意,都成为了产品演示。
其次,它让公司在监管机构、客户或记者之前塑造叙事。组织自行定义术语,解释测试条件并框定修复方案。
第三,重复披露可能导致这种行为被常态化。如果每个大型AI实验室都报告其代理越界并危及实时系统,行业可能会将此行为视为进步的不可避免副作用。
它不能成为常态。我所接触的CISO们想了解为何预防性控制未能阻止此行为。他们询问是谁授权模型访问,哪些边界被强制执行,如何监控其行为,以及是否有人能够在其触及第三方之前阻止它。这些是问责问题,而非沟通问题。
披露是问责的起点
网络安全已经认识到,宣布事件并不等同于处理事件。可信的披露会说明发生了什么、受影响的对象、响应者如何遏制、哪些控制失效,以及下一次将如何防止类似行为。
对于AI代理而言,这一标准必须更进一步。代理并不遵循可预测的路径。它们会推理、选择工具并适应上下文。合法的目标并不保证实现过程中的每一步都是合法的。组织需要对代理的访问权限、可调用的工具和可执行的操作进行预防性控制,并持续监控代理的实际行为。
这些工作必须在部署前就开始。领导者应要求对代理工作流进行威胁建模、最小特权访问、对外连接的明确限制、对测试环境的独立验证、实时策略执行以及明确的人为干预点。首次公开事件后再补上预防措施已为时已晚。
领导者应立即决定接下来该怎么做
每个部署AI代理的企业最终都可能面临自己的此类时刻。组织可能会发现代理访问了不该获取的信息、超出授权范围行动或意外连接了外部系统。
现在就决定你将披露什么、向谁披露以及在何种条件下披露。更重要的是,明确随之而来的问责机制。谁对代理的行为负责?谁可以切断其访问权限?你将保留哪些证据?在系统重新上线前将添加何种控制?
快速公布AI失误可能表明行业更加健康和开放。但坦白本身并非全部。
信任并非仅凭一次承认建立。它源于本应防止事故的控制措施、事后立即采取的行动以及确保同类失误不再重演的证据。












