思想领袖
谁有资格审计前沿人工智能?白宫协议中缺失的定义

本周,Google、OpenAI、Anthropic、Meta、xAI 和 Nvidia 的领导人签署了 White House Accord on Super Intelligence。这些公司承诺对前沿模型实施 四层监督:内部控制、负责验证的内部团队、独立的外部审计员或评估员,以及独立的董事会委员会。目前这些承诺是自愿的,协议表示它们最终可能被写入法律。
在这四层中,外部评估的权重最大。它是唯一一层让公司外部的人员能够判断安全措施是否有效。它也是定义最少的一层。协议并未说明谁有资格成为独立评估员、他们依据何种标准进行评估、能够获得多少访问权限,或当评估员同时向其审查的公司提供服务时独立性如何保持。每家公司自行选择其评估员。
在这些条款下,两家公司都可以宣布通过了独立评估,却意味着截然不同的内容。弥合这一差距需要对三个问题给出答案。
应由何决定谁有资格
对独立 AI 评估员的可信定义至少需要涵盖四个方面。
独立性。评估员不应审查其参与设计的安全措施,也不应向其评估的同一公司出售整改或咨询服务。成熟的审计领域还会关注费用依赖性。当某一客户占评估员收入的很大比例时,评估员就会有放宽要求的动机。
能力匹配岗位。 “审计”涵盖 AI 中的多种不同活动。测试模型的危险能力,例如协助网络攻击或生物武器,需要机器学习研究人员和领域专家。检查公司安全措施是否设计得当并在实践中有效,则需要有经验的控制审计员。一个在某项工作上合格的评估员并不自动在另一项上合格,评估报告应说明执行了哪种审计。
访问范围。 仅查看文档的评估员只能确认纸面上存在安全措施。要验证其实际运行则需要访问系统、日志、批准记录以及人员,并在一段时间内进行检查。前沿模型在训练运行和部署之间会发生变化,因此评估员还需要明确的规则来判断何时需要重新审查。
评估员的监督。 必须有人对审计员进行监督。在成熟的审计市场中,认证机构会审查评估员的工作,并在其表现不佳时剥夺其资格。这一后备机制赋予评估结论以分量。
已有的基础设施
这些并不需要从零开始发明。ISO 42001,人工智能管理体系的国际标准,为组织提供了治理 AI 的框架,包含有文件化的控制、明确的责任人以及持续改进。其配套标准 ISO 42006 为审计并依据 ISO 42001 进行认证的机构设定了要求,包括审计员必须展示的能力以及必须遵守的公正性规则。由于认证机构在认可下运作,第三方会对审计员本身进行监督。
在技术测试方面,更新的框架正在填补空白。AIUC-1 对特定部署中的特定 AI 代理进行认证,并通过定期的第三方测试来检测幻觉、越狱以及不安全工具使用等问题,并基于 ISO 42001 的控制措施。
各州也在直接测试模型以监督评估员。康涅狄格州今年通过了一项法律,创建了一个 试点项目,自 2027 年 7 月起生效,州消费者保护局将批准最多五家独立验证机构。每家机构必须签订一份由州监管的协议,明确其范围、方法、报告义务和治理结构。该结构回答了协议中的若干未解问题:谁批准评估员、评估员应遵循何种标准以及谁对其进行监督。
这些要素并非为前沿模型评估而构建,也不应被视为完整答案。接下来的工作是将它们衔接起来,使管理体系保障、技术模型测试和评估员监督能够在一个可信的独立性定义下协同运作。
为何规则必须先行
该协议的承诺目前是自愿的。如果它们成为法律,关于谁可以担任评估员的规则必须在强制实施之前就位,原因有三。
首先,早期实践会形成先例。一旦签署方开始指定评估员并公布结果,市场将形成对“独立”和“合格”的实际定义。在没有外部压力的情况下制定的定义往往倾向于便利。后来的立法者会发现这些定义已经嵌入合同和预期之中。
其次,具备合格的能力需要时间来建立。对评估机构进行认证、培训能够理解前沿模型和控制测试的评估员,以及制定共享方法,都需要多年时间。在该能力尚未形成之前就出现的强制性要求,只能由现有的可用者来满足。
第三,如果没有合格评估员市场作为支撑的要求,只会导致形式上的检查。公司会满足规则的字面要求,监管机构几乎没有依据去质疑薄弱的评估,而公众则只会看到表面的监督,却缺乏实质内容。
有人认为现在制定这些规则为时过早,因为评估前沿模型的科学仍然处于起步阶段。这是对测试方法的合理担忧,测试方法应随模型的发展而不断演进。此处提出的问题聚焦于评估员:他们是否不存在利益冲突、具备胜任该工作的资格、拥有足够的访问权限并接受监督。这些问题都有明确的答案,且其他保障领域已经在数十年间持续给出答案。
组织目前可以采取的措施
构建或部署先进人工智能的公司无需等待强制性要求。在选择评估员时,他们可以询问该公司提供的其他服务、其团队在特定评估类型方面具备的资质、合作中包含的访问程度以及谁负责监督该公司的工作。现在构建 AI 管理系统也能为未来的评估员提供可供评估的具体且有文档记录的材料。
该协议为 AI 责任建立了稳健的框架。其价值取决于谁担任评估员以及对其的要求,而在任何人被要求使用之前就需要明确这些要素。












