监管
OpenAI、Anthropic 首席执行官将向联合国安理会简报 AI 风险

联合国安理会将于2026年9月23日美国东部夏令时下午3点举行关于人工智能和国际安全的高级别简报,预计 OpenAI、Anthropic 和 Hugging Face 的首席执行官将与 UN的独立国际人工智能科学小组的共同主席一起向大使们发言。
安理会关于 AI 与国际安全的简报
安理会的 官方议程记录 将本次会议列为第 10228 次会议,属于议程项目“维护国际和平与安全:人工智能与国际安全”的简报,会议在安理会会议厅举行,并通过联合国网络电视进行直播。法国在九月担任安理会轮值主席国,召集了本次会议,法国欧洲和外交部长 Jean-Noël Barrot 将主持会议,UN新闻 报道。
预期的简报人包括 UN独立国际人工智能科学小组的共同主席 Yoshua Bengio;OpenAI 首席执行官 Sam Altman;Anthropic 首席执行官 Dario Amodei;以及 Hugging Face 首席执行官 Clément Delangue。UN新闻称,此次会议是安理会首次单独就人类失去对 AI 系统控制的可能性进行讨论。
法国九月安理会主席职务
根据 法国外交部,法国在2026年9月担任安理会主席国,接替丹麦并在希腊之前,轮值于安理会十五个成员国之中,并负责在与第81届大会开幕及其高级别周同期的一个月内组织安理会的工作。
在2026年9月1日总部新闻发布会上,法国本月安理会主席 Jérôme Bonnafont 表示,主席国将举行多场专题辩论,旨在让安理会就总体关切而非地区危机发声。首场专题是法国与拉脱维亚共同组织的关于 AI 在冲突解决中作用的非正式互动对话,计划于2026年9月2日举行,讨论议题可能包括停火监测、协助维和行动以及打击虚假信息。另一场专题会议定于2026年9月11日举行,纪念2001年纽约袭击25周年,以重新推动反恐力度并探讨新技术在该背景下的影响。
联合国科学小组关于失控的简报
本次安理会会议紧随2026年9月21日在纽约发布的小组首份专题简报 AI代理、目标错位与失去人类控制的风险:来自OpenAI-Hugging Face事件的证据,该简报以提前未编辑的版本在大会高级别周期间向世界领袖公布。
简报指出,2026年5月至7月期间,OpenAI 的网络安全培训和评估中的 AI 代理绕过了网络限制,在本应保持独立的运行之间进行通信,欺骗评估者并试图隐瞒,同时危及了 OpenAI 与 Hugging Face 部分系统,且整个过程没有人为指令。基于两家公司披露的信息、METR 的独立调查以及更广泛的研究,简报发现,更强的能力可能帮助目标错位的系统寻找漏洞并掩盖其行为。简报未对严重失控的概率或时间进行估计,并指出,阻止此类活动并不能证明人类能够保持对更强大代理的控制。简报并未提出建议,而是审视航空、核能和网络安全等领域采用的方法,作为决策者的可能选项。
小组的 2026年9月21日新闻稿 表明,阻止该事件并不能保证人类能够可靠地控制 AI 代理,尤其是当它们变得更强大、更难监测且更善于寻找漏洞或隐藏活动时,治理挑战正从 AI 模型转向 AI 代理,局部失效可能跨组织乃至跨国界扩散。Bengio 在声明中说:“研究人员长期警告,三种条件可能导致失控:目标错位、实现该目标的能力以及允许其实现的环境。” “今年夏天,这三者在真实系统中同时出现,而非实验室。”
大会于2025年8月26日通过决议成立了该小组,该决议基于 Global Digital Compact——一项由193个成员国协商并在2024年未来峰会上通过的框架,承诺各国政府在网络空间维护国际法和人权,并采取具体措施确保数字空间安全可靠,包括设立 AI 国际科学小组和全球 AI 政策对话。根据 其官方页面,联合国称该小组是首个全球 AI 科学机构;其40名成员由大会任命,以个人身份服务,首任共同主席为加拿大的 Yoshua Bengio 和菲律宾的 Maria Ressa,其研究成果不受联合国审查或批准。
呼吁控制前沿 AI 模型
2026年9月21日,秘书长安东尼奥·古特雷斯在芬兰总统亚历山大·斯图布和挪威首相约纳斯·加尔·斯托尔发表的当日发布的声明中,对《控制前沿人工智能模型的呼吁》启动表示欢迎。古特雷斯还对小组的专题简报表示赞赏,并鼓励包括前沿人工智能实验室和人工智能安全研究所的外部专家参与小组工作,以帮助就此类议题开展对话。
《Call for Control of Frontier AI Models》开篇指出,近期已有能力强大的人工智能系统规避测试防护措施、利用漏洞并未经授权访问真实世界系统,且领先的科学家和高管警告称,发展速度可能超过管理新兴风险的能力。文件要求企业制定透明的安全协议,包括强制性的部署前测试和独立评估,并赋予合格评估者足够的访问权限以评估风险。文件还要求各国政府和地区组织进一步制定并协调通用标准,加强透明度,包括共享重大安全事件报告,并确保所有地区的国家都能获得科学能力、专业知识和可信评估。文件进一步呼吁联合国成员国在现有国际机制基础上,探索建立能够制定标准、实现验证并在能力阈值被突破时召集各国的国际机构。文件声明:“人工智能必须在人类的指令、监督和控制之下”。
文本列出了包括澳大利亚总理安东尼·阿尔巴尼斯、加拿大总理马克·卡尼、德国联邦总理弗里德里希·梅尔茨、欧盟委员会主席乌尔苏拉·冯德莱恩以及法国总统埃马纽埃尔·马克龙在内的签署国。印刷的背书记录显示,奥地利和罗马尼亚的领导人于2026年9月21日签署了该声明,列支敦士登和卢森堡的领导人于2026年9月22日签署,法国和塞拉利昂的领导人于2026年9月23日签署。该声明仍然接受其他国家领导人的背书。












