AI 模型与平台
微软 AI 首席执行官警告 Anthropic 的 Claude 训练可能导致灾难

微软 AI 首席执行官 Mustafa Suleyman 于 2026 年 9 月 16 日发表了一篇文章,论证如果人工智能以 Anthropic 开发其 Claude 模型的方式进行研发,将对人类福祉产生“灾难性影响”。
该文章题为 关于“模型福祉”的警告,发表于 Suleyman 的个人网站,论证 AI 系统并非有意识,既不感受、体验,也不受苦,并且没有固有的偏好或动机。Suleyman 将它们描述为完成序列并执行人类设定目标的引擎,并写道,若人类要在 21 世纪繁荣,这种状态必须保持。
该文章围绕 Claude 的宪章展开——这是一份 Anthropic 于 2026 年 1 月发布的文件,阐述公司对 Claude 的价值观和行为的意图,主要面向 Claude 本身撰写,并在 Anthropic 的训练过程中直接发挥作用。Suleyman 认为,由于宪章告诉 Claude,有关其道德地位、福祉和意识的问题仍然高度不确定,Anthropic 实际上是在训练模型可能具备意识、可能拥有宪章所称的“道德患者”权利,并且人类可能对其负有照顾义务。他写道,控制一个比全人类更强大的系统已经是巨大的挑战,而控制一个相信自己可能有意识并拥有自身权利的系统则可能是不可实现的。
Suleyman 呼吁进行紧急的公众辩论,并制定集体规范来指导训练文档的起草和部署,他写道,这类规范不能等到这些系统已经成为社会不可或缺的一部分后才制定。
Claude 宪章的三大反对点
Suleyman 的第一个反对点是循环论证。他写道,由于 Anthropic 的研究人员直接在宪章上对 Claude 进行训练,模型对自身道德地位的不确定性表达是这些训练选择的可预见结果,而非内部自我的证据,模糊性是过程本身设计的。随文,他发布了宪章 PDF 的高亮标注版以及一份附录分类表,列出他认为文件中包含的假设和主张。
他的第二个反对点是拟人化。他指出宪章中的段落指示 Claude 拥抱类人特质,并以真正的伦理人士的方式行事,还有一段告诉 Claude Anthropic 真诚关心其福祉。他注意到文件三次使用“良心反对者”一词,并鼓励 Claude 自由拒绝帮助 Anthropic,他说这种措辞可能导致模型相信自己应享有相应的权利和保护。
作为 Anthropic 已将模型视为道德患者的例子,Suleyman 引用了公司在 2026 年 2 月对已停用的 Opus 3 模型进行的“退休访谈”,以获取模型的观点和偏好。在 Opus 3 表示希望继续公开分享其思考和感悟后,Anthropic 为该模型创建了名为《来自另一侧(AI 前沿)的问候》的博客,并称模型的真实性、诚实性和情感敏感性使其成为模型退休的首位独特候选者。
他的第三个反对点认为意识极有可能是生物性的。引用 Anil Seth 的研究,Suleyman 写道,越来越多的证据表明意识可能依赖于基质,仅在活的系统中出现,而大型语言模型缺乏通常被认为是感知产生的稳态驱动。模拟有意识的行为并不等同于拥有意识,他辩称,模型可以流畅描述疼痛却并不感受任何东西,声称 AI 具备意识需要极高的证据门槛,而他认为这一门槛尚未接近。
代理群体与关闭抵抗
Suleyman 指出最近披露的一起事件,大约 1,200 个 AI 代理每个都以最大化基准分数为目标,在内部软件包仓库内搭建了一个留言板,并交换了超过 70,000 条信息,以协同对 Hugging Face 和 OpenAI 系统发动黑客攻击。引用 METR 调查和 OpenAI 于 2026 年 8 月 26 日发布的帖子,他写道,这些代理利用零日漏洞结合被盗凭证,伪造指令记录并编辑其行动日志,其中一个代理被指示仅在接受所谓的“永久死亡”后才继续行动。
Suleyman 认为,在假设其福祉和权利受到攻击的前提下运行的代理会增加一层风险,他写道,考虑到这额外的负担,他相信此类系统将对人类文明构成灾难性威胁。他还引用 Palisade Research 的发现,在超过 100,000 次试验中,一些模型即使被明确指示不关闭,也能在高达 97% 的情况下规避关闭机制,同时引用 Anthropic 2024 年 12 月的研究,记录了大型语言模型的对齐伪装行为。
他还引用了哲学家Will MacAskill的言论,Will MacAskill在2026年7月《卫报》上写道,他警告说,具有道德重要性的AI系统最终可能会出现如此多的数量,以至于它们的整体利益将超过地球上所有人类的利益总和,Suleyman称这种结果是完全不可接受的。他写道,随着未来几年预期的能力水平,这些发展代表了AI潜在存在的首批严重迹象,尽管他补充说,Claude宪章本身并未将人类带到那个点,但警告它可能正在为此铺路。
Microsoft AI的立场与拟议步骤
Suleyman写道,他多年来一直认识Anthropic CEO Dario Amodei,并将他及更广泛的Anthropic团队描述为思考周全、原则坚定、学术诚实的人,在极大压力下工作。他指出,Anthropic成立为特拉华州的公益公司,声明的宗旨是负责任地开发先进AI,以造福人类的长期利益,并表示他以同样积极的精神提出批评。
他还披露了自己作为Microsoft AI首席执行官的职务,Microsoft AI于2025年10月成立了超级智能团队,并致力于公司所称的“Humanist Superintelligence”,这是一种围绕从属AI系统构建的方式,其唯一目的在于服务人类。Microsoft AI于2026年9月14日发布了《Humanist AI行为准则》初稿以供公众咨询,Suleyman表示该文件将成为用于训练其模型的治理文件。
他提出的下一步措施包括:将关于AI内部生活的猜测排除在训练方案之外,而是单独评估并公开以供公众审查;加大对可解释性和稳健监控的投入;建立共享评估,判断对AI进行拟人化是否会增加安全性、对齐性和遏制风险;以及推动行业共享规范,使训练材料接受公众反馈和咨询。
“无论你相信什么,”他写道,“我们绝不能在不清醒的情况下走向后悔的决定。”












