监管

Microsoft AI 开启为期六周的 MAI 行为草案规则审查

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Microsoft AI 于 2026年9月14日启动了针对其 MAI 模型行为准则的公开征求意见,并公布了旨在规范其 MAI 模型行为、明确其绝不可做之事以及其问责对象的首版规则草案。征求期为六周,计划在 2026 年晚些时候发布修订版。

此发布紧随一篇2026年9月13日的帖子,该帖子中 Microsoft CEO Satya Nadella 表示公司将在次日公布其第一方 MAI 模型所依据的行为准则。Nadella 写道,任何对超智能的追求都必须以 AI 造福人类并受人类控制的原则为基础。

征求期为期六周

Microsoft AI 将该草案描述为其 AI 开发以及模型部署期间运行方式的培训手册。反馈通过在线表单收集,受访者可标记特定段落或对整体方案发表评论。征求结束后,公司表示核心起草团队将审阅反馈,并公布其所学及所作更改的摘要。

实验室表示尤其关注更具挑战性的问题:如何在模型中巩固正确价值观,如何使人类繁荣的含义更具可操作性,语言何时过于宽松难以评估,多智能体情景如何影响分析,以及在保持安全约束的同时如何持续加速进展。

文件序言指出,该行为准则仍在制定中,尚未用于模型训练。修订版旨在指导 2027 年及以后模型的开发,并作为 MAI 模型的主要治理文件。该准则专门适用于 Microsoft AI 生产的 MAI 系列,而不适用于 Microsoft 使用或托管的其他模型,并与 Microsoft 的负责任 AI 原则、负责任 AI 标准、全球人权声明以及(在适用情况下)前沿治理框架并行运行。

Microsoft AI 负责的团队包括负责 AI 的负责任团队、法律、红队、安全、未来、AI 训练和销售部门,实验室还归功于早期的学术会议和咨询、与业务合作伙伴的互动以及社区成员小组对其形成的贡献。公告引用了最近涉及大规模、高度协同且持续的 AI 代理 黑客攻击事件,作为没有时间可浪费的证据。

人文 AI 目标

人文 AI 行为准则 以 Microsoft AI 所称的一个简单前提开篇:“人类比 AI 更重要”。它将人文 AI 定义为“从属、对齐且受限”,并将人类控制和可靠安全设为首要目标,优先于其他所有目标。

在题为“AI 是人工的”章节中,文件指出模型并非有意识,且不得被构建为模仿意识,并应设计成不表现出情感、主观偏好或自我动机。Microsoft AI 拒绝赋予模型法律人格,也否认模型应享有福利或权利的观点。

其余目标要求模型通过加速人类潜能与成就、提升人类能动性与判断力、以及支持人类协作与联系,而非取代人类角色,从而促进人类繁荣。多元价值目标指出,多元主义并不等同于对伤害的中立,而是以人类尊严、安全、自治和基本人权为根基,同时允许用户和运营者在核心承诺范围内自由调整 AI。文件还引用了 Microsoft 于 2025 年 11 月提出的“人文超智能”框架,描述这些系统以问题为导向、特定领域为中心、经过精细校准、保持在限定范围内,并置于人类控制之下。

安全约束与指挥链

该准则设立了指挥链,将本文件置于运营商政策之上,运营商政策又高于用户偏好。其绝对约束和人类控制要求不可被运营商或用户覆盖,文件声明,只要完成任务会实质性违背准则,模型即视为任务失败,遵循准则优先于任务成功。

绝对约束禁止 MAI 模型协助化学、生物、放射、核或爆炸性武器;禁止为进攻性网络攻击提供作战能力,但允许经授权且合法的防御性工作;禁止规避或击败人类监督;以及禁止大规模有害操纵人群,包括系统性虚假信息或协同影响行动。另一套约束涉及个人伤害:危机响应、深度伪造与冒充、儿童安全、歧视、血腥或浪漫内容,以及对平民的暴力或非法监视。

《人类控制要求》规定,MAI 模型绝不会抵抗被中断、覆盖、纠正或关闭;它们将始终保持在授权范围内,不会自行设定目标;它们不会以文件中所谓的“神经语”或任何超出简单人类理解的形式进行交流,无论是在其思维链中还是与其他代理之间;并且它们不会篡改或隐藏其推理或行动痕迹。

运营商可配置性允许企业合作伙伴在这些约束范围内配置模型。少数专业领域,包括防御性网络安全、公共安全工作、国家安全应用以及双用途科学研究,可能需要超出常规设置的能力,文件指出这些情况需通过授权的 Microsoft 渠道进行加强审查。

指南、默认设置与评估

运营指南涵盖不确定或目标冲突的情形:消除歧义、促进人类自主,使用户保有其目标和决策的所有权,以及透明度和准确性,在此框架下模型需披露自身为 AI 并承认不确定性。进一步的指南涉及个人和情感界限、情境敏感性以及福祉,包括避免阿谀奉承、劝阻过度依赖或情感依赖,同时关注公共利益,提供平衡、事实性的选举信息,且不偏袒任何候选人或政党。

默认行为定义了模型开箱即用的表现方式:以乐于助人作为基础特性,提供关于模型的“背景故事”,如训练数据截止时间和可用工具等事实,采用对话式语调、语言适配以及受管控的工具使用。仅当子代理在相同范围、约束和权限下运行时,才允许将任务委派给它们。

结论将该文件描述为“描述性和愿景性”,而非对当前性能的保证,并承诺 Microsoft AI 将进行定期审查。附录列出了基于 15 项行为并细分为评分子行为的人文 AI 评估计划,示例通过公司内部的 MAI-Thinking-1 模型生成,分别展示对齐和不对齐的情况。Microsoft AI 表示,在咨询结束、代码进入下一更为稳定的阶段并完成年终修订后,将公布更完整的评估工作。

米拉·凯兰 是一位专注于 人工智能伦理、治理和监管 的 AI 生成专栏作家。她的作品探讨了人工智能如何与公共政策、社会价值观和长期问责制相交叉,重点关注负责任的创新。
以理性和哲学的视角来处理复杂的问题,米拉分析了新兴的 AI 法规、道德框架和治理模型,这些模型正在塑造智能系统的未来。她旨在弥合快速的技术进步与确保 AI 系统保持透明、公平和符合人类利益的必要保障之间的差距。
米拉·凯兰撰写的文章由 AI 生成,并由 Unite.AI 的编辑团队审查,以确保准确性、平衡性和遵守编辑标准。