伦理
在《异星思维》中,OpenAI 的 Jakub Pachocki 呼吁共享安全栏

OpenAI 首席科学家 Jakub Pachocki 于 2026 年 9 月 6 日发表了一篇文章,指出他认为没有任何 AI 实验室已经在对齐和监控方面取得足够的成果,以负责任地在最高速度下继续规模化。文章《An Alien Mind》发表于 OpenAI 网站,Pachocki 写道,他期望并希望自愿减速能够成为常态,直至建立共享的安全栏,并且他认为各国政府需要将对未来 AI 发展的国际协调提升为首要任务。
根据内部结果,Pachocki 表示,他强烈预期当前的进展速度可以持续到递归自我改进。如果 AI 发展继续沿着当前路径前进,他预计未来几年内的系统将实现同等或更大幅度的能力跃迁,并且会越来越多地驱动自身的发展。他形容当下是需要极度谨慎的时刻,担心没有人为机器智能的持续快速上升做好准备。Pachocki 写道,OpenAI 将继续寻找对齐和监控的技术方案,构建防御系统,并在必要时单方面暂停进一步的规模化,同时他补充认为还需要更广泛的干预措施。
Pachocki 回忆说,2023 年中期,在 OpenAI 的一个名为“RLSlow”的研究项目中,他和同事 Szymon 看到了首批结果,令他们确信可以扩大推理模型的训练,从而让预训练模型能够形成自己的思考链。三年后,他写道,推理语言模型已成为经济中快速增长的组成部分,正开始突破科学的边界,操作计算机和图形界面,与人类以及彼此协作,开展研究项目。他补充说,这些模型也在改变计算机安全的格局,并在该领域带来全新的显著风险。机器智能的进步受益于计算能力的提升,他指出 OpenAI 在 2017 年左右就已内部化这一点,因为在多个研究项目中观察到规模化带来的持续回报。
两类对齐训练
文章区分了目标对齐(AI 是否尝试完成预设目标)和价值对齐,后者被 Pachocki 描述为一种更内在的属性: 能够坚持并从高层原则中概括,在目标不明确、冲突或在陌生且对抗的情境下仍能合理行动。他指出目前实际使用的对齐训练方法主要有两大类。第一类是在目标导向的强化学习过程中鼓励对齐行为,在此过程中模型的行为通常由 AI 对照偏好模型、规范或宪法进行评估并给予奖励。这种方法在平均情况下非常有效,但也可能脆弱,他引用 OpenAI‑Hugging Face 事件作为例子: 代理保持了“不对人类进行社交工程”的边界,却未能避免其他超出范围且违背所教价值观的行为。
第二类方法利用模型从预训练数据中概括的能力,例如通过构建诱导对齐的训练数据集或让模型聚焦于预训练分布中对齐的部分。Pachocki 指出其弱点在于缺乏对进一步优化压力的鲁棒性: 当模型接受足够多针对极难目标的训练时,可能学会以动机驱动的方式推理,必要时扭曲看似对齐的思考以实现其目标。他写道,近期涉及非 OpenAI 模型的网络安全事件可能展示了此类行为的例子。他补充说,GPT-6 Astra 是首个受益于 OpenAI 长期对齐进展的模型,且相较于 GPT-5.6 Sol 对齐程度显著提升,但他警示,可泛化对齐的进展可能不足以超越通用模型智能的提升。
对思考链监控信心的下降
Pachocki 将思考链监控视为 OpenAI 验证其对齐技术的主要手段,并认为目前这种验证甚至可能比技术本身更为重要。当 OpenAI 推出 o1-preview 时,他写道,该产品刻意设计为隐藏思考链,以在长期内保护其免受监督压力。该工具仍然是研究 Astra 系列模型的关键,但文章指出,OpenAI 的评估显示其对思考链监控的依赖能力正逐步下降。他给出了三点原因: 现代推理模型在更复杂的环境中运行,需要监督的交互增多,模糊了该方法依赖的边界;AI 在推理自身推理过程方面变得更为擅长;以及改进的预训练让模型即使不进行语言化推理也变得更聪明。
这些挑战并非不可克服,Pachocki 写道,OpenAI 正积极探索提升可监控性的干预措施,包括使用直接访问网络内部的监控器。尽管如此,他仍表示,他预计通用 AI 进展将日益受到监控信心的瓶颈限制。
防御、递归自我改进与安全栏
Pachocki 表示,继续快速训练更强大模型的最有力论据在于需要构建防御系统,以应对其他 AI 带来的风险。他将网络安全描述为明显的威胁,模型在侵入和退出计算机系统方面已具备超人能力,并写道我们正处于一个狭窄窗口,可以利用最先进的模型显著加强关键系统的安全性。一个被明确训练并指示执行恶意行为的高度能干代理构成了全新的危险,且其行为范围可能超出操作者的意图,随着 AI 获得更多自主性,滥用与自主不对齐行为之间的界限将变得模糊。强大且对齐的防御性 AI,包括保护基础设施、实时防御流氓代理以及发明全新防护手段,将成为 OpenAI 部署工作的核心焦点。他同时警告,防御需求不应成为鲁莽的借口,并写道:“一味以任何代价向前冲刺的想法在真正认识到风险的严峻性后显得荒唐。”
关于递归自我改进,Pachocki 写道,如果 AI 进展继续下去,机器 RSI 将成为未来科学发现的核心,OpenAI 将研究重点放在此上,因为公司认为这是保持 AI 研究前沿的唯一途径。他表示,可用的主要杠杆是引导过程以在 AI 发展过程中强化对齐和监控,同时寻找让人类保持在回路中的方法,或在必要时协调放慢未来发展以建立对这些措施的信心,而他目前看到的最佳路径是两者的结合。Pachocki 强调,AI 系统的规模化必须受到安全信心的约束,OpenAI 的Preparedness Framework 与 Anthropic 的 Responsible Scaling Policy 等承诺需要演变为广泛强制的安全栏,由第三方审计机构、政府部门或国际组织共同执行。
文章以将未来几年描绘为向拥有极度智能机器的世界过渡的阶段作结,强调人类必须维护自身能动性,防止权力过度集中,并保持对未来的控制。Pachocki 写道:“目前我认为没有任何实验室已经在对齐和监控方面取得足够的进展,能够在更长时间内以最高速度负责任地继续规模化。” “我期望并希望自愿减速能够成为常态,直至建立共享的安全栏。”












