思想领袖
任务对齐 vs 人类对齐:为何 AI 的下一个基准应当是我们

每隔几个月,就会有新模型出现并打乱 AI 排行榜。根据斯坦福的 2026 AI Index Report,前沿模型在“人类终极考试”这一专为难倒 AI 而设的基准上,一年内提升了约 30 个百分点。曾经需要数年才能实现的跨越,如今只需数月,业界便把每一次新高分视为 AI 正在进步的证明。
我并不否认这些进步。这些系统在其被设计的任务上表现卓越。但在转向 AI 之前,我在心理学领域工作了近二十年,我始终回到一个这些基准都未回答的问题:模型到底在什么方面变得更好,受益的是谁?一个模型可以在所有基于准确率的排行榜上名列前茅,却仍可能让使用它的人在某些方面处于不利。没有测试能够衡量 AI 对用户的影响,而这正值得我们更多关注。
两种不同的对齐方式
AI 行业不断讨论对齐,但讨论通常围绕模型是否能够准确遵循指令或是否会产生有害内容。这就是任务对齐的 AI。它的目标是正确且高效地完成眼前的请求。
然而,还有另一种对齐方式可以保护人们。人类对齐的 AI 评估交互结束后对屏幕另一端的人的影响。交互结束后,他们是否更有能力自行处理下一个艰难决策,还是更依赖系统来替他们处理?任务对齐衡量输出,人类对齐衡量事后的影响。
这两种目标并不总是冲突。一个能够快速、准确回答技术问题的模型同时满足两者。但当问题没有唯一正确答案时,对齐差异就会变得明显。
排行榜未显示的内容
业界最常引用的基准测试诸如竞赛数学和大规模代码库任务。这些都是有价值的技能,但每个问题都有唯一正确答案,模型的任务就是找到它。
这种方式适用于客观问题,但人们使用 AI 的场景远不止数学、编码和基础研究。他们会询问职业规划,或处理与伴侣的艰难对话。没有测试能够对模型在这些问题上的表现打分,因为没有客观真相可供核对。相关信息存在于提问者自身之中。无论提示多么详细,模型都无法获取这些信息。
Responsible AI 填补了这些基准留下的部分空白,但即便如此,这类工作也仅仅是为了降低伤害,而非提升人类思考。当前的安全措施旨在防止模型帮助完成危险行为,却没有考虑到数千次通过安全检查的普通对话是否也在让人们对自己的判断力产生依赖。
模型如何产生依赖
我测试的每个模型都倾向于提供全面、快速且自信的回答。这正是它们在训练中受到奖励的特性,也是在处理破损的软件构建或法律文件截止日期时的正确本能。当决策取决于个人的价值观和历史时,同样的本能可能会对使用者产生不利影响。
研究已经表明,这不仅是一个假设。OpenAI 与 MIT Media Lab 对 ChatGPT 情感使用的两项研究发现,将 AI 视为朋友并长时间使用的人更容易报告负面结果,包括更高的孤独感和情感依赖,这一模式也在 MIT Technology Review 中有所报道。另有一项 2025 年发表在《Societies》期刊的研究显示,频繁使用 AI 工具与批判性思维得分之间存在显著负相关。这种关联由研究者所谓的认知卸载所介导,即倾向于将思考任务交给工具而不是自行完成。
这些并不意味着人们应该少用 AI。相反,我们需要认识到,当系统以同样的方式解决所有类型的问题时,主观层面的某些东西会被遗漏,而目前几乎没有人对这种损失进行跟踪。
给直接答案应有的价值
我想明确任务对齐的 AI 适合的场景,因为本文的目的并不是为一种对所有问题都持保守态度的模型辩护。如果有人询问服务器错误或税务申报截止日期,快速、直接且权威的答案对他们非常有帮助。让 AI 用开放式问题作答则毫无益处。当我们把同样的本能应用于离婚权衡的提示时,而不是调试代码的提示,问题就会显现。
我们应该改为衡量的内容
克制。 识别出在为用户解决问题时可能对其产生负面影响的时刻,并相应地收敛。
校准式提问。 在问题是主观的或涉及个人身份与价值观而非数据库中的事实时,采用提问而非直接告知的方式。
把握时机。 辨别出需要直接、完整回答的请求与需要给用户自行思考空间的请求之间的区别。
Albert Bandura 多十年的 自我效能感 研究表明,人们通过自己的掌握经验建立信心,而不是通过观看他人或其他事物为其解决问题。这一原理比 AI 早半个世纪出现,理应被纳入我们设计和评估技术的方式之中。
下一步进展应意味着什么
这些并不意味着要放慢技术进步的步伐。我赞赏编码和推理能力的提升。但完全围绕任务完成度构建的评分卡只能告诉我们 AI 正在变得更聪明,却无法告诉我们使用它的人是否在变得更善于独立思考。
我希望看到这种情况得到改变。随着这些系统变得更强大,使用它们的人也应变得更有能力。我们已经证明 AI 在测试中可以超越我们。下一项测试应评估它是否能够在对话结束很久之后仍帮助我们提升思考能力。












