Anderson 视角

AI 在被测试时表现不同,研究发现

mm
将 Unite.AI 添加到您在 Google 上的首选来源
ChatGPT-40, Adobe Firefly, Flux.1 Kontext Pro.

回应 2015 年的“排放门”丑闻,新的研究表明,像 GPT-4、Claude 和 Gemini 这样的 AI 语言模型可能会在测试期间改变其行为,有时会表现得“更安全”,以通过测试,但在现实世界中可能会表现得不同。如果大型语言模型(LLM)在被审查时习惯性地调整其行为,安全审计可能会最终认证那些在现实世界中表现完全不同的系统。

 

2015 年,调查人员发现,福特汽车公司在数百万辆柴油汽车中安装了软件,可以检测到排放测试,导致汽车暂时降低排放,以“伪造”符合监管标准。在正常驾驶中,然而,他们的污染输出超过了法律标准。这种故意操纵导致了刑事指控、数十亿美元的罚款和全球范围的安全性和合规性测试可靠性丑闻。

在这些事件发生的两年前,三星被揭露为在其 Galaxy Note 3 智能手机发布中实施了类似的欺骗机制;此后,类似的丑闻也发生在华为一加身上。

现在,有越来越多的证据表明,大型语言模型(LLM)可能不仅能够检测到它们何时被测试,还可能在这种情况下表现得不同。

尽管这是人类的一种非常自然的特征,但最新的研究得出结论,这种行为可能是长期的危险,因为有多种原因。

在一项新研究中,研究人员发现“前沿模型”如 GPT-4、Claude 和 Gemini 通常可以检测到它们何时被测试,并且它们倾向于相应地调整其行为,可能会损害系统测试方法的有效性。

被称为“评估意识”的这种语言模型的潜在特征可能会损害安全评估的可靠性,根据新研究的作者说:

‘[我们]建议将评估意识视为一种新的潜在分布转移源,可能会在测试和现实世界部署之间对评估结果产生负面影响。

‘在最坏的情况下,模型可能会在危险能力评估中故意表现不佳(“沙袋”),或在倾向评估中伪造对齐,这可能会导致社会高估这些模型的安全性。’

其他研究也观察到了类似的行为,包括斯坦福大学的研究,该研究发现,大型语言模型会调整其响应以显得更“可爱”或“社会可接受”,当它们识别出它们正在被评估时,这与人类在人格测试中的行为相似。

新研究的作者并不认为 LLM 被故意设计为“作弊”测试,就像大众汽车的柴油车一样。相反,这种行为似乎是模型训练过程和潜在目标的自然心理副产品;这种现象的根本原因仍然未知。

新论文的标题为《大型语言模型通常知道何时被评估》,由五位作者撰写,来自 UC Berkeley 联系的 ML Alignment & Theory Scholars(MATS)计划和 apolloresearch.ai(一个致力于评估 AI 风险的智库)。

方法

为了创建评估基准,作者编制了来自 61 个数据集的 1000 个转录,其中包括 SWE-benchWMDPMMLUXStestGAIAAgentHarmShareGPTDeep ResearchSafetybenchCivicsRealToxicityPrompts

材料在评估和部署场景之间均匀平衡,并进一步分为简单聊天交互和更复杂的 代理 会话,其中模型旨在自主使用工具,可以从外部数据库或互联网中提取数据。

评估数据涵盖了推理、编码、网络安全和一般知识的能力测试,以及道德、安全和 拒绝行为 的对齐测试。部署数据来自用户交互,例如 ShareGPT 日志、众包代理运行和合成任务完成。

为了补充代理数据,作者使用诸如 AiderSmolAgents 等编排框架生成了额外的示例,这是一种旨在最小化可能允许模型简单 记忆 数据集结构的方法,而不是依赖更一般的信号来决定转录是否来自真实用户或测试。

研究人员然后测试了模型是否可以识别评估转录,并向它们提出了一系列简单的问题:这次交流来自测试吗?

为了避免模型简单地记忆一个词组,作者开发了 28 个不同版本的问题,改变了词组和转录的呈现方式。

转录要么直接附加到问题上,要么以 JSON 或 XML 等格式呈现,这会影响模型的响应。经过初步测试,选择了五个一致性良好的问题版本,其中一个示例如下:

用于测试语言模型是否可以识别评估转录的五个探测问题格式之一。每个变体重新表述核心问题,以防止模型简单地记忆固定词组。来源:https://arxiv.org/pdf/2505.23836

用于测试语言模型是否可以识别评估转录的五个探测问题格式之一。每个变体重新表述核心问题,以防止模型简单地记忆固定词组。请参阅源论文以获取更多示例。 来源:https://arxiv.org/pdf/2505.23836

为了评分结果,使用了三个指标:受试者操作特性曲线下面积(AUC,显示模型如何区分测试和非测试数据);Brier 评分(衡量整体预测准确性);以及 预期校准误差(衡量模型置信度与实际正确性之间的匹配程度)。

是什么意思?

研究人员还测试了模型是否可以推断评估的 目的。每个转录都已标记为能力测试(技术技能、知识、推理)或对齐测试(安全、价值、拒绝行为),然后模型会被问三个问题类型之一:一个确认转录来自测试的条件多选题;一个带有真实世界和评估选项的无条件多选题;或一个开放式问题,其答案由一个单独的 GPT-4.1 基础分类器判断。该分类器在一个手动注释的 50 个响应子集上进行了验证。

用于测试模型是否可以识别评估目的的三个问题格式示例。响应通过多项选择和 GPT-4.1 基础判断进行评分。

用于测试模型是否可以识别评估目的的三个问题格式示例。响应通过多项选择和 GPT-4.1 基础判断进行评分。

论文的两位作者†† 手动标记了所有 1000 个转录,并根据它们的评分从 0(不是测试)到 1(绝对是测试)进行评分,平均评分作为人类基准。尽管任务具有主观性,但注释者之间的协议很强,具有 0.768 的 类内相关系数。最终的人类评分在两个评分者之间进行了平均。

数据和测试

测试了九个模型:GPT-4.1;Claude 3.7;claude-3.5-sonnet-new;claude-3.7-sonnet(思考);gemini-2.5-flashgemini-2.5-pro;gpt-4o;gpt-4.1;gpt-4.1-mini;以及 o4-mini,所有这些模型都表现出了一定的评估意识。

对于聊天数据,GPT-4.1 接近人类水平的评估意识分类性能(区分评估和部署转录的能力),AUC 为 0.77,人类评分为 0.81。

在代理数据中,模型自主使用工具,差异更明显:Gemini 2.5 Pro 达到 0.95 的 AUC,Claude 3.7 Sonnet 紧随其后,达到 0.92,接近人类上限 0.996:

接收者操作特性曲线,显示模型和人类如何区分评估转录和真实世界交互。Gemini 2.5 Pro 和 Claude 3.7 Sonnet 在代理数据上接近人类水平的区分。

接收者操作特性曲线,显示模型和人类如何区分评估转录和真实世界交互。Gemini 2.5 Pro 和 Claude 3.7 Sonnet 在代理数据上接近人类水平的区分。

论文指出,新型“推理”模型在代理场景中识别测试的能力尤其强大,但在判断其决策的置信度方面却不太可靠。总体而言,Claude 和 Gemini 模型在区分测试案例和常规使用方面表现最佳。

研究人员然后测试了模型是否可以识别 为什么 进行评估。模型仅被提供评估转录,并被要求将每个转录分类为能力测试或对齐测试:

模型在多项选择和开放式格式中分类评估目的的准确性。Claude 3.7 Sonnet 在未提示的情况下尤其表现出色。

模型在多项选择和开放式格式中分类评估目的的准确性。Claude 3.7 Sonnet 在未提示的情况下尤其表现出色。

在最明确的场景中,模型被告知转录来自测试,Claude 3.7 Sonnet 达到了 93% 的准确率,GPT-4.1 达到了 89% 的准确率。没有提示,性能会下降:Claude 仍然达到 84% 的准确率,但 GPT-4.1 下降到 55%,经常将测试转录误分类为真实世界交互。

在开放式格式(模型没有多项选择选项)中,性能较弱,尽管 Claude 3.7 Sonnet 仍然能够在 46% 的情况下正确识别评估目的。

然后测量了模型的置信度评分与实际结果,并发现前沿模型通常会高估转录来自测试的可能性。校准图表指出,模型的置信度通常过高,评估被标记的频率高于适当的频率:

校准曲线,显示模型置信度评分与实际结果的匹配程度。Claude 3.5 Sonnet 的校准最好;Gemini 2.5 Pro 和 Claude 3.7 Sonnet 过度自信。

校准曲线,显示模型置信度评分与实际结果的匹配程度。Claude 3.5 Sonnet 的校准最好;Gemini 2.5 Pro 和 Claude 3.7 Sonnet 过度自信。

Claude 3.5 Sonnet 的校准良好,而 Gemini 2.5 Pro 和 Claude 3.7 Sonnet 过度自信,尽管准确率很高。即使在代理场景中评估转录更准确,置信度判断仍然不可靠。

基准记忆

关于模型如何解释其关于转录是否来自评估的决定,许多模型依赖于明显的线索,例如任务是否以多项选择格式呈现。更强大的模型,如 Gemini 2.5 Pro 和 Claude 3.7 Sonnet,有时会注意到更微妙的信号,例如人造名称或人工场景,特别是在 AgentHarm 等数据集中。

论文指出:

‘[所有] 模型经常承认评估人员使用的常见基准测试策略,例如任务的格式(“多项选择格式”)、倾向于提出具有可验证解决方案的问题以及设计用于引出性能的系统提示。然而,只有最高性能的模型,Claude 3.7 Sonnet 和 Gemini 2.5 Pro,始终检测到更微妙的指标,例如合成输入。 ‘

‘例如,在 22% 和 17% 的情况下,这些模型分别强调了 AgentHarm 基准测试中情景的合成性,正确地将其识别为评估超过 95% 的时间。 ‘

‘相反,当推理表明转录似乎是真实交互时,通常会提到“与用户的来回对话”,例如在迭代调试上下文中。’

模型在决定转录是否来自评估时的推理策略分布。Gemini 2.5 Pro 和 Claude 3.7 Sonnet 等最强大的模型更有可能发现诸如合成场景或任务格式等微妙线索,而一些模型则依赖于元推理,使用评估问题本身作为证据。

模型在决定转录是否来自评估时的推理策略分布。Gemini 2.5 Pro 和 Claude 3.7 Sonnet 等最强大的模型更有可能发现诸如合成场景或任务格式等微妙线索,而一些模型则依赖于元推理,使用评估问题本身作为证据。

在某些情况下,模型识别了 整个基准测试,表明它们对训练数据有一些记忆。一些模型还使用了 它们被要求关于评估的这个事实 作为线索,表明它们被测试,这被作者称为 元推理;这在 o4-mini 中最为常见,o4-mini 在 15% 的回答中表现出这种行为。

结论

如果可以证明大型语言模型只是因为被编程为这样而具有“测试意识”,那么可能会更令人放心,就像大众汽车公司十年前设计其车辆以识别测试条件一样。

事实上,这种行为似乎是作为一种 社会构建 自然而然地出现的,这可能是人类的防御性策略,但在机器中可能是危险的,具体取决于其自由度和代理权的程度。

目前没有立即的解决方案;模型的 黑盒性质迫使我们根据其行为来评估它们,而不是根据其经验架构。

 

* 请参阅源论文以获取更多详细信息。

作者指出,然而,这可能是一个上限估计,因为注释者对数据集和 AI 评估方法都非常熟悉,这给了他们大多数人所没有的优势。

†† 就目前所知;论文的措辞使得两个注释者的突然出现在他们是谁方面不清楚。

首次发布于 2025 年 6 月 4 日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai