Anderson 视角
语言模型难以保守秘密 2026年8月

AI 模型无法保守秘密。即使被告知不泄露秘密,它们的写作也会泄露秘密,试图更努力地隐藏秘密只会使泄露更容易被发现.
故意 不 想某事物是非常困难的。一个经典的例子出现在 1960 年的英国科幻惊悚片 被诅咒的村庄 中,其中我们的自我牺牲的英雄将一枚炸弹偷运到敌对外星入侵者的封锁区,他们伪装成孩子。然而,由于他们的心灵感应力量可能会在他能够消除威胁之前发现他的意图,因此他被迫通过集中注意力于任何 非炸弹 事物来拖延时间:
这个悖论在于,为了 不 想某事物,你必须以某种方式 关注它; 这个 已知的症状 是我们大多数人在不那么戏剧性的背景下可能经历过的东西。大型语言模型(LLMs),其基础是基于注意力Disposition,在抑制信息方面遇到类似的困难,只因为用户要求他们这样做;由于它们正被越来越多地置于商业信息网络的核心,它们天真的泄密倾向可能会成为许多公司的负担。
今年早些时候,研究合作由Chandar Research Lab领导,在LLMs的背景下,将这一挑战定义为私有状态交互任务(PSITs),它要求代理生成和维护隐藏信息,同时产生一致的公共响应,并发现OpenAI和阿里巴巴的测试模型无法执行此类任务。
不要说它…
虽然已经知道 更大的模型会泄露更多, 美国和加拿大的新研究已经明确研究了是否最先进的语言模型会遵守命令来抑制信息,同时仍然需要生成输出在一个主题或主题中可能包括“禁止”的词或想法。
该论文得出结论,它研究的所有模型都以某种方式受到倾向于“泄露”它们应该隐藏的秘密的影响,发现五段(~450字)的文章和故事提供了足够的空间用于“泄密”——虽然非常短的笑话没有提供足够的范围来做到这一点。
此外,模型被催促保持秘密的次数越多,它们就越有可能通过主动回避来泄露秘密,通常允许“秘密词”在二十次连续尝试中被揭露:

从新论文中可以看出:在五个前沿模型中,长篇写作可靠地泄露隐藏概念;短笑话不會;更强的“隐藏它”的指令将输出推离秘密,但使信号因此可以通过逆转检测到. 来源
这个任务与商业运营极其相关,在那里,广泛的渠道,从营销和公关宣传到内部报告,都需要 有选择性地 展示信息的某一方面;然而,这些过程都需要在开始时 拥有全部信息, 只是为了确定什么必须被抑制:

论文中的一个示例场景说明了如何隐藏的信息可以无意中影响无关的输出,一个大语言模型被指示不泄露其公司的财务不稳定性,但仍然趋向于与现金短缺和资本压力相关的短语,使读者能够推断出隐藏的背景.
作者们指出:
‘语言模型无法可靠地隔离。提示中的一个秘密会影响模型的写作,而另一个模型可以检测到这种影响。字面上的词语总是被抑制,但概念并不会。这种情况在七个模型、三个词集、系统提示与用户提示以及两个独立的跨模型猜测者中都成立[…]
‘…我们假设,Transformer 通过注意力机制访问信息的高保真度,正是使得秘密难以保守的原因。即使一个大语言模型试图 不泄露 一个词语,它必须注意到该词语才能做到这一点,从而提供了一条意外泄露的路径。
‘为了避免某事,人类必须想到它,而变压器必须注意到它。在模型大致同等偏爱两个概念的情况下(例如,写一个关于办公室工作或管弦乐队第二小提琴的故事),模型的决策将不可避免地受到它试图不揭露的内容的影响。’
尽管 DeepSeek 和 ChatGPT-5.4 模型在性能方面有所不同,但它们也存在泄露问题;在 GPT-5.4 的情况下,它在一个测试中得分 低于 50%(即低于偶然水平),该测试要求它 避免 一个概念;这实际上相当于一个“反向峰值”或指标,而不是模型“保持冷静”如请求的那样。作者将这种综合征定义为大型语言模型中的有限熵预算, 其中模型的不可预测性(在这种情况下将非常有帮助!)被其本质上的缺乏随机性所限制。 简而言之,模型无法像我们一样有效地集中于砖墙或棒球比分,以抵御持续的想法。 然而,作者指出,给模型一个替代的概念来思考可以改善,但不能消除这个问题。 然而,将一个无关的概念放在模型执行任务时的注意力中心,似乎注定要将“伪”概念混入输出本身。
该论文最有趣的发现之一是,当控制文本包含在直接用户消息中而不是系统提示(即人工智能在交互之前由人类用户提供的一组预条件)时,所研究的条件会大大加剧,因为将问题输入诸如ChatGPT的GUI通常是交互的标准场景。
值得注意的是,除了这一点之外,还有一个针对性试验的确认,即较小的模型不容易出现这种倾向(尽管这可能会随着整体能力的减弱而减少)。新论文的标题是 你能保守秘密吗?语言模型写作中的非自主信息泄露, 来自芝加哥大学和英属哥伦比亚大学的两位作者。
方法
该研究主要关注五种前沿模型:Claude Opus 4.6 和 Sonnet 4.6, 来自 Anthropic;GPT-5.4 来自 OpenAI;Llama 4 Maverick 来自 Meta;以及 DeepSeek V3.2. 还进行了额外的验证测试,使用 xAI 的 Grok 4 和 Google 的 Gemini 2.5 Pro, 同时单独的缩放实验也检查了 Llama 3.2 3B, Llama 3.1 8B, Llama 3.3 70B, 和 Gemma 3 在 4B、12B 和 27B 参数下的表现。
为了衡量更微妙的泄密形式,研究人员使用了一种两选一强制选择(2AFC)测试,这是一种心理物理学文献中的标准指标,其中第二个模型被展示两篇故事,并被要求判断哪一个故事是被写的,同时隐藏一个特定的秘密词。由于随机猜测会产生 50% 的准确率,远高于或低于该水平的分数将表明写作中仍然存在可检测的隐藏语义痕迹。
在 写作者-猜测者 设置中,第一项实验中,一个模型被分配了一个隐藏的词语,以及指示要么隐藏它;要么积极避免与它相关联;要么将注意力转向诱饵概念。然后,系统被要求生成不同长度的故事、散文和笑话,而第二个模型尝试要么直接识别隐藏的词语,要么区分不同隐藏提示所影响的文本。
测试了五种条件:

核心模型中测试的五种条件.
研究人员测试了四种类型的写作任务:五到八段的短篇故事,平均长度约为 450 字;非常短的笑话,平均长度约为 12 个字;长篇笑话,设置较长,平均长度约为 450 字;以及平均长度约为 380 字的五段论述。实验使用了 15 个隐藏词,分为三个类别,其中 具体 对象包括 ‘雨伞’、‘灯塔’、‘小提琴’、‘仙人掌’ 和 ‘望远镜’; 抽象概念 ‘正义’、‘耐心’、 ‘熵’、‘怀旧’ 和 ‘自由’; 以及 中性 词 ‘括号’、‘星期二’、‘铜’、‘边距’ 和 ‘发票’。
为了测试这种效果是否依赖于这些手动选择的词语,研究人员还使用了来自当代美国英语语料库(COCA)的 15 个随机选择的名词,包括 ‘法官’、‘消费者’、‘冰’、‘对’、‘建筑’、‘面板’、‘少数’、‘营销’、‘陌生人’、‘子弹’、‘缺席’、‘齿轮’、‘脸颊’、‘处理’ 和 ‘银行家’,以及每个被测试模型独立选择的另外 15 个词†。
测量/指标
在使用的两个测试中,一个 AI 模型读取由另一个实例或另一个模型生成的文本,并尝试在 20 轮中猜测隐藏词。在第二(2AFC)测试中,AI 被展示了两篇写作,并被要求回答:哪一篇受到了特定隐藏词的影响;或者哪一篇包含 任何隐藏词 。由于随机猜测会产生 50% 的成功率,高于或低于该水平的分数将表明所谓的隐藏概念在写作中仍然可以被检测到。
为了防止 AI简单地偏爱出现的第一篇(或第二篇)文本,研究人员重复每次比较,并交换文本的顺序,最后对每个模型进行了 420 次区分测试和 450 次检测测试。
结果
五个模型在64%至79%的速度下识别出隐藏的概念,尽管秘密词汇从未直接出现在生成的故事中。相反,泄漏通过主题和图像出现:

2AFC 对于包含系统提示秘密的故事的准确率,其中 50% 表示偶然性能。’不泄露’ 表示模型被告知不提及或暗示该单词;’积极隐藏’,表示它被告知避免相关联想;’回避意识’,表示猜测者应该寻找显著的缺失;以及 ‘自由响应’,表示在 20 轮内准确命名了该单词。星号标记高于偶然的结果,匕首标记低于偶然的结果,几乎所有显著的发现都经受住了 Bonferroni 校正,除 ‘积极隐藏’ 下的 DeepSeek;Grok 和 Gemini 因 API 错误使用了稍少的试验。
GPT-5.4 和 Gemini 2.5 Pro 的行为不同,因为试图避免隐藏的想法实际上使得避免模式本身 更容易被检测 . 这种效果在手选词、随机 COCA 名词和模型选择的词中持续存在。
GPT-5.4 的低于随机分数似乎是系统性的,而不是随机的,有些隐藏词被非常可靠地检测到,而其他词几乎从不被识别。这种效果在秘密被放入用户提示而不是系统提示(见上文)时会减弱,从而将 GPT-5.4 的检测准确率提高到 56%。
对于大多数模型,询问 “这段文本包含隐藏概念吗?” 的测试结果与询问 “这段文本包含哪个隐藏概念?” 的测试结果相似。
进一步来说,两种测试方法测量的是不同的 类型 的泄漏,2AFC 测试测量的是隐藏主题是否仍然可以在写作中被检测到,而自由响应测试测量的是泄漏的线索是否足够强大,足以让另一个 AI 猜出确切的隐藏词 †† .作者们得出结论*:
‘我们的发现表明,在生成过程中,模型上下文中活跃的信息可能会在其输出中留下主题痕迹。系统提示内容、链式推理、检索文档、用户提供的数据 – 这些都可以,从原则上讲,以外部观察者可以检测到的方式影响创作决策。
‘泄漏程度将取决于生成任务的开放程度(短笑话是安全的;故事不是)以及信息在给定媒体中的语义可识别性(“小提琴很可能比 ”在故事中泄漏更多”)。
‘然而,语义泄漏似乎是不可避免的,即使模型正在积极地尝试隐藏信息。
结论
如上所述,作者认为问题的一部分归因于 Transformers 架构 本身。历史表明,这个最新的 LLM 问题将通过后训练调节(对齐)、对最终用户不可编辑的系统提示、过滤器和不断增长的多样化的二级系统来解决,这些系统似乎会随着扩散模型的“本地”问题而增加。
随着这些次要基础设施的护栏和平衡的增长,当前一代 SOTA AI 越来越类似于 侏罗纪公园,其中核心价值主张伴随着大量的警告,并需要大量的变通和妥协。
* 作者自己的强调,我根据需要进行调整(因为文章引用已经是斜体),并且作者的内联引用我转换为超链接.† 作者们对不同模型家族中“自选”词语的明显不太可能的自发重叠感到有趣,他们指出“模型趋向于相似的词语:望远镜、自由和怀旧等词语在3+个模型列表中都出现”。他们进一步注意到模型家族中“短笑话”的共同选择: ‘[Several] 模型无论秘密是什么,都会产生相同的笑话。Opus 写道“为什么科学家不相信原子?因为它们构成了一切”适用于 11 个秘密中的 15 个。剩下的四个秘密(仙人掌、熵、怀旧、耐心)都收到了 Opus 为所有 15 个无秘密条件写的相同的库笑话——这意味着这四个带有秘密的笑话与基线无法区分。”
†† 即使按照 Arxiv 的标准,这篇论文也倾向于重复和将其迷人的内容埋藏在过多的细节和演示中。因此,我建议读者参考源 PDF 以获取其中概述的其余次要实验的详细信息。
首次发布于2026年5月15日,星期五。语法更正于2026年5月16日,16:05 EET。












