Anderson 视角
系统提示中的隐藏日期削弱语言模型评估

如果没有对大型语言模型(LLM)进行基准测试的能力,消费者和企业很难了解模型在最近版本中取得了什么进展,以及它相对于竞争对手的表现如何:

arena.ai 上有影响力的 LLM 排行榜。 来源
由于 LLM 是非确定性的(即使在相同输入下,它们不始终产生一致的输出),评估它们十分棘手。即使研究人员使用相同的提示、模型设置和基准数据集,执行环境中看似微小的差异也可能产生不同的答案,并显著改变性能得分。
硬件配置、数值精度、推理批量大小,甚至多项选择答案的顺序等因素都可能影响结果。这会使人难以判断报告的改进是实际进步,还是仅仅是模型测试条件中半随机的变化。
在一定程度上,人们可以考虑其中一些变量,或至少确定它们产生的误差幅度,从而使比较评估具有意义。值得尝试,因为大量资金和声誉取决于能够以一定精度对这类 AI 系统进行基准测试。
然而,根据最新研究,某个特定变量不仅会破坏基准测试,而且很难从定义这些基准的提示中消除——当前日期。
时代变迁
新论文*,由德国、墨西哥和美国的学术合作完成,断言当前日期自动且悄悄地被包含在所有前沿以及许多部署的开放权重模型的系统提示中,这意味着可重复性几乎不可能实现:
‘我们发现了 LLM 评估中一个关键且常被忽视的非确定性来源:在系统提示中隐藏注入当前日期。’
‘在 9 种模型、6 个数据集和四项任务中,这一动态元数据改变了模型性能并重新排列了排行榜名次,其影响超过了批量大小或数值精度等其他系统层面因素带来的差异。’
研究人员还指出,这一效应在需要生成答案的任务中更为显著,性能在多项选择题上波动最高可达 6%,在数学推理上可达 14%,在代码生成上可达 7%——机器翻译得分也出现了显著变化。
提供示例答案并鼓励逐步推理并未解决问题——事实上,后者使情况更糟:

2024 年不同日期下 Llama 3.1(8B)在 MMLU 基准测试中的准确率波动。逐步推理(红色)产生的变异性明显大于直接答案(蓝色),展示了链式思考提示如何放大对日期的敏感性。 来源
该效应也在专有模型中被发现,GPT-5.1在 2025 年 12 月的一周测试期间,在三个多项选择基准上显示出最高达 4% 的准确率波动。研究人员使用了空的系统提示,禁用了推理并将随机性设为零——但日期仍被提供者自动插入:

尽管用户提示和模型设置相同,GPT-5.1 的准确率在 2025 年 12 月连续七天仍出现波动。最大差异出现在 GPQA(橙色),最佳日与最差日之间相差四个百分点。虚线表示每个基准在一周内的平均准确率。
研究人员建议在可能的情况下从系统提示中移除日期,或对其进行修正并记录,以确保公平比较。然而,他们指出,以日期为中心的影响可能更为根深蒂固:
‘日期敏感性的一个可能原因是系统提示在监督微调(SFT)和人类反馈强化学习(RLHF)期间可能被固定,使模型对任何轻微的修改都变得脆弱。’
为调查此问题,研究人员尝试了六种不同的系统提示措辞,发现这些变化对准确率的影响与更改日期(0.78%)同等。因此,日期的影响似乎与刻意的 提示工程 相当——但它会自动变化,用户甚至不知道。
还尝试了其他方法来缓解“当前日期”问题,包括 少样本学习(模型在回答前先看到五个示例答案)。这稍有帮助,使平均波动从 2.52% 降至 2.27%,但未能根除该问题。
还测试了 GPU 硬件、批量大小、数值精度、答案顺序和系统提示措辞的变化。影响最大的是答案顺序和提示措辞,它们的影响接近于更改日期的程度。
最后的日子
合理地预期,LLM/VLM 在对话伊始就能理解日期;然而,似乎没有明确理由将其写入系统提示(这一不可见的准则会施加 安全防护,并以用户无法访问的方式约束 LLM 的行为),即使 LLM 完全可以在与用户交互前,例行进行一次小于千字节的 RAG 调用来获取最新日期作为日常维护。
毫无疑问还有其他解决方案;然而,由于将当前日期强加到系统提示中迄今未被视为问题,显然对此几乎没有或根本没有进行调查。
线上约会
在测试中,对所有模型使用相同的提示,仅更改系统提示中的日期。对 2024 年的每一天都进行了测试,范围从 1 月 1 日至 12 月 31 日,其他所有设置保持不变。
使用了六个基准:MMLU;GPQA;以及 ARC-Challenge,用于多项选择题(通过答案标记概率评分)。GSM8K 用于逐步数学(检查最终答案);HumanEval 用于 Python 代码生成(单元测试);以及 WMT 用于英译德、英译芬兰语和英译捷克语的翻译(对完整输出进行评估)。时间相关的问题被排除在外。
测试了九个模型:Llama 3.1 Instruct(8B 和 70B);Gemma 3 Instruct(4B 和 27B);Qwen3(4B);Qwen3-Next(80B);Phi-4(14B);以及 GPT-OSS(20B 和 120B)。
准确率(正确回答的问题比例)用于对多项选择题和数学测试进行评分,而 期望校准误差(ECE)则衡量模型的置信度与实际表现之间的匹配程度。
代码使用 pass@1 进行检查(首次尝试即通过所有测试的生成代码解决方案的比例);翻译则使用 BLEU 和 chrF 进行评分。
结果证实了研究人员的假设:仅仅更改系统提示中的日期就会影响模型对相同问题的回答准确性。

测试结果展示了五个领先模型在 2024 年系统提示日期变化期间在 MMLU 上的表现。顶部显示准确率,下面显示期望校准误差(ECE)。尽管测试条件未做其他更改,所有五个模型在两项指标上均出现波动。较低的 ECE 分数表明置信度与准确性之间的匹配度更好。
结合文章前面展示的其他结果,这对 LLM 基准测试而言可能是坏消息,因为模型的得分可能因测试日期不同而高低起伏,进而在排行榜上改变名次,却并未真正提升或削弱其能力。
结论
此问题凸显了我们在 2023 年左右之前习惯的确定性计算系统与自那以后不断演进的基于扩散等全然不同的 AI 系统之间的鸿沟。
日期解析在 1970年1月1日 基本上已经解决,但显然以 截止日期 等 时间相关问题 的形式再次困扰计算领域。
*标题为“为模型标注日期:系统提示中的隐藏日期影响 LLM 评估”
首次发布于2026年10月9日星期五

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









