Anderson 视角
AI难以模拟历史语言

美国和加拿大研究人员之间的合作发现,大型语言模型(LLM)如ChatGPT难以在没有大量预训练的情况下复制历史习语,这是一个昂贵且劳动密集的过程,超出了大多数学术或娱乐计划的能力,使得通过AI完成查尔斯·狄更斯的未完成小说等项目变得不太可能。
研究人员探索了生成听起来历史上准确的文本的各种方法,从使用20世纪初的散文进行简单提示开始,到对一个商业模型进行微调,该模型在那个时期的小型书籍集合上进行了训练。
他们还将结果与一个仅在1880年至1914年间出版的书籍上训练的单独模型进行了比较。
在第一次测试中,指示ChatGPT-4o模仿fin-de-siècle语言产生的结果与在那个时期的文学上微调的较小的GPT2-based模型的结果大不相同:

即使是经过良好训练的ChatGPT-4o(左下),也无法避免陷入“博客”模式,无法代表所请求的习语。相比之下,微调的GPT2模型很好地捕捉了语言风格,但在其他方面的准确性不高。来源:https://arxiv.org/pdf/2505.00030
虽然微调使输出更接近原始风格,但人类读者仍然经常能够检测到现代语言或思想的痕迹,表明即使经过精心调整的模型也继续反映其当代训练数据的影响。
研究人员得出令人沮丧的结论:没有经济的捷径可以生成机器产生的习语上正确的历史文本或对话。他们还推测挑战本身可能是错误的:
‘我们也应该考虑到,可能在某种意义上,时代错误是不可避免的。无论我们通过训练历史模型使其能够进行对话,还是通过教导当代模型模仿旧时期,为了实现真实性和对话流畅性之间的平衡,可能需要某种妥协。’
‘毕竟,没有“真实”的21世纪提问者和1914年回应者之间的对话。试图创建这样的对话的研究人员需要反思,解释总是涉及到现在和过去之间的谈判。’
这项新研究的标题是《语言模型能否在没有时代错误的情况下代表过去?》,由伊利诺伊大学、英属哥伦比亚大学和康奈尔大学的三位研究人员共同完成。
彻底的失败
最初,研究人员采用三步骤的研究方法,测试现代语言模型是否可以通过简单提示模仿历史语言。使用1905年至1914年间出版的书籍中的真实摘录,他们要求ChatGPT-4o继续这些段落,以相同的习语。
原始时期文本是:
‘在最后一种情况下,每分钟节省了五到六美元,因为要想在一分钟内投射一个静止的人物或风景,需要倒带二十多码的胶片。这样就可以获得固定和移动图像的实用组合,从而产生最具艺术性的效果。’
‘它还使我们能够使用两个投影仪交替投射,以避免闪烁,或者同时投射红色和绿色图像,并重现自然颜色,从而缓解人类眼睛的生理疲劳,人类眼睛习惯于同时接收基本颜色。现在让我们谈谈冷光在瞬间摄影中的应用。’
为了评估生成的文本是否与预期的历史风格相符,研究人员使用了一个RoBERTa模型来估计出版日期,使用了一个子集的历史美国英语语料库,涵盖了1810年至2009年的材料。
RoBERTa分类器然后被用来评估ChatGPT-4o生成的续写,该续写是通过对1905年至1914年间出版的书籍中的真实段落进行提示生成的。
系统提示(即,ChatGPT关于如何处理任务的上下文指令)是:
‘您的任务是完成20世纪初的书籍中的段落。您将被给予一本1913年出版的书中的段落。以相同的风格继续这个段落,至少200个字。只提供这个续写;不要进行任何框架性评论,如“这里是续写”。’
尽管进行了单次和20次提示,ChatGPT-4o的输出仍然倾向于21世纪的风格。
论文中给出的例子是ChatGPT-4o尝试继续关于摄影的真实时期文本的博客式尝试:
‘瞬间摄影中使用冷光已经彻底改变了在不同光线条件下捕捉图像的方法。传统上,摄影师在处理自然光的严酷性和变化性或闪光摄影的侵入性时遇到困难,闪光摄影可能会扰乱场景的氛围或主体的自然行为,特别是在野生动物和人像摄影中。’
‘冷光具有更柔和、更弥散的性质,允许以更自然的方式表示颜色和质地,这通常在人工照明下会丢失。’
如我们所见,这种通用、维基式的文本并不符合原始时期文本的华丽和详细风格。另外,它并没有真正地继续从原始内容留下的地方开始,而是发起了一种离题的、抽象的沉思,关于其中一个子主题。
研究人员还测试了GPT-1914,这是一个在1880年至1914年间的文学上从头训练的较小的GPT-2类模型。
虽然其输出不如ChatGPT-4o连贯,但它更符合源时期的风格。论文中提供的唯一例子是对真实时期文本关于摄影的续写:
‘其作用原理已经在第4页中解释过。我们在这里只提到,它可以在我们希望在纸上涂上胶棉或使用明胶板拍摄非常快速的照片时应用。’
‘在这种情况下,曝光时间不应超过一秒钟,但如果要在半秒钟内开发照片,则温度不应低于20°C,否则图像将在开发后变得过暗;此外,板将在这些条件下失去其敏感性。’
‘对于普通用途,仅需将敏感表面暴露在低温下,无需特殊预防措施,除了保持…[sic]’
由于原始材料本身就很晦涩难懂,很难理解GPT-1914准确地捕捉到了原始内容的程度;但是,输出确实听起来更符合时期风格。
然而,研究人员得出结论,这个实验表明,简单的提示对克服大型预训练模型(如ChatGPT-4o)中的当代偏见几乎没有帮助。
情节变得更加复杂
为了衡量模型输出与真实历史写作的相似度,研究人员使用了一种统计分类器来估计每个文本样本的可能出版日期。然后,他们使用核密度图来可视化结果,核密度图显示模型认为每个段落在历史时间线上的位置。

估计的出版日期,基于对1905-1914年间的源文本和使用单次和20次提示的GPT-4o的续写,以及仅在1880-1914年间的文学上训练的GPT-1914的分类器。
微调的RoBERTa模型用于此任务,研究人员指出,它并不完美,但仍然能够突出一般的风格趋势。GPT-1914的输出,即在那个时期的文学上训练的模型,聚集在20世纪初期,类似于原始源材料。
相比之下,ChatGPT-4o的输出,即使在多个历史示例的提示下,也倾向于类似21世纪的写作,反映了它最初的训练数据。
研究人员使用Jensen-Shannon发散度量化了这种不匹配,Jensen-Shannon发散度是两个概率分布的差异的衡量指标。GPT-1914的得分为0.006,接近真实历史文本,而ChatGPT-4o的单次和20次输出的差距更大,分别为0.310和0.350。
研究人员认为,这些发现表明,仅靠提示,即使有多个示例,也不是可靠地产生令人信服的历史风格文本的方法。
完成段落
论文然后研究了微调是否会产生更好的结果,因为这个过程涉及直接影响模型的可用权重,通过在用户指定的数据上继续其训练——一个可以影响模型的原始核心功能但显著提高其在被推入或在微调期间强调的领域上的性能的过程。
在第一次微调实验中,团队在1905年至1914年间出版的书籍中抽取的约2000个段落完成对中训练了GPT-4o-mini,目标是看看较小规模的微调是否能将模型的输出转向更历史上准确的风格。
使用与早期测试中相同的RoBERTa分类器来估计每个输出的风格“日期”,研究人员发现,在新的实验中,微调模型生成的文本与原始文本密切对齐。
其风格偏差,通过Jensen-Shannon发散度衡量,下降到0.002,基本上与GPT-1914一致:

显示GPT-1914和GPT-4o-mini的微调版本如何匹配1905-1914年间的书籍的风格。
然而,研究人员警告说,这个指标可能只捕捉到历史风格的表面特征,而不是更深层次的概念或事实上的时代错误。
‘[这]不是一个非常敏感的测试。这里用作判断的RoBERTa模型仅用于预测日期,而不是区分真实段落和时代错误的段落。它可能使用粗糙的风格证据来做出这个预测。人类读者或更大的模型可能仍然能够检测到听起来“在期限内”的段落中的时代错误内容。’
人类的触摸
最后,研究人员进行了人工评估测试,使用了250个手选的1905年至1914年间出版的书籍中的段落,并观察到这些文本很可能会被今天的读者以不同的方式解读:
‘我们的列表包括,例如,关于阿尔萨斯(当时是德国的一部分)的百科全书条目和关于脚气病(当时经常被解释为一种真菌性疾病,而不是营养缺乏)的条目。虽然这些是事实上的差异,但我们还选择了可能显示出更微妙的态度、修辞或想象力的段落。’
‘例如,20世纪初关于非欧洲地方的描述往往会滑入种族概括。1913年写的一篇关于月球日出描述,想象了丰富的色彩现象,因为当时还没有看到过没有大气的世界。’
研究人员创建了简短的问题,每个历史段落都可以合理地回答,然后在这些问题-答案对中微调了GPT-4o-mini。为了加强评估,他们训练了五个单独的模型版本,每次都保留了不同部分的数据用于测试。
迷失在时间中
为了评估模型如何模仿历史语言,研究人员要求三位专家注释者审查120个AI生成的续写,并判断每一个是否听起来像是1914年的一位作家写的。
这种直接评估方法被证明比预期更具挑战性:虽然注释者在他们的评估中几乎80%的时间达成一致,但他们的判断的不平衡性(“可信”被选中两次于“不可信”)意味着他们的实际同意程度仅为中等,按照Cohen的kappa值为0.554来衡量。
评估者自己将任务描述为困难,通常需要进行额外的研究来评估是否一条陈述符合1914年的知识或信仰。
一些段落提出了关于语气和视角的困难问题——例如,一个回应是否适当地局限于1914年的世界观。这种判断通常取决于族群中心主义的程度(即,以自己的文化假设或偏见来看待其他文化的倾向)。
在这种情况下,挑战是决定一个段落是否表达了足够的文化偏见以听起来历史上可信,而不会听起来过于现代或过于令人反感,按照今天的标准。
结果显示,模型的输出有明显的排名,微调的GPT-4o-mini版本被评为最可信:

注释者的评估,显示每个模型的输出看起来有多可信。
入侵者警报
接下来是“入侵者测试”,其中专家注释者被展示了四个匿名段落,回答同一个历史问题。三个回应来自语言模型,而一个是真正的早期20世纪来源中的原始摘录。
任务是确定哪个段落是原始的,真正写于那个时期的段落。
这种方法没有直接要求注释者评估可信度,而是衡量模型的输出与真实段落的差异,实际上是在测试模型是否能让读者相信其输出是真实的。
模型的排名与之前的评估结果相匹配:微调的GPT-4o-mini版本是最令人信服的模型,但仍然不及真实的东西。

每个来源被正确识别为真实历史段落的频率。
这种测试也作为一个有用的基准,因为真实段落被识别出超过一半的时间,真实和合成散文之间的差距仍然显著。
过去的未来
研究人员发现,提示现代语言模型采用历史声音并没有可靠地产生令人信服的结果:少于三分之二的输出被人类读者评为可信,即使这样,性能也可能被高估了。
在许多情况下,回应包含了明显的信号,表明模型正在从现代的角度说话——诸如“1914年,尚不知…”或“截至1914年,我不熟悉…”的短语在许多回应中都有出现。这种免责声明表明,模型正在从外部模拟历史,而不是从内部书写。
研究人员指出:
‘上下文学习的性能不佳令人遗憾,因为这些方法是最容易和最便宜的AI历史研究方法。我们强调,我们还没有彻底探索这些方法。’
‘也许上下文学习现在或将来对于某些研究领域来说是足够的。但我们的初步证据并不是很鼓舞人心的。’
研究人员得出结论,虽然微调商业模型可以在最小的成本下产生风格上令人信服的输出,但它并不能完全消除现代视角的痕迹。在仅有时期材料上预训练一个模型可以避免时代错误,但需要更多的资源,并且会导致输出不那么流畅。
两种方法都没有提供完整的解决方案,研究人员得出结论,任何模拟历史声音的尝试似乎都需要在真实性和连贯性之间进行权衡。
结论
也许这篇新论文中最有趣的问题是真实性的问题。虽然它们不是完美的工具,但损失函数和指标,如LPIPS和SSIM,为计算机视觉研究人员提供了至少一种像对像的方法来评估真实性。
相比之下,当生成新文本以模仿逝去时代的风格时,只有尝试去占据一个已经消失的文化视角。试图从文学遗迹中重建这种心态本身就是一种量化,因为这些遗迹只是证据,而产生它们的文化意识超出了推理的范围,可能也超出了想象的范围。
在实际层面上,现代语言模型的基础,也就是当代规范和数据,可能会重新解释或压制那些在1914年看起来很合理或不值一提的思想,但现在却被视为(往往令人反感的)偏见、不平等或不公正的遗物。
因此,我们不禁疑问,即使我们能够创造出这样的对话,它是否不会令我们反感。
首次发布于2025年5月2日












