Anderson 视角
为什么语言模型在对话中会“迷失”

微软研究院和Salesforce的一篇新论文发现,即使是最强大的大型语言模型(LLM)也会在指令以阶段性给出而不是一次性给出时失效。作者发现,当提示以多个回合给出时,性能会平均下降39%,跨六个任务。

单回合对话(左)获得最佳结果,但对于最终用户来说是不自然的。多回合对话(右)发现,即使是排名最高、表现最好的LLM也会在对话中失去有效的动力。 来源:https://arxiv.org/pdf/2505.06120
更值得注意的是,响应的可靠性会大幅下降,像ChatGPT-4.1和Gemini 2.5 Pro这样的著名模型会在相同任务的不同表述方式下,结果在接近完美和明显失败之间徘徊;此外,输出的一致性可能会下降超过一半。
为了探索这种行为,这篇论文引入了一种称为“分片”的方法,它将完整的提示分成更小的片段,并一次性地将它们释放到对话中。
在最基本的术语中,这相当于在餐厅下一个连贯且全面的单一订单,让服务员无需做任何事情,只需确认请求;或者决定合作解决问题:

两种极端的餐厅对话(不来自新论文,仅用于说明)。
为了强调,上面的例子可能会将顾客描绘成负面形象。但第二列中的核心思想是,事先澄清问题集,然后再解决问题——这似乎是一种理性和合理的处理任务的方法。
这种设置反映在新工作中,以分片的方式与LLM交互的方法。作者指出,LLM通常会生成过长的响应,并继续依赖自己的见解,即使这些见解被证明是错误的或不相关。这种倾向,加上其他因素,可能会导致系统完全失去对交换的跟踪。
事实上,研究人员指出,我们很多人已经通过经验发现,当对话与LLM没有达到预期结果时,开始一个新对话可能是让对话回到正轨的最佳方式。
‘如果与LLM的对话没有达到预期结果,开始一个新的对话,重复相同的信息,可能会比继续进行对话带来更好的结果。’
‘这是因为当前的LLM会在对话中迷失,我们的实验表明,继续进行对话是无效的。另外,由于LLM生成文本具有随机性,新的对话可能会带来更好的结果。’
作者承认,代理系统(如Autogen或LangChain)可以通过在最终用户和LLM之间充当解释层来潜在地提高结果,只有当它们收集到足够的“分片”响应时才会与LLM交互,这些响应可以凝聚成一个单一的连贯查询(最终用户不会接触到)。
然而,作者认为,不应需要单独的抽象层,或者应该直接将其构建到源LLM中:
‘可以认为,多回合能力不是LLM的必要功能,因为它可以被代理框架所取代。换句话说,我们是否需要LLM中的本地多回合支持,当代理框架可以编排与用户的交互并仅将LLM用作单回合操作时?…’
但在测试了他们的例子阵列后,他们得出结论:
‘[依赖]代理框架来处理信息可能是有限的,我们认为LLM应该本地支持多回合交互’
这篇有趣的新论文的标题为LLM在多回合对话中迷失,来自四位跨越MS Research和Salesforce的研究人员,
碎片化对话
新方法首先将传统的单回合指令分解为较小的碎片,旨在在LLM交互的关键时刻引入,反映了ChatGPT或Google Gemini等系统中看到的探索性、来回的参与风格。
每个原始指令都是一个单独的、自成体系的提示,提供整个任务的所有内容,结合了高级问题、支持上下文和任何相关条件。分片版本将其分成多个较小的部分,每个碎片只添加一块信息:

成对的指令,显示(a)在单个回合中交付的完整提示和(b)其分片版本,用于模拟未指定的多回合交互。语义上,两个版本都提供相同的信息有效载荷。
第一个碎片总是引入任务的主要目标,而其余的提供澄清细节。它们共同提供与原始提示相同的内容,但自然地分散在对话的几个回合中。
每个模拟对话在三个组件之间展开:助手,正在评估的模型;用户,一个模拟的代理,具有访问完整指令的分片形式的权限;以及系统,它监控并评分交换。
对话从用户揭示第一个碎片开始,助手自由地做出回应。系统然后将该回应归类为几个类别之一,例如澄清请求或完整答案尝试。
如果模型尝试回答,一个单独的组件会提取仅相关的跨度以进行评估,忽略任何周围的文本。在每个新回合中,用户会揭示一个额外的碎片,提示另一个回应。交换继续,直到模型正确回答或没有更多的碎片可揭示:

模拟分片对话的图表,评估模型以红色突出显示。
早期测试显示,模型经常询问尚未共享的信息,因此作者放弃了以固定顺序揭示碎片的想法。相反,使用模拟器来决定下一个应该揭示哪个碎片,基于对话的进展。
用户模拟器使用GPT-4o-mini实现,具有完全访问整个指令和对话历史的权限,任务是决定在每个回合中下一个应该揭示哪个碎片,基于交换的展开方式。
用户模拟器还重述每个碎片以保持对话流畅,而不改变其含义。这使模拟能够反映真实对话的“来回”风格,同时保持对任务结构的控制。
在对话开始之前,助手只会收到完成任务所需的基本信息,例如数据库模式或API参考。它不会被告知指令将被分解,也不会被引导至特定的对话处理方式。这是故意为之:在现实世界中使用中,模型几乎从不被告知提示将不完整或随时间更新,并省略此上下文有助于模拟反映模型在更现实的上下文中的行为。
GPT-4o-mini还用于决定如何对模型的回复进行分类,以及从这些回复中提取任何最终答案。这有助于模拟保持灵活性,但也引入了一些错误:然而,在手动检查了几百个对话后,作者发现,少于5%的对话有任何问题,少于2%的对话由于这些错误而改变了结果,他们认为这是项目参数内的低错误率。
模拟场景
作者使用五种模拟来测试模型在不同条件下的行为,每种模拟都是指令部分如何以及何时被揭示的变体。
在完整设置中,模型在单个回合中接收完整的指令。这代表标准基准格式,并作为性能基准。
分片设置将指令分成多个部分,并一次一个地交付,模拟更现实的、未指定的对话。这是用于测试模型处理多回合输入的能力的主要设置。
在连接设置中,碎片被拼接在一起,保留其措辞,但去掉了回合结构。这有助于分离对话碎片化的影响和内容损失或重述的影响。
在回顾设置中,运行方式与分片类似,但在模型给出最终答案之前,添加了一个最终回合,其中所有以前的碎片都被重述。这测试了总结提示是否可以帮助恢复丢失的上下文。
最后,雪球进一步发展,通过在每个回合中重复所有先前的碎片,在整个对话过程中保持完整的指令可见,提供了对多回合能力的更宽容的测试。

基于分片指令的模拟类型。一个完全指定的提示被分成较小的部分,可以用来模拟单回合(完整、连接)或多回合(分片、回顾、雪球)对话,具体取决于信息被揭示的速度。
任务和指标
选择了六个生成任务,以涵盖编程和自然语言领域:代码生成提示来自HumanEval和LiveCodeBench;文本到SQL查询来自Spider;API调用使用来自伯克利函数调用排行榜的数据构建;基本数学问题来自GSM8K;表格字幕任务基于ToTTo;多文档摘要来自摘要 haystack数据集。
模型性能使用三个核心指标来衡量:平均性能、能力和不可靠性。
平均性能捕捉了模型在多次尝试中整体表现如何;能力反映了模型可以达到的最佳结果,基于其最高评分输出;不可靠性衡量了这些结果的变化程度,较大的最佳和最差结果之间的差距表明行为不太稳定。
所有分数都放在0-100的范围内,以确保任务之间的一致性,并为每个指令计算指标,然后平均以提供模型性能的整体图景。

六个分片任务,用于实验,涵盖编程和自然语言生成。每个任务都显示一个完全指定的指令及其分片版本。每个任务都有90到120个指令,适用于已建立的基准。
竞争者和测试
在初始模拟中(估计成本为5000美元),600个指令跨六个任务被分片,并用于模拟三种对话类型:完整、连接和分片。对于每个模型、指令和模拟类型的组合,运行了十次对话,总共产生了超过200,000次模拟——这种模式使得能够捕捉到整体性能和更深入的能力和可靠性度量。
测试了15个模型,涵盖了广泛的提供商和架构:OpenAI模型GPT-4o(2024-11-20版)、GPT-4o-mini(2024-07-18版)、GPT-4.1(2025-04-14版)和思考模型o3(2025-04-16版)。
Anthropic模型是Claude 3 Haiku(2024-03-07版)和Claude 3.7 Sonnet(2025-02-19版),通过Amazon Bedrock访问。
谷歌贡献了Gemini 2.5 Flash(预览-04-17版)和Gemini 2.5 Pro(预览-03-25版)。Meta模型是Llama 3.1-8B-Instruct和Llama 3.3-70B-Instruct,以及Llama 4 Scout-17B-16E,通过Together AI访问。
其他条目是OLMo 2 13B、Phi-4和Command-A,所有这些都通过Ollama或Cohere API本地访问;以及Deepseek-R1,通过Amazon Bedrock访问。
对于两个“思考”模型(o3和R1),令牌限制提高到10,000,以适应更长的推理链:

每个模型在六个任务中的平均性能分数:代码、数据库、操作、数据到文本、数学和摘要。结果显示三个模拟类型:完整、连接和分片。模型按其平均完整设置分数排序。阴影表示从完整设置到连接和分片设置的性能下降程度,最后两列报告相对于完整设置的平均下降。
关于这些结果,作者指出†:
‘总体而言,每个模型在比较完整和分片性能时都会看到其性能下降,平均下降为-39%。我们将这种现象称为迷失在对话中:在实验室环境中,具有优秀性能的模型(90%以上)在单回合、完全指定的对话中会在相同任务中挣扎,在更现实的、未指定的多回合对话中。’
连接分数平均达到完整分数的95%,表明分片设置中的性能下降不能归因于信息损失。较小的模型,如Llama3.1-8B-Instruct、OLMo-2-13B和Claude 3 Haiku,在连接设置下表现出更明显的下降,表明较小的模型通常比较大的模型更不稳定,无法处理重述。
作者观察到†:
‘令人惊讶的是,更高性能的模型(Claude 3.7 Sonnet、Gemini 2.5、GPT-4.1)与较小的模型(Llama3.1-8B-Instruct、Phi-4)一样容易在对话中迷失,平均下降30-40%。这部分是由于指标定义。由于较小的模型在完整设置中实现较低的绝对分数,因此它们的下降幅度不如更好的模型那么大。 ‘
‘简而言之,无论LLM的单回合性能有多强大,我们都观察到在多回合设置中会有很大的性能下降。’
初始测试表明,一些模型在特定任务中表现更好:Command-A在操作中,Claude 3.7 Sonnet和GPT-4.1在代码中,Gemini 2.5 Pro在数据到文本中,表明多回合能力因领域而异。像o3和Deepseek-R1这样的推理模型整体上没有表现更好,可能是因为它们更长的回复引入了更多的假设,这些假设往往会混淆对话。
可靠性
单回合模拟中清晰的能力和可靠性之间的关系,在多回合条件下似乎崩溃了。虽然能力仅略微下降,但不可靠性翻倍。像GPT-4.1和Gemini 2.5 Pro这样的模型,在完整的提示中表现稳定,但一旦指令被分片,就变得和较弱的模型(如Llama3.1-8B-Instruct或OLMo-2-13B)一样不规律。

能力和不可靠性概述,如盒线图(a)所示,接着是15个模型的不可靠性结果(b),以及逐渐分片测试的结果,其中指令被分成1到8个碎片(c)。
模型的响应经常在相同任务上变化多达50个点,即使没有添加任何新内容,表明性能下降并非由于缺乏技能,而是由于模型在回合之间变得越来越不稳定。
该论文指出†:
‘[虽然]更好的模型往往具有略高的多回合能力,但所有模型都倾向于具有相似的不可靠性水平。换句话说,在多回合、未指定的设置中,我们测试的所有模型都表现出非常高的不可靠性,平均而言,固定指令的最佳和最差模拟运行之间的性能下降了50个百分点。’
为了测试性能下降是否与回合次数相关,作者进行了一个逐渐分片的实验,将每个指令分成1到8个碎片(见上图的最右列)。
随着碎片数量的增加,不可靠性稳步增加,证实了即使是回合次数的微小增加也会使模型更加不稳定。能力基本保持不变,强调了问题不在于能力,而在于一致性。
温度控制
一组单独的实验测试了不可靠性是否只是随机性的副产品。为此,作者在三个值上变化了助手和用户模拟器的温度设置:1.0、0.5和0.0。
在单回合格式中,如完整和连接,降低助手的温度会显著提高可靠性,减少多达80%的变化;但在分片设置中,相同的干预几乎没有效果:

不同助手和用户温度组合的不可靠性分数,跨完整、连接和分片设置,较低的值表示更一致的响应。
即使助手和用户都设置为零温度,仍然会出现高不可靠性,GPT-4o的变异性在30%左右,表明多回合对话中观察到的不稳定性不仅仅是随机性,而是模型处理分片输入的结构性弱点。
影响
作者在论文结论中对他们的发现的影响进行了长篇大论,认为单回合性能强并不保证多回合的可靠性,并警告不要过度依赖完全指定的基准来评估现实世界的准备就绪性(因为这样的基准会掩盖在更自然的、分片化的交互中可能存在的不稳定性)。
他们还建议,随机性不仅仅是一个采样伪像,而是当前模型处理不断变化的输入的基本限制,并指出这对代理框架(它们依赖于持续的推理)提出了担忧。
最后,他们认为,多回合能力应该被视为LLM的核心能力,而不是外部系统的责任。
作者指出,他们的结果可能低估问题的真实规模,并强调了测试的理想条件:用户模拟器在他们的设置中具有完全访问指令和对话历史的权限,可以以最佳顺序揭示碎片,这为助手提供了不切实际的有利环境(在现实世界中使用中,用户通常会提供碎片化或模糊的提示,而不知道模型下一步需要听到什么)。
此外,助手在每个回合后立即被评估,整个对话尚未展开,因此不会惩罚后续的混乱或自相矛盾,这在其他情况下会使性能恶化。这些选择虽然对于实验控制是必要的,但意味着实践中观察到的可靠性差距可能比报告的更大。
他们得出结论:
‘[我们]相信所进行的模拟代表了LLM多回合能力的仁慈测试环境。 由于模拟的过度简化条件,我们相信实验中观察到的性能下降可能是LLM不可靠性的低估,在现实世界环境中,LLM在对话中迷失的频率可能更高。 ‘
结论
任何花费大量时间与LLM交互的人可能都会从实践经验中认识到这里提出的问题;我想我们大多数人都曾经出于实践的考虑,放弃了“迷失”的LLM对话,转而开始新的对话,希望LLM能够“重新开始”,并停止对长时间且越来越令人沮丧的交互中出现的内容的执着。
有趣的是,增加更多的上下文可能并不能解决这个问题;而且,值得注意的是,该论文提出了比答案更多的问题(除了如何绕过这个问题)。
* 令人困惑的是,这与AI中的“分片”传统含义无关。
† 作者自己的强调。
首次发表于2025年5月12日星期一












