思想领袖
AI的记忆问题:为什么高效的长上下文改变一切,以及如何做对

一位同事在对话结束后立即忘记所有之前的对话,在大多数工作中是无法长久的。然而,许多商业AI正是这样工作的。会话关闭,背景就消失了。消费者可能不会注意到这一点,但长时间运行的公司会立即遇到限制。
真正的工作会从一个会话继续到下一个会话,周四做出的决定通常依赖于周一做出的决定,思考的依据需要在中间存活下来。会话结束后擦除自身的AI可以在会话内表现良好,但对跨越一周的任务贡献甚微。
企业AI已经悄悄地改变了对模型的需求。多年来,模型主要被评估为吸收了多少知识。现在,企业需要它们在工作展开时保持正确的信息,这需要一种不同的高效工程。到目前为止,保持这种级别的持久知识的能力尚未实现,因为需要大量的内存(GPU)、计算和成本来扩展这种能力。维持可接受的延迟和模型幻觉水平变得具有挑战性,当使用大背景时会出现并发使用问题。对此类知识能力的需求越来越大,但内存和计算资源不足。因此,人们会问:如何在更少的基础设施和占地情况下实现更准确的智能和规模?
桌子和文件柜
两个东西被归类为记忆,它们的行为不同到足以使其余部分依赖于将它们分开。
首先考虑上下文窗口,即模型可以在单次传递中接收和推理的内容。它的工作原理类似于桌面的表面。一个小的桌子一次处理几页内容,其他内容等待在抽屉中,并在需要时被取出和清除,而一个大的桌子可以让整个案件文件同时打开在其上。桌子上的内容会在每天结束时被清除。
持久性内存是桌子旁边的文件柜。系统选择要存储的内容,并在相关时将其取回,因此本周发生的事情可以告知下周要做的事情。存储内容可以跨会话使用,并需要对要保存的内容、如何组织它以及何时取回它做出自己的决定。
大部分可见的工程竞争都集中在桌子上。曾经只能容纳几千个令牌的窗口现在可以容纳数十万个令牌,OpenAI和Anthropic的最大模型可以达到一百万个令牌。
这个工作的术语“上下文工程”来自Shopify的Tobi Lutke,并在2025年中期由Andrej Karpathy推广。Karpathy写道,任何严肃的AI应用中的核心技能都是用正确的信息填充下一个步骤的窗口。他的类比是硬件——模型作为处理器,窗口作为其工作内存。从业者迅速采用了这个术语,因为他们以前围绕这个想法打转,但没有标签。
拥有更大的桌子并不能解决记忆问题
这是一个明显的解决方案——不断扩大桌子——遇到麻烦的地方。
斯坦福研究人员在2024年展示了,当模型需要的信息位于长输入的中间时,其准确性会明显下降,尤其是与相同的事实放在开始或结束时相比。他们称之为“迷失在中间”,即使对于专门为长上下文设计的模型也是如此。向模型提供更多信息并不能保证模型能够可靠地使用它。
这种效果在其他团队寻找它时仍然成立,2025年的一项研究使用18个前沿模型对越来越长的输入进行了测试,发现性能在窗口填满之前就已经恶化,这种模式被其作者称为上下文腐烂。扩大桌子和使模型在其上干净地推理是两个独立的问题,前者并不能解决后者。
策划比容量赚取更多
上下文工程已经成为一个学科,其方法和Gartner在2025年7月建议客户将上下文置于提示之上。手艺从编写更锐利的指令转变为为模型组装更锐利的输入集。
更大的桌子提高了放在上面的内容的赌注。将整个文档存储倒在表面上,重要的几页内容会在噪音、矛盾和过时版本中丢失,而更紧凑的选择会使模型表现出色。判断力在于什么属于模型的前面,如何构建它,何时出现,以及什么留在柜子里。
RAG(检索增强生成)就是为此而构建的:将文档切成片段并检索看起来相关的片段,以绕过太小的窗口。假设合同纠纷取决于第200页的某个条款。通常的方法是将合同切成片段,让检索系统取回看起来相关的片段。如果第200页被评为不相关,模型就永远不会看到该条款。
一个可以容纳整个合同的窗口完全跳过了取回步骤,并将条款与周围的内容一起提供给模型。然后模型是否能很好地阅读长输入是一个可靠性问题,这是一个比检索系统悄悄决定不传递条款更好的问题。
在会话内和会话后
长上下文使AI代理可以跨越长时间的工作,而不是单次交换。处理多天合规审查或供应商入职的代理会在运行过程中保持整个任务在窗口中,因此每一步都可以利用任务的全部状态。足够长的窗口可以在会话内代替内存。
然而,这就是相似之处的结束。系统应该在本周后回忆什么,一旦会话关闭,就必须存储在窗口之外的某个地方。
构建此类内存带来了不同的问题,行业才刚刚开始面对。我的心理学和神经科学训练使我很难忽略与人类记忆的比较。我们不会检索事件的完美记录。每次我们记住它时,我们都会重建它,小错误会逐渐成为接受的版本的一部分。机器内存也可能在存储的信息被反复总结、合并或重写时出现类似的问题。除非有人检查、纠正错误并删除不可靠的信息,否则记录可能会随着时间的推移而偏离原始事件。
许多部署这些系统的公司尚未遇到这些问题,很少有公司能够解决这些问题。我会关注供应商的能力,而不是他们宣传的窗口大小。即使一个模型可以容纳1000万个令牌,如果大部分内容都是过时的、不相关的或错误的,那么它也毫无价值。其答案可能看起来很有根据,但却基于业务不应该信任的材料。判断力在于什么内容应该保留,以及能够在所有信息上准确推理的能力,所有这些都在更少的基础设施成本和占地的情况下实现。这就是做更多事情的同时使用更少的资源,并不是所有更大的窗口都带有这种真正的能力。












