思想领袖
贵公司的记忆应当比其 AI 模型更持久

人们常常询问是哪种模型为我的公司提供动力。答案很重要:它决定了质量、成本和限制,我也乐于花一小时来探讨。我还想了解第二件事:当模型更换时,组织仍然拥有的东西是什么。
把它设想成一个日期。如果你的供应商在星期二把价格翻倍,或者停用了你所使用的端点,你在星期三早晨还能拥有些什么?
对许多公司而言,坦率的答案是:一个 API 密钥、一张发票,以及一段存放在他人服务器上、遵循他人保留计划的极长对话历史。
我的背景是化学。我花了多年时间为化工厂构建灰盒模型,连接到 SCADA、实验室结果以及操作员的笔记。这项工作快速教会了我一条规则:没有条件的数字不是结果。如果有人上周更换了传感器,却没有记录下来,屏幕上的读数毫无意义。
那是实验室笔记本的问题。它现在表现为采购问题,却很少出现在决定 AI 预算的表格上。
三个问题合而为一地得到答案
更大的上下文窗口让模型在单次请求中使用更多信息。持久存储决定了哪些内容在请求之间得以保留。可移植性决定了当供应商更换时,这些信息是否仍可使用。这些是独立的架构问题,而百万标记的窗口却促使大家把它们视为同一问题。
Google 自己的文档提供了 直接的类比:“对上下文窗口的类比是短期记忆。”请字面理解。短期记忆就是你会失去的东西。
因此,每个出售巨大窗口的供应商也会提供用于持久化状态的独立方案。请仔细阅读这些层级的官方说明,并记录每一层实际覆盖的内容。
OpenAI 默认将 Response 对象存储 30 天;会话对象及其项目不受该 TTL 限制。Amazon 的 30 天删除政策适用于 该 Bedrock Session Management API,且仅覆盖该 API。Anthropic 的 客户端内存工具展示了一个有用的边界:模型请求内存操作,应用程序控制存储,而同一公司还为其托管代理提供 托管内存存储。
所有这些都是普通的工程决策,已公开发布。这也意味着贵公司工作上下文的保留规则写在他人的发行说明中,你应该能够明确哪条规则适用于你的哪类数据。
切换成本的真实所在
将一次文本生成调用换成另一种只需一个周末。这就是为什么“我们是多模型的”听起来如此轻松。真正昂贵的层级是没有人演示过的那些。
嵌入。 更改嵌入 模型通常需要重新嵌入语料库并迁移或重建索引。对生成 模型没有此类要求,而这两者经常被混淆——通常是因为有人承诺迁移会很快。2025 年的文献将标准路径描述为“重新编码整个语料库并重建近似最近邻(ANN)索引,导致显著的运营中断和计算成本”;该论文的自身贡献 Drift-Adapter 是一种用于延迟 重建的方式,通过学习嵌入空间之间的转换来实现。无论如何,迁移成本包括检索验证、运营工作以及嵌入调用本身。
微调行为。 Cohere 的一句话:2025年9月停用通知 位于每个采购部门的首要位置:“先前的微调模型将不再可访问”。这是你付费创建的行为,却随着承载它的端点一起被退役。所有人都遵循了已公布的流程。你的模型仍然消失了。
提示和工具行为。 相同的指令在不同模型上产生不同的应用。在某企业应用中,研究人员 报告回归通过率下降 从原始模型的 100% 降至新模型的 97.3%,两者使用相同的提示,只有在刻意重新设计提示后才恢复。测试场景在生产中以各自的频率出现,因此该数字无法估计实时工作流的失败频率。它所支持的运营规则更为简单:在模型升级到达客户之前,必须自行在应用层面验证每一次升级。
所有这些最终都会体现在发票上,远在对比定价页面之后。
别人在掌控你的日程
废弃遵循已公布的时间表,而这些时间表并不由您决定。OpenAI 提前一年通知后,于2026年8月关闭了 Assistants API——在同一页面上,GPT-4.5 预览版仅获得约三个月的宽限期,这已相当慷慨。Mistral 的 政策对 GA 模型为六个月,对预览版和第三方模型为一个月,并警告称滚动别名“可能导致模型行为和定价的静默更新”。
AWS 在其 生命周期政策中直言不讳:“在 EOL 日期之前迁移到活跃模型;迁移不会自动进行”。
您的路线图还有一位共同作者。它从不参加您的规划会议,也不在乎您处于哪个季度。
价格也是一个会变动的因素
在 Gemini 3.7 Flash 的标准费率表中,未缓存的输入代币为 50 亿,计费输出代币为 10 亿,月费用为 7,500 美元。目前计划于 2027 年 1 月 1 日生效的费率将使该代币账单升至 15,000 美元,尚未计入其他费用或折扣,而您的产品仍然保持原有功能。
冻结的价目表也可能导致更高的账单。Anthropic 的 定价文档指出,其新一代模型使用的分词器“对相同文本产生约 30% 更多的代币”——这取决于内容且仅适用于这些代代代代——因此您必须自行测量实际计费的代币量。仅凭费率卡本身无法告知您具体费用。
对于运行工作流的产品而言,有用的经济衡量标准是成功完成一次任务的成本,包括重试和人工审查。即使费率卡保持不变,一旦模型更换,这一数字也会随之变化。
而且在离职需要一年时间的情况下,这一切都不可协商。Capgemini 调查了 1,300 位高管,这些高管来自 2026 年春季的数十亿美元规模组织,针对关键技术供应商的整体情况进行调查:36% 表示迁移离开某供应商需要超过十二个月,且十分之一的受访者根本没有可行的替代方案。这是一种没有第二来源的供应商关系描述。
将其交由采购部门
我经营一家法国公司,注册地在马赛,托管在欧洲,我仍然会在抽象层面略过主权演讲。对普通公司而言,完全摆脱所有技术供应商的依赖是不可能的。同一项 Capgemini 研究发现,59% 的高管认为实现完整的数字主权不切实际,我也赞同他们的观点。
了解并控制关键依赖是一项规模更小且可行的工作。只需在一次会议中回答三个问题:我们的数据存储和处理在哪里,谁可以访问,以及要转向另一供应商需要哪些条件?
每家公司都知道如何就物流、支付和云存储提出这些问题。当谈及工作环境时,欧洲依赖性会在会议中以第二来源讨论的形式出现,并附带具体数字,这正是采购部门可以采取行动的依据。
关于此处引用的数字需谨慎。企业使用多个模型并不能说明它能否在供应商之间迁移工作环境。这需要另行测试:记录、权限以及未完成的工作能否被迁移并继续使用?
真正使模型可替换的因素是什么
跨模型的共享接口非常有用,我会去构建它。它应当让模型特定的能力和依赖关系可见。可移植性不应假装所有模型的行为完全相同,而将差异抽象化的做法会悄然抹去您为优秀模型付费的理由。
更繁重的工作在于拥有状态,而不应让任何单一供应商成为唯一的托管者。以下四项按其可能出现的顺序列出。
您可控制的权威记录。消息、检索到的来源、批准、执行检查点。记录外部系统中已完成的操作以及哪些可以安全重试:邮件可能已发送而确认未保存,若恢复流程不了解此情况就会导致邮件重复发送。任何您无法重建的供应商状态都是依赖关系。请在事故发生前将其明确记录下来。
每个向量旁的来源。向量是已编译的产物;块是源代码。存储源文档及其版本、文档 ID、块边界、块生成器版本、嵌入模型(含版本和维度)、索引版本以及生成文本的处理过程。仅存储的文本片段无法重建表格、图像或 OCR 结果。完整保存所有信息可将重新索引转化为计划中的迁移,这正是我所承诺的安心之处。
区分来源、推断和决策的记录。记忆必须把来源的陈述、模型的推断以及人的批准区分开来。客户承诺在星期四付款、模型猜测付款可能会延迟、以及双方同意将付款延至星期五,这三条记录各自拥有不同的状态,系统必须知道可以依据哪一条进行操作。每条记录都需要其来源、范围、访问规则以及当前状态,包括是否已被更正或取代。转录本可能包含证据;仅仅重放它并不能可靠地判断哪些结论仍然有效,哪些决策仍然成立。
您实际测试过的可移植性。让它可通过两种方式进行测试:一次导出-恢复演练,以及一个定义应用必须实现目标的评估套件。随后“我们可以切换”就成为可以让某人执行的度量:替换方案是否能在您的质量、权限、延迟和成本要求下继续代表性工作流?并且 保留您有权重用的训练数据,以及其版本、调优配置和验收测试。这些使得重新训练成为可能,但无法保证行为完全相同,且微调模型 ID 的有效期由您从未见过的某人设定的日期决定。
然后在有帮助的地方使用托管会话、提示缓存和提供商检索。它们通常表现出色,原则性地拒绝使用反而会带来更高成本。要求是它们持有的记录能够被恢复并在其他地方使用,同时保持其访问和保留规则不变。租用计算资源;保持对记录的控制。
我也不想对架构夸大其词。在产品-市场匹配之前,提前六周交付往往胜过任何抽象层,而一家在拥有客户之前就构建了三个检索后端的初创公司,无异于建了座博物馆。此举是否合适取决于产品本身以及最终重建的成本。保持原始材料可恢复,捷径才仍然是捷径。
变化的部分
当 AI 仅仅回答问题时,丢失上下文只是一种不便。您重新输入提示词并继续。现在它会安排会议、创建工单并触及 CRM,而缺失的上下文会导致客户系统中出现重复或未完成的工作。
模型供应商构建了非凡的产品,我每天都在使用它们。我所描述的责任在于我们这些构建中间平台的人:让依赖关系可见,并保留可靠的记录,记录哪些已获授权、哪些已完成。
每个已完成的工作流都应为组织留下可再次使用的成果——经过验证的结果、具备可追溯历史的决策、以及为下一个任务提供更清晰的起点。此类累计价值应超越帮助生成它的模型的寿命。
思考一下,周三早晨你仍会拥有的是什么。












