思想领袖

2026 年预测 – 开源将乘着 AI 的东风进入下一个黄金时代

mm
将 Unite.AI 添加到您在 Google 上的首选来源
A widescreen, photorealistic digital landscape of a futuristic smart city where glowing data streams in various colors flow like highways between glass buildings and centralized glowing hubs.

IBM 以 110 亿美元收购 Confluent 于 12 月初宣布,这不仅是一次重大数据基础设施整合,也是人工智能(AI)本质上是事件驱动的公开承认。换句话说,这次收购证明了企业需要可靠的数据流动和静态数据。随着企业在 2025 年急于在整个运营中部署 AI 代理,这笔交易凸显了一个关键的认识:实时上下文是使代理 AI 在企业规模上有效工作的缺失成分

IBM 自己的定位揭示了战略转变。他们将合并后的实体定位为“智能数据平台,用于 AI 代理” – 可以实时连接、处理和管理数据的基础设施,以便代理可以在混合环境中无缝运行。这不仅仅是关于销售更多的流媒体基础设施,而是关于承认 AI 代理需要持续的新鲜上下文才能可靠地运行,以及 流数据是使其成为可能的基础设施

企业 AI 的核心悖论

IBM 的收购也凸显了数据基础设施领域的一个有趣悖论。过去几年,一些基础设施供应商从开源中撤退,改变了许可证并退回到专有模式,以追求更强的货币化。然而,AI 的采用正在迫使生态系统重新向开放性转变。为什么?代理需要在许多系统中具有可互操作的管道、连接器和治理 – 而不是单个供应商的封闭堆栈。

强大的开源大型语言模型(LLM)的崛起已经将整个 AI 生态系统推向了透明度和可移植性。像 Llama、Mistral 等模型为企业提供了比封闭模型更便宜、更好的替代方案。这造成了紧张关系:数据基础设施供应商正在关闭他们的花园,就在 AI 公司使用他们的产品时打开了他们的花园。IBM 收购 Confluent 标志着重置的开始,在这种重置中,AI 的拉动力将基础设施推向开放性。

上下文管理:企业对 AI 的需求

为了理解为什么,我们需要讨论我所谓的“上下文管理” – 一个企业能力,用于向模型上下文窗口提供最相关、最可靠和最保留的上下文。这不仅仅是跨不同团队散布的临时检索增强生成(RAG)实现,而是一个系统方法,确保 AI 代理可以访问它们需要的信息,需要时具有适当的治理和来源。

这里有一个简单的心理模型:代理运行在上下文中。上下文运行在管道中。

上下文管道如下所示:

源 → 流 → 存储(湖仓/OLTP)→ 索引(向量 + 词汇 + SQL)→ 政策/治理 → 提供 → 可观察性/评估。

每个层需要可靠地运行,它们需要一起运行。流媒体位于基础,因为它提供了代理所需的连续新鲜度。

传统的 RAG 方法通常是反应性的 – 它们在被提示时检索上下文。但代理还需要主动更新:事件不断刷新内存,更新检索索引,调整权限,执行策略。Confluent 被 IBM 收购基本上是一场对“始终更新的上下文层”成为企业 AI 的关键基础设施的赌注。

代理为什么会失败(以及为什么它很重要)

企业 AI 团队正在通过艰难的方式发现这个不幸的真相:代理不会因为大型语言模型“愚笨”而失败。它们会因为底层上下文是破碎的、过时的、不完整的或不受管理的而失败。事实上,分析师估计,高达 60% 的 AI 项目将由于缺乏 AI 准备就绪的数据而被放弃。一个基于昨天的库存数据做出采购决策的代理不是有用的。一个没有适当授权访问客户记录的代理是一个合规性噩梦。一个无法解释其推理的代理在受监管的行业中是不可用的。

企业无法在没有来源的情况下审计 AI 决策。他们无法在没有一致的数据新鲜度的情况下扩大 AI 应用程序。他们无法在没有适当的治理防护的情况下自信地部署代理。所有这些要求都指向同样的结论:上下文管理需要成为一流基础设施,而不是事后补充。

开源复兴

这就是开源复兴的开始。上下文跨越了太多的供应商和系统,任何单一的专有堆栈都无法获胜。成功的方法将是开放接口加上可移植的构建块:连接器、流媒体平台、元数据管理、检索系统和策略执行。封闭许可证会减慢集成速度 – 而集成就是代理 AI 中的整个游戏。

IBM 理解这一点。他们在开源方面的历史(尤其是通过 Red Hat)使他们具有可信度。合并的 IBM-Confluent 实体有望加速他们所谓的“事件驱动智能”,通过在集成点拥抱开放性,在不同系统之间实现无缝合作。

我们已经看到这种转变正在发生。开源流媒体平台、开源表格格式(如 Apache Iceberg 和 Delta Lake)以及元数据和治理的开源标准正在成为企业 AI 基础设施的连接组织。组织正在要求可移植性和互操作性,因为他们知道他们将与多个 AI 模型、多个数据存储和多个工具合作。锁定是他们需要的灵活性的敌人。

2026 年的预测

到 2026 年底,我预测“上下文管理”将作为企业技术栈中的一个命名类别出现。买家将要求三件事:

  • 首先,数据存储和索引的开源连接器和“自带”架构。不应该有单一供应商控制整个上下文管道。
  • 其次,工具之间的标准化上下文 API。团队需要能够在不重建整个系统的情况下交换组件。
  • 第三,作为默认值的管理来源,而不是附加组件。每个上下文部分都需要一个清晰的血统,每个代理决策都需要一个审计跟踪。

这些不是很好的选择。它们是企业 AI 采用规模的基本要求。

重置开始

IBM 收购 Confluent 标志着数据基础设施的根本重置的开始。AI 的势头,由代理在新鲜、可靠的上下文中运行的需求所驱动,正在迫使行业重新向开放性转变。无论这是否是纯粹的开源,还是至少是开放和可执行的互操作性,取决于市场的发展。但方向是明确的。

在这个新时代中,能够蓬勃发展的供应商将不是那些拥有最封闭、最专有的堆栈的供应商。它们将是那些在集成层面拥抱开放性、提供真正的互操作性并帮助企业在没有人为限制的情况下建立上下文管理能力的供应商。

下一波创新将来自开源 AI 基础设施,它使企业能够在没有供应商锁定的情况下构建复杂的代理和应用程序。这不是理想主义 – 这是务实主义。因为当您构建需要跨整个企业的关键任务 AI 系统时,开放性不是哲学 – 它是一个要求。

郭思捷是StreamNative的创始人和CEO。 郭思捷与Apache Pulsar的旅程始于雅虎!他是开发公司全球消息平台团队的一员。 然后他去了Twitter,领导消息基础设施团队,并共同创造了DistributedLog和Twitter EventBus。 2017年,他联合创立了Streamlio,该公司被Splunk收购,并于2019年创立了StreamNative。 他是Apache Pulsar和Apache BookKeeper的原始创建者之一,并仍然是Apache BookKeeper的副总裁和Apache Pulsar的PMC成员。 郭思捷居住在加利福尼亚州旧金山湾区。