AI 模型与平台

Backboard 设立了人工智能内存的新全球标准 —— 向真正的代理人工智能迈出了一步

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Backboard 已经在人工智能系统中跨越了一个重要的门槛,证明了内存可以被视为核心基础设施,而不是脆弱的附加组件。该公司宣布,它现在同时领导两个主要的 AI 内存基准,LoCoMo 和 LongMemEval,这是第一个在一致的学术和独立评估方法下实现这一目标的平台。

在由 NewMathData 进行的独立评估中,Backboard 在 LongMemEval 上实现了 93.4% 的准确率,这是迄今为止在基准的原始规范下运行的最高公开报告的分数。这个结果建立在其之前 发布的 90.1% 的 LoCoMo 分数 之上,将 Backboard 置于少数能够维持短期精度和长期上下文连续性的系统之列。

值得注意的是,评审人员确定了多个案例,其中 Backboard 的响应被标记为不正确,尽管它们比基准的预期答案更具上下文准确性。在这些情况下,系统将交互中已经存在的事实信息纳入其中,而不是遵循对提示的更狭隘的解释。因此,报告的分数代表了一个保守的基准,而不是性能的上限。

为什么内存已经成为人工智能的限制因素

大多数现代人工智能系统仍然表现得好像它们没有真正的过去。虽然大型语言模型在生成流畅的响应方面非常出色,但它们往往会在会话结束或提示窗口填满后忘记上下文。这一限制迫使开发人员通过检索黑客、提示工程或脆弱的工具链来重建状态,这些工具链经常在系统变得更加复杂时破裂。

内存不仅仅是关于回忆。在实际部署中,内存决定了人工智能系统是否能够在时间上保持连贯性,协调任务并与用户建立信任。没有持久的内存,系统会重置、 产生幻觉 或自相矛盾。随着人工智能从单次交互转向长期工作流,内存已经成为主要的瓶颈。

Backboard 通过将内存视为一级基础设施来解决这个问题。它不是将内存作为应用层的附加组件,而是将持久性、嵌入、检索和编排集成到一个统一的平台中,可以通过单个 API 访问。

系统级方法而不是基准优化

Backboard 没有设计其架构来追求基准分数。评估要么是独立启动的,要么用于内部了解系统如何与学术研究相比。结果反映了系统在现实条件下的行为,而不是任务特定的优化。

这种区别很重要,因为大多数基准衡量模型在隔离状态下的行为,而实际的人工智能系统由许多移动部件组成。Backboard 的结果表明,内存性能不仅仅是模型大小或蛮力计算的函数,而是内存如何结构化、更新和随时间共享。

该平台结合了持久的长期内存、原生的嵌入和向量化、内置的检索增强生成、跨代理共享内存以及访问超过 17,000 个大型语言模型,包括自带密钥支持。通过统一这些元素,Backboard 消除了企业需要将开源组件拼接在一起的必要性,这些组件经常在生产约束下失败。

使代理人工智能变得实用

代理人工智能 的兴趣继续增长,但大多数实现都难以超越演示。原因很简单。没有共享持久内存的代理无法有效地协调。它们会碎片化、丢失上下文,并且随着时间的推移表现出不可预测的行为。

Backboard 允许即使代理依赖于不同的底层模型,也可以在代理之间实现持久共享内存。当内存可靠时,代理行为自然出现,而不是被编写。系统可以记住以前的决定、在会话之间保持连续性,并在没有不断重新提示的情况下协调操作。

该平台的底层内存框架旨在保持时间连贯性,而不是通过静态图或重复检索来重建状态。这使得人工智能系统可以在复杂性增加时保持一致性和可审计性。

为无法忘记的系统而建

Backboard 的架构植根于其创始人和首席执行官 Rob Imbeault 的经验,他之前帮助将 Assent 从早期创业公司发展成为一个价值超过 14 亿美元的全球企业平台。在 Assent,Imbeault 工作的系统深深嵌入客户运营,支持法规遵从性和复杂的供应链工作流,其中连续性、正确性和信任是不可协商的。

这种经历形成了一个明确的信念。最有价值的基础设施往往不是华丽的。它是那些安静、持续、长期工作的基础设施。在这些环境中,系统不允许在上下文丢失时重置。如果状态消失或信任被侵蚀,系统将在操作上失败,而不仅仅是在技术上失败。

Imbeault 看到了现代人工智能中出现的结构性差异。虽然大型语言模型迅速发展,但它们仍然在本质上是无状态的。上下文在会话之间消失,迫使开发人员通过脆弱的提示链和临时的检索层来重建内存。这些方法可能在演示中有效,但当人工智能系统需要连续运行、跨代理协调和随时间演化时,它们就会崩溃。

Backboard 被构建来填补这一空白。内存被视为可靠的基础设施,而不是应用逻辑,使人工智能系统能够在交互、模型和代理之间保持状态。专注于持久性、正确性和长期可靠性反映了在 Backboard 存在之前就形成的信念:在生产环境中,内存故障不是次要缺陷,而是系统性风险。

这种观点支撑着 Backboard 的设计哲学。目标不是在孤立的时刻展示智能,而是使人工智能系统能够像可靠的软件一样运行,即使复杂性增加和时间范围扩展。

这对人工智能的未来意味着什么

Backboard 的结果对人工智能的更广泛影响是,下一阶段的人工智能进步将不仅仅由更大的模型或更长的上下文窗口驱动。它将由能够记住、推理和随时间演化的系统驱动。

随着企业在客户支持、运营、研究和合规方面部署人工智能,持久的内存成为信任和可扩展性的基础。解决内存问题的平台将定义代理人工智能如何从实验转向日常使用。

在其内存架构在学术和独立基准上获得验证后,Backboard 正在将其注意力转向帮助团队更好地了解和评估人工智能系统在现实世界约束下的行为。该公司即将推出的 Switchboard 功能旨在使复杂的人工智能配置更加透明和可预测。

人工智能的未来将不再由聪明的提示技巧塑造,而是由随时间可信赖的系统塑造。内存是这一转变的基础,Backboard 的最新结果表明这一基础终于开始成形。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。