思想领袖

自动化模型开发的关键路径

mm mm
将 Unite.AI 添加到您在 Google 上的首选来源
A stylized digital landscape showing illuminated lines connecting data structures. A cluster representing

人工智能研究的下一个重要里程碑是自动化模型开发。每一个推理、语言和感知方面的进步,在某种意义上,都是一步向这个目标迈进。然而,通往模型自动化的道路需要解决一系列基础挑战,这些挑战必须首先被克服。

通往这一目标的桥梁直接穿过机器学习(ML)工程。一个常见的误解认为,ML是现代AI的前身技术,基础模型已经取代了它。这误解了两者的关系。作为一个学术学科,ML涵盖了所有模型训练的方面,包括当前AI热潮中心的基础模型训练。然而,规模和数据复杂性之间存在着有意义的差异。

传统的ML模型通常是在精心策划的、特定领域的数据集上进行训练,这些数据集包含成千上万的例子。相比之下,基础模型是在成千上万个同时进行的数据集上进行训练,这些数据集来自不同的来源,格式、来源、质量不一致。这一数据规模和异构性的差异是数据管理变得更加困难和重要的根本原因,当模型变得更加强大时。

这使得数据理解成为自动化模型开发中的一个关键瓶颈。一个能够解释异构数据并改进围绕它构建的流水线的AI系统,原则上可以改进其自身的训练过程,并帮助构建更好的模型。一旦AI能够通过改进训练过程来提高自身的性能,改进就会在AI应用的每个领域中传递下去。

三大障碍

第一个障碍是上下文碎片化。在几乎每个组织中,任何给定建模问题相关的信号、实验、特征定义和机构知识都分散在数据仓库、笔记本和流水线中,这些流水线从未被设计为相互通信。考虑一个医疗系统正在构建一个脓毒症检测模型。与该问题相关的临床标准,例如生命体征、实验室值和文档标准,可能存在于电子健康记录系统的完全独立的模块中。

第二个障碍是语义模糊性。意义并不是固有于数据中的,而是依赖于上下文和组织。两个不同数据库中的同一个字段名称可能指的是微妙不同的东西。像收入、活跃用户和流失率这样的概念通常在单个公司内有多个有效的定义。甚至像“收入”这样的概念也可能引起问题。销售团队可能将收入定义为本季度签订的合同总价值,而财务团队将其定义为实际收到的现金。产品团队有另一种理解,因为他们将其定义为在订阅期内分配的确认收入。所有三个团队都从各自系统中名为“收入”的字段中提取数据,但跨团队报告将无声地混合三个不兼容的数字。

第三个也是最系统性的障碍是缺乏记录的组织记忆。跟踪来源、解决不一致性和在这么多来源中保持质量信号是一个尚未解决的人类团队的问题。没有机构对已尝试的内容和这些方法的效果的记忆,任何模型自动化机制都将不断重新发现相同的死胡同,浪费时间和资源。

考虑一个零售公司的数据科学团队正在构建一个需求预测模型。在三年中,十二名分析师各自独立地发现,原始天气数据会在假期周降低模型性能,某个供应商的库存提醒包含系统性滞后,并且处理促销事件的标准方法会导致目标泄漏。当最初的分析师转到其他团队或离开公司时,他们的知识也随之离开。没有对已尝试的内容、失败的原因和为什么这些方法被放弃的记录,模型自动化机制就无法建立在积累的经验之上。它只是从零开始,反复浪费时间。

真正的解决方案需要什么

ML自动化的历史是一个部分解决方案的历史。自动化机器学习(AutoML)解决了超参数调优的狭隘问题,但无法处理目标不匹配或推理组织意图。机器学习运维(MLOps)使生产流水线更加稳健,易于监控,但MLOps工具执行策略,而不是定义它。最近的编码代理代表了真正的进步,但它们继承了相同的盲点。它们在没有组织上下文或机构记忆的情况下生成代码。

真正能够进行自主ML工程的系统需要现有工具不提供的组合功能。它需要将业务目标映射到模型目标,这是一种不能仅从数据中推断出的翻译。它需要在具有不一致模式的分散系统中发现相关数据,同时自动遵守合规性、治理和安全约束,而不是将其作为人类单独的过程来管理。它需要机构记忆来表明现有工作,了解过去实验为什么被放弃,并建立在同事已经知道的基础上。

严格的审计跟踪需要成为系统的核心机制,以跟踪数据版本、特征定义和代码提交的来源。任何这样的系统都需要周到的、人机交互设计。不是二元选择,完全自动化或完全手动控制,而是根据任务、风险和系统在每个决策点的信心支持不同级别的交互。绕过人类判断的关键时刻的自动化不是设计良好的AI的特征,而是一个故障模式。

目前尚未解决的问题是如何创建一个对组织数据具有语义理解的系统,这个系统能够理解数据在特定机构背景下的含义。MCP解决了连接问题,但尚未解决含义问题。这仍然是开放的研究前沿。

可能实现的目标

解决这些问题的经济影响是显著的。今天,定制的机器学习开发需要专家实践者和数周的迭代,即使对于明确定义的问题。一个能够从问题定义到数据发现、模型开发和模型评估的整个工作流程中自主导航的系统,将会显著改变这一等式,压缩时间表,并开启目前由于资源密集型而无法追求的高价值用例。曾经需要深入机器学习专业知识的团队花费数周时间完成的项目,现在可以在几天内完成,而无需使用如此多的稀缺的机器学习专家时间。

上下文碎片化、语义模糊性和缺乏机构记忆的挑战并非企业机器学习所独有。在基础模型训练流水线的构建中,这些挑战以不同的约束表现出来,成千上万个异构数据集必须被聚合、过滤和迭代精炼。虽然这两个环境在结构和目标上有所不同,但它们都受到相同的根本瓶颈的限制:缺乏能够可靠地恢复上下文、跟踪来源并在迭代中建立在先前工作基础上的系统。因此,在企业中自动化模型开发是实现能够自我改进的AI系统的路径上的一个关键步骤。

许多斯(Doris Xin)是Disarray的CEO和联合创始人。作为UC Berkeley RISELab的博士和NSF Graduate Research Fellow,以及后来在LinkedIn担任早期机器学习工程师,许多斯在机器学习方面磨练了她的专业知识。

毛斯塔法·阿卜杜勒巴基(Moustafa AbdelBaky)是Disarray的首席技术官和联合创始人。他是三届IBM博士后研究员,拥有近二十年的研究经验,涉及分布式系统、边缘机器学习和NASA自治航空及太空任务的实时人工智能。