思想领袖

无处不在的问题:为什么“数据无处不在”正在成为AI时代的基础设施挑战

mm
将 Unite.AI 添加到您在 Google 上的首选来源

当前AI领域最有影响力的问题不是哪个模型最聪明,而是数据存储在哪里,以及智能是否能够到达它。

过去十年中,AI行业一直遵循一个令人放心的前提:集中数据,集中计算,天才就会随之而来。超大规模计算模型——在大型云集群中集中大量训练数据,并应用大量GPU计算来压缩它们成为模型参数——取得了非凡的成果,但也产生了一个现在正在因其自身成功的重量而受到压力的架构。

我们可以称之为“数据无处不在”的问题。随着AI从研究实验室渗透到医院、工厂、金融机构和主权政府的运营结构中,必须告知这些系统的数据本质上是分布式的、受管辖限制的和运营不可移动的。欧洲的监管机构坚持认为,其公民的财务记录永远不会离开该大陆。位于巴塞尔的制药公司的临床试验数据不能合法地与来自首尔的基因组数据共享一个云存储桶。

无论如何,智能必须去到数据那里。数据,强调一下,绝不会来到智能那里。

转变的经济学

这种结构性的紧张局势因同时发生的AI经济革命而变得更加严峻。该行业正在从训练为中心转向推理为中心的支出,数据架构的影响是深远的。

德勤估计,到2025年,推理工作负载占所有AI计算的50%,到2026年将增加到三分之二。比例正在以惊人的速度颠倒。分析师估计,到2026年,推理需求将比训练需求高出118倍。到2030年,推理可能占总AI计算的75%,推动7万亿美元的基础设施投资。

成本数学同样令人震惊。对于每1亿美元用于训练AI模型的费用,组织将面临150-200亿美元的推理成本,这一比例由GPT-4的训练成本粗略估计为1.5亿美元,但累计推理成本到2024年底已达到23亿美元。训练曾经是AI投资者和采购官的头条热点,现在被重新定义为一次性的学费。推理是智能的永久运营成本,现在它是主导的费用项目。

然而,这里存在一个悖论:推理成本对于GPT-3.5级系统,从2022年11月到2024年10月下降了280多倍,硬件成本每年下降约30%,能效每年提高40%。价格下降;消费加速得更快。每单位推理成本下降100倍,而微软和谷歌报告称AI工作负载在半年内增长了31倍。

杰文斯悖论,即效率提高导致资源使用量增加,在GPU集群中找到了现代的体现。

数据存储在哪里,智能必须跟随

推理经济从根本上重塑了基础设施需求,现在here更是如此,尤其是在数据重力方面。推理与训练不同,不是一次性在数据中心运行的批处理作业。它是一个连续的、延迟敏感的、地理分布式服务,只有当数据在查询时刻可达时才有效。

这是“数据无处不在”的挑战的核心。

例如,一个在ICU实时遥测数据上推理的语言模型不能承受200毫秒的往返时间到东海岸的云集群。一个在交易点运行推理的金融服务欺诈模型不能将帐户数据转移到违反GDPR的管辖区。一个主权AI部署不能依赖于由外国商业实体拥有的和运营的基础设施。

边缘实验室非常清楚这一点。Anthropic与Google Cloud的协议,为提供最多100万个TPU,到2026年将提供超过1千瓦的AI计算能力容量,表明领先的实验室如何在前所未有的规模上投资,以塑造全球推理基础设施的足迹。

数据强度的分类学

并非所有AI系统都面临相同的挑战,因此考虑一个粗略的分类法是有意义的,因为有各种类型的AI模型和复杂性。让我们通过三个核心示例来分解它:LLM、图像和物理模型。

大型语言模型——Claude、GPT和Gemini家族——主要处理语言令牌:相对较轻、可压缩,并且适用于保密技术,如差分隐私或联邦学习。它们的“数据无处不在”的问题非常复杂。

生成视觉模型呈现了一个更难的案例。像Black Forest Labs的FLUX.2可以在强大的硬件上在不到一秒内生成高分辨率、照片级的图像,但生成一张图像需要比生成文本更多的数据和计算。随着视觉AI从创意工具转向工业检查、医疗成像和卫星分析,底层数据通常很大、敏感且难以移动,增加了在数据已经存在的地方运行AI的需求。

更复杂的类别是物理AI。NVIDIA的Jensen Huang 宣布,“物理AI已经到来,每家工业公司都将成为一家机器人公司。”新的模型,如NVIDIA的Cosmos 3,旨在通过结合模拟、视觉和推理,使机器对物理世界有一个普遍的理解,而像Physical Intelligence这样的公司正在使用真实世界的传感器数据(包括力、运动和视觉输入)训练机器人,以实现更适应性、自主的行为。

相同的扩展动态正在被应用于真实世界的数据,如振动、声音和传感器输入。但是,这些信息本质上是局部的。工厂地板上的机器人不能将实时视觉和触觉数据发送到远程云进行处理,而不引入可能造成安全风险的延迟,这意味着AI必须越来越多地在边缘运行,靠近数据生成的地方。

信任、可解释性和结果

这是“数据无处不在”的挑战超越基础设施并成为治理问题的地方。随着AI应用于高风险决策——从医疗诊断到金融风险模型到物理控制系统——关于数据存储位置的问题越来越多地与谁对结果负责的问题联系在一起。

在今天的监管环境中,解释性不是可选的。例如,欧盟AI法要求高风险系统展示其输出的基础,这在数据分布在多个系统、管辖权和监管框架中时是困难的。

因此,信任成为大规模采用的先决条件。对数据环境的控制与对模型本身的控制一样重要。

AI基础设施的下一代

解决“数据无处不在”的挑战将定义AI的竞争格局的未来十年。联邦推理、安全数据处理环境、边缘优化模型和考虑数据允许驻留的位置的编排系统不是小众的技术功能,而是AI扩展到可以自由集中数据的用例以外的先决条件。

能够提供可信、可解释、主权推理的基础设施的公司和政府——智能到达数据,而不是要求数据前往智能——将拥有AI时代最持久的护城河。训练一个更聪明的模型越来越成为一个已经解决和商品化的问题。负责任地部署它,在边缘,跨越管辖边界,面对无法移动的数据,是仍然存在的问题。

数据无处不在不是一个口号。这是企业AI中最难解决的问题。它将决定过去十年训练投资解锁的非凡能力是否能够转化为世界可以信任的结果。

作为首席战略官,Abhas 领导 Cloudera 的整体公司战略,并负责创建公司愿景,建立业务和客户目标运营模型,通过明确定义的 OKR 与关键利益相关者进行沟通,并执行关键转型计划以实现该计划。他还负责推动增长和创新,并做出适当的 build/buy 合作决策,包括定价和包装,企业发展,以及 Cloudera 的创新加速器以推出新产品。在 Cloudera 和 Hortonworks 合并之前,他曾担任全球客户创新和价值管理负责人,帮助扩大 Hortonworks 的市场营销工作。作为一名管理顾问出身,他热衷于推动社会的行动和变化,并曾与多个组织合作,包括世界经济论坛,未来创始人和其他非营利组织。