思想领袖

生成式 AI 的未来是边缘计算

mm
将 Unite.AI 添加到您在 Google 上的首选来源

ChatGPT 和生成式 AI 的出现是一个技术史上的重要时刻,类似于互联网和智能手机的出现。生成式 AI 已经展示了其在智能对话、考试、生成复杂程序/代码和创建令人惊叹的图像和视频方面的无限潜力。虽然大多数 Gen AI 模型在云端运行——无论是训练还是推理——但这并不是一个长期可扩展的解决方案,尤其是推理,主要是由于成本、功耗、延迟、隐私和安全等因素。 本文将讨论这些因素以及将 Gen AI 计算工作负载移至边缘的动机例子。

大多数应用程序都运行在高性能处理器上——无论是设备上(例如智能手机、台式机、笔记本电脑)还是数据中心。随着利用 AI 的应用程序的份额不断扩大,这些仅具有 CPU 的处理器变得不够用。另外,生成式 AI 工作负载的快速扩张正在推动对具有昂贵、耗能的 GPU 的 AI 启用服务器的需求,从而推高了基础设施成本。这些 AI 启用服务器的成本可能是普通服务器的 7 倍,GPU 账户占增加成本的 80%。

此外,基于云的服务器消耗 500W 至 2000W 的电力,而 AI 启用服务器消耗 2000W 至 8000W 的电力——这是 4 倍的电力!为了支持这些服务器,数据中心需要额外的冷却模块和基础设施升级——这些成本可能甚至高于计算投资。数据中心已经每年消耗 300 太瓦时的电力,几乎占全球总电力消耗的 1% 如果 AI 采用的趋势继续下去,那么到 2030 年,数据中心可能会消耗多达 5% 的全球电力。另外,正在进行大量投资于生成式 AI 数据中心。据估计,数据中心将在 2027 年之前消耗高达 5000 亿美元的资本支出,主要由 AI 基础设施需求驱动。

数据中心的电力消耗已经达到 300 太瓦时,将会随着生成式 AI 的采用而显著增加。

AI 计算成本以及能耗将阻碍生成式 AI 的大规模采用。通过将 AI 计算移至边缘并使用针对 AI 工作负载优化的处理解决方案,可以克服可扩展性挑战。这种方法还为客户带来其他好处,包括延迟、隐私、可靠性以及增加的能力。

计算跟随数据到边缘

十年前,当 AI 从学术界出现时,AI 模型的训练和推理发生在云/数据中心。由于大部分数据是在边缘生成和消费的——尤其是视频——将推理移到边缘以改善企业的总拥有成本(TCO)是有意义的,这得益于降低的网络和计算成本。虽然云上的 AI 推理成本是周期性的,但边缘上的推理成本是一次性的硬件支出。基本上,通过在系统中添加边缘 AI 处理器可以降低整体运营成本。像传统 AI 工作负载迁移到边缘(例如,家电,设备)一样,生成式 AI 工作负载也将遵循此趋势。这将为企业和消费者带来显著的节省。

将推理移到边缘并使用高效的 AI 加速器来执行推理功能还带来了其他好处。首先是延迟。例如,在游戏应用中,非玩家角色(NPC)可以使用生成式 AI 控制和增强。使用在边缘 AI 加速器上运行的 LLM 模型,游戏玩家可以为这些角色提供特定的目标,以便他们能够有意义地参与故事。边缘推理的低延迟将使 NPC 的语音和动作能够实时响应玩家的命令和操作,从而提供一种身临其境的游戏体验,以一种具有成本效益和能效的方式交付。

在医疗保健等应用中,隐私和可靠性至关重要(例如,患者评估,药物推荐)。数据和相关的 Gen AI 模型必须在本地进行保护,以保护患者数据(隐私),并且任何网络中断都可能阻止访问云中的 AI 模型,从而带来灾难性的后果。为每个企业客户(在本例中为医疗保健提供者)定制的边缘 AI 设备可以在提供较低延迟和成本的同时无缝地解决隐私和可靠性问题。

边缘设备上的生成式 AI 将确保游戏中具有低延迟,并为医疗保健保留患者数据和提高可靠性。

许多在云上运行的 Gen AI 模型都接近一万亿参数——这些模型可以有效地解决一般目的查询。然而,企业特定应用需要模型提供与用例相关的结果。以在快餐厅构建的基于 Gen AI 的助手为例,该助手旨在接受订单——为了实现无缝的客户交互,底层 Gen AI 模型必须在餐厅的菜单项上进行训练,同时了解过敏原和成分。可以通过使用一个超集大型语言模型(LLM)来训练一个相对较小的 10-30 亿参数 LLM,然后使用客户特定的数据进行额外的微调来优化模型大小。这样的模型可以带来更高的准确性和能力。并且由于模型的较小大小,它可以有效地部署在边缘的 AI 加速器上。

Gen AI 将在边缘获胜

总会有对云上运行的 Gen AI 的需求,尤其是对于像 ChatGPT 和 Claude 这样的通用应用。但是,当涉及到企业特定应用(如 Adobe Photoshop 的生成填充或 Github Copilot)时,边缘的生成式 AI 不仅是未来,也是现在。为此提供关键支持的是专用 AI 加速器。尤其是对于企业特定应用,生成式 AI 在边缘的优势不仅在于成本,还在于延迟、隐私、可靠性以及提高的能力。因此,生成式 AI 在边缘的未来是光明的。

作为硅谷的资深人士,并且是 Kinara Inc 的 CEO,Ravi Annavajjhala 拥有超过 20 年的经验,涵盖业务开发、营销和工程,打造领先的技术产品并将其推向市场。在他目前担任 Deep Vision 首席执行官的角色中,Ravi 在其董事会任职,并已筹集了 5000 万美元,将公司的 Ara-1 处理器从预硅阶段推向大规模生产,并批量生产第二代处理器 Ara-2。在加入 Deep Vision 之前,Ravi 在 Intel 和 SanDisk 担任过高级领导职位,在那里他在推动收入增长、发展战略合作伙伴关系以及制定具有领先功能和能力的产品路线图方面发挥了关键作用。