AI 模型与平台

神经处理单元的崛起:提高设备上的生成式人工智能的速度和可持续性

mm
将 Unite.AI 添加到您在 Google 上的首选来源

生成式人工智能的演变不仅仅是在重塑我们与计算设备的交互和体验,而且也在重新定义计算的核心。这种转变的关键驱动力之一是需要在计算资源有限的设备上运行生成式人工智能。这篇文章讨论了这种挑战和如何通过神经处理单元(NPUs)来解决它们。另外,这篇文章介绍了一些最新的NPU处理器,它们正在这一领域领先。

设备上生成式人工智能基础设施的挑战

生成式人工智能是图像合成、文本生成和音乐创作的强大工具,它需要大量的计算资源。传统上,这些需求是通过利用云平台的巨大能力来满足的。虽然这种方法有效,但对于设备上的生成式人工智能,它带来了自己的挑战,包括对不断的互联网连接和集中式基础设施的依赖。这种依赖引入了延迟、安全漏洞和更高的能耗。

云基础设施的骨干主要依赖于中央处理器(CPUs)和图形处理器(GPUs)来处理生成式人工智能的计算需求。然而,当应用于设备上的生成式人工智能时,这些处理器遇到了重大的障碍。CPUs是为通用任务设计的,缺乏高效和低功耗执行生成式人工智能工作负载所需的专用架构。它们有限的并行处理能力导致了吞吐量的降低、延迟的增加和功耗的提高,使得它们不太适合设备上的人工智能。另一方面,虽然GPUs可以在并行处理方面表现出色,但它们主要是为图形处理任务设计的。为了有效地执行生成式人工智能任务,GPUs需要专用的集成电路,这些电路会消耗大量的功率并产生大量的热量。另外,它们的大体积也为它们在紧凑的设备应用中造成了障碍。

神经处理单元(NPUs)的出现

为了应对上述挑战,神经处理单元(NPUs)正在作为变革性技术出现,以实现设备上的生成式人工智能。NPUs的架构主要受到了人类大脑的结构和功能的启发,特别是神经元和突触如何协同工作来处理信息。在NPUs中,人工神经元作为基本单元,模仿生物神经元接收输入、处理它们并产生输出。这些神经元通过人工突触相互连接,人工突触在学习过程中调整其强度来传递信号。这种过程模仿了大脑中突触权重的变化。NPUs组织成层次:输入层接收原始数据,隐藏层执行中间处理,输出层生成结果。这种层次结构反映了大脑的多阶段和并行信息处理能力。由于生成式人工智能也使用类似的结构,即人工神经网络,NPUs非常适合管理生成式人工智能工作负载。这种结构上的对齐减少了对专用集成电路的需求,导致了更紧凑、更节能、更快和更可持续的解决方案。

解决生成式人工智能的多样化计算需求

生成式人工智能涵盖了广泛的任务,包括图像合成、文本生成和音乐创作,每个任务都有其独特的计算需求。例如,图像合成严重依赖于矩阵运算,而文本生成涉及顺序处理。为了有效地满足这些多样化的计算需求,神经处理单元(NPUs)通常与系统芯片(SoC)技术一起集成,系统芯片中还包括CPUs和GPUs。

每个处理器都有其独特的计算优势。CPUs特别擅长顺序控制和即时性,GPUs在流式并行数据处理方面表现出色,NPUs则针对核心人工智能操作进行了优化,处理标量、向量和张量数学。通过利用异构计算架构,可以根据处理器的优势和任务的需求来分配任务。NPUs可以高效地从主CPU中卸载生成式人工智能任务,不仅可以确保快速和节能的操作,还可以加速人工智能推理任务,使得生成式人工智能模型可以更顺畅地在设备上运行。当NPUs处理人工智能相关任务时,CPUs和GPUs可以将资源分配给其他功能,从而提高应用程序的整体性能,同时保持热效率。

NPUs的现实世界例子

NPUs的发展正在获得动力。以下是一些NPUs的现实世界例子:

  • 高通的Hexagon NPUs专门设计用于在低功耗和低资源设备上加速人工智能推理任务。它可以处理生成式人工智能任务,如文本生成、图像合成和音频处理。Hexagon NPU集成到高通的Snapdragon平台中,提供了在高通人工智能产品的设备上高效执行神经网络模型的能力。
  • 苹果的神经引擎是A系列和M系列芯片的关键组件,驱动各种人工智能驱动的功能,如Face ID、Siri和增强现实(AR)。神经引擎加速了面部识别、自然语言处理(NLP)和增强对象跟踪和场景理解等任务,显著提高了苹果设备上人工智能相关任务的性能,提供了无缝和高效的用户体验。
  • 三星的NPU是一种专门用于人工智能计算的处理器,能够同时处理数千次计算。集成到最新的三星Exynos SoCs中,三星NPU技术使得低功耗、高速度的生成式人工智能计算成为可能。三星的NPU技术还集成到旗舰电视中,实现了人工智能驱动的音频创新和增强用户体验。
  • 华为的达芬奇架构是他们的昇腾人工智能处理器的核心,旨在提高人工智能计算能力。该架构利用高性能的3D立方体计算引擎,使其对人工智能工作负载非常强大。

结论

生成式人工智能正在改变我们与设备的交互和体验,并重新定义计算。设备上运行生成式人工智能的挑战显著,传统的CPUs和GPUs往往难以满足这些需求。神经处理单元(NPUs)提供了一个有前途的解决方案,其专用架构旨在满足生成式人工智能的需求。通过将NPUs集成到系统芯片(SoC)技术中,利用CPUs、GPUs和NPUs的优势,可以实现更快、更高效和更可持续的人工智能性能。随着NPUs的不断发展,它们将提高设备上的人工智能能力,使应用程序更加响应迅速和节能。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。