AI 基础
神经处理单元(NPUs):下一代人工智能和计算的驱动力
就像GPU曾经在人工智能工作负载中超越CPU一样,神经处理单元(NPUs)正通过提供更快、更高效的性能来挑战GPU,尤其是在生成性人工智能中,需要在闪电般的速度和较低的成本下进行大规模实时处理。传统处理器在这些要求方面可能会挣扎,导致能耗增加、延迟增加和吞吐量瓶颈。
问题是NPUs如何工作,以及为什么它们正在取代GPU成为现代人工智能任务的首选,以及是什么使它们对于从强大的数据中心基础设施到日常消费设备的所有内容都不可或缺?无论您是在策划下一次大型人工智能部署还是仅仅对技术的前沿感到好奇,了解NPUs为什么可能是重新定义人工智能和下一代计算的突破都是至关重要的。
什么是神经处理单元(NPU)?
神经处理单元(NPU)是一种专门为处理现代人工智能和机器学习工作负载的独特要求而设计的微处理器。虽然中央处理器(CPUs)和图形处理器(GPUs)历史上曾为传统计算任务和图形渲染提供动力,但它们并不是专门为处理深度神经网络的计算强度而设计的。NPUs通过专注于并行、高吞吐量的操作(如矩阵乘法和张量数学——人工智能模型的基础)来填补这一空白。
NPUs与一般用途CPU和GPU的主要区别包括:
- 优化的AI算术:NPUs通常使用低精度数据类型(例如8位整数数学,甚至更低)来平衡处理能力和能效,而CPU和GPU通常依赖于更高精度的浮点计算。
- 并行架构:NPUs可以将AI任务分解为成千上万个较小的计算,这些计算可以同时运行,从而大大提高吞吐量。
- 能效:通过消除不必要的指令并专门针对神经网络任务进行优化,NPUs可以在与GPU或CPU执行相同AI工作负载相比下实现更高的性能和更低的功耗。
NPUs也被称为AI加速器,通常作为独立的硬件附加到服务器主板上,或者作为智能手机、笔记本电脑或边缘设备中的系统芯片(SoC)的一部分。
NPUs为什么对生成性人工智能至关重要
生成性人工智能的爆炸式增长——包括大型语言模型(LLMs)如ChatGPT、图像生成工具如DALL·E和视频合成模型——需要能够处理大量数据、实时处理数据并高效学习的计算平台。传统处理器可能难以满足这些要求,导致能耗增加、延迟增加和吞吐量瓶颈。
NPUs在生成性人工智能中的主要优势
- 实时处理:生成性人工智能模型(如变压器、扩散模型和生成对抗网络(GANs))涉及大量的矩阵和张量操作。NPUs擅长并行执行矩阵乘法和向量加法,有助于生成性模型实现低延迟性能。
- 可扩展性:NPUs专门为并行扩展而设计,使其非常适合生成性人工智能中使用的大规模架构。向数据中心集群添加更多NPU核心或NPUs可以在不大幅增加能耗的情况下线性提高AI性能。
- 能效:随着生成性模型的复杂性增加,其功耗也会增加。NPUs通过专注于生成性人工智能所需的数学运算来帮助控制能耗,消除了其他计算的开销。
NPUs的关键特征
- 并行处理:通过将计算任务分解为许多较小的任务,NPUs可以比CPU更快地处理广泛的矩阵操作,而CPU通常以更线性或串行的方式执行指令。这种并行性对于深度学习任务至关重要,在这些任务中,训练和推理涉及大量数据。
- 低精度算术:大多数神经网络计算不需要32位或64位浮点运算的精度。低精度数据类型(如8位整数)显著减少每个运算处理的位数,从而实现更快、更节能的执行,同时保持模型的准确性。
- 高带宽片上内存:在处理器附近保持大量训练或推理数据的能力对于AI任务至关重要。许多NPUs具有片上高带宽内存(HBM)或为神经网络专门设计的高级内存子系统,减少了与外部内存通信的需要。
- 硬件加速技术:现代NPU架构通常包含专用硬件单元,如 systolic阵列或张量核心,能够以最小的开销实现矩阵乘法和其他AI中心操作的闪电般快速执行。
NPUs的工作原理:模拟大脑
NPUs从人脑的神经网络中汲取灵感。就像数十亿个神经元和突触并行处理信息一样,NPU由能够同时处理大量数据的众多处理元素组成。这种设计对于以下任务尤其有效:
- 图像识别和处理
- 自然语言处理(NLP)和语音识别
- 物体检测和自主导航
- 生成性人工智能(例如图像生成和文本生成)
突触权重和学习
神经网络计算的基础是权重的概念,它代表了网络中每个神经元的连接的“强度”或“重要性”。NPUs将这些权重直接集成到硬件中,实现模型学习时更快、更节能的更新。
简化的高容量核心
虽然CPU传统上处理多种多样的操作(从网页浏览到电子表格计算),但NPUs简化了设计,专注于少数几个核心操作——如矩阵乘法、激活函数和卷积——这些操作以并行方式重复执行。
NPUs与GPUs与CPUs的比较
每种处理器类型在现代计算中都扮演着独特的角色,尽管在处理AI任务时存在一些重叠。以下是简要的比较:
| 特征 | CPU | GPU | NPU |
|---|---|---|---|
| 主要用途 | 通用任务、逻辑和控制 | 渲染图形、并行处理用于HPC任务 | 专门用于AI、ML和深度学习的并行处理 |
| 核心数量 | 少(通常为2-16个消费芯片核心) | 数百到数千个较小的核心 | 高度并行的专用核心阵列 |
| 精度 | 通常为高精度(32位或64位) | 混合高精度和低精度(FP32、FP16等) | 专注于低精度(8位或更低) |
| 能效(AI) | 在大规模AI中适中 | 良好,但在大规模中可能耗费大量电力 | 高度优化,操作功耗更低 |
| 物理尺寸 | 集成到主板或SoC中 | 通常为独立卡(独立GPU)或SoC基础 | 可以是独立的,也可以集成到SoC(智能手机等)中 |
总结:虽然CPU仍然对于整体系统控制和传统工作流至关重要,而GPU则提供了强大的并行处理能力(尤其适用于重型图形任务),NPUs专门为AI加速而设计,并且通常在机器学习工作负载中具有更高的性能功耗比。
NPUs的现实世界应用
数据中心和云AI
大型数据中心拥有可以直接附加到服务器主板的独立NPUs。这些NPUs可以加速从推荐引擎(如Netflix和Amazon)到生成性AI(如实时文本和图像生成)等一切内容。
智能手机和消费电子
今天的许多高端智能手机、笔记本电脑和平板电脑都将NPU或AI引擎直接集成到SoC中。 苹果的神经引擎、高通的Hexagon NPU和三星的神经处理引擎是集成解决方案的例子。这一方法允许:
- 实时图像和视频处理(例如视频通话的背景模糊)
- 设备上的语音助手(带有语音识别)
- 智能相机功能,如场景检测、人脸识别和高级图像稳定
边缘设备和IoT
NPUs已成为边缘计算的关键组件,在边缘计算中,设备需要在本地处理数据,而不是将其发送到云端。这对于需要低延迟、数据隐私或实时反馈的应用程序尤其有价值——可以想到智能家居设备、工业4.0传感器、无人机、自动驾驶车辆等。
机器人
从自动仓库机器人到机器人外科助手,NPUs可以根据传感器输入做出瞬间决策。它们处理视频流(物体检测和模式识别)和其他传感器数据的能力对于下一代自主和半自主机器人的发展至关重要。
NPUs用于边缘计算和设备AI
为什么边缘计算很重要
随着人工智能渗透到可穿戴设备、远程传感器和其他物联网设备中,在数据源附近处理数据(而不是在云端)的能力可能比以往任何时候都更为重要。边缘AI降低了数据传输成本,缓解了延迟问题,并将敏感信息保留在设备上——提高了安全性和隐私性。
NPUs在边缘AI中的作用
- 低功耗:边缘设备通常是电池供电或能量受限的,因此需要一种AI处理器,可以在不耗尽资源的情况下运行。NPUs专门针对矩阵操作进行了优化,因此是完美的选择。
- 实时洞察:无论是检测工厂中的异常还是在飞行中重定向无人机,瞬间推理决策都可以决定应用程序的可行性。NPUs提供了这种功能,开销最小。
- 智能手机应用:随着设备上的生成性人工智能的出现,智能手机中的NPUs已经开始为高级相机功能、实时语言翻译和上下文感知语音助手提供动力。
NPUs和AI的未来
随着生成性人工智能的能力呈指数级增长,对高性能、超高效计算的需求也将增加。硬件制造商如英特尔、AMD、Nvidia (NVDA ) 、苹果、Qualcomm和三星正在争相将自己的NPU架构纳入或改进。同样,数据中心正在转向异构计算模型——CPU、GPU和NPUs在此类模型中共存,以处理日益专业化的工作负载。
下一代生成性人工智能的NPUs
- 更低的延迟:未来的NPUs可能会实现几乎瞬间的实时推理,使虚拟个人助手和实时内容生成成为日常生活中无缝的一部分。
- 即时模型调整:随着模型变得更加动态——实时调整其架构和权重——NPUs将发展以处理连续的在线学习场景。
- 超越视觉和语言:生成性人工智能很快将扩展到复杂的多感官输出,包括实时触觉反馈、3D对象生成或甚至音频-视觉沉浸式体验。
多处理器协作
异构计算涉及为每个任务选择合适的处理器。CPU处理通用任务和编排,GPU处理大规模并行操作(如图形或大型矩阵计算),而NPU则为专门的AI任务提供动力——尤其是大规模神经网络推理。
在这种未来场景中,应用程序变得更加灵活和强大:
- 生成艺术可以在本地运行,NPU处理实时风格转换或上采样任务。
- 企业软件,需要AI驱动的自然语言处理,可以将语法纠正和上下文理解委托给NPUs,而CPU则与GPU协调以进行数据可视化。
- 复杂模拟在科学研究中可以在CPU、GPU和NPUs之间分割,以高效地处理数十亿个数据点。
快速硬件和软件创新
由于对AI的快速扩张的需求,硬件和软件创新正在加速:
- 自定义指令集:许多NPUs都具有专有的指令集,与不断演变的AI算法保持一致。
- 统一AI框架:AI框架(例如TensorFlow、PyTorch、ONNX)继续针对NPU后端进行优化,简化开发人员的工作流程。
- 边缘和云融合:曾经仅限于云端的AI工作负载现在可以跨云端GPU和NPUs或直接在边缘设备上分布。
结论
神经处理单元(NPUs)正在引领一场专用人工智能硬件的新时代,直接解决了深度学习、生成性人工智能和大规模数据处理所带来的挑战。通过专注于并行、低精度的工作负载,NPUs提供了前所未有的性能、能效和可扩展性——这些对于不仅仅是云端人工智能,而是日常消费设备和新兴边缘应用程序来说都是至关重要的。
它们在人工智能未来的重要性不言而喻。随着对设备上生成性人工智能的需求激增,异构计算成为标准,NPUs可能会成为人工智能驱动系统中与CPU在传统计算中一样不可或缺的组件。无论是使智能手机上的实时语言翻译成为可能,还是在数据中心中编排大型语言模型,NPU都有望改变机器学习和与世界交互的方式——让我们窥见一个更加智能、个性化和节能的计算未来。












