AI 基础

什么是边缘 AI 与边缘计算?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

边缘计算将计算放置在产生数据的设备和物理过程附近。边缘 AI在传感器、手机、车辆、网关或本地服务器上运行机器学习推理——有时甚至进行训练或适应——而不是将每个输入发送到远程云端。

该架构通常是一个连续体,而非边缘与云端的二选一。即时决策可以在本地完成,而云端则负责舰队管理、聚合分析、模型训练和长期存储。

关键要点

  • 边缘 AI 可以降低延迟、带宽使用和原始数据传输,但并不能自动保证隐私。
  • 内存、功耗、热限制以及加速器的支持决定了可部署模型的形态。
  • 量化、剪枝和蒸馏在模型大小和速度与准确性、鲁棒性之间进行权衡。
  • 安全更新、遥测、回滚以及硬件多样性是系统的核心组成部分。
What is Edge AI & Edge Computing? diagram showing sensor, local inference, action, gateway, cloud training, signed update
根据延迟、隐私、功耗、可靠性和生命周期成本划分工作。

边缘‑云连续体

传感器可以运行一个微小的阈值模型,附近的网关可以合并多个数据流,而区域服务器可以执行更重的推理。云端可以训练模型并分发签名更新。工作划分取决于延迟、连接性、能耗、数据敏感性和维护需求。

对于工业控制,毫秒级的响应时间和离线运行可以证明本地推理的合理性。对于低频率的业务预测,集中计算可能更简单且更易观察。

硬件与模型约束

边缘设备的范围从拥有几千字节内存的微控制器到配备 NPU 或 GPU 的手机和服务器不等。模型必须适配存储和 RAM,满足实时截止时间,保持在热限制范围内,并使用受支持的算子。

基准测试应包括预处理、数据移动和唤醒成本——而不仅仅是算子吞吐量。批量大小通常为 1,持续性能可能与短时间实验室运行不同。

压缩与优化

量化使用更低精度来表示权重和激活。剪枝去除参数或结构。知识蒸馏训练一个更小的学生模型去模仿更大的教师模型。算子融合和内存规划可以进一步降低延迟。

压缩可能会影响准确率、校准以及子群体性能。团队应在目标硬件上验证转换后的产物,而不是假设原始浮点模型的指标仍然适用。

隐私、联邦学习与安全

本地推理可以将原始音频、图像或传感器记录保留在设备上,但元数据、嵌入和遥测仍可能敏感。联邦学习可以协同分布式训练,但也伴随自身的隐私和投毒风险。

边缘舰队扩大了攻击面。安全启动、签名模型、最小特权服务、加密通信和及时更新都是网络安全设计的一部分。必须假设存在物理访问以及长期未受支持的设备。

监控与舰队运营

本地模型仍然需要可观测性。设备可以上报注重隐私的聚合指标、版本、健康状态、延迟和拒绝率。对选定输入进行抽样审查需要明确的同意和保留控制。

发布应使用金丝雀分组和自动回滚。系统必须能够处理不兼容的硬件、更新中断以及模型漂移。无法接收安全补丁的设备可能需要下线。

边缘架构与工作负载放置

边缘计算在数据源附近——如传感器、设备、网关、车辆、零售场所或本地服务器——处理数据,而不是完全依赖远程云端。边缘 AI 将模型推理或有时的训练放置在该环境中。放置应遵循延迟、连接性、带宽、隐私、弹性、能耗和管理需求。混合设计可以在本地进行即时检测,将选定事件发送至区域系统,并利用云端进行舰队分析和模型训练。

硬件范围从微控制器和 NPU 到 GPU 与坚固服务器不等。模型会被导出、量化、剪枝、蒸馏或编译以适配可用的算子和内存。预处理和传感器 I/O 可能主导延迟,而热量或电池限制则影响持续吞吐。需在实际并发、温度和功耗模式下,在目标设备上对完整流水线进行基准测试。单一的 TOPS 指标并不能揭示算子回退、内存传输或实际部署的准确率。

舰队安全、更新与可观测性

分布式设备扩大了攻击面,并可能被物理访问。应使用安全启动、签名固件和模型、硬件支持的身份(如可能)、加密通信、最小特权、网络分段以及受保护的密钥。更新需要分阶段发布、兼容性检查、适当的防回滚策略、更新中断恢复以及已知良好镜像。对设备、传感器、固件、运行时和模型版本进行清点,以便快速界定事件范围。

连接可能是间歇性的,因此需使用有界存储缓冲数据、对事件排序、使重试具备幂等性,并定义离线行为。可观测性应捕获健康状态、延迟、功耗、输入摘要、预测、置信度以及已确认的结果,而不传输不必要的原始数据。时钟漂移、传感器故障和本地存储耗尽都可能导致结果失效。远程指令和调试通道需要更强的授权,因为它们可能成为全舰队的控制路径。

负责任的部署

本地处理可以减少传输,但并不能自动保护隐私;原始输入、嵌入和日志仍可能保留在设备上或随后同步。应最小化数据保留并披露云端回退机制。需在不同地点和环境条件下测试模型漂移,并在置信度或传感器健康下降时提供安全默认值。当本地约束真实存在时,边缘 AI 具有价值,但它将生命周期、安全性和质量的责任转移到需要统一设计和维护的大规模异构舰队上。

案例示例:远程安全摄像头的边缘 AI

在远程现场,需要检测在机器运行时受限门是否开启。边缘设备在本地处理视频以实现低延迟,仅传输事件和允许的缩略图。数据涉及天气、夜间照明、灰尘、振动以及空场景。模型经过量化,并在目标设备上进行端到端基准测试,以评估检测率、误报率、延迟、能耗和持续的热行为。

安全启动、签名更新、设备身份以及分段网络保护舰队安全。摄像头遮挡、存储耗尽、时钟漂移、网络丢失和模型超时会触发健康警报,并产生独立于 AI 的安全设备规则。更新以小组方式发布,并具备自动回滚。监控收集最少的健康和结果数据,现场人员可以检查并进行覆盖。本地推理虽降低了传输,但并未消除隐私、数据保留或物理安全义务。

实施证据与运营准备

生产决策需要超越成功演示。必须明确预期用户、运行环境、输入、输出、依赖、所有者以及每种重要故障的后果。调优前要建立可复现的基线和带版本的评估集。测试常规案例、边界条件、畸形或缺失的输入、分布漂移、依赖中断、误用,以及最可能服务不足的群体或环境。测量任务质量时需同步评估校准或不确定性、延迟、吞吐、资源成本、可访问性、隐私和安全性。记录每一次转换和阈值,以便独立审阅者能够复现结果并将证据与诱人的原型区分开来。

上线前,需要指定发布、例外、变更、回滚和退役的责任人。采用分阶段发布,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康、人为覆盖以及已确认的结果,而不收集不必要的敏感数据。要定义警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据来源、用户、模型、供应商、政策、硬件或目标变化时,都需重新评估。维护中的系统还需要有文档化的恢复、事件学习、删除与保留流程,以及明确的停用或替换时点。

常见问题

边缘 AI 总是比云端 AI 更快吗?

不一定。虽然本地推理可以避免网络延迟,但可能运行在性能较弱的硬件上。完整的流水线和可靠性需求决定了实际延迟。

边缘 AI 能在没有互联网访问的情况下工作吗?

可以,只要模型、预处理和决策逻辑全部在本地。更新、同步或依赖云端的功能可能不可用。

主要参考文献

博客作者和程序员,专攻 Machine Learning 和 Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。