AI 基础

什么是联邦学习?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

联邦学习 在多个设备或组织之间训练共享模型,同时保持每个参与者的原始训练数据本地化。协调者分发模型参数,客户端在自己的记录上计算更新,然后通过聚合步骤合并这些更新。

将记录保留在本地是有益的,但这并不等同于隐私或安全。模型更新可能泄露信息,受损的客户端可能投毒训练,且协调者仍需进行身份验证、传输安全、访问控制以及定义信任模型。

关键要点

  • 联邦学习将计算迁移到分布式数据上;它并不将原始数据集移动到单一的中心训练器。
  • 跨设备系统涉及大量间歇性设备,而跨孤岛系统涉及更少且更稳定的组织。
  • 安全聚合和差分隐私针对不同风险,可结合使用。
  • 非IID数据、带宽受限、参与不可靠以及恶意更新是核心设计约束。
什么是联邦学习?示意图展示共享模型、本地数据、本地训练、受保护的更新、聚合、新模型
原始记录保留在每个客户端;更新仍需隐私、完整性和治理控制。

联邦平均生命周期

一次典型的轮次始于协调者选择符合条件的客户端并发送当前模型。每个客户端在本地进行有限步数的训练,生成参数或梯度更新。协调者聚合符合条件的更新——通常根据本地样本数量加权——并发布新的共享模型。

每轮只有一部分客户端可能参与。协议必须容忍连接中断、版本不匹配以及在充电、忙碌或离线时无法训练的设备。通信可能主导计算,因此更新压缩和更少的往返次数往往比原始加速器速度更为重要。

跨设备 vs 跨孤岛

跨设备联邦学习可能涉及许多个人拥有的手机、传感器或浏览器。客户端数量众多,可信度较低且间歇可用。

跨孤岛联邦学习通常连接一小批拥有稳定基础设施和合同治理的医院、银行或业务单元。

这两种设置需要不同的身份、审计和故障假设。跨孤岛项目可以协商共享的模式和验证流程;跨设备服务可能需要处理数百万的软件版本以及高度不均衡的本地数据集。

安全聚合、差分隐私与加密

安全聚合是一种加密协议,使服务器能够在不读取每个客户端更新的情况下恢复聚合结果。差分隐私通过裁剪贡献并添加校准噪声,限制发布结果对任何单条记录或参与者的依赖程度。

这两种机制都不能消除所有风险。安全聚合并未使聚合结果无害,差分隐私则带来精度与隐私的权衡,需要通过明确的隐私预算加以考虑。加密保护传输或存储中的数据;但它本身并不能阻止对模型的推断。

非IID数据与模型质量

客户端数据很少是独立同分布的。键盘模型会看到每个人的词汇表;医院服务不同的人口;工厂使用不同的设备。这些差异可能导致收敛变慢,并且会掩盖小型客户端群体的性能不佳。

评估应包括全局指标、每个客户端或群体的分布、校准以及故障分析。中心测试集虽方便但不足。这将联邦学习与机器学习的数据质量以及结构化和非结构化数据治理联系起来。机器学习 结构化和非结构化数据治理。

威胁与运营控制

恶意客户端可能提交投毒更新,Sybil 客户端可能扭曲聚合,受损的服务器可能分发针对性模型。防御措施包括已认证的注册、异常检测、稳健聚合、更新验证、速率限制以及在实践中可行的可复现软件证明。

联邦学习应纳入更广泛的网络安全计划。团队应记录谁控制协调者、收集哪些元数据、参与者如何退出、模型如何回滚以及隐私或质量测试失败时的处理方式。

联邦优化与数据异质性

联邦学习将模型或更新任务发送给参与的客户端,在本地训练,并在不集中原始样本的情况下聚合更新。在联邦平均中,选定的客户端执行若干本地优化步骤,服务器根据样本数量等进行加权平均。通信轮次、本地周期、选择策略和学习率在带宽与收敛之间进行权衡。跨设备环境涉及大量不可靠的手机或传感器;跨孤岛环境则涉及计算、身份和治理更强的少数组织。

客户端数据通常非独立且分布不均:用户在行为、标签分布、数据量和可用性上各不相同。本地训练可能向不兼容的方向漂移,使简单平均不稳定或偏向活跃的大量客户端。算法可能使用近端项、自适应服务器优化、聚类、个性化或控制变量。评估应报告全局和客户端层面的性能、尾部客户端、参与频率、收敛、通信和能耗。良好的平均结果可能掩盖小众或稀有客户端群体获得较差模型的事实。

隐私、安全与系统工程

仅将数据本地化并不能保证隐私。梯度和更新可能泄露成员身份或特征,最终模型也可能记住样本。安全聚合将单个更新对服务器隐藏,差分隐私通过裁剪和添加噪声限制信息贡献,但两者都会影响效用和运营复杂度。需明确威胁模型、隐私单元、预算以及受信组件。传输中的加密是必要的,但并不能阻止恶意客户端、投毒更新、受损的协调者或推断攻击。

防御措施包括已认证的客户端、稳健聚合、异常检查、更新限制、某些设计中的安全隔离区,以及对干净数据的验证。Sybil 攻击者可以创建大量客户端;后门可能在平均过程中存活;丢弃可疑更新也可能排除合法的稀有行为。对客户端代码进行版本管理、支持中断的轮次、防止重放,并针对落后者和设备约束进行设计。对本地数据及其派生更新仍需遵守同意、保留、地区法规和删除要求。

部署与治理示例

移动键盘可以在本地训练下一个词的改进,但部署时应针对具备设备能力和已获同意的人群,收集裁剪后的受保护更新,并与冻结的基线进行比较。发布前需验证语言和方言表现、耗电、数据使用以及记忆风险。客户端需要签名的训练任务和模型更新;服务器需要可审计的轮次配置和回滚机制。联邦学习是一种在约束条件下进行分布式学习的架构,而非代表性数据、隐私工程或问责制的替代方案。

案例示例:跨医院的联邦学习

医院在不汇总扫描的情况下训练共享的图像质量模型。通用协议定义了设备元数据、标签、预处理、客户端资格、本地周期、裁剪以及安全聚合。各站点保留患者数据并提交受保护的更新,协调者在本地留出的数据集上评估每轮结果。报告包括站点层面和尾部性能,而不仅是按量加权的平均,因为否则小型医院和设备类型可能被忽视。

威胁模型涵盖恶意更新、成员泄露、受损客户端以及协调者访问。差分隐私使用已记录的预算并经过效用测试。模型和任务包均已签名;站点可以撤回,更新可审计。投毒或不稳定的轮次不会自动替换已部署的模型。项目保留本地基线和临床审查,并将联邦架构视为更广泛同意、安全和治理义务中的一种隐私控制。

实施证据与运营准备

生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖关系、负责人以及每个重要故障的后果。调优前建立可复现的基线和带版本的评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最可能服务不足的群体或环境。将任务质量与校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全一起衡量。记录每一次转换和阈值,以便独立审阅者能够复现结果并将证据与诱人的原型区分开来。

在上线前,分配发布、例外、变更、回滚和退役的授权。采用分阶段发布,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为干预以及已确认的结果,同时不收集不必要的敏感数据。定义警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据源、用户、模型、供应商、政策、硬件或目标变化时都需重新评估。维护中的系统还需要有文档化的恢复、事件学习、删除和保留流程,以及明确的停用或替换时点。

常见问题

联邦学习能否保证私人数据不泄露?

不会。它减少了原始数据的移动,但更新和最终模型仍可能泄露信息。隐私需要威胁模型以及额外的技术和组织控制。

何时集中式训练更简单?

当数据能够合法且安全地集中时,集中式训练通常更易于调试、复现和监控。只有在分布是真正需求而非仅仅品牌宣传时,才需要使用联邦学习。

主要参考文献

博客作者和程序员,专攻 Machine Learning 和 Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。