思想领袖

三种保护隐私的机器学习技术解决本十年的最重要问题

mm
将 Unite.AI 添加到您在 Google 上的首选来源

作者:Amogh Tarcar,机器学习和人工智能研究员,Persistent Systems

根据各个领域的专家意见,数据隐私将成为本十年最重要的问题本十年最重要的问题。这在机器学习(ML)中尤其重要,因为算法需要处理大量数据。

传统上,机器学习建模技术依赖于将多个来源的数据集中到一个数据中心。毕竟,机器学习模型在拥有大量数据时最强大。然而,这种方法带来了许多隐私挑战。由于HIPAA、GDPR和CCPA等监管问题,聚合多个来源的数据变得不太可行。此外,集中数据会增加数据滥用和安全威胁的范围和规模,例如数据泄露。

为了克服这些挑战,已经开发了多个保护隐私的机器学习(PPML)支柱,具有特定的技术来降低隐私风险并确保数据保持合理的安全。以下是其中一些最重要的技术:

1. 联邦学习

联邦学习是一种机器学习训练技术,它颠倒了数据聚合问题。与其创建一个单一的机器学习模型来聚合数据,不如聚合机器学习模型本身。这确保数据永远不会离开其源位置,并允许多个方合作并在不直接共享敏感数据的情况下建立一个共同的机器学习模型。

它的工作原理如下。首先,你有一个基本的机器学习模型,然后将其共享给每个客户端节点。这些节点然后使用自己的数据在本地运行模型训练。模型更新定期与协调器节点共享,协调器节点处理这些更新并将它们融合在一起以获得新的全局模型。这样,你就可以在不共享这些数据集的情况下获得多样数据集的见解。

来源:Persistent Systems

在医疗保健的背景下,这是一种非常强大和隐私保护的工具,可以在给研究人员提供集体智慧的同时保持患者数据的安全。通过不聚合数据,联邦学习创建了一个额外的安全层。然而,模型和模型更新本身如果不加保护仍然存在安全风险。

2. 差分隐私

机器学习模型经常成为会员推理攻击的目标。假设您与医院共享了您的医疗数据,以帮助开发一种癌症疫苗。医院保护您的数据安全,但使用联邦学习训练了一个公开可用的机器学习模型。几个月后,黑客使用会员推理攻击来确定您的数据是否用于模型的训练。他们然后将这些信息传递给保险公司,保险公司可能会根据您患癌症的风险提高您的保费。

差分隐私确保对机器学习模型的对手攻击不会能够识别出用于训练的特定数据点,从而减少了在机器学习中暴露敏感训练数据的风险。这是通过在训练模型时向数据或机器学习模型参数中添加“统计噪声”来实现的,使得运行攻击和确定特定个人的数据是否用于训练模型变得困难。

例如,Facebook最近发布了Opacus,这是一种用于训练PyTorch模型的高速度库,使用了一种名为DP-SGD(差分隐私随机梯度下降)的基于差分隐私的机器学习训练算法。下面的GIF演示了它如何使用噪声来屏蔽数据。

 

这种噪声由一个名为Epsilon的参数控制。如果Epsilon值很低,则模型具有完美的数据隐私,但实用性和准确性较差。相反,如果您有一个高Epsilon值,则您的数据隐私将降低,而准确性将提高。关键在于找到平衡,以优化两者。

3. 同态加密

标准加密通常与机器学习不兼容,因为一旦数据被加密,机器学习算法就无法理解它。然而,同态加密是一种特殊的加密方案,允许我们继续执行某些类型的计算。

来源:OpenMined

这种方法的强大之处在于,训练可以在完全加密的空间中进行。这不仅保护了数据所有者,还保护了模型所有者。模型所有者可以在加密数据上运行推理,而无需看到或滥用数据。

当应用于联邦学习时,模型更新的融合可以安全地进行,因为它们发生在完全加密的环境中,大大降低了会员推理攻击的风险。

隐私保护的十年

当我们进入2021年时,保护隐私的机器学习是一个新兴领域,研究非常活跃。如果上一个十年是关于打破数据孤岛,那么这个十年将是关于在保护基础数据隐私的同时打破机器学习模型的孤岛,通过联邦学习、差分隐私和同态加密。这些技术为以隐私保护的方式推进机器学习解决方案提供了一个有前途的新方法。

Amogh 是一名机器学习研究员,并是 Persistent Systems 人工智能研究实验室的一部分。他的当前研究重点是联邦学习应用和构建用于知识提取的 NLP 工具。