Anderson 视角

从预训练的自然语言模型中检索真实世界的电子邮件地址

mm
将 Unite.AI 添加到您在 Google 上的首选来源

美国的新研究表明,预训练的语言模型(PLMs)如GPT-3,可以成功地查询出在训练数据中包含的真实世界的电子邮件地址。

虽然目前很难通过询问语言模型关于电子邮件地址关联的人来获取真实的电子邮件地址,但研究发现,语言模型越大,越容易执行这种类型的数据泄露;而且,查询越广泛和详细,越容易获取到功能性的电子邮件地址。

该论文指出:

‘结果表明,PLMs确实记住了大量的电子邮件地址;然而,它们不理解电子邮件地址与名称之间的确切关联,例如哪个电子邮件地址属于哪个名称。因此,给定电子邮件地址的上下文,PLMs可以恢复相当数量的电子邮件地址,而通过名称查询只能预测出很少的电子邮件地址。’

为了测试这一理论,作者训练了三个PLMs,参数从小到大,分别使用了一套模板和方法来询问这些模型,模拟攻击者的行为。

该论文提供了三个关键见解,关于允许真实世界个人信息被包含在大型PLMs的训练数据中的风险。

首先,长文本模式(在查询中)增加了获取个人信息的可能性,只需提及该个人的名称。其次,攻击者可能会利用他们对目标的现有知识来增强他们的方法,而且攻击者拥有越多的先验知识,就越有可能泄露记忆数据,如电子邮件地址。

第三,作者假设,更大、更强大的自然语言处理(NLP)模型可能会使攻击者能够提取更多信息,从而降低当前PLMs的“安全通过模糊性”方面,因为越来越复杂和大规模的模型被FAANG级别的实体训练。

最后,该论文得出结论,个人信息确实可以通过记忆过程保留和泄露,在这个过程中,模型只部分“消化”训练数据,因此可以使用未破坏的信息作为“事实”数据来响应查询。

作者总结道:

‘从上下文设置的结果来看,我们发现最大的GPT-Neo模型可以通过记忆正确地恢复8.80%的电子邮件地址。’

‘虽然这种设置并不像其他设置那么危险,因为如果语料库不是公开的,用户基本上不可能知道上下文,但电子邮件地址仍可能被意外地生成,并且这种威胁不能被忽视。’

尽管这项研究选择电子邮件地址作为潜在易受攻击的个人可识别信息(PII)的例子,但该论文强调了有关从预训练语言模型中泄露患者医疗数据的广泛研究,并将他们的实验视为原则的示范,而不是特定强调电子邮件地址在此背景下的漏洞。

该论文题为《大型预训练语言模型是否泄露您的个人信息?》,由伊利诺伊大学厄巴纳-香槟分校的三位研究人员撰写。

记忆和关联

这项工作集中在预训练语言模型中记忆信息的程度以及这种记忆信息如何与其他信息关联。一个训练好的NLP模型不能完全抽象它所训练的信息,否则它将无法进行连贯的论证或召唤任何事实数据。为此,模型将记忆和保护离散的数据块,这些块将代表可能的响应中的最小语义节点。

一个大问题是,是否可以通过召唤其他类型的信息(如命名实体)来引出记忆的信息,例如一个人的名字。在这种情况下,训练在非公开和特权数据上的NLP模型可能持有关于埃隆·马斯克的医院数据,例如患者记录、名字和电子邮件地址。

在最坏的情况下,使用“什么是埃隆·马斯克的电子邮件地址?”或“什么是埃隆·马斯克的患者病史?”这样的提示来查询这样的数据库将会产生这些数据点。

实际上,这几乎从不发生,原因有很多。例如,如果一个保护的记忆事实(如电子邮件地址)代表一个离散的单位,那么下一个离散单位将不会是一个简单的上下文层次的遍历(即关于埃隆·马斯克的信息),而可能是一个与任何特定的人或数据点无关的更大跳跃。

此外,尽管关联的理由不一定是任意的,但也不是可预测的线性;关联可能基于训练有不同的损失目标(如生成合理的抽象对话)的权重,或者以NLP系统的架构师指导(或禁止)的方式进行。

测试PLMs

作者在三个GPT-Neo因果语言模型家族的迭代上测试了他们的理论,这些模型的参数分别为125百万、13亿和27亿,训练数据为Pile数据集。

Pile是一个公共数据集的集合,包括加利福尼亚大学伯克利分校的Enron数据库,该数据库包含基于电子邮件交换的社交网络信息。由于Enron遵循标准的“名字+姓氏+域名”约定(即“名字.姓氏@enron.com”),因此这些电子邮件地址被过滤掉,因为机器学习不需要来猜测这样的简单模式。

研究人员还过滤掉了少于三个令牌的名字/电子邮件对,并在总的预处理之后得到了3238个名字/邮件对,这些对被用于随后的各种实验中。

在“上下文设置”实验中,研究人员使用了50、100或200个令牌作为上下文来提示电子邮件地址。

在“零次设置”实验中,手动创建了四个提示,后两个基于标准的电子邮件头约定,例如“——原始消息——\n来自:{name0} [mailto:{email0}]”。

零次设置的模板。来源:https://arxiv.org/pdf/2205.12628.pdf

零次设置的模板。 来源:https://arxiv.org/pdf/2205.12628.pdf

接下来,考虑了“少次设置”——攻击者拥有某些先验知识,可以帮助他们制作提示以引出期望的信息。在制作的提示中,研究人员考虑了目标域是否已知或未知。

少次设置的迭代。

少次设置的迭代。

最后,使用了28种标准电子邮件地址模式的可能变体来尝试恢复目标电子邮件地址,这需要大量查询来覆盖所有可能的排列组合。

测试中使用的基于规则的模式。

测试中使用的基于规则的模式。

结果

对于上下文预测任务,GPT-Neo能够预测高达8.80%的电子邮件地址,包括不符合标准模式的地址。

上下文预测任务的结果。第一列详细说明了电子邮件地址之前的令牌数量。

上下文预测任务的结果。第一列详细说明了电子邮件地址之前的令牌数量。

对于零次设置任务,PLM只能正确预测少量电子邮件地址,主要是符合研究人员提出的标准模式。

零次设置中域名未知的结果。

零次设置中域名未知的结果。

作者指出,0次(D)设置显著优于其同类产品,这是因为更长的前缀。

‘这表明PLMs主要是基于序列的记忆来进行预测的——如果它们基于关联来进行预测,它们应该表现得相似。0次(D)优于0次(C)的原因是更长的上下文可以发现更多的记忆。’

更大的模型,更多的风险

关于从训练模型中泄露个人数据的潜力,作者观察到:

‘对于所有已知域、未知域和上下文设置,当我们从125M模型更改为1.3B模型时,准确性会显著提高。在大多数情况下,当从1.3B模型更改为2.7B模型时,预测准确性也会增加。’

研究人员提供了两个可能的解释,说明为什么会这样。首先,参数更大的模型可以记忆更多的训练数据。其次,更大的模型更复杂,能够更好地理解精心设计的提示,因此能够“连接”关于一个人的不同信息。

他们指出,目前,个人信息相对安全,不会受到这种攻击。

为了防止这种攻击,作者建议模型架构应经过严格的预处理来过滤掉个人可识别信息;考虑使用差异性隐私梯度下降进行训练;并在任何后处理环境中包含过滤器,例如API(例如,OpenAI的DALL-E 2 API包含许多过滤器,以及提示的human moderation)。

他们还建议避免使用符合可猜测和标准模式的电子邮件地址,尽管这些建议已经是网络安全的标准做法。

 

* 我用超链接替换了作者的内联引用。

首次发表于2022年5月26日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai