Anderson 视角

AI 研究人员估计 97% 的欧盟网站未能满足 GDPR 隐私要求,尤其是用户画像

mm
将 Unite.AI 添加到您在 Google 上的首选来源

美国的研究人员使用机器学习技术研究了超过一千个欧盟网站的 GDPR 隐私政策,发现 97% 的网站未能满足欧盟 2018 年监管框架的至少一个要求,尤其是用户画像的监管要求。

论文指出:

‘[由于] 隐私政策是用户理解和控制其隐私的基本沟通渠道,许多公司在 GDPR 生效后更新了其隐私政策。然而,大多数隐私政策冗长、充满术语,并模糊地描述公司的数据实践和用户的权利。因此,尚不清楚它们是否符合 GDPR 的要求。’

它继续指出:

‘我们的结果表明,即使 GDPR 生效后,97% 的网站仍然未能满足 GDPR 的至少一个要求。’

该研究题为 使用深度主动学习的 GDPR 披露要求在隐私政策中的自动检测,由弗吉尼亚大学夏洛茨维尔分校的三名研究人员进行。

最后的隐私

研究发现,GDPR 中有关用户画像的规定是网站最不符合的要求,只有 15.3% 的网站完全符合这一规定。

用户画像(即记录用户与网站的交互并常用于其他在线环境的目标广告)已成为科技界自剑桥分析公司丑闻以来最热门的争议话题之一。

周二,欧洲议会的一个关键委员会通过了新的数字市场法(DMA)立法的第一阶段,该法案将禁止对未成年人的行为定向,并对违规公司施加高达全球年度销售额 20% 的罚款。

尽管该法案被媒体视为对科技巨头日益增长的影响的直接回应,但新的研究显示,绝大多数欧盟公司(包括在欧洲经营的美国公司)都面临着 GDPR 罚款的法律风险。

此外,意大利本周对苹果和谷歌施加了最高可达 1 亿欧元(1120 万美元)的罚款,理由是他们利用用户画像以及其他违规行为。

数据

研究中检查的网站样本来自 Quantcast 排名前 10,000 的网站,研究人员通过在英国 VPN 上进行 Yandex 搜索提取了这些网站的英文版隐私政策,以确保这些政策不会被地理屏蔽。

自 2018 年 5 月 GDPR 生效以来,欧盟的网站必须提供规定的隐私政策,涵盖 18 个核心要求(见上图)。研究人员仅提取了 2018 年 8 月以后发布的隐私政策,以便让域名有足够的时间发布所需的政策(他们至少有一年时间知道 GDPR 的开发阶段将持续两年,从 2016 年开始)。

筛选过程产生了一个包含 9,761 个政策的隐私语料库,研究人员从中随机选择了 1,080 个政策。

预处理

研究团队聘请了两名法律专家来培训四名人类标注员,以标记 GDPR 规定的 18 个可能的隐私政策。

一些政策涵盖了多个要求,因此需要使用卷积神经网络(CNN)来检测每个政策的语言特征。

最初,研究人员尝试训练一个模型来识别基于语言的合规性,取得了 80.5% 的成功率。为了改进这些结果,研究人员应用了主动学习来增强模型的性能,使用较少的标记数据。通过这种方法,研究人员能够将分类器 CNN 的准确率提高到 89.2%,F1 得分为 0.88(其中 1 表示完全成功)。

为了确保词嵌入特定于隐私政策,研究人员使用 Facebook 的 FastText Python 库训练了一个无监督的词嵌入模型。

按照标准做法,研究人员将最终数据分为 80/20 的训练数据和测试数据(即随机选择的数据,用于评估算法的准确性)。研究人员还添加了一个人机测量研究,以评估结果的质量。

在工作流程中,产生了 11,271 个人类标注的隐私政策段,每个段都由四名人类标注员审查,这些标注员由两名参与研究的法律专家培训。如果出现分歧,则需要 75% 的一致性比率,以避免拒绝数据。

除了前面提到的结果外,研究人员还发现, GDPR 中的可移植性要求(即用户有权将公司持有的数据转移到其他地方或导出)几乎与画像一样不被满足。

研究人员得出结论:

‘[要求] 如用户的可移植性权利和提供数据保护官员的联系信息,分别被 15.5% 和 16.4% 的网站覆盖。其他主要要求,如用户的投诉权、撤回同意权、异议权和适当性决定,分别被 17-20% 的网站覆盖。’

并继续指出:

‘似乎只有 3% 的网站完全符合 18 个要求。这些发现表明,许多网站仍然不遵守 GDPR 的要求。’

2021 年 11 月 26 日 19:00 – 澄清了第一张图的标题。 – MA

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai