Anderson 视角

重识别GAN生成器的源数据

mm
将 Unite.AI 添加到您在 Google 上的首选来源

法国的新研究提出了一种技术,可以“重识别”那些贡献于合成数据的源身份,例如面部生成项目中生成的“不存在的人”。

该方法在论文《这个人(可能)存在。对GAN生成面部的身份成员攻击》中被概述,论文地址为https://arxiv.org/pdf/2107.06018.pdf,该方法不需要(不太可能)访问训练架构或模型数据,可以应用于各种使用生成对抗网络(GAN)的应用中,以匿名化个人身份信息(PII)或生成合成数据同时保护源材料。

研究人员制定了一种称为《身份成员攻击》的方法,该方法评估单个身份在贡献数据集中频繁出现的可能性,而不是尝试识别特定的身份特征(例如,用于训练生成模型的原始图像的像素组)。

来源:https://arxiv.org/pdf/2107.06018.pdf

来源:https://arxiv.org/pdf/2107.06018.pdf

上述图像来自研究,每行开始于由StyleGAN创建的GAN生成图像。左侧图像块来自40,000张图像,中间图像块来自80,000张图像,右侧图像块来自46,000张图像。所有图像来自VGG2Face2数据集。

一些样本与训练数据有着短暂的相似之处,而其他样本则强烈地与训练数据相关。研究人员使用面部识别网络成功地识别了这些面部。

超过表面价值

这种重识别方法对多个研究领域有着多重影响;位于诺曼底的卡昂大学的研究人员强调,他们的技术不仅限于面部集和面部生成GAN框架,也同样适用于医疗成像数据集和生物特征数据等其他可能的攻击面。

“我们认为,如果成功,这种攻击将成为在敏感环境中安全交换GAN的严重障碍。例如,在绘画或其他艺术作品的背景下,分发非私有生成器可能会因明显的版权问题而被排除。在更重要的是,考虑一个生物特征公司A发布一个生成器,暴露其客户身份。另一家公司B可能会检测出哪些客户也是公司A的客户。类似的情况可能会对医疗数据造成严重问题,因为泄露GAN可能会违反患者疾病的个人信息。”

重识别非法网页抓取或私人数据

虽然论文仅轻轻触及了这个话题,但从抽象输出(如GAN生成面部,同样适用于编码器/解码器系统和其他架构)中识别原始源数据的能力,对于未来5-10年内的版权保护实施具有显著的影响。

目前,大多数国家对公共网络数据的抓取采取了“放任不管”的态度,以免在即将到来的机器学习经济的发展阶段中落后。随着这种气候的商业化和巩固,可能会出现一代新的“数据巨魔”来提出对历史上曾被用于机器学习算法的图像的版权主张,这些图像可以通过类似于新法国论文中提出的方法从输出中推断出来。

随着开发的算法成熟并随着时间的推移变得更加有价值,任何未经许可使用的图像,如果可以通过类似于新法国论文中提出的方法从其输出中推断出来,则可能成为法律责任,规模类似于SCO Vs IBM(一个传奇的长期科技诉讼,继续威胁 Linux操作系统)。

利用多样性与频率的墨西哥僵局

法国研究人员使用的主要技术是利用原始数据集图像的频率作为重识别的关键。原始数据集中特定身份出现的频率越高,就越有可能通过将攻击结果与公开或私人可用数据集相关联来识别出该原始身份。

研究人员指出,这可以通过在源数据集中包含更多样化的数据(例如面部)来缓解,并且不应训练数据集太长以至于发生过拟合。问题在于,模型必须在更高维度的空间中实现良好的抽象,并且需要比严格必要的更多的数据来获得合理的合成结果。

要实现这种最佳的泛化是昂贵且耗时的:潜在空间(机器学习模型中分析数据的公式部分)将需要更多资源;数据集将需要更多的策划;由于需要大量数据,批处理大小和速率调度将需要针对质量和高泛化能力进行优化,而不是训练速度和经济性,从而导致开发成本更高,开发时间更长。

此外,过拟合的生成算法即使输出数据(例如面部、地图、生物医学图像等)不完全抽象,但具有比理想状态更大的区别特征,也可以实现高度逼真的合成数据——这是一个诱人的捷径。在当前的机器学习领域的“狂野西部”气候中,小型项目试图用更少的资源挑战FAANG的领先地位,或者为了吸引注意力而被收购,是否始终能达到如此高的标准是值得怀疑的。

该论文还观察到,源数据点(如面部)的多样性本身不足以通过这些和类似的方法防止重识别,因为训练的早期停止可能会导致源身份抽象不足。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai