Anderson 视角
阻碍计算机视觉数据集的未经授权使用

中国的研究人员开发了一种方法,可以通过有效地“水印”图像数据来对计算机视觉训练使用的图像数据集进行版权保护,然后通过基于云的平台为授权用户解密“干净”的图像。
对该系统的测试显示,训练机器学习模型在版权保护的图像上会导致模型准确率大幅下降。研究人员在两个流行的开源图像数据集上测试了该系统,发现可以将准确率从86.21%和74.00%下降到38.23%和16.20%,当尝试在未解密的数据上训练模型时。

来自论文的示例 – 左到右,干净、受保护(即扰乱)和恢复的图像。 来源:https://arxiv.org/pdf/2109.07921.pdf
这可能允许高质量、昂贵的数据集被广泛分发,甚至可以进行“演示”训练,以展示近似的功能。
基于云的数据集认证
该论文来自南京航空航天大学的两个部门,设想了数据集管理云平台(DMCP)的常规使用,这是一个远程认证框架,提供与Adobe Creative Suite等本地安装类似的遥测预启动验证。
受保护的图像是通过特征空间扰动生成的,这是一种由北卡罗来纳州杜克大学在2019年开发的对抗攻击方法。

特征空间扰动执行激活攻击,其中一张图像的特征被推向对抗图像的特征空间。 来源:https://openaccess.thecvf.com
然后,未修改的图像通过块对和块变换嵌入到扭曲的图像中,如2016年论文《加密图像中的可逆数据隐藏》中所述。
包含块对信息的序列然后被嵌入到一个临时的中间图像中,使用AES加密,密钥将在认证时从DMCP中检索。最低有效位隐写算法然后被用于嵌入密钥。作者将此过程称为修改的可逆图像变换(mRIT)。
mRIT例程基本上在解密时被逆转,恢复“干净”的图像以供训练会话使用。
测试
研究人员在两个数据集上测试了该系统:2009年的CIFAR-10数据集,包含10个类别的6000张图像;以及斯坦福大学的TinyImageNet数据集,它是ImageNet分类挑战数据的子集,包含10万张训练图像、1万张验证图像和1万张测试图像。
ResNet模型从零开始训练,使用三个配置:干净、受保护和解密的数据集。两个数据集都使用Adam优化器,初始学习率为0.01,批大小为128,训练轮数为80。

加密系统的训练和测试准确率结果。解密(即逆转)图像的训练统计数据中可以观察到到minor损失。
尽管论文得出结论,“恢复数据集上的模型性能不会受到影响”,但结果确实显示了在恢复数据与原始数据上的准确率的轻微损失,从86.21%到85.86%的CIFAR-10数据集,以及从74.00%到73.20%的TinyImageNet数据集。
然而,考虑到甚至小的随机扰动(以及GPU硬件)可以影响训练性能,这似乎是一个最小的、有效的权衡,以换取知识产权保护。
模型保护格局
以前的工作主要集中在保护实际的机器学习模型,假设训练数据本身更难保护:2018年日本的一项研究提出了在深度神经网络中嵌入水印的方法;2017年更早的工作提出了类似的方法。
2018年IBM的一项计划可能是对神经网络模型水印潜力的最深入、最有承诺的调查。这种方法与新研究不同之处在于,它试图在训练数据中嵌入不可逆的水印,然后使用神经网络中的过滤器来“折扣”数据中的扰动。

IBM的计划依赖于神经网络“忽略”水印,通过保护识别和丢弃水印部分的数据结构。 来源:https://gzs715.github.io/pubs/WATERMARK_ASIACCS18.pdf
盗版向量
虽然追求IP保护数据集加密框架似乎是一种边缘情况,在机器学习文化仍然依赖于开源审查和全球研究社区之间的信息共享的背景下,但持续的对隐私保护身份保护算法的兴趣可能会周期性地产生对企业有兴趣保护特定数据而不是PII的系统。
新研究不向图像数据添加随机扰动,而是使用特征空间中的精心设计的、强制的偏移。因此,目前的水印去除和图像增强计算机视觉项目可能能够将图像“恢复”到人类感知的更高质量,而实际上并没有去除导致误分类的特征扰动。
在许多计算机视觉应用中,特别是那些涉及标记和实体识别的应用中,这样的非法恢复的图像可能仍然会导致误分类。然而,在图像变换是主要目标的应用中(例如面部生成或深度伪造应用),算法恢复的图像可能仍然可以在开发功能算法中使用。













