Anderson 视角

如何判断图像合成系统产生的图像是否真正“原创”

mm
将 Unite.AI 添加到您在 Google 上的首选来源
'Teddy bears working on new AI research underwater with 1990s technology' – Source: https://www.creativeboom.com/features/meet-dall-e/

韩国的一项新研究提出了一个方法来确定图像合成系统是否产生真正的新颖图像,还是只是对训练数据的“小”变体,这可能会破坏此类体系结构的目标(例如,生产新颖和原创的图像)。

这篇论文建议,现有的指标往往偏爱与训练数据集中的(非假)源图像相对较近的图像,因为它们更“真实”,但不一定更“原创”。

如果生成的图像在视觉上与源数据“接近”,那么它很可能会因为“真实性”而获得更高的评分,而不是“原创性”,因为它是“忠实的”,但不一定是“原创的”。

在一个法律影响尚不明确的领域,这可能会成为一个重要的法律问题,如果商业化的合成图像内容与当前允许在研究领域使用的(往往是)受版权保护的源材料没有足够的区别(这种类型的潜在侵权诉讼的可能性最近在微软的GitHub Co-Pilot AI中引起了关注)。

在像OpenAI的DALL-E 2、Google的Imagen和中国的CogView等系统中,输出越来越连贯和语义上强大,但几乎没有可靠的方法来测试生成图像的原创性。

事实上,搜索一些新的DALL-E 2图像通常只会找到更多相同的图像,具体取决于搜索引擎。

上传一个完整的9图DALL-E 2输出组只会导致更多DALL-E 2输出组。将第一张图(来自2022年6月8日的Twitter帖子,来自'Weird Dall-E Generations'账户)单独上传会导致Google将图像基于搜索的方向引向篮球,导致图像基于搜索走向一个语义盲巷。对于同样的图像基于搜索,Yandex似乎至少会进行一些实际的像素级别的解构和特征匹配。

上传一个完整的9图DALL-E 2输出组只会导致更多DALL-E 2输出组,因为网格结构是最强的特征。将第一张图(来自这个Twitter帖子,来自2022年6月8日的’Weird Dall-E Generations’账户)单独上传会导致Google将图像基于搜索的方向引向篮球,导致图像基于搜索走向一个语义盲巷。对于同样的图像基于搜索,Yandex似乎至少会进行一些实际的像素级别的解构和特征匹配。

虽然Yandex比Google Search更有可能使用实际的特征和视觉特征来找到相似的图像,但所有图像基于搜索引擎都可能有某种议程或做法,使得通过网络搜索难以识别“源>生成”的抄袭实例。

此外,生成模型的训练数据可能无法公开获取,从而进一步阻碍对生成图像原创性的法医检查。

有趣的是,在Google的专用Imagen网站上对合成图像进行基于图像的网络搜索,会发现没有任何与图像主题相似的图像,只有当添加“imagen google”作为额外的(和限制性的)参数时,才能进行纯粹的基于图像的网络搜索。

相反,Yandex会找到许多相似(或至少视觉相关)的真实世界图像来自业余艺术社区:

一般来说,能够衡量图像合成系统输出的新颖性或原创性将会更好,不需要从每个可能的网络图像中提取特征,或者在训练模型时使用非公开数据集,这些数据集可能使用了受版权保护的材料。

与此相关,来自韩国KAIST AI和NAVER Corp的研究人员开发了一个“稀有度评分”(Rarity Score),可以帮助识别图像合成系统更原创的创作。

图像通过StyleGAN-FFHQ生成。从左到右,列表示从最差到最佳的结果。我们可以看到“截断技巧”(Truncation trick)指标(见下文)和真实性指标有自己的议程,而新的“稀有度评分”(Rarity Score)正在寻找连贯但原创的图像(而不仅仅是连贯的图像)。来源:https://arxiv.org/pdf/2206.08549.pdf

图像通过StyleGAN-FFHQ生成。从左到右,列表示从最差到最佳的结果。我们可以看到“截断技巧”(Truncation trick)指标(见下文)和真实性指标有自己的议程,而新的“稀有度评分”(Rarity Score)正在寻找连贯但原创的图像(而不仅仅是连贯的图像)。由于本文有图像大小限制,请参阅源论文以获取更好的细节和分辨率。来源:https://arxiv.org/pdf/2206.08549.pdf

新论文的标题是《稀有度评分:评估合成图像不常见性的新指标》,由KAIST的三位研究人员和NAVER Corp的三位研究人员撰写。

超越“廉价技巧”

在之前的指标中,新的论文试图改进的包括2019年由英国Heriot-Watt大学和Google的DeepMind合作提出的“截断技巧”(Truncation trick)。

“截断技巧”基本上使用不同的潜在分布进行采样,而不是用于训练生成模型的分布。

开发此方法的研究人员在原始论文中表示,他们对其有效性感到惊讶,但承认它减少了生成输出的多样性。尽管如此,“截断技巧”已成为一种有效且流行的方法,尤其是在可以被重新描述为“廉价技巧”来获得真实外观的结果的背景下,这些结果并不一定包含所有数据中的可能性,并且可能更类似于源数据。

关于“截断技巧”,新论文的作者观察到:

“[它]不是用于生成训练数据集中的稀有样本,而是为了更稳定地合成典型图像。我们假设现有的生成模型如果能够有效地生成稀有样本,将能够产生更丰富的真实数据分布的样本。”

结果图像显示了从最小的最近邻距离(NNDs)到最大的最近邻距离,在使用FFHQ训练的StyleGAN架构中。

“对于所有数据集,最近邻距离最小的样本显示了代表性和典型的图像。相反,最近邻距离最大的样本具有强烈的个性,并且与最近邻距离最小的典型图像明显不同。”

理论上,通过使用这个新指标作为鉴别器,或者至少将其包含在更复杂的鉴别器架构中,生成系统可以被引导远离纯粹的模仿,朝着更具发明性的算法发展,同时保留可能对真实图像生产至关重要的概念的基本凝聚力(例如,“人”、“女人”、“车”、“教堂”等)。

技术

研究人员的新稀有度评分采用了早期作品中的一个想法——使用K-最近邻(KNNs)来表示图像合成系统中的真实(训练)和合成(输出)数据数组。

关于这种新型分析方法,作者断言:

“我们假设普通样本将彼此更接近,而独特和稀有的样本将在特征空间中稀疏分布。”

结果图像显示了从最小到最大的最近邻距离,在使用FFHQ训练的StyleGAN架构中。

“对于所有数据集,最近邻距离最小的样本显示了代表性和典型的图像。相反,最近邻距离最大的样本具有强烈的个性,并且与最近邻距离最小的典型图像明显不同。”

理论上,通过使用这个新指标作为鉴别器,或者至少将其包含在更复杂的鉴别器架构中,生成系统可以被引导远离纯粹的模仿,朝着更具发明性的算法发展,同时保留可能对真实图像生产至关重要的概念的基本凝聚力(例如,“人”、“女人”、“车”、“教堂”等)。

比较和实验

在测试中,研究人员将稀有度评分的性能与“截断技巧”和NVIDIA的2019年“真实性评分”进行了比较,并发现该方法能够在各种框架和数据集上识别“独特”的结果。

虽然论文中的结果太多无法在此列出,但研究人员似乎已经证明了新方法在生成过程中识别源(真实)和生成(假)图像中的稀有性方面的能力:

选择性地从论文中重现的广泛视觉结果(请参阅上面的源URL以获取更多详细信息)。左侧为FFHQ中的真实示例,这些示例在原始数据集中具有很少的近邻(即新颖和不寻常);右侧为StyleGAN生成的假图像,新指标已将其识别为真正新颖的图像。由于本文有图像大小限制,请参阅源论文以获取更好的细节和分辨率。

选择性地从论文中重现的广泛视觉结果(请参阅上面的源URL以获取更多详细信息)。左侧为FFHQ中的真实示例,这些示例在原始数据集中具有很少的近邻(即新颖和不寻常);右侧为StyleGAN生成的假图像,新指标已将其识别为真正新颖的图像。由于本文有图像大小限制,请参阅源论文以获取更好的细节和分辨率。

新稀有度评分指标不仅允许在单个架构中识别“新颖”的生成输出,还允许比较不同架构的生成模型(例如,自编码器、VAE、GAN等)。

论文指出,稀有度评分与之前的指标不同之处在于,它关注生成框架的能力,生成独特和稀有的图像,而不是传统指标,它们检查训练过程中生成的多样性。

超越有限任务

虽然新论文的研究人员已经对有限领域框架(例如,生成人或猫的图片)进行了测试,但稀有度评分可以潜在地应用于任何任意图像合成过程,其中需要识别使用训练数据分布的生成示例,而不是通过插入外部潜在分布或依赖于其他“捷径”来提高真实性。

实际上,这种指标可以区分DALL-E系列系统中真正新颖的输出实例,方法是使用识别出的距离来确定一个明显的“离群”结果、训练数据和来自类似提示或输入的结果之间的距离。

在实践中,尤其是在没有明确理解系统真正吸收了多少视觉和语义概念(通常受到对训练数据了解有限的阻碍)时,这可能是一种可行的方法来识别生成系统中的真正“灵感时刻”——足够多的输入概念和数据已经产生了真正发明性的东西,而不是过于衍生或接近源数据的东西。

* 我将作者的内联引用转换为超链接。

首次发布于2022年6月20日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai