Anderson 视角

深度学习模型可能难以识别AI生成的图像

mm
将 Unite.AI 添加到您在 Google 上的首选来源

一篇新论文的发现表明,目前最先进的AI模型在识别和解释AI合成图像方面比人类要差得多,这可能会在机器学习模型越来越多地在合成数据上进行训练的未来引起担忧,而这些数据可能不是“真实”的。

这里我们看到resnext101_32x8d_wsl预测模型在“百吉饼”类别中挣扎。在测试中,如果核心目标词(在这种情况下是“百吉饼”)不在前五个预测结果中,则认为识别失败。来源:https://arxiv.org/pdf/2208.10760.pdf

这里我们看到resnext101_32x8d_wsl预测模型在“百吉饼”类别中挣扎。在测试中,如果核心目标词(在这种情况下是“百吉饼”)不在前五个预测结果中,则认为识别失败。来源:https://arxiv.org/pdf/2208.10760.pdf

这项新研究测试了两类基于计算机视觉的识别框架:对象识别和视觉问答(VQA)。

左边是对象识别系统的推理成功和失败;右边是VQA任务,旨在以更探索性和更重要的方式探测AI对场景和图像的理解。来源:https://arxiv.org/pdf/2105.05312.pdf和https://arxiv.org/pdf/1505.00468.pdf

左边是对象识别系统的推理成功和失败;右边是VQA任务,旨在以更探索性和更重要的方式探测AI对场景和图像的理解。来源:https://arxiv.org/pdf/2105.05312.pdf和https://arxiv.org/pdf/1505.00468.pdf

在十个最先进的模型中,所有模型都在ImageNet上进行了训练,并在由图像合成框架DALL-E 2Midjourney生成的数据集上进行了测试,其中最好的模型只能在两种测试类型中实现60%和80%的top-5准确率,而ImageNet在非合成的真实世界数据上可以分别实现91%和99%的准确率,而人类的性能通常更高。

解决围绕分布转移(也称为“模型漂移”,即预测模型在从训练数据转移到“真实”数据时会经历预测能力下降)的问题,该论文指出:

人类能够轻松地识别生成的图像并回答关于它们的问题。我们得出结论:a)深度模型难以理解生成的内容,可能需要微调才能做得更好,b)生成的图像和真实照片之间存在很大的分布转移。分布转移似乎是类别依赖的。

鉴于互联网上已经泛滥的合成图像数量,尤其是在上周稳定扩散模型的开源之后,很自然地会想到,当“假”图像涌入行业标准数据集(如Common Crawl)时,多年来的准确率可能会受到“非真实”图像的影响。

虽然合成数据被誉为可能拯救数据匮乏的计算机视觉研究领域的潜在救星,该领域通常缺乏资源和预算用于大规模数据集成,但新的合成图像潮流(以及自从DALL-E 2的商业化以来合成图像的普遍增加)不太可能都带有方便的标签、注释和哈希标签来区分它们为“假”的,当机器视觉系统从互联网上抓取它们时。

图像合成框架的开发速度已经超过了我们对图像进行分类的能力,导致了对“假图像”检测系统的兴趣日益增长,类似于深度伪造检测系统,但负责评估整个图像而不是面部部分

这篇新论文的标题是深度模型在理解生成图像方面有多好,来自旧金山机器学习初创公司Quintic AI的Ali Borji。

数据

该研究是在稳定扩散发布之前进行的,实验使用DALL-E 2和Midjourney在17个类别中生成的数据,包括大象蘑菇披萨椒盐卷拖拉机兔子

测试识别和VQA系统挑战的图像示例。

测试识别和VQA系统挑战的图像示例。

图像通过网络搜索和Twitter获得,并且按照DALL-E 2的政策(至少在那时),不包括任何包含人脸的图像。只选择人类可以识别的高质量图像。

为对象识别和VQA任务分别策划了两个图像集。

对象识别中每个类别的图像数量。

对象识别中每个类别的图像数量。

测试对象识别

对于对象识别测试,测试了十个模型,所有模型都在ImageNet上进行了训练:AlexNetResNet152MobileNetV2DenseNetResNextGoogleNetResNet101Inception_V3DeitResNext_WSL

一些类别比其他类别更细致,需要使用平均方法。例如,ImageNet包含三个与“钟表”相关的类别,因此需要定义某种仲裁指标,即只要任何“钟表”类别的任何类型在任何图像的前五个标签中都被认为是成功。

17个类别中的每个模型性能。

17个类别中的每个模型性能。

本轮测试中最好的模型是resnext101_32x8d_ws,实现了近60%的top-1(即其五个猜测中的首选预测是图像中正确的概念)和80%的top-five(即期望的概念至少在模型的五个猜测中列出)。

作者认为,该模型的良好性能是因为它是为社交媒体平台中弱监督预测标签而训练的。然而,这些领先的结果,作者指出,与ImageNet在真实数据上实现的91%和99%相比明显较低。他认为这是因为ImageNet图像(也是从网络上抓取的)和生成图像之间存在重大差异。

对于系统来说,最困难的五个类别,按难度顺序排列,是风筝乌龟松鼠墨镜头盔。该论文指出,风筝类别经常与气球降落伞雨伞混淆,尽管这些区别对人类观察者来说是微不足道的。

某些类别,包括风筝乌龟,导致所有模型都出现了普遍的失败,而其他类别(尤其是椒盐卷拖拉机)则在所有测试模型中实现了几乎普遍的成功。

两极分化的类别:所选目标类别中有些要么困扰了所有模型,要么对所有模型来说都很容易识别。

两极分化的类别:所选目标类别中有些要么困扰了所有模型,要么对所有模型来说都很容易识别。

作者认为,这些发现表明所有对象识别模型可能具有相似的优缺点。

测试视觉问答

接下来,作者测试了VQA模型,使用开放式和自由形式的VQA,具有二元问题(即只能回答“是”或“否”的问题)。该论文指出,最近的最先进的VQA模型能够在VQA-v2数据集上实现95%的准确率。

在此测试阶段,作者策划了50张图像,并围绕它们提出了241个问题,其中132个问题的答案为“是”,109个问题的答案为“否”。平均问题长度为5.12个单词。

本轮测试使用了OFA模型,一种任务不可知和模态不可知的框架,用于测试任务的全面性,并且最近在VQA-v2测试标准集中取得了领先的成绩。OFA模型在生成的图像上实现了77.27%的准确率,相比之下,在VQA-v2测试标准集上实现了94.7%的准确率。

VQA部分测试的示例问题和结果。'GT'是'基准真值',即正确答案。

VQA部分测试的示例问题和结果。’GT’是’基准真值’,即正确答案。

该论文的作者认为,部分原因可能是生成的图像包含VQA-v2数据集中不存在的语义概念,而且为VQA测试编写的问题可能比VQA-v2问题更具挑战性,尽管他认为前一个原因更有可能。

数据流中的LSD?

意见

新型AI合成图像的涌现,这些图像可以呈现出不存在于自然界中的概念的瞬间结合和抽象,并且通过传统方法生产这些图像将是极其耗时的,这可能会为弱监督数据收集系统带来特定的问题,这些系统可能无法优雅地处理大量未标记的合成数据——主要是因为它们不是为处理大量未标记的合成数据而设计的。

在这种情况下,可能存在这些系统将某一部分“怪异”的合成图像归入错误类别的风险,只是因为这些图像中存在不真正属于一起的不同对象。

宇航员骑马的图像可能已经成为新一代图像合成系统的最具代表性的视觉表现——但这些“非真实”的关系可能会进入真正的检测系统,除非采取措施防止这种情况。来源:https://twitter.com/openai/status/1511714545529614338?lang=en

宇航员骑马的图像可能已经成为新一代图像合成系统的最具代表性的视觉表现——但这些“非真实”的关系可能会进入真正的检测系统,除非采取措施防止这种情况。来源:https://twitter.com/openai/status/1511714545529614338?lang=en

除非可以在训练之前的预处理阶段防止这种情况,否则这些自动化管道可能会导致不太可能甚至是怪诞的关联被训练到机器学习系统中,从而降低其有效性,并冒着将高级关联传递到下游系统和子类别和类别中的风险。

或者,断断续续的合成图像可能会对后续系统的准确率产生“寒冷效应”,尤其是在新出现或修订的架构试图考虑特殊的合成图像时,它们可能会对此做出过度反应。

在任何情况下,稳定扩散时代的合成图像可能会为计算机视觉研究领域带来头痛,该领域的努力使这些奇怪的创造和能力成为可能——最不重要的是,它们会危及该领域希望数据的收集和策划最终可以比现在更自动化、更便宜和更不耗时的希望。

 

首次发布于2022年9月1日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai