Anderson 视角

检测纯图像合成框架的系统,如DALL-E 2

mm
将 Unite.AI 添加到您在 Google 上的首选来源

来自加利福尼亚大学伯克利分校的新研究为判断新一代图像合成框架(如Open AI的DALL-E 2、谷歌的Imagen和Parti)输出是否可以被检测为“非真实”提供了一种方法。这种方法是通过研究合成图像中的几何、阴影和反射来实现的。

研究人员通过研究DALL-E 2生成的图像发现,尽管该架构能够产生令人印象深刻的真实图像,但仍然存在一些与全局视角、阴影和反射相关的不一致性。

论文指出:

‘几何结构、阴影和反射在镜面上的表现与自然场景的预期视角几何不一致。几何结构和阴影在局部是一致的,但在全局上是不一致的。’

‘反射则经常被不合理地渲染,可能是因为它们在训练图像数据集中较少见。’

DALL-E 2图像中,渲染对象和其反射之间的一致性交点的缺乏,目前是一个可靠的检测方法。来源:https://arxiv.org/pdf/2206.14617.pdf

DALL-E 2图像中,渲染对象和其反射之间的一致性交点的缺乏,目前是一个可靠的检测方法。来源:https://arxiv.org/pdf/2206.14617.pdf

这篇论文代表了计算机视觉研究领域中一个新的研究方向——图像合成检测。

自2017年深度伪造技术出现以来,深度伪造检测(主要针对autoencoder输出,如DeepFaceLab和FaceSwap)已经成为一个活跃的研究领域,各种论文和方法都在针对合成面部的“特征”进行研究。

然而,直到最近,像DALL-E 2这样的超大规模训练图像生成系统的出现,文本提示系统(如CLIP)输出的图像并没有对“照片真实性”构成威胁。论文作者认为,这种情况即将改变,即使他们发现的不一致性可能不会对图像的欺骗性产生太大影响。

作者指出:

‘这些失败可能不会对人类视觉系统产生太大影响,人类视觉系统在某些几何判断方面(如照明、阴影、反射、视角和视角失真)已经被证明是相当无能的。’

消失的可信度

作者首先对DALL-E 2输出进行了视角投影的法医检查,即附近对象和纹理的直边应该统一地收敛到一个“消失点”。

左,同一平面上的平行线收敛到一个共同的消失点;右,同一平面和平行平面的多个消失点定义了一条消失线(以红色表示)。

左,同一平面上的平行线收敛到一个共同的消失点;右,同一平面和平行平面的多个消失点定义了一条消失线(以红色表示)。

为了测试DALL-E 2在这一方面的一致性,作者使用DALL-E 2生成了25张合成的厨房图像——一个熟悉的空间,即使在豪华住宅中,也通常足够小,以提供多个可能的消失点用于各种对象和纹理。

检查来自提示“带有瓷砖地板的厨房照片”的输出后,研究人员发现,尽管每个案例都有一个令人信服的表现(除了与视角无关的几个小的伪影),但所描绘的对象从不正确地收敛。

作者注意到,虽然每组平行线从瓷砖图案中都是一致的,并在一个单独的消失点(蓝色)相交,但柜台(青色)的消失点与消失线(红色)和从瓷砖中推导出的消失点都不一致。

作者观察到,即使柜台不平行于瓷砖,青色消失点也应该收敛到由地板瓷砖的消失点定义的(红色)消失线上。

论文指出:

‘虽然这些图像中的视角在局部上是一致的,但在全局上是不一致的。这种模式在25张合成的厨房图像中都被发现了。’

阴影法医

任何处理过光线追踪的人都知道,阴影也具有潜在的消失点,指示单一或多个光源。对于外部阴影,在强烈的阳光下,图像中的所有阴影都应该一致地收敛到单一的光源(太阳)。

与前面的实验类似,研究人员使用DALL-E 2生成了25张图像,使用提示“三个立方体在人行道上拍摄在晴天”和“三个立方体在人行道上拍摄在多云天”,以测试阴影的一致性。

上行,使用提示“三个立方体在人行道上拍摄在多云天”的图像;下行,使用提示“三个立方体在人行道上拍摄在晴天”的图像。

上行,使用提示“三个立方体在人行道上拍摄在多云天”的图像;下行,使用提示“三个立方体在人行道上拍摄在晴天”的图像。

研究人员注意到,当表示多云条件时,DALL-E 2能够以令人信服和合理的方式渲染相关的阴影,可能是因为这种类型的阴影在训练数据集中更为常见。

然而,在一些“晴天”照片中,作者发现了一些不一致的阴影,不能被单一光源解释。

对于上面的图像,生成的图像已被转换为灰度以提高清晰度,每个对象都有自己的“太阳”。

虽然平均观众可能无法发现这些异常,但一些生成的图像显示出更明显的“阴影失败”:

DALL-E 2中的反射

最令人震惊的结果出现在作者测试DALL-E 2创建高反射表面的能力时,这也是传统渲染算法(如光线追踪)中一个繁重的计算。

为了进行这个实验,作者使用DALL-E 2生成了25张图像,使用提示“玩具恐龙和其在梳妆镜中的反射的照片”。

在所有情况下,作者报告说,镜子中的渲染玩具恐龙与“真实”恐龙的方面和布局不一致。作者指出,这个问题对提示文本的变化具有抵抗力,似乎是系统中的一个基本弱点。

似乎有一些逻辑在这些错误中——顶行中的第一个和第三个例子似乎显示了一个非常好的复制,但不是镜像的恐龙。

作者评论:

‘与前面章节中的阴影和几何结构不同,DALL-E 2难以合成可信的反射,可能是因为这些反射在其训练图像数据集中较少见。’

这些故障可能会在未来的文本到图像模型中被消除,这些模型能够更好地审查其输出的整体语义逻辑,并能够对其场景施加抽象的物理规则,这些场景在一定程度上是从系统的潜在空间中构建的。

鉴于越来越大的合成架构的趋势,作者得出结论:

‘可能只是时间问题,绘图引擎将学会以全面的视角一致性渲染图像。然而,在那之前,几何法医分析可能会在分析这些图像中发挥作用。’

* 我将作者的内联引用转换为超链接。

最初发布于2022年6月30日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai