Anderson 视角

深度伪造的下一个革命:去耦合

mm
将 Unite.AI 添加到您在 Google 上的首选来源

计算机生成图像(CGI)数据增强正在被用于一个新项目中,以对深度伪造图像获得更大的控制权。虽然您仍然不能有效地使用CGI头部来填补深度伪造面部数据集中的缺失间隙,但一项新的研究浪潮正在进行,旨在将身份与上下文去耦合,这意味着您可能不需要这样做。

过去几年中最成功的深度伪造视频的创作者非常小心地选择他们的源视频,避免持续的侧面拍摄(即警察逮捕程序中流行的侧面特写),急剧的角度和不寻常或夸张的表情。越来越多的深度伪造视频都是编辑后的合集,选择“最容易”的角度和表情来进行深度伪造。

事实上,目标视频中最容易插入深度伪造的名人是原人物(其身份将被深度伪造所抹去)直接面对摄像机,表情最小的视频。

最近几年流行的深度伪造视频大多显示直接面对摄像机的对象,且表情有限(例如微笑),这些表情可以轻松从红毯拍照中提取,或者(如2019年对西尔维斯特·史泰龙的假造),理想情况下没有任何表情,因为中性表情非常常见,容易被深度伪造模型所接受。

最近几年流行的深度伪造视频大多显示直接面对摄像机的对象,且表情有限(例如微笑),这些表情可以轻松从红毯拍照中提取,或者(如2019年对西尔维斯特·史泰龙的假造),理想情况下没有任何表情,因为中性表情非常常见,容易被深度伪造模型所接受。

由于深度伪造技术(如DeepFaceLab和FaceSwap)在这些简单的交换中表现得很好,我们被它们所取得的成就所迷惑,以至于没有注意到它们的局限性,而且通常甚至不尝试超越这些局限性。

一段著名的深度伪造视频中,阿诺德·施瓦辛格被变成西尔维斯特·史泰龙——除非角度太棘手。侧面特写仍然是当前深度伪造方法的持久性问题,部分是因为用于定义深度伪造框架中面部姿势的开源软件不适用于侧面视图,但主要是因为必要的数据集中缺乏合适的源材料。来源:https://www.youtube.com/watch?v=AQvCmQFScMA

一段著名的深度伪造视频中,阿诺德·施瓦辛格被变成西尔维斯特·史泰龙——除非角度太棘手。侧面特写仍然是当前深度伪造方法的持久性问题,部分是因为用于定义深度伪造框架中面部姿势的开源软件不适用于侧面视图,但主要是因为必要的数据集中缺乏合适的源材料。来源:https://www.youtube.com/watch?v=AQvCmQFScMA

新研究来自以色列,提出了一种使用合成数据(如CGI头部)的新方法,以将深度伪造带入2020年代,通过真正地分离面部身份(即“汤姆·克鲁斯”的基本面部特征)与其上下文(即向上看向侧面看皱眉在黑暗中皱眉眉头紧皱闭眼等)。

新系统将姿势和上下文(即眨眼)与个体的身份编码分离,使用无关的合成面部数据(左图)。在顶行,我们看到一个“眨眼”被转移到巴拉克·奥巴马的身份上,通过一个GAN的潜在空间的非线性路径,这由左边的CGI图像表示。在下一行,我们看到拉长的嘴角被转移到前总统身上。底右,我们看到两个特征同时被应用。来源:https://arxiv.org/pdf/2111.08419.pdf

新系统将姿势和上下文(即眨眼)与个体的身份编码分离,使用无关的合成面部数据(左图)。在顶行,我们看到一个“眨眼”被转移到巴拉克·奥巴马的身份上,通过一个GAN的潜在空间的非线性路径,这由左边的CGI图像表示。在下一行,我们看到拉长的嘴角被转移到前总统身上。底右,我们看到两个特征同时被应用。来源:https://arxiv.org/pdf/2111.08419.pdf

这不是简单的深度伪造头部木偶,一种更适合于头像和部分面部唇部同步的技术,并且对于完整的深度伪造视频转换具有有限的潜力。

相反,这代表着一种前进的道路,用于从工具性(如改变头部角度创建皱眉)中分离身份,提供了一条通往高级而非“衍生”的图像合成基于的深度伪造框架的路径。

新论文的标题是Delta-GAN-Encoder:使用少量合成样本对图像进行显式编辑的语义变化编码,来自以色列理工学院的研究人员。

为了理解这项工作的意义,让我们来看看深度伪造是如何在从深度伪造色情网站到工业光魔(由于DeepFaceLab开源存储库目前在业余和专业深度伪造中都占据主导地位)等各个领域中产生的。

当前深度伪造技术的局限性是什么?

当前的深度伪造是通过训练一个编码器/解码器机器学习模型在两个面部图像文件夹上实现的——您想要“涂抹”的人(在前面的例子中,就是阿诺德)和您想要叠加到视频中的的人(史泰龙)。

两个面部数据集中的不同姿势和照明条件的示例。注意第三列最后一行的独特表情,不太可能在另一个数据集中找到相似的表情。

两个面部数据集中的不同姿势和照明条件的示例。注意第三列最后一行的独特表情,不太可能在另一个数据集中找到相似的表情。

编码器/解码器系统然后比较每个文件夹中的每个图像,维持、改进和重复此操作数十万次(通常需要一周),直到它充分理解两个身份的基本特征,以至于可以随意交换它们。

对于交换过程中的每个人,深度伪造架构学习到的身份信息是与上下文耦合的。它无法学习和应用关于一个通用姿势的原则,而是需要在训练数据集中为每个将参与面部交换的身份提供大量实例。

因此,如果您想交换两个身份,它们正在做一些比简单地微笑或直接面对摄像机更不寻常的事情,您将需要在两个面部数据集中为每个身份提供许多该姿势的实例。

由于面部身份和姿势特征目前紧密耦合,需要在两个面部数据集中对表达、头部姿势和(在一定程度上)照明进行广泛的对齐,以便在DeepFaceLab等系统上训练有效的深度伪造模型。两个面部数据集中某个特定配置(如侧面/微笑/日照)出现的次数越少,深度伪造视频中渲染的准确性就越低。

由于面部身份和姿势特征目前紧密耦合,需要在两个面部数据集中对表达、头部姿势和(在一定程度上)照明进行广泛的对齐,以便在DeepFaceLab等系统上训练有效的深度伪造模型。两个面部数据集中某个特定配置(如侧面/微笑/日照)出现的次数越少,深度伪造视频中渲染的准确性就越低。

如果数据集A包含不寻常的姿势,但数据集B缺少它,那么您基本上没有运气;无论您训练模型多长时间,它都无法学会很好地在身份之间复制该姿势,因为它在训练时只获得了所需信息的一半。

即使您拥有匹配的图像,也可能不够:如果数据集A包含匹配的姿势,但具有严酷的侧面照明,而数据集B中的相同姿势具有平坦的照明,交换的质量将不如在两个数据集中具有相同照明特征的情况下那么好。

为什么数据稀缺?

除非您经常被逮捕,否则您可能没有很多侧面特写照片。您可能会丢弃任何出现的侧面特写,因为图片机构也会这样做,所以侧面特写照片很难找到。

深度伪造者通常在面部数据集中包含多个副本有限的侧面特写数据,以便在训练过程中至少能得到一些关注和时间,而不是被丢弃为异常值

但是,可能的侧面面部照片类型远远超过可能在数据集中包含的数量——微笑皱眉尖叫哭泣黑暗照明轻蔑无聊高兴闪光照明向上看向下看睁眼闭眼……等等。任何这些姿势,在多种组合中,都可能在目标深度伪造视频中需要。

而这只是侧面特写。您有多少张自己向上看的照片?您是否有足够的照片来广泛代表您可能在特定姿势和摄像机角度下佩戴的10,000种可能的表情,涵盖至少部分的一百万种可能的照明环境?

您可能没有一张自己向上看的照片。而这只是需要的数百个角度中的两个。

即使能够生成面部的全部覆盖,从各个角度和照明条件下,也会产生一个过于庞大的数据集,无法训练,数量达到数十万张图片;即使可以训练,也会因为当前深度伪造框架的性质而丢弃大部分额外数据,转而关注有限的派生特征,因为这些框架是简化的,并且不太可扩展。

合成替代

自深度伪造出现以来,深度伪造者一直在尝试使用CGI风格的图像,使用3D应用程序(如Cinema4D和Maya)创建的头部来生成“缺失”的姿势。

不需要AI;一位女演员在传统的CGI程序Cinema 4D中使用网格和位图纹理被重现——这项技术可以追溯到20世纪60年代,尽管直到20世纪90年代才得到广泛应用。在理论上,这个面部模型可以用于生成深度伪造源数据,用于不寻常的姿势、照明风格和面部表情。然而,在现实中,由于CGI渲染的“假象”往往会渗透到交换的视频中,这种方法基本上是无用的。来源:https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

不需要AI;一位女演员在传统的CGI程序Cinema 4D中使用网格和位图纹理被重现——这项技术可以追溯到20世纪60年代,尽管直到20世纪90年代才得到广泛应用。在理论上,这个面部模型可以用于生成深度伪造源数据,用于不寻常的姿势、照明风格和面部表情。然而,在现实中,由于CGI渲染的“假象”往往会渗透到交换的视频中,这种方法基本上是无用的。来源:https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/

这种方法通常很快被新深度伪造实践者放弃,因为虽然它可以提供其他方式无法获得的姿势和表情,但CGI面部的合成外观通常会由于身份和上下文信息的耦合而渗透到交换中。

这可能导致在一个原本令人信服的深度伪造视频中突然出现“不真实的山谷”面部,因为算法开始使用它可能拥有的唯一数据来渲染不寻常的姿势或表情——明显的假面部。

在深度伪造者中最受欢迎的对象之一,澳大利亚女演员玛格特·罗比的3D深度伪造算法包含在DeepFaceLive的默认安装中,DeepFaceLive是可以在直播中(如网络摄像头会话)进行深度伪造的DeepFaceLab版本。CGI版本(如上图所示)可以用于在深度伪造数据集中获得不寻常的“缺失”角度。来源:https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace

在深度伪造者中最受欢迎的对象之一,澳大利亚女演员玛格特·罗比的3D深度伪造算法包含在DeepFaceLive的默认安装中,DeepFaceLive是可以在直播中(如网络摄像头会话)进行深度伪造的DeepFaceLab版本。CGI版本(如上图所示)可以用于在深度伪造数据集中获得不寻常的“缺失”角度。来源:https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace

CGI面部作为分离的概念性指南

相反,以色列研究人员的新Delta-GAN Encoder(DGE)方法更有效,因为CGI图像中的姿势和上下文信息已完全与目标的“身份”信息分离。

我们可以在下图中看到这一原理的应用,其中使用CGI图像作为指南获得了各种头部方向。由于身份特征与上下文特征无关,因此CGI面部的假象或其中所描绘的身份不会渗透到结果中。

使用新方法,您不需要找到三个单独的真实生活源图像来从多个角度执行深度伪造——您只需旋转CGI头部,其高级抽象特征将被施加到身份上,而不会泄露任何身份信息。

使用新方法,您不需要找到三个单独的真实生活源图像来从多个角度执行深度伪造——您只需旋转CGI头部,其高级抽象特征将被施加到身份上,而不会泄露任何身份信息。

Delta-GAN-Encoder。顶部左侧组:源图像的角度可以在一秒内更改以渲染新源图像,这将反映在输出中;顶部右侧组:照明也与身份分离,允许叠加照明风格;底部左侧组:多个面部细节被修改以创建“悲伤”的表情;底部右侧组:单个面部细节被修改,使眼睛眯起来。

Delta-GAN-Encoder。顶部左侧组:源图像的角度可以在一秒内更改以渲染新源图像,这将反映在输出中;顶部右侧组:照明也与身份分离,允许叠加照明风格;底部左侧组:多个面部细节被修改以创建“悲伤”的表情;底部右侧组:单个面部细节被修改,使眼睛眯起来。

这种身份和上下文的分离是在训练阶段实现的。新深度伪造架构的流水线寻找匹配要转换的图像的预训练生成对抗网络(GAN)的潜在向量——一种建立在2018年IBM人工智能研究部门项目基础上的Sim2Real方法论。

研究人员观察到:

‘只要有少量样本,样本之间只有特定属性的差异,就可以学习预训练的耦合生成模型的去耦合行为。没有必要使用真实世界的样本来达到这一目标,这在某些情况下可能是不现实的。 ‘

‘通过使用非真实的数据样本,可以利用编码的潜在向量的语义来实现相同的目标。可以在不需要显式探索潜在空间行为的情况下对现有数据样本应用所需的更改。’

研究人员预计,该项目中探索的去耦合的核心原理可以转移到其他领域,例如室内建筑模拟,并且该项目采用的Sim2Real方法最终可以使深度伪造工具仅基于草图而非CGI输入。

可以认为,新系统可能合成深度伪造视频的程度远不如该研究在将上下文与身份去耦合方面取得的进展那么重要,因为它在GAN的潜在空间上获得了更多的控制权。

去耦合是图像合成中一个活跃的研究领域;2021年1月,亚马逊领衔的研究论文展示了类似的姿势控制和去耦合,而2018年,中国科学院深圳先进技术研究所的一篇论文在生成GAN中的任意视点方面取得了进展。去耦合是图像合成中的一个活跃研究领域;在2021年1月,亚马逊领衔的研究论文展示了类似的姿势控制和去耦合,并且在2018年,中国科学院深圳先进技术研究所的一篇论文在生成GAN中的任意视点方面取得了进展。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai