Anderson 视角

新的、更简单的深度伪造方法超越了先前的方法

mm
将 Unite.AI 添加到您在 Google 上的首选来源

中国AI研究团队与美国研究人员之间的合作开发了可能是四年前深度伪造技术出现以来首次真正的创新。

这种新方法可以执行面部交换,优于所有现有的框架,在标准的感知测试中表现出色,无需耗时地收集和整理大量专用数据集,并训练它们长达一周,以适应单个身份。对于新论文中呈现的示例,模型在两个流行的名人数据集上进行了训练,使用一块NVIDIA Tesla P40 GPU,大约训练了三天。

全视频嵌入在本文末尾。来自新论文的补充材料中的一段视频样本,斯嘉丽·约翰逊的脸被转移到源视频上。CihaNet通过形成和执行源和目标身份之间的更深层次关系,消除了边缘遮罩的问题,意味着“明显的边界”和其他叠加故障的结束,这些故障在传统的深度伪造方法中经常出现。来源:https://mitchellx.github.io/#video

全视频可在本文末尾找到。 来自新论文的补充材料中的一段视频样本,斯嘉丽·约翰逊的脸被转移到源视频上。CihaNet通过形成和执行源和目标身份之间的更深层次关系,消除了边缘遮罩的问题,意味着“明显的边界”和其他叠加故障的结束,这些故障在传统的深度伪造方法中经常出现。来源:https://mitchellx.github.io/#video

这种新方法消除了将移植的身份粗糙地粘贴到目标视频中的需要,这种方法经常导致在假面结束和真实的底层面开始的地方出现可疑的伪影。相反,“幻觉地图”被用来执行视觉方面的更深层次的混合,因为该系统比当前方法更有效地将身份与上下文分离,因此可以在更深层次上混合目标身份。

来自论文。CihaNet变换通过幻觉地图(底行)实现。该系统使用上下文信息(即面部方向、头发、眼镜和其他遮挡等),全部来自将新身份叠加的图像,并且使用面部身份信息全部来自将被插入图像的人。将面部与上下文分离的这种能力对于系统的成功至关重要。来源:https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

来自论文。CihaNet变换通过幻觉地图(底行)实现。该系统使用上下文信息(即面部方向、头发、眼镜和其他遮挡等),全部来自将新身份叠加的图像,并且使用面部身份信息全部来自将被插入图像的人。将面部与上下文分离的这种能力对于系统的成功至关重要。来源:https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

有效地,新的幻觉地图为交换提供了更完整的上下文,而不是经常需要大量策划(在DeepFaceLab的情况下,还需要单独的训练)的硬遮罩,同时提供了有限的灵活性,以便真正地整合两个身份。

来自补充材料中使用FFHQ和Celeb-A HQ数据集的样本,跨VGGFace和Forensics++。前两列显示要交换的随机选择(真实)图像。接下来的四列显示使用当前最有效的四种方法交换的结果,而最后一列显示CihaNet的结果。FaceSwap存储库已被使用,而不是更流行的DeepFaceLab,因为两个项目都是2017年GitHub上原始Deepfakes代码的分支。虽然每个项目都添加了模型、技术、多样化的UI和补充工具,但使深度伪造成为可能的底层代码从未改变,并且仍然是两者共有的。来源:https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

论文题为《一阶段上下文和身份幻觉网络》,由与JD AI研究和马萨诸塞大学阿默斯特分校有关的研究人员撰写,并得到了中国国家重点研发计划(编号2020AAA0103800)的支持。该论文于10月20日至24日在中国成都举行的第29届ACM国际多媒体会议上发表。

无需“面对面”对齐

目前最流行的深度伪造软件DeepFaceLab和竞争对手FaceSwap,都需要进行繁琐且经常手动策划的工作流程,以确定面部朝向、障碍物等信息。

相比之下,CihaNet不需要两张图像直接面对摄像头才能从单张图像中提取和利用有用的身份信息。

在这些示例中,一套深度伪造软件竞争者面临着交换面部的任务,这些面部不仅身份不同,而且朝向不同。来自原始深度伪造存储库(如流行的DeepFaceLab和FaceSwap)的软件无法处理两个图像之间的角度差异(见第三列)。同时,CihaNet可以正确抽象身份,因为面部的“姿势”并不是身份信息的固有部分。

在这些示例中,一套深度伪造软件竞争者面临着交换面部的任务,这些面部不仅身份不同,而且朝向不同。来自原始深度伪造存储库(如流行的DeepFaceLab和FaceSwap)的软件无法处理两个图像之间的角度差异(见第三列)。同时,CihaNet可以正确抽象身份,因为面部的“姿势”并不是身份信息的固有部分。

架构

根据作者的说法,CihaNet项目的灵感来自2019年微软研究和北京大学的合作,称为FaceShifter,尽管它对旧方法的核心架构进行了一些显著和关键的更改。

FaceShifter使用两个自适应实例归一化(AdaIN)网络来处理身份信息,这些信息然后通过遮罩以类似于当前流行的深度伪造软件(及其相关限制)的方式转换到目标图像中,使用额外的HEAR-Net(包括一个单独训练的子网,训练用于遮挡障碍——一个额外的复杂性层)。

相反,新架构直接使用这种“上下文”信息来执行转换过程本身,通过两步单级级联自适应实例归一化(C-AdaIN)操作,提供ID相关区域的上下文的一致性(即面部皮肤和遮挡)。

系统中至关重要的第二个子网称为交换块(SwapBlk),它从参考图像的上下文和源图像的嵌入“身份”信息中生成一个集成特征,绕过了传统方法中必要的多个阶段。

为了帮助区分上下文和身份,对于每个级别生成一个幻觉地图,代替软分割遮罩,并作用于此关键深度伪造过程的更广泛的特征集。

随着幻觉地图(右图)值的增长,身份之间出现了更清晰的路径。

随着幻觉地图(右图)值的增长,身份之间出现了更清晰的路径。

通过这种方式,整个交换过程在单个阶段中完成,无需后处理。

数据和测试

为了测试该系统,研究人员在两个流行且多样化的开源图像数据集上训练了四个模型:CelebA-HQ和NVIDIA的Flickr-Faces-HQ数据集(FFHQ),每个数据集分别包含30,000和70,000张图像。

在这些基础数据集上没有进行任何修剪或筛选。在每种情况下,研究人员在单个Tesla GPU上训练了每个数据集的全部内容,训练时间为三天,学习率为0.0002,使用Adam优化器。

然后,他们渲染了一系列随机交换,这些交换是在数据集中呈现的成千上万个个体之间进行的,无论他们的面部是否相似,甚至是否同性别,并将CihaNet的结果与四个领先的深度伪造框架的输出进行了比较:FaceSwap(代表更流行的DeepFaceLab,因为它们共享一个根代码库,即2017年将深度伪造带到世界的原始存储库);上述FaceShifter;FSGAN;以及SimSwap

通过VGG-Face、FFHQ、CelebA-HQ和FaceForensics++比较结果,作者发现他们的新模型在所有先前的模型中表现出色,如下表所示。

评估结果使用的三个指标是结构相似性(SSIM)、姿势估计错误ID检索准确率,后者是根据成功检索的配对百分比计算的。

研究人员声称,CihaNet代表了一种更好的方法,具有更高的定性结果,并且是深度伪造技术的显著进步,通过消除广泛而耗时的遮罩架构和方法的负担,并实现身份与上下文的更有用和更直接的分离。

请查看下面的视频示例,以了解更多关于新技术的信息。您可以在这里找到完整的视频。

来自新论文的补充材料,CihaNet对各种身份执行面部交换。 来源:https://mitchellx.github.io/#video

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai