Anderson 视角
深度伪造视频中的忠实度与真实度

并非所有深度伪造从业者都有相同的目标:图像合成研究领域的推动力——由Adobe、NVIDIA和Facebook等有影响力的支持者背后——是为了推进这一领域的艺术水平,使机器学习技术能够最终以高分辨率和在最具挑战性的条件下重现或合成人类活动(忠实度)。
相比之下,希望利用深度伪造技术传播虚假信息的人的目标是通过多种方法创建可信的真人模拟,而不仅仅是深度伪造面部的真实性。在这种情况下,辅助因素如背景和可信度几乎等同于视频模拟面部的潜力(真实度)。
这种“手法”方法延伸到深度伪造视频的最终图像质量的退化,使整个视频(而不仅仅是由深度伪造面部代表的欺骗部分)具有一个连贯的“外观”,该外观准确地反映了预期的媒体质量。
“连贯”并不意味着“良好”——只要质量在原始内容和插入的、篡改的内容中保持一致,并且符合预期,就足够了。就像Skype和Zoom这样的平台上的VOIP流媒体输出而言,质量标准可以非常低,包括卡顿、 jerky视频和一系列潜在的压缩伪影,以及旨在减少其影响的“平滑”算法——这些算法本身构成了额外的“不真实”效果,我们已经接受了这些效果作为直播的约束和怪癖的副产品。

DeepFaceLive在行动:该流媒体版本的顶级深度伪造软件DeepFaceLab可以通过以有限的视频质量呈现伪造品来提供上下文真实度,包括播放问题和其他反复出现的连接伪影。来源:https://www.youtube.com/watch?v=IL517EgYH8U
内置退化
的确,两种最流行的深度伪造软件包(都源自2017年的有争议的源代码)都包含旨在将深度伪造面部集成到“历史”或较低质量视频的背景下的组件。在DeepFaceLab中,bicubic_degrade_power参数实现了这一点,而在FaceSwap中,Ffmpeg配置中的“grain”设置也通过保留编码过程中的grain来帮助将假面部集成到非HQ视频内容中*。

FaceSwap中的“grain”设置有助于将假面部集成到非HQ视频内容和可能具有相对罕见的电影grain效果的旧内容中。
通常,深度伪造者不会输出完整的集成深度伪造视频,而是输出一系列带有alpha通道的PNG图像,每个图像只显示合成面部输出,因此可以在具有更复杂的“降级”效果功能的平台(如Adobe After Effects)中将图像流转换为视频,然后将假面部和真实元素组合在一起以创建最终视频。
除了这些故意的退化之外,深度伪造工作的内容经常被重新压缩, либо通过算法(社交媒体平台通过生成更轻的用户上传版本来节省带宽),例如在YouTube和Facebook等平台上, либо通过将原始作品处理为动画GIF、详细部分或其他具有不同动机的工作流程,这些工作流程将原始发布作为起点,并随后引入额外的压缩。
现实的深度伪造检测背景
考虑到这一点,瑞士的一篇新论文提出了改进深度伪造检测方法的方法论,通过教导检测系统学习深度伪造内容在故意退化的背景下的特征。

应用于新论文中使用的数据集之一的随机数据增强,包括高斯噪声、伽马校正和高斯模糊,以及JPEG压缩的伪影。来源:https://arxiv.org/pdf/2203.11807.pdf
在新论文中,研究人员认为,先进的深度伪造检测软件包依赖于不切实际的基准条件来评估其指标,并且“退化”的深度伪造输出可能低于检测的最低质量阈值,尽管其现实的“粗糙”内容可能会由于正确的背景关注而欺骗观众。
研究人员制定了一种新颖的“现实世界”数据退化过程,该过程成功地提高了领先的深度伪造检测器的普遍性,仅在原始“干净”数据上获得的检测率上损失了很小的准确率。他们还提供了一个新的评估框架,可以评估深度伪造检测器在现实世界条件下的鲁棒性,并支持广泛的消融研究。
这篇题为提高基于学习的深度伪造检测在现实条件下的新方法的论文来自瑞士洛桑的多媒体信号处理小组(MMSPG)和洛桑联邦理工学院(EPFL)的研究人员。
有用的混淆
将降级输出纳入深度伪造检测方法的先前尝试包括2018年麻省理工学院和FAIR的Mixup神经网络和2020年DeepMind和Google的AugMix,这两种数据增强方法都尝试以一种有利于泛化的方式“混淆”训练材料。
新研究的研究人员还指出之前的研究,这些研究将高斯噪声和压缩伪影应用于训练数据,以建立派生特征与其中嵌入的噪声之间的关系边界。
新研究提供了一种模拟成像和分发过程中损害条件的管道。通过将这种现实世界工作流程纳入评估框架中,可以生成对伪影更具抵抗力的深度伪造检测器的训练数据。

新方法的概念逻辑和工作流程。
退化过程被应用于两个用于深度伪造检测的流行且成功的数据集:FaceForensics++和Celeb-DFv2。此外,领先的深度伪造检测器框架Capsule-Forensics和XceptionNet也在两个数据集的变体上进行了训练。
检测器使用Adam优化器分别训练了25个和10个epoch。在数据集转换过程中,从每个训练视频中随机采样了100帧,并提取了32帧用于测试,然后添加了降级过程。
考虑的失真包括噪声,在六个不同的级别上应用零均值高斯噪声;重采样,模拟典型户外摄像头的降低分辨率,这可能会影响检测器;压缩,在数据上应用了不同级别的JPEG压缩;平滑,评估了三种常见的平滑滤镜;增强,调整了对比度和亮度;以及组合,同时将上述方法中的任何三种应用于单个图像。
测试和结果
在测试数据时,研究人员采用了三个指标:准确率(ACC);受试者操作特征曲线下面积(AUC);以及F1评分。
研究人员测试了标准训练版本的两个深度伪造检测器与变换数据,并发现它们的性能不佳:
“一般来说,大多数现实的失真和处理都对正常训练的基于学习的深度伪造检测器造成了极大的危害。例如,Capsule-Forensics方法在两个未压缩的FFpp和Celeb-DFv2测试集上表现出非常高的AUC评分,但在我们评估框架的修改数据上表现出急剧的性能下降。XceptionNet检测器也表现出类似的趋势。”
相比之下,两个检测器的性能通过训练变换数据得到了显著的提高,每个检测器现在都更能检测到未见的欺骗性媒体。
“数据增强方案显著提高了两个检测器的鲁棒性,同时在原始未修改的数据上保持了高性能。”

在研究中评估的两个深度伪造检测器上使用的原始和增强数据集的性能比较。
论文得出结论:
“当前的检测方法旨在在特定基准上实现尽可能高的性能。这通常会以牺牲对更现实的场景的泛化能力为代价。在本文中,我们提出了一个基于自然图像退化过程的精心设计的数据增强方案。”
“广泛的实验表明,这种简单但有效的技术显著提高了模型对各种现实的失真和图像处理操作的鲁棒性,在典型的图像处理工作流程中。”
* 生成面部中的grain是转换过程中样式转移的功能。
首次发布于2022年3月29日。于美国东部时间8:33 pm更新,以澄清Ffmpeg中的grain使用情况。












