Anderson 视角

为什么当前的Deepfakes无法传达情感的细微差别

mm
将 Unite.AI 添加到您在 Google 上的首选来源
The Book of Boba Fett - Disney

昨天,星球大战衍生剧《波巴·费特之书》的第六集首播,似乎引发了粉丝们的两极分化。一般来说,人们认为对马克·哈米尔(Mark Hamill)进行去老化处理(与2020年在《曼达洛人》第二季结局中的前一次出现相比)的改进是工业光魔公司(Industrial Light and Magic)聘请业余深度伪造艺术家Shamook的结果;并且认为角色渲染一定是深度伪造技术和可能用CGI整理的结合。

目前没有太多证据支持这一说法,尽管Shamook自从与工业光魔公司签订合同后就没有对外发表过任何言论。尽管如此,这项工作相比2020年的CGI有了显著的改进,展现出了一些与从存档作品中派生的深度伪造模型相关的“光泽”;并且总体上符合当前深度伪造的最佳视觉标准。

粉丝们的另一个观点是,这个新的“年轻卢克”尝试有着与之前不同的缺陷。也许最能说明这一点的是,在长时间的序列中,新卢克天行者重现的缺乏表达性和微妙、恰当的情感,更典型的是深度伪造而非CGI;The Verge将《波巴·费特》模拟描述为“马克·哈米尔的不寒而栗、空白的1983年面容”。

无论《波巴·费特》中使用的新技术是什么,深度伪造转换都有一个与情感细微差别相关的基本问题,这个问题很难通过改变架构或改进源训练材料来解决,通常会通过深度伪造者在选择目标视频时的谨慎选择来避免。

面部对齐的局限性

最常用的两个深度伪造开源存储库是DeepFaceLab(DFL)和FaceSwap,两者都源自2017年的匿名和有争议的源代码,DFL在视觉特效行业中拥有巨大的领先优势,尽管其工具性有限。

每个包最初的任务是从源材料(即视频帧和/或静止图像)中提取面部特征。

阿德里安·布拉特的面部对齐网络(FAN)在行动,来自官方存储库。来源:https://github.com/1adrianb/face-alignment

面部对齐网络(FAN)在行动,来自官方存储库。 来源:https://github.com/1adrianb/face-alignment

两者都使用面部对齐网络(FAN)库。FAN可以为提取的面部创建2D和3D(见上图)特征。3D特征可以充分考虑面部的感知方向,直到极端的侧面和相对锐角。

然而,很明显,这些是非常基本的指南,用于引导和评估像素:

来自FaceSwap论坛的面部线条的大致指示。来源:https://forum.faceswap.dev/viewtopic.php?f=25&t=27

来自FaceSwap论坛的面部线条的大致指示。 来源:https://forum.faceswap.dev/viewtopic.php?f=25&t=27

最基本的面部线条是允许的:眼睛可以睁开和闭上,下巴也可以,嘴巴的基本配置(如微笑、皱眉等)可以被追踪和适应。面部可以在相机视角上旋转约200度。

但除此之外,这些是非常粗糙的界限,用于控制像素的行为;并且代表了整个深度伪造过程中唯一真正的数学和精确的面部指南。训练过程本身只是比较像素在这些边界内或附近的排列方式。

在DeepFaceLab中训练。来源:https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

在DeepFaceLab中训练。 来源:https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

由于没有面部子部分的拓扑结构(如脸颊的凸凹、老化细节、酒窝等),所以甚至无法尝试匹配源面部和目标面部之间的这些“细微”子特征。

处理有限的数据

在两个身份之间匹配数据以训练深度伪造并不容易。需要匹配的角度越不寻常,您可能需要在该角度匹配是否实际上具有相同的表情之间进行更多的妥协。

接近,但不是完全匹配。

接近,但不是完全匹配。

上面的例子中,两个身份相对来说很相似,但这是数据集可以接近的最接近的匹配。

仍然存在明显的差异:角度和镜头不完全匹配,照明也不匹配;主题A的眼睛没有完全闭上,不像主题B;图像质量和压缩比主题B要差;不知为何,主题B看起来比主题A更“高兴”。

但是,你知道的,这就是我们所拥有的,所以我们将不得不在此基础上进行训练。

由于这个A<>B匹配有这么多不寻常的元素,可以肯定数据集中没有类似的配对。因此,训练将要么“欠拟合”它,要么“过拟合”它。

违背常规

尽管深度伪造革命带来了将“经典”电影明星插入现代电影和电视的承诺,但人工智能无法回到过去并以更兼容的定义和质量拍摄他们的经典作品,这对于这种用例至关重要。

假设(并且为了我们的目的,这并不重要,如果它是错误的)《波巴·费特》中哈米尔的重现主要是训练有素的深度伪造模型的工作,那么该模型的数据集将需要利用拍摄时期的片段(即《绝地归来》制作期间的哈米尔,1981-83)。

这部电影是在Eastman Color Negative 250T 5293/7293胶片上拍摄的,这是一种当时被认为是中等到细粒的250ASA乳剂,但即使在1980年代末也被后来的胶片在清晰度、色彩范围和保真度方面超越。它是那个时代的产品,而且由于《绝地归来》的宏伟视野,即使对于主要演员来说,也很少有特写镜头,这使得颗粒问题更加关键,因为源面部只占据了部分画面。

哈米尔在《绝地归来》(1983年)中的几幕场景。

哈米尔在《绝地归来》(1983年)中的几幕场景。

此外,许多包含哈米尔的特效镜头都经过光学打印机处理,这增加了胶片颗粒。然而,访问卢卡斯影业档案(这些档案可能已经妥善保管了原始负片,并且可以提供数小时的额外未使用的原始镜头)可以解决这个问题。

有时,可以通过覆盖演员作品的多年时间来增加和多样化深度伪造数据集。在哈米尔的例子中,深度伪造者们因哈米尔在1977年的一次车祸后外貌的变化以及他在《绝地归来》之后几乎立即开始了他作为配音演员的第二职业生涯而受到限制,使得源材料相对匮乏。

情感范围有限?

如果您需要您的深度伪造演员来渲染场景,您将需要源镜头中包含异常广泛的面部表情。也许只有有限的、适合年龄的镜头可用,并且这些镜头中没有出现太多的表情。

例如,当《绝地归来》的故事弧线到来时,哈米尔的角色已经基本上掌握了他的情绪,这是原创系列神话中的一个基本发展。如果您从《绝地归来》的数据中创建一个哈米尔深度伪造模型,那么您将不得不使用哈米尔在那个时候的角色所要求的更有限的表情和不常见的面部姿势来工作,相比他在特许经营中的早期作品。

即使您考虑到《绝地归来》中有一些时刻,天行者角色处于压力之下,可以为更广泛的表情提供素材,但这些场景中的面部素材是短暂的,并且容易受到动作场景中典型的模糊和快速编辑的影响;因此,数据是相当不平衡的。

概括:情感的融合

如果《波巴·费特》中的天行者重现确实是一个深度伪造,那么针对它的一些批评——缺乏表达范围——并不是完全由于源材料有限。深度伪造的编码器-解码器训练过程正在寻找一个能够从成千上万张图像中提取中心特征的概括模型,并且可以尝试深度伪造一个在数据集中缺失或罕见的角度。

如果没有这种灵活性,深度伪造架构只会在每一帧的基础上复制和粘贴基本形态,而不会考虑时间适应或上下文。

然而,牺牲表达忠实度是这种多功能性的痛苦代价,任何“细微”的表达可能不是正确的。我们都像100件乐器一样演奏我们的脸,并且能够做到这一点,而深度伪造软件在很大程度上上缺乏其中至少一部分。

表情中的情感差异

面部运动及其对我们的影响在所有面部上都不是一种统一的语言;罗杰·摩尔的眉毛扬起可能看起来很无忧无虑,但在塞斯·罗根身上可能看起来就不那么成熟,玛丽莲·梦露的诱惑力可能会在深度伪造到一个最可用角色是“愤怒”或“失望”(例如奥布里·普拉扎在《公园与游憩》七季中的角色)的角色身上转化为更负面的情绪。

因此,A/B面部集之间的像素对像素等价性在这方面并没有太大的帮助;但这就是当前的深度伪造开源软件所提供的全部。

可能需要的是一种深度伪造框架,不仅可以识别表情和推断情绪,还具有体现高级概念(如“愤怒”、“诱惑”、“无聊”、“疲劳”等)的能力,并能够在每个面部身份中对这些情绪及其相关表情进行分类,而不是检查和复制嘴巴或眼睑的排列。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai