Anderson 视角

深度伪造的情感黎明

mm
将 Unite.AI 添加到您在 Google 上的首选来源

研究人员开发了一种新的机器学习技术,可以在视频中任意地将新情感强加于面部,利用最近出现的匹配唇部运动以适应外语配音的现有技术。

该研究是波士顿东北大学和麻省理工学院媒体实验室之间的合作,题为《可逆的皱眉:视频到视频的面部情感翻译》。虽然研究人员承认,初步结果的质量需要通过进一步的研究来改进,但他们声称,这种技术,称为Wav2Lip-Emotion,是第一个直接解决全视频表情修改的神经网络技术。

基础代码已经在GitHub上发布,尽管模型检查点稍后将添加到开源存储库中,作者承诺。

左边是源视频的“悲伤”帧,右边是“高兴”帧。在中间是两种初步方法来合成替代情感——上行:完全掩盖面部,整个表情表面都被替换;下行:更传统的Wav2Lip方法,只替换面部的下半部分。来源:https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

左边是源视频的“悲伤”帧,右边是“高兴”帧。在中间是两种初步方法来合成替代情感——上行:完全掩盖面部,整个表情表面都被替换;下行:更传统的Wav2Lip方法,只替换面部的下半部分。来源:https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

单个视频作为源数据

理论上,这些操作现在可以通过传统的深度伪造仓库(如DeepFaceLab或FaceSwap)来实现。然而,标准工作流程将涉及使用替代身份来替换“目标”身份,例如演员模仿目标,其自己的表情将被转移到另一个个体,同时也转移了整个表演。此外,通常需要深度伪造语音克隆技术来完成幻觉。

此外,在这些流行框架下,实际上改变源视频中target1>target1的表情将涉及改变面部对齐向量,以一种这些架构当前不支持的方式。

Wav2Lip-Emotion在转换相关表情的同时保持原始视频音频对话的唇部同步。

Wav2Lip-Emotion在转换相关表情的同时保持原始视频音频对话的唇部同步。

相反,Wav2Lip-Emotion旨在从视频的一部分“复制和粘贴”与情感相关的表情,并将其代入其他点,具有源数据的节俭性,旨在最终提供一种更低成本的表情操作方法。

离线模型可以稍后开发,训练在演讲者的替代视频上,这将消除需要任何一个视频包含一个“调色板”来操纵视频的表情状态。

潜在用途

作者建议了一些用于表情修改的应用,包括一个实时视频过滤器,以补偿创伤后心理压力综合征和面部麻痹患者的影响。论文观察到:

‘具有或不具有抑制面部表情的个体可能会从调整自己的表情中受益,以更好地适应他们的社会环境。一个人可能想要改变显示给他们的视频中的表情。演讲者可能在视频会议中对着对方大喊大叫,但仍然希望在不带有不愉快表情的情况下收集他们的交流内容。或者电影导演可能希望增强或减弱演员的表情。’

由于面部表情是意图的关键和核心指标,即使它可能与所说的话相矛盾,改变表情的能力也提供了一定程度的改变通信方式的能力。

先前的工作

对机器学习表情修改的兴趣可以追溯到2012年,当时Adobe、Facebook和罗格斯大学之间的合作提出了使用基于张量的3D几何重建方法来改变表情的方法,该方法劳动密集地将CGI网格叠加在目标视频的每一帧上,以实现更改。

2012年Adobe/Facebook研究通过将传统的、基于CGI的更改叠加在视频片段上来操纵表情。可以增强或抑制表情。来源:https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

2012年Adobe/Facebook研究通过将传统的、基于CGI的更改叠加在视频片段上来操纵表情。可以增强或抑制表情。来源:https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

虽然结果很有希望,但该技术很繁琐,所需的资源很多。在那时,CGI远远领先于直接特征空间和像素操作的计算机视觉方法。

与新论文更密切相关的是MEAD,一个数据集和表达生成模型,于2020年发布,能够生成“说话头”视频,尽管没有直接修改实际源视频的复杂性。

2020年SenseTime Research、卡内基梅隆大学和三所中国大学之间的MEAD表达生成。来源:https://wywu.github.io/projects/MEAD/MEAD.html

2020年SenseTime Research、卡内基梅隆大学和三所中国大学之间的MEAD表达生成。来源:https://wywu.github.io/projects/MEAD/MEAD.html

2018年,另一篇题为《GANimation:从单个图像生成解剖学感知的面部动画》的论文作为美西学术合作成果出现,使用生成对抗网络来增强或改变静止图像中的表情。

使用GANimation更改静止图像中的表情。来源:https://arxiv.org/pdf/1807.09251.pdf

使用GANimation更改静止图像中的表情。来源:https://arxiv.org/pdf/1807.09251.pdf

Wav2Lip-Emotion

相反,新项目基于Wav2Lip,该项目在2020年因提供一种潜在的方法来重新同步唇部运动以适应新语音(或歌曲)输入而引起了关注,该输入在原始视频中不存在。

原始Wav2Lip架构是在BBC档案中的口语句子语料库上训练的。为了将Wav2Lip适应表情修改任务,研究人员在上述MEAD数据集上“微调”了架构。

MEAD由60个演员阅读相同的句子同时表演各种面部表情的40小时视频组成。演员来自15个不同的国家,提供了一系列国际特征,旨在帮助该项目(及其衍生项目)产生可应用和普遍的表情合成。

在研究时,MEAD仅发布了数据集的第一部分,包含47个个体表演的表情,如“愤怒”、“厌恶”、“恐惧”、“轻蔑”、“高兴”、“悲伤”和“惊讶”。在这次新的尝试中,研究人员将项目的范围限制为叠加或改变感知的情感“高兴”和“悲伤”,因为这些是最容易被识别的。

方法和结果

原始Wav2Lip架构仅替换面部的下半部分,而Wav2Lip-Emotion也尝试使用全脸替换掩码和表情合成。因此,研究人员需要修改内置的评估方法,因为这些方法不是为全脸配置设计的。

作者通过保留原始音频输入、保持唇部运动的一致性来改进原始代码。

生成器元素包括身份编码器、语音编码器和面部解码器,按照早期工作的规定。语音元素被编码为堆叠的2D卷积,然后连接到它们的帧/中。

除了生成元素,修改后的架构还具有三个主要的辨别器组件,针对唇部同步的质量、情感目标元素和对抗训练的视觉质量目标。

对于全脸重建,原始Wav2Lip工作中没有先例,因此模型从头开始训练。对于下半脸训练(半掩码),研究人员从原始Wav2Lip代码中包含的检查点开始。

除了自动评估,研究人员还使用半自动服务平台提供的众包意见。工人通常对输出的识别超级表情的能力进行了高度评价,但只对图像质量进行了“中等”评估。

作者建议,除了通过进一步的改进来提高生成的视频质量外,未来的工作可能包括更广泛的表情,并且该工作也可以在未来应用于标记或自动推断的源数据和数据集,导致最终形成一个真实的系统,其中情感可以根据用户的意愿进行调节,或者最终用原始源视频的对比情感替换。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai