Anderson 视角

使用机器学习重塑视频中的面部

mm
将 Unite.AI 添加到您在 Google 上的首选来源

中国和英国的研究合作开发了一种新的方法来重塑视频中的面部。这种技术可以实现令人信服的面部结构扩大和缩小,具有高一致性和无伪影。

从YouTube视频中提取的图像,女演员詹妮弗·劳伦斯出现在右侧,具有更为修长的面部特征。请参阅文章底部的视频以获取更多示例。来源:https://www.youtube.com/watch?v=tA2BxvrKvjE

从YouTube视频中提取的图像,女演员詹妮弗·劳伦斯出现在右侧,具有更为修长的面部特征。请参阅文章底部的视频以获取更多示例。来源:https://www.youtube.com/watch?v=tA2BxvrKvjE

这种转换通常仅通过传统的CGI方法实现,需要通过详细和昂贵的动作捕捉、骨骼绑定和纹理处理过程来完全重建面部。

相反,这种技术中的CGI部分被集成到一个神经管道中,作为参数化的3D面部信息,随后被用作机器学习工作流的基础。

传统的参数化面部正在被用作变形过程的指导。来源:https://arxiv.org/pdf/2205.02538.pdf

传统的参数化面部正在被用作变形过程的指导。来源:https://arxiv.org/pdf/2205.02538.pdf

作者表示:

‘我们的目标是通过编辑面部形状来生成高质量的肖像视频,模拟现实世界中的自然面部变形。这可以用于诸如美化和视觉效果等应用。’

尽管2D面部变形和扭曲自Photoshop问世以来就已被消费者使用(并导致了奇怪和经常不可接受的子文化的产生),但在视频中实现这一点而不使用CGI是一个具有挑战性的任务。

马克·扎克伯格的面部尺寸被扩大和缩小。

马克·扎克伯格的面部尺寸被扩大和缩小。

身体重塑目前是计算机视觉领域的一个热点研究领域,主要是由于其在时尚电子商务中的潜力,尽管使某人看起来更高或更有骨骼多样性目前是一个具有挑战性的任务。

同样,改变视频中头部的形状以一种一致且令人信服的方式,已经是新论文研究人员之前工作的主题,尽管该实现存在伪影和其他局限性。新的系统扩展了该先前研究的能力,从静态输出到视频输出。

新系统是在一台配备AMD Ryzen 9 3950X处理器和32GB内存的台式电脑上训练的,使用OpenCV的光流算法进行运动映射,并使用StructureFlow框架进行平滑;面部对齐网络(FAN)组件用于标志估计,也用于流行的深度伪造软件包;以及Ceres Solver来解决优化挑战。

新系统的极端面部扩张示例。

新系统的极端面部扩张示例。

论文题为《视频中肖像的参数化重塑》,由浙江大学的三位研究人员和巴斯大学的一位研究人员共同完成。

关于面部

在新系统中,视频被提取为图像序列,并首先估计每个面部的刚性姿势。然后,联合估计一系列后续帧以构建整个图像序列的一致身份参数(即视频帧)。

面部变形系统的架构流程。

面部变形系统的架构流程。

之后,表达式被评估,得出一个通过线性回归实现的重塑参数。然后,一个新颖的有符号距离函数(SDF)方法构建了面部线条在重塑前后的密集2D映射。

最后,在输出视频上执行内容感知变形优化。

参数化面部

该过程使用3D可变形面部模型(3DMM),一种越来越流行的神经和基于GAN的面部合成系统的辅助工具,也适用于深度伪造检测系统。

不是来自论文的3D可变形面部模型(3DMM)示例。来源:http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

不是来自论文的3D可变形面部模型(3DMM)示例。来源:http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

工作流程必须考虑遮挡的情况,例如当主题看向别处时。这是深度伪造软件的一个最大挑战,因为FAN标志对这些情况的容纳能力有限,且当面部转向或被遮挡时,质量会恶化。

新系统通过定义一个能够匹配3D面部(3DMM)和2D面部(由FAN标志定义)边界的轮廓能量来避免这一陷阱。

优化

这种系统的一个有用部署是实现实时变形,例如在视频聊天滤镜中。当前框架不支持这一点,所需的计算资源将使“实时”变形成为一个显著的挑战。

根据论文,假设目标是24帧每秒的视频,管道中的每帧操作代表每秒16.344秒的延迟,另外还有身份估计和3D面部变形的单次延迟(分别为321毫秒和160毫秒)。

因此,优化是降低延迟的关键。由于跨所有帧的联合优化会给过程增加严重的开销,而init式优化(假设说话者的身份在第一帧后保持一致)可能会导致异常,作者采用了稀疏模式来计算在实用间隔内采样的帧的系数。

然后在此子集的帧上执行联合优化,导致重建过程更加精简。

面部变形

该项目中使用的变形技术是作者2020年工作《深度形状肖像》(DSP)的改编。

深度形状肖像,2020年ACM多媒体会议提交的论文。来源:http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

深度形状肖像,2020年ACM多媒体会议提交的论文。来源:http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

作者观察到:
‘我们将这种方法从重塑单个单眼图像扩展到重塑整个图像序列。’

测试

论文指出,没有可比拟的先前材料来评估新方法。因此,作者将新方法的变形视频输出帧与静态DSP输出进行比较。

将新系统与静态图像进行比较。

将新系统与静态图像进行比较。

作者指出,DSP方法由于使用了稀疏映射而产生了伪影,这是一个新框架通过密集映射解决的问题。另外,论文声称,DSP生成的视频在https://youtu.be/tA2BxvrKvjE?t=110处展示了缺乏平滑性和视觉连贯性。

作者表示:

‘结果表明,我们的方法可以稳健地产生连贯的重塑肖像视频,而基于图像的方法容易导致明显的闪烁伪影。’

查看以下视频以获取更多示例:

最初发布于2022年5月9日。于东欧时间下午6点修改,SDF中的“field”改为“function”。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai