Anderson 视角
谷歌的 LipSync3D 提供了改进的“深度伪造”嘴唇运动同步

谷歌 AI 研究人员和印度理工学院 Kharagpur 之间的合作提供了一个新的框架,用于从音频内容中合成说话头像。该项目旨在产生优化和合理资源的方式,从音频创建“说话头”视频内容,用于同步嘴唇运动到配音或机器翻译的音频,并用于角色、交互式应用程序和其他实时环境。

来源: https://www.youtube.com/watch?v=L1StbX9OznY
在此过程中训练的机器学习模型 – 称为 LipSync3D – 只需要一个目标面部身份的单个视频作为输入数据。数据准备管道将面部几何提取与输入视频的照明和其他方面的评估分离,允许更经济和更集中的训练。

LipSync3D 的两个阶段工作流程。上面,从“目标”音频生成动态纹理 3D 面部;下面,将生成的网格插入目标视频中。
实际上,LipSync3D 对该领域研究工作的最显著贡献可能是其照明归一化算法,该算法将训练和推理照明解耦。

从一般几何中分离照明数据有助于 LipSync3D 在具有挑战性的条件下产生更真实的嘴唇运动输出。其他近年来的方法仅限于“固定”照明条件,这不会揭示它们在这方面的更有限的能力。
在输入数据帧的预处理过程中,系统必须识别和删除镜面点,因为这些点特定于视频拍摄的照明条件,否则会干扰重新照明的过程。

LipSync3D,如其名称所示,不仅仅是在面部上执行像素分析,而是积极使用识别的面部标志来生成可移动的 CGI 风格网格,以及传统 CGI 管道中包裹在它们周围的“展开”纹理。

LipSync3D 中的姿势归一化。左边是输入帧和检测到的特征;中间是生成的网格评估的归一化顶点;右边是对应的纹理图集,它提供了纹理预测的真实值。 来源: https://arxiv.org/pdf/2106.04185.pdf
除了新颖的重新照明方法外,研究人员声称 LipSync3D 在以前的工作基础上有三个主要创新: 将几何、照明、姿势和纹理分离成归一化空间中的离散数据流;一个易于训练的自回归纹理预测模型,生成时间一致的视频合成;以及通过人工评分和客观指标评估的更高的真实度。

将视频面部图像的各个方面分离出来可以在视频合成中获得更大的控制力。
LipSync3D 可以直接从音频中推导出适当的嘴唇几何运动,通过分析音素和其他方面的语音,并将它们转换为已知的对应口部周围的肌肉姿势。

此过程使用一个联合预测管道,其中推断的几何和纹理在自编码器设置中具有专用编码器,但与要强加于模型的语音共享一个音频编码器:
LipSync3D 的易变运动合成也旨在为风格化的 CGI 角色提供动力,这本质上与真实世界图像相同,只是使用了网格和纹理信息:

风格化的 3D 角色,其嘴唇运动由源视频实时驱动。在这种情况下,通过个性化预训练可以获得最佳结果。
研究人员还预计使用具有更真实感的角色:
![]()
视频的样本训练时间从 3-5 小时不等,用于 2-5 分钟的视频,使用 TensorFlow、Python 和 C++ 在 GeForce GTX 1080 上进行训练。训练会话使用 128 帧的批次大小,训练 500-1000 个 epoch,每个 epoch 表示对视频的完整评估。
向动态重新同步嘴唇运动
重新同步嘴唇以适应新音频轨道的领域在过去几年中获得了大量的计算机视觉研究关注(见下文),尤其是作为有争议的 深度伪造技术 的副产品。
2017 年,华盛顿大学 提出了一项研究,能够从音频中学习嘴唇同步,并使用它来改变当时总统奥巴马的嘴唇运动。2018 年,马克斯·普朗克信息学研究所领导了 另一项研究计划,以实现身份到身份的视频转移,嘴唇同步是 该过程的副产品;2021 年 5 月,AI 初创公司 FlawlessAI 公布了其专有的嘴唇同步技术 TrueSync,在媒体上被广泛报道为一种能够改进主要电影发布的配音技术的 深度伪造技术。
当然,深度伪造开源存储库的持续开发为面部图像合成领域提供了另一个分支的活跃用户贡献研究。
nc 技术 TrueSync,在媒体上被广泛认为是改进主要电影发布的配音技术的深度伪造技术的推动者。当然,深度伪造开源存储库的持续开发为面部图像合成领域提供了另一个分支的活跃用户贡献研究。











