Anderson 视角
基于稳定扩散的新系统:实现时间一致的视频角色

阿里巴巴集团的一项新计划提供了我所见过的最好的方法之一,即从基于稳定扩散的基础模型生成全身人类角色。
这项名为 MIMO (MIMicking with Object Interactions)的系统使用了一系列流行的技术和模块,包括基于计算机生成图像(CGI)的人类模型和 AnimateDiff ,以实现视频中角色的时间一致性替换或驱动用户定义的骨骼姿势。
这里,我们看到从单个图像源中插值的角色,并由预定义的运动驱动:
[点击下面的视频播放]
从单个图像源中,三个多样化的角色由 3D 姿势序列(最左)使用 MIMO 系统驱动。 请参阅项目网站和附件的 YouTube 视频(嵌入在本文末尾)以获取更多示例和更高分辨率。 来源:https://menyifang.github.io/projects/MIMO/index.html
生成的角色也可以从视频帧和其他方式中获取,并可以集成到真实世界的镜头中。
MIMO 提供了一种新颖的系统,生成三个离散的编码,每个用于角色、场景和遮挡(即,抠图,当某个物体或人在被描绘的角色前方经过时)。这些编码在推理时集成。
[点击下面的视频播放]
MIMO 可以用照片级或风格化的角色替换原始角色,跟随目标视频的运动。请参阅项目网站和附件的 YouTube 视频(嵌入在本文末尾)以获取更多示例和更高分辨率。
该系统是在稳定扩散 V1.5 模型上训练的,使用研究人员自定义的数据集,数据集由真实世界和模拟视频组成。
基于扩散的视频的最大问题是 时间稳定性 ,即视频内容会闪烁或以不适合一致角色表示的方式“演化”。
MIMO 相反,有效地使用单个图像作为一致的指导,可以由中间的 SMPL CGI 模型编排和约束。
由于源参考是一致的,并且基础模型已经用足够的代表性运动示例增强,系统的时间一致性输出能力远远高于基于扩散的角色的一般标准。
[点击下面的视频播放]
更多由 MIMO 驱动的角色示例。请参阅项目网站和附件的 YouTube 视频(嵌入在本文末尾)以获取更多示例和更高分辨率。
单个图像被用作有效神经表示的源,或者以多模态方式与文本提示结合使用,变得更加普遍。例如,流行的 LivePortrait 面部转移系统也可以从单个面部图像中生成非常逼真的深度伪造面部 从单个面部图像。
研究人员相信,MIMO 系统中使用的原理可以扩展到其他和新颖的生成系统和框架中。
这篇 新论文 的标题是 MIMO:使用空间分解建模的可控角色视频合成 ,来自阿里巴巴集团智能计算研究所的四位研究人员。该工作有一个视频丰富的 项目页面 和一个附件的 YouTube 视频 ,也嵌入在本文末尾。
方法
MIMO 实现了自动和 无监督 分离上述三个空间组件,在端到端的架构中(即所有子过程都集成到系统中,用户只需要提供输入材料)。

MIMO 的概念架构。 来源:https://arxiv.org/pdf/2409.16160
源视频中的物体从 2D 翻译到 3D,最初使用单ocular 深度估计器 Depth Anything。帧中的人类元素使用 Tune-A-Video 项目的方法提取。
这些 特征 然后通过 Facebook Research 的 Segment Anything 2 架构翻译成基于视频的体积facet。
场景层本身是通过删除检测到的其他两个层中的物体获得的,有效地提供了一个自动的 rotoscope 风格的掩码。
对于运动,一个提取的 潜在代码 集用于人类元素,锚定到默认的人类 CGI 基础 SMPL 模型,其运动提供了渲染的人类内容的上下文。
人类内容的 2D 特征图 由一个 可微分光栅器 获得,该光栅器源自 NVIDIA 的 2020 年倡议 2020。将从 SMPL 获得的 3D 数据与 NVIDIA 方法获得的 2D 数据相结合,代表“神经人”的潜在代码与其最终上下文有着坚实的对应关系。
在这一点上,需要建立一个在使用 SMPL 的架构中常需要的参考——一个 规范姿势 。这与达芬奇的 ‘维特鲁威人’ 类似,因为它代表了一个零姿势模板,可以接受内容,然后被变形,带着它(有效地)纹理映射的内容。
这些变形,或“偏离规范”,代表了人类运动,而 SMPL 模型保留了构成提取的人类身份的潜在代码,因此代表了正确的角色姿势和纹理。

SMPL 人物中的规范姿势示例。 来源:https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
关于 纠缠 (训练数据可以变得不灵活,当你超出其训练范围和关联时)的问题,作者们指出*:
‘为了完全分离外观和姿势视频帧,理想的解决方案是从单ocular 视频中学习动态的人类表示,并将其从姿势空间转换到规范空间。
‘考虑到效率,我们采用了一种简化的方法,直接将姿势的人类图像转换为标准 A 姿势的规范结果,使用预训练的人类重姿模型。合成的规范外观图像被输入到 ID 编码器中以获得身份[代码]。
‘这种简单的设计使得身份和运动属性的完全分离成为可能。按照 Animate Anyone,ID 编码器包括一个 CLIP 图像编码器和一个参考网架构来嵌入全局和局部特征[分别]。’
对于场景和遮挡方面,使用一个共享和固定的 变分自编码器 (VAE – 在本例中源自 2013 年的 出版物)来嵌入场景和遮挡元素到潜在空间中。使用 2023 年 ProPainter 项目的 修复 方法来处理不一致性。
一旦组装和修复,这些分解的属性就会被输入到基于稳定扩散 V1.5 架构的 U-Net 主干中。完整的场景代码与主机系统的本地潜在噪声连接。人类组件通过 自注意力 和交叉注意力层分别集成。
然后, 去噪 结果通过 VAE 解码器输出。
数据和测试
为了训练,研究人员创建了一个名为 HUD-7K 的人类视频数据集,包含 5,000 个真实的人物视频和 2,000 个由 En3D 系统创建的合成动画。真实视频不需要注释,因为 MIMO 架构中的图像提取过程是非语义的。合成数据是完全注释的。
该模型在八个 NVIDIA A100 GPU(尽管论文没有指定这些是 40GB 或 80GB VRAM 模型)上训练,使用 24 个视频帧和批大小为四,训练 50 次,直到 收敛。
系统的运动模块在 AnimateDiff 的权重上训练。在训练过程中,VAE 编码器/解码器的权重和 CLIP 图像编码器被 冻结 (与完全 微调 相比,后者将对基础模型产生更广泛的影响)。
尽管 MIMO 没有与类似系统进行比较,但研究人员在来自 AMASS 和 Mixamo 的难以分配的运动序列上测试了它。这些运动包括攀爬、玩耍和跳舞。
他们还在野外的人类视频上测试了该系统。在两种情况下,论文报告了“高鲁棒性”用于这些未见的 3D 运动,从不同的视角来看。
尽管论文提供了多个静态图像结果来展示该系统的有效性,但 MIMO 的真正性能最好通过项目页面和 YouTube 视频(嵌入在本文末尾)中提供的广泛视频结果来评估。
作者得出结论:
‘实验结果[表明]我们的方法不仅可以实现灵活的角色、运动和场景控制,还可以实现任意角色、通用新 3D 运动和交互场景的高级可扩展性。
‘我们还[相信]我们的解决方案,考虑到固有的 3D 性质,并自动将 2D 视频编码为分层空间组件,可以激发未来 3D 感知视频合成研究。
‘此外,我们的框架不仅适合生成角色视频,还可以潜在地适用于其他可控视频合成任务。’
结论
看到一个基于稳定扩散的角色系统似乎具有如此高的时间稳定性,真是令人耳目一新 – 不仅因为高斯角色似乎在这个特定的研究领域占据了 高地。
结果中表示的风格化角色是有效的,虽然 MIMO 可以产生的照片级别目前还不如高斯斑点能够做到的,但在基于语义的潜在扩散网络(LDM)中创建时间一致的人类的多样优势是相当可观的。
* 我将作者的内联引用转换为超链接,并在必要时添加外部解释性超链接。
首次发布于 2024 年 9 月 25 日星期三












