AI 模型与平台

DynamiCrafter:使用视频扩散先验对开放域图像进行动画处理

mm
将 Unite.AI 添加到您在 Google 上的首选来源

计算机视觉 是人工智能社区中最令人兴奋和研究最广泛的领域之一,尽管计算机视觉模型得到了快速的增强,但开发人员仍然面临着一个长期存在的挑战,即图像动画。即使到今天,图像动画框架仍然难以将静态图像转换为显示自然动态的视频,同时保留图像的原始外观。传统上,图像动画框架主要关注自然场景的动画处理,例如人类头发或身体运动,或者随机动态,例如流体和云。虽然这种方法在一定程度上有效,但它限制了这些动画框架的适用性,尤其是在通用视觉内容方面。

此外,传统的图像动画方法主要集中在合成振荡和随机运动,或者针对特定对象类别进行定制。然而,这种方法的一个显著缺陷是,它们强加了这些方法的强假设,最终限制了它们的适用性,特别是在开放域图像动画等通用场景中。过去几年中,T2V 或文本到视频模型 已经在使用文本提示生成生动和多样化的视频方面取得了显著的成功,这也是 DynamiCrafter 框架的基础。

DynamiCrafter 框架是一种尝试克服当前图像动画模型的局限性并扩展其适用性到开放世界图像的通用场景。DynamiCrafter 框架尝试为开放域图像合成动态内容,将它们转换为动画视频。DynamiCrafter 的关键思想是将图像作为指导融入生成过程中,利用现有的文本到视频扩散模型的运动先验。对于给定的图像,DynamiCrafter 模型首先实现一个查询变换器,将图像投影到文本对齐的丰富上下文表示空间中,促进视频模型以兼容的方式消化图像内容。然而,DynamiCrafter 模型仍然难以保留一些视觉细节在生成的视频中,这是一个问题,DynamiCrafter 模型通过将图像与初始噪声连接并将其馈送到扩散模型中来克服,从而为模型提供更精确的图像信息。

本文旨在深入介绍 DynamiCrafter 框架,并探讨其机制、方法、架构以及与最先进的图像和视频生成框架的比较。让我们开始吧。

DynamiCrafter:开放域图像动画

动画静态图像通常为观众提供了一个引人入胜的视觉体验,因为它似乎让静态图像活了起来。多年来,众多框架已经探索了各种动画静态图像的方法。最初的动画框架实施了基于物理模拟的方法,专注于模拟特定对象的运动。然而,由于每个对象类别的独立建模,这些方法既无效又缺乏普遍性。为了复制更真实的运动,基于参考的方法出现了,它们从参考信号(如视频)传输运动或外观信息到合成过程中。虽然基于参考的方法与基于模拟的方法相比具有更好的时间一致性,但它们需要额外的指导,这限制了它们的实际应用。

近年来,大多数动画框架主要关注自然场景的动画处理,具有随机、域特定或振荡运动。虽然这些框架实施的方法在一定程度上有效,但它们生成的结果并不令人满意,仍有很大的改进空间。过去几年中,文本到视频生成模型 已经在使用文本提示生成生动和多样化的视频方面取得了显著的成功,这激发了 DynamiCrafter 框架的开发者利用文本到视频模型的强大生成能力进行图像动画。

DynamiCrafter 框架的关键基础是将条件图像纳入视频生成过程中,以控制 文本到视频扩散模型。然而,图像动画的最终目标仍然是一个非平凡的任务,因为图像动画需要保留细节和理解视觉上下文,以创建动态。然而,像 VideoComposer 这样的多模态可控视频扩散模型已经尝试过使用图像的视觉指导来生成视频。然而,这些方法不适合图像动画,因为它们要么导致突然的时间变化,要么由于其不够完善的图像注入机制而导致低视觉一致性。为了克服这个障碍,DynamiCrafter 框架提出了双流注入方法,包括视觉细节指导和文本对齐上下文表示。双流注入方法允许 DynamiCrafter 框架确保视频扩散模型以互补的方式合成保留细节的动态内容。

对于给定的图像,DynamiCrafter 框架首先将图像投影到文本对齐的上下文表示空间中,使用专门设计的上下文学习网络。更具体地说,上下文表示空间由一个可学习的查询变换器组成,以促进其适应扩散模型,并由一个预训练的 CLIP 图像编码器提取文本对齐的图像特征。然后,模型使用交叉注意力层和门控融合来组合这些文本特征。然而,这种方法用学习的上下文表示来交换文本对齐的视觉细节,从而促进图像上下文的语义理解,并允许合成合理和生动的动态。另外,为了补充额外的视觉细节,框架将全图像与初始噪声连接并馈送到扩散模型中。因此,DynamiCrafter 框架的双流注入方法保证了视觉一致性和合理的动态内容。

继续,扩散模型或 DM 已经在文本到图像生成中展示了显著的性能和生成能力。为了复制文本到图像模型的成功到视频生成中,提出了视频扩散模型(VDM),它使用空间时间分解的 U-Net 架构来模拟低分辨率视频。将文本到图像框架的知识转移到文本到视频框架中将有助于减少训练成本。虽然视频扩散模型可以生成高质量的视频,但它们仅接受文本提示作为唯一的语义指导,这可能不能反映用户的真实意图或可能是模糊的。然而,视频扩散模型的结果往往不符合输入图像,并且存在不现实的时间变化问题。DynamiCrafter 方法建立在文本条件的视频扩散模型上,利用它们的丰富动态先验来动画开放域图像。它通过纳入更好的语义理解和输入图像的符合性来实现这一点。

DynamiCrafter:方法和架构

对于给定的静态图像,DynamiCrafter 框架尝试将图像动画化,即生成一个短视频片段。视频片段继承了图像的视觉内容,并表现出自然的动态。然而,图像可能出现在生成的帧序列中的任意位置,这是一个在图像条件视频生成任务中具有高视觉一致性要求的特殊挑战。DynamiCrafter 框架通过利用预训练视频扩散模型的生成先验来克服这个挑战。

图像动态从视频扩散先验

通常,开放域文本到视频扩散模型以文本描述为条件显示动态视觉内容。为了使用文本到视频生成先验来动画化静态图像,框架应该首先以全面方式将视觉信息注入视频生成过程中。另外,对于动态合成,文本到视频模型应该消化图像以理解上下文,同时也应该能够在生成的视频中保留视觉细节。

文本对齐上下文表示

为了使用图像上下文来指导视频生成,DynamiCrafter 框架尝试将图像投影到一个对齐的嵌入空间中,以便视频模型以兼容的方式使用图像信息。然后,DynamiCrafter 框架使用图像编码器从输入图像中提取图像特征,因为文本嵌入是使用预训练的 CLIP 文本编码器生成的。现在,虽然 CLIP 图像编码器的全局语义标记与图像字幕对齐,但它主要代表视觉内容在语义层面,因此无法捕捉图像的全部内容。DynamiCrafter 框架实施了来自 CLIP 编码器最后一层的全视觉标记,以提取更完整的信息,因为这些视觉标记在条件图像生成任务中表现出高保真度。另外,框架使用上下文和文本嵌入与 U-Net 中间特征交互,使用双交叉注意力层。这种组件的设计促进了模型以层依赖的方式吸收图像条件的能力。

视觉细节指导

DynamiCrafter 框架使用富有信息的上下文表示,允许视频扩散模型在其架构中生成类似于输入图像的视频。然而,如下图所示,生成的内容可能由于预训练的 CLIP 编码器无法完全保留输入信息而显示一些差异,因为它是为对齐语言和视觉特征而设计的。

为了增强视觉一致性,DynamiCrafter 框架提议为视频扩散模型提供来自输入图像的额外视觉细节。为此,DynamiCrafter 模型将条件图像与每帧初始噪声连接并馈送到去噪 U-Net 组件中作为指导。

训练范式

DynamiCrafter 框架通过两个互补的流来集成条件图像,分别用于细节指导和上下文控制。为此,DynamiCrafter 模型采用三步训练过程

  1. 在第一步中,模型训练图像上下文表示网络。
  2. 在第二步中,模型将图像上下文表示网络适应文本到视频模型。
  3. 在第三步和最后一步中,模型联合训练图像上下文表示网络和视觉细节指导组件。

为了使图像信息与文本到视频(T2V)模型兼容,DynamiCrafter 框架建议开发一个上下文表示网络 P,旨在从给定的图像中捕获文本对齐的视觉细节。认识到 P 需要许多优化步骤才能收敛,框架的方法涉及首先使用更简单的文本到图像(T2I)模型来训练它。这一策略使上下文表示网络能够专注于学习图像上下文,然后通过联合训练 P 和 T2V 模型的空间层(而不是时间层)来与 T2V 模型集成。为了确保 T2V 兼容性,DynamiCrafter 框架合并输入图像与每帧噪声,然后对 P 和视频判别模型(VDM)的空间层进行微调。这种方法是为了保持 T2V 模型现有的时间见解的完整性,而不会受到密集图像合并的不利影响,这可能会损害性能并偏离我们的主要目标。此外,框架采用随机选择视频帧作为图像条件的策略,以实现两个目标:(i)避免网络开发可预测的模式,该模式直接将合并的图像与特定帧位置关联,并(ii)通过防止为任何特定帧提供过于僵化的信息来鼓励更适应性的上下文表示。

DynamiCrafter:实验和结果

DynamiCrafter 框架首先在稳定扩散模型上训练上下文表示网络和图像交叉注意力层。然后,框架用 VideoCrafter 替换稳定扩散模型,并进一步微调上下文表示网络和空间层以适应图像连接。推理时,框架采用 DDIM 采样器和多条件分类器自由指导。另外,为了评估视频在时间和空间域中合成的时间一致性和质量,框架报告了 FVD 或弗雷切视频距离,以及 KVD 或核视频距离,并评估了 MSR-VTT 和 UCF-101 基准测试中的零样本性能。为了调查生成结果和输入图像之间的感知一致性,框架引入了 PIC 或感知输入一致性,并采用了感知距离度量 DreamSim 作为距离函数。

下图演示了不同风格和内容的生成动画内容的视觉比较。

如可以观察到的那样,在所有不同的方法中,DynamiCrafter 框架很好地符合输入图像条件,并生成时间一致的视频。下表包含了 49 名参与者关于时间一致性(T.C)、运动质量(M.C)和视觉一致性(I.C)偏好率的统计数据。如可以观察到的那样,DynamiCrafter 框架在很大程度上优于现有的方法。

下图演示了使用双流注入方法和训练范式的结果。

最后的想法

在本文中,我们讨论了 DynamiCrafter,一种尝试克服当前图像动画模型的局限性并扩展其适用性到开放世界图像的通用场景的尝试。DynamiCrafter 框架尝试为开放域图像合成动态内容,将它们转换为动画视频。DynamiCrafter 的关键思想是将图像作为指导融入生成过程中,利用现有的文本到视频扩散模型的运动先验。对于给定的图像,DynamiCrafter 模型首先实现一个查询变换器,将图像投影到文本对齐的丰富上下文表示空间中,促进视频模型以兼容的方式消化图像内容。然而,DynamiCrafter 模型仍然难以保留一些视觉细节在生成的视频中,这是一个问题,DynamiCrafter 模型通过将图像与初始噪声连接并馈送到扩散模型中来克服,从而为模型提供更精确的图像信息。

Kunal Kejriwal 是一名专注于 Python、PostgreSQL、Redis 以及 GCP 和 AWS 上云基础设施的后端工程师。拥有三年构建和扩展生产系统的经验,他撰写关于 AI 基础设施、分布式系统以及部署机器学习工作负载背后架构的文章。