Anderson 视角

通往更好的 AI 视频编辑之路

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

视频/图像合成研究领域经常输出视频编辑架构,过去九个月,这类输出变得更加频繁。然而,大多数输出仅代表了对当前技术的渐进式改进,因为核心挑战是很大的。

然而,中国和日本之间的一项新合作本周产生了一些值得更仔细研究的例子,即使它不一定是一项开创性的工作。

在下面的视频中(来自论文的相关项目网站,可能会占用浏览器资源)我们可以看到,虽然系统的深度伪造能力在当前配置中不存在,但它可以很好地根据视频掩码(左下角)改变年轻女性的身份:

点击播放。 基于下左角的语义分割掩码,原来的(左上角)女人被转换成一个明显不同的身份,尽管这个过程没有实现提示中的身份交换。 来源:https://yxbian23.github.io/project/video-painter/ (请注意,在撰写本文时,这个自动播放和视频丰富的网站倾向于崩溃我的浏览器)。如果您可以访问,请参考源视频以获得更好的分辨率和细节,或者查看项目概述视频:https://www.youtube.com/watch?v=HYzNfsD3A0s

这种基于掩码的编辑在静态 潜在扩散模型 中已经很成熟,使用工具如 ControlNet。然而,在视频中保持背景一致性要困难得多,即使掩码区域为模型提供了创造性的灵活性,如下所示:

点击播放。 使用新的 VideoPainter 方法进行物种更改。请参考源视频以获得更好的分辨率和细节,或者查看项目概述视频:https://www.youtube.com/watch?v=HYzNfsD3A0s

该论文的作者将他们的方法与腾讯自己的 BrushNet 架构(我们去年曾报道过)以及 ControlNet 进行比较,后两者都具有可以隔离前景和背景生成的双分支架构。

然而,将这种方法直接应用于 OpenAI 的 Sora 提出的扩散变换器(DiT)方法会带来特定的挑战,如作者所述:

‘将 BrushNet 和 ControlNet 的架构直接应用于视频 DiT 会带来若干挑战。首先,鉴于视频 DiT 具有强大的生成基础且模型规模庞大,将整个或一半的视频 DiT 主干网络复制为上下文编码器既没有必要,在计算上也不可行。

‘其次,与 BrushNet 的纯卷积控制分支不同,由于全局注意力,DiT 掩码区域中的标记天然包含背景信息,因此很难在 DiT 主干网络中区分掩码区域和非掩码区域。

‘最后,ControlNet 无法在所有层中注入特征,妨碍了修复任务所需的精细背景控制。’

因此,研究人员开发了一种名为 VideoPainter 的插件式方法,采用双分支框架。

VideoPainter 提供了一个双分支视频修复框架,通过轻量级上下文编码器增强预训练的 DiTs。该编码器仅占主干网络参数的 6%,作者声称这使得该方法比传统方法更高效。

该模型提出三个关键创新:一个简化的两层上下文编码器,用于高效的背景指导;一个掩码选择性特征集成系统,用于分离掩码和非掩码标记;以及一个修复区域 ID 重采样技术,用于在长视频序列中保持身份一致性。

通过冻结预训练的 DiT 和上下文编码器,并引入一个 ID 适配器,VideoPainter 确保修复区域标记从以前的剪辑中持续存在,减少闪烁和不一致性。

该框架还设计为插件兼容,允许用户将其无缝地集成到现有的视频生成和编辑工作流中。

为了支持这项工作,该工作使用 CogVideo-5B-I2V 作为其生成引擎,作者策划了他们声称的迄今为止最大的视频修复数据集,名为 VPData,该数据集包含超过 390,000 个视频剪辑,总视频时长超过 886 小时。他们还开发了一个相关的基准框架,名为 VPBench

点击播放。 从项目网站的示例中,我们可以看到由 VPData 集合和 VPBench 测试套件提供的分割能力。请参考源视频以获得更好的分辨率和细节,或者查看项目概述视频:https://www.youtube.com/watch?v=HYzNfsD3A0s

这项新工作的标题是 VideoPainter:任何长度的视频修复和编辑,具有插件式上下文控制,来自腾讯 ARC 实验室、香港中文大学、东京大学和澳门大学的七位作者。

除了上述项目网站外,作者还发布了一个更易访问的 YouTube 概述 和一个 Hugging Face 页面

方法

VPData 的数据收集管道包括收集、注释、拆分、选择和字幕:

数据集构建流程图。来源:https://arxiv.org/pdf/2503.05639

数据集构建流程图。 来源:https://arxiv.org/pdf/2503.05639

用于此编译的源集合来自 VidevoPexels,最初收集了大约 450,000 个视频。

多个贡献库和方法组成了预处理阶段:Recognize Anything 框架用于提供开放集视频标记,任务是识别主要对象;Grounding Dino 用于检测已识别对象的边界框;Segment Anything Model 2(SAM 2)框架用于将这些粗略选择精炼为高质量的掩码分割。

为了管理场景转换并确保视频修复的一致性,VideoPainter 使用 PySceneDetect 来识别和分割剪辑在自然断点处,避免了跟踪同一对象从多个角度拍摄的破坏性转换。剪辑被分成 10 秒的间隔,任何短于 6 秒的剪辑都被丢弃。

对于数据选择,应用了三个筛选标准:美学质量,使用 Laion-Aesthetic Score Predictor 进行评估;运动强度,通过 光流 使用 RAFT 进行测量;以及 内容安全性,通过 Stable Diffusion 的 Safety Checker 进行验证。

现有的视频分割数据集的一个主要限制是缺乏详细的文本注释,这对于指导生成模型至关重要:

研究人员强调了同类数据集中缺少视频字幕。

研究人员强调了同类数据集中缺少视频字幕。

因此,VideoPainter 的数据策划过程纳入了多个领先的视觉语言模型,包括 CogVLM2Chat GPT-4o,以生成关键帧字幕和掩码区域的详细描述。

VideoPainter 通过引入一个自定义的轻量级上下文编码器来增强预训练的 DiTs,该编码器将背景上下文提取与前景生成分离,如下图右上角的示意图所示:

VideoPainter 的概念模式。VideoPainter 的上下文编码器通过 VAE 处理嘈杂的潜在变量、下采样的掩码和掩码视频潜在变量,将仅背景标记集成到预训练的 DiT 中以避免歧义。ID 重采样适配器通过在训练期间连接掩码区域标记并在推理期间从以前的剪辑中重采样它们来确保身份一致性。

VideoPainter 的概念模式。VideoPainter 的上下文编码器通过 VAE 处理嘈杂的潜在变量、下采样的掩码和掩码视频潜在变量,将仅背景标记集成到预训练的 DiT 中以避免歧义。ID 重采样适配器通过在训练期间连接掩码区域标记并在推理期间从以前的剪辑中重采样它们来确保身份一致性。

该编码器并未让主干网络承担冗余处理,而是采用简化的输入:一个嘈杂的潜在变量、一个掩码视频潜在变量(通过一个 变分自编码器 或 VAE 提取)和一个下采样的掩码的组合。

嘈杂的潜在变量提供了生成的上下文,而掩码视频潜在变量则与 DiT 现有的分布相一致,旨在提高兼容性。

而不是复制模型的大部分内容,VideoPainter 仅集成 DiT 的前两层。这些提取的特征以结构化的、分组方式重新引入到冻结的 DiT 中:早期特征告知模型的前半部分,而后期特征则完善了后半部分。

此外,一个标记选择机制确保仅重新集成背景相关的特征,防止掩码和非掩码区域之间的混淆。作者认为,这种方法使 VideoPainter 能够在背景保存中保持高保真度的同时提高前景修复的效率。

作者指出,他们的方法支持多种风格化方法,包括最流行的 低秩适应(LoRA)。

数据和测试

VideoPainter 使用 CogVideo-5B-I2V 模型和其文本到视频等效模型进行训练。VPData 集合以 480x720px 的分辨率和 1×10-5 的学习率进行训练。

ID 重采样适配器经过 2,000 步的训练,而上下文编码器经过 80,000 步的训练,两者都使用 AdamW 优化器。训练过程在两个阶段使用 64 个 NVIDIA V100 GPU 进行(尽管论文没有指定这些 GPU 是否具有 16GB 或 32GB 的 VRAM)。

对于基准测试,Davis 用于随机掩码,而作者自己的 VPBench 用于分割掩码。

VPBench 数据集包含物体、动物、人类、风景和多种任务,涵盖四个操作:添加删除更改交换。该集合包含 45 个 6 秒的视频和 9 个平均时长为 30 秒的视频。

使用了八个指标来评估该过程。对于掩码区域保存,作者使用了 峰值信噪比(PSNR);学习到的感知相似性度量(LPIPS);结构相似性指数(SSIM);以及 平均绝对误差(MAE)。

对于文本对齐,研究人员使用了 CLIP 相似性,既用于评估剪辑字幕和其感知内容之间的语义距离,也用于评估掩码区域的准确性。

为了评估输出视频的整体质量,使用了 Fréchet 视频距离(FVD)。

对于视频修复的量化比较,作者将他们的系统与之前的方法 ProPainterCOCOCOCog-Inp(CogVideoX)进行了比较。测试包括使用图像修复模型修复剪辑的第一帧,然后使用图像到视频(I2V)后端将结果传播到潜在混合操作中,与以色列一篇2023 年论文中提出的方法一致。

由于项目网站在撰写本文时并非完全功能性,并且项目相关的 YouTube 视频可能不包含项目网站中包含的所有示例,因此很难找到与论文中概述的结果非常具体的视频示例。因此,我们将显示论文中包含的静态结果,并以我们从项目网站提取的视频示例结束本文。

VideoPainter 与 ProPainter、COCOCO 和 Cog-Inp 在 VPBench(分割掩码)和 Davis(随机掩码)上的量化比较。指标涵盖掩码区域保存、文本对齐和视频质量。红色 = 最佳,蓝色 = 第二最佳。

VideoPainter 与 ProPainter、COCOCO 和 Cog-Inp 在 VPBench(分割掩码)和 Davis(随机掩码)上的量化比较。指标涵盖掩码区域保存、文本对齐和视频质量。红色 = 最佳,蓝色 = 第二最佳。

关于这些量化结果,作者评论说:

‘在基于分割的 VPBench 中,ProPainter 和 COCOCO 在大多数指标中表现最差,主要是因为它们无法修复完全掩码的对象,并且单网络架构难以平衡背景保存和前景生成。 ‘

‘在基于随机掩码的 Davis 基准测试中,ProPainter 利用部分背景信息取得了改善。然而,VideoPainter 凭借有效解耦背景保留与前景生成的双分支架构,在分割掩码(标准和长视频)及随机掩码测试中均取得了最佳性能。 ‘

作者随后给出了静态的定性测试示例,我们在下面展示其中一部分。在所有情况下,我们都建议读者访问项目网站和 YouTube 视频以查看更高分辨率的结果。

与以前框架中的修复方法的比较。

与以前框架中的修复方法的比较。

 

点击播放。 我们从项目网站的“结果”视频中连接的示例。

关于这个视频修复的定性轮次,作者评论说:

‘VideoPainter 一致地表现出在视频连贯性、质量和文本字幕对齐方面的出色结果。值得注意的是,ProPainter 因为它仅依赖于背景像素传播而不是生成,所以它无法生成完全掩码的对象。 ‘

‘虽然 COCOCO 展示了基本功能,但它无法在修复区域中保持一致的 ID(不一致的船只外观和突然的景观变化),这是由于它的单网络架构试图平衡背景保存和前景生成。 ‘

‘Cog-Inp 获得了基本的修复结果;然而,其混合操作无法检测掩码边界导致了显著的伪影。 ‘

‘此外,VideoPainter 可以生成超过一分钟的连贯视频,同时通过我们的 ID 重采样保持 ID 一致性。 ‘

研究人员还测试了 VideoPainter 增强字幕并获得改进结果的能力,将其与 UniEditDiTCtrlReVideo 进行比较。

与三个以前的方法的视频编辑结果比较。

与三个以前的方法的视频编辑结果比较。

作者评论说:

‘对于 VPBench 中的标准和长视频,VideoPainter 获得了最佳性能,甚至超过了端到端的 ReVideo。这一成功可以归因于其双分支架构,确保了出色的背景保存和前景生成能力,保持了非编辑区域的高保真度,同时确保了编辑区域与编辑指令紧密对齐,并通过修复区域 ID 重采样保持了长视频中的 ID 一致性。 ‘

虽然论文中以静态形式呈现了这些指标的定性示例,但这些示例并不是很有启发性,我们建议读者参考项目网站和 YouTube 视频中的各种视频示例。

最后,进行了一项人工研究,30 名用户被要求评估来自 VPBench 和编辑子集的 50 个随机生成的视频。这些示例突出了背景保存、提示对齐和视频质量。

VideoPainter 的用户研究结果。

VideoPainter 的用户研究结果。

作者指出:

‘VideoPainter 在所有评估标准中显著优于现有的基准,获得了更高的偏好率。 ‘

他们承认,VideoPainter 的生成质量取决于基础模型,这可能难以应对复杂的运动和物理;并且它在低质量掩码或不匹配的字幕方面也表现不佳。

结论

VideoPainter 似乎是文献中一个有价值的补充。然而,像最近的解决方案一样,它具有相当大的计算需求。另外,项目网站上选择用于展示的许多示例与最佳示例相差甚远;因此,看到这个框架与未来的条目和更广泛的以前方法进行比较将会很有趣。

本文结束前,需要注意的是,“视频编辑”在这里的意义上并不意味着“将多个片段组合成一个序列”,这是该术语的传统含义;而是指使用机器学习技术直接更改或以某种方式修改现有视频片段的内部内容。

首次发布于 2025 年 3 月 10 日。2026 年 7 月 25 日更新,以替换视频。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai