Anderson 视角
一致的 AI 视频内容编辑与文本引导输入

虽然专业的 VFX 社区对新兴的图像和视频合成技术感到着迷,并且偶尔会感到有点威胁,但大多数基于 AI 的视频编辑项目缺乏时间连续性,这使得它们局限于“迷幻”领域,具有闪烁和快速变化的质地和结构,不一致的效果和类似于早期视觉效果技术的粗糙技术处理。
如果您想改变视频中非常具体的内容,而不是深度伪造(即,将新身份强加于现有的人物镜头),大多数当前的解决方案都受到严重的限制,尤其是在需要生产级别的视觉效果的精度方面。
一个例外是威兹曼科学研究所的一组学者在 2021 年提出的一个新方法,用于分解视频并将一致的内部映射——一个分层神经地图——叠加到合成输出中,包括 alpha 通道和时间上一致的输出。

来自 2021 年论文:源片段中的道路的完整遍历估计通过神经网络编辑,传统上需要大量的旋转和匹配移动。由于背景和前景元素由不同的网络处理,掩码是真正的“自动”生成的。来源:https://layered-neural-atlases.github.io/
虽然它与 VFX 管道中的光流有关,但分层地图在传统的 CGI 工作流中没有直接的等价物,因为它本质上是一个可以通过传统软件方法生成和编辑的“时间质地图”。
上述图中的“展开”地图仅代表个别解释帧;在任何目标视频帧中的一致变化都映射回原始帧,保留任何必要的遮挡和其他必要的场景效果,例如阴影或反射。
核心架构使用多层感知器(MLP)来表示展开的地图、alpha 通道和映射,这些都是在 2D 空间中优化的,不需要 NeRF 风格的 3D 几何点、深度图和类似的 CGI 风格的附加物。
可以可靠地改变个别对象的参考地图:

在 2021 年框架下移动对象的一致变化。来源:https://www.youtube.com/watch?v=aQhakPFC4oQ
基本上,2021 年的系统将几何对齐、匹配移动、映射、重新纹理和旋转掩码合并为一个离散的神经过程。
Text2Live
2021 年论文的三位原始研究人员与 NVIDIA 研究人员一起,为该技术开发了一种新的创新方法,结合了分层地图的力量和文本引导的 CLIP 技术,这种技术本周因 OpenAI 的 DALL-E 2 框架发布而再次受到关注。
新的架构,称为 Text2Live,允许最终用户根据文本提示创建对实际视频内容的局部编辑:


前景编辑的两个示例。为了获得更好的分辨率和定义,请查看原始视频:https://text2live.github.io/sm/pages/video_results_atlases.html
Text2Live 提供语义和高局部编辑,而无需预训练生成器,通过使用特定于正在编辑的视频片段的内部数据库来实现这一点。

Text2Live 下的背景和前景(对象)变换。来源:https://text2live.github.io/sm/pages/video_results_atlases.html
该技术不需要用户提供的掩码,例如传统的旋转掩码或绿幕工作流,而是通过 Tel Aviv 大学计算机科学学院和 Facebook AI 研究院(FAIR)2021 年的研究开发的自举技术来估计相关性地图。

通过基于转换器的通用注意力模型生成的输出地图。
新论文的标题是 Text2LIVE:基于文本的分层图像和视频编辑。原始 2021 年团队由 NVIDIA 研究的 Omer Bar-Tal 和 Yoni Kasten 加入。
架构
Text2Live 由一个接受单个输入图像和目标文本提示的生成器组成。一个在 4000 万个文本/图像对上预训练的 CLIP 模型提供了相关的视觉材料,可以从中解释用户输入的变换。

生成器接受一个输入图像(帧)并输出一个目标 RGBA 层,包含颜色和不透明度信息。然后将该层合成到原始镜头中,并进行额外的增强。
通过训练内部图像以使其与目标视频或图像相关,Text2Live 避免了将输入图像反转到生成对抗网络(GAN)的潜在空间的需要,这种做法目前对于生产视频编辑的要求来说还不够精确,或者使用更精确和可配置的扩散模型,但无法保持对目标视频的忠实度。

Text2Live 的基于提示的变换编辑。
以前的方法要么使用基于传播的方法,要么使用基于光流的方法。由于这些技术在某种程度上都是基于帧的,因此都无法创建输出视频中变化的一致时间外观。相比之下,神经分层地图提供了一个单一的空间来处理变化,这些变化可以保持对提交的变化的忠实度,当视频进展时。

没有“闪烁”或随机的幻觉:Text2Live 解释文本提示“生锈的吉普”,并将其应用于视频中的汽车的神经分层地图,而不是为每个解释帧重新开始变换。
Text2Live 更接近于在基于 AI 的合成方面取得突破,而不是在吸引了大量关注的文本到图像空间中,尤其是随着 OpenAI 的 DALL-E 框架第二代的发布(该框架可以将目标图像纳入变换过程,但仍然受到直接干预图像的限制,以及源训练数据的审查和过滤的限制,旨在防止用户滥用)。
相反,Text2Live 允许最终用户提取地图并在像 Photoshop 这样的像素级环境中对其进行一次编辑,然后将其反馈到正确的环境中,而不依赖于 3D 估计或基于 CGI 的方法。
此外,Text2Live 的作者声称,这是第一个在完全自动化的方式下实现蒙版和合成的可比框架。
首次发布于 2022 年 4 月 7 日。














