Anderson 视角

NeRF:Facebook 联合研发静态和动态视频合成

mm
将 Unite.AI 添加到您在 Google 上的首选来源

弗吉尼亚理工学院和州立大学与 Facebook 的合作解决了 NeRF 视频合成中的一个主要挑战:自由混合静态和动态图像和视频在神经辐射场(NeRF)输出中。

该系统可以生成可导航的场景,具有动态视频元素和静态环境,每个环境都在现场记录,但分离成虚拟环境的可控方面:

https://www.youtube.com/watch?v=j8CUzIR0f8M

此外,它从单个视点实现这一点,而无需多摄像头阵列,这种阵列会将此类计划绑定到工作室环境。

论文,题为 从动态单眼视频合成动态视图,并不是第一个开发单眼 NeRF 工作流的论文,但似乎是第一个同时训练时间变化和时间静态模型从相同输入,并生成一个框架,允许运动视频在“预映射”的 NeRF 区域内存在,类似于高预算 SF 外景中经常包含演员的虚拟环境。

超越 D-NeRF

研究人员基本上重现了动态 NeRF(D-NeRF)的多功能性,只使用一个视点,而不是 D-NeRF 使用的多个摄像头。为了解决这个问题,他们预测了向前和向后的场景流动,并使用这些信息开发了一个时空一致的变形辐射场。

由于只有一个视点,需要使用 2D 光流分析来获取参考帧的 3D 点。然后将计算出的 3D 点反馈到虚拟摄像机中,以建立一个与估计光流匹配的计算光流的“场景流动”。

在训练期间,动态元素和静态元素被调和成一个完整的模型作为单独的可访问方面。

通过包括深度顺序损失的计算和对 D-NeRF 中场景流动预测的严格正则化,运动模糊的问题得到了很大的缓解。

虽然这项研究在规范 NeRF 计算方面有很多贡献,并且极大地提高了单个视点输出的灵活性和便利性,但同样值得注意的是动态和静态 NeRF 元素的新颖分离和重新集成。

仅凭借一台相机,这种系统无法复制多摄像头阵列 NeRF 设置的全景视图,但它可以到处去,并且不需要一辆卡车。

NeRF – 静态还是视频?

最近我们看到了来自中国的一些令人印象深刻的 NeRF 研究,它可以将动态 NeRF 场景中捕获的元素分离出来,使用了 16 个摄像头。

ST-NeRF

ST-NeRF(上图)允许查看器重新定位个别元素在捕获的场景中,甚至可以调整它们的大小,改变它们的播放速率,冻结它们或反向运行。另外,ST-NeRF 允许用户“滚动”通过 16 个摄像头捕获的 180 度弧线的任何部分。

然而,ST-NeRF 论文 的研究人员在结论中承认,时间在这种系统下总是朝着某个方向运行,并且很难更改照明并将效果应用于实际上是视频的环境,而不是“静态映射”的 NeRF 环境,这些环境本身不包含移动组件,不需要作为视频捕获。

高度可编辑的静态 NeRF 环境

一个静态神经辐射场景,现在与任何运动视频段分离,更加容易以多种方式进行处理和增强,包括重新照明,如早些时候这个年份由 NeRV(神经反射和可见性场的重新照明和视图合成)提出,这提供了改变照明和/或 NeRF 环境或对象的纹理的初始步骤:

使用 NeRV 重新照明 NeRF 对象。来源:https://www.youtube.com/watch?v=4XyDdvhhjVo

使用 NeRV 重新照明 NeRF 对象。 来源:https://www.youtube.com/watch?v=4XyDdvhhjVo

NeRV 中的重新纹理化,甚至包括逼真的镜面效果。由于图像阵列的基础是静态的,因此以这种方式处理和增强 NeRF 方面比跨越一系列视频帧更容易,使初始预处理和最终训练更轻松、更容易。

NeRV 中的重新纹理化,甚至包括逼真的镜面效果。由于图像阵列的基础是静态的,因此以这种方式处理和增强 NeRF 方面比跨越一系列视频帧更容易,使初始预处理和最终训练更轻松、更容易。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai