Anderson 视角

神经渲染: NeRF 在新鲜空气中漫步

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Google Research 与哈佛大学合作开发了一种新方法,利用 神经辐射场 (NeRF) 创建完整场景的 360 度神经视频。该新方法使 NeRF 更接近在任何环境中随意抽象使用,而不受限于 桌面模型 或 封闭室内场景。

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

请查看文章末尾获取完整视频。 来源: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 能够处理扩展的背景和诸如天空等‘无限’对象,因为与大多数之前的版本不同,它对光线的解释设置了限制,并创建了注意力边界,从而使原本冗长的训练时间变得合理。请查看本文末尾嵌入的新视频,以获取更多示例和对该过程的深入了解。

这篇新论文的标题为 Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields,由 Google Research 的高级研究科学家 Jon Barron 主导。

要理解这一突破,需要对基于神经辐射场的图像合成原理有基本的了解。

NeRF 是什么?

用‘视频’来描述 NeRF 网络并不恰当,因为它更接近于一个完全 3D 实现但基于 AI 的虚拟环境,在该环境中,单张照片(包括视频帧)的多个视角被用于拼接出一个场景,该场景在技术上仅存在于机器学习算法的潜在空间中——但可以随意提取出大量的视角和视频。

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

多个相机捕获点的示意图,这些点提供的数据被 NeRF 组装成神经场景(如右图所示)。

从贡献的照片中提取的信息被训练成一个矩阵,类似于 CGI 工作流中的传统 体素网格,因为 3D 空间中的每个点都会得到一个数值,从而使场景可导航。

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

传统体素矩阵将像素信息(通常存在于二维环境中,例如 JPEG 文件的像素网格)放入三维空间。 来源: ResearchGate

在计算照片之间的间隙(如有必要)后,每张贡献照片的每个可能像素的路径都会被有效地‘光线追踪’,并分配颜色值,包括透明度值(若没有该值,神经矩阵将完全不透明或完全为空)。

类似体素网格,而不同于基于 CGI 的 3D 坐标空间,‘封闭’对象的‘内部’在 NeRF 矩阵中并不存在。你可以把 CGI 鼓套打开来看内部,如果你愿意;但对 NeRF 来说,当其表面的不透明度值等于‘1’时,鼓套的存在就结束了。

像素的更广视角

Mip-NeRF 360 是对 2021 年 3 月的研究的扩展,该研究在不进行大量超采样的情况下有效地为 NeRF 引入了高效的抗锯齿技术。

NeRF 传统上只计算单一路径的像素,这容易产生早期互联网图像格式以及 早期游戏系统 中常见的 ‘锯齿’。这些锯齿边缘通常通过各种方法解决,通常涉及对相邻像素进行采样并求取平均表示。

由于传统 NeRF 只对单一路径的像素进行采样,Mip-NeRF 引入了一个‘圆锥形’捕获区域,类似宽束手电筒,能够提供足够的相邻像素信息,从而以更经济的方式实现抗锯齿并提升细节。

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

Mip-NeRF 使用的圆锥形捕获被切分为圆锥台(下图),随后进一步‘模糊’,形成模糊的高斯空间,可用于计算像素的精度和锯齿程度。 来源: https://www.youtube.com/watch?v=EpH175PY1A0

相较于标准 NeRF 实现的提升显著:

Mip-NeRF (right), released in 2021年3月, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF(右图),于 2021 年 3 月发布,通过更全面但经济的抗锯齿管线提供了更高的细节,而不是仅仅‘模糊’像素来避免锯齿。 来源: https://jonbarron.info/mipnerf/

NeRF 无界

3 月的论文在将 Mip-NeRF 应用于可能包含极远物体(包括天空)的无界环境时留下了三个未解决的问题。新论文通过对 Mip-NeRF 高斯分布应用卡尔曼式扭曲来解决这些问题。

其次,更大的场景需要更高的计算能力和更长的训练时间,Mip-NeRF 360 通过使用小型‘提议’ 多层感知器(MLP)‘提炼’场景几何,从而对大型标准 NeRF MLP 预测的几何进行预界定。这样可将训练速度提升三倍。

最后,更大的场景往往使解释后的几何离散化变得模糊,导致游戏画面出现‘撕裂’时玩家熟悉的那类伪影。新论文通过为 Mip-NeRF 光线区间创建新的正则化器来解决此问题。

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

右图显示由于对如此大场景进行界定困难,Mip-NeRF 出现了不希望的伪影。左图则显示新的正则化器已足够优化场景,消除了这些干扰。

欲了解新论文的更多信息,请观看下方视频,同时观看 2021 年 3 月的 Mip-NeRF 视频介绍。您也可以通过查看我们迄今为止的 NeRF 报道来获取更多 NeRF 研究信息。

最初发布于 2021 年 11 月 25 日
2021 年 12 月 21 日,12:25pm – 替换失效视频。 – MA

机器学习撰稿人,专注于人类图像合成的领域专家。曾任 Metaphysic.ai 的研究内容负责人,直至其并入 DNEG 的 Brahma.ai。
网站: martinanderson.ai
联系:martin@martinanderson.ai