มุมมองของ Anderson
สู่การสร้างมนุษย์ AI ในแบบเรียลไทม์ด้วย Neural Lumigraph Rendering

尽管当前对神经辐射场(NeRF)的兴趣正在增加,但这种能够创建 AI 生成的 3D 环境和对象的技术仍需要大量的训练时间,并且缺乏能够实现实时、高响应界面的实现。
然而,行业和学术界的一些著名合作提供了对这一挑战的新视角(通常被称为新视角合成或 NVS)。
研究论文《神经光图渲染》声称,其性能比当前最先进的技术提高了两个数量级,代表了几步走向实时计算机图形渲染通过机器学习管道的进展。

神经光图渲染(右)提供了更好的混合伪影分辨率和改进的遮挡处理。 来源.
尽管论文只提到了斯坦福大学和全息显示技术公司 Raxium(目前处于隐身模式),但贡献者包括谷歌的一位主要机器学习架构师、Adobe的一位计算机科学家和 StoryFile 的首席技术官(最近因创建威廉·夏特纳的 AI 版本而登上头条)。
StoryFile似乎正在使用 NLR 在其新流程中创建交互式、AI 生成的实体,基于个人的特征和叙述。
StoryFile设想使用此技术在博物馆展览、在线交互式叙述、全息显示、增强现实(AR)和文化遗产记录中,并且似乎也在考虑NLR在招聘面试和虚拟约会应用中的潜在新应用。

StoryFile在线视频的拟议用途。 来源:https://www.youtube.com/watch?v=2K9J6q5DqRc
体积捕捉用于新视角合成接口和视频
体积捕捉的原理,在相关论文中,是使用机器学习从拍摄对象的静止图像或视频中“填充”未被原始相机阵列覆盖的视点的想法。

来源:https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf
在上面的图像中,来自Facebook 2019年AI研究(见下文),我们看到体积捕捉的四个阶段:多个相机获取图像/视频;编码器/解码器架构(或其他架构)计算和连接视图的相对性;射线行进算法计算体积空间中每个点的体素(或其他XYZ空间几何单位);以及(在最近的论文中)训练发生以合成可以在实时中操纵的完整实体。
这是一个常常需要大量数据和训练的阶段,到目前为止,这一直是新视角合成无法实现实时或高响应捕捉的原因。
新视角合成创建了体积空间的完整 3D 地图,这意味着将这些点连接成传统计算机生成网格相对简单,有效地捕捉和描述 CGI 人物(或其他相对有界的对象)实时。
使用 NeRF 的方法依赖于点云和深度图来生成捕捉设备的稀疏视点之间的插值:

NeRF 可以通过深度图的计算生成体积深度,而不是生成 CG 网格。 来源:https://www.youtube.com/watch?v=JuH79E8rdKc
虽然 NeRF 能够计算网格,但大多数实现不使用此功能来生成体积场。
相比之下,隐式可微分渲染器(IDR)方法,由威兹曼科学研究所于 2020 年 10 月发表,依赖于从捕捉阵列自动生成的 3D 网格信息:

IDR 捕捉转换为交互式 CGI 网格的示例。 来源:https://www.youtube.com/watch?v=C55y7RhJ1fE
虽然 NeRF 缺乏 IDR 的形状估计能力,但 IDR 不能匹配 NeRF 的图像质量,两者都需要大量资源来训练和收集(尽管最近在 NeRF 上的创新开始解决这个问题)。

NLR 的自定义相机支架,配备 16 个 GoPro HERO7 和 6 个中央 Back-Bone H7PRO 相机。为了实现“实时”渲染,这些相机至少以 60fps 运行。 来源:https://arxiv.org/pdf/2103.11571.pdf
相反,神经光图渲染利用 SIREN(正弦表示网络)将每种方法的优势融入其框架中,旨在生成直接可用于现有实时图形管道的输出。
SIREN 已被用于过去一年中类似的实现,现在代表了图像合成社区中业余爱好者 Colab 的热门 API 调用;然而,NLR 的创新之处在于将 SIREN 应用于二维多视图图像监督,这由于 SIREN 产生过拟合而不是泛化输出而具有挑战性。
在从阵列图像中提取 CG 网格后,网格通过 OpenGL 渲染,网格的顶点位置映射到相应的像素,然后计算各个地图的混合。
生成的网格比 NeRF 的更为泛化和代表性,需要更少的计算,并且不会对无法从中受益的区域(如光滑的面部皮肤)施加过多的细节:
在负面方面,NLR 目前还没有动态照明或重新照明的能力,输出仅限于捕获时获得的阴影图和其他照明考虑。研究人员计划在未来的工作中解决这个问题。
此外,论文承认,NLR 生成的形状不如某些替代方法(如《无序多视图立体视觉中的像素级视图选择》)准确,或威兹曼研究所提到的研究。
体积图像合成的崛起
使用神经网络从有限的照片系列中创建 3D 实体的想法早于 NeRF,具有远见的论文可以追溯到 2007 年或更早。在 2019 年,Facebook 的 AI 研究部门制作了一篇开创性的研究论文《神经体积:从图像中学习动态可渲染体积》,首次实现了对由机器学习基于体积捕捉生成的合成人类的响应式界面。

Facebook 的 2019 年研究使得可以为体积人创建响应式用户界面。 来源:https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/













