Anderson 视角

面向实时AI人类的神经光图渲染

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Neural Lumigraph Rendering

尽管当前对神经辐射场(NeRF)的兴趣正在增加,NeRF是一种能够创建AI生成的3D环境和对象的技术,但这种新型图像合成技术仍需要大量的训练时间,并且缺乏能够实现实时、高响应界面的实现。

然而,行业和学术界的一些著名合作提供了对这一挑战的新思考(通常被称为新视图合成或NVS)。

研究论文《神经光图渲染》声称,其方法相比当前的最先进技术有了两个数量级的改进,代表了几步向实时CG渲染通过机器学习管道的进展。

神经光图渲染(右)提供了更好的混合伪影的分辨率和更好的遮挡处理。来源:https://www.youtube.com/watch?v=maVF-7x9644

神经光图渲染(右)提供了更好的混合伪影的分辨率和更好的遮挡处理。 来源

尽管论文的署名仅提到了斯坦福大学和全息显示技术公司Raxium(目前处于隐身模式),但贡献者包括谷歌的一位主要机器学习架构师、Adobe的一位计算机科学家和StoryFile的CTO(最近因创建威廉·夏特纳的AI版本而登上头条新闻)。

关于最近的夏特纳宣传活动,StoryFile似乎正在其新过程中使用NLR来创建交互式、AI生成的实体,基于个人的特征和叙述。

StoryFile设想这种技术可以应用于博物馆展示、在线交互式叙述、全息显示、增强现实(AR)和遗产文档,并且似乎还在考虑NLR在招聘面试和虚拟约会应用中的潜在新应用。

StoryFile在线视频的拟议用途。来源:https://www.youtube.com/watch?v=2K9J6q5DqRc

StoryFile在线视频的拟议用途。 来源:https://www.youtube.com/watch?v=2K9J6q5DqRc

用于新视图合成接口和视频的体积捕获

体积捕获的原理,在积累的论文中,是使用机器学习从拍摄对象的静止图像或视频中“填充”未被原始摄像机阵列覆盖的视点的想法。

来源:https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

来源:https://research.fb.com/wp-content/uploads/2019/06/Neural-Volumes-Learning-Dynamic-Renderable-Volumes-from-Images.pdf

在上面的图像中,来自Facebook 2019年AI研究(见下文),我们看到体积捕获的四个阶段:多个摄像机获取图像/视频;编码器/解码器架构(或其他架构)计算和连接视图的相关性;射线行进算法计算体积空间中每个点的体素(或其他XYZ空间几何单位);以及(在最近的论文中)训练发生以合成可以在实时中操作的完整实体。

这种通常广泛且数据密集的训练阶段一直以来都限制了新视图合成进入实时或高响应捕获的领域。

新视图合成创建了体积空间的完整3D地图,这意味着将这些点连接成传统的计算机生成网格相对简单,从而可以实时捕获和解释CGI人类(或其他相对有界的对象)。

使用NeRF的方法依赖于点云和深度图来生成捕获设备的稀疏视点之间的插值:

NeRF可以通过深度图的计算生成体积深度,而不是生成CG网格。来源:https://www.youtube.com/watch?v=JuH79E8rdKc

NeRF可以通过深度图的计算生成体积深度,而不是生成CG网格。 来源:https://www.youtube.com/watch?v=JuH79E8rdKc

虽然NeRF能够计算网格,但大多数实现不使用此方法来生成体积场。

相比之下,隐式可微渲染器(IDR)方法,由威兹曼科学研究所于2020年10月发表,利用3D网格信息自动从捕获阵列中生成:

IDR捕获转换为交互式CG网格的示例。来源:https://www.youtube.com/watch?v=C55y7RhJ1fE

IDR捕获转换为交互式CG网格的示例。 来源:https://www.youtube.com/watch?v=C55y7RhJ1fE

虽然NeRF缺乏IDR的形状估计能力,但IDR无法匹配NeRF的图像质量,两者都需要大量资源来训练和收集(尽管NeRF的最近创新开始解决这个问题)。

NLR的自定义相机支架,配备16个GoPro HERO7和6个中心Back-Bone H7PRO相机。为了实现“实时”渲染,这些相机至少以60fps运行。来源:https://arxiv.org/pdf/2103.11571.pdf

NLR的自定义相机支架,配备16个GoPro HERO7和6个中心Back-Bone H7PRO相机。为了实现“实时”渲染,这些相机至少以60fps运行。 来源:https://arxiv.org/pdf/2103.11571.pdf

相反,神经光图渲染利用SIREN(正弦表示网络)将每种方法的优势融入其框架中,旨在生成直接可用于现有实时图形管道的输出。

SIREN已被用于过去一年中类似的实现,现在代表了图像合成社区中Colab的流行API调用;然而,NLR的创新之处在于将SIREN应用于二维多视图图像监督,这由于SIREN产生过拟合而不是泛化输出而存在问题。

在从阵列图像中提取CG网格后,网格通过OpenGL进行光栅化,网格的顶点位置映射到相应的像素,然后计算各种贡献图的混合。

生成的网格比NeRF的更通用、更具代表性,需要更少的计算,并且不会对无法从中受益的区域(例如光滑的面部皮肤)施加过多的细节:

来源:https://arxiv.org/pdf/2103.11571.pdf

来源:https://arxiv.org/pdf/2103.11571.pdf

在负面方面,NLR目前尚无动态照明或重新照明的能力,输出仅限于在捕获时获得的阴影图和其他照明考虑。研究人员计划在未来的工作中解决这个问题。

此外,论文承认NLR生成的形状不如某些其他方法(如《像素级视图选择用于无结构多视图立体视觉》或之前提到的威兹曼研究所研究)准确。

体积图像合成的崛起

使用神经网络从有限的照片系列中创建3D实体的想法早于NeRF,具有远见的论文可以追溯到2007年或更早。在2019年,Facebook的AI研究部门制作了一篇开创性的研究论文《神经体积:从图像中学习动态可渲染体积》,这首次实现了对由机器学习基于体积捕获生成的合成人类的响应式界面。

Facebook 2019年的研究使得可以创建一个对体积人进行用户驱动的响应式界面。来源:https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

Facebook 2019年的研究使得可以创建一个对体积人进行用户驱动的响应式界面。 来源:https://research.fb.com/publications/neural-volumes-learning-dynamic-renderable-volumes-from-images/

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai