AI 模型与平台

神经部件:分解原语以获得有意义的推理几何

mm
将 Unite.AI 添加到您在 Google 上的首选来源

近年来,能够从静态单个图像生成3D几何的系统已经变得普遍,但是它们获得的对象往往是“融合”在一起的,没有任何真正的语义模式来反映这些部分如何贡献于整体。

有很多很好的理由来生成具有有意义的部分划分的分层推理模型,包括工业分析、医学研究和成像应用、自动为视频游戏、模拟器和VR/AR环境生成几何、视觉特效骨骼绑定等。

近年来开发的许多方法,例如超二次曲面形状解析,产生的结果不太令人满意,并且难以超越立方体风格的指示性切割。

超二次曲面和其他方法提供的粗略或广义的子部分到推理图像。来源:https://www.youtube.com/watch?v=6WK3B0IZJsw

超二次曲面和其他方法提供的粗略或广义的子部分到推理图像。 来源:https://www.youtube.com/watch?v=6WK3B0IZJsw

然而,来自马克斯·普朗克研究所的新研究,题为《神经部件:使用可逆神经网络学习表达性3D形状抽象》,提供了一个新的神经原语3D表示系统,创建了语义上有用的部分。

以前的方法可以分解大型推理对象,但不是以语义上有用的方式。右边,神经部件方法创建更实用的碎片。来源:https://paschalidoud.github.io/neural_parts

以前的方法可以分解大型推理对象,但不是以语义上有用的方式。右边,神经部件方法创建更实用的碎片。 来源:https://paschalidoud.github.io/neural_parts

分割是通过可逆神经网络(INN)实现的,使用条件同胚来变形基本几何形状为原语,反之亦然,计算两者之间的拓扑层次结构。这样,每个原语形状都与一个可学习的原语嵌入相关联,以生成该原语的形状嵌入。

架构

神经部件需要在重构质量和原语完整性之间取得平衡,因为复杂的原语会使系统趋向于复杂的分解。因此,神经部件的架构被设计为以一种优雅的方式平衡这些相互矛盾的考虑。

神经部件架构由一个特征提取器组成,映射输入向量,并有一个条件同胚组件,学习由形状嵌入条件的同胚映射。

特征提取器的初始部分使用ResNet-18组件来提取特征图像。条件同胚组件使用一个实值非体积保持(实NVP)变换模块。

评估

该系统在三个数据集上进行了测试——2017年的动态FAUST(D-FAUST)、FreiHAND(2019)和斯坦福大学2015年的流行ShapeNet。D-FAUST包含38,640个以人为中心的网格,证明了比较的合适性,而FreiHAND的前5000个手势用于生成网格。对于ShapeNet,研究人员遵循斯坦福研究人员在2016年概述的相同类别特定训练。

测试是针对基于原语的方法进行的,包括超二次曲面、CvxNetH-SQs

在ShapeNet下,研究人员发现神经部件模型在5个和25个原语的水平上产生的重构比CvxNet更准确。数据库中的一些更简单的对象,例如椅子,缺乏足够的几何信息以进行有意义的分解。

对于FreiHAND,神经部件产生了更具几何准确性的重构,捕捉了拇指位置等细节。研究人员指出,与此相比,CvxNet和SQs更注重一般的核心结构,缺乏这些细节。

对于动态FAUST,CvxNet和SQs与使用五个原语来捕捉最初从数据中推断的人体完整性的神经部件的输出进行了比较。神经部件能够实现更平滑的分割,而不会牺牲拓扑的基本要素。

未来工作

研究人员打算通过使用可微渲染技术将神经部件扩展到不直接提供目标网格的研究。由于神经部件框架中当前使用的基本原语是球体,研究人员还正在考虑使用更复杂和更具表达力的几何原语。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai