Anderson 视角

使用神经辐射场(NeRF)教机器人关于工具

mm
将 Unite.AI 添加到您在 Google 上的首选来源

密歇根大学的新研究提出了一种方法,允许机器人通过创建神经辐射场(NeRF)对象来理解工具和其他现实世界中关节对象的机制,这些对象展示了这些对象的移动方式,可能允许机器人与它们交互和使用它们,而无需耗时的专用预配置。

通过利用工具(或任何具有适当参考的对象)的内部运动性已知参考,NARF22可以合成工具和其运动范围及操作类型的照片现实近似。来源:https://progress.eecs.umich.edu/projects/narf/

通过利用工具(或任何具有适当参考的对象)的内部运动性已知参考,NARF22可以合成工具和其运动范围及操作类型的照片现实近似。来源:https://progress.eecs.umich.edu/projects/narf/

需要执行更多任务的机器人,例如避免行人或执行精心预编程的例行程序(这些程序可能需要大量标记和训练数据),需要这种适应能力,以便能够处理与我们相同的材料和对象。

到目前为止,机器人系统中存在几个障碍,包括可用数据集的匮乏,这些数据集通常只包含很少的对象;生成能够帮助机器人学习工具性和现实世界中3D模型的巨大费用;以及这些数据集的非照片现实性,使得对象看起来与机器人所感知的世界脱节,并训练机器人寻找永远不会出现的卡通式对象。

为了解决这个问题,密歇根大学的研究人员开发了一种两阶段流水线,用于生成具有“现实世界”外观的NeRF基于的关节对象,这些对象包含了任何特定关节对象的运动和限制。他们的论文题为《NARF22:用于配置感知渲染的神经关节辐射场》。

虽然看起来更复杂,但NARF22流水线的基本两个阶段涉及渲染移动工具的静态部分,然后将这些元素组合成一个第二个数据集,该数据集包含了这些部分的运动参数。来源:https://arxiv.org/pdf/2210.01166.pdf

虽然看起来更复杂,但NARF22流水线的基本两个阶段涉及渲染移动工具的静态部分,然后将这些元素组合成一个第二个数据集,该数据集包含了这些部分的运动参数。来源:https://arxiv.org/pdf/2210.01166.pdf

该系统称为《神经关节辐射场》- 或NARF22,以区别于另一个类似名称的项目。

NARF22

确定一个未知对象是否可能是关节对象需要大量的人类先验知识。例如,如果您以前从未见过一个关闭的抽屉,它可能看起来像任何其他类型的装饰面板 – 直到您实际打开它,您才会将“抽屉”作为一个具有单一轴运动(前后)的关节对象 internalize。

因此,NARF22不打算作为一个探索系统,用于拾取物体并查看它们是否具有可操作的移动部件 – 这种几乎像猿一样的行为将涉及一系列可能的灾难场景。相反,该框架基于知识,知识来自于《统一机器人描述格式》(URDF)- 一个广泛适用和适合该任务的开源XML格式。URDF文件将包含对象的运动参数,以及对象部分的描述和其他标记的方面。

在传统的流水线中,需要描述对象的关节能力,并标记相关的关节值。这不是一个廉价或容易扩展的任务。相反,NaRF22工作流程在“组装”每个静态组件之前渲染对象的个别组件,然后使用URDF提供的运动参数创建一个具有关节的NeRF基于表示。

在流程的第二阶段,创建了一个完全新的渲染器,包含了所有的部分。虽然可以更容易地在早期阶段连接个别部分并跳过后续步骤,但研究人员观察到,最终模型(在NVIDIA RTX 3080 GPU和AMD 5600X CPU下训练)在反向传播期间具有较低的计算需求,而不是过早和过于草率的组装。

此外,第二阶段模型的运行速度是连接和强制组装的两倍,而可能需要使用静态模型部分信息的任何次要应用程序都无需访问URDF信息,因为这些信息已经被纳入了最终阶段的渲染器中。

数据和实验

研究人员进行了多个实验来测试NARF22:一个用于评估每个对象配置和姿势的定性渲染;一个用于比较渲染结果与真实世界机器人看到的类似视图的定量测试;以及一个演示配置估计和6 DOF(深度)精化挑战,使用NARF22执行基于梯度的优化。

训练数据来自之前一些作者的早期论文中的《进展工具》数据集。《进展工具》包含大约六千个RGB-D图像(即包含深度信息,对机器人视觉至关重要),分辨率为640×480。使用的场景包括八种手工具,分为其组成部分,包括网格模型和对象的运动参数信息(即它们被设计为移动的方式及其运动参数)。

《进展工具》数据集包含四种关节工具。上面的图像是NARF22的NeRF基于渲染。

《进展工具》数据集包含四种关节工具。上面的图像是NARF22的NeRF基于渲染。

对于这个实验,使用了钳子、长鼻钳和夹子(见上图)训练了一个最终可配置模型。训练数据包含了夹子的一个配置和每个钳子的一个配置。

NARF22的实现基于《FastNeRF》,修改了输入参数以关注连接和空间编码的工具姿势。FastNeRF使用分解的多层感知器(MLP)配对 voxelized 采样机制(voxels 本质上是像素,但具有完整的3D坐标,因此可以在3D空间中操作)。

对于定性测试,研究人员观察到,有几个被遮挡的夹子部分(即无法通过观察对象而仅通过与其交互来了解的中心脊柱),该系统难以创建这种“未知”几何形状。

工具的定性渲染。

工具的定性渲染。

相比之下,钳子能够很好地推广到新颖的配置(即在URDF参数内但在训练材料中没有明确解决的部分的扩展和运动)。

研究人员观察到,钳子的标签错误导致了渲染质量的下降,特别是工具的详细尖端,这对渲染产生了负面影响 – 这是一个与计算机视觉研究领域中标签后勤、预算和准确性相关的更广泛问题,而不是NARF22流水线的程序缺陷。

渲染准确性测试结果。

渲染准确性测试结果。

对于配置估计测试,研究人员执行了从初始“刚性”姿势开始的姿势精化和配置估计,避免了FastNeRF本身使用的任何缓存或加速工作。他们然后训练了17个Progress Tools测试集的有序场景(这些场景在训练期间被保留),并运行了150次Adam优化器的梯度下降优化。根据研究人员的说法,这个过程“非常好”地恢复了配置估计。

配置估计测试结果。

配置估计测试结果。

 

首次发布于2022年10月5日。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai