Anderson 视角

合成数据:使用侠盗猎车手填补遮挡缺口

mm
将 Unite.AI 添加到您在 Google 上的首选来源

伊利诺伊大学的研究人员创建了一个新的计算机视觉数据集,该数据集使用侠盗猎车手游戏引擎生成的合成图像来帮助解决语义分割中最棘手的障碍之一,即识别源图像和视频中仅部分可见的对象。

为此,研究人员使用侠盗猎车手V游戏引擎生成了一个合成数据集,该数据集不仅包含创纪录数量的遮挡实例,而且具有完美的语义分割和标签,并以其他开源数据集未解决的方式考虑时间信息。

完整场景理解

下面的视频作为研究的支持材料,展示了对场景进行完整3D理解的优势,即被遮挡的对象在所有情况下都是已知和暴露的,从而使评估系统能够学习将部分遮挡的视图与整个对象(标记)关联起来。

来源:http://sailvos.web.illinois.edu/_site/index.html

所得数据集称为SAIL-VOS 3D,据作者称,它是第一个具有帧级注释、实例级分割、场景视图的真实深度和由边界框标定的2D注释的合成视频网格数据集。

来源 (点击放大)

SAIL-VOS 3D的注释包括深度、实例级模态和非模态分割、语义标签和3D网格。数据包括484个视频,共237,611帧,分辨率为1280×800,包括镜头转换。

上图为原始CGI帧;第二行为实例级分割;第三行为非模态分割,展示了数据中可用的场景理解和透明度的深度。来源

上图为原始CGI帧;第二行为实例级分割;第三行为非模态分割,展示了数据中可用的场景理解和透明度的深度。 来源 (点击放大)

数据集分为6,807个片段,每个片段平均包含34.6帧,数据中有3,460,213个对象实例,来源于GTA-V游戏引擎中的3,576个网格模型。这些对象实例被分配到178个语义类别中。

网格重构和自动标注

由于后续的数据集研究可能会在真实世界图像上进行,因此SAIL-VOS 3D中的网格是由机器学习框架生成的,而不是从GTA-V引擎中派生出来的。

具有对整个场景表示的程序化和本质上‘全息’理解,SAIL-VOS 3D图像可以合成通常被遮挡的对象的表示,例如这里角色转身时的远侧手臂,以一种在真实世界图像中需要许多代表性实例的方式。来源:https://arxiv.org/pdf/2105.08612.pdf

具有对整个场景表示的程序化和本质上‘全息’理解,SAIL-VOS 3D图像可以合成通常被遮挡的对象的表示,例如这里角色转身时的远侧手臂,以一种在真实世界图像中需要许多代表性实例的方式。 (点击放大) 来源:https://arxiv.org/pdf/2105.08612.pdf

由于GTA-V世界中的每个对象都包含一个唯一的ID,SAIL-VOS使用GTA-V脚本钩子库从渲染引擎中检索这些ID。这解决了如果对象暂时离开视野,则重新获取对象的问题,因为标注是持久和可靠的。环境中有162个对象,研究人员将其映射到相应数量的类别中。

多样化的场景和对象

GTA-V引擎中的许多对象在自然界中很常见,因此SAIL-VOS库包含微软2014年经常使用的MS-COCO数据集中的60%的类别。

SAIL-VOS数据集包括在不同天气条件下的大量室内和室外场景,角色穿着多种服装。

SAIL-VOS数据集包括在不同天气条件下的大量室内和室外场景,角色穿着多种服装。 (点击放大)

适用性

为了确保与该领域一般研究的兼容性,并确认这种合成方法可以使非合成项目受益,研究人员使用MS-COCO和2012年PASCAL视觉对象类别(VOC)挑战赛中使用的帧级检测方法评估了数据集,平均精度为评估指标。

研究人员发现,在SAIL-VOS数据集上进行预训练可以将交并比(IoU)提高19%,同时在VideoMatch性能上从55%提高到74%的未见数据上取得相应的改进。

然而,在极端遮挡的情况下,旧方法仍然无法识别对象或人物,尽管研究人员预测,这可以通过检查相邻帧来确定非模态掩码的原因来解决。

在右侧两张图像中,传统的分割算法未能识别出女性人物的头部的很小一部分。后续的光流评估创新可能会改善这些结果。

在右侧两张图像中,传统的分割算法未能识别出女性人物的头部的很小一部分。后续的光流评估创新可能会改善这些结果。 (点击放大)

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai