AI 模型与平台

英特尔实验室通过两个新的人工智能模型推进计算机视觉开发

mm
将 Unite.AI 添加到您在 Google 上的首选来源

VI-Depth 1.0 和 MiDaS 3.1 开源人工智能模型提高了计算机视觉的深度估计能力。

深度估计是计算机视觉中的一项具有挑战性的任务,需要创建广泛的应用程序,包括机器人、增强现实(AR)和虚拟现实(VR)。现有的解决方案通常难以正确估计距离,这是帮助规划运动和避免障碍的关键方面。英特尔实验室的研究人员通过发布两个用于单ocular深度估计的人工智能模型来解决这个问题:一个用于视觉惯性深度估计,另一个用于强健的相对深度估计(RDE)。

最新的RDE模型,MiDaS版本3.1,仅使用单个图像作为输入即可预测强健的相对深度。由于其在大型和多样化的数据集上进行了训练,因此它可以在更广泛的任务和环境中高效地执行。MiDaS的最新版本通过其更大的训练集和更新的编码器骨架提高了RDE的模型准确性约30%。

MiDaS已被纳入许多项目中,特别是在Stable Diffusion 2.0中,它使得深度到图像的功能能够推断输入图像的深度,然后使用文本和深度信息生成新图像。例如,数字创作者 Scottie Fox 使用Stable Diffusion和MiDaS的组合创建了一个360度的VR环境。这种技术可能会导致新的虚拟应用,包括犯罪现场重建、医疗保健的治疗环境和沉浸式游戏体验。

虽然RDE具有良好的普遍性和有用性,但其缺乏尺度会降低其在需要度量深度的下游任务中的实用性,例如映射、规划、导航、对象识别、3D重建和图像编辑。英特尔实验室的研究人员通过发布VI-Depth来解决这个问题,VI-Depth是一个提供准确深度估计的人工智能模型。

VI-Depth是一个视觉惯性深度估计管道,它将单ocular深度估计和视觉惯性测量(VIO)相结合,以产生具有度量尺度的密集深度估计。这种方法提供了准确的深度估计,可以帮助场景重建、映射和对象操作。

将惯性数据纳入可以帮助解决尺度模糊性。大多数移动设备已经包含惯性测量单元(IMU)。全局对齐确定适当的全局尺度,而密集尺度对齐(SML)在本地运行,并将区域推向或拉向正确的度量深度。SML网络利用MiDaS作为编码器骨架。在模块化管道中,VI-Depth将数据驱动的深度估计与MiDaS相对深度预测模型以及IMU传感器测量单元相结合。数据源的组合使VI-Depth能够为图像中的每个像素生成更可靠的密集度量深度。

MiDaS 3.1VI-Depth 1.0 在GitHub上以开源MIT许可证提供。

有关更多信息,请参阅“Vision Transformers for Dense Prediction”和“Towards Robust Monocular Depth Estimation:Mixing Datasets for Zero-shot Cross-dataset Transfer”。

Daniel 是一个大力提倡人工智能最终将颠覆一切的人。他呼吸着技术,活着就是为了尝试新的小工具。