AI 模型与平台

研究人员使用深度学习将地标照片转换为4D

mm
将 Unite.AI 添加到您在 Google 上的首选来源

康奈尔大学的研究人员开发了一种新方法,利用深度学习将世界地标照片转换为4D。该团队依赖于公开的旅游照片,例如罗马的特雷维喷泉,并且最终结果是可以操控的3D图像,并且可以显示随时间变化的外观。

这种新方法可以处理和综合数万张未标记和未日期的照片,这是计算机视觉领域的一个重大进步。

这项工作被称为“Crowdsampling the Plenoptic Function”,并在虚拟的欧洲计算机视觉会议上发表,该会议于8月23-28日举行。

诺亚·斯纳维利(Noah Snavely)是康奈尔科技学院计算机科学副教授和论文的首席作者。其他贡献者包括康奈尔博士生郑琦(Zhengqi Li),论文的第一作者,以及艾比·戴维斯(Abe Davis),计算机科学助理教授和康奈尔科技学院博士生文琦(Wenqi Xian)。

“这是对场景建模的一种新方法,不仅可以让你移动头部并从不同角度看到喷泉,还可以控制时间的变化,”斯纳维利说。

“如果你真的去特雷维喷泉旅游,那么它的外观将取决于你去的时间——晚上,它将被底部的泛光灯照亮。在下午,它将被阳光照亮,除非你在多云的日子去,”他继续说。“我们从这些无序的照片集合中学习了所有外观的变化,基于时间和天气,这样你就可以探索所有变化并同时移动场景。”

传统计算机视觉的局限性

由于存在许多不同的质地需要被复制,因此传统计算机视觉很难通过照片准确地表示场景。

“现实世界的外观非常多样,有不同的材料——闪亮的东西,水,薄结构,”斯纳维利说。

除了这些障碍,传统计算机视觉还难以处理不一致的数据。全景函数是指某物从空间和时间的每个可能视点看起来的样子,但是要复制它,需要在场景中安装数百个网络摄像头。并且,它们需要在白天和晚上都进行录制。这可以做到,但当考虑到需要这种方法的场景数量时,这是一个非常耗资源的任务。

从其他照片中学习

为了绕过这个限制,研究团队开发了这种新方法。

“可能没有从这个确切视点在4点拍摄的照片在数据集中。所以我们必须从在一个位置拍摄的9点照片和在另一个位置拍摄的4:03照片中学习,”斯纳维利说。“并且我们不知道这些照片拍摄的时间。然而,使用深度学习可以让我们推断出在任何给定时间和地点,场景将会是什么样子。”

研究人员引入了一种新的场景表示,称为深度多平面图像,以便在四个维度(3D和随时间变化)中插值外观。

根据斯纳维利的说法,“我们使用与创建2D动画中的3D效果相同的想法来创建现实世界场景中的3D效果,通过将其拟合到游客照片中的所有这些不一致的测量值来创建这个深度多层图像。有趣的是,它有点源自于动画中使用的非常老的、经典的技术。”

研究表明,训练模型可以使用来自各个网站的50,000张公开可用的图像创建一个场景。该团队认为它可以在计算机视觉研究和虚拟旅游等领域产生影响。

“你可以真正感受到自己在那里,”斯纳维利说。“它在各种场景中都能令人惊讶地正常工作。”

该项目得到了前谷歌CEO和慈善家埃里克·施密特(Eric Schmidt)以及温迪·施密特(Wendt Schmidt)的支持。

(GOOGL )

https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title

Alex 负责 Unite.AI 的 AI 驱动新闻业务,融合新闻、研究和自动化,以支持对人工智能的及时且可扩展的报道。他的工作帮助确保新兴 AI 发展能够高效呈现,同时保持出版物的编辑标准。