访谈
Fyusion 首席执行官兼联合创始人 Radu Rusu – 采访系列

Radu Rusu 是 Fyusion 的首席执行官兼联合创始人,Fyusion 是一家致力于构建新型、视觉效果惊人的 3D 技术的公司,旨在使用人工智能解决复杂的视觉问题。他们共同开发并获得了一种新型文件格式的专利,称为 .fyuse,允许人们使用智能手机捕获惊人的 3D 图像,引起了社交媒体的轰动效应,并吸引了超过 1 亿用户通过消费者移动应用程序。
您从 2012 年开始从事 3D 技术的研究,目前您是 Open Perception, Inc. 的总裁兼首席执行官。您能否分享这个非营利组织的使命宣言?
我在 2000 年初开始了我的 3D 数据处理职业生涯,当时我正在进行研究生学习,我脑海中有一个想法,就是让机器人从视觉角度更好地看到和理解世界。这让我花了大约十年的时间进行机器人相关的 3D 计算机视觉研究,并在 2010 年初,我意识到我所做的工作可以应用于更广泛的问题。Open Perception 是从 Willow Garage 分拆出来的,并接管了我们的 BSD 许可的开源项目——点云库(PCL)项目,并继续推动其发展。Open Perception, Inc. 于 2012 年 4 月在加利福尼亚州注册成立,作为一个独立的组织,旨在支持开源软件的开发、分发和采用,用于 2D/3D 感知数据的处理,应用于研究、教育和产品开发。
2014 年,您成为 Fyusion, Inc. 的联合创始人兼首席执行官。您能否分享 Fyusion, Inc. 的创立故事?
在从事机器人研究期间,Fyusion 的联合创始人和我意识到瓶颈不再是算法,而是数据格式。机器学习在许多领域已经达到峰值,因为我们使用的数据类型,尤其是视觉格式,是二维的(如照片和视频),而世界是三维的。我们认为,有可能通过在机器学习平台中利用 3D 数据来改变人们理解世界的方式。
2014 年,我们决定创建一种新型的 3D 数据,通过计算机视觉和机器学习软件生成,通过融合多个数据源,并使用我们口袋中的极其可扩展的商品硬件——即我们的智能手机。
我们创立了 Fyusion,旨在构建新型、视觉效果惊人的 3D 技术,能够让每个人使用人工智能解决复杂的视觉问题。
我们共同开发并获得了一种新型文件格式的专利,称为 .fyuse,允许人们使用智能手机捕获惊人的 3D 图像。它立即引起了社交媒体的轰动效应,并吸引了超过 1 亿用户通过消费者移动应用程序。
最初是什么吸引您去重新定义 3D 技术的含义,以应用于消费者应用程序?
我们只是意识到没有人曾经在大规模上解决过这个问题。这是一个未解决的问题。就像在我们的博士生涯中一样,令我们兴奋的东西是真正复杂的问题,别人说不能解决。
在这种情况下,他们在某种程度上是正确的。解决这个问题所需的算法只是部分被思考过,而运行它们所需的硬件不存在,尤其是在智能手机等边缘设备上。我们实际上不得不等到 iPhone4S 发布,这样我们才能在智能手机上运行实时 3D 计算机视觉代码,因为在那之前,iPhone 只有一个 CPU 核心。一旦我们开始看到智能手机硬件可以做什么,我们就非常感兴趣地将我们的计算机视觉和机器人研究专业知识应用于这些小型摄像头和 CPU/GPU 上。花了一段时间回到绘图板上,重新思考如何实现光场捕获和处理,全部通过软件。 一旦我们看到它的工作原理,Fyusion 就开始运作了。
我们过去有 2D 照片的模拟形式,然后它们只是被数字化,就像其他一切一样。我们在 3D 世界中唯一的大规模实现是“三角网格加纹理”(例如 OBJ 类型的文件格式),它来自计算机游戏和计算机图形学,旨在表示游戏中的人工创建的对象。它们严重依赖于完美的几何形状,这是无法获得的——如何使用相机捕获和表示水作为三角网格加纹理?什么关于透明物体?树叶?远处的物体?等等…
很明显,需要有人解决消费者友好 3D 格式的需求。它必须基于一个完全不同的范式,以“3D 图像渲染”的方式解决(即光场),并包含在捕获时可用的信息(例如通过陀螺仪传感器的相机方向),通常在捕获 2D 图像时会被丢弃。然后,当然,我们试图通过机器学习重新推断出丢弃的信息。
这是我们的机会,这也是初创公司的梦想:找到一个真正困难的问题,等待合适的时机和机会,然后疯狂地尝试解决它。
核心技术允许任何人通过移动相机来创建沉浸式、交互式的 3D 图像,称为 .fyuse。您能否讨论使用移动应用程序创建 .fyuse 的过程?
我们仍然处于这一技术的初期阶段,但其基本原理是:您使用一款具有 Fyusion 或合作伙伴应用程序的智能手机,该应用程序使用 Fyusion ALIS SDK,打开相机,按照指示,获得设备上的 .fyuse 文件对象,可以在设备、网页或任何 AR/VR/MR 头显上渲染。
什么计算机视觉和机器学习技术被用来实现这一点?
这里没有银弹,但我们创建了一系列 3D 计算机视觉和机器学习工具来解决这个问题。其中有来自摄影测量学的想法(因为我们有效地通过在空间中移动单个相机来创建一个虚拟相机阵列),机器人学(巨大的传感器融合问题,因为我们不再有一个相机,而是一个可以从中提取数据来帮助解决这个问题的传感器阵列),计算机图形学(您可以查看我们的 Siggraph 2019 工作来了解我们如何表示一些底层结构),以及更多。所有这些都必须在设备上完成并实时运行,这意味着我们利用计算着色器并编写汇编代码。如前所述,这只是开始,当更多传感器和计算能力可用时,我们将使用 ALIS 推进器来改进技术的各个方面。这是一个长期的愿景,我们还有十多年的工作要做,才能完全满意于数字化复杂的真实世界场景的外观。
很容易想象 .fyuse 将如何颠覆 VR 应用程序。您能否讨论 .fyuse 可以应用的当前 VR 应用程序类型?
我们认为任何 VR 应用程序,如果将真实世界的物体数字化并显示都很重要,那么就应该从使用我们的 ALIS 引擎和 .fyuse 中受益。电子商务、医疗保健、汽车、教育等领域和应用程序中没有缺乏垂直和应用,我们对这一未来感到非常兴奋。
您预见 .fyuse 在 VR 应用程序中的未来会是什么样子?
我们不认为当前技术有任何限制,尽管我们的当前重点是小型至中型场景和物体,而不是大型城市景观。
我可以轻松地想象 .fyuse 被应用于未来的增强现实(AR)和混合现实(MR)应用程序中。您对 .fyuse 在 AR 和 MR 环境中的未来有什么设想?
我们将所有 AR/VR/MR 应用程序视为相同:一旦使用我们的技术数字化 3D 物体,就可以从场景中提取并放置在任何位置。
您的团队是否讨论过使用虚拟助手或 AI 创建 .fyuse 的想法?
我们尚未探索创建交互式虚拟化身的机会。这是一个有趣的可能性,但我们正试图专注于解决我们正在处理的当前问题集。
您是否还有其他关于 .fyuse 或 Fyusion, Inc. 的内容想要分享?
这可能听起来像一个推销,但… 我们是一群疯狂的机器人和 3D 计算机视觉科学家,混合了 CERN 物理学家、优秀的黑客和工程师,这只是描述核心技术团队的成员。我们喜欢所有类型的多样性,因为这使我们更聪明、更强大。如果我们正在做的任何事情对阅读此内容的人有趣,请不要害羞,联系我们。我们正在尽力回答每个问题,您可能会发现自己处于一种情况,您来这里喝杯咖啡,然后留下来十年。
感谢这次精彩的采访,希望了解更多的读者可以访问 Fyusion。












