AR、XR 和脑机接口
研究人员创建了 AI 驱动的实时 3D 全息图像在智能手机上

智能手机可能很快能够生成逼真的 3D 全息图像,这在一定程度上归功于由 MIT 研究人员开发的 AI 模型。MIT 团队开发的 AI 系统 确定了从一系列输入图像中生成全息图的最佳方法。
MIT 的研究人员最近设计了能够生成逼真 3D 全息图像的 AI 模型。该技术可能对 VR 和 AR 头戴设备有应用,并且全息图像甚至可以由智能手机生成。
与传统的 3D 和 VR 显示不同,后者仅仅产生深度的幻觉,并可能引起晕动症和头痛,全息显示可以被人们看到而不引起眼疲劳。创建全息媒体的主要障碍是处理实际生成全息图所需的数据。每个全息图由创建全息图“深度”所需的大量数据组成。由于此原因,生成全息图通常需要大量的计算能力。为了使全息技术更实用,MIT 团队将深度卷积神经网络应用于该问题,创建了一个能够快速根据输入图像生成全息图的网络。
生成全息图的传统方法基本上是生成许多全息图块,然后使用物理模拟将这些块组合成一个完整的对象或图像表示。这与传统的全息图生成方法不同。在传统方法中,图像被切割成块,然后使用一系列查找表将全息图块连接在一起,因为查找表标记了不同全息图块的边界。使用查找表定义全息图块的边界是一个非常耗时和计算密集的过程。
根据 IEEE Spectrum,MIT 团队设计了另一种生成全息图的方法。利用深度学习网络的力量,他们能够将图像切割成可以使用更少的“切片”重新编译成全息图的块。这种新技术利用了卷积神经网络分析图像和将图像分离成离散块的能力。这种新方法大大减少了系统必须执行的总操作次数。
为了设计他们的 AI 驱动的全息图生成器,研究团队首先构建了一个包含大约 4000 个计算机生成图像的数据库,每个图像都有一个相应的 3D 全息图。卷积神经网络在此数据集上进行了训练,学习了每个图像如何与其全息图相关,并学习了如何使用特征来生成全息图。当 AI 系统提供了未见过的数据和深度信息时,它可以从这些数据中生成新的全息图。深度信息通过使用 lidar 传感器或多摄像头显示来提供,并以计算机生成图像的形式渲染。一些新的 iPhone 具有这些组件,这意味着它们可以在连接到正确的显示设备时潜在地生成全息图。
新的 AI 驱动的全息图系统需要的内存比传统方法少得多。该系统可以以每秒 60 帧、全彩色、1920 x 1080 分辨率生成 3D 全息图,同时仅使用大约 620 KB 的内存,并在单个常见的 GPU 上运行。研究人员能够在 iPhone 11 上运行他们的系统,产生大约每秒 1 个全息图,而在 Google (GOOGL ) Edge TPU 上,系统可以渲染每秒 2 个全息图。这表明该系统可以适应智能手机、AR 设备和 VR 设备。该系统还可以用于体积 3D 打印或全息显微镜的设计。
在未来,技术的改进可能会引入眼动跟踪硬件和软件,允许全息图根据用户查看的特定位置动态缩放分辨率。












