AI 模型与平台
Uni3D:探索统一的3D表示
近年来,扩大文本和视觉表示的研究一直是重点。过去的研究和发展已经导致了自然语言处理和视觉领域的多次革命。然而,尽管扩大文本和视觉表示很受欢迎,但3D场景和对象表示的扩大却没有得到充分的讨论。
今天,我们将讨论Uni3D,一个旨在探索统一3D表示的3D基础模型。Uni3D框架采用2D初始化的ViT框架,预训练端到端,以对齐图像-文本特征与其对应的3D点云特征。
Uni3D框架使用预文任务和简单的架构来利用大量预训练的2D模型和图像-文本对齐模型作为初始化和目标。这种方法释放了2D模型和策略的全部潜力,使其能够扩大到3D世界。
在本文中,我们将更深入地探讨3D计算机视觉和Uni3D框架,探索基本概念和模型的架构。让我们开始。
Uni3D和3D表示学习:介绍
近年来,计算机视觉已经成为人工智能行业中最受投资的领域之一。随着2D计算机视觉框架的显著进步,开发者已经将焦点转移到3D计算机视觉上。这个领域,特别是3D表示学习,结合了计算机图形、机器学习、计算机视觉和数学,以自动化3D几何的处理和理解。3D传感器如LiDAR的快速发展及其在AR/VR行业的广泛应用,导致3D表示学习获得了越来越多的关注。其潜在应用每天都在增长。
尽管现有的框架在3D模型架构、任务导向的建模和学习目标方面取得了显著的进步,但大多数探索3D架构是在相对较小的规模上,具有有限的数据、参数和任务场景。学习可扩展的3D表示的挑战,这些表示可以应用于不同环境中的实时应用,仍然基本上没有被探索。
继续前进,在过去的几年中,扩大预训练的语言模型已经帮助革命性地改变了自然语言处理领域,最近的工作表明,从语言到2D的进展使用数据和模型扩大,使开发者能够尝试和重新尝试这种成功,以学习可扩展和转移的3D表示。
Uni3D是一个可扩展和统一的3D预训练框架,旨在学习大规模3D表示,测试其在超过10亿参数、10万张图像、70万文本和10万3D形状的规模上的极限。下图比较了零样本准确率与参数的关系。Uni3D框架成功地将3D表示从600万扩大到超过10亿。

Uni3D框架由一个2D ViT或视觉Transformer作为3D编码器,预训练端到端,以对齐图像-文本特征与3D点云特征。Uni3D框架使用预文任务和简单的架构来利用大量预训练的2D模型和图像-文本对齐模型作为初始化和目标,释放2D模型和策略的全部潜力,使其能够扩大到3D世界。Uni3D框架的灵活性和可扩展性以以下几点来衡量:
在Uni3D提供的灵活和统一的框架下,开发者观察到每个组件的性能都有显著的提高。大规模3D表示学习也从可共享的2D和扩大策略中受益匪浅。
如图所示,Uni3D框架在与先前艺术作品的比较中显示出性能的提高。值得注意的是,Uni3D框架在ModelNet上返回超过88%的零样本分类准确率,与多个监督方法的性能相当。

此外,Uni3D框架在执行其他代表性3D任务(如部件分割和开放世界理解)时也能提供顶级准确率和性能。Uni3D框架旨在通过扩大3D基础模型和统一的预训练方法来学习更强大的3D表示,以最终帮助2D和3D视觉在多种模式下融合。
Uni3D:相关工作
Uni3D框架从以前的3D表示学习和基础模型(尤其是在不同模式下)中汲取灵感和经验。
3D表示学习
3D表示学习方法使用点云来理解3D对象,这个领域近年来被开发者广泛探索。观察到这些点云可以使用特定的3D预文任务(包括掩码点建模、自重构和对比学习)进行自监督预训练。
值得注意的是,这些方法通常使用有限的数据,并且通常不探索从2D或NLP到3D的多模态表示。然而,CLIP框架最近的成功表明,使用对比学习方法可以从原始文本中高效地学习视觉概念,并进一步尝试使用相同的对比学习方法来学习3D表示,通过对齐图像、文本和点云特征。
基础模型
开发者一直致力于设计基础模型来扩大和统一多模态表示。例如,在NLP领域,开发者一直致力于扩大预训练语言模型,这正在革命性地改变NLP行业。另外,在2D视觉领域也可以观察到进展,因为开发者正在使用数据和模型扩大技术来帮助语言到2D模型的进展,尽管这些框架很难为3D模型复制,因为3D数据的可用性有限,并且统一和扩大3D框架存在挑战。
通过学习上述两个工作领域,开发者创建了Uni3D框架,这是第一个具有超过10亿参数的3D基础模型,使用统一的ViT或视觉Transformer架构,允许开发者使用统一的3D或NLP策略来扩大模型。开发者希望这种方法能够帮助Uni3D框架弥合2D和3D视觉之间的差距,并促进多模态融合。
Uni3D:方法和架构

上图展示了Uni3D框架的通用概述,一个可扩展和统一的3D预训练框架,用于大规模3D表示学习。开发者使用超过70万文本、10万张图像和10万3D形状来扩大Uni3D框架到超过10亿参数。Uni3D框架使用2D ViT或视觉Transformer作为3D编码器,预训练端到端,以对齐图像-文本数据与3D点云特征,使Uni3D框架能够在广泛的基准测试中提供所需的效率和准确率。让我们更详细地了解Uni3D框架的工作原理。
扩大Uni3D框架
以前关于点云表示学习的研究传统上专注于设计特定的模型架构,以在广泛的应用中提供更好的性能,并且通常在小规模数据集上工作。然而,最近的研究尝试了使用3D中的可扩展预训练,但由于3D数据的可用性有限,结果并不显著。为了解决3D框架的可扩展性问题,Uni3D框架利用了类似于视觉Transformer的vanilla Transformer结构,可以通过使用统一的2D或NLP扩大策略来扩大模型大小。

以前关于点云表示学习的研究传统上专注于设计特定的模型架构,以在广泛的应用中提供更好的性能,并且通常在小规模数据集上工作。然而,最近的研究尝试了使用3D中的可扩展预训练,但由于3D数据的可用性有限,结果并不显著。为了解决3D框架的可扩展性问题,Uni3D框架利用了类似于视觉Transformer的vanilla Transformer结构,可以通过使用统一的2D或NLP扩大策略来扩大模型大小。
初始化Uni3D
以前从事3D表示扩大的工作面临的另一个重大挑战是,由于模型大小大,收敛和过拟合的困难。克服这一障碍的有效方法是使用特定的3D预文任务预训练单个3D骨干,并初始化预训练参数。然而,这种方法伴随着高训练成本,并且由于3D数据的可用性有限,很难为跨模态学习建立强大的初始化。
Uni3D框架利用了类似于ViT的vanilla Transformer结构。通过这种方法,Uni3D框架可以自然地采用预训练的其他模态的大型模型来初始化Uni3D框架。
多模态对齐
Uni3D框架尝试通过使用类似于OpenShape和ULIP框架的范式来学习图像、语言和点云之间的多模态对齐。另外,为了与其他方法进行公平的比较,Uni3D框架使用OpenShape的集成3D数据集进行训练。这个集成数据集由OpenShape包含4个3D数据集:
- Objaverse。
- ShapeNet。
- 3D-FUTURE。
- ABO。
实验和结果
Uni3D框架在不同设置和各种分类任务中进行了测试,包括其在零样本和少样本设置中的性能、开放世界理解和更多。让我们更详细地了解这些结果。
零样本形状分类
为了评估Uni3D框架在零样本形状分类任务中的性能,开发者在三个基准测试数据集(ModelNet、ScanObjNN和Objaverse-LVIS基准测试数据集)上进行了实验。ModelNet和ScanObjNN是广泛用于分类任务的数据集,分别包含15个和40个对象类别,而Objaverse-LVIS基准测试是一个经过清理和注释的数据集,包含超过40,000个对象,跨越1,100多个类别。框架之间的比较如图所示,Uni3D框架在不同设置中显著优于以前的最先进框架。

少样本线性探测
在AI中,线性探测是一种常用的方法,用于评估框架或模型学习的表示。为了评估Uni3D的线性探测能力,开发者使用与OpenShape相同的设置,冻结了Uni3D框架的参数。然后,开发者使用少样本类标签训练了一个线性分类器。下图展示了不同框架在Objaverse-LVIS数据集上的线性探测能力,展示了模型在10个随机种子上的平均性能。如图所示,Uni3D框架在不同少样本设置中显著优于现有方法。

开放世界理解
为了评估Uni3D框架在实时理解真实世界形状和对象方面的能力,开发者使用ScanNet和CLIP数据集来探索Uni3D的性能。值得注意的是,场景的ground truth实例分割可用,主要目标是识别每个场景的个别实例的类别。在零样本设置中。结果如图所示,Uni3D框架在执行真实世界理解和识别时提供了异常的结果。Uni3D框架在从未训练过的真实世界数据集上显著优于现有框架。

跨模态检索
Uni3D框架学习的多模态表示可以使框架能够从文本或图像中检索3D形状。为了检索3D形状,模型计算3D形状的嵌入和查询文本提示或查询图像的嵌入之间的余弦相似度。然后,框架使用KNN或K最近邻算法来生成最能匹配查询的3D形状,结果如图所示。如图所示,Uni3D框架成功地使用真实世界图像来检索3D形状。值得注意的是,训练图像仅用于渲染目的,真实世界图像和训练图像之间的差距很大。另外,模型还可以接受两个输入图像,并通过使用两个图像的嵌入平均值和其嵌入3D形状之间的余弦相似度来检索类似于两个输入图像的形状。结果很有趣,因为它们展示了Uni3D学习多样3D表示和感知多个2D信号的能力。

在第一列中,框架使用2个查询图像来返回最能匹配查询图像的3D形状。在第二列中,框架使用2个输入图像来检索类似于两个输入图像的3D形状。最后,在最后一列中,模型使用查询文本来返回最能匹配查询文本的3D形状。
最后的思考
在本文中,我们讨论了Uni3D,一个可扩展和统一的3D预训练框架,旨在学习大规模3D表示,测试其在超过10亿参数、10万张图像、70万文本和10万3D形状的规模上的极限。开发者使用了类似于ViT的vanilla Transformer结构,允许他们使用统一的2D或NLP扩大策略来扩大Uni3D框架。此外,Uni3D框架可以利用大量预训练的2D框架和2D策略来扩大到3D世界。实验结果已经证明了Uni3D框架的巨大潜力,因为它在广泛的设置中提供了准确和高效的结果,并且在现有的最先进框架中表现出色。












