AI 模型与平台

DreamCraft3D:一种分层的3D生成方法,使用引导式扩散先验

mm
将 Unite.AI 添加到您在 Google 上的首选来源

生成式AI模型在AI行业中已经成为一个热门话题。近年来,2D生成模型的成功为我们今天使用的视觉内容创作方法铺平了道路。虽然AI社区在2D生成模型方面取得了显著的成功,但生成3D内容仍然是深度生成式AI框架面临的重大挑战。这尤其正确,因为对3D生成内容的需求正在达到历史新高,驱动这一趋势的因素包括广泛的视觉游戏、应用程序、虚拟现实,甚至电影。值得注意的是,虽然有一些3D生成式AI框架能够为某些类别和任务提供可接受的结果,但它们无法高效地生成3D对象。这种缺陷可以归因于训练这些框架所需的广泛3D数据不足。最近,开发人员提出了利用预训练的文本到图像AI生成模型的指导,这种方法已经显示出有希望的结果。

在本文中,我们将讨论DreamCraft3D框架,这是一个分层的3D内容生成模型,能够生成连贯且高保真度的3D对象。DreamCraft3D框架使用2D参考图像来指导几何雕刻阶段,并专注于解决当前框架或方法中存在的一致性问题。此外,DreamCraft3D框架采用视图依赖的扩散模型进行分数蒸馏采样,有助于雕刻出有助于连贯渲染的几何形状。

我们将更深入地探讨DreamCraft3D框架用于3D内容生成的方法。另外,我们将探索利用预训练的文本到图像(T2I)模型进行3D内容生成的概念,并检查DreamCraft3D框架如何利用这种方法来生成逼真的3D内容。

DreamCraft3D:介绍

DreamCraft3D是一个分层的3D内容生成管道。DreamCraft3D框架尝试利用最先进的T2I或文本到图像生成框架,使用文本提示创建高质量的2D图像。这种方法允许DreamCraft3D框架最大限度地发挥最先进的2D扩散模型的能力,以表示文本提示中描述的视觉语义,同时保留这些2D AI生成框架提供的创造自由。然后使用级联的几何纹理增强和几何雕刻阶段将生成的图像提升到3D,并在每个阶段应用专门的技术,借助问题的分解。

对于几何形状,DreamCraft3D框架重点关注全局3D结构和多视图一致性,因此可以在图像中进行详细纹理的妥协。一旦框架解决了几何相关的问题,它就将重点转移到通过实现3D感知的扩散来优化连贯且逼真的纹理。几何雕刻和纹理增强的两个优化阶段有两个关键的设计考虑因素。

综上所述,可以将DreamCraft3D描述为一个AI生成框架,它利用分层的3D内容生成管道,将2D图像转换为其3D对应物,同时保持整体3D一致性。

利用预训练的T2I或文本到图像模型

利用预训练的T2I或文本到图像模型进行3D内容生成的想法首先由DreamFusion框架在2022年提出。DreamFusion框架尝试强制执行SDS或分数蒸馏采样损失,以优化3D框架,使得随机视图的渲染与文本条件图像分布一致,如预训练的文本到图像扩散框架所解释的那样。虽然DreamFusion方法提供了不错的结果,但仍存在两个主要问题:模糊和过度饱和。为了解决这些问题,最近的工作实施了各种阶段优化策略,尝试改进2D蒸馏损失,从而导致更好的质量和更逼真的3D生成图像。

然而,尽管这些框架最近取得了成功,但它们仍然无法匹配2D生成框架合成复杂内容的能力。另外,这些框架通常存在“Janus问题”,即3D渲染虽然看似合理,但在检查整体时会出现风格和语义不一致。

为了解决前期工作中存在的问题,DreamCraft3D框架探索了使用整体分层3D内容生成管道的可能性,并从手动艺术过程中汲取灵感,即首先将概念草拟成2D草图,然后雕刻粗糙的几何形状,细化几何细节,并绘制高保真度的纹理。按照同样的方法,DreamCraft3D框架将耗时的3D内容或图像生成任务分解为各种可管理的步骤。它首先使用文本提示生成高质量的2D图像,然后使用纹理增强和几何雕刻将图像提升到3D阶段。将过程分解为后续阶段有助于DreamCraft3D框架最大限度地发挥分层生成的潜力,结果是生成更高质量的3D图像。

在第一个阶段,DreamCraft3D框架部署几何雕刻以使用2D图像作为参考生成连贯且合理的3D几何形状。此外,该阶段不仅使用SDS损失用于光度损失和新视图的参考视图,还引入了一系列策略来促进几何一致性。框架旨在利用Zero-1-to-3,一种视图条件的图像翻译模型,使用参考图像来建模新视图的分布。此外,框架还从隐式表面表示转换为网格表示,以进行从粗糙到精细的几何细化。

DreamCraft3D框架的第二阶段使用引导式分数蒸馏方法来增强图像的纹理,因为当前的视图条件扩散模型是在有限的3D数据上训练的,这就是为什么它们经常难以匹配2D扩散模型的性能或保真度的原因。通过这种方法,DreamCraft3D框架微调扩散模型以适应被优化的3D实例的多视图图像,这有助于增强3D纹理,同时保持多视图一致性。当扩散模型在这些多视图渲染上训练时,它为3D纹理优化提供了更好的指导,这种方法有助于DreamCraft3D框架实现大量的纹理细节,同时保持视图一致性。

如上图所示,DreamCraft3D框架能够生成具有逼真纹理和复杂几何结构的创意3D图像和内容。在第一张图像中,是动漫角色Son Goku的身体与一头野猪的头混合,而第二张图像描绘了一只穿着侦探服装的猎犬。以下是其他一些示例。

DreamCraft3D:工作原理和架构

DreamCraft3D框架尝试利用最先进的T2I或文本到图像生成框架,使用文本提示创建高质量的2D图像。这种方法允许DreamCraft3D框架最大限度地发挥最先进的2D扩散模型的能力,以表示文本提示中描述的视觉语义,同时保留这些2D AI生成框架提供的创造自由。然后使用级联的几何纹理增强和几何雕刻阶段将生成的图像提升到3D,并在每个阶段应用专门的技术,借助问题的分解。以下图像简要总结了DreamCraft3D框架的工作原理。

让我们更详细地了解纹理增强和几何雕刻阶段的关键设计考虑因素。

几何雕刻

几何雕刻是DreamCraft3D框架的第一个阶段,旨在创建一个3D模型,使其在相同的参考视图下与参考图像的外观一致,同时确保即使在不同的视角下也具有最大程度的合理性。为了确保最大程度的合理性,框架使用SDS损失来鼓励每个个别采样视图的合理图像渲染,预训练的扩散模型可以识别到它。此外,为了有效地利用参考图像的指导,框架惩罚参考视图下参考图像和渲染图像之间的光度差异,损失仅在视图的前景区域内计算。另外,为了鼓励场景稀疏性,框架还实施了一种遮罩损失来渲染剪影。尽管如此,保持外观和语义在后视图的一致性仍然是一个挑战,这就是为什么框架采用额外的方法来生成详细且连贯的几何形状的原因。

3D感知扩散先验

仅使用每视图监督的3D优化方法是欠约束的,这就是为什么DreamCraft3D框架使用Zero-1-to-3,一种视图条件的扩散模型,因为Zero-1-to-3框架提供了增强的视点感知,因为它是在更大规模的3D数据资产上训练的。此外,Zero-1-to-3框架是一种微调的扩散模型,它根据给定的参考图像和相机姿势来推断图像。

进步视图训练

直接在360度中推导自由视图可能会导致几何伪影或不一致,例如椅子上多出一条腿,这可能是由于单个参考图像的模糊性所致。为了解决这个问题,DreamCraft3D框架逐渐扩大训练视图,然后逐渐将已建立的几何形状传播到360度以获得结果。

扩散时间步长退火

DreamCraft3D框架采用扩散时间步长退火策略,尝试与3D优化的粗糙到精细的进展一致。在优化过程的开始,框架优先采样更大的扩散时间步长,以提供全局结构。随着框架继续训练过程,它线性地在数百次迭代中退火采样范围。由于退火策略,框架能够在优化的早期阶段建立合理的全局几何形状,然后再细化结构细节。

详细结构增强

DreamCraft3D框架最初优化隐式表面表示以建立粗糙的结构。然后,框架使用此结果,并将其与可变的四面体网格(DMTet)结合,初始化具有纹理的3D网格表示,这可以分离纹理和几何形状的学习。当框架完成结构增强后,模型能够通过仅细化纹理来保留从参考图像中获得的高频细节。

使用引导式分数采样进行纹理增强

虽然几何雕刻阶段强调学习详细且连贯的几何形状,但它也会使纹理变得模糊,这可能是由于框架依赖于在粗糙分辨率下运行的2D先验模型以及3D扩散模型提供的有限清晰度所致。此外,包括过度饱和和过度平滑在内的常见纹理问题是由于大型分类器自由引导所致。

框架使用VSD或变分分数蒸馏损失来增强纹理的逼真度。框架选择稳定扩散模型在此阶段以获得高分辨率的梯度。此外,框架保持四面体网格不变,以促进真实的渲染并优化网格的整体结构。在学习阶段,DreamCraft3D框架不使用Zero-1-to-3框架,因为它对纹理质量有不利影响,这可能导致3D输出不一致。

实验和结果

为了评估DreamCraft3D框架的性能,它被与当前最先进的框架进行比较,分析了定性和定量结果。

与基线模型的比较

为了评估性能,DreamCraft3D框架被与5个最先进的框架进行比较,包括DreamFusion、Magic3D、ProlificDreamer、Magic123和Make-it-3D。测试基准包括300个输入图像,它们是真实世界图像和由稳定扩散框架生成的图像的混合。每个测试基准图像都有一个文本提示、预测的深度图和前景的alpha遮罩。框架从图像标题框架中获取真实图像的文本提示。

定性分析

以下图像比较了DreamCraft3D框架与当前基线模型,并且可以看出,依赖文本到3D方法的框架通常面临多视图一致性问题。

一方面,你有ProlificDreamer框架,它提供了逼真的纹理,但它在生成合理的3D对象方面却力不从心。像Make-it-3D框架这样的框架依赖于图像到3D的方法,能够创建高质量的正面视图,但它们无法保持理想的几何形状。Magic123框架生成的图像提供了更好的几何正则化,但它们生成了过度饱和和平滑的几何纹理和细节。相比之下,DreamCraft3D框架使用引导式分数蒸馏方法,不仅保持了语义一致性,还提高了想象力的多样性。

定量分析

为了生成不仅与输入参考图像相似,而且还能从各个角度一致地传达语义的令人信服的3D图像,DreamCraft3D框架使用的技术与基线模型进行了比较,评估过程使用了四个指标:PSNR和LPIPS用于在参考视图下测量保真度,Contextual Distance用于评估像素级别的吻合度,CLIP用于估计语义一致性。结果如以下图像所示。

结论

在本文中,我们讨论了DreamCraft3D,一种用于生成3D内容的分层管道。DreamCraft3D框架旨在利用最先进的文本到图像(T2I)生成框架,使用文本提示创建高质量的2D图像。这种方法允许DreamCraft3D框架最大限度地发挥最先进的2D扩散模型的能力,以表示文本提示中描述的视觉语义,同时保留这些2D AI生成框架提供的创造自由。然后使用级联的几何纹理增强和几何雕刻阶段将生成的图像提升到3D,并在每个阶段应用专门的技术,借助问题的分解。通过这种方法,DreamCraft3D框架可以生成高保真度和一致的3D资产,具有令人信服的纹理,可从多个角度查看。

专业为工程师,心为作家。 Kunal是一名技术作家,对AI和ML有着深厚的热爱和理解,致力于通过其引人入胜和信息丰富的文档来简化这些领域中的复杂概念。