AI 模型与平台

概念滑块:在具有 LoRA 适配器的扩散模型中实现精确控制

mm
将 Unite.AI 添加到您在 Google 上的首选来源

由于其功能,文本到图像的扩散模型已在艺术界变得非常流行。然而,当前的模型,包括最先进的框架,往往难以维持对生成图像中的视觉概念和属性的控制,导致不满意的输出。大多数模型仅依赖文本提示,这使得连续属性的调节(如天气强度、阴影清晰度、面部表情或人物年龄)变得困难。这使得最终用户难以调整图像以满足他们的特定需求。另外,尽管这些生成框架产生高质量和逼真的图像,但它们容易出现像扭曲的面部或缺失的手指这样的失真。

为了克服这些局限性,开发人员提出了使用可解释的概念滑块。这些滑块承诺为最终用户提供对视觉属性的更大控制,从而增强图像生成和编辑在扩散模型中的能力。概念滑块在扩散模型中通过识别与单个概念相对应的参数方向并最小化对其他属性的干扰来工作。该框架使用样本图像或一组提示创建这些滑块,从而为文本和视觉概念建立方向。

最终,概念滑块在文本到图像扩散模型中的使用可以实现最小干扰的图像生成,并增强对最终输出的控制,同时提高感知的真实性,而不改变图像的内容,从而生成逼真的图像。在本文中,我们将更深入地讨论在文本到图像框架中使用概念滑块的概念,并分析其使用如何导致更高质量的 AI 生成图像。

概念滑块介绍

如前所述,当前的文本到图像扩散框架往往难以控制生成图像中的视觉概念和属性,导致不满意的结果。此外,许多这些模型在调节连续属性方面也面临挑战,进一步导致不满意的输出。概念滑块可能有助于缓解这些问题,赋予内容创作者和最终用户对图像生成过程的增强控制,并解决当前框架面临的挑战。

大多数当前的文本到图像扩散模型依赖于直接文本提示修改来控制图像属性。虽然这种方法允许图像生成,但它不是最优的,因为更改提示可能会大大改变图像的结构。另一种方法是使用后处理技术,这些技术反转扩散过程并修改交叉注意力来编辑视觉概念。然而,后处理技术有局限性,仅支持有限数量的同时编辑,并且需要为每个新概念进行个别干扰传递。此外,如果不仔细设计,它们可能会引入概念纠缠。

相比之下,概念滑块提供了一种更高效的图像生成解决方案。这些轻量级、易于使用的适配器可以应用于预训练模型,增强对所需概念的控制和精度,在单次干扰传递中具有最小的纠缠。概念滑块还允许编辑不被文本描述涵盖的视觉概念,这是它们与基于文本提示的编辑方法的区别。虽然基于图像的自定义方法可以有效地为基于图像的概念添加令牌,但它们在编辑图像方面很难实施。概念滑块另一方面,允许最终用户提供一小组成对的图像来定义所需的概念。然后,滑块将此概念推广并自动将其应用于其他图像,旨在增强真实性并修复诸如手部等失真。

概念滑块旨在从四个生成 AI 和扩散框架概念中学习和解决问题:图像编辑、基于指导的方法、模型编辑和语义方向。

图像编辑

当前的 AI 框架要么使用条件输入来指导图像结构,要么操纵源图像与其目标提示的交叉注意力来实现文本到图像扩散框架中的单图像编辑。因此,这些方法只能在单个图像上实现,并且它们还需要对每个图像进行潜在基础优化,因为随着时间的推移,几何结构会随着提示的变化而演变。

基于指导的方法

基于分类器的指导方法已表明其能够增强生成图像的质量,并提高文本-图像对齐度。通过在干扰期间纳入指导项,该方法提高了扩散框架继承的有限组合性,并且可以用于引导不安全的概念在扩散框架中。

模型编辑

使用概念滑块也可以被视为一种模型编辑技术,它使用低秩适配器输出与属性对齐的单个语义属性。然后使用基于微调的自定义方法对框架进行个性化以添加新概念。此外,自定义扩散技术提出了一种方法来微调交叉注意力层以将新视觉概念纳入预训练的扩散模型中。相反,文本扩散技术提出优化嵌入向量以激活模型能力并将文本概念引入框架中。

GAN 中的语义方向

操纵语义属性是生成对抗网络的关键属性,潜在空间轨迹被发现以自监督的方式对齐。在扩散框架中,这些潜在空间轨迹存在于 U-Net 架构的中间层中,潜在空间的主要方向在扩散框架中捕获全局语义。概念滑块直接训练对应于特殊属性的低秩子空间,并使用文本或图像对优化全局方向来获得精确和局部化的编辑方向。

概念滑块:架构和工作原理

扩散模型和 LoRA 或低秩适配器

扩散模型本质上是生成 AI 框架的子类,它们的工作原理是通过逆转扩散过程来合成数据。前向扩散过程最初向数据添加噪声,因此从有组织的状态转变为完全的高斯噪声状态。扩散模型的主要目标是通过逐渐去噪图像并对随机高斯噪声进行采样来生成图像。在实际应用中,扩散框架的主要目标是预测真实噪声,当完全高斯噪声作为输入时,附加输入如条件和时间步长。

LoRA 或低秩适配器技术将权重更新分解为预训练模型层的输入和输出维度,并将更新约束为低维子空间。这种技术使大型预训练框架能够在下游任务上进行高效适配。

概念滑块

概念滑块的主要目标是作为一种方法来对扩散框架中的 LoRA 适配器进行微调,以便在概念目标图像上实现更大的控制度。以下图像演示了概念滑块的工作原理。

当条件化为目标概念时,概念滑块学习低秩参数方向以增加或减少特定属性的表达。对于模型和其目标概念,概念滑块的主要目标是获得增强的模型,该模型修改了条件化为目标概念的图像的属性增强和抑制的可能性。使用重参数化和 Tweedie 公式,框架引入了一个时间变化的噪声过程,并将每个分数表示为去噪预测。另外,解耦目标微调概念滑块中的模块,同时保持预训练权重不变,并且在 LoRA 公式中引入的缩放因子在干扰期间被修改。缩放因子还可以调整编辑的强度,并且可以在不重新训练框架的情况下使编辑更强,如下图所示。

以前的框架使用的编辑方法可以通过重新训练框架并增加指导来实现更强的编辑。然而,在干扰期间缩放缩放因子可以在不增加重新训练成本和时间的情况下产生相同的编辑结果。

学习视觉概念

概念滑块旨在控制文本提示无法定义的视觉概念,并且这些滑块利用小型数据集,这些数据集可以成对训练以学习这些概念。图像对之间的对比使滑块能够学习视觉概念。另外,概念滑块的训练过程优化了在正向和反向方向中实现的 LoRA 组件。因此,LoRA 组件与视觉效果在两个方向上一致的方向对齐。

概念滑块:实现结果

为了分析性能的提高,开发人员主要在高分辨率 1024 像素框架 Stable Diffusion XL 上评估了概念滑块的使用,并且还在 Stable Diffusion v1.4 框架上进行了额外的实验,模型分别训练了 500 个 epoch。

文本概念滑块

为了评估文本概念滑块的性能,它们被验证在一组 30 个基于文本的概念上,并且该方法被比较为使用标准文本提示的两个基准,在固定时间步数后开始组合以引导图像。如以下图所示,使用概念滑块的结果始终具有更高的 CLIP 分数,并且与原始框架相比,LPIPS 分数也减少了。

如上图所示,使用概念滑块可以实现对图像生成过程中所需属性的精确编辑,同时保持图像的整体结构。

视觉概念滑块

仅使用文本提示的文本到图像扩散模型通常难以维持对视觉属性(如面部毛发或眼形)的更高控制度。为了更好地控制粒度属性,概念滑块利用了可选的文本指导和图像数据集。如以下图所示,概念滑块为“眼大小”和“眉毛形状”创建了单独的滑块,这些滑块使用图像对捕获所需的变换。

结果可以通过提供特定的文本来进一步完善,这样方向就可以集中在该面部区域,并且可以创建具有对目标属性逐步控制的滑块。

组合滑块

使用概念滑块的一个主要优势是其可组合性,它允许用户组合多个滑块以获得对概念的增强控制,而不是一次关注一个概念。另外,由于概念滑块是轻量级的 LoRA 适配器,因此它们易于共享,并且可以轻松叠加在扩散模型上。用户还可以同时调整多个旋钮来引导复杂的生成,并且可以下载有趣的滑块集。

以下图像演示了概念滑块的组合能力,并且多个滑块在每行中从左到右逐步组合,允许以增强的控制度遍历高维概念空间。

提高图像质量

尽管最先进的文本到图像扩散框架和大型生成模型(如 Stable Diffusion XL 模型)能够生成逼真和高质量的图像,但它们经常出现图像失真,如模糊或扭曲的物体,尽管这些最先进框架的参数具有生成高质量输出的潜在能力,具有更少的生成次数。使用概念滑块可以通过识别低秩参数方向来生成具有更少失真的图像,从而解锁这些模型的真正能力。

修复手部

生成具有真实外观的手的图像一直是扩散框架面临的挑战,使用概念滑块可以直接控制手部失真的趋势。以下图像演示了使用“修复手部”概念滑块的效果,该滑块允许框架生成具有更真实外观的手的图像。

修复滑块

使用概念滑块不仅可以生成具有更真实外观的手的图像,还表现出提高图像整体真实性的潜力。概念滑块还可以识别单个低秩参数方向,从而使图像从常见的失真问题中转变,结果如下图所示。

最终思考

在本文中,我们讨论了概念滑块,这是一种简单却可扩展的新范式,能够在扩散模型中实现对生成输出的可解释控制。使用概念滑块的目标是解决当前文本到图像扩散框架面临的难以维持对生成图像中的视觉概念和属性的控制的问题,这通常导致不满意的输出。此外,大多数文本到图像扩散模型难以调节图像中的连续属性,这通常导致不满意的输出。使用概念滑块可能使文本到图像扩散框架能够缓解这些问题,并赋予内容创作者和最终用户对图像生成过程的增强控制,并解决当前框架面临的挑战。

专业为工程师,心为作家。 Kunal是一名技术作家,对AI和ML有着深厚的热爱和理解,致力于通过其引人入胜和信息丰富的文档来简化这些领域中的复杂概念。