AI 模型与平台
InstantStyle:文本到图像生成中的风格保留
过去几年中,基于调优的扩散模型在图像个性化和定制任务中取得了显著进展。然而,尽管它们具有潜力,当前的基于调优的扩散模型仍然面临着生成和保留风格一致的图像的挑战。可能有三个原因导致这种情况。首先,风格的概念仍然没有被明确定义和确定,它包括大气、结构、设计、材料、颜色等多个元素。其次,基于逆向的方法容易导致风格退化,导致细节丢失。最后,基于适配器的方法需要为每个参考图像进行频繁的权重调优,以平衡文本可控性和风格强度。
此外,大多数风格转换方法或风格图像生成的主要目标是使用参考图像,并将其特定的风格应用于目标内容图像。然而,风格的属性数量众多,使得研究人员难以收集风格化的数据集,正确地表示风格,并评估转换的成功性。以前,处理基于调优的扩散过程的模型和框架会对共享相同风格的图像数据集进行调优,这个过程既耗时又具有有限的普遍性,因为很难收集具有相同或几乎相同风格的图像子集。
在本文中,我们将讨论InstantStyle框架,它旨在解决当前基于调优的扩散模型在图像生成和定制中面临的挑战。我们将讨论InstantStyle框架实施的两种关键策略:
- 一种简单而有效的方法,用于在特征空间中解耦参考图像的风格和内容,基于这样的假设:同一特征空间中的特征可以相互添加或减去。
- 通过将参考图像特征仅注入风格特定块中,防止风格泄漏,并避免使用笨重的权重进行调优,这通常是参数更重的设计的特征。
本文旨在深入介绍InstantStyle框架,并探讨其机制、方法论、架构以及与最先进框架的比较。我们还将讨论InstantStyle框架如何展示出显著的视觉风格化结果,并在文本可控性和风格强度之间取得最佳平衡。让我们开始吧。
InstantStyle:文本到图像生成中的风格保留
基于扩散的文本到图像生成AI框架在一系列个性化和定制任务中取得了显著成功,特别是在一致的图像生成任务中,包括对象定制、图像保留和风格转换。然而,尽管最近的成功和性能提升,风格转换仍然是研究人员面临的挑战,主要是由于风格的概念仍然没有被明确定义和确定,包括大气、结构、设计、材料、颜色等多个元素。 风格转换或风格图像生成的主要目标是使用参考图像或参考图像子集,将其特定的风格应用于目标内容图像。然而,风格的属性数量众多,使得研究人员难以收集风格化的数据集,正确地表示风格,并评估转换的成功性。以前,处理基于调优的扩散过程的模型和框架会对共享相同风格的图像数据集进行调优,这个过程既耗时又具有有限的普遍性,因为很难收集具有相同或几乎相同风格的图像子集。
由于当前方法的挑战,研究人员对开发基于调优的风格转换或风格图像生成方法感兴趣,这些框架可以分为两类:
- 无适配器方法:无适配器方法和框架利用扩散过程中的自注意力,并通过实现共享注意力操作,这些模型能够直接从给定的参考风格图像中提取关键特征和值。
- 基于适配器的方法:基于适配器的方法和框架另一方面,包含一个轻量级模型,用于从参考风格图像中提取详细的图像表示。然后,该框架使用交叉注意力机制将这些表示集成到扩散过程中。集成过程的主要目标是引导生成过程,并确保生成的图像与所需的风格细微差别一致。
然而,尽管有这些承诺,调优免费方法通常会遇到一些挑战。首先,无适配器方法需要在自注意力层中交换键和值,并预先捕获来自参考风格图像的键和值矩阵。当在自然图像上实现时,无适配器方法需要使用DDIM或去噪扩散隐式模型等技术将图像反转为潜在噪声。然而,使用DDIM或其他反转方法可能会导致细节丢失,例如颜色和纹理,从而降低生成图像中的风格信息。此外,这些方法引入的额外步骤是一个耗时的过程,并且在实际应用中可能会带来显著的缺点。另一方面,基于适配器方法的主要挑战在于平衡上下文泄漏和风格强度。内容泄漏发生在风格强度增加时,导致生成输出中出现非风格元素,而主要的困难点在于在参考图像中有效地分离风格和内容。为了解决这个问题,一些框架构建了成对的数据集,代表相同的对象在不同的风格中,从而促进内容表示和分离风格的提取。然而,感谢风格的内在不确定表示,创建大规模成对数据集的任务在捕获风格多样性方面是有限的,并且是一个资源密集的过程。

为了解决这些限制,InstantStyle框架被引入,它是一种基于现有基于适配器方法的新颖调优免费机制,能够无缝集成到其他基于注意力的注入方法中,并有效地解耦内容和风格。此外,InstantStyle框架引入了两种有效的方法来解耦风格和内容,实现更好的风格迁移,而无需引入额外的方法来实现解耦或构建成对的数据集。
此外,之前的基于适配器的框架已被广泛用于CLIP-based方法作为图像特征提取器,一些框架探索了在特征空间内实现特征解耦的可能性,并且与风格的不确定性相比,使用文本描述内容更容易。由于图像和文本在CLIP-based方法中共享特征空间,因此从图像特征中减去内容文本特征可以显著减少内容泄漏。此外,在大多数扩散模型中,架构中有一个特定的层将风格信息注入其中,并通过仅将图像特征注入特定的风格块来实现内容和风格的解耦。通过实施这两种简单的策略,InstantStyle框架能够解决大多数现有框架遇到的内容泄漏问题,同时保持风格的强度。
总之,InstantStyle框架采用两种简单、直接却有效的机制来实现对参考图像的内容和风格的有效解耦。InstantStyle框架是一种模型无关且调优免费的方法,展示了在风格转换任务中出色的性能,并具有巨大的潜力用于下游任务。
Instant-Style:方法论和架构
如前所述,在调优免费扩散模型中,风格条件的注入存在平衡。如果图像条件的强度太高,可能会导致内容泄漏,而如果图像条件的强度太低,风格可能不会足够明显。这种观察的主要原因是风格和内容在图像中是相互耦合的,并且由于风格的内在不确定性,很难解耦风格和内容。因此,通常会为每个参考图像调优权重,以平衡文本可控性和风格强度。此外,对于给定的输入参考图像及其对应的文本描述,逆向方法会采用DDIM等方法对图像进行逆转,以获得逆转扩散轨迹,这个过程近似地将图像转换为潜在噪声表示。基于此,并从逆转扩散轨迹和新的提示开始,这些方法生成具有风格一致性的新内容。然而,如下图所示,DDIM逆转方法对于真实图像通常是不稳定的,因为它依赖于局部线性化假设,导致错误传播,并导致内容丢失和图像重构不正确。

至于方法论,Instant-Style框架采取最简单的方法来实现类似的性能。与风格的不确定性相比,内容可以用自然文本表示,这使得Instant-Style框架能够使用CLIP的文本编码器来提取内容文本的特征作为上下文表示。同时,Instant-Style框架实现CLIP图像编码器来提取参考图像的特征。利用CLIP全局特征的特性,并从图像特征中减去内容文本特征,Instant-Style框架能够显式地解耦风格和内容。虽然这是一个简单的策略,但它帮助Instant-Style框架在保持内容泄漏最小化方面非常有效。

此外,每个深度网络层都负责捕获不同的语义信息,并且以前的模型中存在两个注意力层,负责处理风格。特别是blocks.0.attentions.1和down blocks.2.attentions.1层,负责捕获风格,如颜色、材料、气氛和空间布局层,捕获结构和构图。Instant-Style框架使用这些层来隐式地提取风格信息,并防止内容泄漏而不失去风格强度。这个策略是简单却有效的,因为模型已经定位了可以将图像特征注入其中以实现无缝风格转换的风格块。此外,由于模型大大减少了适配器的参数,框架的文本控制能力得到了增强,并且该机制也适用于其他基于注意力的特征注入模型,用于编辑和其他任务。

Instant-Style:实验和结果
Instant-Style框架是在Stable Diffusion XL框架上实现的,并使用常用的预训练IR-adapter作为其验证方法,并对图像特征进行静音,除了风格块之外。Instant-Style模型还在4百万大规模文本-图像对数据集上从头开始训练IR-adapter,并且只更新风格块。
为了测试其泛化能力和鲁棒性,Instant-Style框架进行了大量风格转换实验,使用不同的风格和内容,并且结果可以在以下图像中看到。给定一个单一的风格参考图像和不同的提示,Instant-Style框架提供了高质量的一致风格图像生成。

此外,由于模型仅将图像信息注入风格块中,因此它能够显著减少内容泄漏,并且不需要进行权重调优。

此外,Instant-Style框架还采用ControlNet架构来实现具有空间控制的图像风格化,并且结果如以下图像所示。

与以前的最先进方法相比,包括StyleAlign、B-LoRA、Swapping Self Attention和IP-Adapter,Instant-Style框架展示了最佳的视觉效果。

最后的思考
在本文中,我们讨论了Instant-Style,一种采用两种简单却有效的策略来实现对参考图像的内容和风格的有效解耦的通用框架。InstantStyle框架旨在解决当前基于调优的扩散模型在图像生成和定制中面临的挑战。Instant-Style框架实施了两种关键策略:一种简单却有效的方法,用于在特征空间中解耦参考图像的风格和内容;第二,通过将参考图像特征仅注入风格特定块中,防止风格泄漏,并避免使用笨重的权重进行调优,这通常是参数更重的设计的特征。












