Anderson 视角

提高 AI 图像编辑的准确性

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Images from the paper ' Tight Inversion: Image-Conditioned Inversion for Real Image Editing'

尽管 Adobe 的 Firefly 潜在扩散模型(LDM)可以说是目前最好的模型之一,但 Photoshop 用户在尝试其生成功能时会发现,它不能轻松地 编辑现有图像,而是用基于用户文本提示的图像完全替换用户选择的区域(尽管 Firefly 擅长将生成的部分集成到图像的上下文中)。

在当前的 beta 版本中,Photoshop 至少可以 包含一个参考图像 作为部分图像提示,这使得 Adobe 的旗舰产品赶上 Stable Diffusion 用户已经享受了两年多的功能,得益于第三方框架,如 Controlnet

当前的 Adobe Photoshop beta 版本允许在生成新内容时使用参考图像 - 虽然现在还很难以预测结果。

当前的 Adobe Photoshop beta 版本允许在生成新内容时使用参考图像 – 虽然现在还很难以预测结果。

这说明了图像合成研究中一个开放的问题 – 扩散模型难以编辑现有图像而不实施对所选区域的完全 “重新想象”。

虽然这种基于扩散的 inpaint 遵循用户的提示,但它完全重新创造了源主题,而不是考虑原始图像(除了将新生成的图像与环境融合)

虽然这种基于扩散的 inpaint 遵循用户的提示,但它完全重新创造了源主题,而不是考虑原始图像(除了将新生成的图像与环境融合) Source: https://arxiv.org/pdf/2502.20376

这种问题的原因是 LDM 通过 迭代去噪 生成图像,其中每个阶段的过程都取决于用户提供的文本提示。随着文本提示内容转换为 嵌入令牌,并且像 Stable Diffusion 或 Flux 这样的超大规模模型包含数十万(或数百万)个与提示相关的近匹配嵌入,过程中有一个计算出的 条件分布 作为目标;每一步都是朝着这个 “条件分布目标” 迈进。

因此,这就是文本到图像 – 用户 “希望得到最好的结果”,因为无法预测生成的结果会是什么样子。

相反,许多人试图使用 LDM 的强大生成能力来编辑现有图像 – 但这需要在保真度和灵活性之间进行平衡。

当图像被投影到模型的潜在空间中时,例如使用 DDIM 反转,目标是尽可能地恢复原始图像,同时仍允许进行有意义的编辑。问题在于,图像被更精确地重构时,模型更紧密地遵循其 原始 结构,使得进行重大修改变得困难。

与许多其他近年来提出的基于扩散的图像编辑框架一样,Renoise 架构难以对图像的外观进行任何真正的改变,只是在猫的喉咙底部出现了一个简单的蝴蝶结。

与许多其他近年来提出的基于扩散的图像编辑框架一样,Renoise 架构难以对图像的外观进行任何真正的改变,只是在猫的喉咙底部出现了一个简单的蝴蝶结。

另一方面,如果过程优先考虑可编辑性,模型对原始图像的控制力减弱,使得引入更改变得更容易 – 但代价是与源图像的整体一致性。

任务完成 - 但对于大多数基于 AI 的图像编辑框架来说,这是一种转变,而不是调整。

任务完成 – 但对于大多数基于 AI 的图像编辑框架来说,这是一种转变,而不是调整。

由于这是一个即使 Adobe 的庞大资源也难以解决的问题,我们可以合理地认为,这是一个值得注意的挑战,可能不会有简单的解决方案,如果有的话。

紧密反转

因此,这周发布的一篇新论文中给出的例子引起了我的注意,因为这项工作在这一领域的当前状态下提供了一个值得注意的改进,通过将细腻的编辑应用于投影到模型潜在空间的图像 – 而不使编辑变得微不足道或压倒原始内容。

使用紧密反转时,源选择被以更细粒度的方式考虑,变换符合原始材料,而不是覆盖它。

使用紧密反转时,源选择被以更细粒度的方式考虑,变换符合原始材料,而不是覆盖它。

LDM 爱好者和从业者可能会认识到这种结果,因为它可以通过外部系统(如 Controlnet 和 IP-Adapter)在复杂工作流中创建。

实际上,这种新方法 – 被称为 紧密反转 – 确实利用了 IP-Adapter,以及一个专门用于人脸的模型,用于人脸描绘。

来自 2023 年 IP-Adapter 论文的示例,展示了如何对源材料进行适当的编辑。来源:https://arxiv.org/pdf/2308.06721

来自 2023 年 IP-Adapter 论文的示例,展示了如何对源材料进行适当的编辑。来源:https://arxiv.org/pdf/2308.06721

紧密反转的显著成就是将复杂的技术程序化为一个可以应用于现有系统的单一插入模态,包括许多最流行的 LDM 分布。

自然地,这意味着紧密反转(TI),像它所利用的辅助系统一样,使用源图像作为其编辑版本的条件因素,而不是仅仅依赖于准确的文本提示。

紧密反转将真正混合编辑应用于源材料的进一步示例。

紧密反转将真正混合编辑应用于源材料的进一步示例。

虽然作者承认他们的方法并非完全摆脱了基于扩散的图像编辑技术中传统的和持续的保真度与可编辑性之间的紧张关系,但他们报告了在将 TI 注入现有系统时取得了最先进的结果,相比基线性能。

这篇题为 紧密反转:图像条件反转用于实际图像编辑 的新工作来自 Tel Aviv 大学和 Snap 研究所的五位研究人员。

方法

最初,一个大型语言模型(LLM)用于生成一组不同文本提示,从而生成图像。然后,对每个图像应用上述 DDIM 反转,使用三个文本条件:用于生成图像的文本提示;相同提示的简短版本;以及一个空(空)提示。

使用这些过程返回的反转噪声,图像再次使用相同的条件重新生成,而不使用 无分类器指导(CFG)。

DDIM 反转得分在不同提示设置下的各种指标。

DDIM 反转得分在不同提示设置下的各种指标。

如上图所示,随着文本长度的增加,各项指标的得分都有所提高。使用的指标包括 峰值信噪比(PSNR);L2 距离;结构相似性指数(SSIM);以及 学习到的感知图像补丁相似性(LPIPS)。

图像意识

实际上,紧密反转改变了主机扩散模型编辑真实图像的方式,通过将反转过程条件化为图像本身,而不是仅仅依赖文本。

通常,将图像反转到扩散模型的噪声空间需要估计起始噪声,当去噪时,可以重构输入。标准方法使用文本提示来指导此过程;但是,一个不完美的提示可能会导致错误,丢失细节或改变结构。

紧密反转使用 IP 适配器将视觉信息输入模型,使其能够更准确地重构图像,将源图像转换为条件令牌,并将其投影到反转管道中。

这些参数是可编辑的:增加源图像的影响力可以使重构几乎完美,而减少它可以允许进行更多创造性的更改。这使得紧密反转对细微的修改(如更改衬衫颜色)和更重要的编辑(如交换对象)都很有用 – 而不需要其他反转方法常见的副作用,例如细节丢失或背景内容中的意外异常。

作者指出:

‘我们注意到,紧密反转可以轻松地与以前的反转方法(例如 Edit Friendly DDPM、ReNoise)集成,通过切换本机扩散核心为 IP 适配器修改的模型,紧密反转一致地改进了这些方法,在重构和可编辑性方面。’

数据和测试

研究人员评估了 TI 在重构和编辑现实世界源图像方面的能力。所有实验都使用 Stable Diffusion XL,并使用 DDIM 调度器,如 原始 Stable Diffusion 论文 中所述;所有测试都使用 50 个去噪步骤,指导规模默认为 7.5。

对于图像条件,使用 IP-Adapter-plus sdxl vit-h。对于少步测试,研究人员使用 SDXL-Turbo,并使用 Euler 调度器,并且还进行了使用 FLUX.1-dev 的实验,在这种情况下,模型的条件是 PuLID-Flux,使用 RF-Inversion,步骤为 28。

PulID 仅用于包含人脸的案例,因为这就是 PulID 被训练来解决的领域 – 而我们对生成人脸的浓厚兴趣表明,仅仅依赖像 Stable Diffusion 这样的基础模型的权重可能不够,我们对这个特定任务的标准要求。

重构测试用于定量和定性评估。在下图中,我们看到 DDIM 反转的定性示例:

DDIM 反转的定性结果。每行显示一个高细节图像及其重构版本,每一步使用进步更精确的条件进行反转和去噪。随着条件变得更准确,重构质量会提高。右列显示了最佳结果,其中原始图像本身被用作条件,实现了最高保真度。整个过程中都没有使用 CFG。请参考源文档以获取更好的分辨率和详细信息。

DDIM 反转的定性结果。每行显示一个高细节图像及其重构版本,每一步使用进步更精确的条件进行反转和去噪。随着条件变得更准确,重构质量会提高。右列显示了最佳结果,其中原始图像本身被用作条件,实现了最高保真度。整个过程中都没有使用 CFG。请参考源文档以获取更好的分辨率和详细信息。

论文指出:

‘这些示例强调了条件反转过程对图像的显著改进,特别是在高细节区域。 ‘

‘值得注意的是,在下图的第三个示例中,我们的方法成功地重构了右拳击手背上的纹身。另外,拳击手的腿部姿势被更准确地保留下来,腿上的纹身变得可见。’

DDIM 反转的进一步定性结果。描述性条件改进了 DDIM 反转,图像条件优于文本,特别是在复杂图像上。

DDIM 反转的进一步定性结果。描述性条件改进了 DDIM 反转,图像条件优于文本,特别是在复杂图像上。

作者还测试了紧密反转作为现有系统的插入模块,将修改后的版本与其基线性能进行比较。

测试的三个系统是上述的 DDIM 反转和 RF-Inversion,以及 ReNoise,后者与本论文有一些共同的作者。由于 DDIM 结果没有难以获得 100% 的重构,研究人员仅关注可编辑性。

下面是论文中关于 SDXL 和 Flux 的定性结果的选择,我们建议读者参考源 PDF 以获取更好的分辨率和清晰度。

论文中关于 SDXL 和 Flux 的定性结果的选择。我们建议读者参考源 PDF 以获取更好的分辨率和清晰度。

论文中关于 SDXL 和 Flux 的定性结果的选择。我们建议读者参考源 PDF 以获取更好的分辨率和清晰度。

作者认为,紧密反转在重构和可编辑性之间取得了更好的平衡,一致地优于现有的反转技术。标准方法,如 DDIM 反转和 ReNoise,可以很好地恢复图像,但论文指出,它们在应用编辑时经常难以保留细节。

相比之下,紧密反转利用图像条件将模型的输出更紧密地锚定在原始图像上,防止不必要的失真。作者认为,即使竞争方法产生看似准确的重构,编辑的引入往往会导致伪影或结构不一致,而紧密反转减轻了这些问题。

最后,通过使用 MagicBrush 基准测试,使用 DDIM 反转和 LEDITS++,并使用 CLIP Sim 进行测量,得到了定量结果。

紧密反转与 MagicBrush 基准测试的定量比较。

紧密反转与 MagicBrush 基准测试的定量比较。

作者总结道:

‘在两个图中,图像保存和对目标编辑的遵循之间的权衡都很明显。紧密反转在这个权衡上提供了更好的控制,并且更好地保留了输入图像,同时仍然与编辑提示保持一致。 ‘

‘注意,图像和文本提示之间的 CLIP 相似度超过 0.3 表示图像和提示之间的合理对齐。’

结论

虽然紧密反转并不代表对一个最棘手的挑战的突破,但它整合了多种繁琐的辅助方法,形成了一个统一的 AI 基于图像编辑方法。

尽管紧密反转在保真度和可编辑性之间的紧张关系并没有消失,但根据所呈现的结果,显著减少了。考虑到这项工作所解决的核心挑战可能最终难以在其自身条件下解决(而不是在未来系统中超越基于 LDM 的架构),紧密反转代表了对当前状态的欢迎的增量改进。

 

首次发布于 2025 年 2 月 28 日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai