Anderson 视角

使用 AI 还原和编辑人像图像

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

加州大学默塞德分校和 Adobe 之间的新合作关系使人像图像完成领域取得了突破——这是一项长期研究的任务,旨在“去遮挡”图像中被遮挡或隐藏的部分,例如用于虚拟试穿、动画和照片编辑等目的。

除了修复损坏的图像或根据用户的意愿修改图像外,CompleteMe 等人像图像完成系统还可以将新衣服(通过参考图像,如中间列中的两个示例)叠加到现有图像上。这些示例来自新论文的详细补充 PDF。来源:https://liagm.github.io/CompleteMe/pdf/supp.pdf

除了修复损坏的图像或根据用户的意愿修改图像外,CompleteMe 等人像图像完成系统还可以将新衣服(通过参考图像,如中间列中的两个示例)叠加到现有图像上。这些示例来自新论文的详细补充 PDF。来源:https://liagm.github.io/CompleteMe/pdf/supp.pdf

新的方法,名为 CompleteMe:基于参考的人像图像完成,使用补充输入图像来“建议”系统应该用什么内容来替换人像图像中隐藏或缺失的部分(因此适用于基于时尚的试穿框架):

CompleteMe 系统可以将参考内容适应人像图像中被遮挡或遮蔽的部分。

CompleteMe 系统可以将参考内容适应人像图像中被遮挡或遮蔽的部分。

新系统使用双 U-Net 架构和一个区域关注注意力(RFA)块,用于将资源分配到图像恢复实例的相关区域。

研究人员还提出了一种新的基准系统,用于评估基于参考的完成任务(由于 CompleteMe 是计算机视觉中一个正在进行的研究线的一部分,但迄今为止尚无基准模式)。

在测试中,新方法在大多数指标上表现更好,总体而言也更好。在某些情况下,竞争方法完全被基于参考的方法所困惑:

来自补充材料:AnyDoor 方法在解释参考图像时遇到特别困难。

来自补充材料:AnyDoor 方法在解释参考图像时遇到特别困难。

论文指出:

‘我们在基准测试中进行了广泛的实验,证明 CompleteMe 在量化指标、定性结果和用户研究方面优于现有的基于参考和非基于参考的方法。 ‘

‘特别是在涉及复杂姿势、复杂服装图案和独特配饰的具有挑战性的场景中,我们的模型始终实现了更好的视觉保真度和语义一致性。 ‘

遗憾的是,该项目的 GitHub 页面没有代码,也没有承诺提供代码,该项目似乎被视为专有架构,还有一个简单的项目页面:

新系统的主观性能与先前方法的进一步示例。文章后面会有更多详细信息。

新系统的主观性能与先前方法的进一步示例。文章后面会有更多详细信息。

方法

CompleteMe 框架由一个参考 U-Net 支持,负责将辅助材料集成到过程中,并且有一个连贯的 U-Net,可以容纳更广泛的过程以获得最终结果,如下面的概念方案所示:

CompleteMe 的概念方案。来源:https://arxiv.org/pdf/2504.20042

CompleteMe 的概念方案。来源:https://arxiv.org/pdf/2504.20042

系统首先将掩码输入图像编码为潜在表示。同时,参考 U-Net 处理多个参考图像——每个图像显示不同的身体区域——以提取详细的空间特征。

这些特征通过嵌入在“完成”U-Net 中的区域关注注意力块传递,使用相应的区域掩码选择性地掩码它们,以确保模型仅关注参考图像中的相关区域。

掩码特征然后通过解耦的跨注意力与使用 CLIP 提取的全局语义特征相结合,允许模型使用细节和语义一致性来重建缺失内容。

为了增强真实性和鲁棒性,输入掩码过程将随机网格遮挡与人体形状掩码相结合,每个遮挡都以相等的概率应用,增加了模型必须完成的缺失区域的复杂性。

仅供参考

基于参考的图像修复的先前方法通常依赖于语义级别的编码器。这种项目的例子包括 CLIP 本身和 DINOv2,它们从参考图像中提取全局特征,但通常会丢失完成图像所需的细节空间细节。

来自较旧的 DINOv2 方法的发布论文,该方法包含在新研究的比较测试中:彩色叠加层显示了应用于每列图像块的主成分分析(PCA)的前三个主成分,突出了 DINOv2 如何跨不同图像对相似对象部分进行分组。尽管姿势、风格或渲染存在差异,但相应区域(如翅膀、肢体或轮子)始终保持一致,表明模型能够在无监督的情况下学习基于部件的结构。来源:https://arxiv.org/pdf/2304.07193

来自较旧的 DINOv2 方法的发布论文,该方法包含在新研究的比较测试中:彩色叠加层显示了应用于每列图像块的主成分分析(PCA)的前三个主成分,突出了 DINOv2 如何跨不同图像对相似对象部分进行分组。尽管姿势、风格或渲染存在差异,但相应区域(如翅膀、肢体或轮子)始终保持一致,表明模型能够在无监督的情况下学习基于部件的结构。来源:https://arxiv.org/pdf/2304.07193

CompleteMe 通过从 Stable Diffusion 1.5 初始化的专用参考 U-Net 来解决这个问题,但不使用扩散噪声步骤*。

每个参考图像,覆盖不同的身体区域,都被编码成详细的潜在特征。全局语义特征也使用 CLIP 单独提取,并且两个特征集都被缓存以便在基于注意力的集成期间高效使用。因此,系统可以灵活地适应多个参考输入,同时保留细粒度的外观信息。

编排

连贯的 U-Net 管理完成过程的最后阶段。从 Stable Diffusion 1.5 的修复变体中改编而来,它以潜在形式接收掩码源图像作为输入,并且接收来自参考图像的详细空间特征和使用 CLIP 编码器提取的全局语义特征。

这些各种输入通过区域关注注意力块结合在一起,该块在引导模型的注意力转向参考材料的最相关区域方面发挥着至关重要的作用。

在进入注意力机制之前,参考特征被显式掩码以删除不相关的区域,然后与源图像的潜在表示连接,确保注意力被尽可能精确地引导。

为了增强这种集成,CompleteMe 集成了来自 IP-Adapter 框架的解耦跨注意力机制:

IP-Adapter,是 CompleteMe 的一部分,是过去三年中发展最快的潜在扩散模型架构中最成功、最常用的项目之一。来源:https://ip-adapter.github.io/

IP-Adapter,是 CompleteMe 的一部分,是过去三年中发展最快的潜在扩散模型架构中最成功、最常用的项目之一。来源:https://ip-adapter.github.io/

这允许模型通过单独的注意力流处理空间详细的视觉特征和更广泛的语义上下文,然后将它们组合起来,得到一个连贯的重建,作者声称它既能保留身份也能保留细节。

基准测试

由于缺乏适合的人类参考完成数据集,研究人员创建了自己的数据集。基准数据集是通过从 Adobe Research 2023 年的 UniHuman 项目中策划的 WPose 数据集构建而成的。

Adobe Research 2023 年 UniHuman 项目的姿势示例。来源:https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

Adobe Research 2023 年 UniHuman 项目的姿势示例。来源:https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

研究人员手动绘制了源掩码以指示填充区域,最后获得了 417 个三元图像组,包括源图像、掩码和参考图像。

从参考 WPose 数据集中初始派生的两个组,经过研究人员的广泛策划。

从参考 WPose 数据集中初始派生的两个组,经过研究人员的广泛策划。

作者使用 LLaVA 大型语言模型(LLM)生成文本提示以描述源图像。

使用的指标比平常更广泛;除了通常的峰值信噪比(PSNR)、结构相似性指数(SSIM)和学习到的感知图像补丁相似性(LPIPS,用于评估掩码区域),研究人员还使用 DINO 进行相似性评分;DreamSim 进行生成结果评估;以及 CLIP。

数据和测试

为了测试工作,作者使用了默认的 Stable Diffusion V1.5 模型和 1.5 修复模型。系统的图像编码器使用了 CLIP 视觉模型,以及投影层——这些是将 CLIP 输出重塑或对齐以匹配模型内部使用的特征维度的中等神经网络。

训练过程持续 30,000 次迭代,使用八个 NVIDIA A100 GPU,受均方误差(MSE)损失函数的监督,批次大小为 64,学习率为 2×10-5。训练过程中,系统的各个元素被随机丢弃,以防止系统过拟合数据。

数据集是从 Parts to Whole 数据集修改而来的,后者是基于 DeepFashion-MultiModal 数据集的。

用于开发 CompleteMe 的策划数据的 Parts to Whole 数据集示例。来源:https://huanngzh.github.io/Parts2Whole/

用于开发 CompleteMe 的策划数据的 Parts to Whole 数据集示例。来源:https://huanngzh.github.io/Parts2Whole/

作者指出:

‘为了满足我们的需求,我们通过使用具有多个参考图像的遮挡图像来重建训练对,这些图像捕捉了人体外观的各个方面,并附有简短的文本标签。 ‘

‘每个样本在我们的训练数据中包括六种外观类型:上身服装、下身服装、全身服装、头发或头饰、面部和鞋子。对于遮挡策略,我们在 1 到 30 次之间应用 50% 的随机网格遮挡,对于另外 50%,我们使用人体形状遮挡来增加遮挡复杂性。 ‘

‘在构建管道之后,我们获得了 40,000 个图像对用于训练。 ‘

测试的先前非参考方法是 Large occluded human image completion(LOHC)和图像修复模型 BrushNet;测试的参考模型是 Paint-by-Example、AnyDoor、LeftRefill 和 MimicBrush。

作者首先进行了数量上的比较,使用前面提到的指标:

初始数量比较的结果。

初始数量比较的结果。

关于数量评估,作者指出 CompleteMe 在大多数感知指标(包括 CLIP-I、DINO、DreamSim 和 LPIPS)上获得了最高分,这些指标旨在捕捉输出和参考图像之间的语义对齐和外观保真度。

然而,该模型并非在所有基准测试中都优于所有基准。值得注意的是,BrushNet 在 CLIP-T 上得分最高,LeftRefill 在 SSIM 和 PSNR 上领先,MimicBrush 在 CLIP-I 上略微优于 CompleteMe。

虽然 CompleteMe 总体上表现出一致的强大结果,但在某些情况下,性能差异很小,并且某些指标仍然由竞争对手方法领先。也许作者不公平地将这些结果视为 CompleteMe 在结构和感知维度上平衡的优势证据。

为本研究进行的定性测试的图示太多,无法在此复制,我们不仅建议读者参阅原始论文,还建议参阅包含许多其他定性示例的详细补充 PDF:

主论文中呈现的初始定性结果。请参阅原始论文以获取更好的分辨率。

主论文中呈现的初始定性结果。请参阅原始论文以获取更好的分辨率。

关于上述定性结果,作者评论说:

‘给定掩码输入,这些非参考方法使用图像先验或文本提示生成掩码区域的可信内容。 ‘

‘然而,如红框所示,它们无法复制诸如纹身或独特服装图案等特定细节,因为它们缺乏参考图像来指导相同信息的重建。 ‘

一个比较,部分如下,侧重于四种基于参考的方法:Paint-by-Example、AnyDoor、LeftRefill 和 MimicBrush。在这里,只提供了一张参考图像和一个文本提示。

与基于参考的方法的定性比较。CompleteMe 生成更真实的完成并且更好地保留了参考图像中的特定细节。红框突出了特别感兴趣的区域。

与基于参考的方法的定性比较。CompleteMe 生成更真实的完成并且更好地保留了参考图像中的特定细节。红框突出了特别感兴趣的区域。

作者指出:

‘给定一个掩码的人类图像和一个参考图像,其他方法可以生成可信的内容,但通常无法准确地保留参考图像中的上下文信息。 ‘

‘在某些情况下,它们会生成不相关的内容或错误地映射参考图像中的相应部分。相比之下,CompleteMe 通过准确地保留相同的信息并正确地映射参考图像中的人体相应部分来有效地完成掩码区域。 ‘

为了评估模型与人类感知的吻合程度,作者进行了一项用户研究,涉及 15 名注释员和 2,895 个样本对。每对样本都比较了 CompleteMe 的输出与四个基于参考的基准之一:Paint-by-Example、AnyDoor、LeftRefill 或 MimicBrush。

注释员根据完成区域的视觉质量和它保留参考图像中身份特征的程度来评估每个结果——在这里,评估整体质量和身份,CompleteMe 获得了更明确的结果:

用户研究的结果。

用户研究的结果。

结论

如果有什么的话,这项研究中的定性结果被它们的庞大数量所削弱,因为仔细检查表明新的系统是这一相对小众但备受追捧的神经图像编辑领域中最有效的贡献。

然而,需要花费一点额外的时间和对原始 PDF 进行放大,以便在与先前方法的比较中欣赏系统如何将参考材料适应于被遮挡的区域:

我们强烈建议读者仔细检查补充材料中呈现的最初令人困惑的、如果不是压倒性的结果洪流。

我们强烈建议读者仔细检查补充材料中呈现的最初令人困惑的、如果不是压倒性的结果洪流。

 

* 值得注意的是,现已过时的 V1.5 版本仍然是研究人员的最爱——部分原因是遗产的同类比较测试,但也因为它是所有 Stable Diffusion 迭代中最不受审查和最容易训练的,也不具备 FOSS Flux 版本的审查限制*。

VRAM 规格未给出——它将是每张卡 40GB 或 80GB。

首次发布于 2025 年 4 月 29 日,星期二

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai