Anderson 视角

生成性AI中的零次定制化斗争

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Timothy Chalomet replaces Jack Nicholson in The Shining (1980), thanks to the new HyperLoRA system. Source: https://arxiv.org/pdf/2503.16944

如果你想将自己放入一个流行的图像或视频生成工具中,但你还没有足够的名气让基础模型认识你,你需要使用一组自己的照片来训练一个低秩适应(LoRA)模型。一旦创建,这个个性化的LoRA模型就可以让生成模型在未来输出中包含你的身份。

这通常被称为图像和视频合成研究领域中的定制化。它首先出现在2022年夏天Stable Diffusion出现后的几个月内,谷歌研究的DreamBooth项目提供了高千兆字节的定制化模型,采用了闭源模式,很快被爱好者社区采用和发布。

LoRA模型迅速跟进,并提供了更容易的训练和更轻的文件大小,在最小或没有质量损失的情况下,迅速主导了Stable Diffusion和其后继模型的定制化场景,例如Flux,现在还有新的生成视频模型,如Hunyuan Video和Wan 2.1。

重复和重复

问题是,每当一个新模型出现时,它需要一个新的LoRA生成,这对LoRA生产者来说代表了相当大的摩擦,他们可能会训练一系列自定义模型,但最终发现模型更新或流行的新模型意味着他们需要从头开始。

因此,零次定制化方法已经成为近期文献中的一个重要研究方向。在这种情况下,用户不需要自己训练一个子模型,而是直接提供一张或多张照片,让系统解释这些输入并生成输出。

下面我们可以看到,除了面部交换,PuLID系统还可以将ID值融入风格转换中:

使用PuLID系统的面部ID转换示例。来源:https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

使用PuLID系统的面部ID转换示例。 来源:https://github.com/ToTheBeginning/PuLID?tab=readme-ov-file

虽然用一个通用适配器替换LoRA是一个很好的想法,但这也很有挑战性;LoRA训练过程中获得的极端关注细节和覆盖范围很难在一次性IP-Adapter风格的模型中模拟,这个模型需要在没有分析大量身份图像的优点的情况下匹配LoRA的细节和灵活性。

HyperLoRA

考虑到这一点,ByteDance提出了一个生成实际LoRA代码的系统,这在零次解决方案中是唯一的:

左边是输入图像,右边是基于源图像的输出,有效地生成了安东尼·霍普金斯和安·海瑟薇的深度伪造图像。来源:https://arxiv.org/pdf/2503.16944

左边是输入图像,右边是基于源图像的输出,有效地生成了安东尼·霍普金斯和安·海瑟薇的深度伪造图像。 来源:https://arxiv.org/pdf/2503.16944

该论文指出:

‘基于适配器的技术,如IP-Adapter,会冻结基础模型参数,并采用插件架构来实现零次推理,但它们通常缺乏自然性和真实性,这在肖像合成任务中是不容忽视的。 ‘

‘我们提出了一种参数高效的自适应生成方法,称为HyperLoRA,它使用自适应插件网络来生成LoRA权重,结合了LoRA的卓越性能和适配器方案的零次能力。 ‘

‘通过我们精心设计的网络结构和训练策略,我们实现了零次个性化肖像生成(支持单个和多个图像输入),具有高的照片真实性、保真度和可编辑性。 ‘

最有用的是,该系统可以与现有的ControlNet一起使用,实现生成的高特异性:

蒂莫西·查拉梅在《闪灵》(1980)中出现,基于HyperLoRA的三张输入照片和ControlNet掩码。

蒂莫西·查拉梅在《闪灵》(1980)中出现,基于HyperLoRA的三张输入照片和ControlNet掩码。

至于新系统是否会被提供给最终用户,ByteDance在这方面有合理的记录,已经发布了强大的LatentSync唇-sync框架,并刚刚发布了InfiniteYou框架。

负面的是,该论文没有表明发布的意图,而且所需的训练资源对于爱好者社区来说是难以重现的(就像DreamBooth一样)。

新论文的标题是HyperLoRA:参数高效的自适应生成用于肖像合成,来自ByteDance和ByteDance的智能创作部门的七位研究人员。

方法

新方法使用稳定扩散潜在扩散模型(LDM)SDXL作为基础模型,虽然原则上适用于扩散模型,但训练需求可能使其难以应用于生成视频模型。

HyperLoRA的训练过程分为三个阶段,每个阶段旨在隔离和保存特定信息的学习权重。这个环形过程的目标是防止身份相关的特征被不相关的元素污染,同时实现快速和稳定的收敛。

HyperLoRA的概念架构。模型分为'Hyper ID-LoRA'用于身份特征和'Hyper Base-LoRA'用于背景和服装。这种分离减少了特征泄漏。在训练期间,SDXL基础和编码器被冻结,只更新HyperLoRA模块。在推理时,只需要ID-LoRA来生成个性化图像。

HyperLoRA的概念架构。模型分为’Hyper ID-LoRA’用于身份特征和’Hyper Base-LoRA’用于背景和服装。这种分离减少了特征泄漏。在训练期间,SDXL基础和编码器被冻结,只更新HyperLoRA模块。在推理时,只需要ID-LoRA来生成个性化图像。

第一阶段专注于学习一个’Base-LoRA’(上图左下),它捕获了与身份无关的细节。

为了强制这种分离,研究人员故意模糊了训练图像中的面部,允许模型关注背景、照明和姿势等方面,但不关注身份。这个“热身”阶段作为一个过滤器,去除低级别的干扰,然后开始身份特定的学习。

在第二阶段,引入了一个’ID-LoRA’(上图左上)。这里,面部身份使用两个并行路径进行编码:一个CLIP视觉变换器(CLIP ViT)用于结构特征和InsightFace AntelopeV2编码器用于更抽象的身份表示。

过渡方法

CLIP特征有助于模型快速收敛,但存在过拟合的风险,而Antelope嵌入更稳定但训练速度较慢。因此,系统首先更依赖于CLIP,然后逐渐引入Antelope,以避免不稳定性。

在最后阶段,CLIP引导的注意力层被完全冻结。只有AntelopeV2链接的注意力模块继续训练,允许模型在不降低先前学习组件的保真度或普遍性的情况下改进身份保存。

这种分阶段结构本质上是一种分离尝试。身份和非身份特征首先被分离,然后独立改进。这是一种有针对性的方法,用于应对个人化的常见失败模式:身份漂移、低可编辑性和过拟合到偶然特征。

权重

在CLIP ViT和AntelopeV2提取了给定肖像的结构和身份特征后,获得的特征被传递给一个基于变换器的模块,称为感知器重采样器(来自IP-Adapter项目),该模块将特征映射到一个紧凑的系数集。

使用两个独立的重采样器:一个用于生成Base-LoRA权重(编码背景和非身份元素)和另一个用于ID-LoRA权重(专注于面部身份)。

HyperLoRA网络结构。

HyperLoRA网络结构。

输出系数然后与一组学习的LoRA基矩阵线性组合,生成完整的LoRA权重,而无需对基础模型进行微调。

这种方法允许系统完全在线生成个性化权重,使用图像编码器和轻量级投影,同时仍然利用LoRA修改基础模型行为的能力。

数据和测试

为了训练HyperLoRA,研究人员使用了LAION-2B数据集的4.4百万张面部图像的子集(现在最好被认为是2022年原始Stable Diffusion模型的数据源)。

InsightFace被用来过滤掉非肖像面部和多个图像。图像然后被BLIP-2字幕系统注释。

在数据增强方面,图像被随机裁剪到面部周围,但始终关注面部区域。

相应的LoRA秩需要适应训练设置中的可用内存。因此,ID-LoRA的LoRA秩被设置为8,而Base-LoRA的秩被设置为4,同时使用八步梯度累积来模拟比实际硬件上可能的更大的批大小。

研究人员顺序训练Base-LoRA、ID-LoRA(CLIP)和ID-LoRA(身份嵌入)模块,分别为20K、15K和55K次迭代。在ID-LoRA训练期间,他们从三个条件场景中采样,概率分别为0.9、0.05和0.05。

系统使用PyTorch和Diffusers实现,整个训练过程在16个NVIDIA A100 GPU上运行了大约十天。

ComfyUI测试

作者在ComfyUI合成平台中构建了工作流,以比较HyperLoRA与三个竞争方法:InstantID;上述IP-Adapter,以IP-Adapter-FaceID-Portrait框架的形式;以及上述PuLID。整个框架中使用了一致的种子、提示和采样方法。

作者指出,基于适配器(而不是LoRA)的方法通常需要较低的分类器自由指导(CFG)规模,而LoRA(包括HyperLoRA)在这方面更宽容。

因此,研究人员使用了开源的SDXL微调检查点变体LEOSAM的Hello World,用于测试。对于定量测试,使用了Unsplash-50图像数据集。

指标

为了衡量保真度,作者使用CLIP图像嵌入(CLIP-I)和通过CurricularFace提取的独立身份嵌入(ID Sim)之间的余弦距离。

每种方法生成四张高分辨率头像,每个身份在测试集中,结果然后平均。

可编辑性通过比较CLIP-I得分(在输出中有和没有身份模块)以及CLIP图像文本对齐(CLIP-T)来评估,后者跨越了十个提示变体,涵盖了发型、配饰、服装和背景等方面。

作者将Arc2Face基础模型纳入比较中——一个在固定字幕和裁剪的面部区域上训练的基线模型。

对于HyperLoRA,测试了两个变体:一个仅使用ID-LoRA模块,另一个使用ID-LoRA和Base-LoRA,后者加权为0.4。虽然Base-LoRA提高了保真度,但它略微限制了可编辑性。

初始定量比较的结果。

初始定量比较的结果。

在定量测试中,作者评论说:

‘Base-LoRA有助于提高保真度,但限制了可编辑性。虽然我们的设计将图像特征解耦为不同的LoRA,但很难避免相互泄漏。因此,我们可以调整Base-LoRA的权重以适应不同的应用场景。 ‘

‘我们的HyperLoRA(全和ID)实现了最好和次好的面部保真度,而InstantID在面部ID相似度方面表现出色,但面部保真度较低。 ‘

‘这两个指标都应被考虑在内,以评估保真度,因为面部ID相似度更抽象,而面部保真度反映了更多细节。 ‘

在定性测试中,基本的权衡取舍凸显出来(请注意,我们没有空间重现所有图像以获得定性结果,我们将读者引导至源论文以获取更多图像和更好的分辨率):

定性比较。从上到下,使用的提示分别是:白衬衫和狼耳(见论文中更多示例)。

定性比较。从上到下,使用的提示分别是:’白衬衫’和’狼耳’(见论文中更多示例)。

这里,作者评论说:

‘IP-Adapter和InstantID生成的肖像的皮肤具有明显的AI生成纹理,这有点过饱和,远离了照片真实性。 ‘

‘这是适配器方法的常见缺点。PuLID通过减少对基础模型的侵入来改善这个问题,优于IP-Adapter和InstantID,但仍然遭受模糊和缺乏细节的困扰。 ‘

‘相比之下,LoRA直接修改基础模型的权重,而不是引入额外的注意力模块,通常会生成高细节和照片真实的图像。 ‘

作者认为,因为HyperLoRA直接修改基础模型的权重,而不是依赖外部注意力模块,所以它保留了传统LoRA方法的非线性能力,可能在保真度和细节捕捉方面提供优势。

在定性比较中,论文断言HyperLoRA的布局更具连贯性,更加符合提示,与PuLID生成的图像类似,但比InstantID或IP-Adapter(偶尔会忽略提示或生成不自然的组合)更强。

使用HyperLoRA的ControlNet生成的更多示例。

使用HyperLoRA的ControlNet生成的更多示例。

结论

过去18个月中不断涌现的各种一次性定制化系统,已经呈现出一种绝望的特质。很少有创新取得了显著的进步;而那些取得了一点进步的创新,往往具有过高的训练需求和/或极其复杂或资源密集的推理需求。

虽然HyperLoRA自己的训练方案和许多最近的类似创新一样令人震惊,但至少最终得到的是一个可以直接处理定制化的模型。

从论文的补充材料中,我们注意到HyperLoRA的推理速度比IP-Adapter更好,但比其他两种方法更差——这些数字基于NVIDIA V100 GPU,这不是典型的消费者硬件(尽管新款“家庭”NVIDIA GPU可以匹配或超过V100的最大32GB VRAM)。

竞争方法的推理速度(毫秒)。

竞争方法的推理速度(毫秒)。

可以说,零次定制化仍然是一个未解决的问题,从实际角度来看,HyperLoRA的显著硬件要求与其产生真正长期单一基础模型的能力相矛盾。

* 代表640GB或1280GB的VRAM,具体取决于使用的模型(未指定)

首次发布于2025年3月24日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai