มุมมองของ Anderson
การปรับปรุง Green Screen Generation สำหรับ Stable Diffusion

尽管社区和投资者对视觉生成 AI 热情高涨,但此类系统的输出并不总是适合现实世界使用;例如,生成 AI 系统往往输出整个图像(或视频中的图像序列),而不是多媒体应用和视觉效果实践者通常需要的个别、隔离的元素。
一个简单的例子是设计为“浮动”在用户选择的目标背景上的剪贴画:

可能最熟悉于 Photoshop 用户的浅灰色网格背景,甚至在简单的消费品中代表了 alpha 通道或透明度通道,例如股票图像。
这种透明度已经可用超过三十年;自 1990 年代初的数字革命以来,用户可以通过日益复杂的工具集和技术从视频和图像中提取元素。
例如,删除视频 footage 中的蓝色和绿色背景的挑战,曾经是昂贵的化学过程和光学打印机(以及手工制作的遮罩)的领域,已经成为 Adobe 的 After Effects 和 Photoshop 应用程序(以及许多其他免费和专有程序和系统)中几分钟的工作。
一旦元素被隔离,alpha 通道(有效地遮挡任何不相关的内容)允许视频中的任何元素轻松地叠加在新背景上,或与其他隔离的元素组合。

alpha 通道示例,其效果在下行中显示。来源:https://helpx.adobe.com/photoshop/using/saving-selections-alpha-channel-masks.html
删除
在计算机视觉中,创建 alpha 通道属于语义分割的范畴,开源项目如 Meta 的 Segment Anything 提供了一种基于文本提示的方法来隔离/提取目标对象,通过增强对象识别的语义分割。
Segment Anything 框架已被用于各种视觉效果提取和隔离工作流程,例如 Alpha-CLIP 项目。

使用 Segment Anything 在 Alpha-CLIP 框架中进行的提取示例:
还有许多其他语义分割方法可以适应 alpha 通道分配任务。
然而,语义分割依赖于训练数据,这些数据可能不包含所有需要提取的对象类别。虽然训练了大量数据的模型可以识别更广泛的对象,但它们仍然受到其训练数据的限制。

语义分割系统(如 Segment Anything)可能难以识别某些对象或对象的某些部分,如这里的模糊提示输出所示。来源:https://maucher.pages.mi.hdm-stuttgart.de/orbook/deeplearning/SAM.html
在任何情况下,语义分割都是一种事后处理过程,就像绿幕过程一样,并且必须在没有单一背景颜色的优势下隔离元素,这种背景颜色可以被有效地识别和删除。
因此,用户社区曾经认为,图像和视频可以生成包含绿幕背景,这些背景可以通过传统方法轻松删除。
不幸的是,流行的潜在扩散模型(如 Stable Diffusion)通常难以渲染出鲜艳的绿幕背景。这是因为这些模型的训练数据通常不包含大量此类专用场景的示例。即使系统成功渲染,也容易将“绿色”概念扩散到前景主体中,导致概念纠缠:

上图显示 Stable Diffusion 优先考虑图像的真实性而不是创建单一的绿色强度,有效地复制了传统绿幕场景中发生的现实世界问题。下图显示“绿色”概念污染了前景图像。来源:https://stablediffusionweb.com/
尽管采用了先进的方法,但这两个问题仍然存在:女人的裙子和男人的领带(在下面的图像中)仍然会随着绿色背景一起消失——这是 1970 年代和 1980 年代照片化学蚀刻染色去除的遗留问题。
正如往常一样,模型的缺点可以通过将特定数据应用于问题并投入大量训练资源来克服。像斯坦福 2024 年的 LayerDiffuse 这样的系统可以生成具有 alpha 通道的图像:

斯坦福 LayerDiffuse 项目在一百万张图像上进行了训练,这些图像能够使模型具有透明度。来源:https://arxiv.org/pdf/2402.17113
不幸的是,LayerDiffuse 使用的数据集不公开,这限制了在其上训练的模型的使用。即使这种障碍不存在,这种方法也很难定制或开发以满足特定用例。
稍后,在 2024 年,Adobe Research 与 Stonybrook 大学合作,开发了一种名为 MAGICK 的 AI 提取方法,该方法使用自定义的扩散图像进行训练。

2024 年论文中 MAGICK 中的细粒度 alpha 通道提取示例。来源:https://openaccess.thecvf.com/content/CVPR2024/papers/Burgert_MAGICK_A_Large-scale_Captioned_Dataset_from_Matting_Generated_Images_using_CVPR_2024_paper.pdf
150,000 个提取的、AI 生成的对象被用于训练 MAGICK,以便系统能够对提取开发出直觉理解:

MAGICK 训练数据集的示例。
该数据集,如源论文所述,很难生成,因为扩散方法难以创建实色的色块。因此,需要手动选择生成的遮罩。
这种后勤瓶颈再次导致了一个不能轻松开发或定制的系统,而必须在其最初训练的能力范围内使用。
TKG-DM – 潜在扩散模型的“原生”色键提取
德国和日本研究人员之间的新合作提出了一个替代方案,能够在不需要训练专用数据集的情况下获得更好的结果。

TKG-DM 通过修改生成图像的随机噪声来生成实色背景 – 可以是任何颜色。来源:https://arxiv.org/pdf/2411.15580
新方法通过优化潜在扩散模型(如 Stable Diffusion)中生成图像的随机噪声来解决问题,方法是对噪声进行条件处理以鼓励所需的背景/前景分离。
这种方法建立在对 Stable Diffusion 分布的色彩方案的前期研究基础上,并能够在不扩散到前景内容的情况下生成任何背景颜色。

初始噪声通过通道均值偏移进行条件处理,能够在不扩散到前景内容的情况下影响去噪过程的某些方面。
论文指出:
‘我们的广泛实验表明,TKG-DM 通过提高 33.7% 和 35.9% 的 FID 和 mask-FID 得分,优于上述方法。 ‘
‘因此,我们的无需训练的模型在不需要训练专用数据集的情况下,能够与精调模型相媲美,提供了一种高效且通用的解决方案,适用于需要精确前景和背景控制的各种视觉内容创建任务。 ‘
这篇题为 TKG-DM:训练免费的色键内容生成扩散模型 的新论文来自德国和日本的七位研究人员。
方法
新方法通过条件处理初始高斯噪声来扩展 Stable Diffusion 的架构,方法是使用通道均值偏移(CMS)生成噪声模式,以鼓励生成结果中的所需背景/前景分离。

拟议系统的架构。
CMS 调整每个颜色通道的均值,同时保持去噪过程的总体发展。
作者解释说:
‘为了在色键背景上生成前景对象,我们应用了一种初始噪声选择策略,该策略使用 2D 高斯掩码选择性地组合初始噪声和初始颜色噪声。 ‘
‘该掩码通过保留前景区域的原始噪声并将颜色偏移的噪声应用于背景区域来创建平滑过渡。 ‘

所需的背景色键颜色通过空文本提示进行实例化,而前景内容则通过用户的文本指令创建。
自注意力和交叉注意力用于分离图像的两个方面(色键背景和前景内容)。自注意力有助于前景对象的内部一致性,而交叉注意力则保持对文本提示的忠实度。论文指出,背景图像通常不太详细,生成中也没有那么强调,因此相对容易被纯色所取代。

色键风格生成过程中自注意力和交叉注意力的影响可视化。
数据和测试
TKG-DM 使用 Stable Diffusion V1.5 和 Stable Diffusion SDXL 进行了测试,图像分别生成为 512x512px 和 1024x1024px。
图像使用 Stable Diffusion 的 DDIM 调度器生成,指导规模为 7.5,去噪步骤为 50。目标背景颜色为绿色,现在是主导的删除方法。
新方法与 DeepFloyd、精调的低秩扩散模型 GreenBack LoRA 以及前面提到的 LayerDiffuse 进行了比较。
对于数据,使用了 MAGICK 数据集中的 3000 张图像。

MAGICK 数据集的示例,共 3000 张图像用于测试新系统。来源:https://ryanndagreat.github.io/MAGICK/Explorer/magick_rgba_explorer.html
对于指标,作者使用了 Fréchet 生成距离(FID)来评估前景质量,并开发了一个名为 m-FID 的项目特定指标,使用 BiRefNet 系统来评估生成的掩码质量。

BiRefNet 系统与先前方法的视觉比较。来源:https://arxiv.org/pdf/2401.03407
为了测试输入提示的语义一致性,使用了 CLIP-Sentence(CLIP-S)和 CLIP-Image(CLIP-I)方法。CLIP-S 评估提示的忠实度,而 CLIP-I 评估生成图像与真实图像的视觉相似度。

新方法的首个定性结果,使用 Stable Diffusion V1.5。请参阅源 PDF 以获取更好的分辨率。
作者声称结果(如上所示,SD1.5 和 SDXL)表明 TKG-DM 在无需精调或训练模型的情况下获得了更好的结果。

SDXL 的定性结果。请参阅源 PDF 以获取更好的分辨率。
他们观察到,当使用提示生成绿色背景时,Stable Diffusion 1.5 难以生成干净的背景,而 SDXL(尽管性能略好)会产生不稳定的浅绿色调,这可能会干扰色键过程中的分离。
他们进一步指出,LayerDiffuse 可以生成良好的分离背景,但有时会丢失细节(例如精确的数字或字母),并将其归因于数据集的局限性。他们还指出,遮罩生成有时会失败,导致“未裁剪”的图像。
在定量测试中,尽管 LayerDiffuse 在 SDXL 的 FID 分数上似乎占有优势,但作者强调这只是因为其数据集的局限性。任何未在数据集中涵盖或涵盖不充分的对象或类别可能不会表现得那么好,而进一步的精调将给用户带来数据集的策划和训练负担。

比较的定量结果。论文指出,LayerDiffuse 的明显优势是以灵活性为代价的,并带来了数据策划和训练的负担。
论文指出:
‘DeepFloyd 的高 FID、m-FID 和 CLIP-I 分数反映了其与真实图像的相似性,这得益于 DeepFloyd 的输出。然而,这种一致性使其在图像质量方面占有优势,使其不适合作为公平的基准。其较低的 CLIP-S 分数进一步表明其与其他模型相比的文本一致性较弱。 ‘
总体而言,这些结果凸显了我们模型生成高质量、文本一致的前景的能力,而无需精调,提供了一种高效的色键内容生成解决方案。 ‘
最后,研究人员进行了一项用户研究,以评估不同方法的提示一致性。100 名参与者被要求评估每种方法的 30 个图像对,使用 BiRefNet 和所有示例的手动精修。作者的无需训练的方法在这项研究中被更喜欢。

用户研究结果。
TKG-DM 与 Stable Diffusion 的流行第三方系统 ControlNet 兼容,作者声称它产生了比 ControlNet 的本地能力更好的结果。
结论
也许这篇新论文最值得注意的收获是潜在扩散模型的交叉关联程度,与公众对它们能够轻松分离图像和视频各个方面的流行看法形成鲜明对比。
该研究进一步强调了研究和爱好者社区转向精调作为解决模型缺陷的后续解决方案的程度——一种只能解决特定类别和对象类型的问题的解决方案。在这种情况下,精调的模型要么在有限的类别上表现非常好,要么在更高的对象和类别数量上表现得“可以接受”,这取决于训练集中数据的数量。
因此,看到至少有一种解决方案不依赖于这种劳动密集且可能不诚实的解决方案是令人耳目一新的。
* 1978 年拍摄超人电影时,演员克里斯托弗·里夫被要求穿着青绿色的超人服装进行蓝幕拍摄,以避免标志性的蓝色服装被抹去。服装的蓝色后来通过色彩分级恢复了。












