AI 模型与平台
基于多模态大语言模型的图像编辑指导
视觉设计工具和视觉语言模型在多媒体行业有广泛的应用。尽管近年来取得了显著的进步,但仍需要对这些工具有扎实的理解才能操作。为了提高可访问性和控制性,多媒体行业越来越多地采用基于文本的图像编辑技术或指令式图像编辑技术。这些技术使用自然语言命令而不是传统的区域掩码或详细描述,允许更灵活和可控的图像操作。然而,指令式方法通常提供简短的指令,这可能对现有的模型来说难以完全捕捉和执行。此外,扩散模型以其能够创建逼真的图像而闻名,在图像编辑领域备受青睐。
此外,多模态大语言模型(MLLMs)在涉及视觉感知和跨模态理解的任务中表现出色。MLLM引导图像编辑(MGIE)是一项研究,受MLLMs的启发,评估其能力,并分析它们如何通过文本或引导指令支持编辑。这种方法涉及学习提供明确的指导和推导表达性指令。MGIE编辑模型理解视觉信息,并通过端到端训练执行编辑。在本文中,我们将深入探讨MGIE,对其对全局图像优化、Photoshop风格的修改和局部编辑的影响进行评估。我们还将讨论MGIE在依赖表达性指令的指令式图像编辑任务中的重要性。让我们开始我们的探索。
MLLM引导图像编辑或MGIE:介绍
多模态大语言模型和扩散模型是目前最广泛使用的AI和ML框架,主要是由于其令人惊叹的生成能力。另一方面,你有扩散模型,以生成高度逼真和视觉上吸引人的图像而闻名,而另一方面,你有多模态大语言模型,以其在生成各种内容(包括文本、语言、语音和图像/视频)方面的非凡能力而闻名。
扩散模型交换潜在的跨模态映射,以执行反映输入目标字幕更改的视觉操作,并且它们还可以使用引导掩码来编辑图像的特定区域。但是,扩散模型被广泛用于多媒体应用的主要原因是,它们使用基于指令的编辑方法,允许用户直接使用文本指令或命令表达如何编辑图像。继续,Large Language Models不需要介绍,因为它们已经在各种语言任务(包括文本摘要、机器翻译、文本生成和回答问题)中展示了显著的进步。LLMs通常在大量和多样化的训练数据上进行训练,使它们具备视觉创造力和知识,允许它们执行各种视觉语言任务。基于LLMs,MLLMs或多模态大语言模型可以使用图像作为自然输入,并提供适当的视觉感知响应。
话虽如此,尽管扩散模型和MLLM框架被广泛用于图像编辑任务,但基于文本的指令存在一些指导问题,这会损害整体性能,从而导致MGIE或MLLM引导图像编辑的发展,MGIE是一种由扩散模型和MLLM模型组成的AI驱动框架,如下图所示。
在MGIE架构中,扩散模型通过端到端训练来执行图像编辑,具有对预期目标的潜在想象力,而MLLM框架学习预测精确的表达性指令。同时,扩散模型和MLLM框架利用视觉推导的固有能力来解决模糊的人类命令,从而实现图像的逼真编辑,如下图所示。
MGIE框架从两个现有方法中汲取灵感:指令式图像编辑和视觉大语言模型。
指令式图像编辑可以通过遵循人类命令显著提高视觉操作的可访问性和可控性。有两种主要框架用于指令式图像编辑:GAN框架和扩散模型。GAN或生成对抗网络能够改变图像,但要么仅限于特定域,要么产生不现实的结果。另一方面,扩散模型可以通过大规模训练控制跨模态注意力图来实现图像编辑和转换。指令式编辑通过接收直接命令作为输入来工作,通常不受区域掩码和详细描述的限制。然而,提供的指令可能是模糊的或不够精确以供编辑任务使用。
视觉大语言模型以其文本生成和概括能力而闻名,跨各种任务具有强大的文本理解能力,并且可以进一步生成可执行程序或伪代码。这种大语言模型的能力使MLLMs能够感知图像并提供适当的视觉感知响应,使用视觉特征对齐和指令微调,最近的模型采用MLLMs生成与聊天或输入文本相关的图像。然而,MGIE与MLLMs或VLLMs的区别在于,后者可以从头开始生成图像,而MGIE利用MLLMs的能力来增强图像编辑能力,推导出指令。
MGIE:架构和方法
传统上,大语言模型用于自然语言处理生成任务。但是,自从MLLMs流行以来,LLMs被赋予了通过感知图像输入提供合理响应的能力。通常,多模态大语言模型从预训练的LLM初始化,并包含一个视觉编码器和一个适配器,用于提取视觉特征,并将视觉特征投影到语言模态。因此,MLLM框架能够感知视觉输入,尽管输出仍然仅限于文本。
提出的MGIE框架旨在解决这个问题,并使MLLM能够根据给定的文本指令编辑输入图像以生成输出图像。为此,MGIE框架包含一个MLLM,并训练以推导出简洁和明确的表达性文本指令。此外,MGIE框架在其架构中添加特殊的图像令牌,以弥合视觉和语言模态之间的差距,并采用编辑头来转换模态。这些模态作为多模态大语言模型的潜在视觉想象力,指导扩散模型执行编辑任务。MGIE框架然后能够执行视觉感知任务以实现合理的图像编辑。
简洁的表达性指令
传统上,多模态大语言模型可以提供视觉相关的响应,具有跨模态感知能力,得益于指令微调和特征对齐。为了编辑图像,MGIE框架使用文本提示作为主要语言输入,伴随着图像,并推导出对编辑命令的详细解释。然而,这些解释可能过长或包含重复的描述,导致意图被误解,因此MGIE应用预训练的总结器来获得简洁的叙述,允许MLLM生成总结的输出。框架将简洁而明确的指导视为表达性指令,并应用交叉熵损失来训练多模态大语言模型,使用教师强制。
使用表达性指令提供了一个比文本指令更具体的想法,这弥合了合理图像编辑的差距,进一步提高了框架的效率。此外,MGIE框架在推理期间推导出简洁的表达性指令,而不是生成冗长的叙述并依赖外部总结。因此,MGIE框架能够掌握编辑意图的视觉想象力,但仍然仅限于语言模态。为了克服这个障碍,MGIE模型在表达性指令后追加一定数量的视觉令牌,具有可训练的词嵌入,允许MLLM使用其语言模型头生成它们。
带有潜在想象力的图像编辑
在下一步中,MGIE框架采用编辑头来将图像指令转换为实际的视觉指导。编辑头是一个序列到序列的模型,有助于将MLLM的序列视觉令牌映射到有意义的潜在语义上,作为其编辑指导。更具体地说,词嵌入上的转换可以被解释为视觉模态中的通用表示,并使用实例感知视觉想象组件来编辑意图。此外,为了指导图像编辑,MGIE框架在其架构中嵌入了潜在扩散模型,包括变分自编码器,并解决潜在空间中的去噪扩散。潜在扩散模型的主要目标是根据编辑指导生成潜在目标,同时保留潜在输入。扩散过程在定期时间间隔内向潜在目标添加噪声,噪声水平随着每个时间步的增加而增加。
MGIE的学习
以下图表总结了MGIE框架的学习算法。
如图所示,MLLM学习推导出简洁的表达性指令,使用指令损失。使用输入图像指令的潜在想象力,框架转换编辑头的模态,并指导潜在扩散模型合成结果图像,并应用扩散训练的编辑损失。最后,框架冻结大多数权重,从而实现参数高效的端到端训练。
MGIE:结果和评估
MGIE框架使用IPr2Pr数据集作为其主要预训练数据,包含超过100万个CLIP过滤的数据,指令从GPT-3模型中提取,并使用Prompt-to-Prompt模型来合成图像。此外,MGIE框架将InsPix2Pix框架视为其指令式图像编辑任务的基线,InsPix2Pix框架建立在CLIP文本编码器上,并使用扩散模型。MGIE模型还考虑了一个LLM引导图像编辑模型,用于从仅指令输入中推导出表达性指令,但没有视觉感知。
定量分析
以下图表总结了零次设置中的编辑结果,模型仅在IPr2Pr数据集上训练。对于GIER和EVR数据,涉及Photoshop风格的修改,表达性指令可以揭示具体的目标,而不是模糊的命令,使编辑结果更好地符合编辑意图。
虽然LGIE和MGIE与InsPix2Pix模型在同一数据上训练,但它们可以通过学习大语言模型提供详细的解释,然而LGIE仍然仅限于单一模态。MGIE框架可以提供显著的性能提升,因为它可以访问图像,并使用这些图像来推导出明确的指令。
为了评估指令式图像编辑任务的性能,开发人员对几个模型进行了微调,如下表所示。
如图所示,在适应Photoshop风格的编辑任务(EVR和GIER)后,模型表现出性能的提升。然而,值得注意的是,微调使表达性指令更加特定于域,因此MGIE框架在性能上获得了显著的提升,因为它还学习了特定于域的指导,允许扩散模型从微调的大语言模型中展示具体的编辑场景,惠及局部修改和局部优化。此外,由于视觉感知指导更符合预期的编辑目标,MGIE框架在与LGIE的比较中始终提供更好的结果。
以下图表展示了CLIP-S评分,用于输入或真实目标图像和表达性指令。更高的CLIP评分表示指令与编辑源的相关性,如图所示,MGIE在输入和输出图像上都具有更高的CLIP评分,相比LGIE模型。
定性结果
以下图像完美地总结了MGIE框架的定性分析。
如我们所知,LGIE框架仅限于单一模态,因为它具有基于语言的洞察力,并且容易推导出错误或不相关的图像编辑解释。然而,MGIE框架是多模态的,并且可以访问图像,完成编辑任务,并提供符合目标的明确视觉想象力。
最后的思考
在本文中,我们讨论了MGIE或MLLM引导图像编辑,一项受MLLMs启发的研究,旨在评估多模态大语言模型,并分析它们如何通过文本或引导指令支持编辑,同时学习提供明确的指导和推导出表达性指令。MGIE编辑模型捕获视觉信息,并通过端到端训练执行编辑或操作。相比模糊和简短的指导,MGIE框架产生明确的视觉感知指令,导致合理的图像编辑。












