Anderson 视角

RAG增强图像生成的未来

mm
将 Unite.AI 添加到您在 Google 上的首选来源
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

像Stable Diffusion、Flux和Hunyuan这样的生成性扩散模型依赖于在一个单一的、资源密集的训练过程中使用固定数据集所获得的知识。任何在此训练之后引入的概念——被称为知识截止——都不会被模型所包含,除非通过微调或外部适应技术如低秩适应(LoRA)进行补充。

因此,如果一个生成系统能够输出图像或视频,并能够访问在线资源以便在需要时将其纳入生成过程中,那将是理想的。例如,一个不知道最新的苹果或特斯拉发布的扩散模型仍然可以生成包含这些新产品的图像。

关于语言模型,我们大多数人都熟悉Perplexity、Notebook LM和ChatGPT-4o等系统,它们可以在检索增强生成(RAG)模型中纳入新外部信息。

RAG过程使ChatGPT 4o的响应更相关。来源:https://chatgpt.com/

RAG过程使ChatGPT 4o的响应更相关。 来源:https://chatgpt.com/

然而,这种能力在图像生成中却很少见,ChatGPT会承认自己在这方面的局限性:

ChatGPT 4o根据描述对新手表发布的外观进行了很好的猜测,但它无法将新图像纳入DALL-E基于的生成中。

ChatGPT 4o根据描述对新手表发布的外观进行了很好的猜测,但它无法将新图像纳入DALL-E基于的生成中。

将外部检索的数据纳入生成的图像是一个挑战,因为输入的图像必须首先被分解为标记和嵌入,然后映射到模型的最近训练领域知识中。

虽然这个过程对像ControlNet这样的后训练工具有效,但这种操作基本上是将检索的图像通过渲染管道进行处理,而不是深入地将其集成到模型的内部表示中。

因此,模型缺乏像NeRF这样的神经渲染系统那样生成新视角的能力,它们通过构建具有真正的空间和结构理解的场景来实现这一点。

成熟的逻辑

大型语言模型(LLM)中的RAG查询也存在类似的局限性,例如Perplexity。当这种模型处理外部检索的数据时,它的功能就像一个成年人利用一生积累的知识来推断某个主题的概率。

然而,就像一个人不能将新信息倒退地整合到最初形成其基本世界观的认知框架中一样,LLM也不能将新知识无缝地融入其预训练结构中。

相反,它只能“影响”或将新数据与其现有的内部化知识并置,使用学习的原则来分析和推测,而不是在基础层面上进行综合。

这种“并置”和“内部化”生成之间的等价性缺失可能在生成的图像中比在语言生成中更为明显:原生(而非RAG-based)生成的更深层次的网络连接和更高的创造力已经在各种研究中得到证实。

RAG-Capable图像生成的隐藏风险

即使从技术上讲,将检索的互联网图像无缝地集成到新合成图像中是可行的,安全相关的限制也会带来额外的挑战。

许多用于训练生成模型的数据集都经过了精心的策划,以尽量减少明显的、种族主义的或暴力内容等敏感类别的存在。然而,这个过程并不完美,残留的关联仍然存在。为了减轻这一点,像DALL·E和Adobe Firefly这样的系统依赖于次要的过滤机制,既可以筛选输入提示,也可以筛选生成的输出以排除禁止的内容。

因此,一个简单的NSFW过滤器——主要阻止明显的露骨内容——将不足以评估检索的RAG-based数据的可接受性。这样的内容仍然可能以模型无法正确评估的方式变得令人反感或有害,即使它不属于模型预定义的调节参数之内。

最近发现的CCP生产的DeepSeek中存在漏洞,这突出了如何利用替代输入路径来绕过模型的道德保障;可以认为,这也适用于任意从互联网检索的新数据,当它被纳入新图像生成时。

RAG用于图像生成

尽管存在这些挑战和棘手的政治方面,仍有一些项目尝试使用RAG-based方法将新数据纳入视觉生成中。

ReDi

2023年的检索基于扩散(ReDi)项目是一个无需学习的框架,它通过从预计算的知识库中检索相似的轨迹来加速扩散模型的推理。

可以从数据集中“借用”值来进行新的生成。来源:https://arxiv.org/pdf/2302.02285

可以从数据集中“借用”值来进行新的生成。 来源:https://arxiv.org/pdf/2302.02285

在扩散模型的背景下,轨迹是模型从纯噪声生成图像的逐步路径。通常,这个过程是逐渐发生的,经过许多步骤,每一步都将图像细化一点。

ReDi通过跳过一些步骤来加速这个过程。相反,ReDi从数据库中检索一个类似的过去轨迹,并跳到过程中的一个稍后点。这减少了所需的计算次数,使基于扩散的图像生成速度更快,同时保持高质量。

ReDi不修改扩散模型的权重,而是使用知识库来跳过中间步骤,从而减少了函数估计的次数。

当然,这与在生成请求中任意纳入特定图像并不是一回事;但它与类似的生成有关。

2022年发布的ReDi似乎是最早的基于扩散的RAG方法,当时潜在扩散模型吸引了公众的想象力。

虽然Facebook研究在2021年发布了实例条件GAN,它试图将GAN图像条件化为新图像输入,但这种投影到潜在空间的过程在文献中非常常见,无论是GAN还是扩散模型;挑战在于使这种过程在训练中无需学习并在实时中功能性。

RDM

RAG增强图像生成的另一个早期尝试是检索增强扩散模型(RDM),它引入了一种半参数化的生成图像合成方法。传统的扩散模型将所有学习到的视觉知识存储在其神经网络参数中,而RDM则依赖于一个外部图像数据库:

RDM*中检索的最近邻。

RDM*中检索的最近邻。

在训练过程中,模型从外部数据库中检索最近邻(视觉或语义上相似的图像),以指导生成过程。这使得模型能够将其输出条件化为真实世界的视觉实例。

检索过程由CLIP嵌入提供动力,旨在强制检索的图像与查询共享有意义的相似性,并提供新信息以提高生成质量。

这减少了对参数的依赖,使得模型更小,能够在没有大量训练数据集的情况下实现竞争性的结果。

RDM方法支持事后修改:研究人员可以在推理时更换数据库,实现零次适应新样式、域或甚至完全不同的任务,例如样式化或类条件合成。

在下面的行中,我们看到RDM*中被拉入扩散过程的最近邻。

在下面的行中,我们看到RDM*中被拉入扩散过程的最近邻。

RDM的一个关键优势是其能够在不需要重新训练模型的情况下提高图像生成质量。通过简单地改变检索数据库,模型可以推广到它从未明确训练过的新概念。这在域发生变化的应用中特别有用,例如基于不断演变的数据集生成医学图像,或将文本到图像模型适应创意应用。

然而,检索质量和数据库覆盖范围的依赖意味着其有效性可能会根据参考的质量和可用性而有所不同;这种方法仍然远远不能等同于图像合成中的RAG-based交互。

ReMoDiffuse

ReMoDiffuse是一个检索增强的3D人体运动生成模型,旨在通过从大型运动数据集中检索相关运动样本并将其集成到去噪过程中来生成更自然和多样化的运动序列。

与先前方法相比,RAG增强的ReMoDiffuse(最右)。来源:https://arxiv.org/pdf/2304.01116

与先前方法相比,RAG增强的ReMoDiffuse(最右)。 来源:https://arxiv.org/pdf/2304.01116

ReMoDiffuse使用了一种创新性的混合检索机制,根据语义和运动相似性选择运动序列,以确保检索的运动不仅主题相关,还物理上可行。

然后,模型使用一个语义调制的Transformer来精化这些检索样本,同时保持生成序列的特征质量。

这个项目的条件混合技术增强了模型在不同提示和检索条件下的推广能力,平衡检索运动样本与文本提示,并在每一步调整每个来源的权重。

这可以帮助防止不切实际或重复的输出,即使对于罕见的提示。它还解决了经常在扩散模型中使用的分类器自由引导技术中出现的尺度敏感性问题。

RA-CM3

斯坦福2023年的检索增强多模态语言模型(RA-CM3)允许系统在推理时访问真实世界的信息:

斯坦福的检索增强多模态语言模型(RA-CM3)使用互联网检索的图像来增强生成过程,但仍然是一个没有公开访问的原型。来源:https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

斯坦福的检索增强多模态语言模型(RA-CM3)使用互联网检索的图像来增强生成过程,但仍然是一个没有公开访问的原型。 来源:https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

RA-CM3将检索的文本和图像集成到生成管道中,增强了文本到图像和图像到文本的合成。使用CLIP进行检索和Transformer作为生成器,模型参考了相关的多模态文档以生成输出。

基准测试表明,RA-CM3在MS-COCO上比DALL-E和类似系统有了显著的改进,实现了12点的Fréchet Inception Distance(FID)降低,并且计算成本大大降低。

然而,像其他检索增强方法一样,RA-CM3并不将检索的知识无缝地整合到其预训练网络中。相反,它将新数据叠加在其预训练网络上,就像LLM使用搜索结果增强其响应一样。虽然这种方法可以提高事实准确性,但它并不取代在需要深度合成的领域中对训练更新的需求。

然而,RA-CM3的实际实现似乎尚未发布,甚至没有在API平台上发布。

RealRAG

来自中国的新发布检索增强的真实图像生成(RealRAG)是本文关注RAG增强生成图像系统的原因。

RealRAG中被拉入的外部图像(中间)。来源:https://arxiv.o7rg/pdf/2502.00848

RealRAG中被拉入的外部图像(中间)。 来源:https://arxiv.o7rg/pdf/2502.00848

RealRAG从公开可用的数据集(如ImageNet、Stanford Cars、Stanford Dogs和Oxford Flowers)中检索实际图像,并将其集成到生成过程中,以解决模型中的知识缺口。

RealRAG的关键组件是自反对比学习,它训练一个检索模型来找到信息丰富的参考图像,而不是仅仅选择视觉上相似的图像。

作者表示:

“我们的关键见解是训练一个检索器,它检索的图像保持在生成器的生成空间之外,但接近文本提示的表示。”

“为此,我们首先根据给定的文本提示生成图像,然后使用这些生成的图像作为查询来检索数据库中最相关的图像。这些最相关的图像被用作反射负面。”

这种方法确保检索的图像为生成过程贡献了缺失的知识,而不是强化模型中的现有偏见。

左边是检索的参考图像;中间是没有RAG的图像;右边是使用检索图像的图像。

左边是检索的参考图像;中间是没有RAG的图像;右边是使用检索图像的图像。

然而,检索质量和数据库覆盖范围的依赖意味着其有效性可能会根据参考的质量和可用性而有所不同。如果数据库中没有相关的图像,模型可能仍然难以处理陌生的概念。

RealRAG是一个非常模块化的架构,支持与多种其他生成架构的兼容性,包括基于U-Net、DiT和自回归模型的架构。

一般来说,检索和处理外部图像会增加计算开销,系统的性能取决于检索机制如何推广到不同的任务和数据集。

结论

这是一份代表性的图像检索多模态生成系统的概述。有些系统仅使用检索来改善视觉理解或数据策划,而不是生成图像。一个例子是互联网浏览器

许多文献中的其他RAG集成项目仍未发布。只有发表研究的原型,包括Re-Imagen,它只能访问本地自定义数据库。

此外,2024年11月,百度宣布了一个新的平台,称为基于图像的检索增强生成(iRAG),它使用从数据库中检索的图像。虽然iRAG据称可在Ernie平台上使用,但似乎没有关于此检索过程的进一步细节,它似乎依赖于一个本地数据库(即服务本地数据库,而不是用户直接可访问的数据库)。

此外,2024年的论文提出了一种统一的文本到图像生成和检索方法,使用外部图像来增强生成时的结果——同样来自本地数据库,而不是来自临时的互联网来源。

人们对RAG增强图像生成的兴趣可能会集中在能够直接将互联网来源或用户上传的图像纳入生成过程的系统上,并且允许用户参与图像的选择或来源。

然而,这是一个重大挑战,首先,因为此类系统的有效性通常取决于在资源密集的训练过程中形成的深度集成关系;其次,因为安全性、合法性和版权限制的担忧,如前所述,使得这成为API驱动的Web服务和一般的商业部署中不太可能的功能。

因此,检索增强图像生成的未来可能会受到这些挑战的影响,但研究人员和开发人员正在不断探索新的方法和技术来克服这些限制,并创造出更强大、更灵活的图像生成系统。

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai