Ãngulo de Anderson
O Futuro da GeraçÃĢo de Imagens com RAG

Modelos de difusÃĢo gerativos, como Stable Diffusion, Flux e modelos de vÃdeo como Hunyuan, dependem do conhecimento adquirido durante uma Única sessÃĢo de treinamento intensivo em recursos, utilizando um conjunto de dados fixo. Qualquer conceito introduzido apÃģs este treinamento â referido como o corte de conhecimento â estÃĄ ausente do modelo, a menos que seja suplementado por meio de ajuste fino ou tÃĐcnicas de adaptaçÃĢo externas, como AdaptaçÃĢo de Baixo Rango (LoRA).
Portanto, seria ideal se um sistema gerador de imagens ou vÃdeos pudesse acessar fontes online e incorporÃĄ-las no processo de geraçÃĢo conforme necessÃĄrio. Dessa forma, por exemplo, um modelo de difusÃĢo que nÃĢo sabe nada sobre o Último lançamento da Apple ou da Tesla ainda poderia produzir imagens contendo esses novos produtos.
No que diz respeito a modelos de linguagem, a maioria de nÃģs estÃĄ familiarizada com sistemas como Perplexity, Notebook LM e ChatGPT-4o, que podem incorporar informaçÃĩes externas novas em um modelo de GeraçÃĢo Aumentada por RecuperaçÃĢo (RAG).

Processos RAG tornam as respostas do ChatGPT 4o mais relevantes. Fonte: https://chatgpt.com/
No entanto, essa ÃĐ uma facilidade incomum quando se trata de gerar imagens, e o ChatGPT confessarÃĄ suas prÃģprias limitaçÃĩes nesse aspecto:

ChatGPT 4o fez uma boa suposiçÃĢo sobre a visualizaçÃĢo de um lançamento de relÃģgio novo, com base na linha geral e nas descriçÃĩes que interpretou; mas nÃĢo pode âabsorverâ e integrar novas imagens em uma geraçÃĢo baseada em DALL-E.
Incorporar dados recuperados externamente em uma imagem gerada ÃĐ desafiador porque a imagem de entrada deve primeiro ser quebrada em tokens e incorporaçÃĩes, que sÃĢo entÃĢo mapeados para o conhecimento de domÃnio mais prÃģximo do modelo.
Embora esse processo funcione efetivamente para ferramentas de pÃģs-treinamento, como ControlNet, essas manipulaçÃĩes permanecem em grande parte superficiais, essencialmente canalizando a imagem recuperada por um pipeline de renderizaçÃĢo, mas sem integrÃĄ-la profundamente na representaçÃĢo interna do modelo.
Como resultado, o modelo carece da capacidade de gerar perspectivas novas da maneira como sistemas de renderizaçÃĢo neural, como NeRF, podem, que constroem cenas com compreensÃĢo espacial e estrutural verdadeira.
LÃģgica Madura
Uma limitaçÃĢo semelhante se aplica a consultas baseadas em RAG em Modelos de Linguagem Grande (LLM), como Perplexity. Quando um modelo desse tipo processa dados recuperados externamente, ele funciona muito como um adulto desenhando em uma vida de conhecimento para inferir probabilidades sobre um tÃģpico.
No entanto, assim como uma pessoa nÃĢo pode integrar retroativamente novas informaçÃĩes no quadro cognitivo que moldou sua visÃĢo de mundo fundamental â quando seus preconceitos e preconcepçÃĩes ainda estavam se formando â, um LLM nÃĢo pode mesclar perfeitamente novos conhecimentos em sua estrutura prÃĐ-treinada.
Em vez disso, ele sÃģ pode âimpactarâ ou justapor os novos dados contra seu conhecimento interno, usando princÃpios aprendidos para analisar e conjecturar, em vez de sintetizar no nÃvel fundamental.
Essa falta de equivalÊncia entre justaposto e interiorizado ÃĐ provavelmente mais evidente em uma imagem gerada do que em uma geraçÃĢo baseada em linguagem: as conexÃĩes de rede mais profundas e a criatividade aumentada da âgeraçÃĢo nativaâ (em vez de baseada em RAG) foram estabelecidas em vÃĄrios estudos.
Riscos Ocultos da GeraçÃĢo de Imagens com RAG
Mesmo que fosse tecnicamente viÃĄvel integrar imagens recuperadas da internet em novas sÃnteses de forma RAG, limitaçÃĩes de segurança apresentariam um desafio adicional.
Muitos conjuntos de dados usados para treinar modelos gerativos foram curados para minimizar a presença de conteÚdo explÃcito, racista ou violento, entre outras categorias sensÃveis. No entanto, esse processo ÃĐ imperfeito, e associaçÃĩes residuais podem persistir. Para mitigar isso, sistemas como DALL·E e Adobe Firefly confiam em mecanismos de filtragem secundÃĄrios que verificam tanto os prompts de entrada quanto as saÃdas geradas para conteÚdo proibido.
Como resultado, um simples filtro NSFW â que bloqueia principalmente conteÚdo explÃcito â seria insuficiente para avaliar a aceitabilidade de dados RAG recuperados. Tal conteÚdo ainda poderia ser ofensivo ou prejudicial de maneiras que caem fora dos parÃĒmetros de moderaçÃĢo prÃĐ-definidos do modelo, potencialmente introduzindo material que o AI carece de consciÊncia contextual para avaliar adequadamente.
A descoberta de uma vulnerabilidade recente no DeepSeek, produzido pela CCP, projetado para suprimir discussÃĩes de conteÚdo polÃtico banido, destacou como caminhos de entrada alternativos podem ser explorados para contornar as salvaguardas ÃĐticas de um modelo; argumenta-se que isso tambÃĐm se aplica a dados novos e arbitrÃĄrios recuperados da internet, quando destinados a ser incorporados em uma nova geraçÃĢo de imagens.
RAG para GeraçÃĢo de Imagens
Apesar desses desafios e aspectos polÃticos espinhosos, vÃĄrios projetos surgiram que tentam usar mÃĐtodos baseados em RAG para incorporar dados novos em geraçÃĩes visuais.
ReDi
O projeto Retrieval-based Diffusion (ReDi) de 2023 ÃĐ um framework de aprendizado livre que acelera a inferÊncia do modelo de difusÃĢo, recuperando trajetÃģrias semelhantes de uma base de conhecimento prÃĐ-computada.

Valores de um conjunto de dados podem ser âemprestadosâ para uma nova geraçÃĢo em ReDi. Fonte: https://arxiv.org/pdf/2302.02285
No contexto de modelos de difusÃĢo, uma trajetÃģria ÃĐ o caminho passo a passo que o modelo segue para gerar uma imagem a partir de ruÃdo puro. Normalmente, esse processo ocorre gradualmente ao longo de muitos passos, com cada passo refinando a imagem um pouco mais.
ReDi acelera isso pulando muitos desses passos. Em vez de calcular cada passo, ele recupera uma trajetÃģria passada semelhante de um banco de dados e salta para um ponto posterior no processo. Isso reduz o nÚmero de cÃĄlculos necessÃĄrios, tornando a geraçÃĢo de imagens baseada em difusÃĢo muito mais rÃĄpida, mantendo a qualidade alta.
ReDi nÃĢo modifica os pesos do modelo de difusÃĢo, mas usa a base de conhecimento para pular etapas intermediÃĄrias, reduzindo assim o nÚmero de estimativas de funçÃĢo necessÃĄrias para amostragem.
à claro que isso nÃĢo ÃĐ o mesmo que incorporar imagens especÃficas à vontade em uma solicitaçÃĢo de geraçÃĢo; mas relaciona-se a tipos semelhantes de geraçÃĢo.
Lançado em 2022, o ano em que os modelos de difusÃĢo latente capturaram a imaginaçÃĢo do pÚblico, ReDi parece ser uma das primeiras abordagens baseadas em difusÃĢo para confiar em uma metodologia RAG.
Embora deva ser mencionado que, em 2021, a Facebook Research lançou Instance-Conditioned GAN, que buscava condicionar imagens GAN em novas entradas de imagem, esse tipo de projeçÃĢo no espaço latente ÃĐ extremamente comum na literatura, tanto para GANs quanto para modelos de difusÃĢo; o desafio ÃĐ tornar tal processo livre de treinamento e funcional em tempo real, como os mÃĐtodos RAG focados em LLMs.
RDM
Outra incursÃĢo precoce na geraçÃĢo de imagens aumentada por RAG ÃĐ o Retrieval-Augmented Diffusion Models (RDM), que introduz uma abordagem semi-paramÃĐtrica para sÃntese de imagem gerativa. Enquanto modelos de difusÃĢo tradicionais armazenam todo o conhecimento visual aprendido dentro de seus parÃĒmetros de rede neural, o RDM confia em um banco de dados de imagem externo:

Vizinhos mais prÃģximos recuperados em uma consulta ilustrativa pseudo no RDM*.
Durante o treinamento, o modelo recupera vizinhos mais prÃģximos (imagens visual ou semanticamente semelhantes) do banco de dados externo para guiar o processo de geraçÃĢo. Isso permite que o modelo condicione suas saÃdas em instÃĒncias visuais do mundo real.
O processo de recuperaçÃĢo ÃĐ impulsionado por incorporaçÃĩes CLIP, projetadas para forçar as imagens recuperadas a compartilhar semelhanças significativas com a consulta, e tambÃĐm para fornecer informaçÃĩes novas para melhorar a geraçÃĢo.
Isso reduz a dependÊncia de parÃĒmetros, facilitando modelos menores que alcançam resultados competitivos sem a necessidade de conjuntos de dados de treinamento extensivos.
A abordagem RDM suporta modificaçÃĩes pÃģs-hoc: os pesquisadores podem trocar o banco de dados no momento da inferÊncia, permitindo adaptaçÃĢo zero-shot para novos estilos, domÃnios ou atÃĐ tarefas completamente diferentes, como estilizaçÃĢo ou sÃntese condicional de classe.

Na linha inferior, vemos os vizinhos mais prÃģximos sendo incorporados no processo de difusÃĢo no RDM*.
Uma vantagem-chave do RDM ÃĐ sua capacidade de melhorar a geraçÃĢo de imagens sem retreinar o modelo. Apenas alterando o banco de dados de recuperaçÃĢo, o modelo pode generalizar para novos conceitos que nunca foi explicitamente treinado. Isso ÃĐ particularmente Útil para aplicaçÃĩes onde deslocamentos de domÃnio ocorrem, como gerar imagens mÃĐdicas com base em conjuntos de dados em evoluçÃĢo, ou adaptar modelos de texto-para-imagem para aplicaçÃĩes criativas.
Negativamente, mÃĐtodos de recuperaçÃĢo dessa natureza dependem da qualidade e da cobertura do banco de dados externo, o que torna a cura de dados um fator importante para alcançar geraçÃĩes de alta qualidade; e essa abordagem permanece longe de um equivalente de sÃntese de imagem baseado em RAG, como as interaçÃĩes baseadas em RAG tÃpicas em LLMs comerciais.
ReMoDiffuse
O ReMoDiffuse ÃĐ um modelo de difusÃĢo de movimento aumentado por recuperaçÃĢo, projetado para geraçÃĢo de movimento humano em 3D. Diferentemente de modelos de movimento tradicionais que dependem puramente de representaçÃĩes aprendidas, o ReMoDiffuse recupera amostras de movimento relevantes de um grande conjunto de dados de movimento e as integra no processo de denoising, em um esquema semelhante ao RDM (ver acima).

ComparaçÃĢo do ReMoDiffuse aumentado por RAG (à direita) com mÃĐtodos anteriores. Fonte: https://arxiv.org/pdf/2304.01116
Isso permite que o modelo gere sequÊncias de movimento projetadas para serem mais naturais e diversas, bem como semanticamente fiÃĐis aos prompts de texto do usuÃĄrio.
O ReMoDiffuse usa um mecanismo de recuperaçÃĢo hÃbrido inovador, que seleciona sequÊncias de movimento com base em semelhanças tanto semÃĒnticas quanto cinemÃĄticas, com a intençÃĢo de garantir que os movimentos recuperados nÃĢo sejam apenas tematicamente relevantes, mas tambÃĐm fisicamente plausÃveis quando integrados na nova geraçÃĢo.
O modelo, entÃĢo, refina essas amostras recuperadas usando um Transformador Modulado por SemÃĒntica, que incorpora seletivamente conhecimento das amostras de movimento recuperadas, mantendo as qualidades caracterÃsticas da sequÊncia gerada:

Esquema para o pipeline do ReMoDiffuse.
A tÃĐcnica Mistura de CondiçÃĢo do projeto melhora a capacidade do modelo de generalizar para diferentes prompts e condiçÃĩes de recuperaçÃĢo, equilibrando amostras de movimento recuperadas com prompts de texto durante a geraçÃĢo e ajustando quanto peso cada fonte recebe a cada passo.
Isso pode ajudar a prevenir saÃdas irrreais ou repetitivas, mesmo para prompts raros. TambÃĐm aborda o problema de sensibilidade à escala que frequentemente surge nas tÃĐcnicas de orientaçÃĢo livre de classificador comumente usadas em modelos de difusÃĢo.
RA-CM3
O paper de 2023 da Stanford, Retrieval-Augmented Multimodal Language Modeling (RA-CM3), permite que o sistema acesse informaçÃĩes do mundo real no momento da inferÊncia:

O modelo de Stanford, Retrieval-Augmented Multimodal Language Modeling (RA-CM3), usa imagens recuperadas da internet para aumentar o processo de geraçÃĢo, mas permanece como um protÃģtipo sem acesso pÚblico. Fonte: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf
O RA-CM3 integra texto e imagens recuperados no pipeline de geraçÃĢo, melhorando tanto a sÃntese de texto-para-imagem quanto a imagem-para-texto. Usando CLIP para recuperaçÃĢo e um Transformador como o gerador, o modelo se refere a documentos multimodais pertinentes antes de compor uma saÃda.
Os benchmarks no MS-COCO mostram melhorias notÃĄveis sobre o DALL-E e sistemas semelhantes, alcançando uma reduçÃĢo de 12 pontos na FrÃĐchet Inception Distance (FID), com um custo computacional muito menor.
No entanto, como em outras abordagens baseadas em recuperaçÃĢo, o RA-CM3 nÃĢo internaliza perfeitamente seu conhecimento recuperado. Em vez disso, ele superpÃĩe novos dados contra sua rede prÃĐ-treinada, muito como um LLM aumenta respostas com resultados de busca. Embora esse mÃĐtodo possa melhorar a precisÃĢo factual, nÃĢo substitui a necessidade de atualizaçÃĩes de treinamento em domÃnios onde sÃntese profunda ÃĐ necessÃĄria.
AlÃĐm disso, uma implementaçÃĢo prÃĄtica desse sistema nÃĢo parece ter sido liberada, mesmo em uma plataforma baseada em API.
RealRAG
Um novo lançamento da China, e o que promoveu essa olhada nos sistemas gerativos de imagem com RAG, ÃĐ chamado de GeraçÃĢo de Imagem Realista Aumentada por RecuperaçÃĢo (RealRAG).

Imagens externas incorporadas no RealRAG (centro inferior). Fonte: https://arxiv.o7rg/pdf/2502.00848
O RealRAG recupera imagens reais de objetos relevantes de um banco de dados curado a partir de conjuntos de dados pÚblicos, como ImageNet, Stanford Cars, Stanford Dogs e Oxford Flowers. Em seguida, ele integra as imagens recuperadas no processo de geraçÃĢo, abordando lacunas de conhecimento no modelo.
Um componente-chave do RealRAG ÃĐ o aprendizado contrastivo de auto-reflexÃĢo, que treina um modelo de recuperaçÃĢo para encontrar imagens de referÊncia informativas, em vez de apenas selecionar imagens visualmente semelhantes.
Os autores afirmam:
âNossa principal percepçÃĢo ÃĐ treinar um recuperador que recupera imagens que permanecem fora do espaço de geraçÃĢo do gerador, mas prÃģximas à representaçÃĢo dos prompts de texto.
âPara isso, primeiro geramos imagens a partir dos prompts de texto dados e, em seguida, utilizamos as imagens geradas como consultas para recuperar as imagens mais relevantes no banco de dados baseado em objetos reais. Essas imagens mais relevantes sÃĢo utilizadas como negativos reflexivos.â
Essa abordagem garante que as imagens recuperadas contribuem com conhecimento ausente para o processo de geraçÃĢo, em vez de reforçar vieses existentes no modelo.

à esquerda, a imagem de referÊncia recuperada; centro, sem RAG; à direita, com o uso da imagem recuperada.
No entanto, a dependÊncia da qualidade da recuperaçÃĢo e da cobertura do banco de dados significa que sua eficÃĄcia pode variar dependendo da disponibilidade de referÊncias de alta qualidade. Se uma imagem relevante nÃĢo existe no conjunto de dados, o modelo ainda pode lutar com conceitos desconhecidos.
O RealRAG ÃĐ uma arquitetura muito modular, oferecendo compatibilidade com vÃĄrias outras arquiteturas gerativas, incluindo modelos baseados em U-Net, DiT e autoregressivos.
Em geral, a recuperaçÃĢo e processamento de imagens externas adicionam sobrecarga computacional, e o desempenho do sistema depende de quÃĢo bem o mecanismo de recuperaçÃĢo generaliza em diferentes tarefas e conjuntos de dados.
ConclusÃĢo
Essa ÃĐ uma visÃĢo geral representativa, embora nÃĢo exaustiva, dos sistemas gerativos de imagem que recuperam imagens. Alguns sistemas desse tipo usam recuperaçÃĢo apenas para melhorar a compreensÃĢo da visÃĢo ou a cura de conjuntos de dados, entre outros motivos diversos, em vez de buscar gerar imagens. Um exemplo ÃĐ Internet Explorer.
Muitos dos outros projetos RAG integrados na literatura permanecem sem lançamento. ProtÃģtipos, com apenas pesquisa publicada, incluem Re-Imagen, que â apesar de sua procedÊncia do Google â sÃģ pode acessar imagens de um banco de dados local personalizado.
AlÃĐm disso, em novembro de 2024, a Baidu anunciou GeraçÃĢo Aumentada por RecuperaçÃĢo de Imagens (iRAG), uma nova plataforma que usa imagens recuperadas âde um banco de dadosâ. Embora o iRAG seja relatado como disponÃvel na plataforma Ernie, nÃĢo hÃĄ mais detalhes sobre esse processo de recuperaçÃĢo, que parece depender de um banco de dados local (ou seja, local ao serviço e nÃĢo diretamente acessÃvel ao usuÃĄrio).
Ademais, o paper de 2024 GeraçÃĢo de Imagem de Texto Unificada e RecuperaçÃĢo oferece mais um mÃĐtodo RAG-baseado para usar imagens externas para aumentar os resultados na geraçÃĢo â novamente, de um banco de dados local, em vez de fontes ad hoc da internet.
O entusiasmo em torno da ampliaçÃĢo RAG na geraçÃĢo de imagens provavelmente se concentrarÃĄ em sistemas que possam incorporar imagens originadas da internet ou carregadas pelo usuÃĄrio diretamente no processo gerativo, e que permitem que os usuÃĄrios participem das escolhas ou fontes de imagens.
No entanto, isso ÃĐ um desafio significativo por pelo menos duas razÃĩes; primeiro, porque a eficÃĄcia de tais sistemas geralmente depende de relaçÃĩes profundamente integradas formadas durante um processo de treinamento intensivo em recursos; e segundo, porque preocupaçÃĩes sobre segurança, legalidade e restriçÃĩes de direitos autorais, como mencionado anteriormente, tornam essa uma caracterÃstica improvÃĄvel para um serviço web baseado em API e para implantaçÃĢo comercial em geral.
Â
* Fonte: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf
Publicado pela primeira vez na terça-feira, 4 de fevereiro de 2025












