Andersons vinkel

Framtiden för RAG-förstärkt bildgenerering

mm
Lägg till Unite.AI bland dina föredragna källor på Google
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

Generativa diffusionsmodeller som Stable Diffusion, Flux och videomodeller som Hunyuan bygger på kunskap som förvärvats under en enda resurskrävande träningsession med ett fast dataset. Alla begrepp som introduceras efter denna träningsession – som kallas kunskapsgräns – saknas i modellen såvida den inte kompletteras genom finjustering eller externa anpassningstekniker som Low Rank Adaptation (LoRA).

Det vore därför idealiskt om ett generativt system som producerar bilder eller videor kunde söka upp information på internet och införa den i genereringsprocessen när som helst. På detta sätt kunde till exempel en diffusionsmodell som inte känner till den senaste Apple- eller Tesla-modellen fortfarande producera bilder som innehåller dessa nya produkter.

När det gäller språkmodeller är de flesta av oss bekanta med system som Perplexity, Notebook LM och ChatGPT-4o, som kan införa ny extern information i en RAG-modell (Retrieval Augmented Generation).

RAG-processer gör ChatGPT 4o:s svar mer relevanta. Källa: https://chatgpt.com/

RAG-processer gör ChatGPT 4o:s svar mer relevanta. Källa: https://chatgpt.com/

Detta är emellertid en ovanlig funktion när det gäller bildgenerering, och ChatGPT kommer att erkänna sina egna begränsningar i detta avseende:

ChatGPT 4o har gjort ett bra gissning om visualiseringen av en ny klockmodell, baserat på den allmänna linjen och beskrivningar den har tolkat; men den kan inte ’absorbera’ och integrera nya bilder i en DALL-E-baserad generering.

ChatGPT 4o har gjort ett bra gissning om visualiseringen av en ny klockmodell, baserat på den allmänna linjen och beskrivningar den har tolkat; men den kan inte ’absorbera’ och integrera nya bilder i en DALL-E-baserad generering.

Att införa externt hämtad data i en genererad bild är utmanande eftersom den inkommande bilden först måste brytas ned i token och embeddings, som sedan måste mappas till modellens närmaste tränade domänkunskap om ämnet.

Medan denna process fungerar effektivt för post-träningsverktyg som ControlNet, förblir sådana manipulationer i huvudsak ytliga, vilket i princip innebär att den hämtade bilden leds genom en renderingspipeline, men utan att djupt integrera den i modellens interna representation.

Som ett resultat saknar modellen förmågan att generera nya perspektiv på samma sätt som neurala renderingsystem som NeRF kan, som konstruerar scener med verklig rumslig och strukturmässig förståelse.

Mogen logik

En liknande begränsning gäller för RAG-baserade frågor i stora språkmodeller (LLM), som Perplexity. När en modell av detta slag bearbetar externt hämtad data, fungerar den mycket som en vuxen som använder en livstid av kunskap för att inferera sannolikheter om ett ämne.

Men precis som en person inte kan retroaktivt integrera ny information i den kognitiva ramen som formade deras grundläggande världsbild – när deras fördomar och antaganden fortfarande bildades – kan en LLM inte smidigt förena ny kunskap i sin förtränade struktur.

I stället kan den bara ’påverka’ eller ställa den nya datan mot sin befintliga internaliserade kunskap, med hjälp av inlärda principer för att analysera och gissa snarare än att syntetisera på en grundläggande nivå.

Denna brist på ekvivalens mellan jämförd och internaliserad generation är sannolikt mer tydlig i en genererad bild än i en språkbaserad generation:

Dolda risker med RAG-kapabel bildgenerering

Även om det vore tekniskt möjligt att smidigt integrera hämtade internetbilder i ny syntetiserad bild på ett RAG-liknande sätt, skulle säkerhetsrelaterade begränsningar presentera en ytterligare utmaning.

Många dataset som används för att träna generativa modeller har valts för att minimera förekomsten av explicit, rasistisk eller våldsam innehåll, bland annat känsliga kategorier. Men denna process är ofullständig, och resterande associationer kan kvarstå. För att mildra detta förlitar sig system som DALL·E och Adobe Firefly på sekundära filtermekanismer som skärmar både indataprompt och genererade utdata för förbjudet innehåll.

En enkel NSFW-filter – som i huvudsak blockerar öppet explicit innehåll – skulle vara otillräcklig för att utvärdera acceptabiliteten hos hämtad RAG-baserad data. Sådant innehåll kunde fortfarande vara stötande eller skadligt på sätt som faller utanför modellens fördefinierade modereringsparametrar, potentiellt introducerar material som AI saknar kontextuell medvetenhet för att korrekt bedöma.

Upptäckten av en nylig sårbarhet i CCP-producerade DeepSeek, designad för att undertrycka diskussioner om förbjudet politiskt innehåll, har understrukit hur alternativa ingångsvägar kan utnyttjas för att kringgå en modells etiska skydd; detta gäller också för godtyckliga nya data som hämtas från internet, när de avses att införlivas i en ny bildgenerering.

RAG för bildgenerering

Trots dessa utmaningar och törnhänta politiska aspekter har flera projekt dykt upp som försöker använda RAG-baserade metoder för att införa ny data i visuella generationer.

ReDi

2023 års Retrieval-baserad diffusion (ReDi) är ett inlärningsfritt ramverk som accelererar diffusionsmodellens inferens genom att hämta liknande banor från en förberäknad kunskapsbas.

Värden från ett dataset kan ’lånas’ för en ny generation i ReDi. Källa: https://arxiv.org/pdf/2302.02285

Värden från ett dataset kan ’lånas’ för en ny generation i ReDi. Källa: https://arxiv.org/pdf/2302.02285

I diffusionsmodellens kontext är en bana den stegvisa väg som modellen tar för att generera en bild från ren brus. Vanligtvis sker denna process gradvis över många steg, med varje steg som förfinar bilden lite mer.

ReDi accelererar detta genom att hoppa över en del av dessa steg. I stället för att beräkna varje enskilt steg hämtar den en liknande tidigare bana från en databas och hoppar fram till en senare punkt i processen. Detta minskar antalet beräkningar som behövs, vilket gör diffusionsbaserad bildgenerering mycket snabbare, samtidigt som kvaliteten behålls.

ReDi modifierar inte diffusionsmodellens vikter, utan använder i stället kunskapsbasen för att hoppa över mellansteg, vilket minskar antalet funktionsuppskattningar som behövs för sampling.

Detta är naturligtvis inte samma sak som att införa specifika bilder i en generation begäran; men det relaterar till liknande typer av generation.

Släppt 2022, det år då latent diffusionsmodeller fångade allmänhetens fantasi, verkar ReDi vara en av de tidigaste diffusionsbaserade tillvägagångssätten för att luta sig mot en RAG-metod.

Men det bör nämnas att 2021 släppte Facebook Research Instance-Conditioned GAN, som försökte konditionera GAN-bilder på nya bildinmatningar, denna typ av projektion i det latenta utrymmet är extremt vanlig i litteraturen, både för GAN och diffusionsmodeller; utmaningen är att göra en sådan process inlärningsfri och fungerande i realtid, som LLM-fokuserade RAG-metoder är.

RDM

En annan tidig utflykt i RAG-förstärkt bildgenerering är Retrieval-Augmented Diffusion Models (RDM), som introducerar en semi-parametrisk approach till generativ bildsyntes. Medan traditionella diffusionsmodeller lagrar all inlärdd visuell kunskap inom sina neurala nätverksparametrar, förlitar sig RDM på en extern bild-databas:

Hämtade närmaste grannar i en illustrativ pseudo-fråga i RDM*.

Hämtade närmaste grannar i en illustrativ pseudo-fråga i RDM*.

Under träningsprocessen hämtar modellen närmaste grannar (visuellt eller semantiskt liknande bilder) från den externa databasen för att vägleda generationsprocessen. Detta tillåter modellen att konditionera sina utdata på verkliga visuella instanser.

Hämtningsprocessen drivs av CLIP-inbäddningar, designade för att tvinga de hämtade bilderna att dela meningsfulla likheter med frågan, och också för att tillhandahålla ny information för att förbättra generationen.

Denna metod minskar beroendet av parametrar, vilket möjliggör mindre modeller som uppnår konkurrenskraftiga resultat utan behov av omfattande träningsdataset.

RDM-tillvägagångssättet stöder post-hoc-modifieringar: forskare kan byta ut databasen vid inferenstid, vilket möjliggör nollskotts-anpassning till nya stilar, domäner eller till och med helt olika uppgifter som stilisering eller klass-villkorlig syntes.

I de nedre raderna ser vi närmaste grannarna dras in i diffusionsprocessen i RDM*.

I de nedre raderna ser vi närmaste grannarna dras in i diffusionsprocessen i RDM*.

En viktig fördel med RDM är dess förmåga att förbättra bildgenerering utan att behöva träna om modellen. Genom att enbart ändra hämtningsdatabasen kan modellen generalisera till nya begrepp som den aldrig uttryckligen tränats på. Detta är särskilt användbart för tillämpningar där domänförändringar sker, såsom generering av medicinska bilder baserat på utvecklande dataset eller anpassning av text-till-bild-modeller för kreativa tillämpningar.

Negativt beror hämtningsbaserade metoder av detta slag på kvaliteten och relevansen hos den externa databasen, vilket gör datakurering en viktig faktor för att uppnå högkvalitativa generationer; och denna metod förblir långt ifrån en bildsyntesekvivalent till den typ av RAG-baserade interaktioner som är typiska i kommersiella LLM.

ReMoDiffuse

ReMoDiffuse är en hämtningsförstärkt rörelsediffusionsmodell designad för 3D-mänsklig rörelsegenerering. Till skillnad från traditionella rörelsegenereringsmodeller som förlitar sig på rent inlärda representationer, hämtar ReMoDiffuse relevanta röelseexempel från en stor rörelsedataset och integrerar dem i avbrusningsprocessen, i ett schema liknande RDM (se ovan).

Jämförelse av RAG-förstärkt ReMoDiffuse (högermost) med tidigare metoder. Källa: https://arxiv.org/pdf/2304.01116

Jämförelse av RAG-förstärkt ReMoDiffuse (högermost) med tidigare metoder. Källa: https://arxiv.org/pdf/2304.01116

Denna modell tillåter generering av röelsekvenser som är designade för att vara mer naturliga och varierade, samt semantiskt trogna mot användarens textprompt.

ReMoDiffuse använder en innovativ hybridhämtningsmekanism, som väljer röelsekvenser baserat på både semantiska och kinematiska likheter, med avsikt att säkerställa att de hämtade rörelserna inte bara är tematiskt relevanta utan också fysiskt möjliga när de integreras i den nya generationen.

Modellen refinerar sedan dessa hämtade prover med en Semantik-Modulerad Transformer, som selektivt inkorporerar kunskap från de hämtade rörelserna medan den behåller de karakteristiska egenskaperna hos den genererade sekvensen:

Schema för ReMoDiffuses pipeline.

Schema för ReMoDiffuses pipeline.

Projektets Villkorsblandningsteknik förbättrar modellens förmåga att generalisera över olika prompt och hämtningsförhållanden, balanserar hämtade röelseprover med textprompt under generation och justerar hur mycket vikt varje källa får vid varje steg.

Detta kan hjälpa till att förhindra orealistiska eller upprepade utdata, även för sällsynta prompt. Det adresserar också skalakänslighetsproblemet som ofta uppstår i klassificeringsfria vägledningstekniker som ofta används i diffusionsmodeller.

RA-CM3

Stanfords 2023 papper Retrieval-Augmented Multimodal Language Modeling (RA-CM3) tillåter systemet att komma åt verklig information vid inferenstid:

Stanfords Retrieval-Augmented Multimodal Language Modeling (RA-CM3)-modell använder internet-hämtade bilder för att förstärka generationsprocessen, men förblir en prototyp utan offentlig åtkomst. Källa: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

Stanfords Retrieval-Augmented Multimodal Language Modeling (RA-CM3)-modell använder internet-hämtade bilder för att förstärka generationsprocessen, men förblir en prototyp utan offentlig åtkomst. Källa: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

RA-CM3 integrerar hämtad text och bilder i generationspipelinen, förbättrar både text-till-bild och bild-till-text-syntes. Med CLIP för hämtning och en Transformer som generator, hänvisar modellen till relevanta multimodala dokument innan den komponerar utdata.

Benchmark på MS-COCO visar betydande förbättringar jämfört med DALL-E och liknande system, med en 12-poängs Fréchet Inception Distance (FID)-minskning, med betydligt lägre beräkningskostnad.

Men som med andra hämtningsförstärkta tillvägagångssätt internaliserar RA-CM3 inte smidigt sin hämtade kunskap. I stället lägger den till ny data mot sin förtränade nätverk, likt en LLM som kompletterar svar med sökresultat. Medan denna metod kan förbättra faktisk korrekthet, ersätter den inte behovet av träningsuppdateringar i domäner där djup syntes krävs.

Förutom att en praktisk implementering av detta system inte tycks ha släppts, inte ens till en API-baserad plattform.

RealRAG

En ny release från Kina, och den som har utlöst denna titt på RAG-förstärkta generativa bildsystem, kallas Retrieval-Augmented Realistisk Bildgenerering (RealRAG).

Externa bilder dras in i RealRAG (nedre mitten). Källa: https://arxiv.o7rg/pdf/2502.00848

Externa bilder dras in i RealRAG (nedre mitten). Källa: https://arxiv.o7rg/pdf/2502.00848

RealRAG hämtar faktiska bilder av relevanta objekt från en databas som kuraterats från offentligt tillgängliga dataset som ImageNet, Stanford Cars, Stanford Dogs och Oxford Flowers. Den integrerar sedan de hämtade bilderna i generationsprocessen, vilket adresserar kunskapsluckor i modellen.

En viktig komponent i RealRAG är självreflekterande kontrastiv inlärning, som tränar en hämtningsmodell för att hitta informativa referensbilder, snarare än att bara välja visuellt liknande bilder.

Författarna skriver:

’Vår nyckelinsikt är att träna en hämtare som hämtar bilder som stannar utanför generationsutrymmet för generatoren, men som är nära representationen av textprompt.

’För detta ändamål genererar vi först bilder från de givna textprompten och använder sedan de genererade bilderna som frågor för att hämta de mest relevanta bilderna i den realobjektbaserade databasen. Dessa mest relevanta bilder används som reflekterande negativa.’

Denna metod säkerställer att de hämtade bilderna bidrar med saknad kunskap till generationsprocessen, snarare än att förstärka befintliga fördomar i modellen.

Vänster, den hämtade referensbilden; mitten, utan RAG; höger, med användning av den hämtade bilden.

Vänster, den hämtade referensbilden; mitten, utan RAG; höger, med användning av den hämtade bilden.

Men beroendet av hämtningskvalitet och databastäckning innebär att dess effektivitet kan variera beroende på tillgången på högkvalitativa referenser. Om en relevant bild inte finns i datasetet kan modellen fortfarande kämpa med okända begrepp.

RealRAG är en mycket modulär arkitektur, som erbjuder kompatibilitet med flera andra generativa arkitekturer, inklusive U-Net-baserade, DiT-baserade och autoregressiva modeller.

I allmänhet lägger hämtning och bearbetning av externa bilder till beräkningskostnader, och systemets prestanda beror på hur väl hämtningsmekanismen generaliserar över olika uppgifter och dataset.

Slutsats

Detta är en representativ snarare än uttömmande översikt av bildhämtningsmultimodala generativa system. Vissa system av denna typ använder hämtning enbart för att förbättra visuell förståelse eller dataset-kurering, bland annat olika motiv, snarare än att försöka generera bilder. Ett exempel är Internet Explorer.

Många av de andra RAG-integrerade projekten i litteraturen förblir outgivna. Prototyper, med endast publicerad forskning, inkluderar Re-Imagen, som – trots sitt ursprung från Google – endast kan komma åt bilder från en lokal anpassad databas.

Också, i november 2024 meddelade Baidu att Bildbaserad Hämtning-Förstärkt Generation (iRAG), en ny plattform som använder hämtade bilder ’från en databas’. Även om iRAG rapporteras vara tillgänglig på Ernie-plattformen, verkar det inte finnas några ytterligare detaljer om denna hämtningsprocess, som verkar förlita sig på en lokal databas (dvs. lokal till tjänsten och inte direkt tillgänglig för användaren).

Ytterligare, 2024 års papper Enhetlig Text-till-Bild-Generering och Hämtning erbjuder ännu en RAG-baserad metod för att använda externa bilder för att förstärka resultat vid generationstid – återigen, från en lokal databas snarare än från ad hoc-internetkällor.

Spänningen kring RAG-baserad förstärkning i bildgenerering kommer sannolikt att fokusera på system som kan införa internet-hämtade eller användaruppladdade bilder direkt i genereringsprocessen, och som tillåter användare att delta i valet eller källorna till bilder.

Men detta är en betydande utmaning av minst två skäl; först, eftersom effektiviteten hos sådana system vanligtvis beror på djupt integrerade relationer som bildats under en resurskrävande träningsprocess; och för det andra, eftersom säkerhets-, lagliga- och upphovsrättsbegränsningar, som nämnts tidigare, gör detta till en osannolik funktion för en API-driven webbtjänst, och för kommersiell distribution i allmänhet.

* Källa: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf

Publicerad första gången tisdagen den 4 februari 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai