Andersons vinkel

Fremtiden for RAG-forbedret bildegenerering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

Generative diffusjonsmodeller som Stable Diffusion, Flux og videomodeller som Hunyuan, er avhengige av kunnskap tilegnet under en enkelt, ressurskrevende treningsøkt med en fast datasett. Enhver konsept som blir introdusert etter denne treningsøkten – referert til som kunnskapsavkorting – er fraværende fra modellen med mindre den suppleres gjennom finjustering eller eksterne tilpasningsmetoder som Low Rank Adaptation (LoRA).

Det ville derfor være ideelt hvis et generativt system som utsteder bilder eller videoer kunne hente informasjon fra eksterne kilder og inkorporere dem i genereringsprosessen etter behov. På denne måten kunne for eksempel en diffusjonsmodell som ikke vet noe om den aller siste Apple- eller Tesla-lanseringen likevel produsere bilder som inneholder disse nye produktene.

I forhold til språkmodeller er de fleste av oss kjent med systemer som Perplexity, Notebook LM og ChatGPT-4o, som kan inkorporere ny ekstern informasjon i en Retrieval Augmented Generation (RAG)-modell.

RAG-prosesser gjør ChatGPT 4o’s svar mer relevante. Kilde: https://chatgpt.com/

RAG-prosesser gjør ChatGPT 4o’s svar mer relevante. Kilde: https://chatgpt.com/

Likevel er dette en uvanlig fasilitet når det gjelder bildegenerering, og ChatGPT vil innrømme sine egne begrensninger i denne sammenhengen:

ChatGPT 4o har gjort et godt gjett om visualiseringen av en helt ny klokkelansering, basert på den generelle linjen og på beskrivelser den har tolket; men den kan ikke ‘absorbere’ og integrere nye bilder i en DALL-E-basert generering.

ChatGPT 4o har gjort et godt gjett om visualiseringen av en helt ny klokkelansering, basert på den generelle linjen og på beskrivelser den har tolket; men den kan ikke ‘absorbere’ og integrere nye bilder i en DALL-E-basert generering.

Å inkorporere eksternt hentet data i en generert bilde er utfordrende fordi det innkommende bildet først må brytes ned i token og innlejring, som deretter må kartlegges til modellens nærmeste trente domenekunnskap om emnet.

Mens denne prosessen fungerer effektivt for post-trening verktøy som ControlNet, forblir slike manipulasjoner i stor grad overfladiske, essensielt kanaliserer det hentede bildet gjennom en renderingspipeline, men uten å dypt integrere det i modellens interne representasjon.

Dette resulterer i at modellen mangler evnen til å generere nye perspektiver på samme måte som neurale renderingsystemer som NeRF kan, som konstruerer scener med sanne romlige og strukturelle forståelser.

Moden Logikk

En lignende begrensning gjelder for RAG-baserte spørringer i store språkmodeller (LLM), som Perplexity. Når en modell av denne typen prosesser eksternt hentet data, fungerer den mye som en voksen som tegner på en livslang kunnskap for å inferere sannsynligheter om et emne.

Likevel, på samme måte som en person ikke kan retroaktivt integrere ny informasjon i den kognitive rammen som formet deres grunnleggende verdenssyn – når deres fordommer og forestillinger ennå var under utvikling – kan en LLM ikke sammenføye ny kunnskap i sin forhåndsdefinerte struktur.

I stedet kan den bare ‘påvirke’ eller sammenstille den nye data mot sin eksisterende internaliserte kunnskap, ved å bruke lært prinsipper til å analysere og konkludere snarere enn å syntetisere på et grunnleggende nivå.

Denne mangelen på ekvivalens mellom sammenstilt og internalisert generering er sannsynligvis mer tydelig i en generert bilde enn i en språkbasert generering: de dypere nettverksforbindelsene og den økte kreativiteten til ‘native’ (i motsetning til RAG-basert) generering er etablert i forskjellige studier.

Skjulte Risikoer ved RAG-kapabel Bildegenerering

Selv om det teknisk sett var mulig å sammenføye hentede internettbilder i nye syntetiske bilder på en RAG-lignende måte, ville sikkerhetsrelaterte begrensninger fremstå som en ekstra utfordring.

Mange datasett som brukes for å trene generative modeller er kuratert for å minimere tilstedeværelsen av eksplisitt, rasistisk eller voldelig innhold, blant andre sensitive kategorier. Likevel er denne prosessen ikke perfekt, og resterende assosiasjoner kan bestå. For å mildne dette, avhenger systemer som DALL·E og Adobe Firefly av sekundære filtermekanismer som skanner både inndata og genererte utdata for forbudt innhold.

Som et resultat vil en enkel NSFW-filter – en som primært blokkerer åpenbart eksplisitt innhold – være utilstrekkelig for å vurdere akseptabiliteten av hentet RAG-basert data. Slike data kan likevel være offensive eller skadelige på måter som faller utenfor modellens forhåndsdefinerte modereringsparametere, potensielt innfører materiale som AI-en mangler kontekstuell bevissthet til å korrekt vurdere.

Oppdagelsen av en nylig sårbarhet i CCP-produsert DeepSeek, designet for å undertrykke diskusjoner om forbudt politisk innhold, har høylysnet hvordan alternative inndatakanaler kan utnyttes for å omgå en modells etiske sikkerhetssystemer; dette kan også gjelde for vilkårlig ny data hentet fra internettet, når det er ment å inkorporeres i en ny bildegenerering.

RAG for Bildegenerering

Til tross for disse utfordringene og tornefulle politiske aspekter, har flere prosjekter dukket opp som forsøker å bruke RAG-baserte metoder for å inkorporere ny data i visuelle genereringer.

ReDi

2023-prosjektet Retrieval-basert Diffusjon (ReDi) er et læring-fritt rammeverk som akselererer diffusjonsmodell-inferens ved å hente lignende baner fra en forhåndskalkulert kunnskapsbase.

Verdier fra en datasett kan ‘lånes’ for en ny generering i ReDi. Kilde: https://arxiv.org/pdf/2302.02285

Verdier fra en datasett kan ‘lånes’ for en ny generering i ReDi. Kilde: https://arxiv.org/pdf/2302.02285

I sammenheng med diffusjonsmodeller er en bane den steg-for-steg-veien modellen tar for å generere et bilde fra ren støy. Vanligvis skjer denne prosessen gradvis over mange steg, med hvert steg som refinerer bildet litt mer.

ReDi akselererer denne prosessen ved å hoppe over en del av disse stegene. I stedet for å beregne hvert enkelt steg, henter den en lignende tidligere bane fra en database og hopper frem til et senere punkt i prosessen. Dette reduserer antall beregninger som trengs, og gjør diffusjonsbasert bildegenerering mye raskere, mens den fortsatt holder kvaliteten høy.

ReDi endrer ikke diffusjonsmodellens vekt, men bruker i stedet kunnskapsbasen for å hoppe over mellomliggende steg, og reduserer dermed antall funksjonsestimater som trengs for sampling.

Selvfølgelig er dette ikke det samme som å inkorporere bestemte bilder når som helst i en genereringsforespørsel; men det relaterer til lignende typer generering.

Utgitt i 2022, året da latente diffusjonsmodeller fanget den offentlige fantasien, ser ReDi ut til å være blant de tidligste diffusjonsbaserte tilnærmingene til å bruke en RAG-metodologi.

Selv om det bør nevnes at i 2021 ga Facebook Research ut Instance-Conditioned GAN, som forsøkte å kondisjonere GAN-bilder på nye bildeinndata, er denne typen prosjektering inn i latente rom svært vanlig i litteraturen, både for GAN-er og diffusjonsmodeller; utfordringen er å gjøre en slik prosess læring-fri og fungerende i sanntid, som LLM-fokuserte RAG-metoder er.

RDM

En annen tidlig innføring i RAG-forbedret bildegenerering er Retrieval-Augmented Diffusion Models (RDM), som introduserer en semi-parametrisk tilnærming til generativ bilde-syntese. Mens tradisjonelle diffusjonsmodeller lagrer all lært visuell kunnskap innenfor deres neurale nettverksparametre, avhenger RDM av en ekstern bilde-database:

Hentede nærmeste naboer i en illustrativ pseudo-spørring i RDM*.

Hentede nærmeste naboer i en illustrativ pseudo-spørring i RDM*.

Under trening henter modellen nærmeste naboer (visuelt eller semantisk like bilder) fra den eksterne database, for å guide genereringsprosessen. Dette tillater modellen å kondisjonere utdataene på virkelige verdens visuelle eksempler.

Hentingprosessen er drevet av CLIP-innlejring, designet for å tvinge de hentede bildene til å dele meningsfulle likheter med spørringen, og også å gi ny informasjon for å forbedre generering.

Dette reduserer avhengigheten av parametre, og muliggjør mindre modeller som oppnår konkurrerende resultater uten behov for omfattende treningsdatasett.

RDM-tilnærmingen støtter post-hoc-modifikasjoner: forskere kan bytte ut database ved inferens-tid, og tillate null-skudd-tilpasning til nye stiler, domener eller selv helt andre oppgaver som stilisering eller klassisk kondisjonert syntese.

I de nedre radene ser vi nærmeste naboer trekkes inn i diffusjonsprosessen i RDM*.

I de nedre radene ser vi nærmeste naboer trekkes inn i diffusjonsprosessen i RDM*.

En nøkkel fordeler med RDM er dens evne til å forbedre bildegenerering uten å måtte trene modellen på nytt. Ved å bare endre hentings-database, kan modellen generalisere til nye konsepter den aldri ble eksplisitt trent på. Dette er spesielt nyttig i applikasjoner hvor domene-skift skjer, som generering av medisinske bilder basert på evoluerende datasett, eller tilpasning av tekst-til-bilde-modeller for kreative applikasjoner.

Negativt, avhenger hentings-baserte metoder av denne typen kvaliteten og relevansen av den eksterne database, noe som gjør data-kurering en viktig faktor for å oppnå høykvalitets generering; og denne tilnærmingen er langt ifra en bilde-syntese-ekvivalent av den typen RAG-basert interaksjon som er typisk i kommersielle LLM-er.

ReMoDiffuse

ReMoDiffuse er en hentings-forbedret bevegelses-diffusjonsmodell designet for 3D-menneskebevegelsesgenerering. I motsetning til tradisjonelle bevegelses-genereringsmodeller som avhenger av rent lært representasjoner, henter ReMoDiffuse relevante bevegelses-eksempler fra en stor bevegelses-datasett og integrerer dem i støy-fjerningsprosessen, i en skjema lignende RDM (se over).

Sammenligning av RAG-forbedret ReMoDiffuse (høyre) med tidligere metoder. Kilde: https://arxiv.org/pdf/2304.01116

Sammenligning av RAG-forbedret ReMoDiffuse (høyre) med tidligere metoder. Kilde: https://arxiv.org/pdf/2304.01116

Dette tillater modellen å generere bevegelses-sekvenser som er designet for å være mer naturlige og diverse, samt semantisk tro mot brukerens tekst-prompt.

ReMoDiffuse bruker en innovativ hybrid-hentings-mekanisme, som velger bevegelses-sekvenser basert på både semantisk og kinematisk likhet, med intensjonen av å sikre at de hentede bevegelsene ikke bare er tematisk relevante, men også fysisk plausibelt når de integreres i den nye genereringen.

Modellen refinerer deretter disse hentede eksemplene ved å bruke en Semantikk-Modulert Transformer, som selektivt inkorporerer kunnskap fra de hentede bevegelsene samtidig som den beholder de karakteristiske kvalitetene til den genererte sekvensen:

Skjema for ReMoDiffuse’s pipeline.

Skjema for ReMoDiffuse’s pipeline.

Prosjektets Betingelsesblandings-teknikk forbedrer modellens evne til å generalisere over forskjellige prompt og hentings-betingelser, balanserer hentede bevegelses-eksempler med tekst-prompt under generering, og justerer hvor mye vekt hver kilde får ved hvert steg.

Dette kan hjelpe med å forhindre urealistiske eller repetitive utdata, selv for sjeldne prompt. Det addreser også skala-følsomhets-problemet som ofte oppstår i klassifikator-frie veilednings-teknikker som ofte brukes i diffusjonsmodeller.

RA-CM3

Stanfords 2023 papir Retrieval-Augmented Multimodal Language Modeling (RA-CM3) tillater systemet å få tilgang til virkelige verdens informasjon på inferens-tid:

Stanfords Retrieval-Augmented Multimodal Language Modeling (RA-CM3) modell bruker internett-hentede bilder for å forbedre genereringsprosessen, men er fortsatt en prototype uten offentlig tilgang. Kilde: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

Stanfords Retrieval-Augmented Multimodal Language Modeling (RA-CM3) modell bruker internett-hentede bilder for å forbedre genereringsprosessen, men er fortsatt en prototype uten offentlig tilgang. Kilde: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

RA-CM3 integrerer hentede tekst og bilder i genererings-pipeline, og forbedrer både tekst-til-bilde og bilde-til-tekst syntese. Ved å bruke CLIP for henting og en Transformer som generatoren, henviser modellen til relevante multimodale dokumenter før den komponerer en utgang.

Benchmark på MS-COCO viser betydelige forbedringer over DALL-E og lignende systemer, og oppnår en 12-poeng Fréchet Inception Distance (FID) reduksjon, med langt lavere beregningskostnader.

Likevel, som med andre hentings-forbedrede tilnærminger, gjør RA-CM3 ikke en sammenføyning av den hentede kunnskapen. I stedet overlagrer den ny data mot sin forhåndsdefinerte nettverk, mye som en LLM som forbedrer svar med søke-resultater. Mens denne metoden kan forbedre faktisk nøyaktighet, erstatter den ikke behovet for trenings-oppdateringer i domener hvor dyp syntese er nødvendig.

I tillegg ser det ut til at en praktisk implementering av dette systemet ikke er blitt utgitt, selv ikke på en API-basert plattform.

RealRAG

En ny utgivelse fra Kina, og den som har utløst denne gjennomgangen av RAG-forbedrede generative bilde-systemer, er kalt Retrieval-Augmented Realistisk Bilde-Generering (RealRAG).

Eksterne bilder hentet inn i RealRAG (nederst til høyre).

Eksterne bilder hentet inn i RealRAG (nederst til høyre).

RealRAG henter faktiske bilder av relevante objekter fra en database kuratert fra offentlig tilgjengelige datasett som ImageNet, Stanford Cars, Stanford Dogs, og Oxford Flowers. Den integrerer deretter de hentede bildene i genereringsprosessen, og addreser kunnskaps-gap i modellen.

En nøkkel komponent i RealRAG er selv-refleksiv kontrastiv læring, som trener en hentings-modell til å finne informasjonsgivende referanse-bilder, snarere enn bare å velge visuelt like bilder.

Forfatterne sier:

‘Vår nøkkel-insikt er å trene en henter som henter bilder som holder seg utenfor genererings-rommet til generatoren, men likevel nærme seg representasjonen av tekst-prompt.

‘Til dette [formål], genererer vi først bilder fra gitt tekst-prompt, og deretter bruker vi de genererte bildene som spørringer for å hente de mest relevante bildene i den virkelige-objekt-baserte database. Disse mest relevante bildene brukes som refleksive negativ.

Dette sikrer at de hentede bildene bidrar med manglende kunnskap til genereringsprosessen, snarere enn å forsterke eksisterende fordommer i modellen.

Venstre, det hentede referanse-bildet; midten, uten RAG; høyre, med bruk av det hentede bildet.

Venstre, det hentede referanse-bildet; midten, uten RAG; høyre, med bruk av det hentede bildet.

Likevel, avhengigheten av hentings-kvalitet og database-dekning betyr at effektiviteten kan variere avhengig av tilgjengeligheten av høykvalitets-referanser. Hvis et relevant bilde ikke finnes i datasettet, kan modellen likevel slite med ukjente konsepter.

RealRAG er en svært modulær arkitektur, og tilbyr kompatibilitet med flere andre generative arkitekturer, inkludert U-Net-basert, DiT-basert og autoregressiv modell.

I generell, adderer henting og prosessering av eksterne bilder beregnings-overhodet, og systemets ytelse avhenger av hvor godt hentings-mekanismen generaliserer over forskjellige oppgaver og datasett.

Konklusjon

Dette er en representativ, men ikke uttømmende oversikt over bilde-hentende multimodale generative systemer. Noen systemer av denne typen bruker henting kun for å forbedre visuell forståelse eller datasett-kurering, blant andre forskjellige motiver, snarere enn å søke å generere bilder. Et eksempel er Internet Explorer.

Mange av de andre RAG-integerte prosjektene i litteraturen er fortsatt ikke utgitt. Prototyper, med kun publisert forskning, inkluderer Re-Imagen, som – til tross for sin opprinnelse fra Google – kun kan aksessere bilder fra en lokal, tilpasset database.

Også, i november 2024, kunngjorde Baidu utgivelsen av Bilde-basert Hentings-forbedret Generering (iRAG), en ny plattform som bruker hentede bilder ‘fra en database’. Selv om iRAG angivelig er tilgjengelig på Ernie-plattformen, ser det ut til at det ikke finnes flere detaljer om denne hentings-prosessen, som ser ut til å avhenge av en lokal database (dvs. lokal til tjenesten og ikke direkte tilgjengelig for brukeren).

Further, 2024-papiret Unified Text-to-Image Generation and Retrieval tilbyr enda en RAG-basert metode for å bruke eksterne bilder til å forbedre resultater på genererings-tid – igjen, fra en lokal database snarere enn fra ad-hoc internett-kilder.

Begeistring rundt RAG-basert forbedring i bildegenerering er sannsynligvis å fokusere på systemer som kan inkorporere internett-kilder eller bruker-lastede bilder direkte i genereringsprosessen, og som tillater brukerne å delta i valg eller kilder av bilder.

Likevel, dette er en betydelig utfordring av minst to grunner; først og fremst, fordi effektiviteten av slike systemer vanligvis avhenger av dypt integrerte relasjoner dannet under en ressurskrevende treningsprosess; og fordi bekymringer over sikkerhet, lovlighet og opphavsretts-begrensninger, som nevnt tidligere, gjør dette en usannsynlig funksjon for en API-drevet nettside, og for kommersiell utbredelse i generell.

* Kilde: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf Først publisert tirsdag, 4. februar 2025

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai