Andersonin kulma

Tulevaisuus RAG-pohjaisessa kuvageneraatiossa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
ChatGPT-4o: ‘Decades ago photos were a photochemical process, and typically photographic prints were done in a darkroom, with the wet prints hung from a line like clothes. Show me that environment, with 10 photos drying on a line in darkroom, and a white-coated scientist picking one of them off the line. Bokeh focus, 1792x1024’

Generatiiviset diffuusiomallit, kuten Stable Diffusion, Flux ja videomallit kuten Hunyuan, riippuvat tiedosta, joka on hankittu yhden koulutussession aikana kiinteästä aineistosta. Kaikki käsitteet, jotka esitellään tämän koulutuksen jälkeen – jotka viittaavat tietämyksen leikkauspisteeseen – puuttuvat mallista, ellei niitä täydennetä hienosäätöä tai ulkoisia sopeutumistekniikoita kuten Low Rank Adaptation (LoRA) avulla.

Olisi siis ihanteellista, jos generatiivinen järjestelmä, joka tuottaa kuvia tai videoita, voisi hakea tietoa internetistä ja tuoda sen generointiprosessiin tarpeen mukaan. Tällä tavalla esimerkiksi diffuusiomalli, joka ei tiedä mitään uusimmasta Apple- tai Tesla-julkaisusta, voisi silti tuottaa kuvia, jotka sisältävät nämä uudet tuotteet.

Kielellisissä malleissa useimmat meistä ovat tuttuja järjestelmistä, kuten Perplexity, Notebook LM ja ChatGPT-4o, jotka voivat sisällyttää uuden ulkoisen tiedon Retrieval Augmented Generation (RAG) -malliin.

RAG-prosessit tekevät ChatGPT 4o:n vastauksista relevantimmassa.

RAG-prosessit tekevät ChatGPT 4o:n vastauksista relevantimmassa. Lähde: https://chatgpt.com/

Kuitenkin tämä on epätavallinen ominaisuus kuvien generoimisessa, ja ChatGPT tunnustaa omat rajoituksensa tässä suhteessa:

ChatGPT 4o on tehnyt hyvän arvauksen uuden rannekellon visualisoinnista, perustuen yleiseen linjaan ja kuvausten tulkintaan; mutta se ei voi ’absorboida’ ja integroida uusia kuvia DALL-E-pohjaiseen generointiin.

ChatGPT 4o on tehnyt hyvän arvauksen uuden rannekellon visualisoinnista, perustuen yleiseen linjaan ja kuvausten tulkintaan; mutta se ei voi ’absorboida’ ja integroida uusia kuvia DALL-E-pohjaiseen generointiin.

Ulkopuolisen datan sisällyttäminen generoituun kuvaan on haasteellista, koska saapuva kuva on ensin jaettava tokeneiksi ja upottamisksi, jotka sitten kartoitetaan mallin lähimpään koulutettuun aiheen tietämykseen.

Vaikka tämä prosessi toimii tehokkaasti jälkikoulutusvälineissä kuten ControlNet, tällaiset manipulaatiot ovat pääasiassa pinta-alaisia, ja ne kuljettavat haetun kuvan renderöintiputkeen, mutta eivät sisälly syvällisesti mallin sisäiseen edustukseen.

Tämä johtaa siihen, että malli ei pysty tuottamaan uusia näkökulmia samalla tavalla kuin neuroradiance-järjestelmät kuten NeRF, jotka rakentavat kohtauksia oikean avaruuden ja rakenteen ymmärtämisen kautta.

Kypsyneet loogiset järjestelmät

Samankaltainen rajoitus koskee myös RAG-pohjaisia kyselyjä suurissa kielimalleissa (LLM), kuten Perplexity. Kun tällainen malli prosessoi ulkoista haettua tietoa, se toimii paljon kuin aikuinen, joka piirtää elämänsä aikana saadusta tiedosta johtopäätöksiä aiheesta.

Kuitenkin, samoin kuin ihminen ei voi takautuvasti integroida uutta tietoa kognitiiviseen kehykseen, joka muotoili hänen perustavan maailmankuvansa – kun hänen ennakkoluulonsa ja edellytyksensä muodostuivat – LLM ei voi sulauttaa uutta tietoa vaivattomasti ennakkoon koulutettuun rakenteeseensa.

Sen sijaan se voi vain ’vaikuttaa’ tai asettaa uuden tiedon rinnalle olemassa olevaa sisäistettyä tietoa, käyttäen oppimia periaatteita analyysiin ja spekulaatioon, eikä syntetisoi perustasolla.

Tämä ero asennetun ja sisäistetyn generoinnin välillä on todennäköisesti näkyvämmpi generoidussa kuvassa kuin kielellisessä generoinnissa.

Piilotetut riskit RAG-pohjaisessa kuvageneraatiossa

Vaikka teknisesti olisi mahdollista sulauttaa haetut internetkuvat uusiin syntetisoituun kuvien joukkoon RAG-tyylisesti, turvallisuuteen liittyvät rajoitukset esittäisivät lisää haasteita.

Monet generatiivisten mallien koulutukseen käytetyistä aineistoista on karsittu minimoidakseen eksplisiittisen, rasistisen tai väkivaltaisen sisällön, muiden herkkien luokkien joukossa. Kuitenkin tämä prosessi on epätäydellinen, ja jäänteelliset assosiaatiot voivat säilyä. Tämän neutraloimiseksi järjestelmät kuten DALL·E ja Adobe Firefly luottavat toissijaisiin suodatusmekanismeihin, jotka tarkkailevat sekä syöteohjelmia että generoituja tulosteita kielletyn sisällön varalta.

Tästä syystä yksinkertainen NSFW-suodatin – joka estää lähinnä eksplisiittisen sisällön – olisi riittämätön arvioimaan haetun RAG-pohjaisen datan hyväksyttävyyttä. Tällainen sisältö voisi edelleen olla loukkaavaa tai haitallista tavoilla, jotka eivät kuulu mallin ennalta määritettyjen moderointiparametrien piiriin, ja se voisi esittää materiaalia, jota AI ei pysty asianmukaisesti arvioimaan.

Viimeaikaisen haavoittuvuuden löytäminen Kiinan valmistamasta DeepSeekistä, joka on suunniteltu tukahduttamaan kiellettyjen poliittisten sisältöjen keskustelua, on korostanut, miten vaihtoehtoiset syötekanavat voidaan hyödyntää ohittamaan mallin eettisiä suojausjärjestelmiä; voidaan väittää, että tämä koskee myös mielivaltaisia uusia internetistä haettuja tietoja, kun niitä on tarkoitus sisällyttää uuteen kuvagenerointiin.

RAG kuvageneraatiolle

Haasteista ja hankalista poliittisista näkökulmista huolimatta useita projekteja on kehitetty, jotka pyrkivät käyttämään RAG-pohjaisia menetelmiä uuden datan sisällyttämiseksi visuaalisiin generointeihin.

ReDi

Vuoden 2023 Retrieval-pohjainen diffuusio (ReDi) on oppimisen vapaa kehys, joka nopeuttaa diffuusiomallin inferenceä hakemalla samankaltaisia trajectoreita ennakkoon lasketusta tietopohjasta.

Arvoja voidaan ’lainata’ uudesta generoinnista ReDi:ssä. Lähde: https://arxiv.org/pdf/2302.02285

Arvoja voidaan ’lainata’ uudesta generoinnista ReDi:ssä. Lähde: https://arxiv.org/pdf/2302.02285

Diffuusiomalleissa trajektoria on askelkohtainen polku, jota malli seuraa kuvan generoimiseksi puhtaasta melusta. Tavallisesti tämä prosessi tapahtuu asteittain useiden askelten aikana, ja kunkin askelen aikana kuva tarkentuu hieman.

ReDi nopeuttaa tätä prosessia ohittamalla joukon näistä askelista. Sen sijaan, että lasketaan jokainen askel, ReDi hakee samankaltaisen aiemman trajektorian tietokannasta ja hyppää eteenpäin prosessin myöhäisempään vaiheeseen. Tämä vähentää tarvittavien laskelmien määrää, mikä tekee diffuusiopohjaisen kuvageneroinnin paljon nopeammaksi, säilyttäen samalla korkean laadun.

ReDi ei muuta diffuusiomallin painoja, vaan käyttää tietopohjaa välimiesaskelten ohittamiseen, mikä vähentää tarvittavien funktioarvioiden määrää näytteiden ottamiseen.

Tietysti tämä ei ole sama asia kuin tiettyjen kuvien sisällyttäminen halutessa generointipyynnössä; mutta se liittyy samankaltaisiin generoimistyyppeihin.

Julkaistu vuonna 2022, vuonna jolloin latenttidiffuusiomallit valloittivat julkisen mielikuvituksen, ReDi näyttää olevan yksi varhaisimmista diffuusiopohjaisista lähestymistavoista, jotka nojaavat RAG-metodologiaan.

Vaikka vuonna 2021 Facebook Research julkaisi Instance-Conditioned GAN:in, joka pyrki ehdollistamaan GAN-kuvia uusille kuvatuloksiin, tällainen projektio latenttiavaruuteen on erittäin yleinen kirjallisuudessa, sekä GAN:eille että diffuusiomalleille; haaste on tehdä tällainen prosessi koulutusvapaaksi ja toimivaksi reaaliajassa, kuten LLM-keskisiä RAG-menetelmiä.

RDM

Toinen varhainen yritys RAG-pohjaisen kuvageneroinnin parissa on Retrieval-Augmented Diffusion Models (RDM), joka esittelee semi-parametrinen lähestymistapa generatiiviseen kuvasynteesiin. Perinteisten diffuusiomallien sijaan, jotka tallentavat kaiken oppimansa visuaalisen tiedon neuroverkko-parametreihin, RDM luottaa ulkoiseen kuvatietokantaan:

Haetut lähimmät naapurit RDM:n pseudo-kyselyssä*.

Haetut lähimmät naapurit RDM:n pseudo-kyselyssä*.

Koulutuksen aikana malli hakee lähimmät naapurit (visuaalisesti tai semanttisesti samankaltaisia kuvia) ulkoisesta tietokannasta ohjaamaan generointiprosessia. Tämä mahdollistaa mallille ehdollistaa tuloksiaan todellisten maailman visuaalisten esimerkkien perusteella.

Haun prosessi perustuu CLIP -upotukseen, joka on suunniteltu pakottamaan haetut kuvat jakamaan merkityksellisiä yhtäläisyyksiä kyselyyn, ja tarjoamaan uutta tietoa generoinnin parantamiseksi.

Tämä vähentää parametreja, mikä mahdollistaa pienempien mallien saavuttamisen kilpailukykyisiä tuloksia ilman laajoja koulutusaineistoja.

RDM-lähestymistapa tukee post-hoc -muokkauksia: tutkijat voivat vaihtaa tietokannan inference-ajankohtana, sallien nollasuorituksen sopeutumisen uusiin tyyleihin, domeeneihin tai jopa täysin eriin tehtäviin, kuten stylisointiin tai luokka-ehtoiseen synteesiin.

Alemmissa rivissä nähdään lähimmät naapurit, jotka on vedetty diffuusioprosessiin RDM*:ssa.

Alemmissa rivissä nähdään lähimmät naapurit, jotka on vedetty diffuusioprosessiin RDM*:ssa.

RDM:n avainetua on sen kyky parantaa kuvagenerointia ilman mallin uudelleenkoulutusta. Vaihtamalla pelkästään hakutietokantaa, malli voi yleistää uusiin käsitteisiin, joille se ei ollut alun perin koulutettu. Tämä on erityisen hyödyllistä sovelluksissa, joissa domeenisiirtymät tapahtuvat, kuten lääketieteellisten kuvien generoiminen kehittyvistä aineistoista tai teksti-kuvamallien sopeuttaminen luovien sovellusten tarpeisiin.

Negatiivisesti, tällaiset hakupohjaiset menetelmät riippuvat ulkoisen tietokannan laadusta ja merkityksellisyydestä, mikä tekee datakuratoinnin tärkeäksi tekijäksi saavuttamassa korkealaatuisissa generoinneissa; ja tämä lähestymistapa on edelleen kaukana kuvasynteesin vastaavasta RAG-pohjaisesta vuorovaikutuksesta, jota tavataan kaupallisissa LLM:jä.

ReMoDiffuse

ReMoDiffuse on hakupohjainen liikediffuusiomalli, joka on suunniteltu 3D-ihmisen liikkeen generoimiseen. Toisin kuin perinteiset liikemallit, jotka riippuvat pelkästään oppimistaan edustuksista, ReMoDiffuse hakee merkityksellisiä liikemalleja suuresta liiketietokannasta ja integroi ne denoising-prosessiin, samassa skeemassa kuin RDM (ks. yllä).

Vertailu RAG-pohjaisen ReMoDiffusen (oikeanpuoleisin) ja aiempiin menetelmiin. Lähde: https://arxiv.org/pdf/2304.01116

Vertailu RAG-pohjaisen ReMoDiffusen (oikeanpuoleisin) ja aiempiin menetelmiin. Lähde: https://arxiv.org/pdf/2304.01116

Tämä mahdollistaa mallille luonnollisempien ja monipuolisempien liikesequenssien generoimisen, jotka ovat semanttisesti uskollisia käyttäjän tekstipromptteihin.

ReMoDiffuse käyttää innovatiivista hybridihaun mekanismia, joka valitsee liikesequenssejä sekä semanttisen että kinemaattisen samankaltaisuuden perusteella, tarkoituksena varmistaa, että haetut liikkeet eivät ole vain teemallisesti merkityksellisiä, vaan myös fyysisesti uskottavia, kun ne integroidaan uuteen generointiin.

Malli sitten hienontaa nämä haetut näytteet Semantiikka-Moduloivan Transformerin avulla, joka valikoivasti sisällyttää tietoa haetuista liikkeistä, säilyttäen samalla generoituun sequenssin ominaislaadun:

ReMoDiffusen pipeline-skeema.

ReMoDiffusen pipeline-skeema.

Hankkeen Condition Mixture -tekniikka parantaa mallin kykyä yleistää eriin promptteihin ja hakuehtoihin, tasapainottaen haetut liikkeet tekstiprompttien kanssa generoinnin aikana ja mukauttaen, kuinka paljon painoa kullekin lähde saa kussakin vaiheessa.

Tämä auttaa estämään epärealistisia tai toistuvia tuloksia, jopa harvinaisissa prompteissa. Se myös ratkaisee skaalansensitiivisyyden ongelman, joka usein ilmenee luokittelu-vapaissa ohjaustekniikoissa, joita yleisesti käytetään diffuusiomalleissa.

RA-CM3

Stanfordin vuoden 2023 julkaisu Retrieval-Augmented Multimodal Language Modeling (RA-CM3) sallii järjestelmän pääsyn maailmanlaajuiseen tietoon inference-ajankohtana:

Stanfordin Retrieval-Augmented Multimodal Language Modeling (RA-CM3) -malli käyttää internetistä haettuja kuvia generointiprosessin täydentämiseen, mutta se on edelleen prototyyppi ilman julkista pääsyä. Lähde: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

Stanfordin Retrieval-Augmented Multimodal Language Modeling (RA-CM3) -malli käyttää internetistä haettuja kuvia generointiprosessin täydentämiseen, mutta se on edelleen prototyyppi ilman julkista pääsyä. Lähde: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf

RA-CM3 integroi haetut tekstit ja kuvat generointiputkeen, parantaen sekä teksti-kuvan että kuva-tekstin synteesiä. Käyttäen CLIP:iä haussa ja Transformeria generoijana, malli viittaa merkityksellisiin multimodaalisiin asiakirjoihin ennen tulosteen muodostamista.

Vertailu MS-COCO -tietokannassa osoittaa merkittäviä parannuksia DALL-E:hen ja vastaaviin järjestelmiin verrattuna, saavuttaen 12 pisteen Fréchet Inception Distance (FID) -vähennyksen, paljon vähemmällä laskennallisella kustannuksella.

Kuitenkin, kuten muissakin hakupohjaisissa lähestymistavoissa, RA-CM3 ei sisällytä saamaansa tietoa vaivattomasti. Sen sijaan se asettaa uuden tiedon päälle ennakkoon koulutetun verkon, samoin kuin LLM, joka täydentää vastauksiaan hakutuloksilla. Vaikka tämä menetelmä voi parantaa faktuaalista tarkkuutta, se ei korvaa koulutuspäivitysten tarvetta domeeneissa, joissa syvä synteesi vaaditaan.

Lisäksi, käytännön toteutus tästä järjestelmästä ei vaikuta olevan saatavilla, edes API-pohjaiselle alustalle.

RealRAG

Kiinasta tuleva uusi julkaisu, joka on herättänyt tämän tarkastelun RAG-pohjaisista generatiivisista kuvajärjestelmistä, on nimeltään Retrieval-Augmented Realistic Image Generation (RealRAG).

Ulkoiset kuvat haetaan RealRAG:sta (alhaalla keskellä). Lähde: https://arxiv.o7rg/pdf/2502.00848

Ulkoiset kuvat haetaan RealRAG:sta (alhaalla keskellä). Lähde: https://arxiv.o7rg/pdf/2502.00848

RealRAG hakee todellisia kuvia merkityksellisistä objekteista tietokannasta, joka on kuratoitu julkisesti saatavilla olevista aineistoista, kuten ImageNet, Stanford Cars, Stanford Dogs ja Oxford Flowers. Se sitten integroi haetut kuvat generointiprosessiin, ratkaisemalla tiedon aukot mallissa.

RealRAG:n avainkomponentti on itseheijastuva kontrastinen oppiminen, joka kouluttaa hakumallin löytämään tietopitoisia viitekuvia, eikä pelkästään visuaalisesti samankaltaisia.

Tekijät toteavat:

’Meidän avainnäkemyksemme on kouluttaa haku, joka hakee kuvia, jotka ovat pois generoivan mallin generointitilasta, mutta lähellä tekstiprompttien edustusta.

’Tähän tarkoitukseen me ensin generoimme kuvia annetuista tekstipromteista ja käytimme sitten generoituja kuvia kyselyinä hakemaan kaikkein merkityksellisimmät kuvat todellisten objektiiden tietokannasta. Nämä kaikkein merkityksellisimmät kuvat käytetään heijastavina negatiivisina.’

Tämä lähestymistapa varmistaa, että haetut kuvat sisällyttävät puuttuvaa tietoa generointiprosessiin, eikä vahvista olemassa olevia mallin harhautumia.

Vasemmalla, haettu viitekuva; keskellä, ilman RAG:ia; oikealla, haetun kuvan käytön jälkeen.

Vasemmalla, haettu viitekuva; keskellä, ilman RAG:ia; oikealla, haetun kuvan käytön jälkeen.

Kuitenkin, riippuvuus haun laadusta ja tietokannan kattavuudesta tarkoittaa, että sen tehokkuus voi vaihdella riippuen siitä, onko korkealaatuinen viite saatavilla. Jos asiaankuuluvaa kuvaa ei ole aineistossa, malli voi edelleen kamppailla tutkimattomien käsitteiden kanssa.

RealRAG on erittäin modulaarinen arkkitehtuuri, joka tarjoaa yhteensopivuuden useiden muiden generatiivisten arkkitehtuureiden kanssa, mukaan lukien U-Net-pohjaiset, DiT-pohjaiset ja autoregressiiviset mallit.

Yleisesti, ulkoisten kuvien hakeminen ja prosessointi lisäävät laskennallista kuormitusta, ja järjestelmän suorituskyky riippuu siitä, miten hyvin hakumekanismi yleistää eri tehtävissä ja aineistoissa.

Johtopäätös

Tämä on edustava, mutta ei kattava katsaus kuvahakuun perustuvista multimodaalisista generatiivisista järjestelmistä. Jotkut tällaiset järjestelmät käyttävät hakua ainoastaan parantamaan visuaalista ymmärtämistä tai aineiston kuratointia, muun muassa; eivät pyri generoimaan kuvia. Yksi esimerkki on Internet Explorer.

Monet muut RAG-integroidut projektit kirjallisuudessa ovat edelleen julkaisemattomia. Prototyypit, joissa on vain julkaistu tutkimus, kuten Re-Imagen, joka – vaikka se on peräisin Googlelta – voi käyttää ainoastaan paikallista mukautettua tietokantaa.

Lisäksi, marraskuussa 2024 Baidu ilmoitti Kuvapohjaisen hakutiedon täydentämisen (iRAG), uuden alustan, joka käyttää haettuja kuvia tietokannasta. Vaikka iRAG on ilmoitettu olevan saatavilla Ernie-alustalla, ei näytä olevan tarkempia tietoja tästä hakuprosessista, joka näyttää riippuvan paikallisesta tietokannasta (eli palvelimen paikallisesta tietokannasta eikä suoraan käyttäjän saatavilla olevasta).

Lisäksi, vuoden 2024 tutkimus Yhdistetty teksti-kuvan generointi ja hakeminen tarjoaa toisen RAG-pohjaisen menetelmän ulkoisten kuvien käytölle generoinnin aikana – jälleen kerran paikallisesta tietokannasta eikä ad hoc -internetlähteistä.

Jännitys RAG-pohjaisen täydentämisen ympärillä kuvageneroinnissa on todennäköisesti keskittynyt järjestelmiin, jotka voivat sisällyttää internetistä haetut tai käyttäjän lataamat kuvat suoraan generointiprosessiin, ja jotka sallivat käyttäjien osallistua kuvien valintaan tai lähteisiin.

Kuitenkin tämä on merkittävä haaste ainakin kahdesta syystä; ensinnäkin, koska tällaisten järjestelmien tehokkuus riippuu usein syvistä suhteista, jotka muodostuvat resursseja vaativan koulutusprosessin aikana; ja toiseksi, koska turvallisuuden, laillisuuden ja tekijänoikeuksien rajoitukset, kuten aiemmin mainittu, tekevät tämän epätodennäköiseksi ominaisuudeksi API-vetoinen verkkopalveluun ja kaupalliseen käyttöön yleensä.

 

* Lähde: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf

Julkaistu ensimmäisen kerran tiistaina, 4. helmikuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai