Andersonův úhel
Budoucnost RAG-augmentované generace obrazů

Generativní difuzní modely, jako je Stable Diffusion, Flux a video modely, jako je Hunyuan, spoléhají na znalosti získané během jediné, náročné trénovací seance pomocí pevné datové sady. Jakékoli koncepty zavedené po této trénovací seanci – označované jako knowledge cut-off – jsou absence v modelu, pokud nejsou doplněny pomocí fine-tuning nebo externích adaptivních technik, jako je Low Rank Adaptation (LoRA).
Bylo by ideální, kdyby generativní systém, který generuje obrázky nebo videa, mohl vyhledat online zdroje a zahrnout je do generativního procesu podle potřeby. Například difuzní model, který neví nic o nejnovějším vydání Apple nebo Tesla, by mohl stále generovat obrázky obsahující tyto nové produkty.
V případě jazykových modelů jsme většina z nás obeznámena se systémy, jako je Perplexity, Notebook LM a ChatGPT-4o, které mohou zahrnout nové externí informace do Retrieval Augmented Generation (RAG) modelu.

RAG procesy dělají odpovědi ChatGPT 4o více relevantní. Zdroj: https://chatgpt.com/
Však toto je neobvyklá možnost, pokud jde o generování obrázků, a ChatGPT přizná své vlastní omezení v tomto ohledu:

ChatGPT 4o udělal dobrý odhad vizualizace nového vydání hodinek, založený na obecném tvaru a popisech, které interpretoval; ale nemůže ‘absorbovat’ a integrovat nové obrázky do generace založené na DALL-E.
Zahrnutí externě získaných dat do generovaného obrázku je obtížné, protože přicházející obrázek musí být nejprve rozložen na tokeny a embeddings, které jsou pak mapovány na nejbližší trénovací znalosti modelu o tématu.
Zatímco tento proces funguje efektivně pro nástroje pro trénování, jako je ControlNet, takové manipulace zůstávají převážně povrchní, vlastně funnelující získaný obrázek přes renderovací pipeline, ale bez hluboké integrace do vnitřní reprezentace modelu.
Jako výsledek, model postrádá schopnost generovat nové perspektivy způsobem, jakým systémy neuronálního renderování, jako je NeRF, které konstruují scény s pravou prostorovou a strukturální znalostí.
Zralá logika
Podobné omezení platí pro RAG-založené dotazy v Large Language Modelech (LLM), jako je Perplexity. Když model tohoto typu zpracovává externě získaná data, funguje podobně jako dospělý, který se odvolává na celý život znalostí, aby odhadl pravděpodobnosti o tématu.
Však stejně jako člověk nemůže retroaktivně integrovat nové informace do kognitivního rámce, který utvořil jeho základní světový názor – když se jeho předsudky a předpojatosti ještě formovaly – LLM nemůže bezproblémově sloučit nové znalosti do své předtrénované struktury.
Místo toho může pouze ‘ovlivnit’ nebo konfrontovat nová data se svými stávajícími internalizovanými znalostmi, pomocí naučených principů k analýze a konjektuře, spíše než k syntéze na základní úrovni.
Tento nedostatek ekvivalence mezi juxtaposed a internalized generací je pravděpodobně více patrný v generovaném obrázku než v jazykové generaci:
Skrytá rizika RAG-kapabilní generace obrazů
I kdyby bylo technicky možné bezproblémově integrovat získané internetové obrázky do nově syntetizovaných v RAG-stylu, bezpečnostní omezení by představovala další výzvu.
Mnohé datové sady používané pro trénování generativních modelů byly kurátorovány, aby minimalizovaly přítomnost explicitního, rasistického nebo násilného obsahu, mezi jinými citlivými kategoriemi. Avšak tento proces je nedokonalý a reziduální asociace mohou přetrvávat. Aby se tomu zabránilo, systémy, jako je DALL·E a Adobe Firefly, spoléhají na sekundární filtrační mechanismy, které kontrolují jak vstupní podněty, tak generované výstupy pro zakázaný obsah.
V důsledku toho by jednoduchý NSFW filtr – který primárně blokuje otevřeně explicitní obsah – byl nedostatečný pro hodnocení přijatelnosti získaných RAG-založených dat. Takový obsah by mohl být stále urážlivý nebo škodlivý způsoby, které spadají mimo předdefinované moderátorské parametry modelu, potenciálně zavádějící materiál, který AI postrádá kontextuální povědomí, aby jej správně vyhodnotil.
Objev nedávné zranitelnosti v CCP-produkovaném DeepSeek, navrženého pro potlačení diskusí o zakázaném politickém obsahu, zdůraznil, jak alternativní vstupní cesty mohou být využity k obcházení etických zábran modelu; zřejmě se to vztahuje také na libovolná nová data získaná z internetu, když se má integrovat do nové generace obrázků.
RAG pro generaci obrazů
Navzdory těmto výzvám a složitým politickým aspektům se objevilo několik projektů, které se snaží použít RAG-založené metody k začlenění nových dat do vizuálních generací.
ReDi
Projekt Retrieval-based Diffusion (ReDi) z roku 2023 je učící se framework, který urychluje inferenci difuzního modelu tím, že získá podobné trajectories z předem vypočítané znalostní báze.

Hodnoty z datové sady mohou být ‘půjčeny’ pro novou generaci v ReDi. Zdroj: https://arxiv.org/pdf/2302.02285
V kontextu difuzních modelů je trajektorie krok za krokem cesta, kterou model bere k generování obrázku z čisté šumu. Obvykle tento proces probíhá postupně během mnoha kroků, s každým krokem, který obrázek trochu více upravuje.
ReDi urychluje tento proces tím, že přeskočí řadu těchto kroků. Místo výpočtu každého jednotlivého kroku získá podobnou předchozí trajektorii z databáze a přeskočí na pozdější bod v procesu. To snižuje počet nutných výpočtů, což činí generování obrazů založených na difuzi mnohem rychlejším, zatímco kvalita zůstává vysoká.
ReDi nemění váhy difuzního modelu, ale místo toho používá znalostní bázi k přeskočení mezilehlých kroků, čímž se snižuje počet funkčních odhadů potřebných pro vzorkování.
Samozřejmě, že toto není totéž, jako kdybychom mohli libovolně začlenit konkrétní obrázky do generace; ale souvisí to s podobnými typy generace.
Publikován v roce 2022, kdy latentní difuzní modely získaly veřejnou pozornost, ReDi se zdá být jedním z prvních difuzních přístupů, které spoléhají na RAG metodologii.
Ačkoli by mělo být zmíněno, že v roce 2021 Facebook Research vydal Instance-Conditioned GAN, který se snažil podmínit GAN obrázky na nových vstupních obrazech, tento typ projekce do latentního prostoru je velmi častý v literatuře, jak pro GANy, tak pro difuzní modely; výzvou je učinit takový proces bez trénování a funkční v reálném čase, jako jsou RAG-založené metody zaměřené na LLM.
RDM
Další ranou snahou o RAG-augmentovanou generaci obrazů jsou Retrieval-Augmented Diffusion Models (RDM), které představují semi-parametrický přístup k generativní syntéze obrazů. Zatímco tradiční difuzní modely ukládají veškeré získané vizuální znalosti uvnitř svých neuronových sítí, RDM spoléhá na externí obrazovou databázi:

Získané nejbližší sousedy v ilustrativním pseudo-dotazu v RDM*.
Během trénování model získá nejbližší sousedy (vizuálně nebo sémanticky podobné obrázky) z externí databáze, aby vedl generativní proces. To umožňuje modelu podmínit své výstupy na reálných vizuálních instancech.
Proces získávání je poháněn CLIP embeddings, navržených tak, aby získané obrázky sdílely významné podobnosti s dotazem, a aby poskytly nové informace pro zlepšení generace.
Tento přístup snižuje závislost na parametrech, usnadňuje menší modely, které dosahují konkurenčních výsledků bez potřeby rozsáhlých trénovacích dat.
Přístup RDM podporuje post-hoc modifikace: výzkumníci mohou vyměnit databázi během inferenční doby, umožňující nulovou adaptaci na nové styly, domény nebo dokonce zcela odlišné úkoly, jako je stylizace nebo podmíněná syntéza.

V nižších řádcích vidíme nejbližší sousedy vtáhnuté do difuzního procesu v RDM*.
Klíčovým výhodou RDM je jeho schopnost zlepšit generaci obrazů bez potřebného opětovného trénování modelu. Pouze změnou databáze získávání může model zobecnit na nové koncepty, na které nebyl explicitně trénován. To je zvláště užitečné pro aplikace, kde doménové posuny nastávají, jako je generování medicínských obrazů na základě vyvíjejících se dat, nebo přizpůsobení text-to-image modelů pro kreativní aplikace.
Negativně, získávací metody tohoto typu závisí na kvalitě a relevance externí databáze, což činí kurátorování dat důležitým faktorem pro dosažení vysoce kvalitních generací; a tento přístup zůstává daleko od obrazové syntézy ekvivalentu RAG-založených interakcí typických pro komerční LLM.
ReMoDiffuse
ReMoDiffuse je získávací-augmentovaný motion difuzní model navržen pro generaci 3D lidského pohybu. Na rozdíl od tradičních motion generativních modelů, které se spoléhají pouze na naučené reprezentace, ReMoDiffuse získá relevantní pohybové vzorky z velké pohybové datové sady a integruje je do denoising procesu, v schématu podobném RDM (viz výše).

Srovnání RAG-augmentovaného ReMoDiffuse (pravý nejvíce) s předchozími metodami. Zdroj: https://arxiv.org/pdf/2304.01116
Tento model umožňuje generovat pohybové sekvence, které jsou navrženy tak, aby byly více přirozené a rozmanité, a také sémanticky věrné textovým podnětům uživatele.
ReMoDiffuse používá inovativní hybridní získávací mechanismus, který vybírá pohybové sekvence na základě obou sémantických a kinematických podobností, s cílem zajistit, aby získané pohyby nebyly pouze tematicky relevantní, ale také fyzicky proveditelné při integraci do nové generace.
Model pak rafinuje tyto získané vzorky pomocí Semantics-Modulated Transformer, který selektivně zahrnuje znalosti z získaných pohybů, zatímco zachovává charakteristické kvality generované sekvence:

Schéma pro pipeline ReMoDiffuse.
Technika Condition Mixture projektu zlepšuje schopnost modelu zobecnit napříč různými podněty a podmínkami získávání, vyvažující získané pohybové vzorky s textovými podněty během generace, a upravující, jak velkou váhu každá zdroje dostane v každém kroku.
To může pomoci zabránit nereálným nebo opakujícím se výstupům, i pro vzácné podněty. Také řeší problém citlivosti na měřítko, který často vzniká v classifier-free guidance technikách běžně používaných v difuzních modelech.
RA-CM3
Stanfordův paper z roku 2023 Retrieval-Augmented Multimodal Language Modeling (RA-CM3) umožňuje systému přístup k reálným informacím v době inferenční:

Stanfordův Retrieval-Augmented Multimodal Language Modeling (RA-CM3) model používá internet-získané obrázky k augmentaci generativního procesu, ale zůstává prototypem bez veřejného přístupu. Zdroj: https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf
RA-CM3 integruje získané texty a obrázky do generativního pipeline, zlepšující jak text-to-image, tak image-to-text syntézu. Používá CLIP pro získávání a Transformer jako generátor, model se odvolává na příslušné multimodální dokumenty před kompozicí výstupu.
Benchmarky na MS-COCO ukazují významné zlepšení oproti DALL-E a podobným systémům, dosahující 12-bodového Fréchet Inception Distance (FID) snížení, s výrazně nižšími výpočetními náklady.
Však, jako u jiných získávacích-augmentovaných přístupů, RA-CM3 neinternalizuje bezproblémově své získané znalosti. Místo toho superponuje nová data proti své předtrénované síti, podobně jako LLM augmentující odpovědi s výsledky vyhledávání. Zatímco tato metoda může zlepšit faktickou přesnost, nenahrazuje potřebu trénovacích aktualizací v doménách, kde je hluboká syntéza vyžadována.
Navíc, praktická implementace tohoto systému nebyla dosud uvolněna, ani na API-založené platformě.
RealRAG
Nový výstup z Číny, který vedl k tomuto přehledu RAG-augmentovaných generativních obrazových systémů, se nazývá Retrieval-Augmented Realistic Image Generation (RealRAG).

Externí obrázky vtáhnuté do RealRAG (dolní prostřední). Zdroj: https://arxiv.o7rg/pdf/2502.00848
RealRAG získá skutečné obrázky relevantních objektů z databáze kurátorované z veřejně dostupných datových sad, jako je ImageNet, Stanford Cars, Stanford Dogs, a Oxford Flowers. Pak integruje získané obrázky do generativního procesu, řeší mezery ve znalostech modelu.
Klíčovým komponentem RealRAG je sebe-reflectivní kontrastivní učení, které trénuje model získávání, aby nalezl informativní referenční obrázky, spíše než pouze vizuálně podobné.
Autoři uvádějí:
‘Naše klíčová myšlenka je trénovat model získávání, který získá obrázky, které zůstávají mimo generativní prostor generátoru, ale blízko reprezentaci textových podnětů.
‘K tomuto účelu nejdříve generujeme obrázky z daných textových podnětů a pak používáme generované obrázky jako dotazy k získání nejrelevantnějších obrázků v reálné objektové databázi. Tyto nejrelevantnější obrázky se používají jako reflexivní negativa.’
Tento přístup zajišťuje, že získané obrázky přispívají chybějící znalosti do generativního procesu, spíše než posilují stávající předpojatosti modelu.

Vlevo, získaný referenční obrázek; střed, bez RAG; vpravo, s použitím získaného obrázku.
Však, závislost na kvalitě získávání a pokrytí databáze znamená, že jeho účinnost se může lišit v závislosti na dostupnosti vysoce kvalitních referencí. Pokud relevantní obrázek neexistuje v datové sadě, model může stále bojovat s neznámými koncepty.
RealRAG je velmi modulární architektura, nabízející kompatibilitu s několika dalšími generativními architekturami, včetně U-Net-based, DiT-based, a autoregresivních modelů.
Obecně, získávání a zpracování externích obrázků přidává výpočetní režii, a výkon systému závisí na tom, jak dobře mechanismus získávání zobecní napříč různými úkoly a datovými sadami.
Závěr
Tento přehled je reprezentativní, spíše než vyčerpávající, pro obraz-získávající multimodální generativní systémy. Některé systémy tohoto typu používají získávání pouze pro zlepšení porozumění vidění nebo kurátorování dat, mezi jinými různými motivy, spíše než pro generování obrázků. Příkladem je Internet Explorer.
Mnohé z ostatních RAG-integrovaných projektů v literatuře zůstávají nevydané. Prototypy, s pouze publikovaným výzkumem, zahrnují Re-Imagen, který – navzdory svému původu z Google – může získat přístup pouze k obrázkům z místní vlastní databáze.
Kromě toho, v listopadu 2024, Baidu ohlásil Image-Based Retrieval-Augmented Generation (iRAG), novou platformu, která používá získané obrázky ‘z databáze’. Ačkoli iRAG je údajně k dispozici na platformě Ernie, zdá se, že nejsou žádné další podrobnosti o tomto procesu získávání, který vypadá, že spoléhá na místní databázi (tj. místní pro službu a ne přímo přístupné uživateli).
Dále, paper z roku 2024 Jednotná text-to-image generace a získávání nabízí další RAG-založenou metodu pro použití externích obrázků k augmentaci výsledků v době generace – opět, z místní databáze, spíše než z ad hoc internetových zdrojů.
Nadšení kolem RAG-založené augmentace v generaci obrazů se pravděpodobně zaměří na systémy, které mohou začlenit internet-získané nebo uživatelsky nahrávané obrázky přímo do generativního procesu, a které umožňují uživatelům účastnit se výběru nebo zdrojů obrázků.
Však, toto je významná výzva z alespoň dvou důvodů; poprvé, protože účinnost takových systémů obvykle závisí na hluboce integrovaných vztazích vytvořených během náročné trénovací seance; a podruhé, protože obavy týkající se bezpečnosti, legality a autorských omezení, jak bylo zmíněno dříve, činí tuto funkci nepravděpodobnou pro API-řízenou webovou službu a pro komerční nasazení obecně.
* Zdroj: https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf První zveřejněno úterý, 4. února 2025












