Andersonの視点
RAG拡張画像生成の未来

Stable Diffusion、Flux、Hunyuanなどの生成拡散モデルは、固定データセットを使用した単一のリソース集約型トレーニングセッションで取得した知識に依存しています。このトレーニング後の概念、つまり「知識カットオフ」と呼ばれるものは、モデルから除外され、ファインチューニングやLow Rank Adaptation(LoRA)などの外部適応テクニックを介してのみ補足されます。
理想的には、画像またはビデオを出力する生成システムがオンラインソースにアクセスし、必要に応じて生成プロセスに取り込めることができると便利です。たとえば、最新のAppleまたはTeslaリリースについて知らない拡散モデルでも、これらの新しい製品を含む画像を生成できるようになります。
言語モデルについては、Perplexity、Notebook LM、ChatGPT-4oなどのシステムは、Retrieval Augmented Generation(RAG)モデルを使用して、外部の新しい情報を生成プロセスに取り込むことができます。

RAGプロセスにより、ChatGPT 4oの応答がより関連性の高いものになります。 ソース:https://chatgpt.com/
しかし、これは画像生成の場合にあまり見られない機能であり、ChatGPTはこの点での自身の限界を認めています。

ChatGPT 4oは、新しいウォッチのリリースについて、一般的なラインや解釈した説明に基づいて推測していますが、DALL-Eベースの生成に新しい画像を取り込むことはできません。
外部のデータを生成された画像に取り込むことは、画像をトークンや埋め込みに分解し、それをモデルが学習したドメイン知識にマッピングする必要があるため、課題です。
このプロセスは、ControlNetなどのポストトレーニングツールでは効果的に機能しますが、画像をレンダリングパイプラインに通すだけで、モデル内部の表現に深く統合することはできません。
したがって、モデルは、NeRFなどのニューラルレンダリングシステムのように、新しい視点を生成する能力が欠けています。
成熟したロジック
大規模言語モデル(LLM)におけるRAGベースのクエリにも同様の制限があります。外部のデータを取得して処理する際、モデルは、既存の内部化された知識に新しいデータを無理に当てはめるのではなく、既存の知識に新しいデータを照らし合わせて分析し、推論します。
これは、生成された画像よりも言語ベースの生成でより明らかです。ネイティブな生成(RAGベースではない)における、ネットワーク接続の深さと創造性の向上は、さまざまな研究で実証されています。
RAG画像生成の潜在的なリスク
RAGスタイルでインターネットの画像をシームレスに統合することが技術的に可能であっても、安全性に関する制限がさらに課題となります。
生成モデルをトレーニングするために使用される多くのデータセットは、明示的、人種差別的、または暴力的コンテンツを最小限に抑えるようにキュレーションされています。しかし、このプロセスは完璧ではなく、残留する関連付けが残る可能性があります。DALL·EやAdobe Fireflyなどのシステムは、入力プロンプトと生成された出力の両方を禁止コンテンツに対する二次的なフィルタリングメカニズムでフィルタリングしています。
したがって、NSFWフィルタのみでは、RAGベースのデータの受け入れ性を評価するのに十分ではありません。コンテンツは、モデルが適切に評価できない方法で、モデルが定義したモデレーションパラメータの外側にある場合でも、有害または不快な可能性があります。
CCPが開発したDeepSeekの脆弱性の発見は、代替の入力パスがモデル内の倫理的保護を回避するために利用される可能性があることを強調しています。つまり、インターネットから取得した任意の新しいデータも、画像生成に統合することを意図している場合でも同様です。
RAG画像生成
これらの課題と政治的な側面にもかかわらず、RAGベースの方法を使用して新しいデータを視覚的な生成に取り込むことを試みるプロジェクトがいくつかあります。
ReDi
2023年のRetrieval-based Diffusion(ReDi)プロジェクトは、事前計算された知識ベースから類似のトラジェクトリを取得することで、拡散モデル推論を高速化する、学習不要のフレームワークです。

ReDiでは、データセットの値を新しい生成のために「借用」できます。 ソース:https://arxiv.org/pdf/2302.02285
拡散モデルでは、トラジェクトリは、モデルがノイズから画像を生成するためのステップごとのパスです。通常、このプロセスは多くのステップを経て逐渐的に行われ、各ステップで画像を少しずつ精密化します。
ReDiは、これらのステップの多くをスキップすることでこのプロセスを高速化します。各ステップを計算するのではなく、データベースから類似の過去のトラジェクトリを取得し、プロセスの後半にジャンプします。これにより、計算の必要な数が減り、拡散ベースの画像生成が高速化します。
ReDiは、拡散モデルの重みを変更せずに、知識ベースを使用して中間ステップをスキップするため、関数推定の必要な数を削減します。
これは、特定の画像を自由に生成リクエストに取り込むことと同じではありませんが、同様の生成に関係しています。
2022年にリリースされたReDiは、潜在的にRAGメソッドに基づく拡散ベースアプローチの最初のもののようです。
2021年にFacebook ResearchがリリースしたInstance-Conditioned GANは、GAN画像を新しい画像入力に基づいて条件付けることを目指しましたが、このような潜在的な空間への投影は、GANと拡散モデル両方で非常に一般的です。課題は、このプロセスを学習不要でリアルタイムで機能させることです。
RDM
RAG拡張画像生成へのもう1つの初期的な挑戦は、Retrieval-Augmented Diffusion Models(RDM)です。これは、画像合成のための半パラメトリックアプローチを導入します。従来の拡散モデルは、すべての学習済み視覚的知識をニューラルネットワークパラメータ内に格納しますが、RDMは外部画像データベースに依存します。

RDMのイラスト的な疑似クエリの最も近い隣接点。
トレーニング中、モデルは外部データベースから視覚的または意味的に類似した画像(最も近い隣接点)を取得し、生成プロセスを導きます。これにより、モデルは実世界の視覚的インスタンスに基づいて出力を条件付けることができます。
取得プロセスは、CLIP埋め込みによって推進され、取得された画像がクエリと意味的に類似していることを保証し、新しい情報を提供して生成を改善します。
このアプローチにより、パラメータへの依存が減り、広範なトレーニングデータセットが不要になり、競合する結果を達成する小さなモデルが可能になります。
RDMアプローチは、後処理の変更をサポートします。研究者は、推論時にデータベースを交換できます。つまり、新しいスタイル、ドメイン、またはスタイル化やクラス条件付き合成などのタスクへのゼロショット適応が可能になります。

下の行では、拡散プロセスに取り込まれた最も近い隣接点を示しています。
RDMの主な利点は、モデルを再トレーニングせずに画像生成を改善できることです。取得データベースを変更するだけで、モデルはトレーニング時に明示的に学習していない新しい概念に一般化できます。これは、ドメインシフトが発生するアプリケーション、たとえば進化するデータセットに基づく医療画像の生成や、テキストから画像の生成モデルをクリエイティブなアプリケーション用に適応させる場合に特に役立ちます。
しかし、外部データベースの品質と関連性に依存するため、取得ベースのこのような方法は、データのキュレーションが重要な要素となり、高品質の生成を達成する上で重要な要素となります。
ReMoDiffuse
ReMoDiffuseは、3D人間の動きの生成を目的とした、取得を拡張した動き拡散モデルです。従来の動き生成モデルと異なり、ReMoDiffuseは、レンダリングパイプラインではなく、取得した動きサンプルを生成プロセスに統合します。

ReMoDiffuseと従来の方法の比較。 ソース:https://arxiv.org/pdf/2304.01116
このアプローチにより、モデルは、ユーザーのテキストプロンプトに忠実で、自然で多様な動きシーケンスを生成できます。
ReMoDiffuseは、意味的および運動的な類似性に基づいて動きシーケンスを選択する、革新的な取得メカニズムを使用します。
モデルは、取得したサンプルをセマンティクス・モデュレート・トランスフォーマーを使用して精密化し、生成シーケンスの特徴を維持しながら、取得した動きから知識を選択的に統合します。

ReMoDiffuseのパイプラインのスキーマ。
このアプローチにより、モデルは、生成と取得の両方の条件を考慮して、バランスをとった生成を実現できます。
これにより、非現実的または繰り返しのある出力が防止され、稀なプロンプトに対する生成の質が向上します。
RA-CM3
Stanfordの2023年の論文「Retrieval-Augmented Multimodal Language Modeling」(RA-CM3)は、実世界の情報にアクセスできるシステムを実現します。

StanfordのRetrieval-Augmented Multimodal Language Modeling(RA-CM3)モデルは、生成プロセスを拡張するためにインターネットから画像を取得しますが、まだ公開されていません。 ソース:https://cs.stanford.edu/~myasu/files/RACM3_slides.pdf
RA-CM3は、CLIPを使用して画像を取得し、Transformerを使用して生成します。モデルは、テキストプロンプトの前に、関連する多モーダルドキュメントを参照します。
MS-COCOのベンチマークでは、DALL-Eや同様のシステムよりも、12ポイントのFréchet Inception Distance(FID)削減を達成し、計算コストも大幅に低減しています。
しかし、RA-CM3は、取得した知識をシームレスに内部化しません。代わりに、モデルは新しいデータを既存のネットワークに重ね合わせます。つまり、事実の正確性は向上しますが、深い合成が必要なドメインでは、トレーニングの更新は必要です。
また、実用的な実装は、APIベースのプラットフォームにも公開されていません。
RealRAG
中国からの新しいリリースは、Retrieval-Augmented Realistic Image Generation(RealRAG)と呼ばれています。

RealRAGでは、外部の画像を生成プロセスに取り込むことができます。 ソース:https://arxiv.o7rg/pdf/2502.00848
RealRAGは、ImageNet、Stanford Cars、Stanford Dogs、Oxford Flowersなどのパブリックデータセットからキュレーションされたデータベースから、関連するオブジェクトの実際の画像を取得し、生成プロセスに統合します。
RealRAGの重要なコンポーネントは、自律的対比学習です。取得モデルは、単に視覚的に類似した画像ではなく、生成プロセスに「欠落している」知識を提供する画像を取得するようにトレーニングされます。
著者は次のように述べています:
「私たちの主な洞察は、生成空間から外れた画像を取得するリトリーバーをトレーニングすることです。テキストプロンプトの表現に近い画像を取得することです。」
「この目的のために、テキストプロンプトから画像を生成し、生成された画像をクエリとして使用して、実物オブジェクトベースのデータベース内の最も関連する画像を取得します。これらの最も関連する画像は、反射的な負の例として使用されます。」
このアプローチにより、取得された画像は、モデル内の既存の偏見を強化するのではなく、生成プロセスに「欠落している」知識を提供します。

左側が取得された参考画像、中央がRAGなし、右側が取得された画像を使用したもの。
しかし、取得の品質とデータベースのカバレッジに依存するため、取得された画像が利用可能でない場合、モデルはまだ未知の概念に苦労する可能性があります。
RealRAGは、U-Netベース、DiTベース、自己回帰モデルのような、さまざまな生成アーキテクチャと互換性があります。
一般に、外部画像の取得と処理には、計算オーバーヘッドが追加され、システムのパフォーマンスは、取得メカニズムがタスクやデータセットにわたってどれだけ一般化できるかによって決まります。
結論
これは、画像取得マルチモーダル生成システムの代表的な概要であり、網羅的なものではありません。画像を生成するのではなく、ビジョン理解やデータセットのキュレーションを改善するためにのみ取得を使用するシステムもあります。Internet Explorerはそのようなシステムの1つです。
文献にある他のRAG統合プロジェクトの多くは、まだ公開されていません。Googleから発祥したRe-Imagenは、ローカルカスタムデータベースからの画像のみにアクセスできます。
また、2024年11月に、Baiduは、データベースからの画像を取得して生成プロセスを拡張する、Image-Based Retrieval-Augmented Generation(iRAG)と呼ばれる新しいプラットフォームを発表しました。しかし、iRAGはErnieプラットフォームで利用可能であると報告されていますが、サービスにローカルな(ユーザーに直接アクセスできない)データベースに依存するように見えます。
さらに、2024年の論文「Unified Text-to-Image Generation and Retrieval」では、ローカルデータベースから外部画像を使用して生成結果を拡張する、RAGベースの別の方法が提示されています。
RAGベースの画像生成の拡張に対する関心は、インターネットソースまたはユーザーがアップロードした画像を直接生成プロセスに取り込むことができるシステムに焦点を当てているでしょう。また、ユーザーが画像の選択やソースに参加できるシステムにも焦点が当てられます。
しかし、これは、システムの有効性が通常、リソース集約型トレーニングプロセス中に形成された深く統合された関係に依存しているという理由と、安全性、法的、著作権の制限に関する懸念により、API駆動のWebサービスや商業的な展開にとって、実現しそうにない機能であるという2つの理由から、重大な課題です。
* ソース:https://proceedings.neurips.cc/paper_files/paper/2022/file/62868cc2fc1eb5cdf321d05b4b88510c-Paper-Conference.pdf
最初に公開:2025年2月4日












