Andersonの視点
AI画像編集の精度を高める

AdobeのFirefly潜在拡散モデル(LDM)は、現在利用可能なものの中で最も優れたものの一つであると考えられているが、Photoshopユーザーがその生成機能を試した場合、既存の画像を簡単に編集できないことがわかるだろう。代わりに、ユーザーの選択した領域を、ユーザーのテキストプロンプトに基づいた画像で完全に置き換える(ただし、Fireflyは生成されたセクションを画像のコンテキストに統合するのがうまい)。
現在のベータ版では、Photoshopは、参照画像を部分的な画像プロンプトとして組み込むことができるため、Stable Diffusionユーザーが2年以上享受してきたような機能をAdobeのフラグシップ製品にもたらす。第三者フレームワークであるControlnetを使用して実現される。

現在のAdobe Photoshopベータ版では、選択範囲内で新しいコンテンツを生成する際に参照画像を使用できる。ただし、現在は成功するかどうかは不確実である。
これは、画像合成研究における未解決問題を示している。拡散モデルが、完全な「再想像」を実装せずに既存の画像を編集するのに苦労することである。

拡散ベースのインペイントは、ユーザーのプロンプトに従うが、元の画像を考慮せずにソースの主題を完全に再構築する(環境とブレンドすることを除く)。ソース:https://arxiv.org/pdf/2502.20376
この問題は、LDMが画像を生成する際に、ユーザーが提供したテキストプロンプトに基づいて、逐次的なノイズ除去を行うため発生する。テキストプロンプトの内容が埋め込みトークンに変換され、Stable DiffusionやFluxなどのハイパースケールモデルには、プロンプトに関連する数百万の近似埋め込みが含まれているため、プロセスには計算された条件付き分布が存在する。
したがって、テキストから画像というシナリオでは、ユーザーは「最善を尽くす」しかできない。生成される画像がどうなるかは、誰にもわからないからである。
代わりに、多くの人が、LDMの強力な生成能力を利用して既存の画像を編集しようとしている。しかし、これには、忠実性と柔軟性のバランスを取ることが必要である。
画像がDDIM逆変換などの方法でモデルの潜在空間に投影されると、元の画像を可能な限り近く再現することが目標となる。しかし、画像をより正確に再構築するほど、モデルは元の構造に従うようになり、重大な変更が困難になる。

最近提案された他の多くの拡散ベースの画像編集フレームワークと同様に、Renoiseアーキテクチャは、ネコの首の付け根にボウタイの簡単な表示のみが現れるため、画像の外見を実際に変更するのに苦労している。
一方で、プロセスが編集性を優先すると、モデルは元の画像から距離を置き、変更を加えることが容易になるが、全体的な一貫性を犠牲にすることになる。

ミッションは達成されたが、ほとんどのAIベースの画像編集フレームワークにとって、これは調整ではなく変換である。
これは、Adobeの豊富なリソースでも解決に苦労している問題であるため、課題は著名であり、簡単な解決策がない可能性がある。
タイトインバージョン
したがって、この週に公開された新しい論文の例は、私の注意を引いた。なぜなら、この研究は、この分野の現在の最先端技術を、潜在空間内の画像に繊細で洗練された編集を適用できるようにすることで、改善をもたらしているからである。

既存の逆変換方法にタイトインバージョンを適用すると、ソースの選択はより細かく考慮され、変換は元の素材に従うのではなく上書きするのではなく、変換される。
LDMの趣味家や実践者は、このような結果を認識するかもしれない。なぜなら、多くは、ControlnetやIP-Adapterなどの外部システムを使用して、複雑なワークフローでこれらの結果を生成できるからである。
実際、新しい方法であるタイトインバージョンは、IP-Adapterと、人間の描写用の専用モデルを使用している。

2013年のIP-Adapter論文からの、ソース素材に適切な編集を加える例。ソース:https://arxiv.org/pdf/2308.06721
タイトインバージョンの重要な成果は、複雑な技術を、既存のシステムに適用できる単一のドロップインプラグインモダリティに統合したことである。
当然ながら、これは、タイトインバージョン(TI)が、他の補助システムと同様に、画像自体を条件付けとして使用することを意味する。テキストプロンプトのみに頼るのではなく、編集されたバージョンを条件付ける。

タイトインバージョンの、ソース素材に真正にブレンドされた編集を適用する能力のさらなる例。
著者らは、自分のアプローチが、伝統的な拡散ベースの画像編集技術における忠実性と編集性の間の緊張から自由ではないことを認めている。しかし、彼らは、既存のシステムにTIを注入することで、ベースライン性能と比較して最先端の結果を報告している。
新しい研究は、タイトインバージョン:画像条件付き逆変換による実画像編集と題されており、Tel Aviv UniversityとSnap Researchの5人の研究者によって行われた。
方法
最初に、大規模言語モデル(LLM)を使用して、画像を生成するために使用されるテキストプロンプトのセットを生成する。次に、3つのテキスト条件付きで、DDIM逆変換が各画像に適用される。条件は、画像を生成するために使用されたテキストプロンプト、プロンプトの短縮版、そして空のプロンプトである。
これらのプロセスから返された逆変換ノイズを使用して、画像は再び同じ条件で、クラスフィアフリー ガイダンス(CFG)なしで再生成される。

さまざまなメトリクスに対するDDIM逆変換のスコア。プロンプト設定が異なる。
上のグラフからわかるように、テキストの長さが増加すると、メトリクス全体のスコアが向上する。使用されたメトリクスは、ピーク信号対雑音比(PSNR)、L2距離、構造類似性指数(SSIM)、および学習済み感覚画像パッチ類似度(LPIPS)である。
画像に留意した
実質的に、タイトインバージョンは、画像自体を条件付けとして使用することで、ホスト拡散モデルが実画像を編集する方法を変更する。
通常、拡散モデルのノイズ空間への画像の逆変換には、再構築時に画像を再現するための開始ノイズの推定が必要である。標準的な方法では、テキストプロンプトをこのプロセスを導くために使用する。しかし、不完全なプロンプトはエラーを招き、詳細を失ったり構造を変更したりする可能性がある。
タイトインバージョンは代わりに、IPアダプターを使用して、視覚情報をモデルに供給し、画像をより高い精度で再構築する。ソース画像を条件付けトークンに変換し、逆変換パイプラインに投影する。
これらのパラメータは編集可能である。ソース画像の影響を増やすと、再構築はほぼ完璧になり、影響を減らすと、より創造的な変更が可能になる。これにより、タイトインバージョンは、シャツの色を変更するような繊細な変更や、オブジェクトを交換するようなより重要な編集の両方に役立つ。
著者らは次のように述べている。
‘タイトインバージョンは、以前の逆変換方法(例:編集可能なDDPM、ReNoise)と統合することで、再構築と編集可能性の両方でこれらの方法を一貫して改善する。’
データとテスト
研究者らは、TIの、実世界のソース画像の再構築と編集能力を評価した。すべての実験では、Stable Diffusion XLとDDIMスケジューラを使用し、元のStable Diffusion論文に従った。すべてのテストでは、デフォルトのガイダンススケール7.5で50ステップの除噪を使用した。
画像条件付けのために、IP-Adapter-plus sdxl vit-hを使用した。few-stepテストのために、研究者らはSDXL-TurboをEulerスケジューラで使用し、FLUX.1-devの実験も行った。後者の場合、モデルをPuLID-Fluxで条件付けた。さらに、RF-Inversionを28ステップで使用した。
PulIDは、人間の顔を特集する場合のみ使用された。これは、PulIDがこの特定のタスクにトレーニングされたためである。人間の顔を生成することに我々が過度に興味を持っていることは注目に値する。基礎モデルのより広範な重みのみに頼ることは、この特定のタスクの我々の要求水準に適していない可能性がある。
再構築テストは、定性的および定量的な評価のために実行された。在りし日の画像の定性的例は以下に示す。

DDIM逆変換の定性的結果。各行には、詳細な画像とその再構築バージョンが表示され、各ステップでは、逆変換と除噪の際に条件がより正確になる。条件がより正確になるにつれて、再構築の品質が向上する。右端の列は、元の画像自体を条件として使用した場合の最もよい結果を示し、最高の忠実度を達成する。CFGは使用されなかった。より高解像度と詳細については、ソースドキュメントを参照してください。
論文では次のように述べられている。
‘これらの例は、画像条件付けによって再構築が大幅に改善されることを強調している。特に詳細な領域で。’
‘特に、[画像の]3番目の例では、私たちの方法は、右のボクサーの背中のタトゥーを成功的に再構築し、ボクサーのレッグポーズもより正確に保存され、レッグのタトゥーも見えるようになる。’

DDIM逆変換のさらなる定性的結果。記述的な条件はDDIM逆変換を改善し、特に複雑な画像では、画像条件付けがテキストを上回る。
著者らはまた、TIを既存のシステムのドロップインモジュールとしてテストし、変更されたバージョンをベースライン性能と比較した。
テストされたシステムは、DDIM逆変換とRF-Inversion、およびReNoiseであった。ReNoiseは、論文の著者の一部と共著である。DDIM結果は100%の再構築に苦労しないため、研究者らは編集可能性のみに焦点を当てた。
画像の編集能力をテストするために、システムはprompt2prompt、編集可能なDDPM、LED-ITS++、およびRF-Inversionと比較された。
選択された質的結果は以下に示す。

SDXLとFluxのための、広範な質的結果の選択。これらの結果は論文の中でかなり圧縮されており、より高解像度と明確な内容については、ソースのPDFを参照してください。
著者らは、タイトインバージョンが、再構築と編集可能性のバランスをとることで、既存の逆変換技術を一貫して上回ることを主張している。DDIM逆変換やReNoiseなどの標準的な方法は画像をうまく再構築できるが、編集が適用されると、細かい詳細を保存するのに苦労することが多いと論文では述べられている。
対照的に、タイトインバージョンは画像条件付けを利用して、モデルの出力を元の画像により密接に結び付け、望ましくない歪みを防ぐ。著者らは、競合するアプローチが再構築を「正確に」生み出すことが多いが、編集の導入はしばしばアーティファクトや構造的一貫性の問題につながることを示唆し、タイトインバージョンはこれらの問題を緩和する。
最後に、タイトインバージョンは、MagicBrushベンチマークを使用して、DDIM逆変換とLEDITS++と比較して、定量的に評価された。CLIP Simを使用して測定した。

MagicBrushベンチマークに対するタイトインバージョンの定量的な比較。
著者らは結論として次のように述べている。
‘グラフでは、画像保存と編集への従属のトレードオフが明確に観察される。タイトインバージョンはこのトレードオフに対するより良い制御を提供し、入力画像をよりよく保存しながら編集に従う。’
‘注目すべきは、画像とテキストプロンプトの間のCLIP類似度が0.3を超えることは、画像とプロンプトの妥当な一致を示す。’
結論
タイトインバージョンは、LDMベースの画像合成の最も厄介な課題のひとつに対する「ブレークスルー」ではないが、煩わしい補助アプローチを統一されたAI画像編集方法に統合する。
編集可能性と忠実性の間の緊張は、タイトインバージョンによって完全に解消されていない。しかし、結果からわかるように、この緊張は著しく軽減されている。タイトインバージョンが解決しようとしている中央の課題が、最終的には自らの用語で扱う場合に解決不可能である可能性があることを考えると(将来のシステムではLDMベースのアーキテクチャを見越して)、タイトインバージョンは最先端技術の歓迎すべき漸進的な改善を表している。
2025年2月28日金曜日に初めて公開された












