Andersonの視点
人間の画像をAIで復元・編集する

カリフォルニア大学マーセドとアドビの新しい共同研究により、人間の画像の完了というタスク、つまり隠れた部分や欠損した部分を「除去」するための最先端の技術が進化しました。この技術は、仮想試着やアニメーション、写真編集などの目的で使用されます。

CompleteMeのような人間の画像完了システムは、ユーザーの好みに応じて画像を修復したり変更したりするだけでなく、参考画像を使用して新しい服を既存の画像に追加できます。こちらの例は、新しい論文の詳細な補足PDFからです。ソース: https://liagm.github.io/CompleteMe/pdf/supp.pdf
新しいアプローチ、CompleteMe: 参考画像ベースの人間画像完了は、補助入力画像を使用して、隠れたまたは欠損した人間の描写の部分をシステムが「推測」できるようにします。

CompleteMeシステムは、参考コンテンツを人間の画像の隠れた部分または欠損した部分に適応させることができます。
新しいシステムは、双子のU-Netアーキテクチャと、領域に焦点を当てた注意(RFA)ブロックを使用しています。これは、画像の復元の重要な部分にリソースを集中させます。
研究者は、参考画像ベースの完了タスクを評価するための新しいベンチマークシステムも提案しています。
テストでは、ユーザー研究でも、新しい方法がほとんどのメトリックで優れており、全体的に優れています。特定のケースでは、対抗する方法は参考画像ベースのアプローチに完全に敗北しました。

補足資料から: AnyDoor方法は、参考画像を解釈することに特に苦労しています。
論文では次のように述べられています。
‘私たちのベンチマークでは、CompleteMeが、参考画像ベースと非参考画像ベースの両方の最先端の方法を上回り、量的メトリック、質的結果、ユーザー研究のすべてで優れています。 ‘
‘特に、複雑なポーズ、繊細な服のパターン、独特のアクセサリーを含む難しいシナリオでは、私のモデルは一貫して優れた視覚的忠実度と意味的整合性を達成しています。 ‘
残念ながら、このプロジェクトのGitHubにはコードが含まれておらず、コードも提供されていません。このイニシアチブは、プロジェクトページもありますが、独自のアーキテクチャとして位置付けられています。

新しいシステムの主観的なパフォーマンスのさらに多くの例。記事の後半に詳細を説明します。
方法
CompleteMeフレームワークは、補助入力画像をプロセスに統合するためのReference U-Netと、より広範なプロセスを取得するための包括的なU-Netによって裏付けられています。

CompleteMeの概念スキーマ。ソース: https://arxiv.org/pdf/2504.20042
システムは、まずマスク付き入力画像を潜在的な表現にエンコードします。同時に、Reference U-Netは、異なる身体の領域を示す複数の参考画像を処理して、詳細な空間的特徴を抽出します。
これらの特徴は、包括的なU-Net内のRegion-focused Attentionブロックを介して、対応する領域マスクを使用して選択的にマスクされ、モデルが参考画像の関連する領域のみに注目するようにします。
マスクされた特徴は、CLIPによって抽出されたグローバルな意味的特徴と、切り離されたクロスアテンションを介して統合され、モデルが両方の微細な詳細と意味的整合性を持って欠損コンテンツを再構築できるようにします。
入力マスクプロセスは、ランダムなグリッドベースのオクルージョンと人間の身体の形状マスクの両方を組み合わせて、モデルが完了する必要のある欠損領域の複雑さを増加させます。
参考のみ
参考画像ベースの画像インペインティングの以前の方法は、一般的に、セマンティックレベルのエンコーダーに依存していました。CLIPやDINOv2などのプロジェクトは、参考画像からグローバルな特徴を抽出しますが、正確なアイデンティティの保存に必要な微細な空間的詳細を失うことがあります。

より古いDINOV2アプローチのリリースペーパーから: カラーフルなオーバーレイは、各列内の画像パッチに適用された主成分分析(PCA)の最初の3つの主成分を示しています。様々なポーズ、スタイル、またはレンダリングの違いにもかかわらず、対応する領域(たとえば、翼、四肢、または車輪)は一貫して一致しており、モデルの教師なしでパーツベースの構造を学習する能力を示しています。ソース: https://arxiv.org/pdf/2304.07193
CompleteMeは、Stable Diffusion 1.5から初期化された専用のReference U-Netを使用して、この問題に対処しますが、拡散ノイズステップはありません。
各参考画像は、異なる身体の領域をカバーし、詳細な潜在的な特徴をこのU-Netを介してエンコードされます。グローバルな意味的特徴はCLIPを介して別個に抽出され、両方の特徴セットは効率的な使用のためにキャッシュされます。したがって、システムは柔軟に複数の参考入力を処理しながら、微細な外観情報を保持することができます。
オーケストレーション
包括的なU-Netは、完了プロセスの最終段階を管理します。Stable Diffusion 1.5のインペインティングバリアントから適応され、潜在的な形式のマスク付きソース画像と、参考画像から抽出された詳細な空間的特徴、CLIPエンコーダーによって抽出されたグローバルな意味的特徴を受け取ります。
これらのさまざまな入力は、参考資料の最も関連する領域に向けてモデルの焦点を向ける上で重要な役割を果たすRFAブロックを介して統合されます。
注意メカニズムに入る前に、参考特徴は無関係な領域を除去するために明示的にマスクされ、潜在的なソース画像の表現と結合され、注意ができるだけ正確に導かれます。
この統合を強化するために、CompleteMeは、IP-Adapterフレームワークから適応された、切り離されたクロスアテンションメカニズムを組み込みます:

IP-Adapterは、CompleteMeに組み込まれている、過去3年の潜在的拡散モデルアーキテクチャの開発の最も成功したプロジェクトの1つです。ソース: https://ip-adapter.github.io/
これにより、モデルは空間的に詳細な視覚的特徴とより広い意味的コンテキストを個別の注意ストリームを介して処理し、後に結合して、一貫した再構築が行われ、作者によれば、アイデンティティと微細な詳細の両方が保存されます。
ベンチマーキング
参考画像ベースの人間の完了のための適切なデータセットがないため、研究者は独自のベンチマークを提案しました。このベンチマークは、Adobe Researchの2023年のUniHumanプロジェクトのために作成されたWPoseデータセットから選択された画像ペアのカーソルを介して構築されました。

Adobe Research 2023 UniHumanプロジェクトのポーズの例。ソース: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep
研究者は、インペインティング領域を示すためにソースマスクを手動で描き、最終的に417の三部画像グループを取得しました。これは、ソース画像、マスク、参考画像で構成されます。

参考WPoseデータセットから初期的に派生し、研究者によって大幅にキュレーションされたグループの2つの例。
著者は、LLaVA大規模言語モデル(LLM)を使用して、ソース画像を説明するテキストプロンプトを生成しました。
使用されたメトリックは通常よりも広範でした。通常のピーク信号ノイズレシオ(PSNR)、構造類似性指数(SSIM)、学習された知覚画像パッチ類似性(LPIPS、ここではマスクされた領域の評価に使用)のほか、DINOを使用して類似性スコアを取得し、DreamSimを生成結果の評価に使用し、CLIPを使用しました。
データとテスト
この研究をテストするために、著者は、デフォルトのStable Diffusion V1.5モデルと1.5インペインティングモデルを使用しました。システムの画像エンコーダーは、CLIPのVisionモデルと、CLIPの出力をモデルが使用する内部特徴次元に合わせるための投影レイヤーを使用しました。
トレーニングは、8つのNVIDIA A100†GPUで30,000イテレーションにわたって行われ、平均二乗誤差(MSE)損失に従って行われ、バッチサイズは64、学習率は2×10-5でした。トレーニング中には、システムがデータに過剰適合しないように、さまざまな要素がランダムにドロップされました。
データセットは、Parts to Wholeデータセットから変更されました。これは、DeepFashion-MultiModalデータセットに基づいています。

CompleteMeのキュレーションデータの開発に使用されたParts to Wholeデータセットの例。ソース: https://huanngzh.github.io/Parts2Whole/
著者は次のように述べています。
‘私たちの要件を満たすために、私たちは、複数の参考画像とそれらの短いテキストラベルとともに、オクルージョン画像を使用してトレーニングペアを再構築しました。 ‘
‘私たちのトレーニングデータの各サンプルには、6つの外観タイプが含まれます: 上半身の服、下半身の服、全身の服、髪またはヘッドウェア、顔、靴。マスク戦略については、50%のランダムグリッドマスクを1〜30回適用し、残りの50%については、人間の身体の形状マスクを使用してマスクの複雑さを増加させます。 ‘
‘パイプラインの構築後、40,000の画像ペアをトレーニングに使用しました。 ‘
対抗する以前の非参考方法としてテストされたのは、大きなオクルージョン人間画像の完了(LOHC)と、BrushNetというプラグアンドプレイ画像インペインティングモデルでした。テストされた参考画像ベースのモデルは、Paint-by-Example、AnyDoor、LeftRefill、MimicBrushでした。
著者は、先に述べたメトリックに基づいて量的比較から始めました:

初期量的比較の結果。
量的評価について、著者は、CompleteMeが、CLIP-I、DINO、DreamSim、LPIPSを含むほとんどの知覚メトリックで最高スコアを達成し、出力と参考画像の間の意味的整合性と外観の忠実度を捉えることができたと述べています。
ただし、モデルはすべてのベースラインで一貫して優れています。特に、BrushNetはCLIP-Tで最高スコアを達成し、LeftRefillはSSIMとPSNRで優れており、MimicBrushはCLIP-Iでわずかに上回っています。
CompleteMeは全体的に一貫して強力な結果を示していますが、パフォーマンスの違いは場合によってはわずかであり、特定のメトリックは依然として対抗する以前の方法によってリードされています。著者は、これらの結果をCompleteMeの構造的および知覚的両方の次元におけるバランスの取れた強さの証拠として提示しています。
研究で実施された質的テストのイラストは、ここに再現するには数が多すぎます。読者に、元の論文だけでなく、追加の質的例が含まれている詳細な補足PDFも参照するようお勧めします。
私たちは、この記事で最初に紹介した主要な質的例を強調し、記事の序盤に紹介した追加のケースの選択を強調します:

主要論文に提示された初期の質的結果。ソースペーパーを参照してください。より高解像度の画像をご覧ください。
上記の質的結果について、著者は次のように述べています。
‘マスク付き入力が与えられた場合、これらの非参考方法は、画像先行またはテキストプロンプトを使用してマスクされた領域に妥当なコンテンツを生成します。 ‘
‘しかし、赤いボックスで示されているように、タトゥーやユニークな服のパターンのような特定の詳細を再現することはできません。なぜなら、特定の情報の再構築を誘導する参考画像がないからです。 ‘
以下に示すように、2番目の比較では、Paint-by-Example、AnyDoor、LeftRefill、MimicBrushの4つの参考画像ベースの方法が使用され、1つの参考画像とテキストプロンプトが提供されました。

参考画像ベースの方法との質的比較。CompleteMeは、より現実的な完了と、参考画像からのより優れた詳細の保存を生成します。赤いボックスは、特に興味深い領域を強調しています。
著者は次のように述べています。
‘マスク付き人間画像と参考画像が与えられた場合、他の方法は妥当なコンテンツを生成できますが、参考画像からコンテキスト情報を正確に保存することはできません。 ‘
‘場合によっては、無関係なコンテンツを生成したり、参考画像から対応する部分を正しくマッピングできなかったりします。対照的に、CompleteMeは、特定の情報を正確に保存し、参考画像から人間の身体の対応する部分を正しくマッピングすることで、マスクされた領域を完了させます。 ‘
人間の認識との一致を評価するために、著者は15人のアノテーターと2,895のサンプルペアを含むユーザー研究を実施しました。各ペアは、CompleteMeの出力と、Paint-by-Example、AnyDoor、LeftRefill、またはMimicBrushの4つの参考画像ベースのベースラインの1つを比較しました。
アノテーターは、完了された領域の視覚的な品質と、アイデンティティ特徴を参考画像から保存する程度に基づいて各結果を評価しました。

ユーザー研究の結果。
結論
もしあるならば、この研究の質的結果は、量が多すぎて、システムが比較においてオクルージョン領域に参考資料をどの程度適応できるかを評価するには、元のPDFを注意深く調べ、ズームインする必要があります。
しかし、オリジナルのPDFを注意深く調べると、システムがオクルージョン領域に参考資料を適応させる方法は、ほとんどの場合、以前の方法よりも優れています。

読者に、補足資料に提示された結果の多さに惑わされずに、補足資料を注意深く調べることを強くお勧めします。
* 注目すべきは、現在ほとんど古くなっているV1.5リリースが、研究者の間で依然として人気があることです。これは、レガシーの同等のテストのためであり、また、すべてのStable Diffusionイテレーションの中で最も検閲が少なく、最も簡単にトレーニングできる可能性があり、FOSS Fluxリリースの検閲による障害を共有していないためです。† VRAMの仕様は示されていません。各カードあたり40GBまたは80GBのいずれかになります。
2025年4月29日(火曜日)に初めて公開されました。












