Andersonの視点

拡散モデルの限られた鏡と反射の理解を修正する

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o and Adobe Firefly

生成AIが一般の関心を集めるようになって以来、コンピュータービジョン研究では、物理法則を理解し再現できるAIモデルへの関心が深まっている。重力や流体力学などの現象を機械学習システムにシミュレートさせる課題は、少なくとも過去5年間にわたる重要な研究テーマだ。

潜在拡散モデル(LDM)が2022年に生成AI分野を席巻してから、研究者はそのアーキテクチャーが物理現象を理解・再現する能力の限界に注目してきた。OpenAIの動画生成モデルSora、さらにオープンソースのHunyuan VideoやWan 2.1の登場によって、この問題はいっそう重要になっている。

うまく映らない反射

LDMの物理理解を改善する研究の多くは、歩行シミュレーション、粒子物理、ニュートン運動などに向けられてきた。基本的な物理挙動の誤りはAI動画の信憑性を直ちに損なうからだ。一方、規模は小さいものの増加している研究領域が、LDM最大の弱点の一つである正確な反射の生成に取り組んでいる。

From the 2025年1月 paper 'Reflecting Reality: Enabling Diffusion Models to Produce Faithful Mirror Reflections', examples of 'reflection failure' versus the researchers' own approach. Source: https://arxiv.org/pdf/2409.14677
2025年1月の論文『Reflecting Reality』に示された反射失敗と提案手法の比較。

反射はCGI時代にも難題であり、ゲーム分野でもなお課題である。レイトレーシングは光が表面に当たり、跳ね返り、あるいは物体を通過する経路を計算して、現実的な反射、屈折、影を作る。しかし反射回数が一つ増えるたび計算量が大幅に増えるため、リアルタイム用途では遅延と精度の間で妥協しなければならない。

A representation of a virtually-calculated light-beam in a traditional 3D-based (i.e., CGI) scenario, using technologies and principles first developed in the 1960s, and which came to fulmination between 1982-93 (the span between Tron [1982] and Jurassic Park [1993]. Source: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
従来型3D(CGI)環境で仮想的に計算される光線の概念図。

例えば鏡の前のクローム製ティーポットでは、光線が反射面の間を何度も往復し、最終画像への実益が乏しいほぼ無限のループになり得る。通常は2~3回の反射で人が知覚できる限界を超える。1回だけでは光が可視の反射を作るための往復を完了できず、鏡は黒くなる。反射回数を増やすとレンダリング時間が倍増することもあり、高速化はレイトレーシング品質向上の大きな機会である。

反射は鏡だけでなく、雨上がりの道路や戦場、店舗の窓、ガラス扉、人物の眼鏡など、写実性に欠かせない場所に広く現れる。

A simulated twin-reflection achieved via traditional compositing for an iconic scene in 'The Matrix' (1999).
映画『マトリックス』(1999年)の象徴的な場面で、従来の合成処理により作られた二重反射。

画像表現側の問題

拡散モデル以前に人気だったNeural Radiance Fields(NeRF)や、近年のGaussian Splattingにも自然な反射を表現する難しさがある。REF²-NeRFはガラスケースを含む場面について、視点依存成分と非依存成分を使って屈折と反射をモデル化し、ガラス面を推定して直接光と反射光を分離した。

Examples from the Ref2Nerf paper. Source: https://arxiv.org/pdf/2311.17116
Ref²-NeRF論文に掲載された例。

過去4~5年にはNeRFReN、Reflecting Reality、MetaのPlanar Reflection-Aware Neural Radiance FieldsなどがNeRF向けの解決策を提示した。Gaussian SplattingではMirror-3DGS、Reflective Gaussian Splatting、RefGaussianが反射問題を扱い、2023年のNeroは反射特性をニューラル表現へ組み込む独自手法を提案した。

MirrorVerse

拡散モデルに反射の論理を守らせることは、NeRFやGaussian Splattingのような明示的な構造表現より難しい。LDMで規則を確実に学習させるには、幅広い場面の多様な例が訓練データに必要であり、元データの分布と品質に強く依存する。

特定の挙動を追加する一般的な方法はLoRAか基盤モデルのファインチューニングだが、どちらも理想的ではない。LoRAはプロンプトがなくても訓練データの傾向へ出力を偏らせる可能性がある。ファインチューニングは高価で、主要モデルを本流から不可逆的に分岐させ、元モデルや別系統では使えない専用ツール群を生むことがある。

反射の物理を訓練データで強化する必要はあるものの、同様に特別な注意を要する領域はほかにも多い。超大規模データセットを個別に選別するコストを考えると、すべての弱点をこの方法で解くのは現実的ではない。

今回インドの研究者が発表したMirrorVerseは、反射生成の最先端を改善するデータセットと訓練法を提供する。

Right-most, the results from MirrorVerse pitted against two prior approaches (central two columns). Source: https://arxiv.org/pdf/2504.15397
MirrorVerseと先行する二つの手法の結果比較。

例を見ると先行手法より改善しているが、完全ではない。陶器の壺の位置が本来より右にずれ、反射が生じないはずのカップが不自然な角度で右側に映る例もある。この研究は現時点の進歩であると同時に、反射の学習例が特定の行動や状況と絡み合うため、静止画・動画双方のLDMにとって問題が根本的に難しいことも示す。構造に特化したNeRF、Gaussian Splatting、従来CGIに引き続き及ばない可能性がある。

論文名はMirrorVerse: Pushing Diffusion Models to Realistically Reflect the World。IISc BangaloreのVision and AI LabとSamsung R&D Institute Bangaloreに所属する3名の研究者によるもので、プロジェクトページ、Hugging Face上のデータセット、GitHub上のソースコードも公開されている。

手法

研究者はStable DiffusionやFluxが反射に関するプロンプトを守れないことをまず示した。

From the paper: Current state-of-the-art text-to-image models, SD3.5 and Flux, exhibited significant challenges in producing consistent and geometrically accurate reflections when prompted to generate reflections in the scene.
SD3.5とFluxが一貫した幾何学的に正しい反射を生成できない例。

開発されたMirrorFusion 2.0は、合成画像の鏡面反射について写実性と幾何学的精度を高める拡散生成モデルである。訓練には新たに整備したMirrorGen2を使い、従来手法の汎化性能の弱さに対処した。MirrorGen2は物体位置と回転のランダム化、明示的な接地を導入し、鏡に対する多様な姿勢と配置で自然な反射を保てるよう設計されている。

Schema for the generation of synthetic data in MirrorVerse: the dataset generation pipeline applied key augmentations by randomly positioning, rotating, and grounding objects within the scene using the 3D-Positioner. Objects are also paired in semantically consistent combinations to simulate complex spatial relationships and occlusions, allowing the dataset to capture more realistic interactions in multi-object scenes.
MirrorVerseの合成データ生成パイプライン。物体をランダムに配置・回転し、接地処理を施す。

複雑な空間配置への対応を高めるため、パイプラインには物体を組み合わせた場面も含める。椅子と机のように意味的に整合するカテゴリを手作業で組み合わせ、主物体を配置・回転した後、重ならないよう副物体を置く。明示的な接地は、大規模な自動合成で起こりがちな物体の「浮遊」も防ぐ。

データと試験

SynMirrorV2

SynMirrorV2は鏡面反射の訓練データを多様かつ現実的にするために作られた。ObjaverseとAmazon Berkeley Objects(ABO)から3D物体を集め、OBJECT 3DITと初代MirrorFusionのフィルターを使って低品質資産を除外し、66,062物体に絞り込んだ。

Examples from the Objaverse dataset, used in the creation of the curated dataset for the new system. Source: https://arxiv.org/pdf/2212.08051
新しいデータセットの構築に用いられたObjaverseの例。

場面はCC-Texturesの床素材、PolyHavenのHDRI背景、壁全面または縦長の鏡で構成した。照明は物体の上後方45度に固定し、物体を単位立方体へ収め、鏡とカメラの視錐台の交差領域に置いて可視性を確保した。Y軸回りの回転をランダム化し、接地処理で浮遊アーティファクトを防いだ。

ABOカテゴリに基づく意味的に整合した複数物体も取り入れ、副物体が重ならないよう配置した。これにより多様な遮蔽と奥行き関係を持つ3,140の複数物体場面を作成した。

Examples of rendered views from the authors' dataset containing multiple (more than two) objects, with illustrations of object segmentation and depth map visualizations seen below.
複数物体を含むレンダリング例と、物体分割・深度マップ。

訓練プロセス

合成データだけでは実世界への堅牢な汎化が不十分なため、MirrorFusion 2.0は3段階のカリキュラム学習で訓練された。第1段階では条件付け枝と生成枝をStable Diffusion v1.5のチェックポイントで初期化し、SynMirrorV2の単一物体分割で40,000反復のファインチューニングを行った。Reflecting Realityとは異なり生成枝は凍結しなかった。

第2段階ではSynMirrorV2の複数物体分割でさらに10,000反復訓練し、遮蔽と複雑な空間配置を学習させた。第3段階では、Matterport3Dの単眼深度推定器で作成した深度マップを伴う実世界MSDデータにより、さらに10,000反復のファインチューニングを実施した。

Examples from the MSD dataset, with real-world scenes analyzed into depth and segmentation maps. Source: https://arxiv.org/pdf/1908.09101
MSDデータセットの実世界場面を深度・セグメンテーションマップに解析した例。

深度情報を最大限活用させるため、訓練時間の20%ではテキストプロンプトを省略した。全段階でNVIDIA A100を4基使用し、GPUごとのバッチサイズ4、学習率1e-5、AdamWオプティマイザーを用いた。この方式は単純な合成場面から難しい構図へ徐々に難度を上げ、実世界への移行能力を育てる。

評価

MirrorFusion 2.0は従来最先端のMirrorFusionを基準に、MirrorBenchV2の単一物体と複数物体の双方で評価された。MSDとGoogle Scanned Objects(GSO)でも追加の定性試験を行った。評価対象は既知・未知カテゴリの単一物体画像2,991枚と、ABOの二物体場面300件である。

鏡のマスク領域における反射品質をPSNR、SSIM、LPIPSで測り、入力プロンプトとの整合性をCLIP類似度で測定した。定量試験では各プロンプトにつき4つのシードで画像を生成し、SSIMが最良の画像を採用した。

Left, Quantitative results for single object reflection generation quality on the MirrorBenchV2 single object split. MirrorFusion 2.0 outperformed the baseline, with the best results shown in bold. Right, quantitative results for multiple object reflection generation quality on the MirrorBenchV2 multiple object split. MirrorFusion 2.0 trained with multiple objects outperformed the version trained without them, with the best results shown in bold.
MirrorBenchV2における単一物体および複数物体の定量評価。

結果は提案手法が基準手法を上回り、複数物体でファインチューニングすると複雑な場面の性能も向上することを示した。

Comparison on MirrorBenchV2: the baseline failed to maintain accurate reflections and spatial consistency, showing incorrect chair orientation and distorted reflections of multiple objects, whereas (the authors contend) MirrorFusion 2.0 correctly renders the chair and the sofas, with accurate position, orientation, and structure.
MirrorBenchV2での比較。MirrorFusion 2.0は位置・向き・構造をより正確に保つ。

研究者によれば、基準モデルは反射内の物体方向や空間関係を正確に描けず、不適切な回転や浮遊物体を生じた。SynMirrorV2で訓練したMirrorFusion 2.0は、単一・複数物体のいずれでも位置と向きを保ち、より現実的で一貫した反射を生成した。

Comparison on the GSO dataset. The baseline misrepresented object structure and produced incomplete, distorted reflections, while MirrorFusion 2.0, the authors contend, preserves spatial integrity and generates accurate geometry, color, and detail, even on out-of-distribution objects.
GSOデータセットでの比較。提案手法は未知の物体でも形状・色・細部を保持する。

GSOでは、基準モデルが物体構造を誤り、不完全で歪んだ反射を作ったのに対し、MirrorFusion 2.0は分布外の物体でも空間的一貫性、形状、色、細部を維持した。引き出しの取っ手を正しく反射し、白と黄色のマグカップでもアーティファクトの少ない説得力ある形状を生成した。

Real-world scene results comparing MirrorFusion, MirrorFusion 2.0, and MirrorFusion 2.0, fine-tuned on the MSD dataset. MirrorFusion 2.0, the authors contend, captures complex scene details more accurately, including cluttered objects on a table, and the presence of multiple mirrors within a three-dimensional environment. Only partial results are shown  here, due to the dimensions of the results in the original paper, to which we refer the reader for full results and better resolution.
実世界MSD場面におけるMirrorFusion各版の比較。

MirrorFusion 2.0はMirrorBenchV2とGSOでは良好だったが、当初はMSDの複雑な実世界場面で苦戦した。MSDの一部で追加学習すると、散らかった環境や複数の鏡への対応が改善し、保留した試験分割でも一貫性と細部が向上した。

ユーザー調査では84%が基準手法よりMirrorFusion 2.0の生成結果を好んだ。詳細は論文付録に記載されている。

Results of the user study.
ユーザー調査の結果。

結論

論文の結果の一部は従来最先端を明確に改善している。ただし、この分野の既存水準そのものが低いため、完全には説得力のない総合的解決策でも比較的容易に勝てる。拡散モデルの基本構造は、一貫した物理法則を確実に学び再現することに向いておらず、問題設定自体が難しく、洗練された解決策にはなじみにくい。

既存モデルの欠点を補うためデータを増やすことはすでに標準的な手法であり、先に述べた短所も伴う。将来の大規模データセットが反射関連データの分布と注釈に注意を払えば、モデルは反射をより適切に扱えるだろう。しかしLDM出力には同様の難題が多数あり、どの問題に今回のような費用と労力を投じるべきかは容易に決められない。

初出:2025年4月28日(月)。4月29日(火)、最終段落の文法を修正。

出典と関連リンク

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai