Andersonの視点
拡散モデルの限られた鏡と反射の理解を修正する

生成的なAIが一般の注目を集めるようになった以来、コンピュータビジョン研究分野は、物理法則を理解し、再現することができるAIモデルを開発することに深い興味を抱いてきました。しかし、機械学習システムに、例えば重力や流体力学などの現象をシミュレートすることを教えるという課題は、少なくとも5年間、研究の重要な焦点となってきました。
2022年に潜在的拡散モデル(LDM)が生成的なAIのシーンを支配するようになって以来、研究者は、LDMアーキテクチャの物理現象を理解し、再現する能力の限界にますます注目しています。現在、この問題は、OpenAIの生成ビデオモデルSoraのランドマーク的な開発や、オープンソースビデオモデルHunyuan VideoやWan 2.1の最近のリリースによってさらに注目されています。
反射の問題
LDMの物理的理解を改善するために行われているほとんどの研究は、歩行シミュレーション、粒子物理学、ニュートンの運動法などの分野に焦点を当てています。これらの分野は、AI生成ビデオの本物さをすぐに損なう基本的な物理的挙動の不正確さに注目しているため、注目を集めています。
しかし、LDMの最大の弱点の1つである反射の正確な生成という問題に焦点を当てた研究もあります。

2025年1月の論文「Reflecting Reality: 拡散モデルの忠実なミラー反射の生成を可能にする」から、反射の失敗の例と研究者のアプローチの比較。ソース: https://arxiv.org/pdf/2409.14677
この問題は、CGI時代にもビデオゲーム業界でも、レイ・トレーシングアルゴリズムが表面との光の相互作用をシミュレートするために使用されている現在も、課題となっています。レイ・トレーシングは、実際的な反射、屈折、影を生成するために、仮想的な光線が物体と相互作用する方法を計算します。
しかし、各追加のバウンスは計算コストを大幅に増加させるため、リアルタイムアプリケーションでは、レイ・トレーシングの精度とレイのバウンスの数のトレードオフが必要です。1つのバウンスだけでも、レンダリング時間を2倍に増やすことがあります。

伝統的な3Dベースのシナリオ(つまり、CGI)における仮想的に計算された光線の表現。ソース: https://www.unrealengine.com/en-US/explainers/ray-tracing/what-is-real-time-ray-tracing
例えば、ミラーの前のクロームティーポットを描写するには、光線が反射面の間で繰り返しバウンスするレイ・トレーシングプロセスが必要です。これにより、ほとんどの実用的な利点がない無限ループが生じます。ほとんどの場合、2〜3回のバウンスで、視聴者が認識できる限界に達します。1回のバウンスだけでは、光が反射を形成するために2回の旅を完了する必要があるため、ミラーは黒く表示されます。
画像の問題
LDMの物理的理解を改善するために行われている研究のほとんどは、歩行シミュレーション、粒子物理学、ニュートンの運動法などの分野に焦点を当てています。これらの分野は、AI生成ビデオの本物さをすぐに損なう基本的な物理的挙動の不正確さに注目しているため、注目を集めています。
しかし、LDMの最大の弱点の1つである反射の正確な生成という問題に焦点を当てた研究もあります。
ミラーベース
LDMに反射のロジックを教えることは、明示的な構造的アプローチであるNeRFやGaussian Splattingよりも難しいと考えられています。LDMでは、このようなルールは、トレーニングデータに多様な例が含まれている場合にのみ、信頼性の高い方法で埋め込まれる可能性があります。
従来、LDMに特定の動作を追加するには、LoRAやFine-Tuningが使用されていました。しかし、これらのアプローチには限界があります。LoRAは、プロンプトなしでさえも、トレーニングデータに基づいて出力を歪める可能性があり、Fine-Tuningは、高価で、モデルを主流から逸脱させる可能性があります。
一般に、LDMを改善するには、トレーニングデータが反射の物理学に更に注意を払う必要があります。しかし、他の多くの分野も同様の特別な注意を必要とします。超大規模なデータセットでは、カスタムのキュレーションは高価で困難であるため、このような弱点をすべてこのように対処することは実用的ではありません。
しかし、LDMの反射問題の解決策が時々現れます。インドから最近の1つの努力は、MirrorVerseプロジェクトであり、状態オブザートを向上させることができるデータセットとトレーニング方法を提供しています。

MirrorVerseの結果と2つの前のアプローチの比較。ソース: https://arxiv.org/pdf/2504.15397
方法
研究者は、Stable DiffusionやFluxなどのモデルが反射ベースのプロンプトを尊重することの難しさを強調しています。

SD3.5とFluxの反射の生成の例。ソース: https://arxiv.org/pdf/2504.15397
研究者は、MirrorFusion 2.0と呼ばれる拡散ベースの生成モデルを開発しました。このモデルは、合成画像におけるミラー反射の写実性と幾何学的精度を向上させることを目的としています。
トレーニングデータセットは、MirrorGen2と呼ばれ、反射の物理学をよりよく捉えるために設計されています。

MirrorVerseのデータセット生成パイプラインのスキーマ。ソース: https://arxiv.org/pdf/2504.15397
データとテスト
SynMirrorV2
研究者は、SynMirrorV2と呼ばれる新しいデータセットを開発しました。このデータセットは、3Dオブジェクト、テクスチャードフロア、HDRI背景を使用して生成され、ミラー反射のシミュレーションに適しています。
シーンの構築には、ObjaverseとAmazon Berkeley Objectsから3Dオブジェクトを使用し、CC-TexturesとPolyHavenからテクスチャードフロアとHDRI背景を使用しました。
オブジェクトは、3D-Positionerを使用してシーン内に配置され、ランダムな回転とグラウンドテクニックが適用されました。
トレーニングプロセス
研究者は、MirrorFusion 2.0をトレーニングするために、3段階のカリキュラム学習プロセスを開発しました。
ステージ1では、モデルはStable Diffusion v1.5のチェックポイントから初期化され、SynMirrorV2データセットのシングルオブジェクトトレーニングスプリットでファインチューニングされました。
ステージ2では、モデルはSynMirrorV2のマルチオブジェクトトレーニングスプリットでさらにファインチューニングされ、複雑な空間配置を扱う能力を向上させました。
ステージ3では、モデルはMSDデータセットでファインチューニングされ、リアルワールドシーンでの反射の生成能力を向上させました。
テスト
研究者は、MirrorFusion 2.0をMirrorBenchV2データセットでテストしました。
結果は、MirrorFusion 2.0が基準モデルよりも優れており、反射の生成の質が向上していることを示しています。
さらに、研究者は、MirrorFusion 2.0が、複雑なシーンでの反射の生成に優れていることを示すために、Google Scanned Objectsデータセットでテストしました。
結論
研究者は、MirrorFusion 2.0が、反射の生成の質を向上させることができ、複雑なシーンでの反射の生成に優れていることを示しています。
しかし、LDMの反射問題は、根本的なアーキテクチャの限界により、解決が難しい問題であることも示しています。
さらに、LDMの反射問題は、他の多くの問題と同様に、データセットのキュレーションとトレーニング方法の改善が必要であることを示しています。












