Andersonの視点
AIワールドモデルは本当に物理法則を理解できるのか?

ビジョン言語AIモデルにとっての大きな希望は、それらが将来、より高度な自律性と多様性を持ち、物理法則の原理を私たちが初期の経験を通じて身につけるのと同様に取り入れることである。
例えば、子供たちのボールゲームは、運動学の理解を発達させ、重量や表面の質感が軌道に与える影響も理解できる。
同様に、風呂、こぼれた飲み物、海、プールなどの様々な液体の挙動を通じて、重力下での液体の挙動に関する汎用性の高い理解を身につける。
さらに、燃焼、爆発、圧力下での建築物の重量分布などの珍しい現象についても、テレビ番組や映画、ソーシャルメディアのビデオを通じて無意識に吸収する。
私たちがこれらのシステムの原理を学ぶのは、学術的なレベルでであるが、実際には私たちの直感的な(しかし無知な)精神モデルを「後付け」するに過ぎない。
一人で達人
現在、ほとんどのAIモデルは、対照的に、より「専門化」されており、多くのモデルは、特定のユースケースに特化した画像またはビデオのデータセットで微調整されたり、スクラッチからトレーニングされたりしている。
他のモデルは、物理法則の理解を装うかもしれないが、実際にはトレーニングデータからサンプルを再現しているだけで、運動物理学などの分野で真正に新しい(そして科学的に妥当な)描写を生み出すことができない。
ジェネレーティブAIシステムの製品化と商業化のこのデリケートな時期に、私たちと投資家の注意は、AIモデルの創造的なマーケティングとその限界の現実を区別することにある。
11月の最も興味深い論文の1つは、Bytedance Researchが主導し、「万能」のジェネレーティブモデルであるSoraのようなモデルが、実際には物理法則を理解しているかどうかを探った。
研究では、現在の最先端のジェネレーティブモデルは、トレーニングデータからサンプルを再現するだけで、物理法則を真正に理解しているわけではないと結論づけた。
論文では、次のように述べられている。
‘これらのモデルは、トレーニングセットからの「欺瞞的な」例によって簡単に偏る可能性があり、特定の条件下で「ケースベース」の方法で一般化する傾向がある。これは、大規模言語モデルでも観察された現象であり、モデルが新しいタスクを解決する際に、類似のトレーニングケースを参照する傾向を示す。
過去の記憶
一般化能力がなければ、トレーニングされたAIモデルは、高価な参照の集合に過ぎない。適切な検索用語を見つければ、トレーニングデータのインスタンスを呼び出すことができる。
このシナリオでは、モデルは基本的に「ニューラル検索エンジン」に過ぎない。抽象的または「創造的な」解釈を生み出すことができない。代わりに、トレーニングプロセス中に見たデータのわずかなバリエーションを再現する。
これは、暗記として知られる問題であり、真正に柔軟で解釈可能なAIモデルは詳細性に欠けがちである一方で、詳細性の高いモデルは柔軟性と独創性に欠けがちである。
ワールドモデル
暗記の問題は、AIモデルが物理法則の基本的な理解を装うが、実際にはトレーニングデータの高volumeによってこの幻覚を生み出していることを示唆する。
この問題は、ワールドモデルの発展に特に重要である。ワールドモデルとは、多様な既知の法則を取り込み、豊富に探索可能な、高度にトレーニングされたAIシステムである。
ワールドモデルは、特にジェネレーティブ画像とビデオの分野で注目されている。2023年、RunwayMLはワールドモデルの開発と実現可能性に関する研究プロジェクトを開始した。DeepMindは最近、有名なSoraジェネレーティブビデオの創設者をワールドモデルの開発に取り組むために雇用した。Higgsfieldのようなスタートアップは、画像とビデオの合成のためのワールドモデルに大量に投資している。
ハードコンボ
新しいジェネレーティブビデオAIシステムの開発の1つの約束は、運動、人間の運動学(例:歩行特性)、流体力学などの基本的な物理法則を学習する能力である。
ジェネレーティブAIがこの里程標に到達できれば、爆発、洪水、異なるオブジェクト間の衝突イベントをリアルに描写できるようになる。
一方で、AIシステムがこれらのイベントを描写するトレーニングデータに基づいている場合は、ユーザーのターゲットクエリに似たトレーニングデータがあれば、トレーニングデータを再現することができるが、クエリが多くの概念を組み合わせている場合は失敗する可能性がある。
これらの限界はすぐには明らかにならず、システムを挑戦的な組み合わせでテストするまで明らかにならない。
これは、新しいジェネレーティブシステムが、印象的なビデオコンテンツを生成できるが、そのシステムの能力と理解の深さについて誤った印象を与える可能性があることを意味する。
例えば、比較的一般的で広く普及しているイベントである「建物の解体」は、トレーニングデータセット内の複数のビデオに現れる可能性があり、モデルはこの概念をうまく一般化し、トレーニングデータから学んだパラメータ内で新しい出力を生成できる。
これは、インディストリビューションの例であり、データセットにはモデルが学習するための多くの有用な例が含まれている。
しかし、もっと珍しい、またはありそうもない例、たとえば「エッフェル塔が異星人に爆破される」を要求された場合、モデルは「金属の特性」、「爆発の特性」、「重力」、「風抵抗」、「宇宙船」のような多様なドメインを組み合わせる必要があり、システムは、生成された例がユーザーのプロンプトに従っているかどうかに関係なく、生成された例がトレーニングデータに基づいているかどうかに関係なく、生成された例を生成するか、またはトレーニングデータに基づいた最も近い例を生成するかする。
このような描写は、モデルが物理法則を真正に理解していることを示すために、ハリウッドスタイルのCGIベースのVFXを含むトレーニングデータセットがなければ、絶対に必要である。
物理的制約
新しい論文は、Soraのようなモデルが真正に決定論的な物理法則を内部化していないことを示唆し、データをスケールアップすることは、この点ではほとんど改善をもたらさない。
論文では、特定の物理法則の外挿の限界だけでなく、モデルが2つの物理原理の表現を1つの生成出力に結合する能力である組み合わせ的一般化も探究した。
新しい論文のビデオサマリー。 Source: https://x.com/bingyikang/status/1853635009611219019
研究者は、放物線運動、一様線運動、完全弾性衝突の3つの物理法則を研究した。
上記のビデオからわかるように、研究結果は、Soraのようなモデルが真正に物理法則を内部化していないことを示唆し、トレーニングデータを再現する傾向がある。
さらに、色や形が推論時のエントロピーで絡み合うため、生成されたボールは、トレーニングデータの例に基づいて、球ではなく四角形になる可能性がある(上記のビデオの例を参照)。
論文では、次のように結論づけられている。
‘私たちの研究は、スケーリングだけがビデオ生成モデルが基本的な物理法則を発見するのに十分ではないことを示唆しています…
‘…[発見]は、ビデオモデルの一般化が、普遍的なルールを学ぶよりも、類似のトレーニング例を参照することに重点を置いていることを示しています。色>サイズ>速度>形状の順序で「ケースベース」の動作が見られます。
‘私たちの研究は、ビデオモデルの一般化が、スケーリングではなく、組み合わせ空間のカバレッジに依存することを示唆しています。
研究チームの1人は、問題に対する解決策を見つけたかどうか尋ねられ、次のように答えた。
‘残念ながら、まだ見つけておりません。実際、这是全AIコミュニティの使命です。 ‘
方法とデータ
研究者は、変分オートエンコーダー(VAE)とDiTアーキテクチャを使用して、ビデオサンプルを生成した。
VAEによって生成される圧縮された潜在的な表現は、DiTのノイズ除去プロセスのモデリングとともに機能する。
ビデオは、Stable Diffusion V1.5-VAEでトレーニングされた。スキーマは基本的に変更されず、エンドオブプロセスのアーキテクチャの強化のみが行われた。
‘[私たちは]元の2D畳み込み、グループ正規化、空間次元の注意メカニズムのほとんどを保持しています。
‘この構造を空間時間オートエンコーダーに膨張させるために、エンコーダーの最後の数つの2Dダウンサンプルブロックとデコーダーの最初の数つの2Dアップサンプルブロックを3Dに変換し、時間モデリングを強化するために複数の追加の1D層を使用します。 ‘
画像データセットは、Stable Diffusionの元のソースであるLAION-Aestheticsで、フィルタリングとDataCompが使用された。ビデオデータセットは、Vimeo-90K、Panda-70m、HDVGからキュレーションされたサブセットが使用された。
データは、1ミリオンステップで、ランダムリサイズクロップとランダム水平フリップがデータ増強プロセスとして適用された。
フリッピングアウト
上記で述べたように、ランダム水平フリップデータ増強プロセスは、真正な運動を生成するように設計されたシステムをトレーニングする上で、欠点となる可能性がある。これは、出力モデルがオブジェクトの両方の方向を考慮し、矛盾するデータによってランダムに逆転する可能性があるためである。
一方で、水平フリップをオフにすると、モデルはトレーニングデータから学習した1つの方向のみに従う出力を生成する可能性が高くなる。
したがって、この問題に対する簡単な解決策はなく、システムが両方の方向の運動の全可能性を真正に吸収する能力が必要である。子供はこれを簡単に発達させるが、AIモデルにとってはより大きな課題である。
テスト
最初の実験のために、研究者は、Box2D物理ゲームエンジンを使用して、古典力学の法則に従ったオブジェクトの運動と衝突のビデオを生成する2Dシミュレーターを作成した。
上記で述べた3つの基本シナリオ、つまり一様線運動、完全弾性衝突、放物線運動がテストの焦点となった。
サイズと複雑さが異なるモデル(DiT-SからDiT-L)をトレーニングするために、30,000から300万までのビデオのデータセットが使用された。各ビデオの最初の3フレームが条件付けに使用された。
結果は、インディストリビューション(ID)結果が増加するデータ量とともにうまくスケーリングするが、OOD生成は改善されないことを示唆しており、一般化における限界があることを示唆している。
著者は次のように述べている。
‘これらの結果は、スケーリングがOODシナリオでの推論を実行することができないことを示唆しています。 ‘
次に、研究者は、2つの異なる物理原理の表現を1つの生成出力に結合する能力である組み合わせ的一般化を示すシステムをテストおよびトレーニングした。
このテストのために、著者は、PHYREシミュレーターを使用して、多様な形状のオブジェクトが自由落下し、複数の複雑な相互作用で衝突する2D環境を作成した。
この第2テストの評価メトリックは、Fréchet Video Distance(FVD)、Structural Similarity Index(SSIM)、Peak Signal-to-Noise Ratio(PSNR)、Learned Perceptual Similarity Metrics(LPIPS)、および人間の研究(結果では「異常」と表記)であった。
3つのスケールのトレーニングデータセット(100,000、600万、3600万ビデオ)が作成され、DiT-BとDiT-XLモデルが使用された。各ビデオの最初のフレームが条件付けに使用された。
モデルは256×256の解像度で32フレームのビデオを1ミリオンステップでトレーニングされた。
結果は、単にデータのvolumeを増やすことは不十分であることを示唆している。
論文では、次のように述べられている。
‘これらの結果は、モデルの容量と組み合わせ空間のカバレッジが、組み合わせ的一般化に重要であることを示唆しています。 この洞察は、ビデオ生成のスケーリング法は、データのvolumeを単にスケールアップするのではなく、組み合わせの多様性を増やすことに重点を置くべきであることを示唆しています。 ‘
最後に、研究者は、ビデオ生成モデルが真正に物理法則を吸収できるか、またはトレーニングデータを単に再現するかを判断するために、さらなるテストを実施した。
ここでは、モデルが新しい状況に直面したときに特定のトレーニング例を模倣する傾向がある「ケースベース」の一般化の概念を調査し、特に一様運動の場合、トレーニングデータの方向がモデルによる予測に与える影響を調査した。
一様運動と衝突の2つのトレーニングデータセットが作成され、各データセットには2.5から4単位の速度で一様運動を表すビデオが含まれた。潜在的な値である速度は省略され、トレーニング後、既知のシナリオと未知のシナリオの両方でテストが実施された。
一様運動生成のテスト結果は以下のとおりである。
著者は次のように述べている。
‘[大きなギャップがあるトレーニングセットでは]、モデルは、トレーニングデータを模倣するために、速度が高いか低いかのいずれかでビデオを生成する傾向がある。 ‘
衝突テストでは、多くの変数が関与し、モデルは2次元の非線形関数を学習する必要がある。
著者は、欺瞞的な例(たとえば、逆方向の運動、たとえばボールが衝突後に方向を逆転する)の存在がモデルを欺き、物理的に正しくない予測を生成させる可能性があることを観察している。
結論
非AIアルゴリズム(「焼き付け」された手続き的方法)には、流体や重力、圧力の下での物体の挙動などの物理現象の挙動を記述するための数学的ルールが含まれている。正確なレンダリングのための不変の定数が利用できる。
しかし、新しい論文の結果は、ジェネレーティブモデルがトレーニング中に等価の関係や物理法則の理解を発達させていないことを示唆しており、データを増やすと問題は解決されず、むしろ隠される。システムが推論時に模倣できるトレーニングビデオの数が増えるからである。
* 著者のインライン引用をハイパーリンクに変換したもの。
2024年11月26日初出。












