Andersonの視点
AIビデオが時々逆になる理由

2022年は、ジェネレーティブAIがより広い一般の人々の想像力をかきたてる年となったが、2025年は、中国から出てきた新しいジェネレーティブ・ビデオ・フレームワークが同じことを成し遂げるために設定されている年である。
TencentのHunyuan Videoは、オープンソースでリリースされたフルワールド・ビデオ・ディフュージョン・モデルで、ユーザーが大きな影響を与えた。ユーザーはこのモデルを自分のニーズに合わせてカスタマイズできる。
その後、AlibabaのWan 2.1が登場し、現在の最も強力な画像からビデオへのFOSSソリューションの一つとなり、Wan LoRAsを介してカスタマイズが可能となった。
最近の人間中心の基礎モデルSkyReelsの利用可能性に加えて、現在、Alibabaの包括的なVACEビデオ作成および編集スイートのリリースを待っている。
クリックして再生。 AlibabaのマルチファンクションAI編集スイートVACEのリリースがユーザーコミュニティを興奮させている。 ソース:https://ali-vilab.github.io/VACE-Page/
突然の影響
ジェネレーティブ・ビデオ・AIの研究シーンは、爆発的な状況にある。3月の前半で、アーカイブのコンピュータービジョンセクション(ジェネレーティブAIの論文の中心)への火曜日の提出物は、約350件に達した。これは、通常、カンファレンスのピークシーズンにみられる数字である。
2022年の夏にStable Diffusionがリリースされて以来、DreamboothとLoRAのカスタマイズ方法の開発に続く2年間は、重大な進展がなかった。しかし、最近の数週間では、新しいリリースや革新が、追跡することさえ困難なほどの速さで進んでいる。
ビデオ・ディフュージョン・モデルであるHunyuanやWan 2.1は、ついに、人間、環境、オブジェクトの生成における時間的一貫性の問題を解決した。数百の研究プロジェクトが失敗した後、ようやく解決された。
ビデオ・エフェクト・スタジオは、現在、スタッフとリソースを、新しい中国のビデオ・モデルを適用して、フェイス・スワッピングなどの課題を解決するために投入している。現在、ControlNetスタイルの補助メカニズムが不足しているにもかかわらずである。
これほど大きな障害が潜在的に克服されたことは、ほとんど疑う余地がない。
しかし、残っている問題のうち、この問題は重要ではない。
クリックして再生。 プロンプト「急な岩の斜面を転がり落ちる小さな岩、土や小石を押しのけながら」に基づいて、Wan 2.1で生成されたビデオでは、1つの単純なミスがある。 ソース:https://videophy2.github.io/
逆の坂を上る
現在利用可能なすべてのテキストからビデオへのシステムや画像からビデオへのシステム、商用のクローズドソース・モデルを含む、は、物理的な間違いを生み出す傾向がある。上記のビデオのように、プロンプト「急な岩の斜面を転がり落ちる小さな岩、土や小石を押しのけながら」に基づいて、ビデオが岩を上りに転がることを示す。
これが起こる理由として、最近、AlibabaとUAEの共同研究で提案された仮説がある。つまり、モデルは常に単一の画像でトレーニングされる。ビデオの場合も、トレーニングのためにシーケンスに書き出されるためである。したがって、モデルは「前」と「後」の正しい時間的順序を学習できない可能性がある。
しかし、最も可能性の高い解決策は、モデルがデータ・オーグメンテーション・ルーチンを使用していることである。つまり、ソース・トレーニング・クリップをモデルに、前向きと後ろ向きの両方で提示する。実際には、トレーニング・データを2倍に増やすことになる。
これは、いつの時代からも、無制限に行うべきではないことはわかっている。なぜなら、ある動きは逆方向に機能するが、多くの動きはそうではないからである。2019年の研究では、イギリスのブリストル大学は、データセット内の「等価」、「不変」、「不可逆」の3種類のソース・ビデオ・クリップを区別する方法を開発しようとした。無適切なソース・クリップをデータ・オーグメンテーション・ルーチンから除外するという考えだった。

3種類の動きの例。物理的な動きを維持しながら、自由に逆方向に再生できるのは1つだけ。 ソース:https://arxiv.org/abs/1909.09422
研究者は問題を明確に述べている。
「逆再生ビデオの現実性は、自然界ではあり得ない、逆再生アーティファクトによって裏付けられている。アーティファクトの中には、微妙なものもあれば、容易に発見できるものもある。例えば、逆再生された「投げる」アクションでは、投げた物体が床から突然浮き上がる。」
「私たちは、物理的なアーティファクト(自然法則の違反)と、あり得ないアーティファクト(あり得るが、ありそうもないシナリオ)という2種類の逆再生アーティファクトを観察する。両者は相互に排他的ではなく、多くの逆再生アクションは両方のアーティファクトを示す。例えば、紙を丸めて折る場合。」
「物理的なアーティファクトの例としては、重力の逆転(例:「落とす」)、物体への自発的な衝撃(例:「ペンを回す」)、不可逆的な状態変化(例:「ろうそくを燃やす」)などがある。あり得ないアーティファクトの例としては、食器を棚から取り出して、乾燥機で乾かして、乾燥機に置くことである。」
「このようなデータの再利用は、トレーニング時には非常に一般的であり、有益である。例えば、モデルが画像やオブジェクトの1つのみ視点のみを学習しないようにするためである。ただし、対称性のないオブジェクトに対しては機能しない。物理を「逆再生」ビデオから学習することも、逆再生バージョンが前向きバージョンと同じだけの意味を成す場合のみに機能する。」
一時的な逆転
Hunyuan VideoやWan 2.1のようなシステムが、無制限に「逆再生」クリップをモデルに提示したことを示す証拠はない(どちらの研究グループも、データ・オーグメンテーション・ルーチンについて具体的に述べていない)。
しかし、多くの報告(および私の実践的な経験)があるため、唯一の妥当な代替可能性は、ハイパースケール・データセットがこれらのモデルを動かしていることが原因であるように思われる。つまり、実際に逆方向に動作するクリップが含まれている可能性がある。
上記に埋め込まれたビデオで使用された岩は、Wan 2.1で生成されたもので、新しい研究でビデオ・ディフュージョン・モデルが物理をどのように扱うかを調べている。
このプロジェクトのテストでは、Wan 2.1は、物理法則を一貫して遵守する能力において、22%のスコアしか獲得できなかった。
しかし、これは、テストされたシステムの中で最高のスコアであり、ビデオAIの次の躓きに直面している可能性があることを示している。

先頭のオープンおよびクローズドソースシステムのスコア。フレームワークの出力は、人間のアノテーターによって評価された。 ソース:https://arxiv.org/pdf/2503.06800
研究者は、2世代目のベンチマーク・システム、VideoPhyを開発し、コードはGitHubで利用可能である。
この研究の範囲は、ここで網羅的にカバーすることはできないが、方法論と、物理的な意味不一致を避けるための将来のモデル・トレーニング・セッションの方向性を決定する可能性のあるメトリックを確立するための潜在的な可能性について、概要を見てみよう。
研究は、UCLAとGoogle Researchの6人の研究者によって行われ、VideoPhy-2:アクション・セントリック・フィジカル・コモンセンス・エバリューション・イン・ビデオ・ジェネレーションと呼ばれる。
プロジェクト・サイトはこちら、コードとデータセットはGitHubで、データセット・ビューアはHugging Faceで利用可能である。
クリックして再生。 ここでは、OpenAI Soraモデルは、オールと反射の間の相互作用を理解できず、ボート内の人物やボートがそれと相互作用する方法についても、論理的な物理的流れを提供することができない。
方法
研究者は、最新の作品、VideoPhy-2を「挑戦的なリアルワールドのアクション・セントリック・コモンセンス・エバリューション・データセット」と説明する。コレクションには、さまざまなスポーツ、オブジェクトの相互作用、現実世界の物理学を含む、197のアクションが含まれる。
大規模言語モデル(LLM)を使用して、197のアクションから3,840のプロンプトを生成し、プロンプトを使用して、さまざまなフレームワークを介してビデオを合成する。
プロセス全体を通じて、研究者は、AI生成ビデオが満たすべき「候補」の物理ルールと法則のリストを開発している。ビジョン言語モデルを使用して評価する。
研究者は次のように述べている。
「例えば、テニスをしているスポーツマンのビデオでは、物理的なルールは、テニスボールが重力の下で放物線の軌道を辿ることである。ゴールドスタンダードの判断のために、人間のアノテーターに、各ビデオを全体的な意味的順守と物理的なコモンセンスに基づいてスコアを付けるよう依頼し、さまざまな物理的なルールの遵守をマークする。」

上:LLMを使用してアクションからテキスト・プロンプトを生成し、テキストからビデオ・ジェネレーターを使用してビデオを作成する。ビジョン言語モデルを使用してビデオにキャプションを付ける。下:人間のアノテーターがビデオの現実性を評価し、ルールの違反を確認し、不足しているルールを追加し、ビデオが元のプロンプトと一致することを確認する。
初期段階では、研究者は、AI生成ビデオの物理的コモンセンスを評価するために、行動のセットをキュレーションした。Kinetics、UCF-101、SSv2データセットから600以上の行動を出発点として、スポーツ、オブジェクトの相互作用、現実世界の物理学を含む活動に焦点を当てた。
2つの独立したグループのSTEMトレーニングを受けた学生アノテーター(最低限の学士号を取得している)がリストをレビューしてフィルタリングし、重力、運動量、弾性率などの原理をテストする行動を選択し、低運動タスク(例:タイピング、猫を撫でる、嚙む)を除去した。
さらに、Gemini-2.0-Flash-Expを使用して重複を除去した後、最終的なデータセットには、54のオブジェクトの相互作用と143の物理的およびスポーツ活動が含まれた197の行動が含まれていた。

絞り込まれたアクションのサンプル。
2段階目では、研究者はGemini-2.0-Flash-Expを使用して、データセット内の各アクションに対して20のプロンプトを生成し、合計3,940のプロンプトを生成した。生成プロセスでは、明確に表現できる物理的相互作用に焦点を当てた。
例えば、プロンプト「アーチャーが矢を放つ」ではなく、「アーチャーが弓の弦を最大の緊張まで引いてから矢を放つ。矢は真っ直ぐに飛んでいき、紙の的の的の中心に当たる」ような、より詳細なバージョンを生成するようにモデルを指導した。
現代のビデオ・モデルは、より長い説明を解釈できるため、研究者は、Mistral-NeMo-12B-Instructプロンプト・アップサンプラーを使用して、キャプションをさらに洗練し、視覚的な詳細を追加したが、元の意味を変更しなかった。

VideoPhy-2のプロンプトのサンプル。物理活動またはオブジェクトの相互作用に分類され、各プロンプトは対応するアクションとテストする物理的原則とペアになっている。
3段階目では、物理的なルールは、テキスト・プロンプトからではなく、生成されたビデオから導き出された。なぜなら、生成モデルは、条件付きテキスト・プロンプトに従うのに苦労することがあるからである。
ビデオは、VideoPhy-2のプロンプトを使用して生成され、Gemini-2.0-Flash-Expを使用して「上キャプション」され、各ビデオの3つの期待される物理ルールが提案された。人間のアノテーターがこれをレビューして拡張し、追加の潜在的な違反を特定した。

アップサンプルド・キャプションの例。
次に、研究者は、CogVideoX-5Bを使用して、VideoPhy-2のプロンプトでビデオを生成し、197のアクションのうち、モデルが一貫してプロンプトと基本的な物理的コモンセンスに従わない60のアクションを選択した。これらのアクションには、運動量の転送、状態の変化、バランス・タスク、複雑な動きなど、物理的に豊かな相互作用が含まれる。
合計1,200のプロンプトが選択され、サブデータセットの難易度を高めた。結果として得られたデータセットは、3,940のキャプションで構成され、以前のバージョンの5.72倍となり、元のキャプションの平均長さは16トークンで、増幅されたキャプションは138トークンに達し、1.88倍と16.2倍長くなった。
データセットには、102,000の人間のアノテーションが含まれており、さまざまなビデオ生成モデルに対する意味的順守、物理的コモンセンス、ルールの違反についてカバーしている。
評価
研究者は、ビデオを評価するための明確な基準を定義した。主な目標は、各ビデオが入力プロンプトにどれだけよく一致し、基本的な物理的原理に従っているかを評価することであった。
ビデオを単に好みでランク付けするのではなく、評価では、特定の成功と失敗を捉えるために、評価に基づくフィードバックを使用した。人間のアノテーターは、5点満点のスケールでビデオを評価し、ビデオがさまざまな物理的ルールと法則に従っているかどうかも確認した。
人間の評価のために、Amazon Mechanical Turk(AMT)から12人のアノテーターが選択され、詳細なリモート・インストラクションを受けた後、評価を行った。公平性を保つために、意味的順守 と 物理的コモンセンス は、元のVideoPhy研究で共同評価されたのとは異なり、別々に評価された。
アノテーターは、ビデオが入力プロンプトにどれだけよく一致するかを評価し、物理的妥当性を別々に評価し、ルールの違反と全体的な現実性を5点満点のスケールで評価した。モデル間の公平な比較を保つために、元のプロンプトのみが提示された。

AMTアノテーターに提示されたインターフェイス。
人間の判断は金本位であるが、費用がかかり、いくつかの欠点がある。したがって、自動評価は、より迅速でスケーラブルなモデル評価に不可欠である。
論文の著者は、Gemini-2.0-Flash-ExpやVideoScoreを含むいくつかのビデオ言語モデルを、ビデオの意味的正確性と「物理的コモンセンス」への評価能力をテストした。
モデルは、5点満点のスケールで各ビデオを評価し、別の分類タスクでは、物理的ルールが遵守されたか、違反されたか、または不明確であるかを判断した。
実験では、既存のビデオ言語モデルは、人間の判断に匹敵するのに苦労していることがわかり、主な理由は物理的推論が弱く、プロンプトの複雑さである。自動評価を改善するために、研究者は、VideoPhy-2-Autoevalを開発した。これは、3つのカテゴリ(意味的順守、物理的コモンセンス、ルールの遵守)でより正確な予測を提供するように設計された7Bパラメータのモデルで、VideoCon-Physicsモデルを使用して、50,000の人間のアノテーションでファインチューンされた。
データとテスト
これらのツールを使用して、研究者は、CogVideoX-5B、VideoCrafter2、HunyuanVideo-13B、Cosmos-Diffusion、Wan2.1-14B、OpenAI Sora、Luma Rayなどのさまざまなジェネレーティブ・ビデオ・システムをテストした。
モデルは、可能な場合はアップサンプルド・キャプションでプロンプトされ、Hunyuan VideoとVideoCrafter2は77トークンのCLIP制限があるため、特定の長さを超えるプロンプトを受け付けることができない。
生成されたビデオは6秒未満に制限された。出力が短いと、評価が容易になるからである。
駆動データはVideoPhy-2データセットから得られ、ベンチマークとトレーニングセットに分割された。各モデルごとに590のビデオが生成されたが、SoraとRay2については、コストの要因のため、ビデオの数が少なかった。
(詳細な評価については、ソース論文を参照してください。そこでは、評価の詳細が網羅的に記載されています。)
初期評価では、物理活動/スポーツ(PA)とオブジェクトの相互作用(OI)がテストされ、一般的なデータセットと先ほど述べた「より困難な」サブセットがテストされた。

初期ラウンドの結果。
ここで、著者は次のように述べている。
「最も優れたパフォーマンスを示したモデルであるWan2.1-14Bは、データセットの完全版とハードスプリットでそれぞれ32.6%と21.9%のスコアしか達成できなかった。Wan2.1-14Bの相対的な強いパフォーマンスは、そのマルチモーダル・トレーニング・データの多様性と、幅広いアクションに対して高品質のビデオを保存する堅牢なモーション・フィルタリングに帰因される。」
「さらに、クローズド・モデル(例:Ray2)は、オープン・モデル(例:Wan2.1-14BとCogVideoX-5B)よりも、物理的コモンセンスを捉える能力が低いことを示唆している。つまり、クローズド・モデルは、物理的コモンセンスを捉える能力でオープン・モデルよりも優れているわけではない。」
「注目すべきは、Cosmos-Diffusion-7Bがハードスプリットで2番目のスコアを達成し、さらに大きなHunyuanVideo-13Bモデルを上回ったことである。これは、トレーニング・データに人間のアクションが豊富に含まれていることと、合成シミュレーションに帰因している可能性がある。」
結果は、ビデオ・モデルが、オブジェクトの相互作用よりも、スポーツのような物理的活動に苦労していることを示した。これは、この分野でAI生成ビデオを改善するには、特にテニス、円盤投げ、野球、クリケットなどのスポーツの高品質の映像が必要であることを示唆している。
研究では、モデルの一貫した物理的妥当性と他のビデオの品質メトリクス(例:美しさ、モーションの滑らかさ)との間に関連性があるかどうかも調査した。発見は、関連性がないことを示した。つまり、モデルは、物理的コモンセンスを向上させるために、単に視覚的に魅力的または流暢なモーションを生成するだけでなく、物理的コモンセンスに対するより深い理解が必要であることを示した。
論文には豊富な定性的例が含まれているが、PDFに含まれる静的な例のほとんどは、著者がプロジェクト・サイトで提供する広範なビデオの例とは関係がない。したがって、静的な例の小さなサンプルと、実際のプロジェクトのビデオのいくつかを見てみよう。

上段は、Wan2.1によって生成されたビデオ。 (a) Ray2では、左側のジェットスキーが後ろに引っ張られる前に遅れます。 (b) Hunyuan-13Bでは、スラッジハンマーがスイング中で形を変え、破壊された木の板が予期せず現れます。 (c) Cosmos-7Bでは、やりが接地する前に砂を放出します。
上記の定性的テストについて、著者は次のように述べている。
「物理的コモンセンスの違反、例えばジェットスキーの逆方向への移動や、剛体スラッジハンマーの変形を観察する。これらは、弾性の原理に反する。Wanも物理的コモンセンスが不足していることを示しているが、記事の冒頭に埋め込まれたクリップで示されているように、岩が重力の法則に反して上り坂を転がり始める。」
「この場合、物理法則に違反する、岩が上り坂を転がり始めることを強調する。」
プロジェクト・サイトからの追加の例:
クリックして再生。 ここでは、キャプションは「濡れたタオルを激しく絞り、水が外側に放出される可視的なアーク」でしたが、結果として得られた水の源は、タオルよりも水道管のようである。
クリックして再生。ここでは、キャプションは「化学者がビーカーから試験管に透明な液体を慎重に注ぎ、こぼれを避ける」でしたが、ビーカーから出る水の量は、ジャグから出る量と一致していない。
このプロジェクトに関連する資料の量は、ここで網羅的にカバーすることはできない。したがって、著者の手順の詳細な概要と、より多くのテスト例および手順の詳細については、ソース論文、プロジェクトサイト、および先ほど述べた関連サイトを参照してください。
* アノテーションの出所について、論文では「これらのタスクのために取得された」とのみ記載されている。12人のAMTワーカーによって生成されたものであることは、多すぎるように思える。
2025年3月13日初版。












