Andersonの視点

AIビデオが完璧な猫のセルフィーを作成する

mm
Unite.AI を Google の優先ソースに追加
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

AIビデオジェネレーターは、テキストプロンプトの要件を満たすことができないことが多い。しかし、新しいハイレベルな修正が全ての違いをもたらす。

 

生成的なビデオシステムは、非常に創造的またはワイルドなビデオを作成することが難しいことが多く、ユーザーのテキストプロンプトの期待を満たすことができない。

その理由の1つは、エンタングルメント ──ビジョン/言語モデルがソースデータを学習する時間を妥協しなければならないという事実──である。学習時間が短すぎると、概念は柔軟だが完全に形成されていない。学習時間が長すぎると、概念は正確だが柔軟性がなくなり、独自の組み合わせに組み込むことができない。

以下のビデオでその考えを得ることができる。左側は、多くのAIシステムが要求的なプロンプトに応えて出す、ある種の妥協案である。プロンプトはビデオの上部に表示されている。右側は、プロンプトに従って生成されたAIの出力である:

クリックして再生 (オーディオなし)。右側では、’ファクタライズド’ WAN 2.2がプロンプトに従って生成されていることがわかる。一方、左側の’バニラ’ Wan 2.2は、プロンプトに従っていない。プロジェクトサイトでは、より高解像度と多くの例が見られる。ソース

右側の例は、左側の例よりもプロンプトに従って生成されていることがわかる。

興味深いことに、両方のアーキテクチャは本質的に同じである──人気のあるWan 2.2アーキテクチャである。中国でリリースされたこのアーキテクチャは、オープンソースとホビーストのコミュニティで注目を集めている。

違いは、2番目の生成パイプラインがファクタライズドされていることである。ここでは、大規模な言語モデル(LLM)を使用して、ビデオの最初のフレームを再解釈し、システムがユーザーの要求を満たすことができるようにしている。

この’ビジュアルアンカー’には、LLM強化プロンプトから作成されたイメージを生成パイプラインに注入することが含まれる。さらに、LoRA解釈モデルを使用して、’イントラーダー’フレームをビデオ作成プロセスに統合する。

結果は、プロンプトの忠実性という点でかなり驚くべきものである。特に、優雅な解決策である:

クリックして再生 (オーディオなし)。さらに、’ファクタライズド’ビデオ生成の例が見られる。プロジェクトサイトでは、より高解像度と多くの例が見られる。

この解決策は、新しい論文 ファクタライズドビデオ生成:テキストツービデオ拡散モデルにおけるシーン構成と時間合成の分離の形で来ている。さらに、プロジェクトサイトもある。

多くの現在のシステムは、言語モデルを使用して、漠然としたまたは未指定のテキストプロンプトを書き直すことで、プロンプトの精度を高めることを試みている。しかし、新しい研究は、この戦略は、モデルの内部シーン表現が欠陥がある場合には、依然として失敗することを主張している。

詳細な書き直されたプロンプトを持っていても、テキストツービデオモデルは、重要な要素を誤って構成したり、生成された初期状態がアニメーションの論理を破壊したりすることが多い。初期フレームがプロンプトの説明を反映していない限り、生成されたビデオは回復できない。

論文は以下のように述べている*:

‘[テキストツービデオ]モデルは頻繁に分布的にシフトされたフレームを生成するが、依然として[I2Vモデルと比較して]評価スコアが高い。つまり、モーションモデリングはシーンの忠実性が相対的に低い場合でも、依然として自然である。 ‘

‘[イメージツービデオ]モデルは、強い[評価スコア]を示すが、時間的な連続性が弱い。一方、I2V+テキストは両方の側面をバランス良く持っている。 ‘

‘これは、現在のT2Vモデルに構造的なミスマッチがあることを示唆している。シーンのグラウンド化と時間合成は、異なる帰納的バイアスを必要とするが、既存のアーキテクチャは両方を同時に学習しようとしている。 ‘

生成モードの診断比較では、モデルはシーンの配置を妥協することが多く、イメージ条件付きアプローチは反対のパターンを示した:

2つのデータセットにおけるビデオ生成モードの比較。I2V+テキストが最も高いフレーム品質(FID)と時間的連続性(FVD)を達成している。シーン構成とモーションの分離の利点が強調されている。ソース - https://arxiv.org/pdf/2512.16371

2つのデータセットにおけるビデオ生成モードの比較。I2V+テキストが最も高いフレーム品質(FID)と時間的連続性(FVD)を達成している。シーン構成とモーションの分離の利点が強調されている。 ソース

これらの発見は、現在のモデルがシーンのレイアウトとアニメーションを同時に学習しようとしている構造的な欠陥を示唆している。両方のタスクは、異なる種類の帰納的バイアスを必要とするが、別々に扱われるべきである。

おそらく最も興味深いのは、この’トリック’が、Wan 2.1や2.2などのモデル、またはHunyuan Videoなどのビデオ拡散モデルなどのローカルインストールに適用できる可能性があることである。アネクドートによると、KlingやRunwayなどの商用ジェネレーティブポータルと比較して、ほとんどのメジャープロバイダーは、オープンソースオファリングを改善しているようである。したがって、このアプローチは、FOSSコンテントのキャッチアップを表す可能性がある。

この方法のテストでは、シンプルでモジュラーなアプローチが、新しい状態を達成し、すべてのテストされたモデルで大幅な改善をもたらしたことが示された。著者は、結論として、システムは忠実性を大幅に改善したが、アイデンティティドリフトを解決することを目的としていないと述べている。

新しい論文は、スイスのエコールポリテクニークフェデラールドゥロザンヌ(EPFL)の4人の研究者によって書かれた。

方法とデータ

新しい技術の中心的な提案は、テキストツービデオ(T2V)拡散モデルが、開始フレームに’アンカー’される必要があるということである。

モデルが開始フレームを尊重するようにするために、新しい方法は、標準の拡散プロセスを、クリーン潜在的なをアンカーイメージから0時ステップで注入することで妨害する。通常のノイズ入力を置き換える。最初はモデルを混乱させるが、LoRAのファインチューニングにより、注入されたフレームを固定の視覚的アンカーとして扱うことを学習する:

ビジュアルアンカーを使用したテキストツービデオ生成の2ステージ方法:左、モデルは軽量LoRAを使用して、注入されたクリーン潜在的なを固定シーン制約として扱う。右、プロンプトは最初のフレームのキャプションに分割され、ビデオを導くアンカーイメージを生成するために使用される。

ビジュアルアンカーを使用したテキストツービデオ生成の2ステージ方法:左、モデルは軽量LoRAを使用して、注入されたクリーン潜在的なを固定シーン制約として扱う。右、プロンプトは最初のフレームのキャプションに分割され、ビデオを導くアンカーイメージを生成するために使用される。

推論時、方法はプロンプトを、最初のフレームのみを記述するように書き直す。LLMを使用して、レイアウトと外観に焦点を当てた妥当な初期シーン状態を抽出する:

書き直されたプロンプトは、候補のアンカーフレームを生成するためにイメージジェネレーターに渡される。選択されたフレームは潜在的なにエンコードされ、拡散プロセスに注入される。最初のタイムステップを置き換えることで、モデルは、初期シーンにアンカーのまま、ビデオの残りの部分を生成できる:

プロセスは、LoRAsを作成することによってテストされた。Wan2.2-14B、Wan2.1-1B、CogVideo1.5-5BのLoRAトレーニングは、ランク256で、UltraVideoコレクションからランダムにサンプリングされた5000クリップで行われた。トレーニングは6000ステップで、Wan-1BとCogVideo-5Bの場合、48GPU時間、Wan-14Bの場合、96GPU時間が必要だった。著者は、Wan-5Bがテキストのみとテキストイメージ条件付きをネイティブにサポートしているため、ファインチューニングが必要なかったと述べている。

テスト

実験では、各テキストプロンプトは、Qwen2.5-7B-Instructを使用して、詳細な’シードイメージ’キャプションを生成するために、最初に改良された。このキャプションは、QwenImageに渡され、’マジックフレーム’を生成するために使用された:

システムを評価するために使用されたベンチマークには、T2V-CompBenchが含まれており、モデルがオブジェクト、属性、行動を、シーンの中でどのように保存するかをスコアすることで、構成理解をテストする。さらに、VBench 2.0が、18のメトリックにわたる、創造性コモンスーンズ推論制御性人間の忠実性物理を評価する:

T2V-CompBenchの7つの評価カテゴリ全てにおいて、ファクタライズドT2V方法は、標準のT2VベースラインとアップサンプルT2Vベースラインを上回り、最大53.25%の改善を達成した。最高スコアのバリアントは、プロプライエタリのPixVerse-V3ベンチマークを頻繁に上回った。

T2V-CompBenchの7つの評価カテゴリ全てにおいて、ファクタライズドT2V方法は、標準のT2VベースラインとアップサンプルT2Vベースラインを上回り、最大53.25%の改善を達成した。最高スコアのバリアントは、プロプライエタリのPixVerse-V3ベンチマークを頻繁に上回った。

著者は以下のように述べている*:

‘全てのモデルにおいて、アンカーイメージを追加することで、構成パフォーマンスが一貫して改善される。全ての小さいファクタライズドモデル(CogVideo 5B、Wan 5B、Wan 1B)は、大きなWan 14B T2Vモデルを上回る。 ‘

私たちのファクタライズドWan 5Bは、ベンチマークで最高のモデルであるプロプライエタリのPixVerse-V3ベースラインを上回った。これは、視覚的グラウンド化が、容量の小さいモデルでもシーンと行動の理解を大幅に改善できることを示唆している。 ‘

‘各モデルのファミリー内では、ファクタライズドバージョンがオリジナルのモデルを上回る。特に、WAN 14Bの軽量アンカー付きLoRAは、事前トレーニング済みのI2V 14Bバリアント(0.661 vs. 0.666)と同等のパフォーマンスを達成する。ただし、完全な再トレーニングは必要なかった。 ‘

次にVBench2.0のラウンドが続いた:

ファクタライズドT2Vアプローチが、構成、コモンスーンズ推論、制御性、物理学のVBench 2.0パフォーマンスを一貫して改善した。人間の忠実性はプロプライエタリのVeo 3ベースライン以下のままだった。

ファクタライズドT2Vアプローチが、構成、コモンスーンズ推論、制御性、物理学のVBench 2.0パフォーマンスを一貫して改善した。人間の忠実性はプロプライエタリのVeo 3ベースライン以下のままだった。

アーキテクチャ全体で、ファクタライズドアプローチは、人間の忠実性を除くすべてのVBenchカテゴリでスコアを改善した。WAN 5Bは、より大きなWAN 14Bを上回った。これは、視覚的グラウンド化がスケールよりも重要であることを示唆している。

VBenchでの改善は一貫していたが、T2V-CompBenchでの改善よりも小さく、著者はこれをVBenchのより厳格な二値スコアリング方式に帰した。

質的テストの場合、論文は静的なイメージを提供しているが、より明確な理解のために、この記事に埋め込まれたコンポジットビデオを参照することをお勧めする。ただし、ソースビデオはより多く、より多様で、高解像度である。質的結果について、論文は以下のように述べている:

‘アンカー付きビデオは、一貫してより正確なシーン構成、より強いオブジェクト属性バインディング、より明確な時間的進化を示す。 ‘

ファクタライズド方法は、拡散ステップ数を50から15に減らしても、T2V-CompBenchでのパフォーマンスにほとんど影響しなかった。対照的に、テキストのみとアップサンプルベースラインは、同じ条件下で大きく劣化した。

ステップ数を減らすと理論的に3倍の速度になるが、フル生成パイプラインは、アンカーイメージ生成からの固定コストにより、実際には2.1倍の速度しか上がらなかった。結果は、アンカー付けが、サンプルの品質を改善するだけでなく、拡散プロセスを安定させ、精度の低下なしに、より迅速で効率的な生成を可能にすることを示唆している。

プロジェクトサイトでは、アップサンプルと新しい方法の生成の例が見られる。ここでは、いくつかの編集された例を示す:

クリックして再生 (オーディオなし)。アップサンプルソースと著者のファクタライズドアプローチの比較。

著者は以下のように結論付けている:

‘私たちの結果は、グラウンド化の改善が、容量の増加と同等に重要であることを示唆している。最近のT2V拡散の進歩は、モデルサイズとトレーニングデータの増加に大きく依存しているが、依然として、大きなモデルでも、テキストのみから一貫した初期シーンを推論することが難しい。 ‘

‘これは、イメージ拡散と異なり、スケーリングが比較的容易であることとは対照的である。ビデオモデルでは、各アーキテクチャの改善は、時間的な次元を超えて機能しなければならないため、スケーリングは、リソースの面で大幅に多くのコストがかかる。 ‘

‘私たちの発見は、グラウンド化の改善が、ボトルネックを解決することで、スケールを補完できることを示唆している。シーン構成とモーション合成をファクタライズすることで、共通の失敗モードを軽減できる。 ‘

‘これは、将来のアーキテクチャの設計を導く、補足的な設計原則であると見なす。 ‘

結論

エンタングルメントの問題は非常に現実的であり、専用の解決策(例:改善されたキュレーションとトレーニング前の評価)を必要とするかもしれないが、このファクタライズドアプローチが、多くの固執した概念プロンプトを、より正確なレンダリングに変えるのを見ているのは、目覚ましいことである。

ローカルホビースト推論と商用ソリューションの間のリソースの差は、予想よりも小さく、ほとんどのプロバイダーが、消費者への大きなGPUリソースの出力を合理化しようとしているからである。

アネクドートによると、現在の多くのジェネレーティブビデオプロバイダーは、中国のオープンソースモデル(例:Wan 2.2)のブランド化されたバージョンを使用しているようである。中間ソリューションの主な’モート’は、LoRAsをトレーニングしたか、またはモデルウェイトを完全にファインチューンしたことである(後者はより高価で、多少の報酬がある)。

このような洞察は、中国がジェネレーティブAIを民主化しようとしている(必ずしも利他的な理由で)一方、西側のビジネス利益は、モデルサイズの増加と規制の増加によって、良いモデルをAPIと複数のコンテンツフィルタの後ろに隠すことを好む、という文脈で、ギャップをさらに縮めるのに役立つかもしれない。

 

* 著者の強調、僕のものではない。

論文では、使用されたGPUまたは使用数について指定されていない。

†† LoRAルートは、経済的な使用の容易さと、完全な重みではなく量子化された重みが常に利用可能ではないため、より可能性が高い。

2025年12月19日初めて公開。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]