AIモデルとプラットフォーム
安定したビデオ拡散モデル:潜在的なビデオ拡散モデルと生成ビデオモデルの紹介
生成AIは、AIコミュニティにおいて長い間重要な役割を果たしており、特に拡散モデルを使用した生成画像モデリングの分野における進歩は、生成ビデオモデルの進歩に大きく貢献しています。従来的には、生成ビデオモデルのトレーニングは、スクラッチから行うか、事前トレーニングされた画像モデルから部分的にまたは完全にファインチューニングするか、または画像とビデオの混合データセットで行います。
生成ビデオモデルの進歩をさらに進めるために、この記事では、安定したビデオ拡散モデルについて説明します。これは、潜在的なビデオ拡散モデルで、高解像度の画像からビデオ、テキストからビデオの生成が可能です。画像からビデオへの生成やテキストからビデオへの生成のための潜在的な拡散モデルを使用する方法について説明します。また、安定したビデオ拡散モデルのアーキテクチャと動作について詳しく説明し、そのパフォーマンスを評価し、現在のビデオ生成の最先端フレームワークと比較します。では、始めましょう。
安定したビデオ拡散モデルと生成ビデオモデルの紹介
生成AIは、AIとMLの研究者にとって重要な研究テーマとなっています。最近の研究により、生成画像モデルの効率とパフォーマンスが向上し、生成ビデオモデルの実用性と現実世界での応用が向上しました。しかし、生成ビデオモデルの能力を向上させるための研究は、主に時空間層の配置に焦点を当てており、データの選択の影響を調査することに注目があてられていません。
生成画像モデルの進歩により、研究者は、トレーニングデータの分布が生成モデルのパフォーマンスに大きな影響を与えることを観察しました。さらに、研究者は、事前トレーニングされた画像モデルの大規模で多様なデータセットを使用し、それを小規模で高品質のデータセットでファインチューニングすることで、パフォーマンスが大幅に向上することを発見しました。従来的には、生成ビデオモデルのトレーニングは、生成画像モデルの知識を活用して行われますが、データの選択とトレーニング戦略の影響はまだ研究されていません。安定したビデオ拡散モデルは、データの選択に重点を置いて、生成ビデオモデルの能力を向上させることを目指しています。

最近の生成ビデオモデルの多くは、拡散モデル、テキスト条件付け、または画像条件付けアプローチを使用して複数の一貫性のあるビデオフレームまたは画像を生成します。拡散モデルは、ノイズの付加と除去の反復プロセスを実装することで、ノイズの付加されたサンプルから正常な分布を学習する能力で知られています。安定したビデオ拡散モデルは、ビデオデータセットで潜在的なビデオ拡散モデルをトレーニングし、生成対抗ネットワーク(GAN)や自己回帰モデルを使用して、生成ビデオモデルの能力を向上させます。
安定したビデオ拡散モデルは、生成ビデオモデルの新しいアプローチを実現します。潜在的なビデオ拡散モデルの基準と固定されたアーキテクチャ、固定されたトレーニング戦略を使用し、データの選択の影響を評価します。安定したビデオ拡散モデルは、以下の貢献を生成ビデオモデリングの分野に提供します。
- 大規模な未整理ビデオサンプルのコレクションを、高品質のデータセットに変換するための体系的で効果的なデータキュレーションワークフローを提示します。
- 既存のフレームワークを上回る画像からビデオ、テキストからビデオの生成モデルをトレーニングします。
- モデルの3D理解と運動の強い先入観を調査するためのドメイン固有の実験を実施します。
安定したビデオ拡散モデルは、潜在的なビデオ拡散モデルの知識とデータキュレーションテクニックを基礎としています。
潜在的なビデオ拡散モデル
潜在的なビデオ拡散モデル(Video-LDM)は、主な生成モデルを潜在的な空間でトレーニングするアプローチを使用し、計算コストを削減します。多くのVideo-LDMは、事前トレーニングされたテキストから画像モデルと時空間混合層の追加を実装します。安定したビデオ拡散モデルは、テキストからビデオの生成データを直接条件付けし、結果は多視点シンセシスまたは画像からビデオの生成モデルに容易にファインチューニングできることを示しています。
データキュレーション
データキュレーションは、安定したビデオ拡散モデルだけでなく、生成モデルの重要なコンポーネントです。生成モデルのパフォーマンスを向上させるために、大規模で多様なデータセットで事前トレーニングすることが不可欠です。データキュレーションは、生成画像モデルの開発において成功を収めてきましたが、生成ビデオモデルの開発においてはあまり注目されていません。安定したビデオ拡散モデルは、3段階のトレーニング戦略を実装し、結果とパフォーマンスが向上します。
高品質ビデオシンセシスのためのデータキュレーション
安定したビデオ拡散モデルは、3段階のトレーニング戦略を実装します。ステージIは、2Dテキストから画像の拡散モデルを使用する画像事前トレーニングステージです。ステージIIは、ビデオ事前トレーニングステージで、大量のビデオデータでフレームワークをトレーニングします。最後に、ステージIIIは、ビデオのファインチューニングステージで、高品質のビデオの小さなサブセットでモデルを改良します。
しかし、安定したビデオ拡散モデルがこれらの3つのステージを実装する前に、データを処理して注釈付けることが重要です。ステージIIのビデオ事前トレーニングステージの基礎となり、最適な出力を確保する上で重要な役割を果たします。フレームワークは、3つの異なるフレームレート(FPS)でカスケードカット検出パイプラインを実装し、このパイプラインの必要性は以下の画像で示されています。

次に、安定したビデオ拡散モデルは、3つの異なる合成キャプション付け方法を使用してビデオクリップを注釈付けします。以下の表は、安定した拡散フレームワークで使用されるデータセットを、フィルタリングプロセス前と後で比較しています。

ステージI:画像事前トレーニング
安定したビデオ拡散モデルの最初のステージは画像事前トレーニングステージで、事前トレーニングされた画像拡散モデルであるStable Diffusion 2.1モデルを使用して、より強力な視覚的表現を実現します。

ステージII:ビデオ事前トレーニング
2番目のステージはビデオ事前トレーニングステージで、多様な画像生成モデルのデータキュレーションが結果と効率を向上させることを実証しています。しかし、生成ビデオモデルの場合、強力なオフザシェルフ表現が不足しているため、安定したビデオ拡散モデルは人間の好みを入力信号として使用して、適切なデータセットを作成します。以下の図は、カーソルされたデータセットでフレームワークを事前トレーニングすることによる正の効果を示しています。

具体的には、フレームワークは、潜在的なビデオ拡散モデルのサブセットをカーソル化し、LVDモデルをこれらのデータセットでトレーニングするランキングを考慮します。さらに、安定したビデオ拡散フレームワークは、カーソルされたデータセットでフレームワークをトレーニングすることで、フレームワークと拡散モデルのパフォーマンスが向上することを発見しました。データキュレーション戦略は、より大規模で関連性の高い実用的なデータセットでも機能します。以下の図は、カーソルされたデータセットでフレームワークを事前トレーニングすることによる正の効果を示しています。

ステージIII:高品質ファインチューニング
ステージIIまで、安定したビデオ拡散フレームワークはビデオ事前トレーニング前のパフォーマンスの向上に重点を置いています。3番目のステージでは、フレームワークは高品質ビデオファインチューニング後のパフォーマンスの最適化に重点を置いています。ステージIIIでは、フレームワークは潜在的な画像拡散モデルのトレーニングテクニックを使用し、トレーニング例の解像度を増やします。このアプローチの有効性を分析するために、フレームワークは、初期化の違いのみで異なる3つの同一モデルと比較します。最初の同一モデルは、重みを初期化し、ビデオトレーニングプロセスをスキップしますが、残りの2つの同一モデルは、他の潜在的なビデオモデルの重みから初期化されます。
結果と発見
安定したビデオ拡散フレームワークのパフォーマンスを現実世界のタスクで評価し、現在の最先端フレームワークと比較してみましょう。安定したビデオ拡散フレームワークは、最適なデータアプローチを使用してベースモデルをトレーニングし、ファインチューニングを実行して、各タスクを実行するための最先端モデルを生成します。

上の画像は、フレームワークによって生成された高解像度の画像からビデオのサンプルを表しています。以下の図は、フレームワークが高品質のテキストからビデオのサンプルを生成する能力を示しています。

事前トレーニング済みベースモデル
以前述べたように、安定したビデオ拡散モデルはStable Diffusion 2.1フレームワークを基礎としています。最近の研究によると、画像拡散モデルのトレーニングでは、ノイズスケジュールを採用し、ノイズを増やすことで、より高い解像度の画像が得られることがわかりました。安定したビデオ拡散モデルのベースモデルは、強力な運動表現を学習し、ゼロショット設定でのテキストからビデオの生成でベースラインモデルを上回ります。結果は以下の表に示されています。

フレーム補間と多視点生成
安定したビデオ拡散フレームワークは、画像からビデオのモデルを多視点データセットでファインチューニングして、オブジェクトの新しい視点を生成します。このモデルは、Stable Video Diffusion-Multi View(SVD-MV)モデルと呼ばれます。元のSVDモデルは、2つのデータセットでファインチューニングされ、入力として単一の画像を受け取り、出力として多視点画像のシーケンスを生成します。
以下の画像からもわかるように、安定したビデオ拡散マルチビューモデルは、Scratch Multi Viewフレームワークと同等のパフォーマンスを発揮し、SVD-MVモデルは元のSVDフレームワークの知識を活用して多視点画像生成に優れていることを示しています。さらに、結果は、モデルを比較的少ないイテレーションで実行することで、最適な結果が得られることも示しています。


上の図では、左側にメトリックが示されています。安定したビデオ拡散マルチビューモデルは、Scratch-MVとSD2.1マルチビューモデルを大幅に上回っています。2番目の画像は、トレーニングイテレーションの数がフレームワークのパフォーマンスに与える影響を示しています。SVD-MVフレームワークは、Clipスコアで安定した結果を示しています。
最終的な考え
この記事では、安定したビデオ拡散モデルについて説明しました。これは、潜在的なビデオ拡散モデルで、高解像度の画像からビデオ、テキストからビデオの生成が可能です。安定したビデオ拡散モデルは、潜在的なビデオ拡散モデルの基準と固定されたアーキテクチャ、固定されたトレーニング戦略を使用し、データの選択の影響を評価します。
画像からビデオへの生成やテキストからビデオへの生成のための潜在的な拡散モデルを使用する方法について説明しました。また、安定したビデオ拡散モデルのアーキテクチャと動作について詳しく説明し、そのパフォーマンスを評価し、現在のビデオ生成の最先端フレームワークと比較しました。安定したビデオ拡散フレームワークは、3つの異なるビデオモデルのトレーニングステージを分析して、フレームワークのパフォーマンスへの影響を評価します。フレームワークは、最適なビデオシンセシスに適したビデオ表現を出力し、結果は既存のビデオ生成モデルのパフォーマンスと同等です。
さらに、安定したビデオ拡散フレームワークは、ビデオデータのスケーリング研究を実施し、体系的なデータ収集方法を使用して、大量のビデオデータを収集し、ノイズの多いビデオを生成ビデオモデルの入力データに変換します。安定したビデオ拡散フレームワークは、3つの異なるビデオモデルのトレーニングステージを分析して、フレームワークのパフォーマンスへの影響を評価します。フレームワークは、最適なビデオシンセシスに適したビデオ表現を出力し、結果は既存のビデオ生成モデルのパフォーマンスと同等です。












