AIモデルとプラットフォーム
DynamiCrafter:動画生成のためのオープンドメイン画像アニメーション
コンピュータビジョンは、現在のAIコミュニティの中で最も興奮するべきで、研究が進んでいる分野の一つです。コンピュータビジョンモデルが急速に進化しているにもかかわらず、開発者を悩ませている古典的な課題の一つは、画像アニメーションです。現在でも、画像アニメーションフレームワークは、自然なダイナミクスを保ちながら、画像の元の外観を保つことができる静止画像を動画に変換するのに苦労しています。従来の画像アニメーションフレームワークは、自然なシーンを特定のドメイン固有の動きや、確率的なダイナミクスでアニメーション化することに重点を置いています。ただし、このアプローチはある程度機能しますが、画像アニメーションフレームワークの適用範囲をより一般的な視覚コンテンツに制限します。
さらに、従来の画像アニメーションアプローチは、振動や確率的な動きの合成、または特定のオブジェクトカテゴリへのカスタマイズに重点を置いています。ただし、このアプローチには、画像アニメーションの限界を特に一般的なシナリオで制限する強い仮定が課せられています。過去数年間で、T2Vまたはテキストからビデオモデルは、テキストプロンプトを使用して鮮明で多様なビデオを生成することに驚異的な成功を収めてきました。このT2Vモデルの実証は、DynamiCrafterフレームワークの基礎となります。
DynamiCrafterフレームワークは、画像アニメーションモデルの現在の限界を克服し、オープンワールド画像を含む一般的なシナリオへの適用範囲を拡大する試みです。DynamiCrafterフレームワークは、オープンドメイン画像のダイナミックコンテンツを合成し、それらをアニメーション化されたビデオに変換することを試みます。DynamiCrafterの背後にある重要なアイデアは、画像を生成プロセスに導入し、既存のテキストからビデオの拡散モデルを利用することです。特定の画像に対して、DynamiCrafterモデルは、画像をテキストと整列した豊富なコンテキスト表現空間に投影するクエリトランスフォーマーを実装し、ビデオモデルが画像コンテンツを互換性のある方法で消化できるようにします。ただし、DynamiCrafterモデルは、生成されたビデオで一部の視覚的な詳細を保つのに苦労しています。これは、DynamiCrafterモデルが、画像を初期ノイズと結合して拡散モデルに供給することで克服され、モデルにより正確な画像情報を提供します。
この記事では、DynamiCrafterフレームワークを深く掘り下げ、メカニズム、方法論、フレームワークのアーキテクチャ、および最先端の画像およびビデオ生成フレームワークとの比較について説明します。では、始めましょう。
DynamiCrafter:オープンドメイン画像アニメーション
静止画像をアニメーション化すると、視聴者に魅力的でダイナミックな視覚体験を提供できます。多くのフレームワークが、静止画像をアニメーション化するさまざまな方法を探索してきました。初期のアニメーションフレームワークは、特定のオブジェクトの動きをシミュレートする物理シミュレーションベースのアプローチを実装しました。ただし、これらのアプローチは、各オブジェクトカテゴリを個別にモデル化するため、効果的でも一般的でもありませんでした。よりリアルな動きを複製するために、参照ベースの方法が登場しました。動きや外観の情報を、シグナルやビデオなどの参照からシンセシスプロセスに転送します。参照ベースのアプローチは、シミュレーションベースのアプローチと比較して、より良い結果をもたらしましたが、追加のガイダンスが必要で、実用的な応用が制限されました。
最近、多くのアニメーションフレームワークは、自然なシーンを特定のドメイン固有の動きや、確率的なダイナミクスでアニメーション化することに重点を置いています。ただし、これらのフレームワークが生成する結果は、満足のいくものではなく、改善の余地があります。テキストからビデオの生成モデルが過去数年で示した驚異的な結果は、DynamiCrafterフレームワークの開発者を、画像アニメーションにテキストからビデオモデルの強力な生成能力を活用するよう奮起させました。
DynamiCrafterフレームワークの重要な基盤は、テキストからビデオの拡散モデルのビデオ生成プロセスを制御する条件付き画像を組み込むことです。ただし、画像アニメーションはまだ非自明です。画像アニメーションには、詳細を保つだけでなく、ダイナミクスを作成するために必要な視覚的なコンテキストを理解することも必要です。テキストからビデオの拡散モデルを使用してビデオを生成する、ビデオコンポーザーなどのマルチモーダル制御可能なビデオ拡散モデルは、画像からの視覚的なガイダンスを使用してビデオを生成することを可能にします。ただし、これらのアプローチは、画像アニメーションには適していません。画像への適合性が低いか、または画像への適合性が低いこと、または画像への適合性が低いことなど、画像への適合性が低いことが原因で、突然の時間的変化が発生する可能性があります。DynamiCrafterフレームワークは、視覚的な詳細ガイダンスとテキストと整列したコンテキスト表現の2つのストリームからなるデュアルストリームインジェクションアプローチを提案します。デュアルストリームインジェクションアプローチにより、DynamiCrafterフレームワークは、ビデオ拡散モデルが、互補的な方法で詳細を保ったダイナミックコンテンツを合成できることを保証します。

特定の画像に対して、DynamiCrafterフレームワークは、画像をテキストと整列したコンテキスト表現空間に投影するために、特別に設計されたコンテキスト学習ネットワークを使用します。具体的には、コンテキスト表現空間には、拡散モデルへの適応を促進するために、学習可能なクエリトランスフォーマーと、テキストと整列した画像特徴を抽出するために事前トレーニングされたCLIP画像エンコーダーが含まれます。モデルは、クロスアテンションレイヤーを使用して、豊富なコンテキスト特徴を使用し、テキスト特徴とクロスアテンションレイヤーをゲート化フュージョンを使用して組み合わせます。ただし、このアプローチでは、学習されたコンテキスト表現を、テキストと整列した視覚的な詳細と交換します。これにより、画像コンテキストの意味的な理解が可能になり、合理的で鮮明なダイナミクスが合成されます。さらに、DynamiCrafterフレームワークは、拡散モデルに初期ノイズと画像を結合して、追加の視覚的な詳細を提供します。結果として、DynamiCrafterフレームワークのデュアルインジェクションアプローチは、入力画像への視覚的な適合性と、信頼性の高いダイナミックコンテンツを保証します。
拡散モデルまたはDMは、テキストから画像の生成で驚異的なパフォーマンスと生成能力を示してきました。テキストから画像の生成の成功をビデオ生成に複製するために、ビデオ拡散モデルまたはVDMが提案され、ピクセル空間で低解像度ビデオをモデル化するための空間時間分割U-Netアーキテクチャを使用します。テキストから画像のフレームワークの知識をテキストからビデオのフレームワークに転移することで、トレーニングコストを削減できます。ビデオ拡散モデルは、高品質のビデオを生成できますが、テキストプロンプトのみをセマンティックガイダンスとして受け付けるため、ユーザーの真の意図を反映しない場合があります。さらに、ビデオ拡散モデルの結果は、入力画像に従わないことが多く、非リアルな時間的変化の問題に悩まされています。DynamiCrafterアプローチは、テキスト条件付きビデオ拡散モデルを使用し、画像アニメーション化のためにその豊富なダイナミックプライヤーを利用します。入力画像への適合性とセマンティック理解を改善するためのカスタマイズされた設計を使用します。
DynamiCrafter:方法とアーキテクチャ
特定の静止画像に対して、DynamiCrafterフレームワークは、画像からビデオ、つまり短いビデオクリップを生成することを試みます。ビデオクリップは、画像の視覚的なコンテンツを継承し、自然なダイナミクスを示します。ただし、画像が結果のフレームシーケンスの任意の場所に表示される可能性があります。画像が任意の場所に表示されることは、画像条件付きビデオ生成タスクで、高い視覚的な適合性の要件がある特殊な課題です。DynamiCrafterフレームワークは、事前トレーニングされたビデオ拡散モデルの生成プライヤーを使用して、この課題を克服します。
ビデオ拡散プライヤーからの画像ダイナミクス
通常、オープンドメインテキストからビデオの拡散モデルは、テキスト記述に基づいてダイナミックな視覚的なコンテンツを表示します。静止画像をテキストからビデオの生成プライヤーでアニメーション化するには、フレームワークは、ビデオ生成プロセスに視覚的な情報を包括的に導入する必要があります。さらに、ダイナミックなシンセシスに対して、T2Vモデルは画像をコンテキストの理解のために消化し、生成されたビデオで視覚的な詳細を保つ必要があります。

テキストと整列したコンテキスト表現
画像コンテキストでビデオ生成をガイドするために、DynamiCrafterフレームワークは、画像を、ビデオモデルが画像情報を互換性のある方法で使用できる、整列した埋め込み空間に投影することを試みます。次に、DynamiCrafterフレームワークは、画像エンコーダーを使用して、入力画像から画像特徴を抽出します。画像特徴は、事前トレーニングされたCLIP画像エンコーダーを使用して抽出されます。CLIP画像エンコーダーは、画像キャプションと整列したグローバルセマンティックトークンを生成しますが、主に視覚的なコンテンツをセマンティックレベルで表します。DynamiCrafterフレームワークは、CLIPエンコーダーの最後の層からの完全な視覚的なトークンを使用して、画像の完全な情報を抽出します。これらの視覚的なトークンは、条件付き画像生成タスクで高い忠実度を示します。さらに、DynamiCrafterフレームワークは、コンテキストとテキストの埋め込みを使用して、U-Netの中間特徴と双方向のクロスアテンションレイヤーを使用して相互作用します。このコンポーネントの設計により、モデルは層依存的な方法で画像条件を吸収できるようになります。
視覚的な詳細ガイダンス
DynamiCrafterフレームワークは、ビデオ拡散モデルが入力画像に似たビデオを生成できる、情報豊富なコンテキスト表現を使用します。ただし、次の画像に示すように、生成されたコンテンツは、事前トレーニングされたCLIPエンコーダーが入力情報を完全に保つ能力が限られているため、若干の不一致を示す可能性があります。

視覚的な適合性を高めるために、DynamiCrafterフレームワークは、入力画像から抽出された追加の視覚的な詳細をビデオ拡散モデルに提供することを提案します。DynamiCrafterモデルは、条件付き画像をフレームごとの初期ノイズと結合して、ノイズ除去U-Netコンポーネントにガイダンスとして供給します。
トレーニングパラダイム
DynamiCrafterフレームワークは、画像を2つの補足的なストリームを通じて統合します。詳細ガイダンスとコンテキストコントロールの両方で重要な役割を果たします。DynamiCrafterモデルは、3段階のトレーニングプロセスを使用します
- 最初のステップでは、画像コンテキスト表現ネットワークをトレーニングします。
- 2番目のステップでは、画像コンテキスト表現ネットワークをテキストからビデオモデルに適応させます。
- 3番目、最後のステップでは、画像コンテキスト表現ネットワークと視覚的な詳細ガイダンスコンポーネントを共同でファインチューニングします。
テキストからビデオモデルとの適合性を確保するために、DynamiCrafterフレームワークは、画像からテキストと整列した視覚的な詳細を抽出するコンテキスト表現ネットワークPを開発することを提案します。Pが収束するために多くの最適化ステップが必要であることを認識して、DynamiCrafterフレームワークは、Pをテキストから画像モデルを使用して事前にトレーニングすることを提案します。この戦略により、コンテキスト表現ネットワークは、テキストからビデオモデルとの共同トレーニングを開始する前に、画像コンテキストについて学習することに集中できます。DynamiCrafterフレームワークは、入力画像をフレームごとのノイズと結合して、Pとビデオ生成モデルの空間層をファインチューニングします。この方法は、既存のテキストからビデオモデルの時間的洞察を保持し、画像の密な結合によるパフォーマンスの低下や、主な目標からの逸脱を回避するために選択されます。さらに、DynamiCrafterフレームワークは、ビデオフレームをランダムに選択して、画像条件を達成する2つの目的を達成する戦略を使用します。(i) ネットワークが特定のフレームの位置に画像を直接関連付ける予測可能なパターンを開発しないこと、(ii) 特定のフレームに対して過度に厳格な情報を提供しないことで、より適応性の高いコンテキスト表現を促進します。
DynamiCrafter:実験と結果
DynamiCrafterフレームワークは、最初に、Stable Diffusionでコンテキスト表現ネットワークと画像クロスアテンションレイヤーをトレーニングします。次に、Stable DiffusionコンポーネントをVideoCrafterに置き換え、画像の結合とともに、コンテキスト表現ネットワークと空間層を適応させるためにファインチューニングします。推論では、DynamiCrafterフレームワークは、DDIMサンプラーとマルチ条件クラスフリーガイダンスを使用します。さらに、生成されたビデオの時間的的一貫性と品質を、テンポラルと空間の両方のドメインで評価するために、DynamiCrafterフレームワークは、FVDまたはフレチェビデオ距離、KVDまたはカーネルビデオ距離を報告します。MSR-VTTとUCF-101ベンチマークのゼロショットパフォーマンスを評価します。生成された結果と入力画像の間の視覚的な適合性を調査するために、DynamiCrafterフレームワークは、PICまたはパーセプトゥアル入力適合性を導入し、パーセプトゥアル距離メトリクスDreamSimを距離の関数として使用します。
次の図は、さまざまなスタイルとコンテンツのアニメーション化されたコンテンツの視覚的な比較を示しています。

DynamiCrafterフレームワークは、入力画像条件に従って、時間的一貫性のあるビデオを生成します。次の表には、49人の参加者によるユーザー研究の統計が含まれており、時間的一貫性、動きの品質、視覚的な適合性に関する好み率が示されています。DynamiCrafterフレームワークは、既存の方法を大幅に上回っています。

次の図は、デュアルストリームインジェクション方法とトレーニングパラダイムを使用した結果を示しています。

最終的な考え
この記事では、画像アニメーションモデルの現在の限界を克服し、オープンワールド画像を含む一般的なシナリオへの適用範囲を拡大する試みである、DynamiCrafterについて説明しました。DynamiCrafterフレームワークは、オープンドメイン画像のダイナミックコンテンツを合成し、それらをアニメーション化されたビデオに変換することを試みます。DynamiCrafterの背後にある重要なアイデアは、画像を生成プロセスに導入し、既存のテキストからビデオの拡散モデルを利用することです。特定の画像に対して、DynamiCrafterモデルは、画像をテキストと整列した豊富なコンテキスト表現空間に投影するクエリトランスフォーマーを実装し、ビデオモデルが画像コンテンツを互換性のある方法で消化できるようにします。ただし、DynamiCrafterモデルは、生成されたビデオで一部の視覚的な詳細を保つのに苦労しています。これは、DynamiCrafterモデルが、画像を初期ノイズと結合して拡散モデルに供給することで克服され、モデルにより正確な画像情報を提供します。












