AIモデルとプラットフォーム
CameraCtrl:T2V生成のためのカメラ制御を可能にする
最近のテキストからビデオまたはT2V生成を試みるフレームワークは、安定性を加えるために拡散モデルを利用しており、ビデオ拡散モデルは、2D画像拡散アーキテクチャをビデオデータに拡張し、ビデオと画像の両方からスクラッチで学習することを目指しています。Stable Diffusionなどの強力な事前学習済み画像ジェネレーターを構築し、2D層間に時間層を追加して、新しいモデルを未見の大規模データセットでファインチューニングすることが最近の研究です。にもかかわらず、テキストからビデオの拡散モデルは、テキストの説明のみを使用してビデオサンプルを生成することによる曖昧さの課題に直面しています。これにより、テキストからビデオのモデルは生成に対する制御が弱くなります。この限界を克服するために、一部のモデルは強化されたガイダンスを提供し、一部のモデルはシーンまたは人間の動きを精密に制御するために正確な信号を使用します。他方では、画像をビデオジェネレーターの制御信号として使用するテキストからビデオのフレームワークがあり、正確な時間関係のモデリングまたは高品質のビデオが得られます。
画像やビデオの生成タスクでは、制御可能性が重要な役割を果たします。制御可能性により、ユーザーは希望するコンテンツを作成できます。ただし、既存のフレームワークは、シネマティック言語としてのカメラの姿勢の精密な制御をしばしば見落としています。カメラの姿勢の制御は、物語のニュアンスをモデルに伝えるために重要です。この制御可能性の限界を克服するために、この記事では、テキストからビデオのモデルに対して正確なカメラの姿勢制御を可能にする新しいアイデア、CameraCtrlについて説明します。CameraCtrlモデルは、カメラの軌跡を正確にパラメータ化し、テキストからビデオのモデルにプラグアンドプレイのカメラモジュールをトレーニングし、他のコンポーネントは変更せずに残します。また、CameraCtrlモデルは、さまざまなデータセットの影響を調査し、元のベースモデルと似た外観で、多様なカメラ分布を持つビデオは、モデルの制御可能性と汎化能力を高めることができることを示しています。実験結果は、CameraCtrlフレームワークが、実際のタスクで正確でドメイン適応的なカメラ制御を実現するための効率性を示しています。
この記事は、CameraCtrlフレームワークを深く掘り下げ、メカニズム、方法、フレームワークのアーキテクチャ、最先端のフレームワークとの比較を探ります。では、始めましょう。
CameraCtrl:T2V生成のためのカメラ制御
最近の拡散モデルの開発と進歩は、テキスト指示のビデオ生成を大幅に進歩させ、コンテンツ設計のワークフローを革命させました。実用的ビデオ生成アプリケーションでは、制御可能性が重要な役割を果たします。制御可能性により、ユーザーは生成された結果をニーズと要件に合わせてカスタマイズできます。高い制御可能性を持つモデルは、生成されたビデオのリアリズム、品質、利便性を高めることができます。テキストと画像の入力は、制御可能性を高めるために一般的に使用されますが、動きやコンテンツに対する制御が不十分です。この限界を克服するために、一部のフレームワークは、姿勢スケルトン、光流、他のマルチモーダル信号などの制御信号を使用してビデオ生成をガイドすることを提案しています。また、既存のフレームワークは、カメラのポイントを刺激したり調整したりするための精密な制御が欠けているという限界もあります。カメラの制御は、生成されたビデオのリアリズムを高めるだけでなく、カスタマイズされた視点を許可することでユーザー参加を高め、ゲーム開発、拡張現実、仮想現実では不可欠な機能です。また、カメラの動きを熟練して管理することで、クリエイターはキャラクター関係を強調し、感情を強調し、ターゲットオーディエンスの焦点を導くことができます。これは、映画や広告業界では非常に重要なことです。
これらの限界を克服するために、CameraCtrlフレームワークは、ビデオ生成のためのカメラの視点を制御できる、学習可能で正確なプラグアンドプレイのカメラモジュールを提供します。ただし、既存のテキストからビデオのモデルパイプラインにカスタマイズされたカメラを統合することは、容易なタスクではありません。したがって、CameraCtrlフレームワークは、カメラをモデルアーキテクチャに効果的に表現および注入する方法を探す必要があります。同様に、CameraCtrlフレームワークは、カメラパラメータの主要な形式としてプルッカー埋め込みを採用し、プルッカー埋め込みの選択理由は、カメラの姿勢情報の幾何学的表現を符号化できる能力にあると考えられます。また、CameraCtrlモデルの汎化可能性と適用可能性を確保するために、プルッカー埋め込みのみを受け入れるカメラ制御モデルの導入が行われます。カメラ制御モデルの有効なトレーニングを確実にするために、フレームワークとその開発者は、さまざまなトレーニングデータがフレームワークに与える影響を調査するための包括的な研究を実施します。実験結果は、元のベースモデルと似た外観で、多様なカメラ分布を持つデータを実装することで、制御可能性と汎化可能性の間で最適なトレードオフが得られることを示しています。CameraCtrlフレームワークの開発者は、モデルをAnimateDiffフレームワークの上に実装し、異なるパーソナライズされたビデオ生成アプリケーション全体で正確な制御を可能にし、ビデオ作成のさまざまなコンテキストでの汎用性と有用性を実証しています。

AnimateDiffフレームワークは、LoRAファインチューニングアプローチを採用して、モデルの重みをさまざまなショットタイプに対して効率的に取得します。Direct-a-videoフレームワークは、ビデオ生成プロセス中にカメラの姿勢を制御するためにカメラ埋め込みを実装することを提案しますが、3つのカメラパラメータのみに条件付けており、カメラの制御能力は最も基本的なタイプに限定されます。一方、MotionCtrlフレームワークは、3つ以上の入力パラメータを受け入れることができるモーションコントローラを設計し、より複雑なカメラの姿勢を持つビデオを生成できます。ただし、生成されたビデオの一部をファインチューニングする必要性は、モデルの汎化可能性を妨げます。また、他のフレームワークは、画像とテキストの両方の生成の制御可能性を高めるために、追加の構造的制御信号、たとえば深度マップをプロセスに組み込んでいます。通常、モデルはこれらの制御信号を追加のエンコーダーに供給し、さまざまな操作を使用してジェネレーターにシグナルを注入します。
CameraCtrl:モデルアーキテクチャ
カメラエンコーダのコンポーネントをCameraCtrlフレームワーク内でビデオジェネレーターでトレーニングするには、カメラの軌跡を取得するために構造から動き(SfM)アプローチを使用できる、多数のラベル付けおよび注釈付きビデオで構成される大規模なデータセットが必要です。CameraCtrlフレームワークは、外観がベースのテキストからビデオモデルのトレーニングデータに近いデータセットを選択し、可能な限り幅広いカメラ分布を持つことを目指しています。仮想エンジンを使用して生成されたデータセットのサンプルは、開発者がレンダリング段階でカメラパラメータを制御できるため、多様なカメラ分布を示しますが、実世界のサンプルを含むデータセットと比較して分布ギャップが存在します。実世界のサンプルを含むデータセットで作業する場合、カメラの分布は通常狭く、フレームワークは個々のカメラ軌跡の複雑さと異なるカメラ軌跡の多様性のバランスを取る必要があります。個々のカメラ軌跡の複雑さは、モデルがトレーニングプロセス中に複雑な軌跡を制御することを学ぶことを保証しますが、異なるカメラ軌跡の多様性は、モデルが特定の固定パターンに過剰適合しないことを保証します。また、カメラエンコーダのトレーニングプロセスを監視するために、CameraCtrlフレームワークは、生成されたサンプルのカメラ軌跡と入力カメラ条件の間のエラーを量化することでカメラの制御品質を測定するカメラ同期メトリックを提案しています。
ビデオジェネレーターのカメラ制御可能性
モデルはカメラの軌跡をプルッカー埋め込みシーケンス(空間マップ)にパラメータ化できるため、モデルはエンコーダーモデルを使用してカメラの特徴を抽出し、カメラの特徴をビデオジェネレーターに融合することができます。テキストから画像へのアダプタと同様に、CameraCtrlモデルは、ビデオ用に特別に設計されたカメラエンコーダを導入します。カメラエンコーダには、各畳み込みブロックの後に時間的注意モデルが含まれており、ビデオクリップ全体のカメラの姿勢の時間的関係を捉えることができます。次の画像に示すように、カメラエンコーダはプルッカー埋め込み入力のみを受け入れ、多スケール特徴を提供します。多スケールのカメラ特徴を取得した後、CameraCtrlモデルは、これらの特徴をテキストからビデオモデルのU-Netアーキテクチャに無理なく統合し、カメラ情報を効果的に組み込むべきレイヤーを決定します。また、既存の多くのフレームワークが、時間的および空間的注意レイヤーを含むU-Netのようなアーキテクチャを採用しているため、CameraCtrlモデルは、時間的関係を捉える能力がある時間的注意レイヤーにカメラ表現を注入することを決定し、空間的注意レイヤーは個々のフレームを表します。これは、カメラの軌跡の時間的関係と、空間的注意レイヤーが捉える個々のフレームの因果的および順序的な性質と一致しています。

カメラ分布の学習
CameraCtrlフレームワーク内のカメラエンコーダコンポーネントをビデオジェネレーターでトレーニングするには、カメラの軌跡を取得するために構造から動き(SfM)アプローチを使用できる、多数のラベル付けおよび注釈付きビデオで構成される大規模なデータセットが必要です。CameraCtrlフレームワークは、外観がベースのテキストからビデオモデルのトレーニングデータに近いデータセットを選択し、可能な限り幅広いカメラ分布を持つことを目指しています。仮想エンジンを使用して生成されたデータセットのサンプルは、開発者がレンダリング段階でカメラパラメータを制御できるため、多様なカメラ分布を示しますが、実世界のサンプルを含むデータセットと比較して分布ギャップが存在します。実世界のサンプルを含むデータセットで作業する場合、カメラの分布は通常狭く、フレームワークは個々のカメラ軌跡の複雑さと異なるカメラ軌跡の多様性のバランスを取る必要があります。個々のカメラ軌跡の複雑さは、モデルがトレーニングプロセス中に複雑な軌跡を制御することを学ぶことを保証しますが、異なるカメラ軌跡の多様性は、モデルが特定の固定パターンに過剰適合しないことを保証します。また、カメラエンコーダのトレーニングプロセスを監視するために、CameraCtrlフレームワークは、生成されたサンプルのカメラ軌跡と入力カメラ条件の間のエラーを量化することでカメラの制御品質を測定するカメラ同期メトリックを提案しています。
CameraCtrl:実験と結果
CameraCtrlフレームワークは、AnimateDiffモデルをベースのテキストからビデオモデルとして実装し、主要な理由は、AnimateDiffモデルのトレーニング戦略が、テキストから画像のベースモデルまたはテキストから画像のLoRAと統合して、さまざまなジャンルやドメインのビデオ生成を可能にすることです。モデルは、1e-4の定数学習率でAdamオプティマイザを使用してトレーニングされます。また、カメラモジュールが元のテキストからビデオモデルのビデオ生成能力に悪影響を与えないことを保証するために、CameraCtrlフレームワークは、FID(フレチェットインセプションドィスタンス)メトリックを使用してビデオの外観品質を評価し、カメラモジュールを含める前と後の生成されたビデオの品質を比較します。
そのパフォーマンスを評価するために、CameraCtrlフレームワークは、MotionCtrlとAnimateDiffの2つの既存のカメラ制御フレームワークと比較されます。ただし、AnimateDiffフレームワークは8つの基本カメラ軌跡のみをサポートしているため、CameraCtrlとAnimateDiffの比較は3つの基本軌跡に限定されます。一方、MotionCtrlとの比較の場合、フレームワークは既存のデータセットから1000を超えるランダムなカメラ軌跡を選択し、これらの軌跡を使用してビデオを生成し、TransErrとRotErrメトリックを使用して評価します。

観察すると、CameraCtrlフレームワークは基本軌跡でAnimateDiffフレームワークを上回り、複雑な軌跡メトリックでMotionCtrlフレームワークと比較して優れた結果を示しています。
さらに、次の図は、カメラエンコーダのアーキテクチャが生成されたサンプルの全体的な品質に与える影響を示しています。行aから行dは、ControlNet、ControlNet with temporal attention、T2I Adaptor、T2I adaptor with temporal attentionで生成された結果を表します。

次の図は、SparseCtrlフレームワークのRGBエンコーダとCameraCtrlフレームワークの方法を組み合わせて生成されたビデオを示しています。

最終的な考え
この記事では、テキストからビデオのモデルに対して正確なカメラの姿勢制御を可能にする新しいアイデア、CameraCtrlについて説明しました。カメラの軌跡を正確にパラメータ化した後、モデルはテキストからビデオのモデルにプラグアンドプレイのカメラモジュールをトレーニングし、他のコンポーネントは変更せずに残します。また、CameraCtrlモデルは、さまざまなデータセットの影響を調査し、元のベースモデルと似た外観で、多様なカメラ分布を持つビデオは、モデルの制御可能性と汎化能力を高めることができることを示しています。実験結果は、CameraCtrlフレームワークが、実際のタスクで正確でドメイン適応的なカメラ制御を実現するための効率性を示しています。












