AIモデルとプラットフォーム

ジェネレーティブ動画の「間」の橋渡し

mm
Unite.AI を Google の優先ソースに追加
Images taken from the FCVG paper and project site, https://arxiv.org/pdf/2412.11755 and https://fcvg-inbetween.github.io/

中国からの新しい研究は、2つの時間的に離れたビデオフレームの間のギャップを補間するための改善された方法を提供しています。これは、ジェネレーティブAIビデオのリアリズムとビデオコーデック圧縮の両方にとって、最も重要な課題の1つです。

以下の例ビデオでは、左端の列に「開始」(上)と「終了」(下)フレームが表示されます。競合システムが実行しなければならないタスクは、2つのフレームの間でサブジェクトがどのように移動するかを推測することです。アニメーションでは、このプロセスはトゥイーニングと呼ばれ、サイレント映画時代に遡ります。

クリックして再生。 最初の列の左側に、提案された開始フレームと終了フレームが表示されます。中央の列と、右側の3番目の列の上部に、3つの以前のアプローチが表示されます。右下に、新しい方法がより説得力のある結果を提供していることがわかります。 ソース: https://fcvg-inbetween.github.io/

中国の研究者によって提案された新しい方法は、フレームごとの条件に基づくビデオ生成(FCVG)と呼ばれ、上記のビデオの右下に結果が表示されます。1つの静止フレームから別の静止フレームへのスムーズで論理的な遷移を提供します。

一方、ビデオ補間の最も有名なフレームワークの1つであるGoogleの大きな動きのためのフレーム補間(FILM)プロジェクトは、大きな動きを解釈することに苦労しています。これは、多くの類似のアプローチと同様に、挑戦しています。

ビデオに表示される他の2つのライバルフレームワーク、時間逆転融合(TRF)と生成的な中間生成(GI)は、より少ない歪みを持つ解釈を提供しますが、フレーム間の論理的一貫性を尊重していない、フレンジーでコミックなダンス動作を生成しています。

クリックして再生。 ツイーニング問題の2つの不完全な解決策。左側に、FILMは2つのフレームを単純なモーフターゲットとして扱います。右側に、TRFはダンスの挿入が必要であることを認識していますが、解剖学的な異常を示す実行不可能な解決策を生成しています。

上部の左側では、FILMが問題に取り組む方法を詳しく見ることができます。FILMは大きな動きを扱うように設計されていますが、以前のアプローチに比べると、光学流れに基づいていますが、2つのキー フレームの間で何が起こるべきかについてのセマンティック理解が欠けています。単に、1980/90 年代のスタイルのフレーム間でモーフィングを実行します。FILMには、潜在的拡散モデルのような、安定した拡散などのセマンティック アーキテクチャはありません。フレーム間の適切なブリッジを作成するのに役立ちます。

右側のビデオでは、TRFの努力が見られます。ここでは、Stable Video Diffusion(SVD)を使用して、2つのユーザー指定されたフレームに適したダンス動作を「推測」していますが、ボールドで非現実的な近似をしています。

FCVG、以下に示すように、フレーム間の動きとコンテンツを推測するという点でより信頼性の高い仕事をしています:

クリックして再生。 FCVGは以前のアプローチを上回りますが、完璧ではありません。

まだアーティファクト、たとえば手や顔のアイデンティティの不要なモーフィングがありますが、このバージョンは表面的に最も妥当です。どのような改善も、タスクが提示する巨大な困難と、AI生成ビデオの将来に対する大きな障害に対して考慮される必要があります。

補間が重要な理由

私たちが以前にも指摘したように、2つのユーザー指定されたフレームの間にビデオコンテンツを妥当に埋める能力は、ジェネレーティブビデオの時間的一貫性を維持するための最も良い方法の1つです。2つの実際の連続写真には、服、髪、環境などの一貫した要素が含まれているからです。

ただし、単一の開始フレームのみを使用すると、ジェネレーティブシステムの限られた注意ウィンドウは、近くのフレームのみを考慮するため、サブジェクトの側面を徐々に「進化」させ、たとえば、男性が別の男性(または女性)になるか、または「モーフィング」した服を着ているなどの、ほとんどのオープンソース T2V システムや、Kling のようなほとんどの有料ソリューションで一般的に生成される他の多くの妨げの中で、進化させることがあります。

クリックして再生。 新しい論文の 2 つの (実際の) ソース フレームを Kling に入力し、プロンプト「屋根の上でダンスをする男性」を使用した場合、理想的な解決策にはなりませんでした。Kling 1.6 が利用可能だったときに、V1.5 はユーザー入力の開始フレームと終了フレームをサポートする最新バージョンでした。 ソース: https://klingai.com/

問題はすでに解決済みか?

一方で、商用のクローズドソースおよびプロプライエタリシステムは、特にRunwayMLのように、この問題に対処することに成功しているようです。

クリックして再生。 RunwayMLの拡散ベースの補間は非常に効果的です。 ソース: https://app.runwayml.com/

この演習を繰り返すと、RunwayMLは2番目の、同等に信頼性の高い結果を生成しました:

クリックして再生。 RunwayMLシーケンスの2回目。

ここで問題は、プロプライエタリ システムから、課題に関わる挑戦や、オープンソースの現状を進歩させることができないということです。独自のアーキテクチャ アプローチ、データ (またはデータのキュレーション方法、フィルタリング、注釈付けなど)、またはこれらの他の潜在的な研究革新の組み合わせによって、この優れたレンダリングが達成されたかどうかを知ることはできません。

さらに、小規模な企業、たとえば視覚効果会社は、将来のロジスティック計画を単一の価格上昇によって潜在的に損なう可能性のある B2B API ドリブンのサービスに依存することはできません。特に、1つのサービスが市場を支配し、価格を上げる可能性が高くなる場合です。

権利が間違っている時

はるかにより重要なのは、パフォーマンスの良い商用モデルがライセンスされていないデータでトレーニングされている場合、RunwayMLの場合のように、そのサービスを使用する会社は、下流の法的責任を負う可能性があるということです。

法律や訴訟は大統領の任期よりも長く続き、米国市場は世界で最も訴訟が多く、AIトレーニング データの法的管理の傾向は、ドナルド トランプの大統領任期の「軽いタッチ」にも耐えられる可能性が高いです。したがって、コンピュータ ビジョン研究部門は、この問題を難しい方法で解決する必要があります。そうすれば、出現する解決策が長期にわたって持続できるからです。

FCVG

中国からの新しい方法は、論文フレームごとの条件に基づく生成的な中間生成を介したビデオ生成」に提示されており、哈爾浜工業大学と天津大学の5人の研究者によって発表されています。

FCVGは、フレームごとの条件を利用し、ユーザー指定された開始フレームと終了フレームのエッジを定義するフレームワークを使用することで、補間タスクの曖昧性を解決します。これにより、プロセスはフレーム間の遷移をより一貫した方法で追跡し、全体的な効果も維持できます。

フレームごとの条件付けには、インターミディエイト フレームの生成をサブタスクに分解することが含まれます。2つのフレームの間の非常に大きなセマンティックの空間を埋めるのではなく、ランダム ノイズから始まる「前向き」と「後向き」の2つのビデオ生成パスを作成します。

以下のグラフィックでは、著者は先ほど述べた時間逆転法と彼らのアプローチを比較しています。時間逆転法では、事前トレーニング済みの画像からビデオモデル (SVD) を使用して、開始フレームと終了フレームの両方に条件付けられた「前向き」と「後向き」の 2 つのビデオ生成パスを作成します。両方のパスは同じランダムノイズから始まります。これは、以下の画像の左側に示されています:

FCVGへの先行アプローチの比較。

FCVGへの先行アプローチの比較。 ソース: https://arxiv.org/pdf/2412.11755

著者は、FCVGが時間逆転法よりも優れているのは、各フレームに明示的な条件を与えることで、ビデオ生成における曖昧性を軽減するからであると主張しています。

時間逆転法、たとえばTRFは、前向きと後向きの生成パスが分岐し、不一致や矛盾を引き起こす可能性があるため、曖昧性を引き起こす可能性があります。FCVGは、開始フレームと終了フレームの間で一致する線を導出することによってこれを解決し、生成プロセスを導きます。

クリックして再生。 FCVGプロジェクトページからの別の比較。

時間逆転法は、事前トレーニング済みのビデオ生成モデルを中間生成に使用できるようにしますが、欠点もあります。I2Vモデルによって生成されるモーションは、多様であり、安定したものではありません。これは、純粋な画像からビデオ (I2V) タスクには役立つかもしれませんが、補間ビデオの生成では、曖昧性を生み出し、ビデオ パスが一致しないまたは一貫性のないものになります。

時間逆転法ではまた、各生成ビデオのフレームレートなどのハイパーパラメータの煩雑な調整が必要です。さらに、曖昧性を軽減するために時間逆転法で使用される一部のテクニックは、推論を大幅に遅くし、処理時間を増加させます。

方法

著者は、これらの問題の最初のもの (多様性 vs. 安定性) が解決されれば、他のすべての問題も解決される可能性が高いと観察しています。これは、先ほど述べたGIやViBiDSamplerなどの以前のアプローチでも試みられました。

論文には以下のように記載されています:

‘しかし、これらのパス間には依然としてかなりのランダム性が存在し、これらの方法の有効性を、たとえば人間の姿勢の急激な変化を伴うシナリオで妨げています。中間フレームの条件が不足しているため、補間パスの曖昧性が生じます。2つの入力画像は、開始フレームと終了フレームの条件のみを提供します。’

‘したがって、各フレームに明示的な条件を提供することを提案します。これにより、補間パスの曖昧性が大幅に軽減されます。’

FCVGの核となる概念は、以下のスキーマで見ることができます。FCVGは、2つの入力フレームで一貫した開始点と終了点を持つビデオフレームのシーケンスを生成します。これにより、フレームごとの条件を提供することで、フレームが時間的に安定することが保証されます。

FCVGの推論スキーマ。

FCVGの推論スキーマ。

この時間逆転アプローチの再考では、方法は前向きと後向きの情報を組み合わせてスムーズな遷移を生成します。反復プロセスを通じて、モデルはノイズのある入力を徐々に改良し、最終的に中間フレームが生成されます。

次のステージでは、事前トレーニング済みのGlueStickライン マッチング モデルを使用して、開始フレームと終了フレームの間で対応を生成し、スケルトン ポーズを使用してモデルをガイドすることもできます。Stable Video Diffusionモデルを介して、モデルをガイドすることもできます。

GlueStickは、解釈された形状から線を導きます。これらの線は、FCVG*の開始フレームと終了フレームの間で一致するアンカーを提供します。

GlueStickは、解釈された形状から線を導きます。これらの線は、FCVG*の開始フレームと終了フレームの間で一致するアンカーを提供します。

著者は以下のように述べています:

‘実験的に、ほとんどの場合に時間的一貫性を保証するために、線形補間が十分であることを発見しました。さらに、望ましいビデオを生成するために、非線形補間パスを指定することもできます。’

前向きと後向きのフレームごとの条件を確立するためのワークフロー。アニメーションが進むにつれて、コンテンツを一貫性のあるままに保つ一致した色が見られます。

前向きと後向きのフレームごとの条件を確立するためのワークフロー。アニメーションが進むにつれて、コンテンツを一貫性のあるままに保つ一致した色が見られます。

SVDに取得したフレームごとの条件を注入するために、FCVGは2024年のControlNeXtイニシアチブで開発された方法を使用します。このプロセスでは、制御条件は最初に複数のResNetブロックによってエンコードされ、条件とSVDブランチの間でクロス正規化が行われます。

小さなビデオのセットは、SVDモデルをファインチューニングするために使用され、モデルのほとんどのパラメータは凍結されます。

‘上記の制限は、FCVGで大幅に解決されています。(i) 各フレームに明示的な条件を指定することで、前向きと後向きのパスの間の曖昧性が大幅に軽減されます。(ii) 1つの調整可能なパラメータのみが導入され、SVDのハイパーパラメータはデフォルトのままです。(iii) ノイズの再注入なしで、単純な平均融合がFCVGでは十分であり、推論ステップはGIと比較して50%削減できます。’

FCVGのための安定したビデオ拡散へのフレームごとの条件の注入の広いスキーマ。

FCVGのための安定したビデオ拡散へのフレームごとの条件の注入の広いスキーマ。

データとテスト

システムをテストするために、研究者は、屋外環境、人間のポーズ、室内ロケーション、カメラの動き、ダンス アクション、顔の表情など、さまざまなシーンを含むデータセットをキュレーションしました。524 クリップは、DAVISRealEstate10kデータセットから選択されました。このコレクションは、Pexels から取得した高フレーム レートのビデオで補足されました。キュレーションされたセットは、4:1 の比率でファイン チューニングとテストに分割されました。

使用されたメトリックは、学習された認識メトリック(LPIPS)、Fréchet インセプション距離(FID)、Fréchet ビデオ距離(FVD)、VBench、およびFréchet ビデオ モーション距離でした。

著者は、これらのメトリックのいずれも時間的一貫性を推定するのに適していないと指摘し、FCVGのプロジェクト ページのビデオを参照しています。

さらに、DWPoseは、人間のポーズの推定に使用されました。

ファイン チューニング ツールは、AdamW オプティマイザで 70,000 イテレーションを実行し、NVIDIA A800 GPU で、学習率 1×10^-6 で、フレームを 512×320 パッチにトリミングしました。

テストされたライバル先行フレームワークは、FILM、GI、TRF、およびDynamiCrafterでした。

定量的な評価では、扱われたフレーム ギャップは 12 から 23 の間でした。

先行フレームワークとの定量的な結果。

先行フレームワークとの定量的な結果。

この結果について、論文では以下のように述べています:

‘私たちの方法は、4つの生成アプローチすべてのメトリックで最高のパフォーマンスを達成します。FILMとのLPIPS比較では、私たちのFCVGはわずかに劣るものの、他のメトリックでは優れたパフォーマンスを示しています。LPIPSに時間情報がないことを考えると、他のメトリックと視覚観察を優先する方が適切かもしれません。 ‘

‘さらに、異なるフレーム ギャップの結果を比較すると、FILMはギャップが小さい場合に機能するかもしれませんが、生成方法は大きなギャップに適していることがわかります。生成方法の中で、私たちのFCVGは、明示的なフレームごとの条件があるため、顕著な優位性を示しています。’

定性的テストのために、著者はプロジェクト ページ(およびこの記事に埋め込まれている)で見られるビデオを生成しました。また、PDF論文に静的およびアニメーション結果もあります。

論文からのサンプル静的結果。ソースPDFの解像度が高く、アプリケーションがサポートしている場合はアニメーションを再生できることに注意してください。

論文からのサンプル静的結果。ソースPDFの解像度が高く、アプリケーションがサポートしている場合はアニメーションを再生できることに注意してください。

著者は以下のように述べています:

‘FILMは小さな動きのシナリオではスムーズな補間結果を生成しますが、大きな動きには光学流れの固有の限界により苦労し、背景や手の動き(最初のケース)などの目立つアーティファクトが生じます。 ‘

‘TRFやGIなどの生成モデルは、融合パスの曖昧性に苦労し、特に複雑なシーンで人間や物体の動きが含まれる場合、不安定な中間モーションを生み出します。 ‘

‘一方、私たちの方法は、さまざまなシナリオで一貫して満足のいく結果を提供します。重要な遮蔽が存在する場合(2番目と6番目のケース)でも、妥当なモーションを捉えることができます。さらに、私たちのアプローチは、複雑な人間のアクション(最後のケース)に対してロバストです。 ‘

著者はまた、FCVGがアニメーション スタイルのビデオに通常予想される以上に優れて一般化することができると発見しました:

クリックして再生。 FCVGは、カートゥーン スタイルのアニメーションに対して非常に説得力のある結果を生成します。

結論

FCVGは、非プロプライエタリ コンテキストにおけるフレーム補間の最先端を表す、少なくとも漸進的な改善を表しています。著者は、GitHubでこの作業のコードを公開しましたが、関連データセットはまだ公開されていません。

プロプライエタリ商用ソリューションが、Web スクレイピングされたライセンスされていないデータを使用してオープンソースの努力を上回っている場合、商用利用の場合、限られた将来性しかありません。リスクは単純に大きすぎます。

したがって、オープンソースのシーンが現在の市場リーダーを上回っていないとしても、ウサギがカメを追い越すかもしれません。

 

* ソース: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf

Acrobat Reader、Okular、または埋め込みアニメーションを再生できる他のPDFリーダーが必要です。

 

初めて公開:2024年12月20日金曜日

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai