Andersonの視点
2つの画像からより良いAIビデオを生成する

ビデオフレーム補間(VFI)は、生成的なビデオ研究におけるです。課題は、ビデオシーケンス内の2つの既存のフレームの間に中間フレームを生成することです。
クリックして再生。 FILMフレームワークは、Googleとワシントン大学の共同研究であり、効果的なフレーム補間方法を提案しました。この方法は、趣味の分野やプロの分野で人気があります。左側には、2つの別個のフレームが重ねられていることがわかります。中央には、「終了フレーム」があり、右側には、フレーム間の最終的な合成が行われています。 ソース:https://film-net.github.io/ および https://arxiv.org/pdf/2202.04901
広義の意味では、この技術は100年以上前に始まり、伝統的なアニメーションで使用されてきました。その際、主要なアニメーションアーティストによって「キーフレーム」が生成され、他のスタッフによって「トゥイーニング」の作業が行われました。
生成的なAIの登場以前、フレーム補間は、Real-Time Intermediate Flow Estimation(RIFE)、Depth-Aware Video Frame Interpolation(DAIN)、およびGoogleのFrame Interpolation for Large Motion(FILM)などのプロジェクトで、既存のビデオのフレームレートを増加させたり、人工的に生成されたスローモーション効果を実現したりするために使用されました。これは、既存のビデオクリップのフレームを分割し、推定の中間フレームを生成することで実現されます。
VFIは、より優れたビデオコーデックの開発にも使用され、より一般的には、光学フローベースのシステム(生成システムを含む)で、来るべきキーフレームに関する事前の知識を利用して、間のコンテンツを最適化および形状化します。
生成的なビデオシステムにおける終了フレーム
現代の生成システムであるLumaやKlingでは、ユーザーが開始フレームと終了フレームを指定でき、2つの画像のキーポイントを分析し、2つの画像間の軌道を推定することでこのタスクを実行できます。
以下の例からわかるように、終了キーフレームを提供することで、生成的なビデオシステム(この場合はKling)が、アイデンティティなどの側面を維持できるようになります(特に大きな動きの場合、結果は完璧ではないかもしれません)。
クリックして再生。 Klingは、RunwayやLumaを含む、ユーザーが終了フレームを指定できるビデオジェネレーターの1つです。大きな動きは最も現実的な結果をもたらしません。 ソース:https://www.youtube.com/watch?v=8oylqODAaH8
上記の例では、2つのユーザー提供のキーフレーム間で、人物のアイデンティティが一貫しています。
開始フレームのみが提供されている場合、生成システムの注意のウィンドウは通常、ビデオの開始時に人物がどう見えたかを「覚える」ことができません。代わりに、アイデンティティは各フレームで少しずつ変化し、最終的にすべての類似性が失われます。以下の例では、開始画像がアップロードされ、人物の動きはテキストプロンプトによって導かれます。
クリックして再生。 終了フレームがない場合、Klingには、生成のための次のフレームを導くために、直前にあるフレームの小さなグループしかありません。大きな動きが必要な場合、アイデンティティの劣化は深刻になります。
俳優の類似性は、生成システムが彼が笑っているように見えるかどうかを知らないため、指示に耐えられません(シード画像では、彼は笑っていません)。
ほとんどのウイルス的な生成クリップは、これらの欠点を軽視するように注意深くキュレーションされています。しかし、時間的に一貫した生成的なビデオシステムの進歩は、フレーム補間に関する新しい研究開発に依存するかもしれません。唯一の代替案は、伝統的なCGIを「ガイド」ビデオとして使用することですが、現在、テクスチャと照明の一貫性は難しいものです。
さらに、最近のフレームから新しいフレームを導き出す反復的な性質により、大きな動きを達成することは非常に難しくなります。これは、オブジェクトがフレーム内で急速に移動し、1つのフレーム内で反対側に移動する可能性があるため、システムが訓練されたより緩やかな動きとは反対です。
同様に、大きな動きや姿勢の変化は、アイデンティティの変化だけでなく、鮮明な不一致につながる可能性があります。
クリックして再生。 このLumaの例では、要求された動きは、訓練データに良く表現されていないようです。
Framer
これは、中国からの最近の興味深い論文に導きます。この論文では、信憑性のあるフレーム補間の新しい最先端を達成したと主張しており、ドラッグベースのユーザーインタラクションを提供する最初のものです。
Framerでは、ユーザーが直感的なドラッグベースのインターフェイスを使用して動きを導くことができますが、「自動」モードもあります. ソース:https://www.youtube.com/watch?v=4MPGKgn7jRc
ドラッグ中心のアプリケーションは、最近、頻繁 に 現れて います。これは、生成システムのためのテキストプロンプトによって得られる粗い結果に基づかないインストルメンタリティを提供するために、研究セクターが苦労しているためです。
新しいシステム、Framerは、ユーザーが導くドラッグに従うだけでなく、より従来的な「オートパイロット」モードもあります。従来のトゥイーニングに加えて、システムはタイムラプスシミュレーション、モーフィング、入力画像の新しいビューの生成も可能です。

Framerのタイムラプスシミュレーションのための間のフレーム。 ソース:https://arxiv.org/pdf/2410.18978
新しいビューの生成に関しては、FramerはNeural Radiance Fields(NeRF)の領域に少し踏み込んでいますが、NeRFでは6つ以上の画像入力ビューが必要ですが、Framerでは2つの画像のみで済みます。
テストでは、Framerは、Stability.aiのStable Video Diffusion潜在的拡散生成ビデオモデルに基づいています。Framerは、ユーザー研究で、近似されたライバルアプローチを上回ることができました。
現在、コードはGitHubで公開される予定です。ビデオサンプル(上記の画像はこれらから派生しています)はプロジェクトサイトで利用可能であり、研究者はYouTubeビデオも公開しています。
新しい論文は、Framer:インタラクティブフレーム補間と題されており、浙江大学とアリババグループを支援するアントグループの9人の研究者によって書かれています。
方法
Framerは、2つのモダリティのいずれかで、キーポイントベースの補間を使用します。ここで、入力画像は基本的なトポロジーで評価され、「動かす」ポイントが必要に応じて割り当てられます。実質的には、これらのポイントはIDベースのシステムにおける顔のランドマークに相当しますが、任意の表面に一般化されます。
研究者は、Fine-tuned Stable Video Diffusion(SVD)をOpenVid-1Mデータセットで、最後のフレームの合成機能を追加しました。これにより、軌道制御メカニズム(スキーマ画像の右上)が実現され、終了フレーム(またはその逆)に向かうパスを評価することができます。

Framerのスキーマ。
最後のフレームの条件付けについて、著者は以下のように述べています:
‘SVDの事前学習済みの視覚的先行性を可能な限り保存するために、SVDの条件付けパラダイムに従い、潜在的空間と意味的空間に終了フレームの条件を挿入します。 ‘
‘具体的には、最初のフレームのVAEエンコードされた潜在的特徴を最初のフレームのノイズのある潜在的特徴と結合します。さらに、最後のフレームの潜在的特徴znを最後のフレームのノイズのある潜在的特徴と結合します。条件と対応するノイズのある潜在的特徴は、空間的に整列していることを考慮に入れます。 ‘
‘さらに、最初と最後のフレームのCLIP画像埋め込みを個別に抽出し、クロスアテンション機能の注入のために結合します。’
ドラッグベースの機能のために、トラジェクトリーモジュールは、CoTrackerフレームワークを利用します。これは、先に進むことができる多数の可能なパスを評価します。これらは、1〜10の可能なトラジェクトリーに絞り込まれます。
取得したポイントの座標は、DragNUWAおよびDragAnythingアーキテクチャにインスパイアされた方法論を通じて変換されます。これにより、ガウシアンヒートマップが得られ、動きのためのターゲットエリアが個別化されます。
その後、データは、ControlNetの条件付けメカニズムに供給されます。これは、Stable Diffusionのために最初に設計された付随的な整合システムであり、現在は他のアーキテクチャにも適応されています。
オートパイロットモードの場合、機能マッチングは、SIFTによって最初に実行され、トラジェクトリーが得られ、DragGANおよびDragDiffusionにインスパイアされた自動更新メカニズムに渡されます。

Framerのポイントトラジェクトリー推定のスキーマ。
データとテスト
Framerの微調整のために、空間的注意と残差ブロックは凍結され、時間的注意レイヤーと残差ブロックのみが影響を受けました。
モデルは、AdamWの下で10,000イテレーションで訓練され、学習率は1e-4、バッチサイズは16でした。訓練は、16のNVIDIA A100 GPUで実行されました。
以前のアプローチではドラッグベースの編集が提供されていないため、研究者はFramerのオートパイロットモードを従来の機能と比較することを選択しました。
テストされたフレームワークは、LDMVFI、Dynamic Crafter、およびSVDKFIでした。「伝統的な」ビデオシステムの場合、AMT、RIFE、FLAVR、および上記のFILMでした。
さらに、DAVISおよびUCF101データセット上でテストが実行されました。
定性的テストは、研究チームとユーザー研究によってのみ評価できます。ただし、論文では、従来の定量的メトリックは、提示された提案に適していないことが示されています:
‘[再構成]メトリックであるPSNR、SSIM、LPIPSは、他の妥当な補間結果をペナルティーとして扱うため、補間フレームの品質を正確に捉えることができません。 ‘
‘生成メトリックであるFIDは、時間的一貫性を考慮せず、フレームを個別に評価するため、ある程度の改善はありますが、依然として不足しています。 ‘
これにもかかわらず、研究者はいくつかの人気メトリックで定量的テストを実行しました:

Framerとライバルシステムの定量的結果。
著者は、Framerがテストされた方法で最高のFVDスコアを達成したことを示しています。
以下は、質的比較のための論文のサンプル結果です:

以前のアプローチとの質的比較。解像度の良いバージョンと、https://www.youtube.com/watch?v=4MPGKgn7jRcでのビデオ結果については、論文を参照してください。
著者は以下のように述べています:
‘[私たちの]方法は、従来の補間技術と比較して、はるかにクリアなテクスチャーと自然な動きを生成します。入力フレーム間の違いが大きいシナリオでは、従来の方法は内容を正確に補間することができませんが、私たちの方法は特に優れています。 ‘
‘LDMVFIやSVDKFIなどの他の拡散ベースの方法と比較して、Framerは、困難なケースへの適応性が優れており、より優れた制御を提供します。 ‘
ユーザー研究では、研究者は20人の参加者を募集し、テストされた方法からの100個のランダムに順序付けられたビデオ結果を評価しました。したがって、1000個の評価が得られ、最も「リアルな」提案が評価されました:

ユーザー研究の結果。
上記のグラフからわかるように、ユーザーはFramerの結果を圧倒的に好んでいました。
プロジェクトの付随するYouTubeビデオでは、Framerの他の潜在的な用途、モーフィングやカートゥーンの間の補間などが紹介されています。
結論
この課題の重要性は、現在、AIベースのビデオ生成のタスクにとって非常に大きいです。現在までに、FILMやEbSynthなどの古いソリューションは、プロのコミュニティやアマチュアのコミュニティで、フレームの間の補間のために使用されてきましたが、これらのソリューションには大きな制限があります。
新しいT2Vフレームワークの公式の例ビデオの不誠実なキュレーションにより、機械学習システムが3Dモーファブルモデル(3DMM)などのガイダンスメカニズムを使用せずに、動きの中で幾何学を正確に推測できるという、広範な一般的な誤解があります。
正直に言えば、トゥイーニング自体は、問題に対する「ハック」またはチートにすぎません。ただし、テキストプロンプトや現在の代替手段を使用してガイダンスを実現するよりも、2つの整合されたフレーム画像を生成する方が簡単なことが多いため、この古い方法のAIベースのバージョンの進歩をみるのはよいことです。
初めて公開:2024年10月29日(火曜日)












