Andersonの視点

AIベースのビデオ編集の道

mm
Unite.AI を Google の優先ソースに追加
Images from the paper 'VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control'.

ビデオ/画像合成研究分野は、ビデオ編集アーキテクチャを定期的に出力しており、過去9ヶ月でこのような出力がさらに頻繁になっている。ただし、ほとんどのアーキテクチャは、コアの課題が大きいため、現状の技術に対する.incrementalな進歩のみを表している。

しかし、中国と日本の新しいコラボレーションは、注目に値するアプローチの例を生み出した。これは、ランドマークとなる作品ではないかもしれないが、より詳細な検討に値する。

以下のビデオクリップ(プロジェクトサイトからのもので、ブラウザに負担をかける可能性がある)では、システムのディープフェイキング能力は現在の構成では存在しないが、ビデオマスク(下左)に基づいて、画像の若い女性のアイデンティティを妥当かつ著しく変更することを実行する。

クリックして再生してください。 下左のセマンティックセグメンテーションマスクを視覚化したものに基づいて、元の画像(上左)の女性は著しく異なるアイデンティティに変換されますが、これはプロンプトで示されたアイデンティティスワップを達成するものではありません。 ソース:https://yxbian23.github.io/project/video-painter/ (執筆時点で、このオートプレイ機能付きのビデオが多く含まれるサイトは、ブラウザのクラッシュにつながる可能性があります)。より高解像度と詳細なコンテンツを確認するには、ソースビデオまたはhttps://www.youtube.com/watch?v=HYzNfsD3A0sでのプロジェクトの概要ビデオを参照してください。

この種のマスクベースの編集は、静的な潜在的拡散モデルで確立されており、ControlNetなどのツールを使用して実行される。

クリックして再生してください。 新しいVideoPainterメソッドを使用した種の変更。ソースビデオまたはhttps://www.youtube.com/watch?v=HYzNfsD3A0sでのプロジェクトの概要ビデオを参照して、より高解像度と詳細なコンテンツを確認してください。

この新しい作品の著者は、TencentのBrushNetアーキテクチャとControlNetと比較して、双方のアーキテクチャが前景と背景の生成を分離できる双枝構造を扱っていることを考慮している。

しかし、OpenAIのSoraが提案したDiffusion Transformers(DiT)アプローチにこの方法を直接適用することは、著者によると特有の課題がある。

VideoPainterは、事前トレーニングされたDiTを軽量なコンテキストエンコーダで強化する、双枝のビデオインペイントフレームワークを提供する。

このエンコーダは、バックボーンのパラメータの6%のみを占めるため、従来の方法よりも効率的であると著者は主張する。

モデルは3つの重要な革新を提案する:効率的な背景ガイダンスのためのストリームライン化された2層のコンテキストエンコーダ;マスクされたトークンとマスクされていないトークンを分離するマスク選択的な特徴統合システム;および、長いビデオシーケンス全体でアイデンティティの一貫性を維持するインペイント領域IDリサンプリング技術。

VideoPainterは、事前トレーニングされたDiTとコンテキストエンコーダをフリーズし、IDアダプタを導入することで、インペイント領域トークンがビデオ全体で一貫性を維持することを保証する。

フレームワークは、既存のビデオ生成および編集ワークフローにシームレスに統合できるように設計されている。

この研究を支援するために、著者は、CogVideo-5B-I2Vを生成エンジンとして使用し、現在までで最大のビデオインペイントデータセットであるVPDataを策定した。VPDataは、390,000を超えるクリップで構成されており、合計ビデオ時間は886時間を超える。また、関連するベンチマークフレームワークであるVPBenchも開発した。

クリックして再生してください。 VPDataコレクションとVPBenchテストスイートのセグメンテーション機能を示すもの。ソースビデオまたはhttps://www.youtube.com/watch?v=HYzNfsD3A0sでのプロジェクトの概要ビデオを参照して、より高解像度と詳細なコンテンツを確認してください。

新しい研究は「VideoPainter:Any-length Video Inpainting and Editing with Plug-and-Play Context Control」と題され、Tencent ARC Lab、香港中文大学、東京大学、澳門大学の7人の著者によるものである。

プロジェクトサイトのほか、著者は、https://www.youtube.com/watch?v=HYzNfsD3A0sでの概要ビデオやhttps://huggingface.co/TencentARC/VideoPainterでのHugging Faceページも公開している。

方法

VPDataのデータコレクションパイプラインは、コレクション、注釈、分割、選択、キャプション付けで構成される。

データセット構築パイプラインのスキーマ。ソース:https://arxiv.org/pdf/2503.05639

データセット構築パイプラインのスキーマ。ソース:https://arxiv.org/pdf/2503.05639

このコンパイルに使用されたソースコレクションは、VidevoとPexelsから得られ、約45万のビデオを取得した。

事前処理段階では、複数のライブラリと方法が使用された。Recognize Anythingフレームワークは、オープンセットビデオタグ付けに使用され、主なオブジェクトを特定するタスクが与えられた。Grounding Dinoは、特定されたオブジェクトのバウンディングボックスの検出に使用された。Segment Anything Model 2(SAM 2)フレームワークは、これらの粗い選択を高品質のマスクセグメンテーションに精製するために使用された。

シーン遷移を管理し、ビデオインペイントの一貫性を確保するために、VideoPainterはPySceneDetectを使用して、クリップを自然なブレークポイントで分割し、複数の角度から同じオブジェクトを追跡することによって生じる破壊的なシフトを避ける。

クリップは10秒間隔で分割され、6秒未満のものは破棄された。

データ選択のために、3つのフィルタリング基準が適用された。美的品質は、Laion-Aesthetic Score Predictorで評価された。モーションの強度は、RAFTを使用した光学フローで測定された。コンテンツの安全性は、Stable DiffusionのSafety Checkerで検証された。

既存のビデオセグメンテーションデータセットの1つの大きな制限は、生成モデルを導く上で重要な詳細なテキスト注釈の欠如である。

著者は、関連コレクションにおけるビデオキャプションの欠如を強調する。

著者は、関連コレクションにおけるビデオキャプションの欠如を強調する。

したがって、VideoPainterのデータキュレーションプロセスでは、CogVLM2やChat GPT-4oなどの先行するビジョン言語モデルを使用して、マスクされた領域の詳細な説明とキーフレームベースのキャプションを生成する。

VideoPainterは、事前トレーニングされたDiTを軽量なコンテキストエンコーダで強化する。コンテキストエンコーダは、バックグラウンドコンテキストの抽出と前景の生成を分離する。

VideoPainterの概念スキーマ。VideoPainterのコンテキストエンコーダは、ノイズのある潜在変数、ダウンサンプル化されたマスク、そしてマスクされたビデオ潜在変数をVAEを介して処理し、バックグラウンドトークンのみを事前トレーニングされたDiTに統合する。IDリサンプリングアダプタは、インペイント領域トークンを結合してアイデンティティの一貫性を確保する。

VideoPainterの概念スキーマ。VideoPainterのコンテキストエンコーダは、ノイズのある潜在変数、ダウンサンプル化されたマスク、そしてマスクされたビデオ潜在変数をVAEを介して処理し、バックグラウンドトークンのみを事前トレーニングされたDiTに統合する。IDリサンプリングアダプタは、インペイント領域トークンを結合してアイデンティティの一貫性を確保する。

このエンコーダは、冗長な処理をバックボーンに課すのではなく、ノイズのある潜在変数、ダウンサンプル化されたマスク、そしてマスクされたビデオ潜在変数の組み合わせを入力として操作する。

ノイズのある潜在変数は、生成のコンテキストを提供し、マスクされたビデオ潜在変数は、DiTの既存の分布と一致することを目指す。

トークン選択メカニズムにより、バックグラウンドに関連する特徴のみが再統合され、インペイント領域とマスクされていない領域の混同が防止される。

VideoPainterは、LoRA(Low Rank Adaptation)を含むさまざまなスタイライゼーション方法をサポートする。

データとテスト

VideoPainterは、CogVideo-5B-I2Vモデルとそのテキストからビデオへの等価モデルを使用してトレーニングされた。VPDataコーパスは、480x720pxで、学習率1×10^-5で使用された。

IDリサンプリングアダプタは、2,000ステップでトレーニングされ、コンテキストエンコーダは、AdamWオプティマイザを使用して80,000ステップでトレーニングされた。トレーニングには、64個のNVIDIA V100 GPUが使用された。

ベンチマークのために、Davisはランダムマスクで使用され、著者のVPBenchはセグメンテーションベースのマスクで使用された。

VPBenchデータセットには、オブジェクト、動物、人間、風景、そしてさまざまなタスクが含まれており、4つのアクション(追加、削除、変更、交換)をカバーする。コレクションには、45の6秒間のビデオと、平均30秒間の9つのビデオが含まれる。

8つのメトリックがプロセスで使用された。マスクされた領域の保存のために、PSNR(ピーク信号対雑音比)、LPIPS(学習された感覚相似性メトリック)、SSIM(構造類似性指数)、MAE(平均絶対誤差)が使用された。

テキストの整列のために、CLIP類似性が使用された。ビデオの全体的な品質を評価するために、FVD(フレッチェビデオ距離)が使用された。

ビデオインペイントのための量的比較ラウンドでは、著者はProPainter、COCOCO、Cog-Inp(CogVideoX)などの先行アプローチと比較した。

この量的比較の結果について、著者は次のように述べている。

「セグメンテーションベースのVPBenchでは、ProPainterとCOCOCOは、完全にマスクされたオブジェクトをインペイントできないことと、シングルバックボーンアーキテクチャがバックグラウンドの保存と前景の生成のバランスを取るのに苦労することにより、ほとんどのメトリックで最も悪いパフォーマンスを示した。」

「ランダムマスクのベンチマークであるDavisでは、ProPainterは部分的な背景情報を活用することで改善を見せた。ただし、VideoPainterは、双枝アーキテクチャを介して、セグメンテーション(標準と長い長さ)とランダムマスクの両方で最適なパフォーマンスを達成する。」

著者は、静的な質的結果の例も提示している。

先行フレームワークのインペイント方法との比較。

先行フレームワークのインペイント方法との比較。

質的結果について、著者は次のように述べている。

「VideoPainterは、ビデオの連続性、品質、テキストキャプションとの整列性で一貫して優れた結果を示した。特に、ProPainterは、背景ピクセルの伝播のみに依存しているため、完全にマスクされたオブジェクトを生成できない。」

「COCOCOは基本的な機能を示したが、インペイントされた領域でアイデンティティの一貫性を維持できなかった。Cog-Inpは基本的なインペイント結果を達成したが、ブレンド操作のマスク境界の検出の欠如により、著しいアーティファクトが生じた。」

「さらに、VideoPainterは、アイデンティティの一貫性を維持しながら1分を超える長いビデオを生成できる。」

著者はまた、VideoPainterのキャプションを強化し、改善された結果を得る能力を、UniEdit、DiTCtrl、ReVideoなどの先行アプローチと比較した。

ビデオ編集結果に対する3つの先行アプローチとの比較。

ビデオ編集結果に対する3つの先行アプローチとの比較。

著者は次のように述べている。

「VideoPainterは、標準および長いビデオの両方で、優れたパフォーマンスを達成し、 incluso ReVideoを上回った。これは、バックグラウンドの保存と前景の生成を両立させる双枝アーキテクチャによるものであり、編集されていない領域で高忠実度を維持し、編集された領域が編集指示と一致することを保証する。」

最後に、30人のユーザーが、VPBenchと編集サブセットからランダムに選択された50の生成を評価するヒューマンスタディが実施された。例は、バックグラウンドの保存、プロンプトへの整列、ビデオの全体的な品質を強調した。

VideoPainterのユーザースタディの結果。

VideoPainterのユーザースタディの結果。

著者は次のように述べている。

「VideoPainterは、すべての評価基準で、既存のベースラインを上回る優れたパフォーマンスを示した。」

結論

VideoPainterは、文学への有意義な追加である。最近の解決策と同様に、しかし、相当な計算リソースを必要とする。さらに、プロジェクトサイトで提示されている多くの例は、論文で概説されている結果の最良の例から遠く離れている。したがって、このフレームワークを将来のエントリーやより広範な先行アプローチと比較することは興味深いものになるだろう。

* 「ビデオ編集」という用語は、この文脈では「さまざまなクリップをシーケンスに組み合わせる」という伝統的な意味ではなく、機械学習技術を使用して既存のビデオクリップの内部コンテンツを直接変更または修正することを指す。

初版:2025年3月10日。2026年7月25日にビデオを置き換えるために更新された。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai