Andersonの視点

ビデオからオブジェクトや人物をAIで消去する

mm
Unite.AI を Google の優先ソースに追加
AI-generated stylized image depicting a magician robot showing an empty cabinet with a lady's tiara at the bottom. GPT-1.5

子供が写真に残ることはありません。AIが何かを成し遂げるからです。

 

画像やビデオから人物やオブジェクトを除去することは、VFXを中心としたAI文学の分野で人気のある研究分野であり、専用のデータセットやフレームワークがこの課題に取り組んでいます。中国の復旦大学のビッグデータ研究所から最新のものが、EffectEraseです。これは、著者によると、テストで現状の技術を大幅に上回る「効果を認識した」ビデオオブジェクト除去システムです。

プロジェクトのウェブサイトの資料から作成された、EffectErase方法の例です。(注:リンクを提供しますが、ソースサイトには多くのハイレゾと非最適化のオートプレイビデオがあり、ウェブブラウザの安定性に影響を与える可能性があります。付属のYouTubeビデオは、より簡単で完全な参考資料であり、この記事の最後に埋め込まれています。) ソース

新しい研究では、半分に新しいデータセットを作成しました。これには、約350のオリジナルの現実世界と合成シーンが含まれています。(パブリックリポジトリ*を使用して)専用の機器でキャプチャされたものや、オープンソースのBlender 3Dフレームワークを中心としたワークフローにリパーパースされたものがあります。

ハイブリッドのビデオオブジェクト除去(VOR)データセットは、EffectEraseアプリケーションの基礎となります。これは、Wan2.1ビデオ生成システムの上に構築されています。このシステムは、VOR EvalVOR Wildという2つの新しい関連ベンチマークも定義しています。どちらも、グラウンドトゥルースのある/ないサンプル用です。

(この論文には付属のプロジェクトサイトがありますが、複数のハイレゾビデオで過負荷になっており、読み込みが困難です。したがって、上記にカーソルを合わせて埋め込んだビデオの抜粋を参照してください。プロジェクトサイトの使用が困難な場合は、

新しいオファリングに関して、比較可能な以前のデータセットの数量の比較。ソース - https://arxiv.org/pdf/2603.19224

新しいオファリングに関して、比較可能な以前のデータセットの数量の比較。 ソース

研究者は、量的指標と質的結果の両方で、人間の研究を通じて判断された、最先端のパフォーマンスを達成したと主張しています。

彼らは、以前の研究がオブジェクトの付随的な影響、たとえば影や反射を除去することに常に成功していないこと、そして彼らのデータセットがこの欠点を改善するために慎重に作成されたことを指摘しています。

以前のアプローチが、除去対象のオブジェクトに加えて、影や反射などの二次的な兆候を見過ごすことの例。

以前のアプローチが、除去対象のオブジェクトに加えて、影や反射などの二次的な兆候を見過ごすことの例。

新しい論文は、EffectErase: 共有ビデオオブジェクト除去と挿入のための高品質の効果除去と題され、復旦大学のコンピューターサイエンスと人工知能のカレッジの4人の研究者によって書かれています。

方法

ハイブリッドVORデータセットは、ビデオから人物やオブジェクトを除去する際に生じる可能性のあるすべてのシナリオを網羅するように設計されました。

VORデータセットからのペアフレームは、除去対象のオブジェクトの外観だけでなく、オクルージョン、影、照明の変化、反射、物理的変形などの影響を示す例を示しています。入力(オブジェクトあり)と除去後のクリーンな背景を示す対応する例が示されています。この記事の最後に埋め込まれたYouTubeビデオでさらに例を見ることができます。

VORデータセットからのペアフレームは、除去対象のオブジェクトの外観だけでなく、オクルージョン、影、照明の変化、反射、物理的変形などの影響を示す例を示しています。入力(オブジェクトあり)と除去後のクリーンな背景を示す対応する例が示されています。この記事の最後に埋め込まれたYouTubeビデオでさらに例を見ることができます。

著者は、5つの代表的な「干渉」のタイプを定義しています。オクルージョン(さまざまな種類のガラスや煙によるオクルージョンを含む)、影、照明(オブジェクトが除去されるときに光の経路を作成または変更する場合など)、反射、変形(たとえば、クッションに残る使用者の痕跡など)です。

VORのデータセット構築パイプライン。Blenderで生成されたシンセティックシーンとリアルワールドのキャプチャを組み合わせて、シンセティックデータをカーソル3D環境、オブジェクト、カメラトラジェクトリから構築し、リアルな映像をさまざまなシーンで記録し、ケン・バーンズ・モーションで拡張し、SAM2セグメンテーションと手動の精製で、対応するマスクを持つ整列された前景と背景のビデオのトリプレットを生成します。

VORのデータセット構築パイプライン。Blenderで生成されたシンセティックシーンとリアルワールドのキャプチャを組み合わせて、シンセティックデータをカーソル3D環境、オブジェクト、カメラトラジェクトリから構築し、リアルな映像をさまざまなシーンで記録し、ケン・バーンズ・モーションで拡張し、SAM2セグメンテーションと手動の精製で、対応するマスクを持つ整列された前景と背景のビデオのトリプレットを生成します。

リアルワールドのオリジナルデータについては、広範な環境、時間帯、天候条件をカバーする「あり」と「なし」のシーンを記録するために、固定カメラを使用しました。

シンセティックデータについては、複数の視点をレンダリングし、複数のオブジェクトシナリオを作成し、実際の映像で発生する可能性のある複雑で挑戦的なカメラ動作を特に含めました。研究者は、このアプローチが、ROSE(Remove Objects with Side Effects in Videos)データセットに使用されたものよりも洗練され、労力がかかっていることを指摘しています。

運動の多様性を高めるために、カメラで撮影されたペアにケン・バーンズ・エフェクトを適用し、制御されたパン、ズーム、軽微なハンドヘルド・モーションを14の事前定義されたルールに従って追加し、各ペアで5つのモーション・パターンをサンプリングしましたが、元のフレーム内にクロップを維持しました。

スケールと多様性をさらに拡大するために、シンセティック・オブジェクトを複数のカメラ設定で組み合わせ、セグメンテーション2(SAM2)でマスクを生成し、結果をクリーンアップおよび精製し、検証された前景、背景、そしてマスクのトリプレットをトレーニング用にアセンブルしました。

最終的なコレクションは、60,000本のペアのビデオ、リアルとシンセティックを合わせて、145時間のビデオに及ぶもので、443のシーンに366のオブジェクト・クラスが含まれています。

EffectEraseネットワークは、変分オートエンコーダー(VAE)を介して素材を摂取し、潜在的なノイズをWan2.1で処理します。このバックボーン上で、EffectEraseは、除去挿入ジョイント・ラーニングを実行します。これは、同じ領域で両方のタスクを同時にトレーニングします。さらに、タスク認識領域ガイダンス(TARG)を使用します。これは、オブジェクトとタスク・トークンをクロス・アテンションで組み合わせて、オブジェクトとその効果の間の時空間的リンクをモデル化し、タスクの切り替えを可能にします。また、効果の一貫性損失を使用します。これは、除去と挿入タスクの間で効果領域を整列させ、両方のタスクが同じ領域に焦点を当てるようにします。

EffectEraseフレームワークのスキーマ。トレーニング中に、ペアのビデオは共有された潜在的な空間にエンコードされ、ノイズと結合され、タスク認識クロス・アテンションに導かれた拡散トランスフォーマーで処理され、効果の一貫性損失は除去と挿入領域を整列させ、両方のタスクが同じ領域に焦点を当てるようにします。

EffectEraseフレームワークのスキーマ。トレーニング中に、ペアのビデオは共有された潜在的な空間にエンコードされ、ノイズと結合され、タスク認識クロス・アテンションに導かれた拡散トランスフォーマーで処理され、効果の一貫性損失は除去と挿入領域を整列させ、両方のタスクが同じ領域に焦点を当てるようにします。

除去と挿入プロセスは、共有された拡散バックボーンを使用して一緒にトレーニングされ、モデルは同じ影響を受ける領域と構造的ヒントに焦点を当てることを学びます。

オブジェクト、背景のみのビデオ、そしてマスクは、潜在的な空間にエンコードされます。ノイズは拡散トレーニングのために追加され、モデルはタスク固有のガイダンスの下でクリーンな表現を回復することを学びます。軽量アダプターは、ノイズのある機能を除去または挿入条件と組み合わせ、両方のタスクが監督を共有しながら、制御可能なまま維持します。

タスク認識領域ガイダンスは、言語トークンと前景オブジェクトから抽出された視覚的な特徴を組み合わせて、タスク固有の信号を作成します。視覚的な特徴は、CLIPを使用して抽出され、実際の画像コンテンツから派生した埋め込みによって、汎用的なオブジェクト・トークンが置き換えられます。この組み合わせされた表現は、クロス・アテンションを介してバックボーンに注入され、モデルはオブジェクトとその視覚的な効果が空間と時間を通じてどのように進化するかを追跡し、除去と挿入の間で柔軟に切り替えることを可能にします。

効果の一貫性損失は、除去と挿入プロセスが同じ変更された領域に焦点を当てることを強制します。両方のタスクは同じオブジェクトとその視覚的な効果を扱うからです。各ブランチからのアテンション・マップは、オブジェクトと背景のビデオから計算された差分マップと整列されたソフトな領域マップに結合され、微妙な変化 such as 照明や影が保存されます。この追加の損失は、挿入が除去を誘導し、両方のタスクを一貫性のあるものにします。

データとテスト

研究者は、さまざまなインペイント、ビデオインペイント、オブジェクト除去方法と比較してアプローチをテストしました:OmniPaintObjectClearVACEDiffuEraserProPainterROSE;およびMiniMax-Remover

Wan2.1は、LoRA††を使用して、VORデータセットで832x480pxの解像度でファインチューンされました。トレーニングには、81フレーム(WANの有効限界、その後エラーが発生する傾向がある)がランダムにサンプリングされ、バッチサイズ8の8つのH100 GPUで129,000イテレーションでトレーニングされました。学習率は1×102に設定され、LoRAランクは256に設定されました。

ROSE-Benchmarkシンセティック・コレクションは、テストされた唯一の外部データセットでした。他の2つは、VOR-Evalでした。VORデータセットのテスト用に分割されたものです。VOR-Wildは、195本のインターネットからスクラップした「動的オブジェクト」を含むリアルビデオのテストセットでした。

使用された指標は、ピーク信号対雑音比(PSNR)構造類似性指数(SSIM)学習された感覚画像パッチ類似性(LPIPS);およびフレッチェ・ビデオ距離(FVD)でした。VOR-Wildからの195本の生成ビデオのユーザー研究も考慮され、20人のボランティアからの平均評価が考慮されました。

さらに、著者は、Qwen-VLの多モーダル・モデルを利用する、QScoreという指標を考案しました。これは、除去されたオブジェクトのビデオ・アウトプットの品質を、除去されたオブジェクトの残留物や環境の除去の欠陥(影や照明効果など)に関する観点から評価するために使用されます。

ROSEおよびVORベンチマークでの量的比較。最良および2番目の結果はそれぞれ太字および下線で示されています。

ROSEおよびVORベンチマークでの量的比較。最良および2番目の結果はそれぞれ太字および下線で示されています。

これらの結果について、著者は以下のことを指摘しています。

「現在の画像インペイント方法は、2Dモデルを使用して個々のフレームで動作し、時間的一貫性を維持できないため、ビデオでは機能しません。

「最近のビデオインペイント方法は、オブジェクトの副作用を明示的にモデル化していないため、除去結果が自然でないことがあります。既存のビデオオブジェクト除去方法は、オブジェクトとその副作用の間の時空間的相関をモデル化していないため、除去されたオブジェクトの残留物やアーティファクトを残すことがあります。」

「一方、EffectEraseは、除去対象のオブジェクトとその関連する効果を除去することで、クリーンで一貫性のある結果を生成します。EffectEraseは、すべてのデータセットと評価指標で最先端のパフォーマンスを達成し、ビデオの品質指標であるFVDで最高のスコアを獲得し、生成されたビデオの時間的スムーズ性と一貫性を示しています。」

「EffectEraseは、QScoreとユーザーからのフィードバックの評価でも最高のスコアを獲得し、視覚的に納得のいく除去結果を生成する能力をさらに示しています。」

質的評価のために、論文には静的な結果が示されています(以下に示す)。また、プロジェクト・サイトと付属のYouTubeビデオでも動的な結果を見ることができます。

VOR-Evalでの質的比較。オクルージョン、影、照明、反射、変形のケース。インペイント方法はマスクの外側の効果を除去するのに苦労し、除去モデルはしばしば目に見えるアーティファクトを残します。EffectEraseは、除去対象のオブジェクトとその効果をよりクリーンに除去します。より高解像度の画像とビデオの例については、ソース論文とプロジェクト・サイトを参照してください。

VOR-Evalでの質的比較。オクルージョン、影、照明、反射、変形のケース。インペイント方法はマスクの外側の効果を除去するのに苦労し、除去モデルはしばしば目に見えるアーティファクトを残します。EffectEraseは、除去対象のオブジェクトとその効果をよりクリーンに除去します。より高解像度の画像とビデオの例については、ソース論文とプロジェクト・サイトを参照してください。

著者は以下のことを述べています。

「ビデオインペイント方法は、除去されたオブジェクトの副作用を完全に除去することに苦労し、除去されたオブジェクトの残留物やアーティファクトを残すことがあります。ROSEやMinMax-Removerなどの以前のオブジェクト除去アプローチは、除去対象のオブジェクトを除去するのに効果的ですが、特にオクルージョン、影、照明、反射、変形のシナリオでは、副作用を除去するのに苦労します。」

「一方、EffectEraseは、除去対象のオブジェクトとその関連する効果を除去することで、クリーンで一貫性のある結果を生成します。」

結論として、研究者は、EffectEraseを挿入タスクにも適応させることができ、追加のトレーニングは不要であることを観察しています。

ビデオオブジェクト挿入結果。EffectEraseは、背景コンテンツを保存し、影や反射などのオブジェクトに誘発される効果を一貫して生成します。

ビデオオブジェクト挿入結果。EffectEraseは、背景コンテンツを保存し、影や反射などのオブジェクトに誘発される効果を一貫して生成します。

挿入タスクのビデオ結果は、特定の時間に埋め込まれたYouTubeビデオ(およびこの記事の最後に埋め込まれたもの)で見ることができます。

結論

類似のプロジェクトを文学で調べると、多くの研究者が、将来、汎用のVFXモデルがこのような機能を単一の「ツールキット」モデルに統合できることを期待していることがわかります。

しかし、「万能の道具」の原則に基づいて、専用のシステムであるEffectEraseのようなものが、より一般的なアプローチよりも優位性を維持し続ける可能性が高いと考えられます。ただし、その差は将来にわたって縮小する可能性があり、差があっても効果的ではない可能性があります。

 

* IPの出典に関する懸念が増大していることを考えると、すべてのソースが引用されることを希望します。しかし、新しい研究で使用されている3Dモデルの出典をリストした資料を見つけることができませんでした。

提供された参考文献は、2013年の一般的な解説テキストです。特定のVAEについては詳細がありません。

†† 論文から引用したものですが、ファインチューニングとLoRAは異なるプロセスであり、非常に異なる要求があります。

2026年3月21日土曜日初版。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai