Andersonの視点
AIの背景除去を高精度化するための新しいアプローチ

新しい研究によると、AIは高品質の画像と動画から背景を除去できることがわかった。さらに、従来の手法に比べて、コストと時間が大幅に削減された。
ビデオチャットプラットフォームで背景を変更する機能を使用したことがある人なら、簡単な背景変更フィルタの限界を感じたことがあるかもしれない。そうしたシステムは、ビデオ会議で最も頻繁に発生するケースに基づいてトレーニングされているため、予期せぬものや、指のような予測可能なオブジェクトに対しては、ロバスト性が不足していることが多い。

AIトレーニングされたフォアグラウンド抽出システムがソースサブジェクトの多くを切り取る典型的な例。 ソース
最も簡単な解決策は、既存のモデルを微調整することである。ただし、ビジョン言語モデル(VLMs)がこのタスクに特にトレーニングされていない場合、データの微調整が必要となる。
2020年の論文「Real-Time High-Resolution Background Matting」で提示された解決策を裏付ける2つの高容量の厳密に注釈付けされたデータセット。 ソース
しかし、データの注釈付けには、費用と時間がかかる。さらに、結果として得られるツールは特定のタスクに特化しており、汎用性が低い。
これまでのところ、特定のモデルを開発する最も短い方法は、教師なし学習に頼ることである。しかし、多くの場合、これらのアプローチは問題を単に別の場所に移動させているに過ぎない。
現在、Zoomなどのプラットフォームでは、グリーンスクリーンを使用することを推奨しているが、これは面倒でプロフェッショナルな解決策である。
カットアウト!
最近、セグメント(SAM)ファミリーを使用して、自動で詳細な抽出を行うことに興味が高まっている。SAMは、タスクに特化したものではなく、アノテーションを支援するために開発されたものである。
必要に応じてクリックして再生してください。 セグメントアニーサンプル – アノテーションには適しているが、VFXドロップアウトには十分ではない。ソース
中国からの最新の提案では、SAMモデルを使用して優れた抽出プロセスを取得するためのより洗練された方法が提示されている。特に、SAMに基づくトラッカーと、専用のマッティングヘッドを備えたリージョン提案ブリッジを組み合わせることで、エッジの詳細を反復的に改善し、髪の毛などの複雑なエッジを解決できる。
必要に応じてクリックして再生してください。 提案された方法の補足ビデオ – 作者の抽出方法の洗練度を示す。ソース
重要な点は、新しいコンポジットシステムが画像のみでトレーニングされ、追加の人間によるアノテーションが不要であることである。従来の障害であるアノテーションのコストが排除されたことになる。
新しい方法で達成された画像と動画のマッティングの例。髪の毛、半透明、動きなどの課題的なケースと、インザワイルドシーケンスでのクリーンで安定した結果が示されている。 ソース
3つの実験モデルを生成し、作者はこのタスクで新しい状態を達成し、ベースモデルの汎用性を維持したと主張している。つまり、特定のタスクに特化したツールではなく、汎用性の高いモデルが得られたことになる。
著者は以下のように述べている。
‘包括的な実験により、SAM2Mattingが画像と動画のマッティングの両方で最先端のパフォーマンスを達成していることが示された。’
‘広範なインザワイルド結果はさらに、急速な動き、複雑な背景、ターゲットの付属物(例:自転車に乗る人)が存在するオープンワールドシナリオへの強い汎用性を示している。’
‘さらに、私たちのマッティングコンポーネントは軽量で効率的であり、SAM2.1-Tinyバリアントは5GB未満のGPUメモリを使用して、1080pの200フレームのビデオで40fpsで実行できる。’
新しい論文「SAM2Matting:汎用化された画像と動画のマッティング」は、復旦大学と上海財経大学の4人の著者によって執筆された。GitHubリポジトリには、さまざまなバリアントのチェックポイント、推論コード、およびインタラクティブなデモが公開されており、トレーニングコードの公開も予定されている。また、プロジェクトサイトもある。
方法
著者の方法では、トラッキングと詳細抽出を分離することで、ビデオオブジェクトセグメンテーション(VOS)トラッカーを使用して各フレームの時間的に一貫した粗いマスクを生成し、専用のマッティングパイプラインで境界を精密化する。

パイプラインの概要。柔軟なプロンプトと入力ビデオがVOSトラッカーにフィードされ、粗いマスクを生成し、ROI検出器によって精密化され、トリマップに変換され、最後にプログレッシブマルチスケール予測器によって高詳細マットが生成される。
リージョンオブインタレスト(ROI)検出器は、詳細抽出や半透明性のある領域を特定し、それらをトリマップ(前景、背景、不確実な領域を分割する3領域マスク)に変換し、精密化を導く。
従来のマッティングシステムでは、単純な形態学的演算や、マスクの直接再利用を使用して、関心領域を導出するが、これらのアプローチでは、詳細が見落とされたり、不要な領域が含まれたりすることがある。
標準のマスクベース処理とグラウンドトゥルーストリマップの比較。単純な形態学的演算では、細かい構造や半透明性を欠いた粗い境界が生成され、最終的なマットでは詳細が失われる。
複利
一方、提案されたROI検出器は、このステップをピクセル単位の分類タスクとして扱い、VOSマスク、現在のフレーム、及びマルチスケール画像特徴を統合して、より正確にマッティングクリティカル領域を分離する。
新しいアプローチでは、予測されたROIはまず疑似トリマップに変換され、トラッカーのマスクを使用して既知の領域を割り当て、ROIを曖昧な領域としてマークする。したがって、後の処理は境界の詳細を解決することに集中できる。
精密化は、ステップワイズプロセスとして扱うプログレッシブアルファ予測器によって処理される。各ステージでは、画像、トリマップ、及び前の推定値を使用して構造を徐々に精密化し、髪の毛や半透明性などの細かい詳細を回復する。
最終段階では、最高解像度の出力がアップサンプリングされて完成したマットが生成され、広い形状は早期に確立され、細かい要素は後のパスで解決される。
トレーニング中、VOSトラッカーは固定され、マッティングコンポーネントのみが高品質の画像データでトレーニングされた。つまり、詳細抽出はトラッキングの一貫性を損なうことなく精密化された。
サンプションは各フレームごとに適用され、関心領域はグラウンドトゥルースアルファマットから導出され、学習を導くために使用された。ROI検出器は、境界の分類を正確に行い、ギザギザしたアーティファクトを減らすように設計された損失でトレーニングされた。
アルファ推定の場合、複数のスケールで損失が適用され、詳細を徐々に改善し、予測マットを元のマスクと一致させる追加の制約が付け加えられた。これにより、構造が保持され、中空または破損した領域が最終出力で防止された。
データとテスト
8つの画像マッティングデータセットが初期の試験に使用された。
試験では、I-HIM50K、P3M-10k、CelebAHairMask-HQ、AIM-500、Distinctions-646、AM-2K、UHRIM、RefMatteが使用された。また、SAM2Mattingアプローチの3つのバリアントがVOSトラッキングとして開発された。
トラッカーコンポーネントは固定され、マッティングコンポーネントのみが最適化された。すべてのバージョンは、4つのNVIDIA A6000 GPU(各々48GBのVRAM)で5エポックにわたってトレーニングされた。バッチサイズは32で、AdamWオプティマイザが使用された。評価に使用されたメトリックは、平均絶対差(MAD)、平均二乗誤差(MSE)、グラデーション(Grad)、接続性(Conn)、dtSSD(動画マッティングのみ)であった。
数量テスト
作者は、画像マッティングの新しいシステムを、P3M-500-NP、AM-2K(結果では「GFM」と表記)、MAM(結果では「Matte Anything」と表記)、E2E-HIM、Lightweight、PPM-100(結果では「MODNet」と表記)などのベンチマークで評価した。
P3M-500-NP、AM-2Kテスト、PPM-100での数量結果。すべてのメトリックで低い値が良く、最良、2番目、3番目の結果はそれぞれ赤、オレンジ、黄色で強調表示される。
これらの結果について、論文では以下のように述べられている。
‘上記の結果から、SAM2Mattingの3つのバリアントがすべて、異なるメトリックで一貫して以前のベースラインを上回っていることがわかる。たとえば、SAM2.1-TinyバリアントはP3M-500-NPでMAMよりも11.48低いMADを達成している。’
著者は、結果はアプローチの核心的な概念設計によるものであり、データのキュレーションのレベルによるものではないと主張している。
動画マッティングの場合、SAM2MattingはV-HIM60とVideoMatteでゼロショット設定で評価され、MatAnyone2、MatAnyone、MaGGIe、FTP-VM、RVMなどの動画トレーニング済みシステムと比較された。中級とハードスプリットの両方で一貫した改善が報告された。
すべてのベンチマークで、3つのバリアントはMAD、MSE、Grad、Conn、dtSSDで低いエラーを記録し、SAM3が最も強力な結果を達成した。さらに、最も低いdtSSD値はフレーム間の安定性が高いことを示唆している。
V-HIM60とVideoMatteでの動画マッティングベンチマークの数量結果。すべてのメトリックで低い値が良く、最良、2番目、3番目の結果はそれぞれ赤、オレンジ、黄色で強調表示される。
著者は、これらの結果は、VOSトラッカーが時間的な構造を維持し、マッティングモジュールが境界の詳細に集中しているため、画像トレーニング済みモデルが完全に監視された動画アプローチを上回ることができることを示唆している。
質的テスト
人間のマッティングに関する質的テストでは、SAM2Mattingが競合するベースラインを上回った。
人間とインザワイルド動画マッティングの質的比較。SAM2MattingはRVMとMatAnyoneよりも細かい髪の毛や半透明な領域をより正確に保存している。
現存する動画マッティングシステム、たとえばMatAnyone2やMaGGIeは、ドメイン固有のデータセット、特に人間を中心としたデータセットでトレーニングされているため、インザワイルドシーケンス、特に動きの速いサブジェクトや半透明な物体に対しては汎用性が低いことがわかった。
インザワイルドシーケンスの質的比較。SAM2MattingはMatAnyone2やMaGGIeよりも非人間のサブジェクト、急速な動き、半透明な要素に対して、より細かい構造と時間的一貫性を保存する。
一方、SAM2Mattingはこれらの課題的なシナリオで安定したトラッキングと、細かい詳細の抽出を維持することができた。
最後に、以下の図からもわかるように、SAM2Mattingは、自転車に乗った人やスキーポールを持った人などの、付属物を伴うターゲットを効果的に処理し、近くの背景のノイズを抑制し、フレーム間でクリーンなシルエットを維持することができた。
付属物と背景ノイズのあるシーケンスの質的比較。SAM2MattingはMatAnyone2よりも、自転車やスキーポールなどの構造をより正確に保存し、近くのクルマを抑制し、フレーム間でクリーンなシルエットを維持する。
結論
新しい論文で示された成果は、抽出がコンピュータビジョンの最も古いタスクの1つでありながら、依然として解決されていないことを示している。多くのビジョンベースのモデルと同様に、問題は、抽出アルゴリズムがドメイン知識に固執し、未知のオブジェクトに簡単に適応できないことにある。このタスクは、モデルが一般化するための限界を引き出す。
新しい研究は、この依存関係から一歩前進したものであるが、まだ長い道のりがある。特に、このタスクは私たちの日常生活に、ビデオチャットポータルを通じて深く根付いていることを考えると如此である。
初版は2026年7月13日に公開された。












