Andersonの視点

シーンを理解するAI画像マッチング

mm
Unite.AI を Google の優先ソースに追加

2003年のDVDリリースに伴う『エイリアン3』の特別ドキュメンタリーでは、視覚効果のレジェンドであるリチャード・エドランドは、1930年代後半から1980年代後半までの視覚効果作業を支配した写真化学的マット抽出の「相撲」を振り返りながら、恐怖を感じた。エドランドは、このプロセスの当たり外れの性質を「相撲」と比較し、1990年代初頭に登場したデジタルブルー/グリーンスクリーンテクニックに言及した。

フォアグラウンド要素(人物や宇宙船モデルなど)を背景から抽出して、カットアウトされた画像を背景プレートに合成できるようにすることは、もともとフォアグラウンドオブジェクトを青や緑の背景で撮影することで実現されていた。

ILMによる『ジェダイの帰還』のVFXショットの労iousな写真化学抽出プロセス。ソース:https://www.youtube.com/watch?v=qwMLOjqPmbQ

ILMによる『ジェダイの帰還』のVFXショットの労iousな写真化学抽出プロセス。ソース:https://www.youtube.com/watch?v=qwMLOjqPmbQ

結果として得られた映像では、背景色は後に化学的に分離され、光学プリンターでフォアグラウンドオブジェクト(または人物)を浮き彫りにするために使用された。

このプロセスはカラーセパレーションオーバーレイ(CSO)と呼ばれていたが、この用語は後に1970年代と1980年代の低予算テレビ番組で使用された粗いクロマキーションビデオ効果と関連付けられるようになった。

1970年のイギリスの子供向け番組『ブルーペーター』でのカラーセパレーションオーバーレイのデモンストレーション。ソース:https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

1970年のイギリスの子供向け番組『ブルーペーター』でのカラーセパレーションオーバーレイのデモンストレーション。ソース:https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx

どちらの場合でも、抽出された映像は他の映像に挿入できるようになった。

ディズニーのより高価で独自のソーダム蒸気プロセスは、より優れた定義とシャープなマットを提供したが、写真化学抽出は依然として痛みを伴い、信頼性が低かった。

ディズニーの独自のソーダム蒸気抽出プロセスは、黄色の近くにある背景が必要だった。ここでは、アンジェラ・ランズベリーが『ベッドノブとほうき』のVFXシーケンスの制作中にワイヤーで吊り下げられている。ソース

ディズニーの独自のソーダム蒸気抽出プロセスは、黄色の近くにある背景が必要だった。ここでは、アンジェラ・ランズベリーが『ベッドノブとほうき』のVFXシーケンスの制作中にワイヤーで吊り下げられている。ソース

デジタルマッチングの向こう側

1990年代にはデジタル革命が化学物質を排除したが、グリーンスクリーンの必要性は排除されなかった。グリーン(または他の色)の背景を単にその色の範囲内のピクセルを検索することで除去できるようになった。新しいビデオ合成スイートが自動的にカラード背景を除去できるようになった。

これにより、60年の光学印刷業界が一夜にして歴史に残ることとなった。

過去10年のGPUアクセラレーテッドコンピュータビジョン研究は、マッチング抽出を3つの時代に分け、グリーンスクリーンを必要とせずに高品質のマッチングを抽出できるシステムの開発を研究者に課した。Arxivでは、マシンラーニングベースのフォアグラウンド抽出に関する革新に関する論文が毎週の特集となっている。

私たちを絵に描く

このAI抽出への学術的および産業的関心は、すでに消費者空間に影響を与えている。粗いが使える実装は、すべて私たちに馴染みのあるものであり、ZoomやSkypeのフィルターは、ビデオ会議で私たちの背景をトロピカルな島々などに置き換えることができる。

しかし、最高のマッチングは依然としてグリーンスクリーンを必要とする。Zoomは先週、グリーンスクリーンを使用しないとマッチングの精度が低くなることを指摘した。

左、グリーンスクリーンの前で立っている男性、Zoomのバーチャル背景機能で髪の毛がうまく抽出されている。右、普通の家庭のシーンの前で立っている女性、アルゴリズムで髪の毛が抽出されているが、精度は低く、計算要件は高い。ソース:https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

左、グリーンスクリーンの前で立っている男性、Zoomのバーチャル背景機能で髪の毛がうまく抽出されている。右、普通の家庭のシーンの前で立っている女性、アルゴリズムで髪の毛が抽出されているが、精度は低く、計算要件は高い。ソース:https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image

Zoomのサポートプラットフォームからの別の投稿では、グリーンスクリーンを使用しない抽出も、キャプチャーデバイスでより大きな計算能力を必要とすることも警告している。

カットアウトする必要

「野外」マッチング抽出システム(グリーンスクリーンを必要とせずに人物を分離する)の品質、携帯性、リソース経済性の向上は、ビデオ会議フィルター以外の多くのセクターや追求にも関連する。

データセットの開発のためには、顔、頭全体、全身の認識の向上により、背景の余分な要素がコンピュータビジョンモデルにトレーニングされないことを保証する可能性が提供される。より正確な分離により、ドメイン(「猫」、「人」、「ボート」など)を区別して同期するセマンティックセグメンテーションテクニックが大幅に改善される。VAEやトランスフォーマーベースの画像合成システム(OpenAIの新しいDALL-E 2など)も改善される。

実際、テキスト/画像の多モーダル方法の台頭(ドメインを画像と関連するテキストでエンコードする)により、画像処理に既に影響を与えている。最近の例としては、Text2Liveアーキテクチャがあり、テキスト/画像の多モーダルトレーニングを使用して、クリスタルスワンやガラスのジラフなどのビデオを作成する。

シーン認識AIマッチング

AIベースの自動マッチングに関する多くの研究は、境界認識と画像またはビデオフレーム内のピクセルベースのグループ化の評価に焦点を当てていた。ただし、中国からの新しい研究では、シーンのテキストベースの説明(多モーダルアプローチ)を利用して、輪郭とマッチングの品質を改善する抽出パイプラインを提供している。

SPG-IM抽出の例(右下の最後の画像)、先行する方法と比較して。ソース:https://arxiv.org/pdf/2204.09276.pdf

SPG-IM抽出の例(右下の最後の画像)、先行する方法と比較して。ソース:https://arxiv.org/pdf/2204.09276.pdf

この課題は、手動の注釈や人間の介入を最小限に抑えるワークフローを生成することである。アウトソーシングされたクラウドワーカーがさまざまな文化で画像をラベル付けまたはセグメント化することで、画像が一貫性のない方法でラベル付けまたはセグメント化される可能性があるため、注釈や手動セグメンテーションにはコストの影響がある。

例として、フォアグラウンドオブジェクトの定義の主観的な解釈がある。

新しい論文からのもの:先行する方法であるLFMとMODNet(「GT」は、手動または非アルゴリズム的方法で得られる「理想的な」結果を表す)には、フォアグラウンドコンテンツの定義についてさまざまな解釈があり、有効性も異なる。一方、新しいSPG-IM方法は、シーンのコンテキストを通じて「ニアコンテンツ」をより効果的に定義する。

新しい論文からのもの:先行する方法であるLFMとMODNet(「GT」は、手動または非アルゴリズム的方法で得られる「理想的な」結果を表す)には、フォアグラウンドコンテンツの定義についてさまざまな解釈があり、有効性も異なる。一方、新しいSPG-IM方法は、シーンのコンテキストを通じて「ニアコンテンツ」をより効果的に定義する。

この問題に対処するために、研究者は、シチュエーションパーセプションディスティレーション(SPD)とシチュエーションパーセプションガイドマッチング(SPGM)からなる2ステージのパイプラインであるシチュエーションパーセプションガイドイメージマッチング(SPG-IM)を開発した。

SPG-IMアーキテクチャ

SPG-IMアーキテクチャ

まず、SPDは、画像と関連するテキストの変換を事前トレーニングし、画像に適切なキャプションを生成する。次に、フォアグラウンドマスクの予測は、新しいサリエンシ予測テクニックに接続することで可能になる。

次に、SPGMは、生のRGB画像入力と最初のモジュールで得られたマスクに基づいて推定されたアルファマッチングを出力する。

目的は、シチュエーションパーセプションガイダンスであり、システムが画像の構成についてコンテキストを理解できるようにすることである。たとえば、特定のタスクの既知の特性に対して、背景から複雑な髪の毛を抽出する課題を定義することができる。

下の例では、SPG-IMは、パラシュートのコードがパラシュートに内在するものであることを理解しているが、MODNetはこれらの詳細を保持して定義することに失敗している。同様に、上のプレイグラウンド装置の完全な構造は、MODNetで任意に失われる。

下の例では、SPG-IMは、パラシュートのコードがパラシュートに内在するものであることを理解しているが、MODNetはこれらの詳細を保持して定義することに失敗している。同様に、上のプレイグラウンド装置の完全な構造は、MODNetで任意に失われる。

新しい論文は、シチュエーションパーセプションガイドイメージマッチングと題され、OPPO Research Institute、PicUp.ai、Xmotorsの研究者によって発表された。

インテリジェントオートマチックマッチング

SPG-IMは、ローカル詳細とグローバルコンテキストを別々に処理できるアダプティブフォーカストランスフォーメーション(AFT)精製ネットワークも提供する。これにより、「インテリジェントマッチング」が可能になる。

シーンのコンテキストを理解することで、フォアグラウンド抽出を容易にすることができる。たとえば、「少女と馬」

シーンのコンテキストを理解することで、フォアグラウンド抽出を容易にすることができる。たとえば、「少女と馬」

論文では、次のように述べられている。

‘私たちは、視覚的表現が視覚的テキストタスク(たとえば、画像キャプション)から得られることが多く、オブジェクト間およびオブジェクトと周囲環境の間のより意味的に包括的な信号を生成するために使用され、グローバル情報とローカル詳細の両方をカバーする説明を生成できることを信じている。さらに、画像マッチングのピクセル注釈に比べて、テキストラベルは非常に低コストで大量に収集できる。’

SPDアーキテクチャのブランチは、ミシガン大学のVirTexトランスフォーマーベースのテキスタルデコーダーと共同で事前トレーニングされ、画像と関連するテキストのカップルから視覚的表現を学習する。

VirTexは、画像とキャプションのカップルを使用して、ConvNetとTransformerを共同でトレーニングし、オブジェクト検出などのダウンストリームのビジョンタスクに得られた知識を転送する。ソース:https://arxiv.org/pdf/2006.06666.pdf

VirTexは、画像とキャプションのカップルを使用して、ConvNetとTransformerを共同でトレーニングし、オブジェクト検出などのダウンストリームのビジョンタスクに得られた知識を転送する。ソース:https://arxiv.org/pdf/2006.06666.pdf

他のテストや削減研究の中で、研究者は、SPG-IMを、Deep Image Matting(DIM)、IndexNet、Context-Aware Image Matting(CAM)、Guided Contextual Attention(GCA)、FBA、Semantic Image Mapping(SIM)などのトライマップベースの方法と比較した。

他のテストされたフレームワークには、トライマップフリーのアプローチであるLFM、HAttMatting、MODNetが含まれた。

新しい論文では、次のように述べられている。

‘私たちのSPG-IMは、すべての競合するトライマップフリー方法(LFM、HAttMatting、MODNet)を大幅に上回っている。また、私たちのモデルは、トライマップベースとマスクガイドの方法と比較して、すべての4つのメトリックで優位性を示している。さらに、私たちの方法は、トライマップのガイダンスなしで、ヘアの先端サイト、透明なテクスチャ、境界などの細部を保存できる。競合するトライマップフリーのモデルと比較して、私たちのSPG-IMは、より優れたグローバルセマンティック完璧性を保持できる。’

そして続けて言う。

‘明らかに私たちの方法は、トライマップのガイダンスなしで、ヘアの先端サイト、透明なテクスチャ、境界などの細部を保存できる。さらに、競合するトライマップフリーのモデルと比較して、私たちのSPG-IMは、より優れたグローバルセマンティック完璧性を保持できる。’

 

2022年4月24日初出。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai