Andersonの視点

シーンを理解するAI画像マッティング

mm
Unite.AI を Google の優先ソースに追加

2003年に発売されたDVD版『Alien3(1992)』の特典ドキュメンタリーで、視覚効果の伝説であるリチャード・エドランドは、1930年代後期から1980年代後期にかけて視覚効果作業を支配したフォトケミカル・マット抽出の「相撲取り」のような恐ろしさを語った。エドランドはこのプロセスの当てはまりと外れがある性質を「相撲取り」に例え、1990年代初頭にデジタルの青・緑スクリーン技術が台頭したことと比較した(そして彼は戻った)。

前景要素(人物や宇宙船モデルなど)を背景から抽出し、切り抜いた画像を別の背景プレートに合成できるようにする手法は、もともと前景オブジェクトを均一な青または緑の背景の前で撮影することで実現されていた。

Laborious photochemical extraction processes for a VFX shot by ILM for 'Return of the Jedi' (1983).

ILMが『Return of the Jedi』(1983)で行ったVFXショットの手間のかかるフォトケミカル抽出プロセス。

得られた映像では、背景色が化学的に分離され、テンプレートとして使用され、前景オブジェクト(または人物)を光学プリンターで再印刷し、透明なフィルムセル内に「浮き」オブジェクトとして配置した。

このプロセスはカラー分離オーバーレイ(CSO)と呼ばれていたが、最終的には1970年代から1980年代の低予算テレビ制作で使用された粗い‘Chromakey’映像効果と結びつくようになった。

A demonstration of Color Separation Overlay in 1970 for the British children's show 'Blue Peter'. Source: https://www.bbc.co.uk/archive/blue_peter_noakes_CSO/zwb9vwx[/caption]

1970年に英国の子供向け番組『Blue Peter』で行われたカラー分離オーバーレイのデモンストレーション。 Source: https://www.businessinsider.com/mary-poppins-disney-changed-movies-classic-visual-effects-green-screen-2018-12

いずれにせよ、映画でもビデオでも、抽出された映像は他の映像に挿入できるようになった。

ディズニーの特に高価で独自のsodium-vapor process(黄色にキーイングし、使用されたアルフレッド・ヒッチコックの1963年ホラー『The Birds』でも採用された)は、より鮮明でクリスプなマットを提供したが、フォトケミカル抽出は依然として手間がかかり信頼性に欠けていた。

[caption id="attachment_181256" align="alignnone" width="482"]Disney's proprietary sodium vapor extraction process required backgrounds near the yellow end of the spectrum. Here, Angela Lansbury is suspended on wires during the production of a VFX-laced sequence for 'Bedknobs and Broomsticks' (1971). Source ディズニー独自のナトリウム蒸気抽出プロセスは、スペクトルの黄色側に近い背景が必要だった。ここでは『Bedknobs and Broomsticks』(1971)のVFXシーン制作中にアンジェラ・ランズベリーがワイヤーで吊り下げられている。 Source

デジタルマッティングを超えて

1990年代、デジタル革命により化学薬品は不要となったが、緑スクリーンの必要性は残った。Photoshop のようなピクセル編集ソフトや新世代のビデオ合成スイートで、対象色の許容範囲内のピクセルを検索するだけで緑(または任意の色)背景を除去できるようになった。ほぼ瞬時に、60年にわたる光学印刷産業は歴史の闇に葬られた。

GPU 加速によるコンピュータビジョン研究の過去10年は、マット抽出を第3の時代へと導き、研究者は緑スクリーン不要で高品質なマットを抽出できるシステムの開発に取り組んでいる。Arxiv だけでも、機械学習ベースの前景抽出に関する論文が毎週掲載されている。

私たちを映像に入れる

学術界と産業界での AI 抽出への関心はすでに消費者向けにも波及しており、Zoom や Skype のフィルタで、リビングルームの背景を熱帯の島などに置き換えることができる。

しかし、最高品質のマットは依然として緑スクリーンが必要であると、Zoom が先週水曜日に指摘した。

Left, a man in front of a green screen, with well-extracted hair via Zoom's Virtual Background feature. Left, a woman in front of a normal domestic scene, with hair extracted algorithmically, less accurately, and with higher computing requirements. Source: https://support.zoom.us/hc/en-us/articles/210707503-Changing-your-Virtual-Background-image[/caption]

左:緑スクリーンの前に立ち、Zoom のバーチャル背景機能で髪がきれいに抽出された男性。右:通常の家庭シーンの前に立ち、アルゴリズムで髪が抽出されたが精度が低く、計算リソースも多く必要な女性。 Source: https://support.zoom.us/hc/en-us/articles/360043484511

さらに別の投稿 では、緑スクリーンを使用しない抽出はキャプチャデバイス側でより多くの計算リソースが必要になると警告している。

切り抜く必要性

「野外」マット抽出システム(緑スクリーン不要で人物を分離する)の品質、携帯性、リソース効率の向上は、ビデオ会議フィルタ以外の多くの分野や用途にとって重要である。

データセット開発においては、顔や全頭、全身認識の向上により、余計な背景要素が人間対象のコンピュータビジョンモデルに学習されるのを防げる。より正確な分離は、セマンティックセグメンテーション 技術を改善し、‘cat’、‘person’、‘boat’ といったドメインを区別・統合することを可能にし、VAE や トランスフォーマー ベースの画像合成システム(例:OpenAI の新しい DALL‑E 2)を向上させ、また高価な VFX パイプラインにおける手作業のロトスコーピング の必要性を削減できる。

実際、マルチモーダル(通常はテキスト/画像)手法の台頭により、’cat’ のようなドメインが画像と関連テキストの両方でエンコードされ、画像処理への応用が進んでいる。最近の例として、Text2Live アーキテクチャは、マルチモーダル(テキスト/画像)学習を用いて、クリスタルの白鳥やガラスのキリン など多様な映像を生成できる。

シーン認識AIマッティング

AI による自動マッティングの研究は、画像やビデオフレーム内の境界認識とピクセル群の評価に多く焦点を当ててきた。しかし、中国の新たな研究は、シーンのテキストベースの記述(過去 3〜4 年でコンピュータビジョン研究分野で注目を集めたマルチモーダルアプローチ)を活用し、輪郭とマット品質を向上させる抽出パイプラインを提案し、従来手法を複数の面で上回ると主張している。

[caption id="attachment_181258" align="alignnone" width="1112"]An example SPG-IM extraction (last image, lower right), compared against competing prior methods. Source: https://arxiv.org/pdf/2204.09276.pdf[/caption] 下右の画像は SPG‑IM 抽出例で、従来手法と比較したもの。 Source: https://www.unite.ai/wp-content/uploads/2022/04/foreground-extraction.jpg

抽出研究サブセクターが直面している課題は、手動アノテーションや人間の介入を極力減らす、理想的には全く不要なワークフローを実現することだ。コスト面だけでなく、さまざまな文化圏の外部クラウドワーカーが行うアノテーションや手動セグメンテーションは、画像が異なる方法でラベル付け・セグメント化される原因となり、アルゴリズムの一貫性と満足度を損なうことが指摘されている。

このことの一例が「前景オブジェクト」の主観的解釈である:

[caption id="attachment_181259" align="alignnone" width="1200"]From the new paper: prior methods LFM and MODNet ('GT' signifies Ground Truth, an 'ideal' result often achieved manually or by non-algorithmic methods), have different and variously effective takes on the definition of foreground content, whereas the new SPG-IM method more effectively delineates 'near content' through scene context. 新論文によれば、従来手法 LFM と MODNet(「GT」は手動または非アルゴリズム的に得られる理想的な Ground Truth を示す)は前景コンテンツの定義に対して異なる解釈を持つが、SPG‑IM 手法はシーンコンテキストを利用して「近接コンテンツ」をより効果的に区別できる。

この課題に対処するため、研究者は Situational Perception Guided Image Matting(SPG‑IM)という二段階パイプラインを開発した。二段階エンコーダ/デコーダ構造は、Situational Perception Distillation(SPD)と Situational Perception Guided Matting(SPGM)から構成される。

The SPG-IM architecture.

SPG‑IM のアーキテクチャ。

まず、SPD は視覚‑テキスト変換を事前学習し、画像に対応するキャプションを生成する。その後、前景マスク予測は新しい顕著性予測手法と接続することで可能になる。

続いて SPGM は、最初のモジュールで得られたマスクと生の RGB 画像入力に基づき、推定アルファマットを出力する。

目的はシーン認識によるガイダンスであり、システムは画像が何で構成されているかを文脈的に理解し、たとえば特定タスクの特徴的な髪の毛抽出を、既知の特性と照らし合わせてフレーム化できる。

In the example below, SPG-IM understands that the cords are intrinsic to a 'parachute', where MODNet fails to retain and define these details. Likewise above, the complete structure of the playground apparatus is arbitrarily lost in MODNet.

下の例では、SPG‑IM はコードが「パラシュート」の固有要素であることを理解し、MODNet はこれらのディテールを保持できない。同様に上では、遊具全体の構造が MODNet では任意に失われている。

新しい論文は Situational Perception Guided Image Matting と題され、OPPO Research Institute、PicUp.ai、Xmotors の研究者らによるものである。

インテリジェント自動マット

SPG‑IM はさらに、ローカルディテールとグローバルコンテキストを別々に処理できる Adaptive Focal Transformation(AFT)リファインメントネットワークを提供し、「インテリジェントマット」を実現する。

Understanding scene context, in this case 'girl with horse', can potentially make foreground extraction easier than prior methods.

シーンコンテキスト(この場合は「馬に乗る少女」)を理解することで、従来手法より前景抽出が容易になる可能性がある。

The paper states:

‘We believe that visual representations from the visual-to-textual task, e.g. image captioning, focus on more  semantically comprehensive signals between a)object to object and b)object to the ambient environment to generate descriptions that can cover both the global info and local details. In addition, compared with the expensive pixel annotation of image matting, textual labels can be massively collected at a very low cost.’

SPD ブランチは、ミシガン大学のVirTex トランスフォーマーベースのテキストデコーダと共同で事前学習され、セマンティックに濃密なキャプションから視覚表現を学習する。

VirTex jointly trains a ConvNet and Transformers via image-caption couplets, and transfers the obtained insights to downstream vision tasks such as object detection. Source: https://www.unite.ai/wp-content/uploads/2022/04/virtex.jpg VirTex は画像‑キャプション対を通じて ConvNet とトランスフォーマーを共同訓練し、得られた知見を物体検出などの下流ビジョンタスクに転移させる。 Source: https://arxiv.org/pdf/2006.06666.pdf

他のテストやアブレーション研究の中で、研究者は SPG‑IM を最先端のtrimap ベース手法である Deep Image Matting(DIM)、IndexNet、Context‑Aware Image Matting(CAM)、Guided Contextual Attention(GCA、FBA)および Semantic Image Mapping(SIM)と比較した。

比較対象として、trimap‑free アプローチである LFM、HAttMatting、および MODNet を含む従来フレームワークもテストした。公平な比較のため、各手法は異なる手法論に合わせて調整され、コードが入手できない場合は論文で記述されたアーキテクチャを再現した。

The new paper states:

‘Our SPG-IM outperforms all competing trimap-free methods ([LFM], [HAttMatting], and [MODNet]) by a large margin. Meanwhile, our model also shows remarkable superiority over the state-of-the-art (SOTA) trimap-based and mask-guided methods in terms of all four metrics across the public datasets (i.e. Composition-1K, Distinction-646, and Human-2K), and our Multi-Object-1K benchmark.’

And continues:

‘It can be obviously observed that our method preserves fine details (e.g. hair tip sites, transparent textures, and boundaries) without the guidance of trimap. Moreover, compared to other competing trimap-free models, our SPG-IM can retain better global semantic completeness.’

 

2022年4月24日公開。

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai