Andersonの視点
シーンを理解するAI画像マッティング

2003年に発売されたDVD版『Alien3(1992)』の特典ドキュメンタリーで、視覚効果の伝説であるリチャード・エドランドは、1930年代後期から1980年代後期にかけて視覚効果作業を支配したフォトケミカル・マット抽出の「相撲取り」のような恐ろしさを語った。エドランドはこのプロセスの当てはまりと外れがある性質を「相撲取り」に例え、1990年代初頭にデジタルの青・緑スクリーン技術が台頭したことと比較した(そして彼は戻った)。
前景要素(人物や宇宙船モデルなど)を背景から抽出し、切り抜いた画像を別の背景プレートに合成できるようにする手法は、もともと前景オブジェクトを均一な青または緑の背景の前で撮影することで実現されていた。
ILMが『Return of the Jedi』(1983)で行ったVFXショットの手間のかかるフォトケミカル抽出プロセス。
得られた映像では、背景色が化学的に分離され、テンプレートとして使用され、前景オブジェクト(または人物)を光学プリンターで再印刷し、透明なフィルムセル内に「浮き」オブジェクトとして配置した。
このプロセスはカラー分離オーバーレイ(CSO)と呼ばれていたが、最終的には1970年代から1980年代の低予算テレビ制作で使用された粗い‘Chromakey’映像効果と結びつくようになった。
1970年に英国の子供向け番組『Blue Peter』で行われたカラー分離オーバーレイのデモンストレーション。 Source: https://www.businessinsider.com/mary-poppins-disney-changed-movies-classic-visual-effects-green-screen-2018-12
いずれにせよ、映画でもビデオでも、抽出された映像は他の映像に挿入できるようになった。
ディズニーの特に高価で独自のsodium-vapor process(黄色にキーイングし、使用されたアルフレッド・ヒッチコックの1963年ホラー『The Birds』でも採用された)は、より鮮明でクリスプなマットを提供したが、フォトケミカル抽出は依然として手間がかかり信頼性に欠けていた。
[caption id="attachment_181256" align="alignnone" width="482"]デジタルマッティングを超えて
1990年代、デジタル革命により化学薬品は不要となったが、緑スクリーンの必要性は残った。Photoshop のようなピクセル編集ソフトや新世代のビデオ合成スイートで、対象色の許容範囲内のピクセルを検索するだけで緑(または任意の色)背景を除去できるようになった。ほぼ瞬時に、60年にわたる光学印刷産業は歴史の闇に葬られた。
GPU 加速によるコンピュータビジョン研究の過去10年は、マット抽出を第3の時代へと導き、研究者は緑スクリーン不要で高品質なマットを抽出できるシステムの開発に取り組んでいる。Arxiv だけでも、機械学習ベースの前景抽出に関する論文が毎週掲載されている。
私たちを映像に入れる
学術界と産業界での AI 抽出への関心はすでに消費者向けにも波及しており、Zoom や Skype のフィルタで、リビングルームの背景を熱帯の島などに置き換えることができる。
しかし、最高品質のマットは依然として緑スクリーンが必要であると、Zoom が先週水曜日に指摘した。
左:緑スクリーンの前に立ち、Zoom のバーチャル背景機能で髪がきれいに抽出された男性。右:通常の家庭シーンの前に立ち、アルゴリズムで髪が抽出されたが精度が低く、計算リソースも多く必要な女性。 Source: https://support.zoom.us/hc/en-us/articles/360043484511
さらに別の投稿 では、緑スクリーンを使用しない抽出はキャプチャデバイス側でより多くの計算リソースが必要になると警告している。
切り抜く必要性
「野外」マット抽出システム(緑スクリーン不要で人物を分離する)の品質、携帯性、リソース効率の向上は、ビデオ会議フィルタ以外の多くの分野や用途にとって重要である。
データセット開発においては、顔や全頭、全身認識の向上により、余計な背景要素が人間対象のコンピュータビジョンモデルに学習されるのを防げる。より正確な分離は、セマンティックセグメンテーション 技術を改善し、‘cat’、‘person’、‘boat’ といったドメインを区別・統合することを可能にし、VAE や トランスフォーマー ベースの画像合成システム(例:OpenAI の新しい DALL‑E 2)を向上させ、また高価な VFX パイプラインにおける手作業のロトスコーピング の必要性を削減できる。
実際、マルチモーダル(通常はテキスト/画像)手法の台頭により、’cat’ のようなドメインが画像と関連テキストの両方でエンコードされ、画像処理への応用が進んでいる。最近の例として、Text2Live アーキテクチャは、マルチモーダル(テキスト/画像)学習を用いて、クリスタルの白鳥やガラスのキリン など多様な映像を生成できる。
シーン認識AIマッティング
AI による自動マッティングの研究は、画像やビデオフレーム内の境界認識とピクセル群の評価に多く焦点を当ててきた。しかし、中国の新たな研究は、シーンのテキストベースの記述(過去 3〜4 年でコンピュータビジョン研究分野で注目を集めたマルチモーダルアプローチ)を活用し、輪郭とマット品質を向上させる抽出パイプラインを提案し、従来手法を複数の面で上回ると主張している。
[caption id="attachment_181258" align="alignnone" width="1112"] 下右の画像は SPG‑IM 抽出例で、従来手法と比較したもの。 Source: https://www.unite.ai/wp-content/uploads/2022/04/foreground-extraction.jpg
抽出研究サブセクターが直面している課題は、手動アノテーションや人間の介入を極力減らす、理想的には全く不要なワークフローを実現することだ。コスト面だけでなく、さまざまな文化圏の外部クラウドワーカーが行うアノテーションや手動セグメンテーションは、画像が異なる方法でラベル付け・セグメント化される原因となり、アルゴリズムの一貫性と満足度を損なうことが指摘されている。
このことの一例が「前景オブジェクト」の主観的解釈である:
[caption id="attachment_181259" align="alignnone" width="1200"]この課題に対処するため、研究者は Situational Perception Guided Image Matting(SPG‑IM)という二段階パイプラインを開発した。二段階エンコーダ/デコーダ構造は、Situational Perception Distillation(SPD)と Situational Perception Guided Matting(SPGM)から構成される。
まず、SPD は視覚‑テキスト変換を事前学習し、画像に対応するキャプションを生成する。その後、前景マスク予測は新しい顕著性予測手法と接続することで可能になる。
続いて SPGM は、最初のモジュールで得られたマスクと生の RGB 画像入力に基づき、推定アルファマットを出力する。
目的はシーン認識によるガイダンスであり、システムは画像が何で構成されているかを文脈的に理解し、たとえば特定タスクの特徴的な髪の毛抽出を、既知の特性と照らし合わせてフレーム化できる。

下の例では、SPG‑IM はコードが「パラシュート」の固有要素であることを理解し、MODNet はこれらのディテールを保持できない。同様に上では、遊具全体の構造が MODNet では任意に失われている。
新しい論文は Situational Perception Guided Image Matting と題され、OPPO Research Institute、PicUp.ai、Xmotors の研究者らによるものである。
インテリジェント自動マット
SPG‑IM はさらに、ローカルディテールとグローバルコンテキストを別々に処理できる Adaptive Focal Transformation(AFT)リファインメントネットワークを提供し、「インテリジェントマット」を実現する。
The paper states:
‘We believe that visual representations from the visual-to-textual task, e.g. image captioning, focus on more semantically comprehensive signals between a)object to object and b)object to the ambient environment to generate descriptions that can cover both the global info and local details. In addition, compared with the expensive pixel annotation of image matting, textual labels can be massively collected at a very low cost.’
SPD ブランチは、ミシガン大学のVirTex トランスフォーマーベースのテキストデコーダと共同で事前学習され、セマンティックに濃密なキャプションから視覚表現を学習する。
VirTex は画像‑キャプション対を通じて ConvNet とトランスフォーマーを共同訓練し、得られた知見を物体検出などの下流ビジョンタスクに転移させる。 Source: https://arxiv.org/pdf/2006.06666.pdf
他のテストやアブレーション研究の中で、研究者は SPG‑IM を最先端のtrimap ベース手法である Deep Image Matting(DIM)、IndexNet、Context‑Aware Image Matting(CAM)、Guided Contextual Attention(GCA、FBA)および Semantic Image Mapping(SIM)と比較した。
比較対象として、trimap‑free アプローチである LFM、HAttMatting、および MODNet を含む従来フレームワークもテストした。公平な比較のため、各手法は異なる手法論に合わせて調整され、コードが入手できない場合は論文で記述されたアーキテクチャを再現した。
The new paper states:
‘Our SPG-IM outperforms all competing trimap-free methods ([LFM], [HAttMatting], and [MODNet]) by a large margin. Meanwhile, our model also shows remarkable superiority over the state-of-the-art (SOTA) trimap-based and mask-guided methods in terms of all four metrics across the public datasets (i.e. Composition-1K, Distinction-646, and Human-2K), and our Multi-Object-1K benchmark.’
And continues:
‘It can be obviously observed that our method preserves fine details (e.g. hair tip sites, transparent textures, and boundaries) without the guidance of trimap. Moreover, compared to other competing trimap-free models, our SPG-IM can retain better global semantic completeness.’
2022年4月24日公開。
















