Andersonの視点

AIを用いた「よりよい」身体の創出

mm
Unite.AI を Google の優先ソースに追加

アリババのDAMOアカデミーによる新しい研究では、画像の身体のリシェイピングを自動化するためのAI駆動型ワークフローが提供されています。これは、現在、ディープフェイクやGANベースの顔編集などの顔ベースの操作に占められているコンピュータビジョン分野における希少な取り組みです。

結果の列に、修正される領域を定義する生成されたアテンションマップを挿入。ソース:https://arxiv.org/pdf/2203.04670.pdf

結果の列に、修正される領域を定義する生成されたアテンションマップを挿入。ソース:https://arxiv.org/pdf/2203.04670.pdf

研究者のアーキテクチャは、スケルトンポーズ推定を使用して、画像の合成と編集システムが既存の身体画像を概念化し、パラメータ化する際に直面する複雑さに対処しています。

推定スケルトンマップは、修正される領域である上腕部などの身体の部分に焦点を当て、個別化します。

システムは最終的に、ユーザーがパラメータを設定して、写真の人物の体重、筋肉量、または体重分布の外観を変更できるようにします。また、衣服を着たまたは着ていない身体の部分に任意の変換を生成することができます。

左、入力画像;中、導出されたアテンション領域のヒートマップ;右、変換された画像。

左、入力画像;中、導出されたアテンション領域のヒートマップ;右、変換された画像。

この研究の動機は、写真家やグラフィックアーティストが行う手作業によるデジタル操作を自動化するワークフローを開発することです。これは、ファッションから雑誌風の出力や広告物まで、メディアのさまざまな分野で使用されています。

一般的に、著者は、これらの変換はPhotoshopや他の伝統的なビットマップエディタで「歪み」テクニックを使用して適用されることが多いと認めています。これらのテクニックは、ほとんどの場合、女性の画像にのみ使用されます。したがって、新しいプロセスを容易にするために開発されたカスタムデータセットは、主に女性の写真で構成されています。

「身体のリタッチは主に女性によって行われるため、私たちのコレクションは女性の写真で構成されています。年齢、人種(アフリカ系:アジア系:コーカソイド=0.33:0.35:0.32)、ポーズ、衣服の多様性を考慮してください。」

論文のタイトルは《Structure-Aware Flow Generation for Human Body Reshaping》で、アリババのグローバルDAMOアカデミーに所属する5人の著者によって書かれています。

データセットの開発

画像の合成と編集システムの場合、通常、アーキテクチャの構築にはカスタマイズされたトレーニングデータセットが必要です。著者は、3人の写真家にUnsplashというストック写真サイトから適切な画像のPhotoshop操作を依頼し、2K解像度の5,000枚の高品質画像からなる《BR-5K*》というデータセットを作成しました。

研究者は、このデータセットをトレーニングする目的は、魅力性や理想的な外観の指数に関連する「理想化された」および一般化された特徴を生成することではなく、プロの操作による身体画像の中心的な特徴マッピングを抽出することであると強調しています。

しかし、彼らは、最終的に変換プロセスは「実際の」ものから「理想的な」ものへの進化を表すものであることを認めています。

「私たちは、3人のプロのアーティストにPhotoshopを使用して、人気の美的基準に合う細身の人物を達成することを目的として、身体をリタッチするよう依頼し、ベストなものを基準として選択します。」

顔はシステムで扱わないため、データセットに含める前に顔はぼかされました。

アーキテクチャと核心概念

システムのワークフローには、高解像度のポートレートを入力し、利用可能なコンピューティングリソースに収まる低解像度にダウンサンプリングし、推定スケルトンマップポーズ(画像の2番目から左)およびパートアフィニティフィールド(PAF)を抽出します。PAFは、2016年にカーネギーメロン大学のロボティクス研究所によって革新されました。

パートアフィニティフィールドは、四肢の向きと、より広い骨格フレームとの関連性を定義するのに役立ち、新しいプロジェクトに追加のアテンション/ローカリゼーションツールを提供します。

2016年のパートアフィニティフィールドの論文から、予測されたPAFは、四肢の向きを2Dベクトルの一部としてエンコードし、四肢の一般的な位置も含みます。ソース:https://arxiv.org/pdf/1611.08050.pdf

2016年のパートアフィニティフィールドの論文から、予測されたPAFは、四肢の向きを2Dベクトルの一部としてエンコードし、四肢の一般的な位置も含みます。ソース:https://arxiv.org/pdf/1611.08050.pdf

スケルトンマップは、体重の外観に直接関係しないように見えますが、最終的な変換プロセスを修正される身体の部分(上腕、後部、腿など)に導くのに役立ちます。

次に、結果はプロセスの中心的なボトルネックにあるStructure Affinity Self-Attention(SASA)に渡されます。

SASAは、プロセスを燃料とするフローゲネレータのの一貫性を調整し、その結果は、データセットに含まれる手動の修正から学習した変換を適用するための歪みモジュール(画像の2番目から右)に渡されます。

Structure Affinity Self-Attention(SASA)モジュールは、関連する身体の部分にアテンションを割り当て、不要または無関係な変換を回避するのに役立ちます。

Structure Affinity Self-Attention(SASA)モジュールは、関連する身体の部分にアテンションを割り当て、不要または無関係な変換を回避するのに役立ちます。

出力画像は、2017年式のディープフェイクアーキテクチャから派生したDeepFaceLabなどのパッケージで使用されている標準的なアップサンプリングプロセスを使用して、元の2K解像度に戻されます。アップサンプリングプロセスは、GAN編集フレームワークでも共通です。

スキーマのアテンションネットワークは、2019年の米国/シンガポールの学術コラボレーションである《Compositional De-Attention Networks》(CODA)に基づいています。Amazon AIとMicrosoftが参加しています。

テスト

フローベースのフレームワークは、以前のフローベースの方法であるFALATW、および画像翻訳アーキテクチャであるPix2PixHDGFLAと比較してテストされました。評価メトリックとしては、SSIM、PSNR、LPIPSが使用されました。

初期テストの結果(ヘッダーの矢印の方向は、どちらの指標がより良いことを示しています)。

初期テストの結果(ヘッダーの矢印の方向は、どちらの指標がより良いことを示しています)。

採用されたメトリックに基づいて、著者のシステムは以前のアーキテクチャを上回るパフォーマンスを示しています。

選択された結果。より高解像度の比較のために、この記事にリンクされた元のPDFを参照してください。

選択された結果。より高解像度の比較のために、この記事にリンクされた元のPDFを参照してください。

自動メトリックに加えて、研究者はユーザー調査(先ほどの結果テーブルの最後の列)を実施しました。40人の参加者がそれぞれ、さまざまな方法で生成された画像に関する100個の質問のうち30個のランダムに選択された質問に回答しました。70%の回答者は、新しいテクニックを「視覚的に魅力的」と感じていると回答しました。

課題

新しい論文は、AIベースの身体操作への希少な挑戦を表しています。画像の合成分野は現在、Neural Radiance Fields(NeRF)などの方法を使用して編集可能な身体を生成すること、またはGANの潜在的な潜在空間と顔操作のためのオートエンコーダの可能性を探ることに重点を置いています。

著者の取り組みは現在、体重の外観の変更のみに限定されており、背景が露出したときに写真の背景を復元するためのインペイントテクニックは実装されていません。

しかし、彼らは、ポートレートマッティングとテクスチャ推論による背景ブレンドが、AI駆動型の減量によって露出した画像の部分を容易に復元できる可能性があると提案しています。

AI駆動型の減量によって露出した背景を復元するための提案された解決策。

AI駆動型の減量によって露出した背景を復元するための提案された解決策。

 

* プリプリントは、データセットの詳細およびプロジェクトからの追加の例についての補足資料を参照していますが、この資料の場所は論文で公開されていません。また、対応する著者はまだアクセスを求める私たちの要請に回答していません。

初版は2022年3月10日に公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:[email protected]