Andersonの視点
AIで「より良い」体型を偽装する

Alibaba DAMO アカデミーの新しい研究は、身体の画像を自動的にリシェイプする AI 主導のワークフローを提供します。これは、現在深層偽造や GAN ベースの 顔ベースの操作 や 顔編集 が中心となっているコンピュータビジョン分野では稀な試みです。

‘result’ 列に挿入された、修正すべき領域を定義する生成された注意マップ。 出典: https://arxiv.org/pdf/2203.04670.pdf
研究者のアーキテクチャは、スケルトン姿勢推定を用いて、画像合成・編集システムが既存の身体画像を概念化しパラメータ化する際に直面する高度な複雑性に取り組みます。少なくとも、実際に意味のある選択的編集を可能にする粒度までです。

推定されたスケルトンマップは、上腕部など、修正が予想される身体の領域を個別化し、注意を集中させるのに役立ちます。
このシステムは、ユーザーが全身または半身の写真における体重、筋肉量、または体重分布の外観を変更するパラメータを設定できるようにし、衣服を着た状態でも裸の状態でも任意の変換を生成できます。

左は入力画像、中央は派生した注意領域のヒートマップ、右は変換後の画像です。
この研究の動機は、ファッションから雑誌風の出力、そして広報資料まで、メディアのさまざまな分野で写真家や制作グラフィックアーティストが行う手間のかかるデジタル操作を置き換える自動化ワークフローの開発です。
一般に、著者らは、これらの変換は通常 Photoshop やその他の従来型ビットマップエディタで「ワープ」技術を用いて適用され、ほぼ女性の画像にのみ使用されていることを認めています。そのため、新しいプロセスを支援するために作成されたカスタムデータセットは、主に女性被写体の写真で構成されています:
‘体のリタッチは主に女性が望むため、年齢、民族(アフリカ系:アジア系:白人 = 0.33:0.35:0.32)、ポーズ、衣服の多様性を考慮した女性写真がコレクションの大半を占めています。’
この論文のタイトルは Structure-Aware Flow Generation for Human Body Reshaping で、Alibaba のグローバル DAMO アカデミーに所属する5人の著者によるものです。
データセット開発
画像合成・編集システムで通常見られるように、プロジェクトのアーキテクチャはカスタマイズされたトレーニングデータセットを必要としました。著者らは、ストック写真サイト Unsplash から適切な画像を選び、標準的な Photoshop 操作を行うよう3人の写真家に依頼し、2K 解像度の高品質画像5,000枚からなるデータセット(タイトルは BR-5K*)を作成しました。
研究者は、このデータセットでのトレーニングの目的は、魅力度や望ましい外観の指標に関する『理想化された』一般的な特徴を生成することではなく、身体画像のプロフェッショナルなリタッチに関連する中心的な特徴マッピングを抽出することにあると強調しています。
しかしながら、彼らはこれらの操作が最終的には『実際』から事前に設定された『理想』への変換プロセスを反映していることを認めています:
‘3人のプロのアーティストに Photoshop を使用して独立に身体をリタッチさせ、人気の美学に合致する細身の体形を実現させ、最良のものを真実データとして選択するよう依頼しました。’
このフレームワークは顔を全く扱わないため、データセットに含める前に顔はすべてぼかされました。
アーキテクチャとコアコンセプト
システムのワークフローは、高解像度のポートレートを入力し、利用可能な計算リソースに収まるよう低解像度にダウンサンプリングし、推定されたスケルトンマップ姿勢(下図左から2番目の図)と、2016 年にカーネギーメロン大学ロボティクス研究所が開発したパートアフィニティフィールド(PAF)を抽出することを含みます(以下の埋め込み動画をご参照ください)。
パートアフィニティフィールドは、四肢の向きと全体的な骨格フレームワークとの関連性を定義するのに役立ち、新しいプロジェクトに追加の注意/位置特定ツールを提供します。

2016 年の Part Affinity Fields 論文から、予測された PAF は四肢の向きと四肢の一般的な位置を含む 2 次元ベクトルの一部としてエンコードしています。 出典: https://arxiv.org/pdf/1611.08050.pdf
体重の外観とは一見関係がないように見えますが、スケルトンマップは上腕部、臀部、太ももなど、修正すべき身体部位へ最終的な変換プロセスを導くのに有用です。
その後、結果はプロセスの中心的ボトルネックにある Structure Affinity Self-Attention(SASA)に入力されます(下図参照)。

SASA はプロセスを駆動するフロージェネレータの一貫性を調整し、その結果は上図右から2番目のワーピングモジュールに渡され、データセットに含まれる手動修正でのトレーニングから学習した変換を適用します。

Structure Affinity Self-Attention(SASA)モジュールは関連する身体部位に注意を割り当て、余計なまたは無関係な変換を防止します。
出力画像はその後、元の 2K 解像度にアップサンプリングされます。このプロセスは、DeepFaceLab などの人気パッケージが派生した標準的な 2017 年スタイルのディープフェイクアーキテクチャに類似しており、GAN 編集フレームワークでも一般的です。
このスキーマの注意ネットワークは、Compositional De-Attention Networks(CODA)をモデルにしており、これは 2019 年の米国/シンガポールの学術協働で、Amazon の AI と Microsoft が参加しています (AMZN )。
テスト
フロー型フレームワークは、従来のフロー型手法 FAL と Animating Through Warping(ATW)および画像変換アーキテクチャ Pix2PixHD と GFLA と比較され、評価指標として SSIM、PSNR、LPIPS が使用されました。

初期テストの結果(ヘッダーの矢印方向は、数値が低い方が良いか高い方が良いかを示します)。
採用された指標に基づくと、著者のシステムは従来のアーキテクチャを上回ります。
自動評価指標に加えて、研究者はユーザー調査(前述の結果表の最終列)を実施し、40 名の参加者に各々、さまざまな手法で生成された画像に関する 100 問のプールからランダムに選ばれた 30 問を提示しました。回答者の 70% が新手法をより『視覚的に魅力的』と評価しました。
課題
本稿は AI ベースの身体操作への稀な試みを示しています。画像合成分野は現在、Neural Radiance Fields(NeRF)などの手法で編集可能な身体を生成すること、あるいは GAN の潜在空間や顔操作用オートエンコーダの可能性を探求することに大きく関心を寄せています。
著者らの取り組みは現在、見かけ上の体重変化の生成に限られており、人物の画像を細くした際に必然的に露出する背景を復元するインペインティング技術は実装されていません。
しかしながら、テクスチャ推論によるポートレートマットと背景ブレンドを用いれば、人間の『不完全さ』により画像で隠れていた世界の部分を簡単に復元できると提案しています。

AI 主導の脂肪減少で露出した背景を復元する提案された解決策。
* 事前印刷版ではデータセットに関する詳細やプロジェクトのさらなる例を含む補足資料が言及されていますが、その資料の所在は論文中で提供されておらず、対応著者からはまだアクセス要請に返答がありません。
初版掲載日: 2022年3月10日。













