Andersonの視点

人体型の再構成にAIを用いる

mm
Unite.AI を Google の優先ソースに追加

中国からの新しい研究コラボレーションは、画像内の人体を再構成するための新しい方法を提供しています。調整された双子ニューラルエンコーダーネットワークを使用して、パラメトリックモデルを導入し、エンドユーザーがインタラクティブなGUIで体重、身長、体のプロポーションを調整できるようにします。

パラメータ化された体の形状の変化、スライダーで3つの利用可能な機能を変更する。出典: https://arxiv.org/pdf/2203.10496.pdf

パラメータ化された体の形状の変化、スライダーで3つの利用可能な機能を変更する。 出典: https://arxiv.org/pdf/2203.10496.pdf

この研究は、Alibabaからの最近の類似のプロジェクトよりも、いくつかの点で改善されています。体重、身長、体のプロポーションを変更できるだけでなく、背景の「インペイント」に専用のニューラルネットワークを備えており、スリムな体の画像で背景が露呈するのを防ぐことができます。また、2010年の早期のパラメトリック方法よりも、変換の生成における人間の介入を削減しています。

新しいアーキテクチャは、NeuralReshaperと呼ばれ、パラメトリック3D人体テンプレートをソース画像に適応させ、元の画像を新しいパラメータに合わせて変換します。

システムは、衣類を着た人や半裸の人(ビーチウェアなど)に対する体の変換を処理できます。

このような変換は、現在、ファッションAI研究セクターに大きな関心を集めています。このセクターは、StyleGAN/CycleGANベースのプラットフォームや一般的なニューラルネットワークを開発しており、ユーザーが画像を提出すると、利用可能な衣類アイテムをユーザーの体の形状やタイプに合わせて調整した仮想トライオンを実現しています。

論文は、Single-image Human-body Reshaping with Deep Neural Networksと題されており、浙江大学と香港城市大学の研究者によって執筆されています。

SMPLフィッティング

NeuralReshaperは、2015年にマックス・プランク研究所とILMによって開発されたSkinned Multi-Person Linear Model(SMPL)を使用しています。

SMPLパラメトリックヒューマン、2015年のプランク/ILMコラボレーション。出典: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPLパラメトリックヒューマン、2015年のプランク/ILMコラボレーション。 出典: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

プロセスの最初の段階では、SMPLモデルを生成し、体の変換を適用したいソース画像に適応させます。SMPLモデルの画像への適応は、2018年に提案されたHuman Mesh Recovery(HMR)方法に従います。

変換の3つのパラメータ(体重、身長、体のプロポーション)は、この段階で計算され、カメラパラメータ(焦点距離など)も考慮されます。2Dキーポイントと生成されたシルエットの整列により、変換の境界が確立され、後続のパイプラインで背景の「インペイント」が可能になります。

SMPLフィッティングの段階: 左、ソース画像;二番目から左、2016年のマックス・プランク研究所による研究で概説された方法からの最適化結果;三番目から左、End-to-end Recovery of Human Shape and Poseの事前トレーニング済みモデルの直接推論結果;二番目から右、2Dキーポイントの最適化結果;右、シルエットの最適化後の完成したフィット(上記参照)。

SMPLフィッティングの段階: 左、ソース画像;二番目から左、2016年のマックス・プランク研究所による研究で概説された方法からの最適化結果;三番目から左、End-to-end Recovery of Human Shape and Poseの事前トレーニング済みモデルの直接推論結果;四番目から左、2Dキーポイントの最適化結果;五番目から左、シルエットの最適化後の完成したフィット(上記参照)。

3D変換は、画像空間への投影により、変換を定義する密な歪みフィールドを生成します。このプロセスは約30秒で完了します。

NeuralReshaperアーキテクチャ

NeuralReshaperは、2つのニューラルネットワークを並行して実行します。1つは、変換された体の形状を生成するフォアグラウンドエンコーダーで、もう1つは、背景の「デオクルージョン」領域(例:体をスリム化する場合)を埋めるバックグラウンドエンコーダーです。

U-netスタイルのフレームワークは、2つのエンコーダーの特徴を統合し、結果を統一されたエンコーダーに渡し、最終的に2つの入力から新しい画像を生成します。アーキテクチャには、統合を可能にする新しいワープガイドメカニズムが特徴です。

トレーニングと実験

NeuralReshaperは、PyTorchで実装され、11GBのVRAMを備えた単一のNVIDIA 1080ti GPUで実行されます。ネットワークは、Adamオプティマイザを使用して100エポックでトレーニングされ、生成器の目標損失は0.0001、判別器の目標損失は0.0004でした。トレーニングは、バッチサイズ8の専有の屋外データセット(COCO、MPII、LSPから抽出)とバッチサイズ2のDeepFashionデータセットで実行されました。

左、元の画像;右、NeuralReshaperの再構成出力。

左、元の画像;右、NeuralReshaperの再構成出力。

以下は、DeepFashionデータセットからNeuralReshaperでトレーニングされた例です。元の画像は左側に表示されます。

3つの制御可能な属性は、独立して適用できます。

導出された屋外データセットでの変換は、複雑な背景のインフィルと明確な変換体の輪郭が必要になるため、より課題的です。

パラメトリックな必要性

論文では、このような同一画像の変換は、画像合成における不適切な問題を表していることを指摘しています。多くの変換GANやエンコーダーフレームワークは、ペア画像(「前と後」のダイエットや美容整形の広告など)を使用できますが、この場合、同じ人を異なる体の構成で撮影した画像のペアが必要になります。これらのデータは、入手または生成が難しい場合があります。

代わりに、変換GANネットワークは、より多様なデータでトレーニングし、潜在的な方向(元の画像の潜在的なコードと目的のクラス間)を探索して変換を実現できます。しかし、このアプローチは、微調整された体の再構成の目的にはまだ限界があります。

Neural Radiance Fields(NeRF)アプローチは、ほとんどのGANベースのシステムよりも、フルボディシミュレーションで進んでいますが、シーン固有でリソースを大量に消費し、現在、体のタイプをNeuralReshaperや以前のプロジェクトが試みているようなグラニュラな方法で編集する能力は非常に限られています(環境に対する全体的なスケーリングを除く)。

GANの潜在的な空間は、制御が難しいです。VAEのみでは、フルボディの再現の複雑さに対処できません。NeRFの人間の体を一貫してリアルに再構成する能力はまだ発展途上です。したがって、SMPLのような「伝統的な」CGI手法の導入は、人間の画像合成研究セクターで継続される可能性があります。これらの新興技術では、まだ十分に理解されていないパラメータや潜在的なコードを特徴、クラス、潜在的なコードで囲み、統合する手段としてです。

このような変換は、現在、ファッションAI研究セクターに大きな関心を集めています。このセクターは、StyleGAN/CycleGANベースのプラットフォームや一般的なニューラルネットワークを開発しており、ユーザーが画像を提出すると、利用可能な衣類アイテムをユーザーの体の形状やタイプに合わせて調整した仮想トライオンを実現しています。

 

2022年3月31日初出。

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]