Andersonの視点
SofGAN:より高度な制御が可能なGANベースの顔生成システム

上海と米国の研究者は、髪、目、眼鏡、テクスチャ、色などの個々の要素に対する以前になかったレベルの制御を可能にする、GANベースのポートレート生成システムを開発しました。
システムの汎用性を示すために、作成者はPhotoshopスタイルのインターフェイスを提供しています。ここで、ユーザーはセマンティックセグメンテーション要素を直接描くことができ、これらは現実的な画像に解釈され、既存の写真の上に直接描くことによって得られることもあります。
以下の例では、俳優ダニエル・ラドクリフの写真がトレーステンプレートとして使用されています(目的は彼に似たものを作ることではなく、一般的に写真現実的な画像を作ることです)。ユーザーがさまざまな要素、たとえば眼鏡などの離散的な要素を埋めるとき、それらは識別され、出力画像に解釈されます。

SofGAN生成のポートレートのトレース素材として使用される画像 ソース:https://www.youtube.com/watch?v=xig8ZA3DVZ8
論文は、SofGAN:動的スタイリングを持つポートレート画像ジェネレーターと題されており、Anpei ChenとRuiyang Liuのほか、上海科技大学とカリフォルニア大学サンディエゴ校の研究者2名によってリードされています。
特徴の分離
この研究の主な貢献は、ユーザーフレンドリーなUXを提供することではなく、学習された顔の特徴の特徴、たとえばポーズとテクスチャを「分離」することです。これにより、SofGANはカメラの視点に間接的な角度の顔も生成できます。
テクスチャが幾何学から分離されたため、顔の形状とテクスチャを個別のエンティティとして操作できます。実際には、これにより、醜聞的な行為である人種変更が可能になり、人種バランスの取れた機械学習データセットの作成に役立ちます。

SofGANは、NVIDIAのGauGANやIntelのゲームベースのニューラルレンダリングシステムなどの類似のセグメンテーション>画像システムと比較して、人工的な老化や属性一致のスタイル調整をより細かいレベルでサポートしています。

SofGANは老化を反復的なスタイルとして実装できる
SofGANの方法論のもう1つのブレークスルーは、ペア化されたセグメンテーション/実画像のトレーニングが不要で、代わりにペア化されていない実世界の画像で直接トレーニングできることです。
研究者は、SofGANの「分離」アーキテクチャは、伝統的な画像レンダリングシステムから着想を得たと述べています。これらのシステムでは、画像の個々の要素を分解します。視覚効果ワークフローでは、コンポジットの要素は最も微細なコンポーネントに分解され、各コンポーネントに専門家が割り当てられます。
セマンティック占有フィールド(SOF)
このことを機械学習画像合成フレームワークで実現するために、研究者は、セマンティック占有フィールド(SOF)を開発しました。これは、伝統的な占有フィールドの拡張であり、ポートレート画像の個々の要素を個別化します。SOFは、校正されたマルチビューのセマンティックセグメンテーションマップでトレーニングされましたが、グラウンドトゥルースの監視は行われませんでした。

単一のセグメンテーションマップ(左下)からの複数のイテレーション
さらに、2Dセグメンテーションマップは、SOFの出力からレイマーチングによって取得され、次にGANジェネレーターによってテクスチャ化されます。「合成」セマンティックセグメンテーションマップは、視点が変更されたときの出力の連続性を確保するために、3層のエンコーダーを介して低次元空間にエンコードされます。
トレーニングスキームでは、各セマンティック領域に対して2つのランダムなスタイルが空間的に混合されます。
研究者は、SofGANが現在の代替的な最先端アプローチよりも低いFrechet Inception Distance(FID)と高いLearned Perceptual Image Patch Similarity(LPIPS)メトリックを達成することを主張しています。
以前のStyleGANアプローチは、特徴の絡み合いによって頻繁に妨げられてきました。ここで、画像を構成する要素が、望ましい要素とともに不要な要素が現れることを引き起こします(たとえば、耳の形が描かれると、トレーニング時に耳に付いていたピアスが現れることがあります)。

レイマーチングを使用してセマンティックセグメンテーションマップの体積を計算する
データセットとトレーニング
SofGANのさまざまな実装の開発には、3つのデータセットが使用されました:CelebAMask-HQ、30,000の高解像度画像のリポジトリ;NVIDIAのFlickr-Faces-HQ(FFHQ)、70,000の画像で構成されており、研究者は事前にトレーニングされた顔パーサーで画像をラベル付けしました;および、手動でセマンティック領域をラベル付けした122のポートレートスキャンで構成される自社制作のグループ。
SOFは、3つのトレーニング可能なサブモジュールで構成されています:ハイパーネット、レイマーチャー(上の画像を参照)、およびクラス分類器。プロジェクトのSIW StyleGANジェネレーターは、StyleGAN2と同様の構成になっています。データ増強は、ランダムなスケーリングとクロッピングを介して適用され、トレーニングでは4ステップごとにパス正則化が行われます。トレーニング全体の手順は、4つのRTX 2080 Ti GPUで22日間、800,000イテレーションに達するまでに要しました。
論文では、2080カードの構成について言及されていませんが、これらは11GB~22GBのVRAMを搭載しているため、トレーニングに使用された合計VRAMは44GB~88GBの範囲になります。
研究者は、一般化された、高レベルの結果がトレーニングの早い段階で、1500イテレーション、3日目に現れたと観察しています。残りのトレーニング時間は、髪や目のような細かい詳細の取得に向けて、予測可能なスロークロールで費やされました。
SofGANは、NVIDIAのSPADEやPix2PixHD、およびSEANなどのライバルメソッドと比較して、単一のセグメンテーションマップからよりリアルな結果を達成します。
以下は、研究者によってリリースされたビデオです。さらに多くのセルフホストビデオは、プロジェクトページで利用可能です。















