Andersonの視点

Adobe Researchが分離されたGANの顔編集を拡張する

mm
Unite.AI を Google の優先ソースに追加

画像合成におけるエンタングルメントが問題となる理由は、他の分野でも同様の問題が生じることが多いため、理解するのは難しくない。例えば、カレーからターメリックを取り除くのは、ハンバーガーからピクルスを取り出すよりも難しい。また、コーヒーをデスイートすることはほぼ不可能である。いくつかのものはバンドルされてくる。

同様に、エンタングルメントは、機械学習を使用して顔(または犬、船、その他のドメイン)を作成または編集するときに、さまざまな機能や概念を分離することを望む画像合成アーキテクチャにとっての障害である。

年齢、性別、髪の色、肌の色、感情など、さまざまな要素を分離できれば、画像を真正に粒状に編集できるフレームワークの基礎ができあがる。不要な「乗客」を変換に引きずり込まないで済む。

最大のエンタングルメント(上の左)では、学習したGANネットワークの画像を別の人の画像に変更することしかできない。

これは、30年以上前に他の手段で解決された問題に対して、最新のAIコンピュータビジョンテクノロジーを使用して何かを実現しようとしているに過ぎない。

ある程度の分離(上の画像の「Medium Separation」)がある場合、髪の色、表情、化粧、頭の回転などのスタイルベースの変更を行うことができる。

Source: FEAT: Face Editing with Attention, Feb 2022, https://arxiv.org/pdf/2202.02713.pdf

Source: FEAT: Face Editing with Attention, 2022年2月, https://arxiv.org/pdf/2202.02713.pdf

過去2年間で、ユーザーがスライダーなどの従来のUIインタラクションを使用して顔の特徴を変更できるインタラクティブな顔編集環境を作成する試みが何度かありました。しかし、これはGANの潜在的な空間における基本的な機能/スタイルエンタングルメントのため、課題となりました。

例えば、メガネの特性は、年齢の特性としばしば絡み合っています。つまり、メガネを追加すると顔が「年をとる」可能性があり、顔が「年をとる」場合はメガネが追加される可能性があり、高レベルの特徴の分離の程度によっては、どちらかまたは両方が発生する可能性があります(以下の「テスト」で説明します)。

特に、髪の色やその他の髪の要素を変更することなく、髪の色やその他の髪の要素を変更することはほぼ不可能でした。これにより、変換中に「スズル」という効果が生じます。

Source: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Source: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

潜在的なGANトラバース

WACV 2022に提出されたAdobe主導の新しい論文は、これらの根本的な問題に対して新しいアプローチを提供します。この論文は、Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Imagesと題されています。

補足資料から。ここでは、学習された顔の基本的な特徴が無関係な変更に引きずり込まれない。記事の最後に埋め込まれたビデオを参照してください。

補足資料から。ここでは、学習された顔の基本的な特徴が無関係な変更に引きずり込まれない。記事の最後に埋め込まれたビデオを参照してください。

この論文は、Adobeの応用科学者Siavash Khodadadehが主導し、他の4人のAdobe研究者とフロリダ中央大学のコンピュータサイエンス学部の研究者が参加しています。

この論文は、Adobeがこの分野で長期間活動していること、またこの機能が将来のCreative Suiteプロジェクトに搭載される可能性があることから興味深いものです。ただし、主な理由は、このプロジェクトのアーキテクチャが、GAN顔編集器で変更を適用しながら視覚的な完全性を維持するための新しいアプローチを採用していることです。

著者は以下のように述べています。

‘[私たちは]、属性の変更に対応する潜在的なエンコードを見つけるために、潜在的な変換を実行するためのニューラルネットワークを訓練します。 このテクニックは、一連の属性の逐次的な変更の線形または非線形トラジェクトリに依存しません。 ‘

‘生成パイプライン全体でネットワークをエンドツーエンドで訓練することで、システムはオフザシェルフのジェネレータアーキテクチャの潜在的な空間に対応できるようになります。 同一性の保存などの保存特性は、訓練損失の形式でエンコードできます。 ‘

‘潜在的な潜在的なネットワークが訓練されると、任意の画像に対して再訓練せずに再利用できます。 ‘

この最後の部分は、提案されたアーキテクチャが、エンドユーザーに完成した状態で到着することを意味します。ローカルリソースでニューラルネットワークを実行する必要がありますが、新しい画像を「ドロップイン」してすぐに変更できるため、画像ごとの追加の訓練は必要ありません。フレームワークは十分に切り離されており、さらに画像固有の訓練は必要ありません。

性別と顔の毛が、スライダーが潜在的な空間をランダムに移動するときに変更されます。

性別と顔の毛が、スライダーが潜在的な空間をランダムに移動するときに変更されます。記事の最後に埋め込まれたビデオを参照してください。

この研究の主な成果の1つは、ネットワークが潜在的な空間でアイデンティティを「凍結」する能力であり、ターゲットベクトルで属性のみを変更し、変換されるアイデンティティを保存する「修正項」を提供することです。

本質的に、提案されたネットワークは、処理された要素をオーケストレートするより広いアーキテクチャに組み込まれており、凍結された重みを持つ事前トレーニングコンポーネントを通過します。これにより、変換に望ましくない横方向的な影響が生じることはありません。

訓練プロセスは、シード画像(GAN逆変換の下で)または既存の初期潜在的なエンコードによって生成できる三つ組に依存しているため、全体の訓練プロセスは無監視です。通常のシステムにあるようなラベリングやキュレーションシステムの通常の範囲の暗黙のアクションは、実際にはアーキテクチャに組み込まれています。実際、新しいシステムはオフザシェルフの属性推定器を使用します。

‘[私たちの]ネットワークが独立して制御できる属性の数は、認識器の能力のみによって制限されます。認識器があれば、任意の顔に属性を追加できます。私たちの実験では、35個の異なる顔の属性の調整を可能にするように潜在的な潜在的なネットワークを訓練しました。これは、以前のアプローチよりも多くの属性です。 ‘

システムには、望ましくない「副作用」変換に対する追加の安全対策が組み込まれています。属性の変更を要求されない場合、潜在的な潜在的なネットワークは潜在的なベクトルを自分自身にマッピングし、ターゲットアイデンティティの安定した永続性をさらに高めます。

顔認識

過去数年間のGANおよびエンコーダ/デコーダベースの顔編集器の再発する問題の1つは、適用された変換が類似性を低下させる傾向があることです。これに対処するために、AdobeプロジェクトはFaceNetと呼ばれる埋め込まれた顔認識ネットワークを使用します。

プロジェクトアーキテクチャ。FaceNetの包含を参照するには、下の中央左を見てください。

プロジェクトアーキテクチャ。FaceNetの包含を参照するには、下の中央左を見てください。

(個人的な注釈として、この標準的な顔識別および表情認識システムを生成ネットワークに統合することは、盲目的なピクセルからピクセルへのマッピングを克服するための最良の方法であると考えられます。)

潜在的な空間内のすべての領域へのアクセス

このフレームワークのもう1つの印象的な機能は、潜在的な空間内の潜在的な変換間を、ユーザーの任意のタイミングで移動できることです。以前のいくつかのシステムは、ユーザーが潜在的な変換の固定されたタイムライン間で「スクラッチ」することしかできませんでしたが、印象的ではありましたが、しばしば線形または規定されたエクスペリエンスでした。

Improving GAN Equilibrium by Raising Spatial Awarenessから: ここでは、ユーザーは潜在的な空間内の2つの潜在的な場所間の潜在的な遷移点の範囲をスクラッチしています。ただし、事前トレーニングされた潜在的な空間内の場所の範囲内でしか行うことはできません。同じ素材に基づいて他の種類の変換を適用するには、再構成と/または再訓練が必要です。

Improving GAN Equilibrium by Raising Spatial Awarenessから: ここでは、ユーザーは潜在的な空間内の2つの潜在的な場所間の潜在的な遷移点の範囲をスクラッチしています。ただし、事前トレーニングされた潜在的な空間内の場所の範囲内でしか行うことはできません。同じ素材に基づいて他の種類の変換を適用するには、再構成と/または再訓練が必要です。

ユーザーがまったく新しいユーザー画像を受け入れることに加えて、ユーザーは変換プロセス中に保存したい要素を手動で「凍結」できます。たとえば、ユーザーは背景が移動しないことを確認したり、目を開けたままにしたり、閉じたままにしたりすることができます。

データ

属性回帰ネットワークは、3つのネットワークで訓練されました: FFHQCelebAMask-HQ、およびStyleGAN-V2のZ空間から400,000個のベクトルをサンプリングして取得したローカルで生成されたGANネットワーク。

分布外の画像は除外され、MicrosoftのFace APIを使用して属性が抽出され、結果の画像セットは90/10で分割され、721,218個の訓練画像と72,172個のテスト画像が比較のために残されました。

テスト

実験ネットワークは当初、35個の潜在的な変換を処理するように構成されていましたが、比較可能なフレームワークであるInterFaceGANGANSpace、およびStyleFlowに対するテストを行うために、8個に絞り込まれました。

選択された8つの属性は、年齢禿ひげ表情性別メガネピッチ、およびヨーでした。元の配布で提供されていなかった属性(たとえば、InterFaceGANに禿ひげを追加する)に対して、競合するフレームワークを再構成する必要がありました。

予想通り、競合するアーキテクチャでは、より高いレベルのエンタングルメントが発生しました。たとえば、1つのテストでは、InterFaceGANとStyleFlowの両方が、年齢を適用したときに、サブジェクトの性別を変更しました。

2つの競合フレームワークは、年齢の変換に性別の変更を組み込み、ユーザーの直接の要請なしに髪の色も変更しました。

2つの競合フレームワークは、年齢の変換に性別の変更を組み込み、ユーザーの直接の要請なしに髪の色も変更しました。

さらに、2つのライバルは、メガネと年齢が切り離せない特徴であることを発見しました。

メガネと髪の色の変更が無料で付いてきます!

メガネと髪の色の変更が無料で付いてきます!

研究は一様に勝利しているわけではありません。記事の最後に埋め込まれたビデオを参照すると、フレームワークは、さまざまな角度(ヨー)を外挿する際に最も効果が低いことがわかりますが、GANSpaceは年齢メガネの追加に対してより優れた一般的な結果を示しています。潜在的な潜在的なフレームワークは、頭の角度(ピッチ)の追加については、GANSpaceとStyleFlowと同等でした。

MTCNN顔検出器の校正に基づいて計算された結果。結果が低いほどよい。

MTCNN顔検出器の校正に基づいて計算された結果。結果が低いほどよい。

詳細や例の解像度の向上については、以下の記事の末尾に埋め込まれたビデオを参照してください。

 

最初に公開されたのは2022年2月16日です。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai