Andersonの視点

GAN生成の顔に対するプラスチックサージャリー

mm
Unite.AI を Google の優先ソースに追加
Improvements in synthetically generated (GAN) images

韓国からの新しい研究は、Generative Adversarial Networks (GAN)によって生成された合成顔データの品質を向上させることを約束しています。

このシステムは、GANプロセスによって生成された画像のアーティファクトを識別し、修復することができ、キャップによって隠された髪を置き換えたり、顔の一部を完全に欠落させたり、ハンドやサングラスなどのオクルージョンを除去したりすることができます。また、風景や建築物の出力にもよく機能します。

GAN修正

各列の左側は、欠陥のある元のGAN出力であり、その後他のアプローチ、そして韓国研究者によって使用された方法が続きます。 ソース:https://arxiv.org/pdf/2104.06118.pdf

GAN生成画像の品質を向上させるための最近のアプローチは、ほとんどがアーティファクトをプロセスの職業上の危険と見なしており、方法論を「自然の力」として扱い、よりサイケデリックまたは異常な結果を生成することが不可避であると考えられてきました。

一方、韓国の研究では、生成チェーンを妨げることなく、実際に影響を受けた画像を「修正」することを提案しています。アーティファクトを引き起こしている側面を特定し、GANネットワーク内でそれらの影響を半教師ありレベルで減らしたり除去したりすることで、セミ・スーパーバイズド・レベルでネイティブの自己修正メカニズムを超えて拡張します。

このプロジェクトでは、GANアーティファクトによって大幅に影響を受けた画像の広く適用可能なハンド・ラベル付けされたデータセットを作成する必要がありました。初期段階では、研究者はFrechet Inception Distance (FID)を使用しました。これは、画像の特徴を比較することでGAN出力の品質を評価するメトリックです。20万枚の画像の実行の中で、FIDスコアが最高の10,000枚の画像が「アーティファクト・ユニット」として使用されました。その後、研究者は2,000枚の生成された画像を手動でラベル付けし、それぞれを「正常」またはFIDアーティファクトによって影響を受けたものと分類しました。次に、データセットをアーティファクト、正常、ランダムな実世界のサンプルに分類するモデルを作成しました。

その後、Gradient-weighted Class Activation Mapping (Grad-CAM)を使用して、アーティファクトに影響を受けた領域のマスクを生成し、欠陥のラベル付けを自動化しました。

Grad-CAMマスク

上の画像では、Grad-CAMマスクがLSUN-Church outdoorデータセットとCelebA-HQデータセットの出力に適用されています。

20,000枚の画像の実行の中で、最も影響を受けた上位20件の結果を分析し、セグメンテーション・マスクを生成し、生成全体を代表する結果(アーティファクトよりも正確または説得力のあるもの)を、後の世代でアーティファクトを生成するユニットの活性化を低下させることで、マスクに代入することができます。

人間による修正の評価では、53%の「修正された」画像が「正常」とラベル付けされ、97%の元の画像が大幅に改善されました。

研究者は、この方法は、わずかな再構成によってNVIDIAのStyleGAN2にも適応できることを主張しています。

GANメガネ除去

合成データの利点

主に顔データに関して言えば、コンピュータビジョンの分野における実世界データセットの一般的な希少性は、顔認識、感情認識、医療研究、顔のトポロジーのより詳細なセグメンテーション研究などの重要な研究分野における多様な研究の障害となっています。

ウェブ上のデータの無料使用に対する現在の反発と、アドホック収集による顔画像のリアルワールドデータベースへの収集は、研究の別の障害となります。多くの州や国が厳しくなっており、ウェブスクレイピングや、ソーシャルメディア画像のこれらの目的への収集を禁止しています。

過去10年間で、限られた数の厳選された顔データセットが、この種の不確実性から避難するための避難所を提供してきました。さまざまな毎年公開研究チャレンジはこれらのデータセットを中心に行われてきました。しかし、これは研究プロジェクトがこれらのデータセットに向けて方法論を特化させ、年間の結果を一貫して比較可能な結果を得ることができたものの、源となる素材の多様性の欠如の代償で行われてきたと主張することができます。この状況は、研究がこれらの枠組みに限定される限り、毎年悪化しています。

さらに、これらの「従来の」データセットの中には、人種的多様性の欠如により批判されてきました。これは、これらのベンチマーク・スタンダードが近い将来、適切なリソースと見なされなくなる可能性があることを示唆しています。

これは、高品質の顔データが必要であり、リアルなものであるが、寄与している「リアルワールド」画像は認識不能なほど変換されていることを示しています。GAN生成の顔の使用がいつの日か「起源」に関する問題を引き起こす可能性があるとしても、データ収集のための法的および技術的メカニズムが確立されるまでに、使用画像の実際の画像を使用することよりもはるかに小さなハザードです。法的枠組みの変更に関しては、まだ使用画像の実際の画像を使用することよりも小さなハザードです。

参考文献:

合成画像のリアリズムの向上
生成ニューラルネットワークの内部ユニットの自動修正

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]