Andersonの視点

カスタムジェネレーティブアドバーサリアルネットワークの作成 – スケッチから

mm
Unite.AI を Google の優先ソースに追加

カーネギーメロン大学とMITの研究者は、新しい方法論を開発しました。これにより、ユーザーは、単に示唆的なドゥードゥルをスケッチするだけで、カスタムのジェネレーティブアドバーサリアルネットワーク(GAN)画像生成システムを作成できます。

このようなシステムは、ユーザーが特定の画像、例えば特定の動物、建物の種類、または個々の人の画像を生成できるようにすることができます。現在、ほとんどのGAN生成システムは、特定の特徴、例えば動物の種類、人の髪の種類、建築様式、または実際の顔の特徴を指定する機能が限られている、広範囲にわたるランダムな出力を生成します。

このアプローチは、論文 Sketch Your Own GAN に概説されており、新しいスケッチングインターフェイスを使用して、画像データベース内の特徴とクラスを検索するための効果的な「検索」機能として機能します。GANは、このフィルタリングされたサブセットの画像でトレーニングされます。

ユーザーが特定のオブジェクトタイプをスケッチすることで、GANの生成能力はそのクラスに特化されます。例えば、ユーザーが特定の種類の猫(This Cat Does Not Exist で得られるものとは異なる)を生成するフレームワークを作成したい場合、入力スケッチは関連しない猫のクラスを除外するためのフィルターとして機能します。

 

Source: https://peterwang512.github.io/GANSketching/

Source: https://peterwang512.github.io/GANSketching/

この研究は、カーネギーメロン大学のSheng Yu-Wangによって主導されており、MITのコンピュータサイエンスおよび人工知能研究所のDavid Bauと共同で行われています。

この方法は「GANスケッチング」と呼ばれ、入力スケッチを使用して、特定のドメインまたはサブドメインを対象とする「テンプレート」GANモデルの重みを直接変更します。

さまざまな正則化方法が、モデルの出力が多様性を維持しながら、高い画像品質を維持するために検討されました。研究者は、潜在的な空間を補間し、画像編集手順を実行することができるサンプルアプリケーションを作成しました。

This [$class] Does Not Exist

GANベースの画像生成システムは、過去数年で流行となり、プロジェクト が増えています。これらのプロジェクトは、存在しないもの、例えば人、レンタルアパート、スナック、足、馬、政治家、昆虫など、さまざまな画像を生成することができます。

GANベースの画像合成システムは、ターゲットドメイン(例えば顔や馬)の画像を含む大規模なデータセットをコンパイルまたはキュレーションすることによって作成されます。モデルは画像データベース内の特徴を一般化し、ランダムな例を生成するジェネレーターモジュールを実装します。

DeepFacePencilからのスケッチからの写真実写的な顔の生成。同様のスケッチから画像プロジェクトは多数存在します。Source: https://arxiv.org/pdf/2008.13343.pdf

DeepFacePencilからのスケッチからの写真実写的な顔の生成。同様のスケッチから画像プロジェクトは多数存在します。Source: https://arxiv.org/pdf/2008.13343.pdf

I Know What You Mean…

これらの初期の形状と最終的な詳細な解釈の関係をマッピングすることで、ユーザーは複雑で写真実写的な画像を粗いスケッチから作成することができます。

最近、NVIDIAは、GANベースの風景生成に関する長期的なGauGAN研究のデスクトップバージョンをリリースしました。

NVIDIAのGauGANとNVIDIA Canvasアプリケーションを使用した、粗いスケッチからの豊かな風景画像の生成。Source: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

NVIDIAのGauGANとNVIDIA Canvasアプリケーションを使用した、粗いスケッチからの豊かな風景画像の生成。Source: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Simplifying Sketch-To-Image

新しい論文のGANスケッチングアプローチは、ユーザーの入力を使用して、どのサブセットの画像がトレーニングデータとして構成するかを定義することで、GAN画像フレームワークの開発で通常必要なデータ収集とキュレーションの負担を軽減します。

システムは、わずか数回の入力スケッチのみでフレームワークを較正するように設計されています。システムは、2019年にカーネギーメロン大学、Adobe 、Uber ATG、Argo AIの研究者によって共同で行われたPhotoSketchプロジェクトの機能を逆転させています。

生成部分では、新しい方法はStyleGAN2の重みのみを変更します。使用される画像データは利用可能なデータのサブセットのみであるため、ただマッピングネットワークを変更するだけで望ましい結果が得られます。

方法は、馬、教会、猫などの人気のあるサブドメインで評価されました。

プリンストン大学の2016年のLSUNデータセットが、ターゲットサブドメインを導出するための基本材料として使用されました。実世界のユーザー入力スケッチの特性にロバストなスケッチマッピングシステムを確立するために、システムはマイクロソフトによって2021年から2016年にかけて開発されたQuickDrawデータセットの画像でトレーニングされました。

PhotoSketchとQuickDrawのスケッチマッピングはかなり異なるものですが、研究者は、システムが比較的単純なポーズでは容易にそれらを跨ぐことができると発見しましたが、より複雑なポーズ(例えば、猫が横になっている)はより大きな挑戦となり、抽象的なユーザー入力(例えば、非常に粗いドゥードゥル)は結果の品質を損ないます。

Latent Space and Natural Image Editing

研究者は、コアワークに基づいて2つのアプリケーションを開発しました。潜在的な空間編集と画像編集です。潜在的な空間編集は、トレーニング時に提供される解釈可能なユーザーコントロールを提供し、ターゲットドメインに忠実で、一貫性があり、変化に伴って変化します。

GANスケッチングのカスタムモデルでの滑らかな潜在的な空間補間。

GANスケッチングのカスタムモデルでの滑らかな潜在的な空間補間。

潜在的な空間編集コンポーネントは、2020年のGANSpaceプロジェクトによって提供されました。これは、Aalto大学、Adobe、NVIDIAの共同プロジェクトです。

単一の画像もカスタマイズされたモデルにフィードできます。これにより、自然な画像編集が可能になります。このアプリケーションでは、単一の画像はカスタマイズされたGANに投影され、直接編集が可能になります。また、潜在的な空間編集も可能です。

ここでは、実際の画像が入力としてGAN(猫モデル)に使用され、入力は提出されたスケッチに合わせて編集されます。これにより、スケッチを使用した画像編集が可能になります。

ここでは、実際の画像が入力としてGAN(猫モデル)に使用され、入力は提出されたスケッチに合わせて編集されます。これにより、スケッチを使用した画像編集が可能になります。

システムはリアルタイムで動作するように設計されていません。少なくともトレーニングと較正の観点からです。現在、GANスケッチングには30,000回のトレーニングイテレーションが必要です。システムは、元のモデルに対する元のトレーニングデータへのアクセスも必要です。

データセットがオープンソースで、ローカルでのコピーが許可されるライセンスを持っている場合は、ソースデータをローカルにインストールされたパッケージに含めることで、これを実現できますが、かなりのディスク容量を占めることになります。あるいは、クラウドベースのアプローチを使用して、データにリモートでアクセスまたは処理することで、これを実現できますが、ネットワークオーバーヘッドと(クラウド上で実際の処理が発生する場合)可能なコンピューティングコストの考慮が必要になります。

人間によって生成されたスケッチのみでトレーニングされたカスタムFFHQモデルからの変換。

人間によって生成されたスケッチのみでトレーニングされたカスタムFFHQモデルからの変換。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai