Sudut Anderson

Membuat Jaringan Adversarial Generatif Kustom dengan Sketsa

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Peneliti dari Carnegie Mellon dan MIT telah mengembangkan metode baru yang memungkinkan pengguna membuat sistem pembuatan gambar Generative Adversarial Network (GAN) kustom hanya dengan menggambar sketsa yang menggambarkan objek yang diinginkan.

Sistem seperti ini dapat memungkinkan pengguna akhir untuk membuat sistem pembuatan gambar yang dapat menghasilkan gambar yang sangat spesifik, seperti hewan tertentu, jenis bangunan – dan bahkan orang individu. Saat ini, sebagian besar sistem pembuatan gambar GAN menghasilkan output yang luas dan cukup acak, dengan kemampuan terbatas untuk menentukan karakteristik tertentu, seperti breed hewan, jenis rambut pada orang, gaya arsitektur atau identitas wajah yang sebenarnya.

Pendekatan ini, yang diuraikan dalam makalah Sketch Your Own GAN, menggunakan antarmuka menggambar yang inovatif sebagai fungsi ‘pencarian’ yang efektif untuk menemukan fitur dan kelas dalam basis data gambar yang padat yang mungkin berisi ribuan jenis objek, termasuk banyak sub-jenis yang tidak relevan dengan niat pengguna. GAN kemudian dilatih pada subset gambar yang disaring.

Dengan menggambar jenis objek yang spesifik dengan yang pengguna ingin kalibrasi GAN, kemampuan generatif kerangka kerja menjadi spesialis untuk kelas tersebut. Misalnya, jika pengguna ingin membuat kerangka kerja yang menghasilkan jenis kucing tertentu (bukan hanya kucing biasa, seperti yang dapat diperoleh dengan This Cat Does Not Exist), sketsa input mereka berfungsi sebagai filter untuk menolak kelas kucing yang tidak relevan.

 

Sumber: https://peterwang512.github.io/GANSketching/

Sumber: https://peterwang512.github.io/GANSketching/

Penelitian ini dipimpin oleh Sheng Yu-Wang dari Carnegie Mellon University, bersama dengan rekan Jun-Yan Zhu, dan David Bau dari Laboratorium Ilmu Komputer dan Kecerdasan Buatan MIT.

Metode ini sendiri disebut ‘GAN sketching’, dan menggunakan sketsa input untuk langsung mengubah bobot model GAN ‘template’ untuk menargetkan domain atau sub-domain yang diidentifikasi melalui kerugian adversarial antar domain.

Berbagai metode regularisasi yang berbeda dieksplorasi untuk memastikan bahwa output model tersebut beragam, sambil mempertahankan kualitas gambar yang tinggi. Peneliti membuat aplikasi sampel yang dapat melakukan interpolasi ruang laten dan prosedur pengeditan gambar.

Ini [$class] Tidak Ada

Sistem pembuatan gambar berbasis GAN telah menjadi tren, jika tidak sebuah meme, selama beberapa tahun terakhir, dengan proliferasi proyek yang dapat menghasilkan gambar dari hal-hal yang tidak ada, termasuk orang, apartemen sewa, camilan, kaki, kuda, politisi dan serangga, di antara banyak lainnya.

Sistem sintesis gambar berbasis GAN dibuat dengan mengompilasi atau mengkurasi basis data ekstensif yang berisi gambar dari domain target, seperti wajah atau kuda; melatih model yang menggeneralisasi berbagai fitur di seluruh basis data; dan mengimplementasikan modul generator yang dapat menghasilkan contoh acak berdasarkan fitur yang dipelajari.

Output dari sketsa di DeepFacePencil, yang memungkinkan pengguna membuat wajah fotorealistik dari sketsa. Banyak proyek serupa ada.

Output dari sketsa di DeepFacePencil, yang memungkinkan pengguna membuat wajah fotorealistik dari sketsa. Banyak proyek serupa ada. Sumber: https://arxiv.org/pdf/2008.13343.pdf

Fitur berdimensi tinggi adalah yang pertama kali dikonkretkan selama proses pelatihan, dan setara dengan sapuan warna yang luas pada kanvas. Fitur-fitur ini akhirnya akan berkorelasi dengan fitur yang lebih rinci (yaitu kilau mata dan kumis yang tajam dari seekor kucing, bukan hanya blob beige generik yang mewakili kepala).

Saya Tahu Apa yang Anda Maksud…

Dengan memetakan hubungan antara bentuk-bentuk awal yang seminal ini dan interpretasi yang lebih rinci yang diperoleh kemudian dalam proses pelatihan, memungkinkan untuk menginfer hubungan antara ‘kabur’ dan ‘spesifik’ gambar, memungkinkan pengguna membuat gambar yang kompleks dan fotorealistik dari coretan yang kasar.

Baru-baru ini NVIDIA merilis versi desktop dari penelitian jangka panjang GauGAN tentang pembuatan lanskap berbasis GAN, yang dengan mudah mendemonstrasikan prinsip ini:

Coretan yang kasar diterjemahkan menjadi gambar lanskap yang kaya melalui GauGAN NVIDIA, dan sekarang aplikasi NVIDIA Canvas. Sumber: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Coretan yang kasar diterjemahkan menjadi gambar lanskap yang kaya melalui GauGAN NVIDIA, dan sekarang aplikasi NVIDIA Canvas. Sumber: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Demikian pula, beberapa sistem seperti DeepFacePencil telah menggunakan prinsip yang sama untuk membuat generator gambar fotorealistik yang diinduksi oleh sketsa untuk berbagai domain.

Arsitektur DeepFacePencil.

Arsitektur DeepFacePencil.

Memudahkan Sketsa-ke-Gambar

Pendekatan GAN Sketching yang baru ini bertujuan untuk menghilangkan beban yang berat dari pengumpulan dan kurasi data yang biasanya terlibat dalam pengembangan kerangka kerja gambar GAN, dengan menggunakan input pengguna untuk menentukan subset gambar yang harus menjadi data pelatihan.

Sistem ini dirancang untuk hanya memerlukan sejumlah kecil sketsa input untuk mengkalibrasi kerangka kerja. Sistem ini secara efektif membalikkan fungsionalitas PhotoSketch, sebuah inisiatif penelitian bersama dari 2019 oleh peneliti dari Carnegie Mellon, Adobe, Uber ATG dan Argo AI, yang dimasukkan ke dalam pekerjaan baru ini. PhotoSketch dirancang untuk membuat sketsa artistik dari gambar, dan sudah mengandung pemetaan efektif hubungan pembuatan gambar yang kabur>spesifik.

Untuk bagian generasi proses, metode baru ini hanya memodifikasi bobot StyleGAN2. Karena data gambar yang digunakan hanya subset dari data yang tersedia, memodifikasi jaringan pemetaan saja sudah mendapatkan hasil yang diinginkan.

Metode ini dievaluasi pada sejumlah sub-domain populer, termasuk kuda, gereja, dan kucing.

Dataset LSUN dari Universitas Princeton tahun 2016 digunakan sebagai bahan utama untuk menghasilkan sub-domain target. Untuk membangun sistem pemetaan sketsa yang robust terhadap kekhasan input sketsa pengguna, sistem ini dilatih pada gambar dari dataset QuickDraw yang dikembangkan oleh Microsoft antara 2021-2016.

Meskipun pemetaan sketsa antara PhotoSketch dan QuickDraw cukup berbeda, peneliti menemukan bahwa kerangka kerja mereka berhasil dengan baik dalam memenuhi mereka dengan mudah pada pose yang relatif sederhana, meskipun pose yang lebih rumit (seperti kucing yang berbaring) membuktikan lebih menantang, sementara input pengguna yang sangat abstrak (yaitu gambar yang sangat kasar) juga menghambat kualitas hasil.

Ruang Laten dan Pengeditan Gambar Alami

Peneliti mengembangkan dua aplikasi berdasarkan pekerjaan inti: pengeditan ruang laten, dan pengeditan gambar. Pengeditan ruang laten menawarkan kontrol pengguna yang dapat diinterpretasikan yang difasilitasi pada saat pelatihan, dan memungkinkan variasi yang luas sambil tetap setia pada domain target, dan konsisten menyenangkan di seluruh variasi.

Interpolasi ruang laten yang mulus dengan model kustom GAN Sketching.

Interpolasi ruang laten yang mulus dengan model kustom GAN Sketching.

Komponen pengeditan ruang laten didukung oleh proyek GANSpace tahun 2020, sebuah inisiatif bersama dari Universitas Aalto, Adobe dan NVIDIA.

Gambar tunggal juga dapat diberikan ke model kustom, memfasilitasi pengeditan gambar alami. Dalam aplikasi ini, gambar tunggal diprojeksikan ke GAN kustom, tidak hanya memungkinkan pengeditan langsung, tetapi juga mempertahankan pengeditan ruang laten yang lebih tinggi, jika ini juga telah digunakan.

Di sini, gambar nyata telah digunakan sebagai input untuk GAN (model kucing), yang mengedit input untuk mencocokkan sketsa yang dikirim. Ini memungkinkan pengeditan gambar melalui sketsa.

Di sini, gambar nyata telah digunakan sebagai input untuk GAN (model kucing), yang mengedit input untuk mencocokkan sketsa yang dikirim. Ini memungkinkan pengeditan gambar melalui sketsa.

Meskipun dapat dikonfigurasi, sistem ini tidak dirancang untuk bekerja dalam waktu nyata, setidaknya dalam hal pelatihan dan kalibrasi. Saat ini GAN Sketching memerlukan 30.000 iterasi pelatihan. Sistem ini juga memerlukan akses ke data pelatihan asli untuk model asli.

Dalam kasus di mana dataset bersifat open source, dan memiliki lisensi yang memungkinkan penyalinan lokal, ini dapat diakomodasi dengan memasukkan data sumber dalam paket yang dipasang secara lokal, meskipun ini akan memakan ruang disk yang cukup; atau dengan mengakses atau memproses data secara remote, melalui pendekatan berbasis awan, yang memperkenalkan overhead jaringan dan (dalam kasus pemrosesan yang sebenarnya terjadi di awan) mungkin pertimbangan biaya komputasi.

Transformasi dari model FFHQ kustom yang dilatih hanya pada 4 sketsa yang dibuat oleh manusia.

Transformasi dari model FFHQ kustom yang dilatih hanya pada sketsa yang dibuat oleh manusia.

Penulis tentang pembelajaran mesin, spesialis domain sintesis gambar manusia. Mantan kepala konten penelitian di Metaphysic.ai, hingga pembubarannya ke dalam Brahma.ai DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai