Sudut Anderson
Mengedit Ruang Laten GAN dengan ‘Blobs’

Penelitian baru dari UC Berkeley dan Adobe (ADBE ) menawarkan cara untuk langsung mengedit konten hiperreal yang dapat dibuat oleh Jaringan Adversarial Generatif (GAN), tetapi yang biasanya tidak dapat dikendalikan, dianimasikan, atau dimanipulasi secara bebas dengan cara yang sudah lama dikenal oleh pengguna Photoshop dan praktisi CGI.
Bertajuk BlobGAN, metode ini melibatkan pembuatan grid ‘blobs’ – konstruk matematika yang memetakan langsung ke konten dalam ruang laten GAN.
Dengan memindahkan blobs, Anda dapat memindahkan ‘objek’ dalam representasi adegan, dengan cara yang lebih intuitif dan lebih dekat dengan metode CGI dan CAD daripada banyak upaya saat ini untuk memetakan dan mengendalikan ruang laten GAN:

Manipulasi adegan dengan BlobGAN: saat ‘blobs’ dipindahkan oleh pengguna, disposisi objek laten dan gaya dalam GAN berubah secara bersamaan. Untuk contoh lebih lanjut, lihat video yang menyertain paper ini, yang disematkan di akhir artikel ini, atau di https://www.youtube.com/watch?v=KpUv82VsU5k
Karena blobs sesuai dengan ‘objek’ dalam adegan yang dipetakan dalam ruang laten GAN, semua objek dipisahkan a priori, sehingga memungkinkan untuk mengubahnya secara individual:

Objek dapat diubah ukurannya, diperkecil, dikloning, dan dihapus, di antara operasi lainnya.
Seperti dengan objek dalam perangkat lunak pengeditan foto (atau bahkan pengeditan teks), sebuah blob dapat diduplikasi dan kemudian dimanipulasi:

Blobs dapat diduplikasi dalam antarmuka, dan representasi laten yang sesuai juga akan ‘disalin dan ditempelkan’. Sumber: https://dave.ml/blobgan/#results
BlobGAN juga dapat memparse gambar baru yang dipilih oleh pengguna ke dalam ruang latennya:

Dengan BlobGAN, Anda tidak perlu menggabungkan gambar yang ingin Anda manipulasi langsung ke dalam data pelatihan dan kemudian mencari kode laten mereka, tetapi dapat memasukkan gambar yang dipilih secara sewenang-wenang dan memanipulasi mereka. Sumber: https://dave.ml/blobgan/#results
Hasil lebih lanjut dapat dilihat di sini, dan dalam video YouTube yang menyertain di sini (disematkan di akhir artikel ini). Ada juga demo interaktif Colab di sini*, dan repo GitHub di sini**.
Jenis instrumentasi dan cakupan ini mungkin tampak naif di era pasca-Photoshop, dan paket perangkat lunak parametri seperti Cinema4D dan Blender telah memungkinkan pengguna untuk membuat dan mengkustomisasi dunia 3D selama beberapa dekade; tetapi ini mewakili pendekatan yang menjanjikan untuk menundukkan keeksentrikan dan sifat laten yang tidak terduga dalam Jaringan Adversarial Generatif, dengan menggunakan entitas proksi yang dipetakan ke kode laten.
Para penulis menyatakan:
‘Pada dataset multi-kategori yang menantang dari adegan indoor, BlobGAN outperforms Style-GAN2 dalam kualitas gambar yang diukur oleh FID.’
Paper ini berjudul BlobGAN: Representasi Adegan yang Dipisahkan Secara Spatial, dan ditulis oleh dua peneliti dari UC Berkeley, bersama dengan tiga dari Adobe Research.
Perantara
BlobGAN membawa paradigma baru ke sintesis gambar GAN. Pendekatan sebelumnya untuk menangani entitas diskrit dalam ruang laten, paper baru ini menunjukkan, telah menjadi ‘top-down’ atau ‘bottom-up’.
Metode top-down dalam GAN atau pengklasifikasi gambar mengobati gambar adegan sebagai kelas, seperti ‘kamar tidur’, ‘gereja’, ‘wajah’, dll. Jenis pasangan teks/gambar ini memungkinkan generasi baru kerangka sintesis gambar multimodal, seperti DALL-E 2 dari OpenAI.
Pendekatan bottom-up, sebaliknya, memetakan setiap piksel dalam gambar ke dalam kelas, label, atau kategori. Pendekatan ini menggunakan teknik yang beragam, meskipun segmentasi semantik adalah strand penelitian populer saat ini.
Para penulis mengomentari:
‘Kedua jalur ini tampak tidak memuaskan karena tidak dapat menyediakan cara yang mudah untuk berpikir tentang bagian adegan sebagai entitas. Bagian adegan baik dipanggang menjadi vektor laten yang terjalin tunggal (top-down), atau perlu dikelompokkan bersama dari label piksel individu (bottom-up).’
Sebaliknya, BlobGAN menawarkan representasi mid-level yang tidak terawasi, atau kerangka proksi untuk model generatif.

Jaringan tata letak memetakan entitas ‘blob’ lokal (dan terkendali) ke kode laten. Lingkaran berwarna di tengah terdiri dari ‘peta blob’. Sumber: https://arxiv.org/pdf/2205.02837.pdf
Blobs Gaussian (yaitu berbasis noise) diurutkan berdasarkan kedalaman, dan mewakili bottleneck dalam arsitektur yang mengassignkan pemetaan ke setiap entitas, memecahkan hambatan terbesar dalam manipulasi konten GAN: pemisahan (juga masalah untuk arsitektur berbasis autoencoder). ‘Peta blob’ yang dihasilkan digunakan untuk memanipulasi dekoder BlobGAN.
Para penulis mencatat dengan sedikit kejutan bahwa sistem ini belajar untuk memecahkan adegan menjadi tata letak dan entitas melalui discriminator yang tidak menggunakan label eksplisit.
Arsitektur dan Data
Entitas dalam peta blob diubah menjadi gambar melalui jaringan StyleGAN2 yang direvisi, dalam pendekatan yang mengambil inspirasi dari penelitian NVIDIA (NVDA ) sebelumnya.

Jaringan StyleGAN 2 yang direvisi dari NVIDIA Research. Beberapa prinsip dalam pekerjaan ini diadopsi atau disesuaikan untuk BlobGAN. Sumber: https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2 dimodifikasi dalam BlobGAN untuk menerima input dari peta blob bukan vektor global tunggal, seperti biasanya.

Serangkaian manipulasi yang dimungkinkan oleh BlobGAN, termasuk ‘penyelesaian’ adegan kamar tidur kosong, dan perubahan ukuran dan lokasi elemen dalam ruangan. Di baris bawah, kita melihat instrumentasi yang dapat diakses pengguna yang memungkinkan ini – peta blob.
Dengan analogi, bukan membawa bangunan yang besar dan kompleks (ruang laten) ke dalam keberadaan sekaligus, dan kemudian harus menjelajahi jalan-jalannya yang tak terbatas, BlobGAN mengirimkan blok-blok komponen di awal, dan selalu tahu di mana mereka berada. Pemisahan konten dan lokasi ini adalah inovasi utama dari pekerjaan ini.
* Tidak berfungsi pada saat penulisan
** Kode belum dipublikasikan pada saat penulisan
Dipublikasikan pertama kali pada 8 Mei 2022.












