Model dan platform AI
Pengeditan Gambar Semantik Presisi Tinggi dengan EditGAN
Jaringan Adversarial Generatif atau GAN telah menikmati aplikasi baru di industri pengeditan gambar. Selama beberapa bulan terakhir, EditGAN mendapatkan popularitas di industri AI/ML karena merupakan metode baru untuk pengeditan gambar semantik presisi tinggi dan berkualitas tinggi.
Kami akan membahas model EditGAN secara detail dan memberitahu Anda mengapa itu mungkin menjadi tonggak dalam industri pengeditan gambar semantik.
Jadi mari kita mulai. Tapi sebelum kita tahu apa itu EditGAN, penting bagi kita untuk memahami apa pentingnya EditGAN dan mengapa itu langkah maju yang signifikan.
Mengapa EditGAN?
Meskipun arsitektur GAN tradisional telah membantu industri pengeditan gambar berbasis AI berkembang secara signifikan, ada beberapa tantangan besar dalam membangun arsitektur GAN dari awal.
- Selama fase pelatihan, arsitektur GAN memerlukan sejumlah besar data yang dilabeli dengan anotasi segmentasi semantik.
- Mereka hanya dapat memberikan kontrol tingkat tinggi.
- Dan seringkali, mereka hanya melakukan interpolasi bolak-balik antara gambar.
Dapat diamati bahwa meskipun arsitektur GAN tradisional menyelesaikan pekerjaan, mereka tidak efektif untuk penerapan skala besar. Inefisiensi arsitektur GAN tradisional adalah alasan mengapa EditGAN diperkenalkan oleh NVIDIA (NVDA ) pada tahun 2022.
EditGAN diusulkan sebagai metode efektif untuk pengeditan gambar semantik presisi tinggi dan berkualitas tinggi dengan kemampuan memungkinkan penggunanya untuk mengedit gambar dengan mengubah masker segmentasi yang sangat detail dari gambar. Salah satu alasan mengapa EditGAN adalah metode yang dapat diskalakan untuk tugas pengeditan gambar adalah karena arsitekturanya.
Model EditGAN dibangun pada kerangka GAN yang memodelkan gambar dan segmentasi semantiknya secara bersamaan, dan hanya memerlukan sejumlah kecil data pelatihan yang dilabeli atau diannotasi. Pengembang EditGAN telah mencoba memasukkan gambar ke dalam ruang latent GAN untuk mengedit gambar secara efektif dengan melakukan optimasi kode latent kondisional sesuai dengan edit segmentasi. Selain itu, untuk menghemat optimasi, model tersebut mencoba menemukan “vektor editing” di ruang latent yang merealisasikan edit.
Arsitektur EditGAN memungkinkan model untuk belajar sejumlah vektor editing yang dapat diterapkan langsung pada gambar lain dengan kecepatan tinggi dan efisiensi. Selain itu, hasil eksperimental menunjukkan bahwa EditGAN dapat mengedit gambar dengan tingkat detail yang belum pernah terlihat sebelumnya sambil mempertahankan kualitas gambar maksimal.
Untuk merangkum mengapa kita memerlukan EditGAN, itu adalah kerangka pengeditan gambar berbasis GAN pertama yang menawarkan
- Pengeditan presisi sangat tinggi.
- Dapat bekerja dengan sejumlah kecil data yang dilabeli.
- Dapat diterapkan secara efektif dalam skenario waktu nyata.
- Memungkinkan komposisi untuk beberapa edit secara bersamaan.
- Bekerja pada gambar yang dihasilkan GAN, gambar nyata yang disematkan, dan bahkan gambar di luar domain.
Pengeditan Gambar Semantik Presisi Tinggi dengan EditGAN
StyleGAN2, kerangka GAN canggih untuk sintesis gambar, adalah komponen generasi gambar utama dari EditGAN. Kerangka StyleGAN2 memetakan kode latent yang diambil dari distribusi normal multivariat, dan memetaskannya menjadi gambar realistis.
StyleGAN2 adalah model generatif dalam yang telah dilatih untuk mensintesis gambar dengan kualitas tertinggi mungkin bersama dengan memperoleh pemahaman semantik tentang gambar yang dimodelkan.
Latihan dan Inferensi Segmentasi
Model EditGAN memasukkan gambar ke dalam ruang latent GAN menggunakan optimasi, dan encoder untuk melakukan segmentasi pada gambar baru, dan melatih cabang segmentasi. Kerangka EditGAN terus membangun pada karya sebelumnya, dan melatih encoder untuk memasukkan gambar ke dalam ruang latent. Tujuan utama di sini adalah untuk melatih encoder yang terdiri dari konstruksi kerugian L2 dan LPIPS standar menggunakan sampel dari GAN, dan data pelatihan nyata. Selain itu, model tersebut juga mengatur encoder secara eksplisit menggunakan kode latent saat bekerja dengan sampel GAN.
Hasilnya, model tersebut memasukkan gambar yang diannotasi dari dataset yang dilabeli dengan segmentasi semantik ke dalam ruang latent, dan menggunakan kerugian entropi silang untuk melatih cabang segmentasi dari generator.
Menggunakan Pengeditan Segmentasi untuk Menemukan Semantik di Ruang Latent
Tujuan utama dari EditGAN adalah untuk memanfaatkan distribusi bersama dari segmentasi semantik dan gambar untuk pengeditan gambar presisi tinggi. Misalkan kita memiliki gambar x yang perlu diedit, maka model memasukkan gambar ke dalam ruang latent EditGAN atau menggunakan sampel gambar dari model itu sendiri. Cabang segmentasi kemudian menghasilkan y atau segmentasi yang sesuai karena baik gambar RGB dan segmentasi berbagi kode latent yang sama w. Pengembang kemudian dapat menggunakan alat pelabelan atau lukisan digital apa pun untuk memodifikasi segmentasi dan mengeditnya secara manual sesuai dengan kebutuhan mereka.

Cara Berbeda untuk Mengedit Selama Inferensi
Vektor editing yang diperoleh menggunakan optimasi dapat digambarkan sebagai memiliki makna semantik, dan seringkali terdisentang dengan atribut yang berbeda. Oleh karena itu, untuk mengedit gambar baru, model dapat langsung memasukkan gambar ke dalam ruang latent, dan melakukan operasi editing yang sama yang dipelajari sebelumnya, tanpa melakukan optimasi dari awal. Dapat dikatakan bahwa vektor editing yang dipelajari oleh model tersebut menghemat optimasi yang diperlukan untuk mengedit gambar secara awal.
Perlu diingat bahwa pengembang masih belum memperbaiki disentanglement, dan vektor edit seringkali tidak mengembalikan hasil terbaik saat digunakan pada gambar lain. Namun, masalah ini dapat diatasi dengan menghilangkan artefak editing dari bagian lain gambar dengan melakukan beberapa langkah optimasi tambahan selama waktu pengujian.
Berdasarkan pembelajaran kita saat ini, kerangka EditGAN dapat digunakan untuk mengedit gambar dalam tiga mode yang berbeda.
- Pengeditan Waktu Nyata dengan Vektor Editing
Untuk gambar yang dilokalisasi dan terdisentang, model mengedit gambar dengan menerapkan vektor editing yang dipelajari sebelumnya dengan skala yang berbeda, dan memanipulasi gambar pada tingkat interaktif.
- Menggunakan Pemolesan Mandiri untuk Pengeditan Berbasis Vektor
Untuk mengedit gambar yang dilokalisasi yang tidak terdisentang dengan baik dengan bagian lain gambar, model memulai pengeditan gambar menggunakan vektor editing yang dipelajari sebelumnya, dan menghilangkan artefak editing dengan melakukan beberapa langkah optimasi tambahan selama waktu pengujian.
- Pengeditan Berbasis Optimasi
Untuk melakukan edit skala besar dan edit gambar spesifik, model melakukan optimasi dari awal karena vektor editing tidak dapat digunakan untuk melakukan transfer tersebut ke gambar lain.
Implementasi
Kerangka EditGAN dievaluasi pada gambar yang tersebar di empat kategori yang berbeda: Mobil, Burung, Kucing, dan Wajah. Cabang segmentasi model dilatih menggunakan pasangan gambar-masker yang dilabeli dengan 16, 30, 30, 16 sebagai data pelatihan yang dilabeli untuk Mobil, Burung, Kucing, dan Wajah. Ketika gambar diedit menggunakan optimasi murni, atau ketika model mencoba mempelajari vektor editing, model melakukan 100 langkah optimasi menggunakan optimizer Adam.
Untuk dataset Kucing, Mobil, dan Wajah, model menggunakan gambar nyata dari set tes DatasetGAN yang tidak digunakan untuk melatih kerangka GAN untuk melakukan fungsionalitas pengeditan. Langsung, gambar-gambar ini dipasukkan ke dalam ruang latent EditGAN menggunakan optimasi dan pengkodean. Untuk kategori Burung, pengeditan ditunjukkan pada gambar yang dihasilkan GAN.
Hasil
Hasil Kualitatif
Hasil Dalam Domain

Gambar di atas menunjukkan kinerja kerangka EditGAN ketika menerapkan vektor editing yang dipelajari sebelumnya pada gambar baru, dan memperbarui gambar menggunakan 30 langkah optimasi. Operasi pengeditan yang dilakukan oleh kerangka EditGAN ini terdisentang untuk semua kelas, dan mempertahankan kualitas gambar secara keseluruhan. Dengan membandingkan hasil EditGAN dan model lain, dapat diamati bahwa kerangka EditGAN outperform metode lain dalam melakukan edit presisi tinggi dan kompleks sambil mempertahankan identitas subjek dan kualitas gambar pada saat yang sama.
Apa yang menakjubkan adalah bahwa kerangka EditGAN dapat melakukan edit presisi sangat tinggi seperti memperbesar pupil, atau mengedit roda pada ban mobil. Selain itu, EditGAN juga dapat digunakan untuk mengedit bagian semantik dari objek yang hanya memiliki beberapa piksel, atau dapat digunakan untuk melakukan modifikasi skala besar pada gambar. Perlu diingat bahwa beberapa operasi pengeditan kerangka EditGAN dapat menghasilkan gambar yang dimanipulasi yang tidak seperti gambar yang muncul dalam data pelatihan GAN.
Hasil Di Luar Domain
Untuk mengevaluasi kinerja EditGAN di luar domain, kerangka tersebut telah diuji pada dataset MetFaces. Model EditGAN menggunakan wajah nyata dalam domain untuk membuat vektor editing. Model kemudian memasukkan potret MetFaces yang di luar domain menggunakan proses optimasi 100 langkah, dan menerapkan vektor editing melalui proses pembaruan mandiri 30 langkah. Hasilnya dapat dilihat pada gambar berikut.

Hasil Kuantitatif
Untuk mengukur kemampuan pengeditan gambar EditGAN secara kuantitatif, model menggunakan benchmark edit senyum yang pertama kali diperkenalkan oleh MaskGAN. Wajah dengan ekspresi netral digantikan dengan wajah yang tersenyum, dan kinerja diukur melintasi tiga parameter.
- Koreksi Semantik
Model menggunakan klasifikasi atribut senyum pra-dilatih untuk mengukur apakah wajah dalam gambar menunjukkan ekspresi tersenyum setelah diedit.
- Kualitas Gambar Tingkat Distribusi
Jarak Inception Kernel atau KID dan Jarak Inception Frechet atau FID dihitung antara dataset uji CelebA dan 400 gambar uji yang diedit.
- Pemeliharaan Identitas
Kemampuan model untuk mempertahankan identitas subjek saat mengedit gambar diukur menggunakan jaringan ekstraksi fitur ArcFace pra-dilatih.

Tabel di atas membandingkan kinerja kerangka EditGAN dengan model baseline lain pada benchmark edit senyum. Metode yang diikuti oleh kerangka EditGAN untuk menghasilkan hasil yang tinggi dibandingkan dengan tiga baseline yang berbeda:
- MaskGAN
MaskGAN mengambil gambar yang tidak tersenyum bersama dengan masker segmentasinya, dan masker segmentasi senyum target sebagai input. Perlu diingat bahwa dibandingkan dengan EditGAN, kerangka MaskGAN memerlukan sejumlah besar data yang diannotasi.
- Pengeditan Lokal
EditGAN juga membandingkan kinerjanya dengan pengeditan lokal, metode yang digunakan untuk mengklaster fitur GAN untuk mengimplementasikan pengeditan lokal, dan bergantung pada gambar referensi.
- InterFaceGAN
Sama seperti EditGAN, InterFaceGAN juga mencoba menemukan vektor editing di ruang latent model. Namun, tidak seperti EditGAN, model InterFaceGAN menggunakan sejumlah besar data yang diannotasi, klasifikasi atribut bantu, dan tidak memiliki presisi editing yang halus.
- StyleGAN2Distilasi
Metode ini membuat pendekatan alternatif yang tidak memerlukan penyematan gambar nyata, dan sebagai gantinya menggunakan model vektor editing untuk membuat dataset pelatihan.

Batasan
Karena EditGAN didasarkan pada kerangka GAN, itu memiliki keterbatasan yang sama dengan model GAN lain: itu hanya dapat bekerja dengan gambar yang dapat dimodelkan oleh GAN. Keterbatasan EditGAN untuk bekerja dengan gambar yang dimodelkan GAN adalah alasan utama mengapa sulit untuk mengimplementasikan EditGAN di berbagai skenario. Namun, perlu diingat bahwa edit presisi tinggi EditGAN dapat dengan mudah dipindahkan ke gambar lain dengan menggunakan vektor editing.
Kesimpulan
Salah satu alasan utama mengapa GAN bukanlah standar industri dalam bidang pengeditan gambar adalah karena keterbatasan praktisnya. Kerangka GAN biasanya memerlukan sejumlah besar data pelatihan yang dilabeli, dan mereka tidak selalu mengembalikan efisiensi dan akurasi yang tinggi.
EditGAN bertujuan untuk mengatasi masalah yang disajikan oleh kerangka GAN konvensional, dan itu mencoba untuk menjadi metode efektif untuk pengeditan gambar semantik berkualitas tinggi dan presisi tinggi. Hasilnya sejauh ini telah menunjukkan bahwa EditGAN memang menawarkan apa yang diklaim, dan itu sudah melakukan lebih baik daripada beberapa praktik dan model standar industri saat ini.












