Sudut Anderson
Manfaat Tidak Terduga dari Pemetaan Ruang Laten GAN

Saat mencoba meningkatkan kualitas dan kesetiaan gambar yang dihasilkan AI, sekelompok peneliti dari Cina dan Australia secara tidak sengaja menemukan metode untuk mengontrol interaktif ruang laten Jaringan Adversarial Generatif (GAN) – matriks kalkulatif misterius di balik gelombang baru teknik sintesis gambar yang akan merevolusi film, game, media sosial, dan banyak sektor lainnya dalam hiburan dan penelitian.
Penemuan mereka, hasil sampingan dari tujuan utama proyek, memungkinkan pengguna untuk mengeksplorasi ruang laten GAN secara sewenang-wenang dan interaktif dengan mouse, seperti menggeser video atau membalik halaman buku.

Cuplikan dari video peneliti (lihat embed di akhir artikel untuk contoh lainnya). Perhatikan bahwa pengguna memanipulasi transformasi dengan kursor ‘grab’ (atas kiri). Sumber: https://www.youtube.com/watch?v=k7sG4XY5rIc
Metode ini menggunakan ‘peta panas’ untuk menunjukkan area mana dari gambar yang perlu diperbaiki saat GAN menjalankan dataset yang sama berulang kali. Peta panas dimaksudkan untuk meningkatkan kualitas gambar dengan memberitahu GAN di mana ia salah, sehingga upaya berikutnya akan lebih baik; namun, secara kebetulan, ini juga menyediakan ‘peta’ dari seluruh ruang laten yang dapat dibrowse dengan menggerakkan mouse.

Perhatian visual spasial ditekankan melalui GradCAM, yang menunjukkan area yang memerlukan perhatian dengan mengenakan warna cerah. Sumber: https://arxiv.org/pdf/2112.00718.pdf
Makalah tersebut berjudul Improving GAN Equilibrium by Raising Spatial Awareness, dan berasal dari peneliti di Universitas Cina Hong Kong dan Universitas Nasional Australia. Selain makalah, video dan materi lainnya dapat ditemukan di halaman proyek.
Penelitian ini masih dalam tahap awal, dan saat ini terbatas pada gambar resolusi rendah (256×256), tetapi merupakan bukti konsep yang berjanji untuk membuka ‘kotak hitam’ ruang laten, dan datang pada saat ketika banyak proyek penelitian sedang mengembangkan kontrol yang lebih besar atas sintesis gambar.
Meskipun gambar-gambar tersebut menarik (dan Anda dapat melihat lebih banyak di antaranya, dengan resolusi yang lebih baik, dalam video yang disematkan di akhir artikel ini), apa yang mungkin lebih signifikan adalah bahwa proyek ini telah menemukan cara untuk meningkatkan kualitas gambar, dan potensial untuk melakukannya dengan lebih cepat, dengan memberitahu GAN secara spesifik di mana ia salah selama pelatihan.
Tetapi, seperti Adversarial menunjukkan, GAN bukanlah satu entitas, melainkan konflik yang tidak seimbang antara otoritas dan kerja keras. Untuk memahami perbaikan yang telah dibuat oleh peneliti dalam hal ini, mari kita lihat bagaimana perang ini telah digambarkan sampai sekarang.
Nasib Memilukan dari Generator
Jika Anda pernah diganggu oleh pikiran bahwa beberapa barang baru yang Anda beli diproduksi di pabrik yang dieksploitasi di negara yang dieksploitasi, atau memiliki bos atau klien yang terus mengatakan ‘Lakukan lagi!’ tanpa pernah memberitahu apa yang salah dengan upaya terakhir Anda, simpan sedikit belas kasihan untuk bagian Generator dari Jaringan Adversarial Generatif.

Generator adalah kuda kerja yang telah mempesona Anda selama lima tahun terakhir dengan membantu GAN menciptakan orang-orang yang sangat realistis yang tidak ada, meningkatkan game video lama ke resolusi 4k, dan mengubah footage abad ke-19 menjadi output HD penuh warna pada 60fps, di antara keajaiban AI lainnya.

Dari menciptakan wajah orang yang tidak ada hingga memulihkan footage kuno dan menghidupkan kembali game video arsip, GAN telah sibuk dalam beberapa tahun terakhir.
Generator menjalankan semua data pelatihan lagi dan lagi (seperti gambar wajah, untuk membuat GAN yang dapat menciptakan foto orang yang tidak ada), satu foto pada satu waktu, selama beberapa hari, atau bahkan minggu, sampai ia dapat menciptakan gambar yang sama meyakinkan dengan foto asli yang dipelajari.
Bagaimana Generator tahu bahwa ia membuat kemajuan, setiap kali ia mencoba menciptakan gambar yang lebih baik dari upaya sebelumnya?
Generator memiliki bos yang kejam.

Kekejaman yang Tidak Terhindarkan dari Discriminator
Tugas Discriminator adalah memberitahu Generator bahwa ia tidak melakukan dengan cukup baik dalam menciptakan gambar yang asli, dan untuk Lakukan lagi!. Discriminator tidak memberitahu Generator apa yang salah dengan upaya terakhir Generator; ia hanya melihatnya secara pribadi, membandingkan gambar yang dihasilkan dengan gambar sumber (juga secara pribadi), dan memberikan skor.
Skor tidak pernah cukup baik. Discriminator tidak akan berhenti mengatakan ‘Lakukan lagi!’ sampai peneliti mematikannya (ketika mereka memutuskan bahwa pelatihan tambahan tidak akan memperbaiki output lebih lanjut).
Dengan cara ini, tanpa kritik yang konstruktif, dan bersenjata hanya dengan skor yang metriknya adalah misteri, Generator harus menebak secara acak bagian mana atau aspek gambar yang menyebabkan skor yang lebih tinggi dari sebelumnya. Ini akan membawanya ke banyak rute yang tidak memuaskan sebelum ia mengubah sesuatu dengan cukup positif untuk mendapatkan skor yang lebih tinggi.
Discriminator sebagai Tutor dan Mentor
Inovasi yang disediakan oleh penelitian baru ini pada dasarnya adalah bahwa Discriminator sekarang menunjukkan kepada Generator bagian mana dari gambar yang tidak memuaskan, sehingga Generator dapat fokus pada area tersebut dalam iterasi berikutnya, dan tidak membuang bagian yang dinilai lebih tinggi. Sifat hubungan telah berubah dari konflik menjadi kolaboratif.

Untuk memperbaiki ketidakseimbangan wawasan antara Discriminator dan Generator, peneliti menggunakan GradCAM sebagai mekanisme yang dapat membentuk wawasan Discriminator menjadi umpan balik visual untuk upaya Generator berikutnya.
Metode pelatihan ‘kesetimbangan’ baru ini disebut EqGAN. Untuk reproduktivitas maksimum, peneliti mengintegrasikan teknik dan metode yang ada pada pengaturan default, termasuk penggunaan arsitektur StyleGan2.

Arsitektur EqGAN. Pengkodean spasial Generator diselaraskan dengan kesadaran spasial Discriminator, dengan sampel acak peta panas spasial (lihat gambar sebelumnya) dikodekan kembali ke generator melalui lapisan pengkodean spasial (SEL). GradCAM adalah mekanisme yang membuat peta perhatian Discriminator tersedia untuk generator.
GradCAM menghasilkan peta panas (lihat gambar di atas) yang mencerminkan kritik Discriminator terhadap iterasi terakhir, dan membuatnya tersedia untuk Generator.
Setelah model dilatih, pemetaan tetap sebagai artefak dari proses kolaboratif ini, tetapi juga dapat digunakan untuk mengeksplorasi kode laten akhir dengan cara interaktif yang ditunjukkan dalam video proyek peneliti (lihat di bawah).
EqGAN
Proyek ini menggunakan beberapa dataset populer, termasuk dataset Kucing dan Gereja LSUN, serta dataset FFHQ. Video di bawah ini juga menampilkan contoh manipulasi wajah dan kucing menggunakan EqGAN.
Semua gambar diubah ukurannya menjadi 256×256 sebelum melatih EqGAN pada implementasi resmi StyleGAN2. Model ini dilatih dengan ukuran batch 64 selama 8 GPU sampai Discriminator telah terpapar lebih dari 25 juta gambar.
Menguji hasil sistem di sampel terpilih dengan Jarak Inception Frechet (FID), penulis menetapkan metrik yang disebut Indikator Ketidakseimbangan (DI) – derajat di mana Discriminator mempertahankan keunggulan pengetahuan atas Generator, dengan tujuan untuk menyempitkan kesenjangan tersebut.
Di atas tiga dataset yang dilatih, metrik baru menunjukkan penurunan yang berguna setelah mengkodekan kesadaran spasial ke Generator, dengan kesetimbangan yang ditingkatkan yang ditunjukkan oleh FID dan DI.

Peneliti menyimpulkan:
‘Kami berharap pekerjaan ini dapat menginspirasi lebih banyak karya untuk mengkaji kembali kesetimbangan GAN dan mengembangkan metode baru untuk meningkatkan kualitas sintesis gambar dengan mengatur kesetimbangan GAN. Kami juga akan melakukan penyelidikan teoretis lebih lanjut tentang masalah ini di pekerjaan masa depan.’
Dan melanjutkan:
‘Hasil kualitatif menunjukkan bahwa metode kami berhasil [mengarahkan Generator] untuk fokus pada area tertentu. Eksperimen pada berbagai dataset memvalidasi bahwa metode kami mengurangi ketidakseimbangan dalam pelatihan GAN dan secara signifikan meningkatkan kualitas sintesis gambar secara keseluruhan. Model yang dihasilkan dengan kesadaran spasial juga memungkinkan manipulasi interaktif dari gambar output.’
Lihat video di bawah untuk detail lebih lanjut tentang proyek ini, dan contoh lain dari eksplorasi dinamis dan interaktif ruang laten dalam GAN.
11:12 pagi 4 Des 2021 – URL GradCAM yang diperbaiki dan referensi sekitarnya dibersihkan.












