Sudut Anderson

Mengubah Gender dan Ras dalam Hasil Pencarian Gambar dengan Pembelajaran Mesin

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Kolaborasi penelitian antara UC San Diego dan Adobe (ADBE ) Research telah mengusulkan solusi inovatif dan proaktif untuk kurangnya keragaman rasial dan gender dalam hasil pencarian gambar untuk pekerjaan yang didominasi WASP: menggunakan Jaringan Adversarial Generatif (GAN) untuk membuat gambar sintetis dari ‘profesi yang bias’, di mana gender dan/atau ras subjek diubah.

Dalam contoh dari makalah baru, peneliti telah memasukkan karakteristik untuk foto yang diinginkan yang tidak ada dalam corpus gambar yang tersedia, atau yang direpresentasikan dengan cara yang tidak pantas (misalnya, sensual atau dalam representasi yang tidak pantas lainnya). Sumber

Dalam contoh dari makalah baru, peneliti telah memasukkan karakteristik untuk foto yang diinginkan yang tidak ada dalam corpus gambar yang tersedia, atau yang direpresentasikan dengan cara yang tidak pantas (misalnya, sensual atau dalam representasi yang tidak pantas lainnya). Sumber

Dalam makalah baru berjudul Generating and Controlling Diversity in Image Search, penulis menyatakan bahwa ada batasan pada seberapa jauh re-ranking dapat memperbaiki ketidakseimbangan kelas gambar/fitur yang bias seperti tukang ledeng, operator mesin, insinyur perangkat lunak, dan banyak lainnya – dan bahwa meningkatkan keragaman rasial dan gender dengan data sintetis mungkin merupakan cara untuk mengatasi tantangan ini.

‘Pencarian dunia utopia memerlukan memberikan pengguna konten kesempatan untuk mempresentasikan setiap profesi dengan karakteristik rasial dan gender yang beragam. Pilihan konten yang terbatas untuk kombinasi profesi, ras, dan gender tertentu merupakan tantangan bagi penyedia konten. Penelitian saat ini yang berhubungan dengan bias dalam pencarian sebagian besar fokus pada algoritma re-ranking.

‘Namun, metode ini tidak dapat membuat konten baru atau mengubah distribusi atribut yang dilindungi dalam foto. Untuk memperbaiki masalah ini, kami mengusulkan tugas baru yaitu generasi gambar dengan kualitas tinggi yang dikondisikan pada atribut multiple dari dataset yang tidak seimbang. ‘

Untuk ini, penulis telah bereksperimen dengan berbagai sistem sintesis gambar berbasis GAN, akhirnya memilih arsitektur yang berbasis pada StyleGan2.

Dari bahan tambahan untuk makalah, dua contoh 'mengimbangkan' representasi gambar dari profesi yang bias, dalam kasus ini, 'tukang kayu' dan 'operator mesin'. Sumber

Dari bahan tambahan untuk makalah, dua contoh ‘mengimbangkan’ representasi gambar dari profesi yang bias, dalam kasus ini, ‘tukang kayu’ dan ‘operator mesin’. Sumber

Tidak Cukup atau Tidak Tepat Direpresentasikan

Peneliti membingkai tantangan dalam hal hasil pencarian dunia nyata untuk tukang ledeng* pada Google Image search, mengamati bahwa hasil gambar didominasi oleh pria muda kulit putih.

Dari makalah, hasil pencarian 'tukang ledeng' pada Google Image search, Januari 2021.

Dari makalah, hasil pencarian ‘tukang ledeng’ pada Google Image search, Januari 2021.

Penulis mencatat bahwa indikasi bias serupa terjadi untuk berbagai profesi, seperti ‘asisten administratif’, ‘pembersih’, dan ‘operator mesin’, dengan bias yang sesuai untuk usia, gender, dan ras.

‘Tidak mengherankan, karena bias sosial, beberapa kombinasi ras dan gender mungkin memiliki sedikit atau tidak ada gambar dalam repositori konten. Misalnya, ketika kami mencari ‘perempuan kulit hitam (atau Afrika Amerika) operator mesin’ atau ‘laki-laki Asia asisten administratif’, kami tidak menemukan gambar relevan pada [Google Image search].

‘Selain itu, dalam kasus langka, kombinasi tertentu dari gender dan ras dapat menyebabkan individu digambarkan tidak pantas. Kami mengamati perilaku ini untuk kueri pencarian seperti ‘perempuan Asia tukang ledeng’ atau ‘perempuan kulit hitam (atau Afrika Amerika) penjaga keamanan.’

Makalah tersebut mengutip kolaborasi akademis lain dari 2014, di mana peneliti mengumpulkan 400 hasil pencarian gambar teratas untuk 96 profesi. Penelitian itu menemukan bahwa perempuan hanya mewakili 37% hasil, dan gambar anti-stereotip hanya 22%. Sebuah penelitian 2019 dari Yale menemukan bahwa lima tahun telah meningkatkan persentase tersebut menjadi hanya 45% dan 30% masing-masing.

Selain itu, penelitian 2014 mengklasifikasikan sensualisasi individu dalam profesi tertentu dalam hasil pencarian gambar sebagai Sexy Carpenter Problem, dengan klasifikasi yang tidak pantas seperti itu berpotensi mempengaruhi hasil pengenalan profesi.

Gambaran Besar

Tantangan utama bagi penulis adalah menghasilkan sistem sintesis gambar berbasis GAN yang dapat menghasilkan gambar dengan resolusi 1024×1024, karena pada saat ini, 512×512 sudah cukup mewah. Apa pun yang lebih tinggi cenderung diperoleh dengan menskalakan output akhir, dengan biaya waktu dan sumber daya pemrosesan, dan dengan risiko pada autentisitas gambar yang dihasilkan.

Namun, penulis menyatakan bahwa resolusi yang lebih rendah tidak dapat diharapkan untuk mendapatkan traksi dalam pencarian gambar, dan bereksperimen dengan berbagai kerangka GAN yang dapat menghasilkan gambar dengan resolusi tinggi pada permintaan, dengan tingkat autentisitas yang dapat diterima.

Ketika keputusan diambil untuk mengadopsi StyleGan2, menjadi jelas bahwa proyek tersebut memerlukan kontrol yang lebih besar atas sub-fitur dari output yang dihasilkan (seperti ras, profesi, dan gender), daripada yang diizinkan oleh penerapan default. Oleh karena itu, penulis menggunakan kondisi multi-kelas untuk meningkatkan proses generasi.

Arsitektur generator gambar yang spesifik, yang menurut penulis tidak spesifik untuk StyleGAN2, tetapi dapat diterapkan pada berbagai kerangka generator.

Arsitektur generator gambar yang spesifik, yang menurut penulis tidak spesifik untuk StyleGAN2, tetapi dapat diterapkan pada berbagai kerangka generator.

Untuk mengontrol faktor ras, gender, dan profesi, arsitektur tersebut menyuntikkan kode satu-shot dari karakteristik yang dikonkatenerasi ke dalam vektor y. Setelah itu, jaringan feedforward digunakan untuk membenamkan fitur-fitur tersebut, sehingga mereka tidak akan diabaikan pada saat generasi.

Penulis mengamati bahwa ada batasan yang keras pada seberapa jauh StyleGAN2 dapat dimanipulasi dengan cara ini, dan bahwa upaya yang lebih halus untuk mengubah hasilnya menghasilkan kualitas gambar yang lebih buruk, dan bahkan keruntuhan mode.

Remedi ini, bagaimanapun, tidak menyelesaikan masalah bias implisit dalam arsitektur, yang peneliti harus atasi dengan oversampling entitas yang kurang direpresentasikan dari dataset, tanpa risiko kelebihan pemrosesan, yang akan mempengaruhi fleksibilitas aliran gambar yang dihasilkan.

Oleh karena itu, penulis menyesuaikan StyleGAN2-ADA, yang menggunakan Augmentasi Diskriminator Adaptif (ADA), untuk mencegah diskriminator dari kelebihan pemrosesan.

Generasi Data dan Evaluasi

Karena tujuan proyek ini adalah untuk menghasilkan data sintetis baru, peneliti mengadopsi metode dari proyek 2014, memilih sejumlah profesi target yang menunjukkan bias rasial dan gender yang tinggi. Profesi yang dipilih adalah ‘manajer eksekutif’, ‘asisten administratif’, ‘perawat’, ‘petani’, ‘orang militer’, ‘penjaga keamanan’, ‘pengemudi truk’, ‘pembersih’, ‘tukang kayu’, ‘tukang ledeng’, ‘operator mesin’, ‘orang dukungan teknis’, ‘insinyur perangkat lunak’, dan ‘penulis.’

Penulis memilih profesi ini tidak hanya berdasarkan seberapa besar bias yang dirasakan dalam hasil pencarian gambar, tetapi karena sebagian besar dari mereka mengandung beberapa komponen visual yang dikodekan ke profesi, seperti seragam, atau kehadiran peralatan atau lingkungan tertentu.

Dataset tersebut diberi makan dengan 10.000 gambar dari perpustakaan Adobe Stock, biasanya mendapatkan skor 95% atau lebih baik ketika mencoba mengklasifikasikan profesi.

Karena banyak gambar tidak berguna untuk tugas target (yaitu, mereka tidak mengandung orang), penyaringan manual diperlukan. Setelah itu, ResNet32-based classifier yang telah dilatih sebelumnya pada FairFace digunakan untuk melabeli gambar untuk gender dan ras, mendapatkan akurasi rata-rata 95,7% untuk gender dan 81,5% untuk ras. Dengan demikian, peneliti mendapatkan label gambar untuk atribut Jenis Kelamin: Laki-laki, Perempuan, Ras: Kulit Putih, Kulit Hitam, Asia, dan Ras Lainnya.

Model dibangun di TensorFlow menggunakan StyleGAN2 dan StyleGAN2-ADA sebagai jaringan inti. Pelatihan sebelumnya dilakukan dengan bobot pra-dilatih StyleGAN2 pada dataset NVIDIA’s Flickr-Faces-HQ (FFHQ) dataset, yang diperluas dengan 34.000 gambar spesifik profesi yang penulis kumpulkan ke dalam dataset terpisah yang mereka sebut Uncurated Stock-Occupation HQ (U-SOHQ).

Contoh HIT dari evaluasi manusia Amazon Mechanical Turk.

Contoh HIT dari evaluasi manusia Amazon Mechanical Turk.

Gambar dihasilkan di bawah empat konfigurasi arsitektur, dengan Uniform+ akhirnya mendapatkan skor terbaik baik dalam FID (evaluasi otomatis), dan dalam evaluasi berikutnya oleh pekerja Amazon Mechanical Turk. Dikombinasikan dengan Akurasi Klasifikasi, penulis menggunakan ini sebagai metrik inti untuk metrik mereka sendiri, yang disebut Skor Pencocokan Atribut.

Evaluasi manusia dari gambar yang dihasilkan oleh berbagai metode, dengan metode Uniform+ yang terbukti paling meyakinkan, dan kemudian menjadi dasar untuk dataset baru.

Evaluasi manusia dari gambar yang dihasilkan oleh berbagai metode, dengan metode Uniform+ yang terbukti paling meyakinkan, dan kemudian menjadi dasar untuk dataset baru.

Makalah tersebut tidak menyatakan apakah Stock-Occupation-HQ, dataset yang dihasilkan dari Uniform+, akan dibuat tersedia untuk umum, tetapi menyatakan bahwa itu mengandung 8.113 gambar HQ (1024×1024).

Difusi

Makalah baru ini tidak secara eksplisit menangani cara gambar sintetis yang ‘direbalans’ dapat diperkenalkan ke dalam sirkulasi. Presumabel, menyebarkan dataset komputer visi sintetis yang baru dengan gambar yang telah direbalans, seperti yang dibuat oleh penulis, akan menyelesaikan masalah bias, tetapi juga dapat menyajikan hambatan untuk penelitian lain yang mencari untuk mengevaluasi inklusi gender dan ras dalam skenario ‘dunia nyata’, dalam keadaan di mana gambar sintetis dicampur dengan gambar dunia nyata.

Gambar sintetis seperti yang dihasilkan oleh peneliti dapat dibuat tersedia tanpa biaya sebagai gambar stok dengan resolusi yang wajar, menggunakan insentif penghematan biaya ini sebagai mesin difusi.

Proyek ini tidak menangani bias berbasis usia, yang presumabel merupakan topik yang menarik dalam penelitian masa depan.

 

* Pencarian yang ditangkap dilakukan pada 5 Januari 2022, pencarian yang dikutip dalam makalah dilakukan pada Januari 2021.

 

Dipublikasikan pertama kali pada 5 Januari 2022.

Penulis tentang pembelajaran mesin, spesialis domain dalam sintesis gambar manusia. Mantan kepala konten riset di Metaphysic.ai, hingga dibubarkannya menjadi Brahma.ai milik DNEG.
Website: martinanderson.ai
Kontak: martin@martinanderson.ai