Anderson’un Açısı

Görüntü Arama Sonuçlarında Cinsiyet ve Irkı Değiştirmek için Makine Öğrenimi ile Görüntü Oluşturma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

UC San Diego ve Adobe (ADBE ) Research arasındaki bir araştırma işbirliği, geleneksel olarak WASP’baskın mesleklerde görüntülü arama sonuçlarında ırksal ve cinsiyet çeşitliliğinin olmamasına karşı yenilikçi ve proaktif bir çözüm önerdi: Generatif Karşıt Ağlar (GAN’ler) kullanarak ‘önyargılı’ mesleklerdeki konunun cinsiyeti ve/veya ırkını değiştiren gerçek olmayan görüntüler oluşturmak.

Bu örnek, yeni makaledeki araştırmacaların, tipik bir görüntü materyali korpusunda temsil edilmeyen veya uygun bir şekilde temsil edilmeyen (örneğin, cinselize edilmiş veya başka bir şekilde uygun olmayan bir temsil) bir fotoğraf için istenen özellikler girdiğini gösteriyor. Kaynak

Bu örnek, yeni makaledeki araştırmacaların, tipik bir görüntü materyali korpusunda temsil edilmeyen veya uygun bir şekilde temsil edilmeyen (örneğin, cinselize edilmiş veya başka bir şekilde uygun olmayan bir temsil) bir fotoğraf için istenen özellikler girdiğini gösteriyor. Kaynak

Yeni bir makale titled Görüntü Aramalarında Çeşitliliği Oluşturmak ve Kontrol Etmek, yazarlar, yeniden sıralama yoluyla önyargılı görüntü/özellik sınıflarının dengesizliğini düzeltmenin sınırlarının olduğunu ve sentetik verilerle ırksal ve cinsiyet çeşitliliğini artırmaya çalışmanın bu zorluğu aşmak için bir yol olabileceğini öne sürüyor.

‘Bir ütopya dünyası peşinde koşmak, içerik kullanıcılarına herhangi bir mesleği çeşitli ırksal ve cinsiyet özellikleriyle sunma fırsatı sunmayı gerektirir. Belirli meslek, ırk ve cinsiyet kombinasyonları için mevcut içeriğin sınırlı olması, içerik sağlayıcılar için bir zorluk oluşturur. Aramada önyargı ile ilgili güncel araştırmalar genellikle yeniden sıralama algoritmalarına odaklanıyor.

‘Ancak bu yöntemler yeni içerik oluşturamaz veya fotoğraflardaki korunan özelliklerin genel dağılımını değiştiremez. Bu sorunları çözmek için, dengesiz veri kümelerinden çoklu özniteliklere bağlı yüksek doğruluklu görüntü oluşturma görevini öneriyoruz.’

Bu amaçla, yazarlar çeşitli GAN tabanlı görüntü sentez sistemleri ile deneysel çalışmalarda bulunmuş ve sonunda StyleGan2 tabanlı bir mimariye ulaşmıştır.

Makaledeki ek materyallerden, 'carpenter' ve 'machine operator' gibi önyargılı mesleklerin 'eşitleştirilmiş' görüntü temsilleri için iki örnek.

Makaledeki ek materyallerden, ‘carpenter’ ve ‘machine operator’ gibi önyargılı mesleklerin ‘eşitleştirilmiş’ görüntü temsilleri için iki örnek. Kaynak

Yetersiz veya Uygunsuz Temsil Edilenler

Araştırmacılar, bu zorluğu gerçek bir dünya arama sonucu olarak çerçevelemektedir: Google Görüntü Arama’da ‘su tesisatçısı’ araması*.

Makaledeki 'su tesisatçısı' araması için seçilen sonuçlar, Ocak 2021.

Makaledeki ‘su tesisatçısı’ araması için seçilen sonuçlar, Ocak 2021.

Yazarlar, benzer önyargı belirtileri diğer mesleklerde de olduğunu gözlemlemişlerdir: ‘idari asistan’, ‘temizlikçi’ ve ‘makine operatörü’ gibi, yaş, cinsiyet ve ırkla ilgili önyargılara karşılık gelen meslekler.

‘Kendiliğinden, böyle bir toplumsal önyargı nedeniyle, bazı ırk ve cinsiyet kombinasyonları için çok az veya hiç görüntü bulunmayabilir. Örneğin, ‘kadın siyahi (veya Afrika Amerikalı) makine operatörü’ veya ‘erkek Asya idari asistanı’ aramaları için Google Görüntü Arama’da ilgili görüntüler bulamadık.’

‘Ayrıca, bazı durumlarda, belirli cinsiyet ve ırk kombinasyonları, bireylerin uygun olmayan bir şekilde temsil edilmesine neden olabilir. ‘Asya kadın su tesisatçısı’ veya ‘Siyah (veya Afrika Amerikalı) kadın güvenlik görevlisi’ gibi arama sorguları için böyle bir davranışı gözlemledik.’

Makale, 2014 yılında yapılan bir başka akademik işbirliğini引用 etmektedir, burada araştırmacılar 96 mesleğin en üst 400 görüntü arama sonucunu topladılar. Bu çalışmada, kadınların sadece %37’si sonuçlarda temsil edilirken, anti-stereotipik görüntüler sadece %22’sini oluşturuyordu. 2019’da Yale’den yapılan bir başka çalışma, beş yıl sonra bu oranların sırasıyla %45 ve %30’a yükseldiğini gösterdi.

Ek olarak, 2014 çalışması, belirli mesleklerdeki bireylerin cinselize edilmesini ‘Cinsel Su Tesisatçısı Problemi’ olarak sınıflandırdı, bu da meslek tanıma sonuçlarını çarpıklaştırabilir.

Büyük Resim

Yazarların karşılaştığı birincil zorluk, 1024×1024 çözünürlükte çıktı verebilen bir GAN tabanlı görüntü sentez sistemi üretmekti, çünkü mevcut GAN ve kodlayıcı/çözücü tabanlı görüntü sentez sistemlerinin durumu, 512×512’nin lüks olduğu bir durumdaydı. Daha yüksek bir çözünürlük, nihai çıktının ölçeklendirilmesini gerektirecekti, bu da zaman ve işlem kaynaklarında bir maliyet ve oluşturulan görüntülerin otantikliğine bir risk oluşturacaktı.

Yazarlar, daha düşük çözünürlüklerin görüntü aramalarında kabul görme beklentisinin düşük olacağını belirttiler ve kabul edilebilir bir doğruluk seviyesinde hi-res görüntüler üretebilecek çeşitli GAN çerçeveleri ile deneysel çalışmalarda bulundular.

StyleGan2’yi benimsemeye karar verildiğinde, oluşturulan çıktı üzerinde, özellikle ırk, meslek ve cinsiyet gibi alt özellikler üzerinde, varsayılan bir dağıtımın izin verdiğinden daha fazla kontrol sağlama ihtiyacı ortaya çıktı. Bu nedenle, yazarlar, oluşturma sürecini artırmak için çok sınıflı koşullandırma kullandı.

Belirtilen görüntü oluşturucunun mimarisi, yazarlar tarafından StyleGAN2'ye özgü olmamakla birlikte, çeşitli oluşturucu çerçevelerine uygulanabileceği belirtilmiştir.

Belirtilen görüntü oluşturucunun mimarisi, yazarlar tarafından StyleGAN2’ye özgü olmamakla birlikte, çeşitli oluşturucu çerçevelerine uygulanabileceği belirtilmiştir.

Irak, cinsiyet ve mesleği kontrol etmek için, mimari, bu birleştirilmiş özelliklerin bir kerede kodunu y vektörüne enjekte eder. Ardından, bu özellikleri gömme amacıyla bir feedforward ağ kullanılır, böylece oluşturma zamanında göz ardı edilmeleri engellenir.

Yazarlar, StyleGAN2’yi bu şekilde manipüle etmenin sınırlarının olduğunu ve daha ince ayarlı sonuç değişiklikleri denemelerinin, daha düşük görüntü kalitesine ve hatta mod kollapsına yol açabileceğini gözlemlediler.

Bu çözümler, mimarinin içerdiği örtülü önyargı sorunlarını çözmez. Araştırmacılar, bu sorunları, veri kümesindeki temsil edilmeyen varlıkları aşırı örnekleyerek, ancak aynı zamanda aşırı uyumu etkileyecek bir durum yaratmadan, çözmek zorunda kaldılar.

Bu nedenle, yazarlar StyleGAN2-ADA‘yı uyarladılar, bu da Ayarlanabilir Diskriminatör Artırımı (ADA) kullanır ve diskriminatörün aşırı uyumu önler.

Veri Oluşturma ve Değerlendirme

Projenin amacı sentetik veri oluşturmak olduğundan, araştırmacılar 2014 projesinin metodolojisini benimseyerek, yüksek ırksal ve cinsiyet önyargısı gösteren hedef meslekleri seçtiler. Seçilen meslekler ‘yönetici’, ‘idari asistan’, ‘hemşire’, ‘çiftçi’, ‘asker’, ‘güvenlik görevlisi’, ‘kamyon şoförü’, ‘temizlikçi’, ‘marangoz’, ‘su tesisatçısı’, ‘makine operatörü’, ‘teknik destek personeli’, ‘yazılım mühendisi’ ve ‘yazar’ idi.

Araştırmacılar, bu meslekleri yalnızca görüntülü arama sonuçlarında algılanan önyargı düzeyine göre değil, aynı zamanda çoğu mesleğin, bir üniforma, özel ekipman veya belirli ortamlar gibi, mesleğe özgü görsel bir bileşeni içerdiğinden seçtiler.

Veri kümesi, Adobe Stock kütüphanesinden 10.000 görüntüden oluşuyordu, genellikle bir mesleği sınıflandırmaya çalışırken %95 veya daha yüksek bir puan alıyordu.

Çoğu görüntü, hedef görev için yararlı değildi (örneğin, insan içermiyordu), bu nedenle manuel filtreleme gerekliydi. Ardından, ResNet32 tabanlı bir sınıflandırıcı, FairFace üzerinde önceden eğitildi ve görüntüleri cinsiyet ve ırk için etiketledi, sırasıyla %95,7 ve %81,5 ortalama doğruluk oranı elde etti. Böylece araştırmacılar, Cinsiyet: Erkek, Kadın, Irk: Beyaz, Siyah, Asya ve Diğer Irklar gibi öznitelikler için görüntü etiketleri elde etti.

Modeller, StyleGAN2 ve StyleGAN2-ADA’nın temel ağları olarak TensorFlow’da oluşturuldu. Ön eğitim, StyleGAN2’nin ön eğitilmiş ağırlıklarıyla NVIDIA’nın Flickr-Faces-HQ Veri Kümesi (FFHQ) veri kümesi üzerinde yapıldı ve 34.000 meslek spesifik görüntüden oluşan bir veri kümesi oluşturuldu, bu veri kümesine Uncurated Stock-Occupation HQ (U-SOHQ) adı verildi.

Amazon Mechanical Turk insan değerlendirmesinden bir örnek.

Amazon Mechanical Turk insan değerlendirmesinden bir örnek.

Görüntüler, mimari yapılandırmalarının dört farklı versiyonunda oluşturuldu, sonunda Uniform+ en iyi puanları hem otomatik değerlendirme (FID) hem de sonraki Amazon Mechanical Turk işçilerince yapılan değerlendirmede elde etti. Sınıflandırma Doğruluğu ile birleştirilerek, yazarlar bu metrici kendi metricleri olan Öznitelik Eşleme Puanı olarak kullandılar.

Çeşitli yöntemlerle oluşturulan görüntülerin insan değerlendirmesi, Uniform+ yönteminin en ikna edici olduğunu ve yeni bir veri kümesinin temelini oluşturduğunu gösterdi.

Çeşitli yöntemlerle oluşturulan görüntülerin insan değerlendirmesi, Uniform+ yönteminin en ikna edici olduğunu ve yeni bir veri kümesinin temelini oluşturduğunu gösterdi.

Makale, Stock-Occupation-HQ adlı tam veri kümesinin kamuoyuna açık olup olmayacağı hakkında bilgi vermemekle birlikte, 8.113 HQ (1024×1024) görüntüden oluştuğunu belirtmektedir.

Dağılım

Yeni makale, sentezlenen ‘yeniden dengelenmiş’ görüntülerin nasıl dolaşıma sokulabileceği ile ilgili olarak açık bir şekilde ilgilenmemektedir. Görüntü arama sonuçlarında önyargı sorununu çözmek için, yeni (bedelsiz) bilgisayar vizyonu veri kümelerinin, araştırmacıların oluşturduğu türden görüntülerle yeniden dengelenmesi muhtemelen sorunu çözecektir, ancak ‘gerçek dünya’ senaryolarında cinsiyet ve ırk dahil edilmesini değerlendirmeye çalışan diğer araştırmalar için engeller oluşturabilir, sentetik görüntüler gerçek dünya görüntüleriyle karıştırıldığında.

Sentetik veri tabanları, araştırmacıların ürettiği gibi, makul yüksek çözünürlükte stok görüntüleri olarak bedelsiz olarak sunulabilir ve bu maliyet tasarrufu teşviki, dağılımın bir motoru olarak kullanılabilir.

Proje, yaşa dayalı önyargı ile ilgili olarak bir konuya değinmemektedir, muhtemelen gelecekteki araştırmalar için ilgi çekici bir konu olarak kalacaktır.

 

* 5 Ocak 2022’de yapılan arama, makalede belirtilen aramanın Ocak 2021’de yapıldığı belirtilmiştir.

 

İlk olarak 5 Ocak 2022’de yayımlanmıştır.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai