Kąt Andersona
Zmiana płci i rasy w wynikach wyszukiwania obrazów za pomocą uczenia maszynowego

Współpraca badawcza między UC San Diego i Adobe (ADBE ) Research zaproponowała innowacyjne i proaktywne rozwiązanie braku różnorodności rasowej i płciowej w wynikach wyszukiwania obrazów dla tradycyjnie dominowanych przez białych zajęć: użycie sieci generatywno-dyskryminacyjnych (GAN) do tworzenia nierzeczywistych obrazów “zakłóconych” zawodów, gdzie płeć i/lub rasa podmiotu są zmienione.

W tym przykładzie z nowego artykułu, badacze wprowadzili cechy pożądanego zdjęcia, które nie są reprezentowane w typowym korpusie dostępnego materiału obrazowego lub są reprezentowane w niewłaściwy sposób (tj. seksualizowane lub w inny sposób nieodpowiednie). Źródło
W nowym artykule zatytułowanym Generowanie i kontrolowanie różnorodności w wynikach wyszukiwania obrazów, autorzy sugerują, że istnieje ograniczenie stopnia, w jakim ponowne rangowanie może naprawić niezrównoważenie zakłóconych klas obrazów/cech, takich jak hydraulik, operator maszyn, inżynier oprogramowania i wiele innych – i że zwiększanie rasowej i płciowej różnorodności za pomocą syntetycznych danych może być sposobem do przodu w tym wyzwaniu.
‘Pogoni za utopijnym światem wymaga zapewnienia użytkownikom możliwości przedstawienia każdego zawodu z różnymi rasowymi i płciowymi cechami. Ograniczony wybór istniejącego materiału dla pewnych kombinacji zawodu, rasy i płci stanowi wyzwanie dla dostawców treści. Bieżące badania dotyczące uprzedzeń w wyszukiwaniu koncentrują się głównie na algorytmach ponownego rangowania.
‘Jednak te metody nie mogą tworzyć nowych treści ani zmieniać ogólnej dystrybucji chronionych atrybutów w zdjęciach. Aby rozwiązać te problemy, proponujemy nowe zadanie generowania obrazów o wysokiej wierności warunkowej na podstawie wielu atrybutów z niezrównoważonych zbiorów danych. ‘
W tym celu autorzy eksperymentowali z różnymi systemami syntezy obrazów opartymi na GAN, ostatecznie wybierając architekturę opartą na StyleGan2.

Z materiałów uzupełniających do artykułu, dwa przykłady “wyrównywania” obrazowych reprezentacji zakłóconych zawodów, w tym przypadku “stolarz” i “operator maszyn”. Źródło
Niewystarczająco lub niewłaściwie reprezentowane
Badacze ujmują wyzwanie w kategoriach wyników wyszukiwania w świecie rzeczywistym wyników wyszukiwania dla ‘hydraulika’* na Google Image search, obserwując, że wyniki obrazowe są zdominowane przez młodych białych mężczyzn.

Z artykułu, wybrane wyniki dla ‘hydraulika’ w Google Image search, styczeń 2021.
Autorzy zauważają, że podobne wskaźniki uprzedzeń występują dla szeregu zawodów, takich jak “asystent administracyjny”, “sprzątacz” i “operator maszyn”, z odpowiednimi uprzedzeniami dotyczącymi wieku, płci i rasy.
‘Niezbyt zaskakująco, ze względu na takie społeczne uprzedzenia, niektóre kombinacje rasy i płci mogą mieć niewiele lub żadnych obrazów w repozytorium treści. Na przykład, gdy wyszukaliśmy “czarną (lub afroamerykańską) kobietę-operatora maszyn” lub “azjatyckiego mężczyznę-asystenta administracyjnego”, nie znaleźliśmy odpowiednich obrazów na [Google Image search].
‘Ponadto, w rzadkich przypadkach, szczególne kombinacje płci i rasy mogą prowadzić do nieodpowiedniej prezentacji osób. Zaobserwowaliśmy to zachowanie dla zapytań wyszukiwania, takich jak “azjatycka kobieta-hydraulik” lub “czarna (lub afroamerykańska) kobieta-stróż.
Artykuł cytuję inną współpracę akademicką z 2014 roku, w której badacze zebrali najlepsze 400 wyników wyszukiwania obrazów dla 96 zawodów. Ta praca wykazała, że kobiety stanowiły tylko 37% wyników, a obrazy niezgodne ze stereotypami tylko 22%. Badanie z 2019 roku z Yale wykazało, że pięć lat później te procenty wzrosły do 45% i 30% odpowiednio.
Ponadto badanie z 2014 roku sklasyfikowało seksualizację osób w pewnych zawodach w wynikach wyszukiwania obrazów jako Sexy Carpenter Problem, z takimi nieodpowiednimi klasyfikacjami, które mogą wpływać na wyniki rozpoznawania zawodu.
Całokształt
Głównym wyzwaniem dla autorów było wytworzenie systemu syntezy obrazów opartego na GAN, który mógłby generować obrazy o rozdzielczości 1024×1024, ponieważ w obecnej fazie rozwoju systemów GAN i encoder/decoderowych systemów syntezy obrazów, rozdzielczość 512×512 jest dość luksusowa. Cokolwiek więcej wymagałoby skalowania końcowego wyniku, co wiązałoby się z pewnym kosztem czasu i zasobów przetwarzania, a także pewnym ryzykiem dla autentyczności generowanych obrazów.
Jednak autorzy stwierdzają, że niższe rozdzielczości nie mogłyby liczyć na uznanie w wynikach wyszukiwania obrazów i eksperymentowali z różnymi ramami GAN, które mogłyby generować obrazy o wysokiej rozdzielczości na żądanie, na akceptowalnym poziomie autentyczności.
Gdy podjęto decyzję o przyjęciu StyleGan2, okazało się, że projekt wymagałby większej kontroli nad pod- cechami generowanego wyniku (takimi jak rasa, zawód i płeć), niż pozwala na to domyślna wdrożenie. Dlatego autorzy użyli warunkowania wieloklasowego, aby uzupełnić proces generowania.

Architektura generatora obrazów określającego, których autorzy stwierdzają, że nie jest specyficzny dla StyleGAN2, ale może być stosowany w różnych ramach generatorów.
Aby kontrolować czynniki rasy, płci i zawodu, architektura wstrzykuje jednorazowe zakodowanie tych połączonych cech do wektora y. Następnie sieć feedforward jest używana do osadzania tych cech, tak aby nie były pomijane podczas generowania.
Autorzy zauważają, że istnieją twarde ograniczenia stopnia, w jakim StyleGAN2 może być manipulowany w ten sposób, i że bardziej szczegółowe próby zmiany wyników prowadziły do gorszej jakości obrazu, a nawet zawalenia trybu.
Te środki, jednak, nie rozwiązują problemów uprzedzeń ukrytych w architekturze, które badacze musieli rozwiązać, przeszacowując niedoreprezentowane jednostki z zestawu danych, ale bez ryzyka przeszacowania, co wpłynęłoby na elastyczność generowanych strumieni obrazów.
Dlatego autorzy dostosowali StyleGAN2-ADA, który używa adaptacyjnego wzmocnienia dyskryminacji (ADA), aby zapobiec przeszacowaniu dyskryminatora.
Generowanie danych i ocena
Ponieważ celem projektu jest generowanie nowych, syntetycznych danych, badacze przyjęli metodologię projektu z 2014 roku, wybierając szereg celowych zawodów, które wykazują wysoki rasowy i płciowy uprzedzenie. Wybrane zawody to “menedżer wykonawczy”, “asystent administracyjny”, “pielęgniarka”, “rolnik”, “osoba wojskowa”, “strażnik”, “kierowca ciężarówki”, “sprzątacz”, “stolarz”, “hydraulik”, “operator maszyn”, “osoba wsparcia technicznego”, “inżynier oprogramowania” i “pisarz”.
Autorzy wybrali te zawody nie tylko na podstawie stopnia postrzeganego uprzedzenia w wynikach wyszukiwania obrazów, ale także dlatego, że większość z nich zawiera pewne wizualne składniki, które są zakodowane do zawodu, takie jak mundur lub obecność konkretnego sprzętu lub środowisk.
Zestaw danych został zasilony 10 000 obrazami z biblioteki Adobe Stock, zwykle uzyskując wynik 95% lub lepszy przy próbie klasyfikacji zawodu.
Ponieważ wiele obrazów nie było przydatnych do celu (tj. nie zawierały ludzi), konieczne było ręczne filtrowanie. Następnie klasyfikator oparty na ResNet32 i wstępnie wytrenowany na FairFace został użyty do oznaczenia obrazów pod względem płci i rasy, uzyskując średnią dokładność 95,7% dla płci i 81,5% dla rasy. W ten sposób badacze uzyskali etykiety obrazów dla atrybutów Płeć: Mężczyzna, Kobieta, Rasa: Biała, Czarna, Azjatycka i inne rasy.
Modele zostały zbudowane w TensorFlow przy użyciu StyleGAN2 i StyleGAN2-ADA jako sieci rdzeniowych. Przeszkolenie zostało wykonane przy użyciu wstępnie wytrenowanych wag StyleGAN2 na zestawie danych NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), uzupełnionym o 34 000 obrazów specyficznych dla zawodu, które autorzy zebrali w oddzielnym zestawie danych, który nazwali Uncurated Stock-Occupation HQ (U-SOHQ).

Przykładowy HIT z Amazon Mechanical Turk human evaluation.
Obrazy zostały wygenerowane w czterech konfiguracjach architektury, z Uniform+ ostatecznie uzyskując najlepsze wyniki zarówno w FID (automatycznej ocenie), jak i w następnej ocenie przez pracowników Amazon Mechanical Turk. W połączeniu z dokładnością klasyfikacji autorzy użyli tego jako podstawy do własnego wskaźnika, zatytułowanego Wskaźnik dopasowania atrybutów.

Ocena ludzka obrazów wygenerowanych przez różne metody, z metodą Uniform+ okazując się najbardziej przekonywującą, a następnie stanowiącą podstawę nowego zestawu danych.
Dyfuzja
Nowy artykuł nie zajmuje się explicite sposobem, w jaki syntetyzowane, “zbalansowane” obrazy mogą być wprowadzone do obiegu. Przypuszczalnie, nasianie nowych (bezpłatnych) zestawów danych komputerowego widzenia z odnowionymi obrazami tego typu, jakie stworzyli autorzy, rozwiązałoby problem uprzedzeń, ale mogłoby również stanowić przeszkodę dla innych badań, które mają na celu ocenę włączenia płci i rasy w “rzeczywistych” scenariuszach, w sytuacji, w której syntetyczne obrazy są mieszane z obrazami z rzeczywistych świata.
Syntetyczne bazy danych, takie jak ta wyprodukowana przez badaczy, mogłyby być udostępnione bezpłatnie jako rozsądnie wysokiej rozdzielczości obrazy stockowe, używając tego oszczędnościowego zachęty jako silnika dyfuzji.
Projekt nie zajmuje się uprzedzeniami wiekowymi, co przypuszczalnie jest potencjalnym tematem zainteresowania w przyszłych badaniach.
* Wyniki wyszukiwania przechwycone 5 stycznia 2022 r., wyszukiwanie cytowane w artykule zostało przeprowadzone w styczniu 2021 r.
Pierwotnie opublikowane 5 stycznia 2022 r.












