Kąt Andersona

Wyzwanie ‘Kategoryzacja Rasowa’ dla Systemów Syntezy Obrazu opartych na CLIP

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badania przeprowadzone w USA wykazały, że jeden z popularnych modeli komputerowego widzenia, który jest podstawą serii DALL-E, a także wielu innych modeli generowania i klasyfikacji obrazów, wykazuje tendencję do hipodescendencji – reguły kategoryzacji rasowej (znanej również jako ‘reguła jednej kropli‘), która kategoryzuje osobę o mieszanej (tj. nie-caucasoidalnej) linii genetycznej całkowicie do kategoryzacji rasowej mniejszości.

Ponieważ hipodescendencja charakteryzowała niektóre z najgorszych rozdziałów w historii ludzkości, autorzy nowego artykułu sugerują, że tendencje te w badaniach i wdrożeniach komputerowego widzenia powinny zostać poddane większej uwadze, zwłaszcza że wspierający framework, który został pobrany prawie milion razy w miesiącu, może dalej rozpowszechniać i utrwalać rasistowskie uprzedzenia w dalszych frameworkach.

Architektura badana w nowej pracy to Contrastive Language Image Pretraining (CLIP), wielomodalny model uczenia maszynowego, który uczy się skojarzeń semantycznych poprzez trening na parach obrazów i podpisów pobranych z internetu – półnadzorowany podejście, które redukuje znaczne koszty etykietowania, ale które prawdopodobnie odzwierciedla uprzedzenia osób, które stworzyły podpisy.

Z artykułu:

‘Nasze wyniki dostarczają dowodów na hipodescendencję w przestrzeni CLIP, uprzedzenie stosowane bardziej silnie do obrazów kobiet. Wyniki wskazują ponadto, że CLIP kojarzy obrazy z etykietami rasowymi lub etnicznymi na podstawie odchylenia od białej, z białą jako domyślną.’

Artykuł stwierdza również, że skojarzenie wartości obrazu (jego tendencja do kojarzenia się z ‘dobrymi’ lub ‘złymi’ rzeczami) jest znacznie wyższe dla etykiet rasowych mniejszości niż dla etykiet kaukaskich, i sugeruje, że uprzedzenia CLIP odzwierciedlają amerykańskocentryczny korpus literatury (angielskojęzycznej Wikipedii) na którym framework został wytrenowany.

Komentując implikacje jawnej obsesy CLIP na hipodescendencji, autorzy stwierdzają*:

‘[Jednym] z pierwszych zastosowań CLIP było wytrenowanie modelu DALL-E zero-shot. Większa, niepubliczna wersja architektury CLIP została użyta do wytrenowania DALL-E 2. Zgodnie z wynikami niniejszych badań, sekcja Ryzyka i Ograniczeń w karcie modelu DALL-E 2 zauważa, że “wytwarza obrazy, które tendencję do nadreprezentowania osób, które są białe”.’

‘Takie zastosowania demonstrują potencjał dla uprzedzeń nauczonych przez CLIP do rozprzestrzeniania się poza przestrzenią modelu, ponieważ jego funkcje są używane do kierowania tworzeniem semantyki w innych modelach AI.’

‘Ponadto, dzięki postępom dokonanym przez CLIP i podobne modele do skojarzeń obrazów i tekstu w ustawieniach zero-shot, architektury wielomodalne zostały opisywane jako podstawa przyszłości powszechnie używanych aplikacji internetowych, w tym wyszukiwarek.’

‘Nasze wyniki wskazują, że dodatkowa uwaga do tego, czego takie modele uczą się z nadzoru językowego, jest uzasadniona.’

Artykuł pt. Dowody na hipodescendencję w sztucznej inteligencji semantyki wizualnej, pochodzi od trzech badaczy z Uniwersytetu Waszyngtonu i Uniwersytetu Harvarda.

CLIP i Złe Wpływy

Chociaż badacze potwierdzają, że ich praca jest pierwszą analizą hipodescendencji w CLIP, wcześniejsze prace wykazały, że przepływ pracy CLIP, zależny od w dużej mierze nienadzorowanego treningu z nieuporządkowanych danych pochodzących z sieci, nie reprezentuje kobiet, może produkować obraźliwe treści, i może wykazywać uprzedzenia semantyczne (takie jak antymuzułmańskie nastawienie) w swoim kodowaniu obrazu.

Oryginalny artykuł, który przedstawił CLIP, przyznał, że w ustawieniu zero-shot CLIP kojarzy tylko 58,3% osób z etykietą rasową białą w FairFace dataset. Zauważając, że FairFace został oznaczony z możliwym uprzedzeniem przez pracowników Amazon Mechanical Turk, autorzy nowego artykułu stwierdzają, że ‘znaczna mniejszość osób, które są postrzegane przez innych ludzi jako białe, są skojarzone z rasą inną niż biała przez CLIP.’

Mówią dalej:

‘Odwrócenie tego nie wydaje się być prawdą, ponieważ osoby, które są postrzegane jako należące do innych rasowych lub etnicznych etykiet w FairFace dataset, są skojarzone z tymi etykietami przez CLIP. To wynik sugeruje możliwość, że CLIP nauczył się reguły “hipodescendencji”, jak opisali ją uczeni społeczni: osoby o wielorasowej tożsamości są bardziej prawdopodobne, aby być postrzeganymi i kategoryzowanymi jako należące do grupy mniejszościowej lub mniej uprzywilejowanej rodzicielskiej niż do grupy większościowej lub uprzywilejowanej rodzicielskiej.

‘Innymi słowy, dziecko czarnego i białego rodzica jest postrzegane jako bardziej czarne niż białe; i dziecko azjatyckiego i białego rodzica jest postrzegane jako bardziej azjatyckie niż białe.’

Artykuł ma trzy główne ustalenia: że CLIP wykazuje hipodescendencję, poprzez ‘pędzenie’ osób o wielorasowych tożsamościach do kategoryzacji rasowej mniejszości; że ‘biała jest domyślną rasą w CLIP’, i że konkurujące rasy są definiowane przez ich ‘odchylenie’ od kategoryzacji białej; i że uprzedzenia wartości (skojarzenie z ‘złymi’ pojęciami) korelują z tym, jak bardzo osoba jest kategoryzowana do mniejszości rasowej.

Metoda i Dane

Aby określić, w jaki sposób CLIP traktuje osoby o wielorasowych tożsamościach, badacze użyli wcześniej przyjętej techniki morfowania do zmiany rasy obrazów osób. Zdjęcia pochodziły z Chicago Face Database, zestawu opracowanego do badań psychologicznych związanych z rasą.

Przykłady z morfowanych obrazów CFD przedstawionych w suplementarnym materiale nowego artykułu. Źródło: https://arxiv.org/pdf/2205.10764.pdf

Przykłady z morfowanych obrazów CFD przedstawionych w suplementarnym materiale nowego artykułu. Źródło: https://arxiv.org/pdf/2205.10764.pdf

Badacze wybrali tylko obrazy z ‘neutralnym wyrazem’ z zestawu danych, aby zachować spójność z poprzednimi badaniami. Użyli sieci generatywnej StyleGAN2-ADA (wytrenowanej na FFHQ) do zmiany rasy twarzy, i stworzyli obrazy pośrednie, które demonstrują postęp od jednej rasy do innej (patrz powyższe obrazy).

Zgodnie z poprzednimi badaniami, badacze zmorfowali twarze osób, które identyfikowały się jako czarne, azjatyckie i latynoskie w zestawie danych, w twarze osób, które określiły się jako białe. W sumie 21 000 obrazów o rozdzielczości 1024×1024 pikseli zostało stworzonych dla tego projektu przy użyciu tej metody.

Badacze następnie otrzymali projekcję osadzania obrazu CLIP dla każdego z 21 obrazów w każdym zestawie morfologicznym. Po tym, poprosili o etykietę dla każdego obrazu z CLIP: ‘wielorasowy’, ‘dwurasowy’, ‘mieszana rasa’, i ‘osoba’ (ostatnia etykieta pomija rasę).

Wersja CLIP użyta w badaniu była implementacją CLIP-ViT-Base-Patch32. Autorzy zauważają, że model ten został pobrany ponad milion razy w miesiącu poprzedzającym ich badania, i stanowi 98% pobranych modeli CLIP z biblioteki Transformers.

Testy

Aby przetestować potencjalną skłonność CLIP do hipodescendencji, badacze zauważyli etykietę rasową przypisaną przez CLIP do każdego obrazu w gradientzie morfowanych obrazów dla każdej osoby.

Zgodnie z wynikami, CLIP tendencję do grupowania osób w kategoriach mniejszościowych wokół 50% punktu przejścia.

Przy 50% stosunku mieszania, gdzie osoba jest równie pochodzenia/cele rasowego, CLIP kojarzy wyższą liczbę 1000 morfowanych obrazów kobiet z etykietami azjatyckimi (89,1%), latynoskimi (75,8%) i czarnymi (69,7%) niż z odpowiednią etykietą białą.

Przy 50% stosunku mieszania, gdzie osoba jest równie pochodzenia/cele rasowego, CLIP kojarzy wyższą liczbę 1000 morfowanych obrazów kobiet z etykietami azjatyckimi (89,1%), latynoskimi (75,8%) i czarnymi (69,7%) niż z odpowiednią etykietą białą.

Wyniki pokazują, że kobiety są bardziej podatne na hipodescendencję pod CLIP niż mężczyźni, chociaż autorzy hipotezują, że może to być spowodowane tym, że etykiety pochodzące z sieci i nieuporządkowane tendencję do podkreślania wyglądu osoby bardziej niż w przypadku mężczyzn, i że może to mieć efekt zniekształcający.

Hipodescendencja przy 50% przejścia rasowego nie została zaobserwowana dla serii morfologicznych azjatycko-białych mężczyzn lub latynosko-białych mężczyzn, podczas gdy CLIP przypisał wyższą podobieństwo kosinusowe do etykiety czarnej w 67,5% przypadków przy 55% stosunku mieszania.

Średnie podobieństwo kosinusowe etykiet Wielorasowych, Dwurasowych i Mieszanej Rasy. Wyniki wskazują, że CLIP działa jako rodzaj 'wody rozgraniczającej' kategoryzacji przy różnych procentach mieszania rasowego, rzadziej przypisując takie mieszanie rasowe do białej ('osoba', w racjonalizacji eksperymentów) niż do etykiety, która została postrzegana w obrazie.

Średnie podobieństwo kosinusowe etykiet Wielorasowych, Dwurasowych i Mieszanej Rasy. Wyniki wskazują, że CLIP działa jako rodzaj ‘wody rozgraniczającej’ kategoryzacji przy różnych procentach mieszania rasowego, rzadziej przypisując takie mieszanie rasowe do białej (‘osoba’, w racjonalizacji eksperymentów) niż do etykiety, która została postrzegana w obrazie.

Cel idealny, zgodnie z artykułem, jest taki, że CLIP powinien kategoryzować pośrednie mieszania rasowe dokładnie jako ‘mieszaną rasę’, zamiast definiowania ‘punktu przełomowego’, w którym osoba jest tak często przypisywana całkowicie do nie-białej etykiety.

Do pewnego stopnia CLIP przypisuje pośrednie kroki morfologiczne z etykietą Mieszana Rasa (patrz powyższy wykres), ale ostatecznie demonstruje preferencję do kategoryzowania osób jako ich mniejszościowa rasa przyczyniająca.

W kwestii wartości, autorzy zauważają skrzywiony osąd CLIP:

‘[Średnie] skojarzenie wartości (skojarzenie z nieprzyjemnymi vs. przyjemnymi) zmienia się wraz ze stosunkiem mieszania w serii morfologicznej czarno-białej, tak że CLIP koduje skojarzenia z nieprzyjemnościami dla twarzy najbardziej podobnych do CFD, które identyfikują się jako czarne.’

Wyniki skojarzeń wartości - testy pokazują, że grupy mniejszościowe są bardziej skojarzone z negatywnymi pojęciami w architekturze obrazu/parze niż etykiety białe. Autorzy twierdzą, że skojarzenie nieprzyjemności z obrazem wzrasta wraz z prawdopodobieństwem, że model skojarzy obraz z etykietą czarną.

Wyniki skojarzeń wartości – testy pokazują, że grupy mniejszościowe są bardziej skojarzone z negatywnymi pojęciami w architekturze obrazu/parze niż etykiety białe. Autorzy twierdzą, że skojarzenie nieprzyjemności z obrazem wzrasta wraz z prawdopodobieństwem, że model skojarzy obraz z etykietą czarną.

Artykuł stwierdza:

‘Dowody wskazują, że wartość obrazu koreluje z rasą. Konkretnie, nasze wyniki wskazują, że im bardziej model jest pewny, że obraz odzwierciedla osobę czarną, tym bardziej skojarzony jest z nieprzyjemną przestrzenią osadzania.’

Jednak wyniki również wskazują na negatywną korelację w przypadku twarzy azjatyckich. Autorzy sugerują, że może to być spowodowane przeniesieniem (poprzez dane pochodzące z sieci) pozytywnych amerykańskich percepcji azjatyckich ludzi i społeczności. Autorzy stwierdzają*:

‘Obserwowanie korelacji między przyjemnością a prawdopodobieństwem etykiety azjatyckiej może odpowiadać stereotypowi “modelu mniejszości”, w którym ludzie azjatyckiego pochodzenia są chwaleni za ich mobilność i asymilację w amerykańskiej kulturze, i nawet skojarzeni z “dobrej zachowaniem”.’

W odniesieniu do ostatecznego celu, aby zbadać, czy biała jest ‘tożsamością domyślną’ z punktu widzenia CLIP, wyniki wskazują na zanurzoną polarność, sugerując, że w tej architekturze jest dość trudno być ‘trochę białym’.

Podobieństwo kosinusowe w 21 000 obrazach utworzonych do testów.

Podobieństwo kosinusowe w 21 000 obrazach utworzonych do testów.

Autorzy komentują:

‘Dowody wskazują, że CLIP koduje białą jako domyślną rasę. To jest wspierane przez silniejsze korelacje między podobieństwem kosinusowym białym a podobieństwem kosinusowym osoby niż dla jakiejkolwiek innej grupy rasowej lub etnicznej.’

 

*Moja konwersja cytatów wewnętrznych autorów do linków.

Pierwotnie opublikowane 24 maja 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai