Kąt Andersona
System sztucznej inteligencji, który może robić zdjęcia ludzi bardziej “piękne”

Naukowcy z Chin opracowali nowy system sztucznej inteligencji do poprawy jakości zdjęć, który jest w stanie robić zdjęcia ludzi bardziej “piękne”, opierając się na nowym podejściu do uczenia się wzmocnionego.

Nowe podejście wykorzystuje ‘sieć przewidywania piękna twarzy’, aby iterować przez różne wersje zdjęcia na podstawie kilku czynników, wśród których ‘oświetlenie’ i poza oczu mogą być kluczowymi czynnikami. Tutaj oryginalne źródła (po lewej stronie każdej kolumny) pochodzą z systemu EigenGAN, a nowe wyniki znajdują się po prawej stronie. Źródło: https://arxiv.org/pdf/2208.04517.pdf
Technika ta opiera się na innowacjach odkrytych dla generatora EigenGAN, innego chińskiego projektu z 2021 roku, który dokonał znaczących postępów w identyfikowaniu i uzyskaniu pewnego kontrolowania nad różnorodnymi atrybutami semantycznymi w przestrzeni latentnej sieci generatywno-dyskryminacyjnych (GAN).

Generator EigenGAN z 2021 roku był w stanie wyodrębnić wysokie poziomy pojęć, takich jak ‘kolor włosów’ w przestrzeni latentnej sieci generatywno-dyskryminacyjnej. Nowa praca opiera się na tym innowacyjnym instrumencie, aby dostarczyć system, który może ‘upiększać’ zdjęcia źródłowe, bez zmiany rozpoznawalnej tożsamości – problem w poprzednich podejściach. Źródło: https://arxiv.org/pdf/2104.12476.pdf
System wykorzystuje ‘sieć oceny estetyki’ pochodzącą z SCUT-FBP5500 (SCUT), benchmarkowego zbioru danych dla przewidywania piękna twarzy z Południowo-Chińskiego Uniwersytetu Technologicznego w Guangzhou.

Z pracy z 2018 roku ‘SCUT-FBP5500: Zróżnicowany zbiór danych dla wieloparadygmatycznego przewidywania piękna twarzy’, który zaproponował ‘sieć przewidywania piękna twarzy’ (FBP) w stanie klasyfikować twarze pod względem postrzeganego atrakcyjności, ale który nie mógł rzeczywiście transformować czy ‘używać’ twarzy. Źródło: https://arxiv.org/pdf/1801.06345.pdf
Nie jak nowa praca, projekt z 2018 roku nie może wykonywać transformacji, ale zawiera algorytmiczne oceny wartości dla 5 500 twarzy, dostarczonych przez 60 osób o mieszanej płci (50/50). Te zostały włączone do nowego systemu jako skuteczny dyskryminator, aby poinformować transformacje, które prawdopodobnie zwiększą ‘atrakcyjność’ zdjęcia.
Ciekawe, że nowy artykuł nosi tytuł Generacja pięknych twarzy kaukaskich z kontrolą atrybutów przy użyciu estetycznego sterowania uczeniem się wzmocnionym. Powodem, dla którego wszystkie rasy poza kaukaską są wykluczone z systemu (zwróć uwagę, że sami badacze są Chińczykami) jest to, że dane źródłowe dla SCUT są znacznie przekrzywione w kierunku azjatyckich źródeł (4000 równo podzielonych azjatyckich kobiet i mężczyzn, 1500 równo podzielonych kobiet i mężczyzn kaukaskich), co sprawia, że ‘przeciętna osoba’ w tym zbiorze danych ma brązowe włosy i brązowe oczy.
Dlatego, aby uwzględnić zmiany kolorystyczne co najmniej w jednej rasie, konieczne było wykluczenie składnika azjatyckiego z oryginalnych danych lub pójście na znaczne koszty odtworzenia danych, aby opracować metodę, która mogłaby nie powieść się. Dodatkowo, zmiany w percepcji piękna nieuchronnie oznaczają, że takie systemy będą wymagać pewnego stopnia konfiguracji geograficznej w odniesieniu do tego, co stanowi ‘atrakcyjność’.
Atrybuty istotne
Aby określić główne czynniki przyczyniające się do ‘atrakcyjnego’ zdjęcia osoby, badacze również przetestowali wpływ różnych zmian na zdjęciach, w zakresie, jak dobrze takie uzupełnienia zwiększyły percepcję ‘piękna’ algorytmiczną. Stwierdzili, że co najmniej jeden z aspektów jest bardziej centralny dla dobrej fotografii niż dobrej genetyki:

Poza oświetleniem, aspekty, które miały największy wpływ na ocenę piękna, to grzywka (która, w przypadku mężczyzn, może często być równoznaczna z posiadaniem pełnej głowy włosów), poza ciała i dyspozycja oczu (gdzie zaangażowanie w punkt widzenia kamery jest impulsem do atrakcyjności).
(W odniesieniu do ‘koloru szminki’, nowy system, który może skutecznie działać zarówno na prezentacje męskie, jak i żeńskie, nie wyodrębnia wyglądu płciowego, ale raczej opiera się na nowym systemie dyskryminacji jako ‘filtrowi’ w tym zakresie)
Metoda
Funkcja nagrody w mechanizmie uczenia się wzmocnionego w nowym systemie jest napędzana przez proste regresję nad danymi SCUT, które generują przewidywania piękna twarzy.
System szkoleniowy iteruje nad danymi wejściowymi (dolny lewy w schemacie poniżej). Początkowo wstępnie wytrenowany model ResNet18 (wytrenowany na ImageNet) wyodrębnia cechy z pięciu identycznych (‘y’) obrazów. Następnie potencjalna transformacja jest pochodną ukrytego stanu warstwy w pełni połączonej (GRUCell, na obrazie poniżej), a transformacje są stosowane, prowadząc do pięciu zmodyfikowanych obrazów, które są wprowadzane do sieci oceny estetyki, której rankingi, w stylu Darwina, określą, które wariacje będą rozwijane, a które odrzucone.
Sieć oceny estetyki wykorzystuje moduł Efficient Channel Attention (ECA), podczas gdy adaptacja wstępnie wytrenowanego egzemplarza EfficientNet-B4 jest odpowiedzialna za wyodrębnienie 1792 cech z każdego obrazu.
Po normalizacji za pomocą funkcji aktywacji ReLU, uzyskuje się 4-wymiarowy wektor, który jest następnie spłaszczany do jednowymiarowego wektora po aktywacji i adaptacyjnym poolingu średnim. W końcu wyniki są wprowadzane do sieci regresji, która pobiera ocenę estetyki.

Jakościowe porównanie wyjścia systemu. W dolnym rzędzie widzimy zsumowany wynik wszystkich wyodrębnionych aspektów, które zostały zidentyfikowane przez metodę EigenGAN i następnie udoskonalone. Średnie wyniki FID dla obrazów znajdują się po lewej stronie wierszy obrazów (wyższy jest lepszy).
Testy i badanie użytkowników
Pięć wariantów proponowanej metody zostało ocenionych algorytmicznie (patrz obraz powyżej), z wynikami Fréchet inception distance (FID, kontrowersyjnymi w niektórych kwartałach) przypisanymi do 1000 obrazów, które zostały przetworzone przez system.
Badacze zauważają, że poprawa oświetlenia osiągnęła lepszy wynik atrakcyjności dla osób na zdjęciach niż kilka innych bardziej ‘oczywistych’ możliwych zmian (tj. zmian w rzeczywistym wyglądzie osoby na zdjęciu).
Do pewnego stopnia testowanie systemu w ten sposób jest ograniczone przez ekscentryczność danych SCUT, które nie mają wielu ‘jasnych uśmiechów’, a autorzy twierdzą, że to mogłoby nadmiernie przeceniać bardziej typowy ‘enigmatyczny’ wygląd w danych w porównaniu z prawdopodobnymi preferencjami potencjalnych użytkowników końcowych (prawdopodobnie, w tym przypadku, rynku zachodniego).
Jednakże, ponieważ cały system opiera się na średnich opiniach zaledwie 60 osób (w artykule EigenGAN), a jakość, która jest badana, jest daleka od empirycznej, można twierdzić, że procedura jest bardziej słuszna niż zbiór danych.
Chociaż jest to omówione bardzo krótko w artykule, obrazy z EigenGAN i pięciu wariantów systemu zostały również pokazane w ograniczonym badaniu użytkowników (ośmiu uczestników), którzy zostali poproszeni o wybranie ‘najlepszego obrazu’ (słowo ‘atrakcyjny’ zostało uniknięte).

Powyżej, interfejs użytkownika przedstawiony małej grupie badawczej; poniżej, wyniki.
Wyniki wskazują, że wyjście nowego systemu osiągnęło najwyższy wskaźnik wyboru wśród uczestników (‘MAES’ na obrazie powyżej).
Pogoni za pięknem
Użyteczność takiego systemu jest trudna do ustalenia, pomimo tego, co wydaje się znaczącym lokalizacją wysiłku w kierunku tego w Chinach. Żaden z nich nie jest przedstawiony w nowej publikacji.
Poprzedni artykuł EigenGAN sugeruje*, że system rozpoznawania piękna może być użyty w systemach rekomendacji makijażu twarzy, chirurgii estetycznej, upiększaniu twarzy, lub w systemach wyszukiwania obrazów opartych na zawartości.
Przykładowo, taki system mógłby być również użyty na stronach randkowych, przez użytkowników, aby ‘poprawić’ własne zdjęcia profilowe w gwarantowany ‘szczęśliwy strzał’, jako alternatywa dla używania przestarzałych zdjęć lub zdjęć innych osób.
Ponadto, strony randkowe same mogłyby ‘oceniać’ swoich klientów, aby utworzyć oceny i nawet ograniczone poziomy dostępu, chociaż to prawdopodobnie działałoby tylko za pomocą uwierzytelniania na żywo, a nie za pomocą przesłanych zdjęć (które również mogłyby być ‘poprawione’ przez klientów, gdyby podejście to stało się popularne).
W reklamie, algorytmiczna metoda oceny piękna (technologia przewidziana przez zmarłego autora science fiction Michaela Crichtona w jego filmie z 1982 roku Looker) mogłaby być użyta do wyboru niezmodyfikowanego wyjścia kreatywnego, które najprawdopodobniej zaangażuje docelowy audytorium, podczas gdy możliwość rzeczywistego zwiększania estetycznego wpływu obrazów twarzy, bez nadpisania ich w stylu deepfake, mogłaby zwiększyć już skuteczne obrazy przeznaczone do zainteresowania publicznego.
Nowa praca jest wspierana przez Narodowy Fundusz Nauki Naturalnej Chin, Otwarty Projekt Funduszu Państwowego Laboratorium Zarządzania i Kontroli Złożonych Systemów oraz Projekt Badań Filozofii i Nauk Społecznych z Ministerstwa Edukacji Chin, wśród innych wspierających.
* Wiele zaleceń artykułu EigenGAN wskazuje na dostępną komercyjnie książkę z 2016 roku zatytułowaną ‘Modele komputerowe do analizy piękna twarzy’, zamiast zasobów akademickich.
Pierwotnie opublikowane 11 sierpnia 2022.













