Kąt Andersona

Szacowanie przewidywania atrakcyjności twarzy w transmisjach na żywo

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

Do tej pory badania nad przewidywaniem atrakcyjności twarzy (FAP) były przede wszystkim prowadzone w kontekście badań psychologicznych, w branży beauty i kosmetycznej, oraz w kontekście chirurgii plastycznej. Jest to trudna dziedzina badań, ponieważ standardy piękna mają tendencję do bycia narodowe, a nie globalne.

To oznacza, że nie istnieje jeden skuteczny zestaw danych oparty na sztucznej inteligencji, ponieważ średnie wartości uzyskane z próbek twarzy/ocen z wszystkich kultur byłyby bardzo tendencyjne (gdzie bardziej zaludnione kraje uzyskałyby dodatkową przewagę), lub stosowane do żadnej kultury w ogóle (gdzie średnia wartość wielu ras/ocen byłaby równa żadnej rasie).

Zamiast tego, wyzwaniem jest opracowanie konceptualnych metodologii i workflow, do których mogą być przetwarzane dane specyficzne dla kraju lub kultury, aby umożliwić rozwój skutecznych modeli FAP dla każdego regionu.

Przypadki użycia FAP w badaniach piękna i psychologicznych są dość marginalne, lub specyficzne dla branży; dlatego większość zestawów danych opracowanych do tej pory zawiera tylko ograniczone dane, lub nie zostały opublikowane w ogóle.

Łatwa dostępność online predictorów atrakcyjności, głównie skierowanych do zachodniej publiczności, niekoniecznie reprezentują stan sztuki w FAP, który wydaje się obecnie zdominowany przez badania azjatyckie (głównie chińskie), i odpowiadające azjatyckie zestawy danych.

Przykłady zestawu danych z 2020 roku 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Źródło: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Przykłady zestawu danych z 2020 roku ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Źródło: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Szersze komercyjne zastosowania estymacji piękna obejmują aplikacje randkowe online, oraz systemy generatywne sztucznej inteligencji zaprojektowane do ‘poprawiania’ prawdziwych awatarów ludzi (ponieważ takie aplikacje wymagają skwantyfikowanego standardu piękna jako miary skuteczności).

Rysowanie twarzy

Atrakcyjne osoby nadal są cennym aktywem w reklamie i budowaniu wpływu, co sprawia, że finansowe zachęty w tych sektorach są wyraźną okazją do rozwoju najnowszych zestawów danych i frameworków FAP.

Na przykład, model sztucznej inteligencji wyszkolony z danych z świata rzeczywistego do oceny i klasyfikacji piękna twarzy mógłby potencjalnie identyfikować wydarzenia lub osoby o wysokim potencjale wpływu reklamowego. Ta zdolność byłaby szczególnie istotna w kontekście transmisji wideo na żywo, gdzie metryki takie jak ‘obserwujący’ i ‘polubienia’ służą obecnie tylko jako niejawne wskaźniki zdolności osoby (lub nawet typu twarzy) do przyciągania uwagi publiczności.

To jest powierzchowny wskaźnik, oczywiście, a głos, prezentacja i punkt widzenia odgrywają również znaczącą rolę w gromadzeniu publiczności. Dlatego kuracja zestawów danych FAP wymaga nadzoru ludzkiego, a także zdolności do odróżniania atrakcyjności twarzy od ‘pozornej’ atrakcyjności (bez której, influencerzy spoza głównego nurtu, tacy jak Alex Jones, mogliby wpłynąć na średnią krzywą FAP dla kolekcji zaprojektowanej wyłącznie do szacowania piękna twarzy).

LiveBeauty

Aby rozwiązać problem braku zestawów danych FAP, badacze z Chin oferują pierwszy duży zestaw danych FAP, zawierający 100 000 obrazów twarzy, wraz z 200 000 ocenami ludzkimi szacującymi piękno twarzy.

Przykłady z nowego zestawu danych LiveBeauty. Źródło: https://arxiv.org/pdf/2501.02509

Przykłady z nowego zestawu danych LiveBeauty. Źródło: https://arxiv.org/pdf/2501.02509

Zestaw danych, zatytułowany LiveBeauty, zawiera 10 000 różnych tożsamości, wszystkie sfotografowane z (nieokreślonych) platform transmisji na żywo w marcu 2024 roku.

Autorzy przedstawiają również FPEM, nową wielomodalną metodę FAP. FPEM integruje wiedzę o twarzy i wielomodalne cechy estetyczne za pomocą modułu Personalized Attractiveness Prior (PAPM), modułu Multi-modal Attractiveness Encoder (MAEM) i modułu Cross-Modal Fusion (CMFM).

Artykuł twierdzi, że FPEM osiąga najlepsze wyniki na nowym zestawie danych LiveBeauty i innych zestawach danych FAP. Autorzy zauważają, że badanie ma potencjalne zastosowania w poprawie jakości wideo, rekomendacji treści i retuszowaniu twarzy w transmisjach na żywo.

Autorzy obiecują również udostępnić zestaw danych ‘wkrótce’ – chociaż trzeba przyznać, że wszelkie ograniczenia licencyjne wynikające z domeny źródłowej mogą zostać przeniesione na większość projektów, które mogą wykorzystać tę pracę.

Nowy artykuł nosi tytuł Przewidywanie atrakcyjności twarzy w transmisjach na żywo: nowy benchmark i wielomodalna metoda i pochodzi od dziesięciu badaczy z Alibaba Group i Shanghai Jiao Tong University.

Metoda i dane

Z każdej 10-godzinnej transmisji z platform transmisji na żywo, badacze wybrali jeden obraz na godzinę przez pierwsze trzy godziny. Transmisje z największą liczbą wyświetleń strony zostały wybrane.

Zebrane dane zostały następnie poddane kilku etapom przetwarzania. Pierwszym z nich jest pomiar rozmiaru twarzy, który wykorzystuje model wykrywania twarzy FaceBoxes z 2018 roku do generowania prostokąta ograniczającego twarz. Potok gwarantuje, że krótsza strona prostokąta przekracza 90 pikseli, unikając małych lub niejasnych twarzy.

Drugim etapem jest wykrywanie rozmycia, które jest stosowane do twarzy za pomocą wariancji operatora Laplace’a w kanałach wysokości (Y) twarzy. Wariancja ta musi być większa niż 10, co pomaga filtrować rozmyte obrazy.

Trzecim etapem jest estymacja pochylenia twarzy, która wykorzystuje model estymacji pochylenia twarzy 3DDFA-V2 z 2021 roku:

Przykłady z modelu estymacji pochylenia twarzy 3DDFA-V2. Źródło: https://arxiv.org/pdf/2009.09960

Przykłady z modelu estymacji pochylenia twarzy 3DDFA-V2. Źródło: https://arxiv.org/pdf/2009.09960

Tutaj potok gwarantuje, że kąt nachylenia twarzy nie przekracza 20 stopni, a kąt yaw nie przekracza 15 stopni, co wyklucza twarze z ekstremalnymi pochyleniami.

Czwartym etapem jest ocena proporcji twarzy, który również wykorzystuje możliwości segmentacji modelu 3DDFA-V2, gwarantując, że proporcja twarzy w obrazie jest większa niż 60%, wykluczając obrazy, na których twarz nie jest wyraźna, czyli mała w stosunku do całego obrazu.

Wreszcie, piątym etapem jest usunięcie duplikatów, które wykorzystuje (niepodpisany) model rozpoznawania twarzy, w przypadku gdy ta sama tożsamość pojawia się w więcej niż jednym z trzech obrazów zebranych dla 10-godzinnej transmisji.

Ocena i adnotacja ludzka

Zatrudniono 20 adnotatorów, w tym 6 mężczyzn i 14 kobiet, odzwierciedlających demografię platformy transmisji na żywo*. Twarze były wyświetlane na 6,7-calowym ekranie iPhone’a 14 Pro Max, w warunkach laboratoryjnych.

Ocena została podzielona na 200 sesji, z których każda obejmowała 50 obrazów. Osoby proszono o ocenę atrakcyjności twarzy na skali od 1 do 5, z pięciominutową przerwą między każdą sesją, a wszystkie osoby uczestniczyły we wszystkich sesjach.

Dlatego całość 10 000 obrazów została oceniona przez 20 osób, co dało 200 000 adnotacji.

Analiza i przetwarzanie

Najpierw przeprowadzono ocenę podmiotów za pomocą współczynnika odchylenia i współczynnika korelacji rangowej Spearmana (SROCC). Osoby, których oceny miały współczynnik SROCC mniejszy niż 0,75 lub współczynnik odchylenia większy niż 2%, uznano za niewiarygodne i usunięto, co dało 20 osób.

Obliczono następnie średnią ocenę (MOS) dla każdego obrazu twarzy, średnią ocen uzyskanych przez osoby wiarygodne. MOS służy jako odniesienie dla atrakcyjności każdego obrazu, a wynik oblicza się jako średnią wszystkich indywidualnych ocen od każdej osoby wiarygodnej.

Wreszcie, analiza rozkładu MOS dla wszystkich próbek, a także dla próbek kobiecych i męskich, wykazała, że mają one kształt zbliżony do rozkładu normalnego, co jest zgodne z rozkładem atrakcyjności twarzy w świecie rzeczywistym:

Przykłady rozkładu MOS z LiveBeauty.

Przykłady rozkładu MOS z LiveBeauty.

Większość osób ma przeciętną atrakcyjność twarzy, a mniej osób ma atrakcyjność na ekstremach, czyli bardzo niską lub bardzo wysoką.

Dalej, analiza współczynników skośności i kurtozy wykazała, że rozkłady te charakteryzują się cienkimi ogonami i są skoncentrowane wokół średniej oceny, oraz że wysoka atrakcyjność była bardziej powszechna wśród próbek kobiecych w zebranych transmisjach na żywo.

Architektura

Zastosowano strategię szkolenia dwuetapowego dla modelu Facial Prior Enhanced Multi-modal (FPEM) i fazy fuzji hybrydowej w LiveBeauty, podzielonej na cztery moduły: moduł Personalized Attractiveness Prior (PAPM), moduł Multi-modal Attractiveness Encoder (MAEM), moduł Cross-Modal Fusion (CMFM) i moduł Decision Fusion (DFM).

Schemat konceptualny potoku szkoleniowego LiveBeauty.

Schemat konceptualny potoku szkoleniowego LiveBeauty.

Moduł PAPM pobiera obraz jako dane wejściowe i wyodrębnia wieloskalowe cechy wizualne za pomocą Swin Transformer, a także wyodrębnia cechy twarzy za pomocą wstępnie wyszkolonego modelu FaceNet. Następnie łączy te cechy za pomocą bloku uwagi krzyżowej, tworząc osobisty ‘atrację’ cech.

Również w fazie wstępnego szkolenia, MAEM wykorzystuje obraz i tekstowe opisy atrakcyjności, wykorzystując CLIP do wyodrębnienia wielomodalnych cech estetycznych.

Opisy tekstowe są w postaci ‘zdjęcie osoby z atrakcyjnością {a}’ (gdzie {a} może być zła, słaba, przeciętna, dobra lub idealna). Proces szacuje podobieństwo kosinusowe między tekstowymi i wizualnymi wektorami, aby uzyskać prawdopodobieństwo atrakcyjności.

W fazie fuzji hybrydowej, CMFM doskonali tekstowe wektory za pomocą osobistych cech atrakcyjności wygenerowanych przez PAPM, tworząc w ten sposób osobiste wektory tekstowe. Następnie wykorzystuje strategię regresji podobieństwa, aby dokonać przewidywania.

Wreszcie, DFM łączy poszczególne przewidywania z PAPM, MAEM i CMFM, aby wyprodukować pojedynczy, ostateczny wynik atrakcyjności, z celem osiągnięcia solidnego konsensusu.

Funkcje straty

Dla miar straty, PAPM jest szkolony za pomocą straty L1, która jest miarą bezwzględnej różnicy między przewidywaną oceną atrakcyjności a rzeczywistą (prawdziwą) oceną atrakcyjności.

Moduł MAEM wykorzystuje bardziej złożoną funkcję straty, która łączy stratę oceny (LS) ze stratą rangi (LR). Strata rangi (LR) składa się z straty wierności (LR1) i straty rangi dwukierunkowej (LR2).

LR1 porównuje względną atrakcyjność par obrazów, podczas gdy LR2 zapewnia, że przewidywana rozkład prawdopodobieństwa poziomów atrakcyjności ma jeden szczyt i maleje w obu kierunkach. Ten złożony podejście ma na celu zoptymalizowanie zarówno dokładnego oceniania, jak i poprawnego rangowania obrazów pod względem atrakcyjności.

CMFM i DFM są szkolone za pomocą prostej straty L1.

Testy

W testach, badacze skonfrontowali LiveBeauty z dziewięcioma poprzednimi podejściami: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (zawarty w REX-INCEP); MEBeauty; AVA-MLSP; TANet; Dele-Trans; i EAT.

Metody bazowe zgodne z oceną estetyki obrazu (IAA) również zostały przetestowane. Były to ViT-B; ResNeXt-50; i Inception-V3.

Ponadto, LiveBeauty, zestaw danych testowy, oraz SCUT-FBP5000 i MEBeauty zostały poddane testom. Poniżej przedstawiono rozkłady MOS tych zestawów danych:

Rozkłady MOS zestawów danych porównawczych.

Rozkłady MOS zestawów danych porównawczych.

Odpowiednio, te zestawy danych zostały podzielone w proporcji 60%-40% i 80%-20% do szkolenia i testowania, oddzielnie, aby zachować spójność z ich oryginalnymi protokołami. LiveBeauty został podzielony w proporcji 90%-10%.

Dla inicjacji modelu w MAEM, VT-B/16 i GPT-2 zostały użyte jako kodery obrazu i tekstu, zainicjowane ustawieniami z CLIP. Dla PAPM, Swin-T został użyty jako szkolalny kodery obrazu, zgodnie z SwinFace.

Optymalizator AdamW został użyty, a stawka uczenia harmonogramu został ustawiony z liniowym rozgrzewaniem pod schematem cosine annealing. Stawki uczenia się różniły się w fazach szkolenia, ale każda miała rozmiar partii 32, przez 50 epok.

Wyniki testów

Wyniki testów

Wyniki testów na trzech zestawach danych FAP są przedstawione powyżej. Spośród tych wyników, artykuł stwierdza:

‘Nasza proponowana metoda zajmuje pierwsze miejsce i przewyższa drugie miejsce o około 0,012, 0,081, 0,021 w wartościach SROCC na LiveBeauty, MEBeauty i SCUT-FBP5500 odpowiednio, co demonstruje wyższość naszej proponowanej metody.

‘Metody IAA są gorsze od metod FAP, co wskazuje, że ogólne metody oceny estetyki pomijają cechy twarzy zaangażowane w subiektywną naturę atrakcyjności twarzy, prowadząc do słabych wyników w zadaniach FAP.

‘Wydajność wszystkich metod spada znacznie w MEBeauty. Jest to spowodowane tym, że próbki szkoleniowe są ograniczone, a twarze są etnicznie różnorodne w MEBeauty, co wskazuje na dużą różnorodność atrakcyjności.

‘Wszystkie te czynniki sprawiają, że przewidywanie atrakcyjności w MEBeauty jest bardziej wyzwaniem.’

Uwagi etyczne

Badania nad atrakcyjnością są potencjalnie kontrowersyjnym przedsięwzięciem, ponieważ ustanawiając rzekomo empiryczne standardy piękna, takie systemy będą miały tendencję do wzmocnienia uprzedzeń wokół wieku, rasy i wielu innych sekcji badań komputerowego widzenia związanego z ludźmi.

Można argumentować, że system FAP jest wewnętrznie skłonny do wzmocnienia i utrwalenia częściowych i tendencyjnych perspektyw na atrakcyjność. Te osądy mogą wynikać z adnotacji prowadzonych przez ludzi – często przeprowadzanych w skalach zbyt małych dla skutecznej generalizacji domenowej – lub z analizy wzorców uwagi w środowiskach online, takich jak platformy transmisji na żywo, które są, zdaje się, daleko od bycia meritokratycznymi.

 

* Artykuł odnosi się do nieokreślonej domeny źródłowej w liczbie pojedynczej i mnogiej.

Publikacja po raz pierwszy w środę, 8 stycznia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai