Kąt Andersona

Narzędzie AI usuwa makijaż, aby powstrzymać nieletnich od omijania kontroli wieku

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Flux, SDXL, Photoshop Neural filters, Firefly, Krita et al.

Wygląd kosmetyków na twarzy pozwala nieletnim użytkownikom, głównie dziewczętom, omijać kontrolę wieku opartą na selfie na platformach takich jak aplikacje randkowe i strony handlu elektronicznego. Nowe narzędzie AI rozwiązuje tę lukę, wykorzystując model dyskryminatywny, który został przeszkolony do usuwania makijażu, zachowując tożsamość, co utrudnia nieletnim oszukiwanie systemów automatycznych.

 

Użycie usług trzecich, opartych na selfie, do weryfikacji wieku jest coraz bardziej popularne, nie tylko ze względu na ogólne globalne tendencje w kierunku weryfikacji wieku online.

Na przykład, w nowym systemie egzekwowania prawa, który nakazuje brytyjski Online Safety Act, weryfikację wieku można przeprowadzić za pomocą różnych usług trzecich, usług, które wykorzystują różne metody, w tym weryfikację wieku za pomocą wizji, gdzie AI jest wykorzystywana do przewidywania wieku użytkownika (zwykle na podstawie nagrania wideo z kamery mobilnej). Usługi, które wykorzystują podejścia tego rodzaju, obejmują Ondato, TrustStamp i Yoti.

Jednak weryfikacja wieku nie jest niezawodna, a tradycyjna determinacja nastolatków do przewidywania praw dorosłości powoduje, że młodzi ludzie opracowali różne skuteczne metody, aby wejść na strony randkowe, fora i inne środowiska, które zabraniają ich grupy wiekowej.

Jedną z tych metod, najczęściej stosowaną przez dziewczęta*, jest noszenie makijażu – taktykę znaną jako oszukiwanie systemów automatycznych, które zwykle przeszacowują wiek młodych ludzi i zaniżają wiek starszych ludzi.

Nie tylko dziewczęta

Przed protestem przeciwko traktowaniu makijażu jako “zorientowanego na dziewczęta”, musimy zauważyć, że obecność kosmetyków na twarzy jest bardzo niepewnym wskaźnikiem płci:

W artykule 'Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms' amerykańscy badacze odkryli, że systemy weryfikacji płci zostały oszukane przez makijaż zmieniający płeć. Źródło: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

W artykule ‘Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms’ amerykańscy badacze odkryli, że systemy weryfikacji płci zostały oszukane przez makijaż zmieniający płeć. Source: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

W 2024 roku 72% amerykańskich konsumentów mężczyzn w wieku 18-24 lat szacowano na tych, którzy włączyli makijaż do swojej rutyny pielęgnacyjnej – chociaż większość z nich używa produktów kosmetycznych, aby poprawić wygląd zdrowej skóry, a nie do makijażu w stylu kobiecym.

Więc nie możemy traktować materiału badawczego w tym artykule inaczej niż w najczęstszym scenariuszu badawczym – tym, w którym dziewczęta nieletnie używają makijażu, aby oszukiwać systemy automatycznej weryfikacji wieku.

Skuteczne usuwanie makijażu – sposób AI

Badania, o których mowa powyżej, pochodzą od trzech współautorów z Nowego Jorku, w postaci nowego artykułu DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation.

Celem projektu jest osiągnięcie metody opartej na AI do usuwania wyglądu makijażu z obrazów (potencjalnie również wideo), aby uzyskać lepsze pojęcie o prawdziwym wieku osoby za makijażem.

Z nowego artykułu, przykład usuwania makijażu. Źródło: https://arxiv.org/pdf/2507.13292

Z nowego artykułu, przykład tego, jak usuwanie makijażu może znacząco zmienić przewidywanie wieku. Source: https://arxiv.org/pdf/2507.13292

Jednym z wyzwań w tworzeniu takiego systemu jest potencjalna wrażliwość na gromadzenie lub kurację obrazów nieletnich dziewcząt w makijażu. Ostatecznie badacze użyli systemu opartego na sieciach generatywnych i dyskryminatywnych, zwanego EleGANt, aby sztucznie nałożyć style makijażu, co okazało się bardzo skuteczne:

System EleGANt z 2022 roku, opracowany przez Uniwersytet Tsinghua, wykorzystuje sieci generatywne i dyskryminatywne, aby autentycznie nałożyć kosmetyki na zdjęcia źródłowe. Źródło: https://arxiv.org/pdf/2207.09840

System EleGANt z 2022 roku, opracowany przez Uniwersytet Tsinghua, wykorzystuje sieci generatywne i dyskryminatywne, aby autentycznie nałożyć kosmetyki na zdjęcia źródłowe. Source: https://arxiv.org/pdf/2207.09840

Dzięki danym syntetycznym uzyskanym w ten sposób, a także dzięki pomocy różnych projektów i zbiorów danych, autorzy byli w stanie przewyższyć metody stanu sztuki w estymacji wieku, gdy spotykają się z makijażem “widocznym” lub “evidentnym”.

Artykuł stwierdza:

‘DiffClean [usuwa] ślady makijażu, wykorzystując model dyfuzyjny z przewodnictwem tekstowym, aby bronić się przed atakami makijażu. [To] poprawia estymację wieku (dokładność minor/adult o 4,8%) i weryfikację twarzy (TMR o 8,9% przy FMR=0,01%) w porównaniu z systemami porównawczymi na obrazach cyfrowo symulowanych i rzeczywistych.’

Zobaczmy, jak to zrobili.

Metoda

Aby uniknąć pozyskiwania rzeczywistych obrazów nieletnich w makijażu, autorzy użyli EleGANt, aby nałożyć syntetyczny makijaż na obrazy z UTKFace dataset, tworząc pary przed-i-po dla treningu.

Przykłady z UTKFace dataset. Źródło: https://susanqq.github.io/UTKFace/

Przykłady z UTKFace dataset. Source: https://susanqq.github.io/UTKFace/

DiffClean został przeszkolony do odwrócenia tej transformacji. Ponieważ algorytmy estymacji wieku popełniają najwięcej błędów, gdy mają do czynienia z młodszymi grupami wiekowymi, badacze stwierdzili, że konieczne jest opracowanie klasyfikatora wieku proxy, dostosowanego do wieku docelowego (10-19 lat). W tym celu wykorzystali architekturę SSRNet przeszkoloną na UTKFace, z ważonym błędem L1.

Uproszczona wersja modelu dyfuzyjnego z 2021 roku OpenAI zapewniła podstawę dla transformacji, z autorami, którzy zachowali podstawową architekturę, ale zmodyfikowali ją o dodatkowe głowy uwagi na różnych rozdzielczościach, głębsze warstwy i bloki BigGAN, aby poprawić etapy upsamplingu i downsamplingu.

Kontrola kierunkowa została wprowadzona za pomocą CLIP promptów: konkretnie, twarz z makijażem i twarz bez makijażu, aby model nauczył się poruszać w pożądanym kierunku semantycznym, pozwalając na usunięcie makijażu bez kompromitowania szczegółów twarzy, wskazówek wieku lub tożsamości.

Sztuczny makijaż nałożony za pomocą EleGANt. Każda triada pokazuje oryginalne zdjęcie UTKFace (po lewej), styl makijażu referencyjny (w środku) i wynik po przeniesieniu stylu (po prawej).

Sztuczny makijaż nałożony za pomocą EleGANt. Każda triada pokazuje oryginalne zdjęcie UTKFace (po lewej), styl makijażu referencyjny (w środku) i wynik po przeniesieniu stylu (po prawej). Przeniesienie makijażu tego rodzaju jest powszechne w literaturze z zakresu komputerowego widzenia, a ta funkcja jest również dostępna w filtrach neuronalnych Adobe Photoshop, które mogą podobnie nałożyć makijaż z obrazu referencyjnego na obraz docelowy.

Cztery kluczowe funkcje strat kierowały usuwaniem makijażu bez wpływu na tożsamość twarzy lub wskazówki wieku. Poza powyższą stratą opartą na CLIP, tożsamość została zachowana za pomocą ważonej pary strat ArcFace pobranych z InsightFace – strat, które mierzyły podobieństwo między wygenerowaną twarzą a oryginalnym czystym obrazem i “pomakijażowanym” wersją, zapewniając, że podmiot pozostał wizualnie spójny przed i po usunięciu makijażu.

Trzecia strata, Perceptual Loss (LPIPS), wykorzystywała odległość L1, aby wymusić realizm na poziomie pikseli i zachować ogólny wygląd oryginalnego obrazu po usunięciu makijażu.

Wreszcie, wiek był nadzorowany za pomocą przeszkolonego SSRNet na UTKFace, z modelem, który wykorzystywał wygładzony błąd L1 (z cięższymi karami za błędy w zakresie wieku 10–29 lat, gdzie błędy są najczęstsze). Wariant modelu zastąpił to stratą opartą na CLIP, nakazując modelowi dopasowanie wyglądu do określonego wieku.

Do estymacji wieku w czasie inferencji (w przeciwieństwie do użycia SSRNet w czasie treningu) wykorzystano ramę MiVOLO z 2023 roku.

Dane i testy

Przeszkolony SSRNet na UTKFace wykorzystywał zestaw treningowy 15 364 obrazów, wobec zestawu testowego 6 701 obrazów. Oryginalne 20 000 obrazów zostało przefiltrowane, aby usunąć osoby powyżej 70 lat, a następnie podzielone w stosunku 70:30.

Zgodnie z wcześniejszą metodą ustaloną przez projekt DiffAM z 2023 roku, trening odbywał się w dwóch etapach, z pierwszym sesją wykorzystującą 300 obrazów makijażu z rzeczywistego świata (tym razem podział 200/100 między trening a walidację) z MT dataset BeautyGAN.

Model został następnie udoskonalony za pomocą 300 dodatkowych obrazów UTKFace, uzupełnionych syntetycznym makijażem za pomocą EleGANt. To stworzyło ostateczny zestaw treningowy 600 przykładów, sparowanych w pięciu stylach referencyjnych z BeautyGAN. Ponieważ usuwanie makijażu wiąże się z mapowaniem wielu stylów makijażu na jedną czystą twarz, trening koncentrował się na szerokiej generalizacji zamiast na pokryciu każdej możliwej odmiany kosmetycznej.

Wydajność została oceniona na obrazach syntetycznych i rzeczywistych. Testy syntetyczne wykorzystywały 2 556 obrazów z Flickr-Faces-HQ Dataset (FFHQ), równomiernie wybrane w dziewięciu grupach wiekowych poniżej 70, i zmodyfikowane za pomocą EleGANt.

Generalizację oceniono za pomocą 3 000 obrazów z BeautyFace i 355 z LADN, oba zawierające autentyczny makijaż.

Przykłady z BeautyFace dataset, ilustrujące segmentację semantyczną, która definiuje różne obszary powierzchni twarzy. Źródło: https://li-chongyi.github.io/BeautyREC_files/

Przykłady z BeautyFace dataset, ilustrujące segmentację semantyczną, która definiuje różne obszary powierzchni twarzy. Source: https://li-chongyi.github.io/BeautyREC_files/

Metryki i implementacja

Do metryk autorzy wykorzystali średni błąd bezwzględny (MAE) między wartościami rzeczywistymi (rzeczywistymi obrazami z ustalonymi wiekami) a przewidywanymi wartościami wieku, gdzie niższe wyniki są lepsze; dokładność grupy wiekowej została użyta do oceny, czy przewidywane wieki znalazły się w odpowiednich grupach (w którym przypadku niższe wyniki są lepsze); dokładność minor/adult została użyta do oceny poprawnej identyfikacji osób powyżej 18 lat (w którym przypadku wyższy wynik jest lepszy).

Ponadto, chociaż nie jest to centralne dla tematu, autorzy podają również metryki weryfikacji tożsamości w postaci True Match Rate (TMR) i False Match Rate (FMR), a także dodatkowe wartości krzywej ROC.

SSRNet został przeszkolony na obrazach 64×64 px przy rozmiarze partii 50 pod optymalizatorem Adam z wygaszaniem wag 1e−4, a także harmonogramem cosine annealing i stawką uczenia 1e−3 przez 200 epok, z wczesnym zatrzymaniem.

Przeciwnie, moduł DiffClean otrzymywał obrazy wejściowe 256×256 px i był przeszkolony przez pięć epok przy użyciu Adama, przy grubszym tempie uczenia 4e−3. Próbkowanie wykorzystywało 40 kroków odwrotnych DDIM i 6 kroków forward DDIM. Wszystkie szkolenia były przeprowadzane na jednej karcie graficznej NVIDIA A100 (nieokreślono, czy z 40 GB czy 80 GB pamięci VRAM).

Systemy porównawcze były CLIP2Protect i wcześniej wymieniony DiffAM. Autorzy wykorzystali “matowe” style makijażu w przepływie pracy, ponieważ, jak stwierdzono w CLIP2Protect, osiągają one wyższy wskaźnik powodzenia (co prawdopodobnie daje możliwość oszukania tego podejścia – ale to temat na inny raz).

Aby odtworzyć DiffAM jako bazę porównawczą, wykorzystano wstępnie przeszkolony model z BeautyGAN, który został przeszkolony na MT dataset. Dla przeniesienia makijażu wykorzystano punkt kontrolny z DiffAM z parametrami domyślnymi dla modelu docelowego, obrazu referencyjnego i tożsamości.

Wydajność DiffClean w porównaniu z systemami porównawczymi w zadaniach estymacji wieku, z użyciem MiVOLO. Podane metryki to dokładność klasyfikacji minor/adult, dokładność grupy wiekowej i średni błąd bezwzględny (MAE). DiffClean z stratą wieku CLIP osiąga najlepsze wyniki we wszystkich metrykach.

Wydajność DiffClean w porównaniu z systemami porównawczymi w zadaniach estymacji wieku, z użyciem MiVOLO. Podane metryki to dokładność klasyfikacji minor/adult, dokładność grupy wiekowej i średni błąd bezwzględny (MAE). DiffClean z stratą wieku CLIP osiąga najlepsze wyniki we wszystkich metrykach.

Z tych wyników autorzy stwierdzają:

‘Nasza metoda DIFFCLEAN przewyższa oba systemy porównawcze, CLIP2Protect i DiffAM, i może pomyślnie przywrócić wskazówki wieku zakłócone przez makijaż, obniżając MAE (do 5,71) i poprawiając ogólną dokładność grupy wiekowej (do 37%). ‘

‘Nasza metoda koncentruje się na grupach wiekowych nieletnich, a wyniki wskazują, że osiągamy lepszą klasyfikację wieku nieletnich i dorosłych, wynoszącą 88,6%.’

Wyniki usuwania makijażu z metod porównawczych i proponowanych. Kolumna po lewej stronie pokazuje obrazy źródłowe, następne to wyniki z CLIP2Protect i DiffAM. Trzecia kolumna pokazuje wyniki z DiffClean za pomocą SSRNet i straty wieku CLIP. Autorzy twierdzą, że DiffClean skuteczniej usuwa makijaż, unikając zniekształceń cech widocznych w CLIP2Protect i nieusuwanego makijażu w DiffAM.

Wyniki usuwania makijażu z metod porównawczych i proponowanych. Kolumna po lewej stronie pokazuje obrazy źródłowe, następne to wyniki z CLIP2Protect i DiffAM. Trzecia kolumna pokazuje wyniki z DiffClean za pomocą SSRNet i straty wieku CLIP. Autorzy twierdzą, że DiffClean skuteczniej usuwa makijaż, unikając zniekształceń cech widocznych w CLIP2Protect i nieusuwanego makijażu w DiffAM.

Autorzy zauważają ponadto, że makijaż nie ma jednolitego wpływu na postrzegany wiek, ale może zwiększać, zmniejszać lub nie zmieniać wyglądu wieku twarzy. Dlatego DiffClean nie stosuje “powszechnego obniżenia” przewidywanego wieku, ale próbuje odzyskać oryginalne wskazówki wieku, usuwając ślady makijażu:

Przykłady usuwania makijażu z CelebA-HQ i CACD datasets. Każda kolumna pokazuje parę obrazów przed (po lewej) i po (po prawej) usunięciu makijażu. W pierwszej kolumnie wiek przewidywany maleje po usunięciu makijażu; w drugiej pozostaje niezmieniony; a w trzeciej wzrasta.

Przykłady usuwania makijażu z CelebA-HQ i CACD datasets. Każda kolumna pokazuje parę obrazów przed (po lewej) i po (po prawej) usunięciu makijażu. W pierwszej kolumnie wiek przewidywany maleje po usunięciu makijażu; w drugiej pozostaje niezmieniony; a w trzeciej wzrasta.

Aby przetestować, jak dobrze DiffClean działa na nowych danych, uruchomiono go na BeautyFace i LADN datasets, które zawierają autentyczny makijaż, ale nie mają sparowanych obrazów tych samych osób bez makijażu. Porównano przewidywania wieku przed i po usunięciu makijażu, aby ocenić, jak skutecznie DiffClean redukuje zniekształcenie wprowadzone przez makijaż:

Wyniki usuwania makijażu na rzeczywistych obrazach z LADN (po lewej) i BeautyFace (po prawej) datasets. DiffClean redukuje wiek przewidywany, usuwając makijaż, zmniejszając lukę między wyglądem a rzeczywistym wiekiem. Białe liczby pokazują wiek szacowany przed i po przetworzeniu.

Wyniki usuwania makijażu na rzeczywistych obrazach z LADN (po lewej) i BeautyFace (po prawej) datasets. DiffClean redukuje wiek przewidywany, usuwając makijaż, zmniejszając lukę między wyglądem a rzeczywistym wiekiem. Białe liczby pokazują wiek szacowany przed i po przetworzeniu.

Wyniki pokazały, że DiffClean konsekwentnie zmniejszał lukę między wyglądem a rzeczywistym wiekiem. W obu zbiorach danych obniżył on błędy przeszacowania i niedoszacowania o około trzy lata średnio, co sugeruje, że system dobrze generalizuje do rzeczywistych stylów kosmetycznych.

Wnioski

Jest to interesujące, a może nieuniknione, że makijaż performatywny byłby wykorzystywany w sposób przeciwny. Biorąc pod uwagę, że dziewczęta dojrzewają w różnym tempie, ale zwykle dojrzewają szybciej jako grupa, zadanie identyfikacji progu między statusem nieletnim a dorosłym może być jednym z najbardziej ambitnych, jakie scena badawcza dotąd postawiła sobie.

Mimo to, czas i dane mogą ostatecznie określić spójne znaki wieku, które mogą być wykorzystane do kotwiczenia systemów weryfikacji wieku wizualnej.

 

* Ponieważ ten temat zaprasza do używania emocjonalnego języka, a “dziewczęta” jest wykluczające (podczas gdy “kobiety i dziewczęta”, obecnie akceptowane określenie osób płci żeńskiej, nie jest dokładnym opisem w tym przypadku), przyjąłem “kobiety” jako najlepsze kompromis, jaki mógłbym wymyślić – chociaż nie ujmuje to wszystkich subtelności demograficznych, za co się przepraszam.

W tym artykule używam “performatywny”, aby wskazać makijaż, który ma być widoczny i rozpoznawalny jako makijaż, taki jak mascara, eyeliner, róże i podkład, w przeciwieństwie do kremów ukrywających i innych “tajemniczych” rodzajów aplikacji kosmetycznych.

Pierwotnie opublikowane w piątek, 18 lipca 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai