Andersonův úhel

AI nástroj odstraňuje make-up, aby zabránil nezletilým obcházet kontrolu věku

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Flux, SDXL, Photoshop Neural filters, Firefly, Krita et al.

Vzhled obličejové kosmetiky umožňuje nezletilým uživatelům, převážně dívkám, proklouznout kolem kontrol věku založených na selfie na platformách jako seznamovací aplikace a e‑shopové stránky. Nový AI nástroj tento nedostatek řeší pomocí diskriminačního modelu trénovaného k vymazání make-upu při zachování identity, což ztěžuje nezletilým podvádět automatizované systémy.

 

Používání třetích stran, služeb ověřování věku založených na selfie, roste, mimo jiné kvůli obecnému celosvětovému impulsu k online ověřování věku.

Například v novém režimu vymáhání, který britský Online Safety Act nyní nařizuje, může být ověřování věku prováděno řadou třetích stran služeb, využívajících různé možné metody, včetně vizuálního ověřování věku, kde se AI používá k vizuálnímu odhadu věku uživatele (obvykle z živého záznamu z mobilní kamery). Služby, které používají takové přístupy, zahrnují Ondato, TrustStamp a Yoti.

Nicméně odhad věku není neomylný a tradiční snaha teenagerů předvídat práva dospělosti znamená, že mladí lidé vyvinuli různé účinné metody, jak vstoupit na seznamovací stránky, fóra a další prostředí, která zakazují jejich věkovou skupinu.

Jednou z těchto metod, nejčastěji používanou ženami*, je nošení obličejového make-upu – taktika známá tím, že oklame automatizované systémy odhadu věku, které obecně nadhodnocují věk mladých lidí a podcení věk starších osob.

Nejen dívky

Předtím, než vznikne protest kvůli vnímání make-upu jako ‘ženského’, musíme poznamenat, že přítomnost obličejové kosmetiky na každém je velmi nespolehlivý ukazatel pohlaví:

V článku 'Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms' američtí výzkumníci zjistili, že systémy pro ověřování pohlaví byly zmateny makeupem měnícím pohlaví. Zdroj: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

Ve studii ‘Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms’ američtí výzkumníci zjistili, že systémy ověřování pohlaví byly zmateny make-upem měnícím pohlaví. Source: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf

V roce 2024 bylo 72 % amerických mužských spotřebitelů ve věku 18–24 let odhadováno, že zahrnují make-up do své péče o vzhled – ačkoliv většina používá kosmetické produkty k podpoře zdravého vzhledu pokožky, spíše než aby se věnovala performativním† kombinacím řasenky/lakového rtěnky více spojeným s ženskou vizuální estetikou.

Takže nemůžeme nepovažovat materiál zkoumaný v tomto článku za typický scénář, který byl prozkoumán v novém výzkumu – tj. dívky‑nezletilé používající make-up k obcházení automatizovaných vizuálních systémů ověřování věku.

Účinné odstranění make-upu – AI cesta

Výzkum zmíněný výše pochází od tří přispěvatelů z New York University, ve formě nového článku DiffClean: Diffusion-based Makeup Removal for Accurate Age Estimation.

Cílem projektu je dosáhnout AI‑poháněné metody odstraňování vzhledu make-upu z obrázků (potenciálně včetně videozáznamů), aby bylo možné získat lepší představu o skutečném věku osoby za make-upem.

Z nového článku příklad odstranění makeupu. Zdroj: https://arxiv.org/pdf/2507.13292

Z nového článku příklad, jak odstranění make-upu může výrazně změnit predikci věku. Source: https://arxiv.org/pdf/2507.13292

Jednou z výzev vývoje takového systému je potenciální citlivost kolem sběru nebo kurátorství snímků nezletilých dívek nosících dospělský make-up. Nakonec výzkumníci použili třetí stranu založený na generativní adversariální síti nazvaný EleGANt k umělému nasazení stylů make-upu, techniku, která se ukázala velmi účinnou:

Tsinghua University's 2022 EleGANt system uses Generative Adversarial Networks (GANs) to superimpose cosmetics authentically onto source photos. Source: https://arxiv.org/pdf/2207.09840

Systém EleGANt z Tsinghua University z roku 2022 používá generativní adversariální síť (GAN) k autentickému překrytí kosmetiky na původní fotografie. Source: https://arxiv.org/pdf/2207.09840

Za pomoci syntetických dat získaných tímto způsobem a s pomocí široké škály doplňkových projektů a datových sad byli autoři schopni překonat špičkové metody odhadu věku při setkání s performativním nebo ‘zjevně’ make-upem.

Článek uvádí:

‘DiffClean [erases] stopy make-upu pomocí textově řízeného difúzního modelu k obraně proti make-up útokům. [It] zlepšuje odhad věku (přesnost pro nezletilé vs. dospělé o 4,8 %) a ověřování obličeje (TMR o 8,9 % při FMR=0,01 %) oproti konkurenčním základům na digitálně simulovaných a reálných obrázcích s make-upem.’

Podívejme se, jak k úkolu přistoupili.

Metoda

Aby se předešlo získávání skutečných snímků nezletilých s make-upem, autoři použili EleGANt k aplikaci syntetického make-upu na obrázky ze sady UTKFace, čímž vytvořili páry před a po pro trénink.

Příklady ze sady UTKFace. Zdroj: https://susanqq.github.io/UTKFace/

Příklady ze sady UTKFace. Source: https://susanqq.github.io/UTKFace/

DiffClean byl poté trénován k obrácení této transformace. Protože algoritmy pro odhad věku chybují nejvíce u mladších věkových skupin, výzkumníci považovali za nutné vyvinout zástupný klasifikátor věku doladěný na cílové věky (10‑19 let). K tomuto účelu použili architekturu SSRNet trénovanou na UTKFace, s váženou L1 loss.

Zjednodušená verze modelu diffusion model z roku 2021 od OpenAI poskytla kostru pro transformaci, přičemž autoři zachovali hlavní architekturu, ale upravili ji o další attention heads na různých rozlišeních, hlubší vrstvy a bloky ve stylu BigGAN pro zlepšení fází upsamplingu a downsamplingu.

Řízení směru bylo zavedeno pomocí výzev CLIP: konkrétně obličej s make-upem a obličej bez make-upu, takže model se naučil pohybovat v požadovaném sémantickém směru, umožňující odstranit make-up bez poškození detailů obličeje, věkových náznaků nebo identity.

Syntetický make-up aplikován pomocí EleGANt. Každý trojice ukazuje původní obrázek UTKFace (vlevo), referenční styl make-upu (uprostřed) a výsledek po přenosu stylu (vpravo).

Syntetický make-up aplikován pomocí EleGANt. Každý trojice ukazuje původní obrázek UTKFace (vlevo), referenční styl make-upu (uprostřed) a výsledek po přenosu stylu (vpravo). Přenos make-upu tohoto druhu je hojně zastoupen v literatuře počítačového vidění a tato funkce je také dostupná v neuronových filtrech Adobe Photoshopu, které mohou podobně aplikovat make-up z referenčního obrázku na cílový obrázek.

Čtyři klíčové ztrátové funkce vedly odstraňování make-upu bez ovlivnění identity obličeje nebo věkových náznaků. Kromě výše zmíněné ztráty založené na CLIP byla identita zachována pomocí vážené dvojice ztrát ArcFace převzatých z knihovny InsightFace – ztrát, které měřily podobnost mezi vygenerovaným obličejem a jak originálním čistým obrázkem, tak verzí s make-upem, čímž zajistily, že subjekt zůstane vizuálně konzistentní před a po odstranění make-upu.

Třetí, percepční ztráta Learned Perceptual Similarity Metrics (LPIPS) použila L1 vzdálenost k vynucení pixelové realismu a zachování celkového vzhledu původního obrázku po odstranění make-upu.

Nakonec byl věk řízen pomocí doladěného SSRNet trénovaného na sadě UTKFace, přičemž model používal vyhlazenou L1 ztrátu (s vyššími penalizacemi za chyby ve věkovém rozmezí 10–29 let, kde je nesprávná klasifikace nejčastější). Varianta modelu nahradila tuto ztrátu výzvou věku založenou na CLIP, která model vyzývá, aby odpovídal vzhledu konkrétního věku.

Pro odhad věku při inferenci (na rozdíl od použití SSRNet během tréninku) byl použit rámec MiVOLO z roku 2023.

Data a testy

Doladění SSRNet na UTKFace použilo trénovací sadu 15 364 obrázků proti testovací sadě o 6 701 obrázcích. Původních 20 000 obrázků bylo filtrováno, aby se odstranili osoby starší 70 let, a poté bylo rozděleno poměrem 70:30.

V souladu s předchozí metodou zavedenou projektem DiffAM z roku 2023 proběhl trénink ve dvou fázích, přičemž úvodní fáze použila 300 reálných obrázků s make-upem (tentokrát rozdělených 200/100 mezi trénink a validaci) ze MT dataset společnosti BeautyGAN.

Model byl následně dále vylepšen pomocí dalších 300 obrázků UTKFace, augmentovaných syntetickým make-upem pomocí EleGANt. Tím vznikla finální trénovací sada 600 příkladů, spárovaných napříč pěti referenčními styly od BeautyGAN. Protože odstraňování make-upu zahrnuje mapování mnoha stylů make-upu na jediný čistý obličej, trénink se zaměřil na širokou generalizaci místo pokrytí každé možné kosmetické variace.

Výkon byl hodnocen na syntetických i reálných obrázcích. Syntetické testování použilo 2 556 obrázků ze sady Flickr-Faces-HQ (FFHQ), rovnoměrně vybraných z devíti věkových skupin pod 70 let a upravených pomocí EleGANt.

Generalizace byla posouzena pomocí 3 000 obrázků ze BeautyFace a 355 z LADN, oba obsahující autentický make-up.

Příklady ze sady BeautyFace, ilustrující sémantickou segmentaci definující různé oblasti postižené povrchu obličeje. Zdroj: https://li-chongyi.github.io/BeautyREC_files/

Příklady ze sady BeautyFace, ilustrující sémantickou segmentaci definující různé oblasti postižené povrchu obličeje. Source: https://li-chongyi.github.io/BeautyREC_files/

Metriky a implementace

Pro metriky autoři použili Mean Absolute Error (MAE) mezi skutečnou hodnotou (reálné obrázky s ověřeným věkem) a předpovězenými věkovými hodnotami, kde nižší výsledky jsou lepší; age group accuracy byla použita k posouzení, zda předpovězené věky spadly do správných skupin (v tomto případě jsou nižší výsledky lepší); přesnost minor/adult byla použita k vyhodnocení správné identifikace osob starších 18 let (kde vyšší výsledek je lepší).

Kromě toho, ačkoliv se to netýká přímo probíraného tématu, autoři také uvádějí metriky ověřování identity ve formě True Match Rate (TMR) a False Match Rate (FMR), s dalším uváděním souvisejících Receiver Operating Characteristic (ROC) hodnot.

SSRNet byl doladěn na obrázcích 64×64 px s batch size 50 za použití optimalizátoru Adam s weight decay 1e−4, dále s cosine annealing scheduler a učební rychlostí 1e−3 po 200 epochs, s early stopping.

Naopak modul DiffClean přijímal vstupní obrázky 256×256 px a byl doladěn po dobu pěti epoch pomocí Adam při hrubší učební rychlosti 4e−3. Vzorkování použilo 40 DDIM inversion kroků a 6 kroků DDIM dopředu. Veškeré trénování probíhalo na jediném GPU NVIDIA A100 (specifikace 40 GB nebo 80 GB VRAM nebyla uvedena).

Testované konkurenční systémy byly CLIP2Protect a dříve zmíněný DiffAM. Autoři ve workflow použili ‘matte’ styl líčení, protože v CLIP2Protect byl zaznamenán vyšší úspěšnost (pravděpodobně poskytuje příležitost těm, kteří se snaží tento přístup obejít – ale to je už jiná otázka).

Pro replikaci DiffAM jako referenčního modelu byl předtrénovaný model z BeautyGAN doladěn na dataset MT. Pro adversariální přenos líčení byl použit checkpoint z DiffAM s výchozími parametry pro cílový model, referenční obrázek a identitu.

Výkon DiffClean ve srovnání se základními modely na úlohách odhadu věku, využívající MiVOLO. Uvedené metriky jsou přesnost klasifikace Minor/Adult, přesnost věkové skupiny a průměrná absolutní chyba (MAE). DiffClean s CLIP věkovou ztrátou dosahuje nejlepších výsledků ve všech metrikách.

Výkon DiffClean ve srovnání se základními modely na úlohách odhadu věku, využívající MiVOLO. Uvedené metriky jsou přesnost klasifikace Minor/Adult, přesnost věkové skupiny a průměrná absolutní chyba (MAE). DiffClean s CLIP věkovou ztrátou dosahuje nejlepších výsledků ve všech metrikách.

Z těchto výsledků autoři uvádějí:

‘[Our] metoda DIFFCLEAN překonává oba referenční modely, CLIP2Protect a DiffAM, a dokáže úspěšně obnovit věkové náznaky narušené make-upem snížením MAE (na 5,71) a zlepšením celkové přesnosti predikce věkové skupiny (na 37 %).

‘Naším cílem byly menší věkové skupiny a výsledky ukazují, že dosahujeme vynikající klasifikace minor vs adult na úrovni 88,6 %.’

Výsledky odstraňování líčení z baseline a navrhovaných metod. Levý sloupec zobrazuje původní obrázky, následující výstupy od CLIP2Protect a DiffAM. Třetí sloupec ukazuje výsledky DiffClean pomocí SSRNet a CLIP‑založené věkové ztráty. Autoři tvrdí, že DiffClean odstraňuje líčení účinněji, vyhýbá se zkreslení funkcí pozorovanému u CLIP2Protect, a odstraňuje zbytky kosmetiky, které DiffAM přehlédl.

Výsledky odstraňování líčení z baseline a navrhovaných metod. Levý sloupec zobrazuje původní obrázky, následující výstupy od CLIP2Protect a DiffAM. Třetí sloupec ukazuje výsledky DiffClean pomocí SSRNet a CLIP‑založené věkové ztráty. Autoři tvrdí, že DiffClean odstraňuje líčení účinněji, vyhýbá se zkreslení funkcí pozorovanému u CLIP2Protect, a odstraňuje zbytky kosmetiky, které DiffAM přehlédl.

Autoři dále poznamenávají, že líčení nemá jednotný vliv na vnímaný věk, ale může věk zvýšit, snížit nebo ponechat beze změny. Proto DiffClean neaplikuje „obecné snížení“ předpovězeného věku, ale snaží se obnovit původní věkové indikátory odstraněním kosmetických stop:

Příklady odstraňování líčení z datasetů CelebA‑HQ a CACD. Každý sloupec ukazuje dvojici obrázků před (vlevo) a po (vpravo) odstranění líčení. V prvním sloupci se po odstranění líčení předpovězený věk sníží; ve druhém zůstane beze změny; ve třetím se zvýší.

Příklady odstraňování líčení z datasetů CelebA‑HQ a CACD. Každý sloupec ukazuje dvojici obrázků před (vlevo) a po (vpravo) odstranění líčení. V prvním sloupci se po odstranění líčení předpovězený věk sníží; ve druhém zůstane beze změny; ve třetím se zvýší.

Aby bylo otestováno, jak dobře DiffClean funguje na nových datech, byl spuštěn na datasetoch BeautyFace a LADN, které obsahují autentické líčení, ale nemají spárované obrázky stejných subjektů bez kosmetiky. Předpovědi věku před a po odstranění líčení byly porovnány, aby se posoudilo, jak efektivně DiffClean snížil zkreslení zavedené líčením:

Výsledky odstraňování líčení na reálných obrázcích z datasetů LADN (levý pár) a BeautyFace (pravý pár). DiffClean snižuje předpovězený věk odstraněním kosmetiky, čímž zužuje rozdíl mezi zdánlivým a skutečným věkem. Bílé číslice ukazují odhadovaný věk před a po zpracování.

Výsledky odstraňování make-upu na reálných snímcích z datasetů LADN (levý pár) a BeautyFace (pravý pár). DiffClean snižuje předpovídaný věk odstraněním kosmetiky, čímž zužuje rozdíl mezi vzhledovým a skutečným věkem. Bílé číslice ukazují odhadované věky před a po zpracování.

Výsledky ukázaly, že DiffClean systematicky zmenšoval rozdíl mezi vzhledem a skutečným věkem. V obou datových sadách snížil chyby přecenění i podcenění o přibližně tři roky v průměru, což naznačuje, že systém se dobře generalizuje na reálné styly kosmetiky.

Závěr

Je zajímavé, a možná i nevyhnutelné, že by se performativní kosmetický make-up používal adversárně. Vzhledem k tomu, že dívky dospívají různou rychlostí, ale systematicky dospívají rychleji jako skupina, může být úkol identifikovat hranici mezi statusy nezletilé a dospělé ženy jedním z nejnáročnějších, jaké si výzkumná scéna doposud stanovila.

Nicméně čas a data mohou nakonec určit konzistentní věkem podmíněné znaky, které lze použít k podpoře vizuálních systémů ověřování věku.

 

* Vzhledem k tomu, že toto téma vyvolává nabité výrazy, a protože termín „dívky“ je vylučující (zatímco „ženy a dívky“, v současnosti přijímaný termín pro osoby ženského pohlaví, není v tomto případě přesný), jsem se rozhodl použít „ženy“ jako nejlepší kompromis, který jsem mohl navrhnout – ačkoliv nepostihuje všechny demografické nuance, za což se omlouvám.

† V tomto článku používám termín „performativní“ k označení make-upu, který má být viditelný a rozpoznatelný jako make-up, například řasenka, oční linka, tvářenka a podkladová báze, na rozdíl od zakrývacích krémů a dalších „skrytých“ druhů kosmetických aplikací.

Poprvé publikováno pátek 18. července 2025

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai