Andersons vinkel
AI-verktøy fjerner sminke for å stoppe mindreårige fra å unngå alderskontroller

Utseendet av ansiktskosmetikk lar mindreårige brukere, hovedsakelig jenter, slippe forbi selvportrettbaserte alderskontroller på plattformer som datingapper og e-handelssteder. Et nytt AI-verktøy løser denne løkken, ved å bruke en diskriminerende modell som er trent til å slette sminke samtidig som identiteten beholdes, og gjør det vanskeligere for mindreårige å lure automatiserte systemer.
Bruken av tredjepartsbaserte, selvportrettbaserte aldersverifiseringstjenester øker, ikke minst på grunn av en generell global impetus mot online aldersbasert verifisering.
For eksempel, i den nye gjennomføringsregimen som Storbritannias Online Safety Act nå pålegger, kan aldersverifisering utføres av en rekke tredjeparts tjenester, som bruker ulike metoder, inkludert visuell aldersverifisering, hvor AI brukes til å forutsi alderen til brukeren (vanligvis fra live mobilkameraopptak). Tjenester som bruker slike metoder inkluderer Ondato, TrustStamp og Yoti.
Imidlertid er aldersestimering ikke feilfritt, og den tradisjonelle bestrebelsen til tenåringer til å forutse rettighetene til voksenhet, betyr at unge mennesker har utviklet en rekke effektive metoder for å komme inn på datingsteder, forum og andre miljøer som forbysder deres aldersgruppe.
En av disse metodene, som oftest brukes av kvinner*, er å bruke ansiktskosmetikk – en taktikk kjent for å lure automatiserte aldersestimeringssystemer, som vanligvis overestimerer alderen til unge mennesker og underestimerer alderen til eldre mennesker.
Ikke bare jenter
Før det oppstår protester mot å vurdere sminke som ‘kvinnefokusert’, må vi merke seg at tilstedeværelsen av ansiktskosmetikk på hvem som helst er en svært upålitelig indikator for kjønn:

I artikkelen ‘Impact of Facial Cosmetics on Automatic Gender and Age Estimation Algorithms’ fant amerikanske forskere at kjønnsverifiseringsystemer ble lurt av kjønnsbyttende sminke. Kilde: https://cse.msu.edu/~rossarun/pubs/ChenCosmeticsGenderAge_VISAPP2014.pdf
I 2024 ble det estimert at 72% av amerikanske mannlige forbrukere i alderen 18-24 inkorporerte sminke i sin grooming-rutine – selv om de fleste bruker kosmetiske produkter for å forbedre utseendet på sunn hud, snarere enn å bruke den type performative mascara/lippenstift-kombinasjoner som er mer forbundet med kvinners visuelle estetikk.
Så vi kan ikke annet enn å behandle det materialet som studeres i denne artikkelen langs linjene med den mest vanlige scenariet som utforskes i ny forskning – det som gjelder kvinnelige mindreårige som bruker sminke for å undergrave automatiserte visuelle aldersverifiseringssystemer.
Effektiv sminkefjerning – Den AI-baserte måten
Forskningen ovenfor kommer fra tre bidragsytere ved New York University, i form av den nye artikkelen DiffClean: Diffusion-basert sminkefjerning for nøyaktig aldersestimering.
Formålet med prosjektet er å oppnå en AI-drevet metode for å fjerne utseendet av sminke fra bilder (potensielt inkludert videobilder), for å få en bedre idé om den faktiske alderen til personen bak sminken.

Fra den nye artikkelen, et eksempel på hvordan sminkefjerning kan påvirke aldersprediksjon. Kilde: https://arxiv.org/pdf/2507.13292
En av utfordringene med å utvikle et slikt system er den potensielle sensitiviteten rundt å samle inn eller kuratere bilder av mindreårige jenter som bruker voksen sminke. Til slutt brukte forskerne en tredjeparts Generative Adversarial Network-basert system kalt EleGANt for å påføre kunstig sminkestiler, en teknikk som viste seg å være svært effektiv:

Tsinghua Universitys 2022 EleGANt-system bruker en Generative Adversarial Network (GAN) for å påføre kosmetikk autentisk på kildebilder. Kilde: https://arxiv.org/pdf/2207.09840
Med hjelp av syntetisk data som er tilegnet på denne måten, og med hjelp av en rekke diverse prosjekter og datasett, var forfatterne i stand til å overgå state-of-the-art-metoder i aldersestimering når de ble konfrontert med performative eller ‘synlige’ sminke.
Artikkelen sier:
‘DiffClean [fjerner] sminkespor ved å bruke en tekststyrt diffusjonsmodell for å forsvare mot sminkeangrep. [Det] forbedrer aldersestimering (minor vs. voksen nøyaktighet med 4,8%) og ansiktsverifisering (TMR med 8,9% ved FMR=0,01%) over sammenlignbare baselinjer på digitalt simulerede og ekte sminkebilder.’
La oss se hvordan de gikk til denne oppgaven.
Metode
For å unngå å samle inn ekte bilder av mindreårige i sminke, brukte forfatterne EleGANt for å påføre syntetisk sminke på bilder fra UTKFace-datasettet, og produserte før- og etter-par for trening.

Eksempler fra UTKFace-datasettet. Kilde: https://susanqq.github.io/UTKFace/
DiffClean ble deretter trent til å reversere denne transformasjonen. Ettersom aldersestimeringsalgoritmer feiler mest når de håndterer yngre aldersgrupper, fant forskerne det nødvendig å utvikle en proxy-alder-klassifikator fine-tuned på målalderne (10-19 år). Til dette formål brukte de SSRNet-arkitekturen trent på UTKFace, med en vektet L1-tap.
En nedskalert versjon av OpenAIs 2021 diffusjonsmodell ga grunnstrukturen for transformasjonen, med at forfatterne beholdt kjernearkitekturen, men modifiserte den med ekstra oppmerksomhets-hoder på ulike oppløsninger, dypere lag og BigGAN-stiler for å forbedre opp- og ned-sampling-stadiene.
Retningsskontroll ble introdusert ved å bruke CLIP-prompts: spesifikt, ansikt med sminke og ansikt uten sminke, så at modellen lærte å bevege seg i den ønskede semantiske retningen, og tillot sminke å bli fjernet uten å kompromittere ansiktsdetaljer, alder-signal eller identitet.

Syntetisk sminke påført ved hjelp av EleGANt. Hver triplet viser det opprinnelige UTKFace-bildet (venstre), referanse-sminkestilen (midten) og resultatet etter stil-overføring (høyre). Sminke-overføring av denne typen er vanlig i computer-vision-litteraturen, og denne fasiliteten er også tilgjengelig i Adobe Photoshops neurale filtre, som kan påføre sminke fra et referansebilde på et målbilde.
Fire nøkkel tap-funksjoner ledet sminkefjerning uten å påvirke ansiktsidentitet eller alder-signal. Foruten den ovennevnte CLIP-baserte tapen, ble identitet beholdt ved å bruke en vektet par av ArcFace-tap, hentet fra InsightFace-biblioteket – tap som målte likheten mellom det genererte ansiktet og både det opprinnelige rene bildet og det ‘sminke-dekorerte’ bildet, og sikret at subjektet forble visuelt konsistent før og etter sminkefjerning.
Tredje, den perceptuelle tapen LPIPS brukte L1-avstand til å påtvinge piksel-nivå-realisme, og beholdt det generelle utseendet på det opprinnelige bildet etter at sminken var fjernet.
Til slutt ble alder overvåket ved å bruke en fine-tuned SSRNet trent på UTKFace-datasettet, med at modellen brukte en glatt L1-tap (med tyngre straffer for feil i aldersgruppen 10-29 år, hvor misklassifisering er mest vanlig). En variant av modellen erstattet dette med en CLIP-basert alder-prompt, som promptet modellen til å matche utseendet på en bestemt alder.
For aldersestimering på inferenstid (i motsetning til å bruke SSRNet på treningstid), ble 2023 MiVOLO-rammeverket brukt.
Data og tester
SSRNet-fine-tuning på UTKFace-datasettet brukte en treningssett på 15 364 bilder, mot en testsett på 6 701 bilder. De opprinnelige 20 000 bildene ble filtrert for å fjerne alle over 70 år, og deretter splittet 70:30.
I henhold til den tidligere metoden etablert av 2023 DiffAM-prosjektet, ble trening utført i to steg, med den første sesjonen som brukte 300 ekte verdens sminkebilder (denne gangen en 200/100-splitning mellom trening og validering) fra BeautyGANs MT-datasett.
Modellen ble deretter forbedret ytterligere ved å bruke 300 ekstra UTKFace-bilder, augmentert med syntetisk sminke via EleGANt. Dette skapte et endelig treningssett på 600 eksempler, parret over fem referanse-stiler fra BeautyGAN. Ettersom sminkefjerning innebærer å kartlegge mange sminkestiler til ett rent ansikt, fokuserte treningen på generell generalisering snarere enn å dekke alle mulige kosmetiske variasjoner.
Ytelse ble evaluert på både syntetiske og ekte verdensbilder. Syntetisk testing brukte 2 556 Flickr-Faces-HQ-datasett (FFHQ)-bilder, jevnt samplet over ni aldersgrupper under 70, og modifisert med EleGANt.
Generalisering ble vurdert ved å bruke 3 000 bilder fra BeautyFace og 355 fra LADN, begge med ekte sminke.

Eksempler fra BeautyFace-datasettet, som viser den semantiske segmenteringen som definerer ulike områder av påvirket ansiktsflate. Kilde: https://li-chongyi.github.io/BeautyREC_files/
Mål og implementering
For mål, brukte forfatterne Gjennomsnittlig absolutt feil (MAE) mellom bakgrunns-sannheten (ekte bilder med faktiske aldre etablert) og de predikerte alder-verdiene, hvor lavere resultater er bedre; alder-gruppe-nøyaktighet ble brukt til å vurdere om predikerte aldre havnet i riktige grupperinger (hvor lavere resultater er bedre); minor/voksen-nøyaktighet ble brukt til å evaluere korrekt identifisering av 18+-personer (hvor høyere resultater er bedre).
I tillegg, selv om det ikke er sentralt for emnet i hånden, rapporterer forfatterne også identitetsverifiserings-mål i form av True Match Rate (TMR) og False Match Rate (FMR), samt ytterligere rapportering av relatert Receiver Operating Characteristic (ROC)-verdier.
SSRNet ble fine-tuned på 64×64px-bilder med en batch-størrelse på 50 under Adam-optimatoren med en vekt-forfall på 1e−4, samt en kosinuss-annealing-scheduler og en læringshastighet på 1e−3 over 200 epoker, med tidlig stopping.
I motsetning til dette, mottok DiffClean-modulen 256×256px-innbildefiler, og ble fine-tuned i fem epoker ved å bruke Adam, med en grovere læringshastighet på 4e−3. Sampling brukte 40 DDIM-inversjons-steg, og 6 DDIM fremover-steg. All trening ble utført på en enkelt NVIDIA A100-GPU (enten med 40GB eller 80GB RAM var ikke spesifisert).
Sammenlignbare systemer som ble testet, var CLIP2Protect og den tidligere nevnte DiffAM. Forfatterne brukte ‘matte’ sminkestiler i arbeidsflyten, da dette har blitt notert i CLIP2Protect som å oppnå en høyere suksessrate (antagelig åpner en mulighet for de som søker å beseire denne tilnærmingen – men det er et spørsmål for en annen gang).
For å replikere DiffAM som en baseline, ble det forhånds-trente modellen fra BeautyGAN fine-tuned på MT-datasettet. For motstående sminke-overføring, ble sjekkpunktet fra DiffAM brukt med standardparametere for målmodellen, referanse-bildet og identiteten.

Ytelse til DiffClean sammenlignet med baselinjer på aldersestimeringsoppgaver, ved å bruke MiVOLO. Mål som rapporteres, er minor/voksen-klassifisering-nøyaktighet, alder-gruppe-nøyaktighet og gjennomsnittlig absolutt feil (MAE). DiffClean med CLIP-alder-tap oppnår de beste resultater over alle mål.
Av disse resultater, sier forfatterne:
‘[Vår] metode DIFFCLEAN overgår begge baselinjene, CLIP2Protect og DiffAM, og kan med hell gjenopprette alder-signalene som ble forstyrret på grunn av sminke, ved å senke MAE (til 5,71) og forbedre den generelle alder-gruppe-prediksjons-nøyaktigheten (til 37%).
‘Vår mål var fokusert på mindreårige aldersgrupper, og resultater indikerer at vi oppnår overlegen minor vs voksen alder-klassifisering på 88,6%.’

Sminkefjerningsresultater fra baseline og foreslåtte metoder. Den venstre kolonnen viser kildebilder, den neste utdata fra CLIP2Protect og DiffAM. Den tredje kolonnen viser resultater fra DiffClean via SSRNet og CLIP-basert alder-tap. Forfatterne hevder at DiffClean fjerner sminke mer effektivt, og unngår funksjons-forvrengning sett i CLIP2Protect, og de residual kosmetiske elementer som DiffAM gikk glipp av.
Forfatterne merker også at sminke ikke har en enhetlig effekt på oppfattet alder, men kan øke, redusere eller forandre den oppfattede alderen til et ansikt. Derfor prøver DiffClean ikke å påføre en ‘blankett-reduksjon’ i predikert alder, men forsøker i stedet å gjenopprette de opprinnelige alder-indikatorene ved å fjerne kosmetiske spor:

Sminkefjernings-eksempler fra CelebA-HQ og CACD-datasettene. Hver kolonne viser et par bilder før (venstre) og etter (høyre) sminkefjerning. I den første kolonnen reduseres den predikerte alderen etter sminkefjerning; i den andre forblir den uendret; og i den tredje øker den.
For å teste hvor godt DiffClean fungerte på nye data, ble det kjørt på BeautyFace- og LADN-datasettene, som inneholder ekte sminke, men ingen par-bilder av samme subjekt uten kosmetikk. Aldersprediksjoner før og etter sminkefjerning ble sammenlignet for å vurdere hvor effektivt DiffClean reduserte forvrengningen introdusert av sminke:

Sminkefjerningsresultater på ekte verdensbilder fra LADN (venstre par) og BeautyFace (høyre par)-datasettene. DiffClean reduserer den predikerte alderen ved å fjerne kosmetikk, og reduserer gapet mellom oppfattet og faktisk alder. Hvite tall viser estimerte aldre før og etter prosessering.
Resultatene viste at DiffClean konsistent reduserte gapet mellom oppfattet og faktisk alder. Over begge datasettene, reduserte det overestimerings- og underestimerings-feilene med omtrent tre år i gjennomsnitt, hvilket antyder at systemet generaliserer godt til ekte verdens kosmetiske stiler.
Konklusjon
Det er interessant, og kanskje uunngåelig, at performative kosmetiske sminke skulle bli brukt på en motstående måte. Gitt at jenter modnes i ulike hastigheter, men konsistent modnes raskere som en gruppe, kan oppgaven med å identifisere skillet mellom mindreårige og voksne kvinner være en av de mest ambisiøse som forskningsscenen har satt seg.
Likevel kan tid og data til slutt avgjøre konsistente alders-relaterte tegn som kan brukes til å forankre visuelle aldersverifiseringssystemer.
* Siden dette emnet inviterer til ladet språk, og siden ‘jenter’ er ekskluderende (mens ‘kvinner og jenter’, den nå akseptable betegnelsen for kvinnelige personer, ikke er en nøyaktig beskrivelse i dette tilfellet), har jeg valgt ‘kvinner’ som den beste kompromissen jeg kunne finne – selv om det ikke fanger alle demografiske nyanser, for hvilket jeg unnskylder.
† I denne artikkelen bruker jeg ‘performative’ for å indikere sminke som er ment å bli sett og gjenkjent som sminke, som for eksempel mascara, eyeliner, blusher og foundation, i motsetning til skjule-krem og andre ‘hemmelige’ typer kosmetiske anvendelser.
Først publisert fredag, 18. juli 2025












