Andersons vinkel
Estimering av ansiktsattraktivitet for direktesendinger

Hittil har Facial Attractiveness Prediction (FAP) hovedsakelig vært studert i sammenheng med psykologisk forskning, i skjønnhets- og kosmetikkindustrien og i sammenheng med kosmetisk kirurgi. Dette er et utfordrende studiefelt, siden skjønnhetsstandarder tenderer til å være nasjonale fremfor globale.
Dette betyr at ingen enkelt effektiv AI-basert datasett er brukbart, fordi gjennomsnittsverdiene som er samlet fra ansikter og vurderinger fra alle kulturer ville være svært forvrengt (hvor mer folkerike nasjoner ville få ekstra grep), eller anvendelige på ingen kultur (hvor gjennomsnittsverdiene av flere raser og vurderinger ville være lik med ingen faktisk rase).
I stedet er utfordringen å utvikle konseptuelle metoder og arbeidsflyter som land- eller kultursspesifikke data kan prosesseres i, for å muliggjøre utvikling av effektive per-region FAP-modeller.
Anvendelsesområdene for FAP i skjønnhets- og psykologisk forskning er ganske marginale, eller bransjespesifikke; derfor inneholder de fleste datasettene som er kuratert hittil bare begrenset data, eller har ikke blitt publisert i det hele tatt.
Den lette tilgjengeligheten av online attraktivitetsprediktorer, hovedsakelig rettet mot vestlige publikum, representerer ikke nødvendigvis tilstanden for FAP, som ser ut til å være dominert av østasiatisk forskning (primært Kina), og tilhørende østasiatiske datasett.

Datasette eksempler fra 2020-papiret ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Kilde: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30
Brodere kommersielle anvendelser for skjønnhetsvurdering inkluderer online dating-applikasjoner og generative AI-systemer designet for å ‘retusjere’ virkelige avatarbilder av mennesker (siden slike applikasjoner krever en kvantifisert skjønnhetsstandard som en målestokk for effektivitet).
Tegning av ansikter
Attraktive individer er fortsatt en verdifull ressurs i reklame og påvirkningsbygging, og det finansielle incitamentet i disse sektorene er en klar mulighet for å fremme state-of-the-art FAP-datasett og -rammeverk.
For eksempel kunne en AI-modell trent med virkelige data for å vurdere og rangere ansiktskvaliteter potensielt identifisere hendelser eller individer med høy potensiale for reklamevirkning. Denne evnen ville være spesielt relevant i live videostrømmingskontekster, hvor målinger som ‘følgere’ og ‘likes’ for tiden bare tjener som implisitte indikatorer på en individs (eller selv en ansiktstyps) evne til å fange en publikums oppmerksomhet.
Dette er en overflatisk målestokk, og stemme, presentasjon og synspunkt spiller også en betydelig rolle i publikumssamling. Derfor krever kurering av FAP-datasett menneskelig tilsyn, samt evnen til å skille ansikts- fra ‘spekios’ attraktivitet (uten hvilket, utenfor-domene påvirkere som Alex Jones kunne ende opp med å påvirke den gjennomsnittlige FAP-kurven for en samling designet kun for å estimere ansiktskvalitet).
LiveBeauty
For å møte mangelen på FAP-datasett, tilbyr forskere fra Kina det første store FAP-datasettet, som inneholder 100 000 ansiktsbilder, sammen med 200 000 menneskelige annotasjoner som estimerer ansiktskvalitet.

Eksempler fra det nye LiveBeauty-datasettet. Kilde: https://arxiv.org/pdf/2501.02509
Det nye datasettet, kalt LiveBeauty, inneholder 10 000 forskjellige identiteter, alle fanget fra (uspesifiserte) live-strømmingsplattformer i mars 2024.
Forfatterne presenterer også FPEM, en ny multi-modal FAP-metode. FPEM integrerer holistisk ansiktskunnskap og multi-modal estetisk funksjoner via en Personlig Attractiveness Prior Module (PAPM), en Multi-modal Attractiveness Encoder Module (MAEM) og en Cross-Modal Fusion Module (CMFM).
Papiret hevder at FPEM oppnår state-of-the-art-ytelse på det nye LiveBeauty-datasettet og andre FAP-datasett. Forfatterne bemerker at forskningen har potensielle anvendelser for å forbedre video kvalitet, innholdsanbefalinger og ansiktsretusjering i live-strømming.
Forfatterne lover også å gjøre datasettet tilgjengelig ‘snart’ – selv om det må innrømmes at alle lisensbegrensninger som er innebygget i kilde-domenen sannsynligvis vil bli overført til de fleste prosjekter som kan bruke arbeidet.
Det nye papiret heter Facial Attractiveness Prediction in Live Streaming: A New Benchmark and Multi-modal Method og kommer fra ti forskere over hele Alibaba Group og Shanghai Jiao Tong University.
Metode og data
Fra hver 10-timers sending fra live-strømmingsplattformene, samlet forskerne ett bilde per time for de første tre timene. Sendinger med de høyeste sidevisningene ble valgt.
De samlede data ble deretter underlagt flere forbehandlingsfaser. Den første av disse er ansiktsregionstørrelsesmåling, som bruker 2018 CPU-basert FaceBoxes-deteksjonsmodell for å generere en avgrensningsboks rundt ansiktslinjementene. Pipeline-sikrer at avgrensningsboksens kortere side overstiger 90 piksler, og unngår små eller uklare ansiktsregioner.
Den andre fasen er uskarphetsdeteksjon, som brukes på ansiktsregionen ved å bruke variansen av Laplacian-operatoren i høydekanalen (Y) av ansiktskroppen. Denne variansen må være større enn 10, hvilket hjelper til å filtrere ut uskarpe bilder.
Den tredje fasen er ansiktsposisjonsestimering, som bruker 2021 3DDFA-V2-posisjonsestimeringsmodell:

Eksempler fra 3DDFA-V2-estimeringsmodellen. Kilde: https://arxiv.org/pdf/2009.09960
Her sikrer arbeidsflyten at pitch-vinkelen til den avkortede ansiktet ikke er større enn 20 grader, og yaw-vinkelen ikke større enn 15 grader, hvilket ekskluderer ansikter med ekstreme posisjoner.
Den fjerde fasen er ansiktsproporsjonsvurdering, som også bruker segmenteringsfunksjonene til 3DDFA-V2-modellen, og sikrer at den avkortede ansiktsregionen er større enn 60 % av bildet, og ekskluderer bilder hvor ansiktet ikke er fremtredende. dvs. små i hele bildet.
Til slutt er den femte fasen duplikat-figur-fjerning, som bruker en (uattribert) state-of-the-art ansiktsgjenkjenningsmodell, for tilfeller hvor samme identitet opptrer i mer enn ett av de tre bildene som er samlet for en 10-timers video.
Menneskelig vurdering og annotering
Tjue annotatorer ble rekruttert, bestående av seks menn og 14 kvinner, som reflekterer demografien til live-plattformen som ble brukt*. Ansikter ble vist på 6,7-tommers skjermen til en iPhone 14 Pro Max, under konsistente laboratorieforhold.
Vurderingen ble delt over 200 sesjoner, hver av dem med 50 bilder. Fagpersoner ble bedt om å vurdere ansiktsattraktiviteten til eksemplene på en skala fra 1 til 5, med en fem-minutters pause tvungen mellom hver sesjon, og alle fagpersoner deltok i alle sesjoner.
Derfor ble hele de 10 000 bildene vurdert over tjue menneskelige fagpersoner, og resulterte i 200 000 annotasjoner.
Analyse og forbehandling
Først ble fagpersonenes vurdering gjennomført ved hjelp av outlier-forhold og Spearman’s Rank Correlation Coefficient (SROCC). Fagpersoner hvis vurderinger hadde en SROCC på mindre enn 0,75 eller en outlier-forhold på mer enn 2 % ble ansett som upålitelige og fjernet, og 20 fagpersoner ble til slutt oppnådd.
En gjennomsnittlig meningsscore (MOS) ble deretter beregnet for hvert ansiktsbilde, ved å gjennomsnittle vurderingene fra de gyldige fagpersonene. MOS tjener som ground truth-attraktivitetslabel for hvert bilde, og scoren blir beregnet ved å gjennomsnittle alle de enkelte vurderingene fra hver gyldig fagperson.
Til slutt indikerte analysen av MOS-fordelingene for alle eksemplene, samt for kvinnelige og mannlige eksempler, at de viste en Gaussian-stil-form, som er konsistent med virkelige ansiktsattraktivitetsfordelinger:

Eksempler på LiveBeauty MOS-fordelinger.
De fleste individer har gjennomsnittlig ansiktsattraktivitet, med færre individer på ytterpunktene av svært lav eller svært høy attraktivitet.
Ytterligere analysen av skjevhet og kurtose-verdier viste at fordelingene var karakterisert av tynne haler og konsentrert rundt gjennomsnittsscoren, og at høy attraktivitet var mer vanlig blant kvinnelige eksempler i de samlede live-strømmingsvideoene.
Arkitektur
En to-trinns treningsstrategi ble brukt for Facial Prior Enhanced Multi-modal-modellen (FPEM) og Hybrid Fusion-fasen i LiveBeauty, delt over fire moduler: en Personlig Attractiveness Prior Module (PAPM), en Multi-modal Attractiveness Encoder Module (MAEM), en Cross-Modal Fusion Module (CMFM) og en avgjørelse-fusjonsmodul (DFM).

Konseptuell skjema for LiveBeauty-treningspipeline.
PAPM-modulen tar et bilde som inndata og trekker ut multi-skala visuelle funksjoner ved hjelp av en Swin Transformer, og trekker også ut ansikts-orienterte funksjoner ved hjelp av en forhånds-trent FaceNet-modell. Disse funksjonene kombineres deretter ved hjelp av en cross-attention-blokk for å skape en personlig ‘attraktivitets’-funksjon.
Også i den preliminære treningsfasen bruker MAEM et bilde og tekstbeskrivelser av attraktivitet, og utnytter CLIP for å trekke ut multi-modal estetisk-semantiske funksjoner.
Den malte tekstbeskrivelsen er på formen ‘et bilde av en person med {a} attraktivitet’ (hvor {a} kan være dårlig, svak, rettferdig, god eller perfekt). Prosessen estimerer kosin-ligningen mellom tekstlige og visuelle innkapslinger for å nå en attraktivitetsnivå-sannsynlighet.
I Hybrid Fusion-fasen refinerer CMFM tekstlige innkapslinger ved hjelp av den personlige attraktivitetsfunksjonen generert av PAPM, og genererer deretter personlige tekstlige innkapslinger. Den bruker deretter en ligningsregresjon-strategi for å gjøre en prediksjon.
Til slutt kombinerer DFM de enkelte prediksjonene fra PAPM, MAEM og CMFM for å produsere en enkelt, sluttfaktor for attraktivitet, med målet om å oppnå en solid konsensus.
Tap-funksjoner
For tap-mål, blir PAPM trent ved hjelp av en L1-tap, en måling av den absolutte forskjellen mellom den forutsagte attraktivitetsscoren og den faktiske (ground truth) attraktivitetsscoren.
MAEM-modulen bruker en mer komplisert tap-funksjon som kombinerer en scoring-tap (LS) med en sammenslått rangering-tap (LR). Rangering-tapen (LR) består av en trofasthet-tap (LR1) og en to-retning-rangering-tap (LR2).
LR1 sammenligner den relative attraktiviteten til bildepar, mens LR2 sikrer at den forutsagte sannsynlighetsfordelingen av attraktivitetsnivåer har en enkelt topp og avtar i begge retninger. Denne kombinasjonsmetoden sikrer både nøyaktig scoring og riktig rangering av bilder basert på attraktivitet.
CMFM og DFM blir trent ved hjelp av en enkel L1-tap.
Tester
I tester, stilte forskerne LiveBeauty mot ni tidligere tilnærminger: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (presentert i REX-INCEP); MEBeauty; AVA-MLSP; TANet; Dele-Trans; og EAT.
Referansemålinger som samsvarer med en Image Aesthetic Assessment (IAA)-protokoll, ble også testet. Disse var ViT-B; ResNeXt-50; og Inception-V3.
Foruten LiveBeauty, ble også andre datasett testet: SCUT-FBP5000 og MEBeauty. Under følger en sammenligning av MOS-fordelinger for disse datasettene:

MOS-fordelinger for benchmark-datasettene.
Disse gjest-datasettene ble delt 60%-40% og 80%-20% for trening og testing, hver for seg, for å opprettholde konsistens med deres opprinnelige protokoller. LiveBeauty ble delt på en 90%-10%-basis.
For modell-initiering i MAEM, ble VT-B/16 og GPT-2 brukt som bilde- og tekst-encodere, henholdsvis, initiert av innstillinger fra CLIP. For PAPM ble Swin-T brukt som en treningbar bilde-encoder, i samsvar med SwinFace.
AdamW-optimalisatoren ble brukt, og en læringshastighet– planlegger ble satt med lineær oppvarming under en kosin-avkling-plan. Læringshastigheter varierte over treningsfasene, men hver hadde en batch-størrelse på 32, for 50 epoker.

Resultater fra tester
Resultatene fra tester på de tre FAP-datasettene vises ovenfor. Av disse resultatene, sier papiret:
‘Vår foreslåtte metode oppnår førsteplassen og overgår andreplassen med omtrent 0,012, 0,081, 0,021 i SROCC-verdier på LiveBeauty, MEBeauty og SCUT-FBP5500, henholdsvis, hvilket demonstrerer overlegenheten til vår foreslåtte metode.
‘IAA-metodene er underlegne FAP-metodene, hvilket viser at generiske estetiske vurderingsmetoder overser ansiktsfunksjoner involvert i den subjektive naturen til ansiktsattraktivitet, og fører til dårlig ytelse på FAP-oppdrag.’
‘Ytelsen til alle metoder synker betydelig på MEBeauty. Dette skyldes at trenings-eksemplene er begrenset og at ansiktene er etnisk mangfoldige i MEBeauty, hvilket indikerer at det er en stor variasjon i ansiktsattraktivitet.
‘Alle disse faktorene gjør prediksjonen av ansiktsattraktivitet i MEBeauty mer utfordrende.’
Etiske overveielser
Forskning på attraktivitet er et potensielt splittende foretak, siden etableringen av såkalte empiriske skjønnhetsstandarder vil tendere til å forsterke fordommer rundt alder, rase og mange andre aspekter av datavitenskap i forhold til mennesker.
Det kan hevdes at et FAP-system er innebygget forutbestemt til å forsterke og videreføre partielle og fordomsfulle perspektiver på attraktivitet. Disse vurderingene kan oppstå fra menneske-ledede annotasjoner – ofte gjennomført på skalaer som er for små for effektiv domæne-genereralisering – eller fra å analysere oppmerksomhetsmønster i nettbaserte miljøer som strømmingsplattformer, som kan være langt ifra å være meritokratiske.
* Papiret henviser til den ubestemte kilde-domen(e) i både entall og flertall.
Først publisert onsdag, 8. januar 2025












