Andersonin kulma
Kasvojen viehätysarvon arvioinnin ennustaminen suoratoistoihin

Kasvojen viehätysarvon ennustaminen (FAP) on pääasiassa tutkittu psykologisen tutkimuksen, kauneus- ja kosmetiikkateollisuuden ja kosmeettisen kirurgian yhteydessä. Se on haasteellinen tutkimusala, sillä kauneuden standardit ovat usein kansallisia eivätkä globaaleja.
Tämä tarkoittaa, että yksikin tehokas AI-pohjainen tietokanta ei ole käytettävissä, koska kaikkien kulttuurien kasvojen/rankingien otosten keskiarvot olisivat hyvin vääristyneitä (jolloin väkirikkaimmat maat saavuttavat lisää vaikutusvaltaa), tai soveltamiskelpoisia mihinkään kulttuuriin (jossa useiden rotujen/rankingien keskiarvo vastaisi oikeasti mihinkään rodun).
Sen sijaan haaste on kehittää konseptuaalisia menetelmiä ja työnkulkuja, joihin voidaan käsitellä maa- tai kulttuurispesifisiä tietoja, jotta voidaan kehittää tehokkaita aluekohtaisia FAP-malleja.
FAP:n käyttötapaukset kauneuden ja psykologisen tutkimuksen aloilla ovat melko marginaalisia, tai teollisuusspesifisiä; siksi useimmat tähän asti kokoamani tietokannat sisältävät vain rajoitetun määrän tietoa, tai eivät ole julkaistu lainkaan.
Helppokäyttöiset online-kauneusennustimet, joista suurin osa on suunnattu länsimaisille yleisöille, eivät välttämättä edusta FAP:n nykytilaa, jota johtavat itäaasialaiset tutkimukset (pääasiassa Kiina), ja vastaavat itäaasialaiset tietokannat.

Esimerkkejä 2020 vuoden tutkimuksesta ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Lähde: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30
Laajemmat kaupalliset sovellukset kauneuden arviointiin sisältävät online-treffeipalvelut ja generatiiviset AI-järjestelmät, jotka on suunniteltu “kosmetisoimaan” oikeiden henkilöiden kuvia (koska tällaiset sovellukset vaativat kvantitoidun kauneuden standardin tehokkuuden mittarina).
Kasvojen piirtäminen
Viehättävät yksilöt ovat edelleen arvokkaita varastoja mainonnassa ja vaikuttamisessa, mikä tekee rahoituksellisista kannustimista näissä aloissa selvän mahdollisuuden FAP-tietokantojen ja -kehysten kehittämiseen.
Esimerkiksi AI-malli, joka on koulutettu todellisen maailman tietojen avulla arvioimaan ja arvioimaan kasvojen kauneutta, voisi potentiaalisesti tunnistaa tapahtumia tai yksilöitä, joilla on suuri potentiaali mainonnassa. Tämä kyky olisi erityisen relevantti live-videostreaming-konteksteissa, joissa metriikka kuten “seuraajat” ja “tykkäykset” palvelevat vain oletusarvoisina osoittimina yksilön (tai jopa kasvotyyppien) kyvylle kerätä yleisöä.
Tämä on pintapuolinen mittari, ja ääni, esitys ja näkökulma myös vaikuttavat yleisön keräämiseen. Siksi FAP-tietokantojen kokoaminen vaatii ihmisen valvontaa sekä kykyä erottaa kasvojen viehätys “epäaidosta” viehätyskästä (jotta voidaan välttää tilanteita, joissa vaikuttajat kuten Alex Jones voivat vaikuttaa FAP-käyrään, joka on tarkoitettu ainoastaan kasvojen kauneuden arvioimiseen).
LiveBeauty
Kiinalaiset tutkijat tarjoavat vastauksen FAP-tietokantojen puutteeseen tarjoamalla ensimmäisen suuren mittakaavan FAP-tietokannan, joka sisältää 100 000 kasvokuvaa ja 200 000 ihmisen arviointia kasvojen kauneudesta.

Esimerkkejä uudesta LiveBeauty-tietokannasta. Lähde: https://arxiv.org/pdf/2501.02509
Tietokanta sisältää 10 000 eri identiteettiä, jotka on kaikki kerätty (määrittelemättömistä) live-streaming-alustoista maaliskuussa 2024.
Tutkijat esittävät myös uuden monimodaalisen FAP-menetelmän, FPEM:n. FPEM yhdistää holistisen kasvojen etukäteistiedon ja monimodaalisen esteettisen semanttiset ominaisuudet henkilökohtaisen viehätyskästä etukäteistiedon kautta, monimodaalisen viehätyskooderin kautta ja ristimodaalisen yhdistämismoduulin kautta.
Tutkimus väittää, että FPEM saavuttaa huipputason suorituskyvyn uudella LiveBeauty-tietokannalla ja muilla FAP-tietokannoilla. Tutkijat huomauttavat, että tutkimuksella on potentiaalisia sovelluksia videon laadun parantamiseen, sisällön suositukseen ja kasvojen korjaamiseen live-streamingissä.
Tutkijat lupaavat myös julkaista tietokannan “pian” – vaikka on myönnettävä, että lähdealueen sisäiset lisenssirajoitukset ovat todennäköisesti siirtymässä useimpiin sovelluksiin, jotka hyödyntävät tutkimusta.
Uusi tutkimus on nimeltään “Facial Attractiveness Prediction in Live Streaming: A New Benchmark and Multi-modal Method”, ja se on tehty kymmenen tutkijan voimin Alibaba Groupista ja Shanghai Jiao Tong Universitysta.
Menetelmä ja data
Tutkijat keräsivät yhden kuvan tunnilta live-streaming-alustoilta ensimmäisten kolmen tunnin aikana. Valittiin lähetykset, joilla oli eniten sivun näyttökertoja.
Kerätty data käsiteltiin useissa esikäsittelyvaiheissa. Ensimmäinen vaihe oli kasvoalueen koon mittaaminen, jossa käytettiin 2018 CPU-pohjaista FaceBoxes-havaintomallia luomaan rajoitusruutu kasvojen piirteille. Työnkulku varmistaa, että rajoitusruudun lyhyempi sivu ylittää 90 pikseliä, välttäen pieniä tai epäselviä kasvoalueita.
Toinen vaihe on sumeen havaitseminen, jota sovelletaan kasvoalueelle käyttämällä Laplace-operaattorin varianssia korkeuskanavassa (Y) kasvokuvausta. Tämä varianssi on oltava suurempi kuin 10, mikä auttaa suodattamaan sumeat kuvat.
Kolmas vaihe on kasvojen asennon arvio, jossa käytetään 2021 3DDFA-V2-asennon arviomallia:

Esimerkkejä 3DDFA-V2-mallista. Lähde: https://arxiv.org/pdf/2009.09960
Työnkulku varmistaa, että leikattujen kasvojen nousu- ja yläkulma eivät ylitä 20 astetta ja 15 astetta, mikä sulkee pois kasvot, joilla on äärimmäiset asennot.
Neljäs vaihe on kasvojen suhteen arviointi, jossa myös käytetään 3DDFA-V2-mallin segmentointiominaisuuksia, varmistaen, että leikattu kasvoalue on suurempi kuin 60 % kuvasta, sulkiessa kuvat, joissa kasvot eivät ole merkittäviä.
Lopulta viides vaihe on kaksoiskappaleiden poistaminen, jossa käytetään (tunnistamatonta) huipputason kasvontunnistusmallia, tapauksissa, joissa sama identiteetti esiintyy useammin kuin yksi kolmesta kerätystä kuvasta.
Ihmisen arviointi ja annotointi
Kaksikymmentä annotoijaa rekrytoitiin, joista kuusi oli miehiä ja 14 naisia, heijastellen live-alustan demografiaa*. Kasvot näytettiin 6,7 tuuman näytöllä iPhone 14 Pro Max -laitteessa, samanlaisissa laboratorio-olosuhteissa.
Arviointi jaettiin 200 istuntoon, joista kussakin oli 50 kuvaa. Koehenkilöiltä pyydettiin arvioimaan kasvojen viehätysarvoa asteikolla 1-5, ja heille annettiin viiden minuutin tauko jokaisen istunnon välillä, ja kaikki koehenkilöt osallistuivat kaikkiin istuntoihin.
Täten koko 10 000 kuvan joukko arvioitiin kahdensadan ihmisen toimesta, ja saatiin 200 000 annotaatiota.
Analyysi ja esikäsittely
Ensimmäinen vaihe oli koehenkilöiden jälkeen suoritettu poissulkeminen, jossa käytettiin poikkeama-suhdetta ja Spearmanin rangauskorrelaatiokerrointa (SROCC). Koehenkilöt, joiden arviot olivat SROCC-arvoltaan alle 0,75 tai poikkeama-suhteelta yli 2 %, tulvatettiin epäluotettaviksi ja poistettiin, ja lopputuloksena saatiin 20 koehenkilöä..
Kunkin kasvokuvan keskiarvo arvioitiin laskemalla keskiarvo validien koehenkilöiden arvioista. Keskiarvo toimii kasvojen viehätysarvon “todellisena” arvona, ja se lasketaan keskiarvoistamalla kaikki yksittäiset arviot kustakin validista koehenkilöstä.
Lopulta analyysi keskiarvojen jakautumisesta kaikissa näytteissä, sekä nais- ja miesnäytteissä, osoitti, että ne seuraavat gaussilaista jakautumista, mikä on yhdenmukainen todellisten kasvojen viehätysarvojen jakautumisen kanssa:

Esimerkkejä LiveBeauty-keskiarvojen jakautumisesta.
Useimmat yksilöt ovat keskivertaisen kasvojen viehätysarvon omaavia, ja vähemmän yksilöitä on äärimmäisissä arvoissa, joilla on hyvin alhainen tai hyvin korkea viehätysarvo.
Lisäksi analyysi vinous- ja kurtosis-arvoista osoitti, että jakautumiset olivat ohuita ja keskittyneitä keskiarvoon, ja että korkea viehätysarvo oli yleisempää naisten näytteissä kerätyissä live-videoklippeissä.
Arkkitehtuuri
Kaksi vaihetta kestävä koulutusstrategia käytettiin FPEM-mallille ja LiveBeauty-mallille, jaettuna neljään moduuliin: henkilökohtaiseen viehätyskästä etukäteistietomoduuliin (PAPM), monimodaaliseen viehätyskooderin moduuliin (MAEM), ristimodaaliseen yhdistämismoduuliin (CMFM) ja päätösmuodostusmoduuliin (DFM).

Käsitteellinen schema LiveBeauty-koulutusprosessille.
PAPM-moduuli ottaa kuvan syötteenä ja poimii moniaikaisia visuaalisia ominaisuuksia Swin Transformerilla, ja poimii myös kasvojen tietoisia ominaisuuksia esikoulutetulla FaceNet-mallilla. Nämä ominaisuudet yhdistetään ristihuomio-lohkolla, jotta voidaan luoda henkilökohtainen “viehätys” -ominaisuus.
MAEM-moduuli käyttää kuvaa ja kauneuden tekstikuvausta, ja hyödyntää CLIP:ia monimodaalisten esteettisten semanttisten ominaisuuksien poimimiseen.
Tekstikuvausten muoto on “{a} kauneuden kuvaus” (jossa {a} voi olla “huono”, “heikko”, “tyydyttävä”, “hyvä” tai “täydellinen”). Prosessi arvioi kosini- yhtäläisyyden tekstuaalisen ja visuaalisen upotusten välillä, jotta voidaan saada kauneuden taso todennäköisyys.
Hybridifusio-vaiheessa CMFM tarkentaa tekstiupotuksia henkilökohtaisen viehätyskästä etukäteistiedosta, jotta voidaan luoda henkilökohtaiset tekstiupotukset. Sitten se käyttää samankaltaisuusregressiostrategiaa tekemään ennustus.
Lopulta DFM yhdistää yksittäiset ennustukset PAPM:stä, MAEM:stä ja CMFM:stä, jotta voidaan tuottaa yksi lopullinen viehätysarvo, tavoitteena vankka konsensus.
Häviöfunktiot
Häviöfunktioiden osalta PAPM koulutetaan L1-häviöfunktiolla, joka on absoluuttinen ero ennustetun viehätysarvon ja todellisen (todellisen) viehätysarvon välillä.
MAEM-moduuli käyttää monimutkaisempaa häviöfunktiota, joka yhdistää pistehäviön (LS) ja yhdistetyn ranking-häviön (LR). Ranking-häviö (LR) koostuu uskollisuushäviöstä (LR1) ja kaksisuuntaisesta ranking-häviöstä (LR2).
LR1 vertaa kuvaparien suhteellista viehätysarvoa, kun taas LR2 varmistaa, että ennustettu todennäköisyysjakauma viehätysarvojen tasolla on yksihuippuinen ja laskee molemmilla puolilla, tavoitteena optimoida sekä tarkka pistehäviö että oikea ranking kuvien viehätysarvon perusteella.
CMFM ja DFM koulutetaan yksinkertaisella L1-häviöllä.
Testit
Testeissä tutkijat asettivat LiveBeauty-nimisen kilpailijan yhdeksää aiempaa lähestymistapaa vastaan: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (joka on esitetty REX-INCEP:ssä); MEBeauty; AVA-MLSP; TANet; Dele-Trans; ja EAT.
Lisäksi testattiin Image Aesthetic Assessment (IAA) -menetelmiä, jotka noudattavat tiettyä päättömenetelmää. Nämä olivat ViT-B; ResNeXt-50; ja Inception-V3.
Kuvat, joissa oli LiveBeauty, MEBeauty ja SCUT-FBP5500, jaettiin 60-40 % ja 80-20 % koulutukseen ja testaamiseen erikseen, jotta voidaan säilyttää alkuperäinen päättömenetelmä.
LiveBeauty jaettiin 90-10 %:een.
Mallin alkuarvo MAEM:lle oli VT-B/16 ja GPT-2, jotka oli alkuarvoistettu CLIP:in asetuksilla. PAPM:lle käytettiin Swin-T:ä koulutettavana kuvakooderinä, joka on yhdenmukainen SwinFace:n kanssa.
AdamW-optimointi käytettiin, ja oppimisnopeuden aikataulu asetettiin lineaariseen lämmittelyyn kosinen annealing -suunnitelman mukaisesti. Oppimisnopeudet erosivat koulutusvaiheittain, mutta jokaisella vaiheella oli 32:n kokoinen erä ja 50 epochia.

Tulokset testeistä
Tutkimuksessa todetaan, että ehdotettu menetelmä saavuttaa ensimmäisen sijan ja ylittää toisen sijan noin 0,012, 0,081, 0,021 SROCC-arvoissa LiveBeauty-, MEBeauty- ja SCUT-FBP5500-tietokannoissa, mikä osoittaa ehdotetun menetelmän ylemmän tasoisuuden.
Tutkimuksessa myös todetaan, että IAA-menetelemät ovat heikompia kuin FAP-menetelemät, mikä osoittaa, että yleiset esteettiset arviointimenetelmät jättävät huomiotta kasvojen piirteet, jotka ovat mukana kasvojen viehätysarvon subjektiivisessa luonteessa, johtaen heikkoon suorituskykyyn FAP-tehtävissä.
Eettiset huomioonotot
Kauneuden tutkimus on potentiaalisesti jakautunut tavoite, koska tällaiset järjestelmät ovat taipuvaisia vahvistamaan ja ylläpitämään puolueellisia ja vinoutuneita näkemyksiä kauneudesta. Nämä arviot voivat johtua joko ihmisten johtamista annotaatioista – usein suoritettuina mittakaavoilla, jotka ovat liian rajoitetut tehokkaalle toimialueen yleistettävyydelle – tai tarkastelemalla huomioon ottamisen malleja online-ympäristöissä, kuten suoratoistopalveluissa, jotka ovat, väittäen, kaukana olevia meritokraattisista.












