Andersonin kulma

Tekoäly ja kauneuden metsästys

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
AI-generated image featuring a woman whose face is being analyzed by a Terminator-style HUD. GPT-1.5.

Uusi tekoälypohjainen kauneuden arviointijärjestelmä arvioi, miten viehättäviä kasvot näyttävät, ja kouluttaa nopeammin kuin tyypilliset syvät oppimismallit, mikä mahdollistaa suurempien automaattisten kauneuspisteytysten toteuttamisen.

 

Kasvojen kauneuden ennustaminen (FBP) on suuri liike, ja vahva tutkimusaihe. Vaikka se rikkoo käytännössä jokaisen tekolyön ja koneoppimisen harjoitusten taustalla olevan puolueettomuuden, ja vaikka se usein tukee naisten objektiivisuutta ja reduktionismia algoritmisten havaintojen kannalta, se kuitenkin kiinnostaa useita monien miljardien dollarien arvosta teollisuutta, joista suurin osa on suunnattu suoraan naisille, kuten kosmetiikka, kosmeettinen kasvojen kirurgia, livestreaming ja muoti, muun muassa:

Naiset arvioidaan 1-5, tutkimuksesta “Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion”. Lähde

Näiden ilmeisten naiskeskeisten liiketoimintojen lisäksi mainonta ja useat muut teollisuudet, kuten viihde ja julkaisut, ovat merkittäviä osapuolia ymmärtäessään, mitä sekä miehet että naiset pitävät “viehättävänä”, välttämättä kulttuurikohtaisesti.

Se, että kauneuden yhteiset havainnot vaihtelevat alueittain, tarkoittaa, että ei voida saavuttaa minkäänlaista yleispätevää, maailmanlaajuista tietokantaa, ja että uudet tutkimukset on joko pidettävä paikallisina tai keskityttävä “korkean tason” menetelmiin, jotka voidaan soveltaa erilaisiin kulttuuridatamääriin.

Kasvojen kauneuden arviointijärjestelmän liittymä 2015 SCUT-FBP-projektissa. Lähde - https://arxiv.org/pdf/1511.02459

Kasvojen kauneuden arviointijärjestelmän liittymä 2015 SCUT-FBP-projektissa. Lähde

Usein maantieteellinen sijainti ei ole ainoa rajoitus, sillä viehättävyyttä koskevat tietokannat voivat kamppailla tasapuolisuuden kanssa sukupuolten tai soveltamisen suhteen, ja tämä voi rajoittaa kokoelman käyttöä muissa aloissa.

Esimerkiksi vuonna 2025 raportoin 100 000+ identiteetin kehittämisestä viehättävyyden arviointiin livestreamingissä, jonka lähikuvat vaativat merkittävää sopeutumista laajempiin projekteihin, huolimatta aloitteesta tehdystä valtavasta työstä.

Kasvojen tulkinta

Kuten yllä olevista linkeistä ja kuvista voidaan havaita, aasialaiset tutkimuslaitokset eivät usein toimi samojen kulttuurirajoitusten alaisina kuin länsimaiset vastineensa, jotka olisivat vaikeasti yrittäneet julkaista tieteellistä kuvaa, jossa viisi länsimaista naista on arvioitu viehättävyydeltään 1-5, kuten edellä mainitussa tutkimuksessa.

Voidaan väittää, että kun aasialaisperäiset järjestelmät ovat osoittautuneet tehokkaiksi julkisesti ilman paikallista kritiikkiä, länsimaiset edut voivat käyttää tai soveltaa tällaista tutkimusta omiin yksityisiin sovelluksiin. Tehtävä “naisten arviointi” siirretään siis paikkaan, jossa sitä voidaan harjoittaa ilman kritiikkiä.

Vaikka tämä on yleinen vai onko vähemmän julkistettuja länsimaisia vastineita, jotka kehittävät vastaavia järjestelmiä avoimen yhteistyön ja julkisen tarkastelun ulottumattomissa, on luonnollista olettaa, että kohde on maailmanlaajuinen kiinnostus, johtuen suuresta määrää ammattimaisia sektoreita, jotka voivat hyötyä tarkoista viehättävyyden arvioista.

Luonnonvalinta

Näyttää siltä, että massiiviset verkosta poimittavat korpukset, kuten Tik Tok, Instagram ja YouTube, olisivat erinomaisia kauneuden arviointimenetelmiä, korreloimalla seuraajia, tykkäyksiä ja liikennettä viehättävyyteen, koska tämä on yleinen ja järkevä yhdistäminen (vaikka joillakin poikkeuksilla).

Vastaavasti olemassa olevat kokoelmat, kuten ImageNet ja LAION, jotka esittävät näyttelijöitä ja malleja, jotka “nousivat huipulle”, sisältävät yleensä viehättäviä yksilöitä (vaikka usein liian vähän tietoja liian monista ihmisistä), mikä mahdollistaa laajempien kulttuuristen mekanismien toimimisen viehättävyyden välikappaleena.

Kuitenkin tämä ei ota huomioon muuttuvia makuja siinä, mitä ihmiset pitävät viehättävänä ajassa (puhumattakaan maantieteellisesti). Siksi jälleen tarvitaan korkean tason ja data-agnostisia järjestelmiä, eikä yksittäisiä ja epäilyttäviä kokoelmia tai kuraatteja, jotka eivät pysty heijastamaan muuttuvia makuja.

Yhdistetty iho

Viimeisin akateeminen osallistuja, joka ottaa vastaan nämä haasteet, tulee Kiinasta, jossa siirrosoppi ja Laaja Oppimisjärjestelmä (BLS) yhdistyvät ratkaisemaan pitkään jatkunutta tasapainoa tarkkuuden ja laskennallisen kustannuksen välillä.

Perinteiset neuroverkkomallit saavuttavat yleensä vahvat tulokset vain raskaiden koulutusten avulla, kun taas kevyemmät järjestelmät, kuten BLS, koulutetaan nopeasti, mutta kamppailevat yksityiskohtien saavuttamisessa. Uusi tutkimus siltaa tämän aukon käyttämällä esikoulutettua visuaalista mallia kasvojen piirteiden poimimiseen, jotka sitten välitetään nopeaan BLS-pohjaiseen järjestelmään arviointia varten, mikä mahdollistaa piirteiden uudelleenkäytön oppimisen sijasta ja pitää koulutuksen tehokkaana:

LSAFBD-tietokannan näytekuvat, joissa naisten kasvot on ryhmitelty ihmisarvioijien antamien kauneuspisteiden mukaan asteikolla 1-5, joissa arviot on johdettu useista annotaattoreista ja käytetty valvottuina merkintöinä kasvojen kauneuden ennustamisen koulutuksessa ja arvioinnissa eri asentojen, valaistuksen ja ulkonäön muunnelmien yli.

LSAFBD-tietokannan näytekuvat, joissa naisten kasvot on ryhmitelty ihmisarvioijien antamien kauneuspisteiden mukaan asteikolla 1-5. Lähde

Tutkimuksessa esitellään kaksi varianttia: E-BLS, joka välittää piirteet suoraan kevyelle BLS-järjestelmälle, ja ER-BLS, joka lisää yksinkertaisen välimuodon, joka standardisoi ja hienostaa piirteitä ennen arviointia, mikä parantaa järjestelmän yleistettävyyttä eri kuvissa esiintyvien häiriöiden ja epävakaiden olosuhteiden suhteen.

Tutkimuksen tulokset osoittavat, että E-BLS paransi tarkkuutta 65,85 prosentista 73,13 prosenttiin, kun taas ER-BLS saavutti 74,69 prosentin tarkkuuden, joka ylitti kaikki vertailumallit. Koulutusaika säilyi huomattavasti alempana kuin syvien CNN-mallien, noin 1 300 sekuntia, verrattuna useisiin tuhansiin tai jopa yli 25 000 sekuntiin.

Menetelmä

Mainittu Laaja Oppimisjärjestelmä on kevyt vaihtoehto syville neuroverkkomalleille, joka ohittaa useiden kerrosten pinottamisen ja sen sijaan levittää oppimisen laajaan joukkoon yksinkertaisia yhteyksiä, mikä mahdollistaa nopean koulutuksen – mutta yleensä kustannuksella tarkkuuden suhteen.

E-BLS-yhdistää EfficientNet-pohjaisen siirrosopin BLS:ään, jossa kasvojen yksityiskohtaiset visuaaliset piirteet poimitaan ja välitetään BLS:lle, jolloin lopullinen ennuste voidaan tehdä ilman koko syvän neuroverkkomallin koulutusta alusta alkaen:

E-BLS-mallin arkkitehtuuri, jossa kasvokuvat välitetään esikoulutetun EfficientNet-ominaisuuspoimijan kautta, jonka parametriksi on siirretty ImageNetistä ja pidetty kiinni, ennen kuin tuloksena olevat ominaisuuskartat välitetään Broad Learning Systemiin (BLS), jossa ominaisuussolmut ja vahvistussolmut yhdistetään koulutettavien painotusten kautta lopulliseen kasvojen kauneuspisteeseen.

E-BLS-mallin arkkitehtuuri.

EfficientNet, joka on esikoulutettu ImageNet-1k:ssa ja pääosin pidetty muuttumattomana, muuttaa jokaisen syötteen kuvan tiiviiksi joukoksi ominaisuusarvoja, jotka kuvaavat kasvoja järjestelmällisellä tavalla, kun taas BLS käsittelee näitä arvoja yksinkertaisten, satunnaisesti yhdistettyjen solmujen verkoston kautta, joka muuttaa ja yhdistää tietoa ennen lopullisen viehättävyyden arviointia.

Koska BLS ei riipu syvistä kerroksellisista rakenteista, E-BLS voidaan päivittää lisäämällä solmuja ilman koko järjestelmän uudelleenkoulutusta. Tämä pitää koulutuksen nopeana ja helpottaa mallin parantamista, kun uusia tietoja esitetään.

Toinen variantti, ER-BLS, laajentaa E-BLS:ää lisäämällä yksinkertaisen välimuodon EfficientNet-ominaisuuspoimijan ja BLS:n välille, jolla parannetaan piirteiden valmistelua ennen arviointia:

ER-BLS-mallin arkkitehtuuri, jossa kasvokuvat käsitellään esikoulutetun EfficientNet-ominaisuuspoimijan kautta, ja sitten jalostetaan yhteyden kautta, jossa käytetään poolingia, normalisointia ja radiaalipohjaisen funktion (RBF) muunnosta. Tuloksena oleva tulos välitetään sitten Broad Learning Systemiin (BLS), josta saadaan lopullinen kasvojen kauneuspiste.

ER-BLS-mallin arkkitehtuuri.

Sen sijaan, että suorasti välitetään EfficientNetin raakapiirteitä BLS:lle, ER-BLS välittää ne ensin jalostuskerroksen kautta, joka standardisoi ja muotoilee datan, mikä auttaa vähentämään häiriöitä ja tekee piirteistä yhdenmukaisempia eri kuvissa. Tämä askel on suunniteltu parantamaan järjestelmän yleistettävyyttä, erityisesti kun kasvot vaihtelevat valaistuksessa, asennossa tai muissa visuaalisissa olosuhteissa, jotka voivat muuten aiheuttaa epävakautta arvioissa.

Jalostetut piirteet välitetään sitten samaan BLS-rakenteeseen kuin E-BLS:ssä, jossa ominaisuus- ja vahvistussolmut yhdistetään koulutettavien painotusten kautta lopulliseen viehättävyyden arviointiin.

Tiedot ja testit

Tutkijat testasivat lähestymistapaansa hyödyntämällä SCUT-FBP5500-tietokantaa, joka on Etelä-Kiinan yliopiston kasvojen kauneuden ennustamisen kokoelma, joka sisältää 5 500 etukasvoa 350x350px resoluutiolla, edustaa monia rotuja, sukupuolia ja ikäryhmiä:

SCUT-FBP5500-tietokannan näytekuvat, joissa kasvot on arvioidu viehättävyydeltään asteikolla 1-5.

SCUT-FBP5500-tietokannan näytekuvat, joissa kasvot on arvioidu viehättävyydeltään asteikolla 1-5.

Jokainen kuva arvioitiin 60 vapaaehtoisen toimesta 1-5 asteikolla, joka vaihteli erittäin epäviehättävästä (1) erittäin viehättävään (5):

Kuvien jakautuminen kauneuspisteiden mukaan.

Kuvien jakautuminen kauneuspisteiden mukaan.

Toinen käytetty tietokanta oli Large-Scale Asian Female Beauty Dataset (LSAFBD), joka on tutkijoiden itse kokoama tietokanta.

LSAFBD-tietokannan näytekuvat, joissa kasvot on arvioidu viehättävyydeltään asteikolla 1-5.

LSAFBD-tietokannan näytekuvat, joissa kasvot on arvioidu viehättävyydeltään asteikolla 1-5.

Tietokanta sisältää 80 000:ta merkintämätöntä kuvaa 144x144px resoluutiolla, joissa on vaihtelua asennossa ja taustassa sekä iässä. Näistä kuvista 75 vapaaehtoista arvioi samat kriteerit kuin edellisessä tietokannassa, tällä kertaa 0-4 asteikolla:

LSAFBD-tietokannan jakautuminen kauneuspisteiden mukaan.

LSAFBD-tietokannan jakautuminen kauneuspisteiden mukaan.

Kummankin tietokannan kuvat jaettiin 8/20-suhteessa koulutus- ja testiosiin, ja ristiinvalidointi käytettiin tulosten stabiloimiseen eri suoritusten aikana. BLS-komponentti määriteltiin ominaisuusikkunoiden määrän, solmujen määrän ikkunaa kohden ja vahvistussolmujen määrän kautta, ja Hyperopt käytettiin tehokkaiden yhdistelmien etsimiseen.

Vertailukohtana käytettiin standard BLS-mallia, joka koulutettiin samojen asetusten kanssa, minkä jälkeen esiteltiin siirrosoppi-malleja, kuten ResNet50, Inception-V3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet ja Xception – kaikki aloitettiin ImageNet-1k-painoilla ja koulutettiin lopullisilla kerroksilla avattuina.

Koulutus tehtiin oppien nopeudella 0,001 (vähennettiin, kun edistys pysähtyi), ja erän koko 16, 50 epokin ajan, sääntelystä ja suoristetun lineaarisen aktivaation (ReLU) sovellettiin koko ajan.

Suorituskyky arvioitiin tarkkuuden ja Pearsonin korrelaation avulla, yhdessä koulutuksen kokonaismääräisen ajan kanssa, ja tulokset keskiarvoitiin viiden suorituksen yli.

Tutkijat ilmoittivat koulutusympäristöksi Intel-i7 3,6 GHz-suorittimen ja 64 GB RAMin “pöytäkoneessa”:

Suorituskykyvertailu SCUT-FBP5500:ssa, jossa E-BLS ja ER-BLS saavuttavat kilpailukykyisen tarkkuuden syvien CNN-mallien, kuten ResNet50, EfficientNetB7, InceptionV3 ja Xception, kanssa, vaikka ne vaativat merkittävästi vähemmän koulutusaikaa – korostaa siirrosopin ja Laajan Oppimisjärjestelmän yhdistämisen tehokkuutta.

Suorituskykyvertailu SCUT-FBP5500:ssa, jossa E-BLS ja ER-BLS saavuttavat kilpailukykyisen tarkkuuden syvien CNN-mallien, kuten ResNet50, EfficientNetB7, InceptionV3 ja Xception, kanssa, vaikka ne vaativat merkittävästi vähemmän koulutusaikaa.

Tulokset osoittivat, että E-BLS paransi tarkkuutta 65,85 prosentista 73,13 prosenttiin, kun taas ER-BLS saavutti 74,69 prosentin tarkkuuden, joka ylitti kaikki vertailumallit. Koulutusaika pysyi huomattavasti alempana kuin syvien CNN-mallien, noin 1 300 sekuntia, verrattuna useisiin tuhansiin tai jopa yli 25 000 sekuntiin.

LSAFBD-tietokannan testitulokset osoittivat, että E-BLS paransi tarkkuutta verrattuna perus-BLS-malliin, kun taas ER-BLS saavutti korkeimman tarkkuuden kaikista vertailumalleista:

Suorituskyky LSAFBD:ssa, jossa ER-BLS ja E-BLS toimivat paremmin kuin kaikki vertailumallit, vaikka ne vaativat vain murto-osan koulutusaikaa – osoittaen johdonmukaisen etun tehokkuudessa ilman tarkkuuden uhraamista.

Suorituskyky LSAFBD:ssa, jossa ER-BLS ja E-BLS toimivat paremmin kuin kaikki vertailumallit, vaikka ne vaativat vain murto-osan koulutusaikaa.

Molemmat variantit säilyttivät huomattavasti alempaa koulutusaikaa kuin syvät CNN-mallit, osoittaen tehokkaamman tasapainon suorituskyvyn ja laskennallisen kustannuksen välillä.

Johtopäätös

Tämä on jonkinlainen “throwback”-julkaisu, kuten sen käyttö vanhemmista suosikeista, kuten CNN:stä, ja sen käyttö alhaisimmassa koulutuslaitteistossa, jonka olen koskaan nähnyt uudessa tutkimuksessa.

Tämä kuitenkin käsittelee yllättävän kestävää tavoitetta kone näkemisessä; yhtä, joka koskettaa voimakkaasti ihmisen kokemusta ja subjektiivista tulkintaa, ja joka vaatii skeeman, joka ylittää esteettiset trendit hetkellä, ja joka voi toimittaa todella kestävän putken tehtävään.

 

Julkaistu ensimmäisen kerran torstaina, 19. maaliskuuta 2026

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai