Andersonin kulma

Tekoälyjärjestelmä, joka voi tehdä ihmisten kuvista “kauniimmat”

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

Kiinalaiset tutkijat ovat kehittäneet uuden tekoälypohjaisen kuvanparannusjärjestelmän, joka pystyy tekemään ihmisten kuvista “kauniimmat”, perustuen uuteen lähestymistapaan vahvistusoppimiseen.

Uusi lähestymistapa käyttää 'kasvojen kauneusennustusverkkoa' iteroidakseen kuvan variaatioita useiden tekijöiden perusteella, joiden joukossa 'valaistus' ja silmien asennot voivat olla kriittisiä tekijöitä. Tässä alkuperäiset lähteet (jokaisen sarakkeen vasemmalla puolella) ovat EigenGAN-järjestelmästä, ja uudet tulokset näkyvät näiden oikealla puolella. Lähde: https://arxiv.org/pdf/2208.04517.pdf

Uusi lähestymistapa käyttää ‘kasvojen kauneusennustusverkkoa’ iteroidakseen kuvan variaatioita useiden tekijöiden perusteella, joiden joukossa ‘valaistus’ ja silmien asennot voivat olla kriittisiä tekijöitä. Tässä alkuperäiset lähteet (jokaisen sarakkeen vasemmalla puolella) ovat EigenGAN-järjestelmästä, ja uudet tulokset näkyvät näiden oikealla puolella. Lähde: https://arxiv.org/pdf/2208.04517.pdf

Tekniikka perustuu innovaatioihin, jotka on löydetty EigenGAN-generaattorin kehittämiseksi, toisessa kiinalaisessa projektissa vuonna 2021, jossa tehtiin merkittäviä edistysaskelia kasvojen semanttisten attribuuttien tunnistamisessa ja hallinnassa generatiivisten vastakkainasettelujen (GAN) latenttiavaruudessa.

<img class="size-full wp-image-183136" src="https://www.unite.ai/wp-content/uploads/2022/08/eigengan-generator.jpg" alt="Vuoden 2021 EigenGAN-generaattori pystyi erottamaan korkean tason käsitteitä, kuten 'hiusten väri', generatiivisen vastakkainasettelun latenttiavaruudessa. Uusi työ perustuu tähän innovatiiviseen välineistöön ja tarjoaa järjestelmän, joka voi 'kaunistaa' alkuperäisiä kuvia ilman, että tunnistettava identiteetti muuttuu – ongelma edellisissä lähestymistapoissa. Lähde: https://arxiv.org/pdf/2104.12476.pdf

Järjestelmä käyttää ‘estetiikka-arvosanan verkkoa’, joka on johdettu SCUT-FBP5500:sta (SCUT), vuoden 2018 benchmark-aineistosta kasvojen kauneuden ennustamiseen Etelä-Kiinan teknillisen yliopiston Guangzhoun kampukselta.

Vuoden 2018 julkaisusta 'SCUT-FBP5500: Monipuolinen benchmark-aineisto moniparadigman kasvojen kauneuden ennustamiseen', joka esitteli 'kasvojen kauneusennustusverkon' (FBP), joka pystyy arvioimaan kasvojen viehätysvoimaa, mutta joka ei voi itse muuttaa tai 'parantaa' kasvoja. Lähde: https://arxiv.org/pdf/1801.06345.pdf

Vuoden 2018 julkaisusta ‘SCUT-FBP5500: Monipuolinen benchmark-aineisto moniparadigman kasvojen kauneuden ennustamiseen’, joka esitteli ‘kasvojen kauneusennustusverkon’ (FBP), joka pystyy arvioimaan kasvojen viehätysvoimaa, mutta joka ei voi itse muuttaa tai ‘parantaa’ kasvoja. Lähde: https://arxiv.org/pdf/1801.06345.pdf

Toisin kuin uusi työ, vuoden 2018 projekti ei voi suorittaa muunnoksia, mutta sisältää algoritmisen arvostelun 5 500 kasvojen kuvasta, jotka on toimittanut 60 sekoitettua sukupuolta olevaa merkintää (50/50 jakautuminen). Nämä on sisällytetty uuteen järjestelmään tehokkaana ‘erottimena’, jotta voidaan informoida muunnoksia, jotka todennäköisesti parantavat kuvan ‘viehätysvoimaa’.

Mielenkiintoista kyllä, uusi artikkeli on otsikoitu Attribute Controllable Beautiful Caucasian Face Generation by Aesthetics Driven Reinforcement Learning. Syy siihen, että kaikki rodut paitsi kaukasialainen on poissuljettu järjestelmästä (huomaa myös, että tutkijat itse ovat kiinalaisia), on se, että SCUT-aineiston lähde on merkittävästi vinoutunut aasialaisten lähteiden suuntaan (4 000 tasaisesti jaettua aasialaista naista/miestä, 1 500 tasaisesti jaettua kaukasialaista naista/miestä), mikä tekee ‘keskivertokasvosta’ tässä aineistossa ruskeatukkaisen ja ruskeasilmäisen.

Siksi, jotta voidaan sopeuttaa värivaihtelua ainakin yhden rodun sisällä, oli tarpeen poistaa aasialainen komponentti alkuperäisestä aineistosta, tai mennä suuriin kustannuksiin aineiston uudelleenmuodostamiseksi kehittämiseksi menetelmää, joka ei välttämättä onnistuisi. Lisäksi kulttuuristen kauneuskuvausten vaihtelut tarkoittavat väistämättä, että tällaiset järjestelmät tarvitsevat jonkinlaista maantieteellistä konfiguroitavuutta siinä, mitä ‘viehätysvoimana’ pidetään.

Pertinent Attributes

Määrittääkseen ensisijaiset vaikuttavat tekijät ‘viehättävään’ valokuvaan, tutkijat testasivat myös eri muutosten vaikutusta kuviin siinä, miten hyvin tällaiset muutokset paransivat algoritmista kauneusarviota. He löysivät, että ainakin yksi näistä puolista on tärkeämpää hyvälle valokuvalle kuin hyvälle geneetikalle:

Lisäksi valaistuksen, ne asiat, jotka vaikuttivat eniten kauneuspisteisiin, olivat hiukset (joilla miehillä voi usein olla vastaava vaikutus kuin täysien hiusten kanssa), kehon asento ja silmien asento (jossa kameran näkökulman vastaanotto on lisä viehätysvoimaa).

(Lipstick-värin osalta uusi järjestelmä, joka toimii sekä miehille että naisille esittävillä sukupuolilla, ei erota sukupuolisen ulkonäön, vaan sen sijaan nojaa uuteen erotusjärjestelmään ‘suodattimena’ tässä suhteessa)

Method

Palkkiofunktiota vahvistusoppimismekanismissa uudessa järjestelmässä ohjataan yksinkertaisella regressiolla SCUT-aineistosta, joka antaa kasvojen kauneuden ennusteita.

Koulutusjärjestelmä toistaa syötekuva (alhaalla vasemmalla kuvassa). Aluksi esikoulutettu ResNet18-malli (koulutettu ImageNet-aineistolla) poimii piirteitä viidestä identtisestä (‘y’) kuvasarjasta. Seuraavaksi potentiaalinen muodonmuutos saadaan piilotetun tilan täysin yhdistetystä kerroksesta (fully connected layer, GRUCell kuvassa), ja muutokset sovelletaan, mikä johtaa viiteen muutettuun kuvaan, jotka syötetään estetiikka-arvosanan verkkoon, jonka arviot, darwinilaisella tavalla, määräävät, mitkä variaatiot kehitetään ja mitkä hylätään.

Laaja esittely uuden järjestelmän työnkulusta.

Esittely uuden järjestelmän työnkulusta.

Estetiikka-arvosanan verkko käyttää Efficient Channel Attention (ECA) -moduulia, kun taas EfficientNet-B4:n esikoulutetun instanssin sovittaminen on tehtävänä poimia 1 792 piirrettä kustakin kuvasta.

Jälkeenpäin normalisoinnin kautta ReLU-aktivaatiofunktion kautta, saadaan 4-ulotteinen vektori takaisin ECA-moduulista, joka tasoitetaan yhdenulotteiseksi vektoriksi aktivaation ja sopeutuvan keskiarvopoolauksen jälkeen. Lopulta tulokset syötetään regressioverkkoon, joka hakee estetiikka-arvon.

Laadullinen vertailu järjestelmän tuloksista. Alhaalla oikeassa rivissä nähdään yhteenveto kaikista erillisistä puolista, jotka on tunnistettu EigenGAN-menetelmällä ja sittemmin parannettu. Keskimääräiset FID-pisteet kuville ovat kuvien rivien vasemmalla puolella (korkeampi on parempi).

Laadullinen vertailu järjestelmän tuloksista. Alhaalla oikeassa rivissä nähdään yhteenveto kaikista erillisistä puolista, jotka on tunnistettu EigenGAN-menetelmällä ja sittemmin parannettu. Keskimääräiset FID-pisteet kuville ovat kuvien rivien vasemmalla puolella (korkeampi on parempi).

Tests and User Study

Viisi varianttia ehdotetusta menetelmästä arvioitiin algoritmallisesti (ks. yllä oleva kuva), ja Fréchet-inception-etäisyys (FID, kiistanalainen joissakin piireissä) -pisteet määritettiin yhteensä 1000 kuvalle, jotka käytiin järjestelmän läpi.

Tutkijat huomauttavat, että valaistuksen parantaminen saavutti paremman viehätysvoimapisteen kuvaamien henkilöiden kuvissa kuin useat muut ‘ilmeisemmät’ mahdolliset muutokset (esim. itse henkilön ulkonäköön).

Järjestelmän testaaminen tällä tavoin on rajoitettu SCUT-aineiston omituisuuksilla, jossa ei ole paljon ‘irkkkuvia hymyjä’, ja kirjoittajat väittävät, että tämä voi ylipainottaa ‘arvoiteltua’ ilmettä aineistossa verrattuna mahdollisiin kohderyhmien mieltymyksiin (oletettavasti tässä tapauksessa länsimaisella markkinalla).

On kuitenkin sanottava, että koko järjestelmä perustuu vain 60 henkilön keskimääräisiin mielipiteisiin (EigenGAN-artikkelissa), ja koska tutkittava laatu on kaukana empiirisestä, voidaan väittää, että menettely on järkevämpää kuin aineisto.

Vaikka sitä käsitellään hyvin lyhyesti artikkelissa, EigenGAN:n ja järjestelmän omat viisi varianttia esitettiin myös rajoitetussa käyttäjätutkimuksessa (kahdeksan osanottajaa), joilta pyydettiin valitsemaan ‘paras kuva’ (sanaa ‘viehättävä’ vältettiin).

Ylhäällä GUI, joka esiteltiin pienelle tutkimusryhmälle; alhaalla tulokset.

Ylhäällä GUI, joka esiteltiin pienelle tutkimusryhmälle; alhaalla tulokset.

Tulokset osoittavat, että uuden järjestelmän tulokset saavuttivat korkeimman valintaprosentin osanottajien keskuudessa (‘MAES’ yllä olevassa kuvassa).

The (Aimless?) Pursuit of Beauty

Tällaisen järjestelmän hyödyllisyys on vaikea määritellä, vaikka näyttää siltä, että on merkittävä kohteista työtä tehty Kiinassa näiden tavoitteiden saavuttamiseksi. Mikään niistä ei ole lueteltu uudessa julkaisussa.

Edellinen EigenGAN-artikkeli ehdottaa*, että kauneuden tunnistusjärjestelmää voidaan käyttää kasvojen meikkien suositusjärjestelmissä, esteettisessä kirurgiassa, kasvojen kauneuden parantamisessa tai sisällön perusteella tapahtuvassa kuvanhaussa.

On luonnollista, että tällaista lähestymistapaa voidaan käyttää myös treffisivustoilla, jotta käyttäjät voivat ‘parantaa’ omia profiilikuviaan varmasti ‘onniin’, vaihtoehtona vanhojen kuvien käyttämiselle tai muiden ihmisten kuvien käyttämiselle.

Vastaavasti treffisivustot voivat myös ‘arvioida’ asiakkaitaan ja luoda arvioluokat, ja jopa rajoitetut pääsytasot, vaikka tämä toimisi vain elossa olevan todentamisen kautta, eikä lähettämien kuvien kautta (joita asiakkaat voivat myös ‘parantaa’, jos tällainen lähestymistapa tulisi suosituksi).

Mainonnassa algoritmisen kauneuden arviointimenetelmän voidaan käyttää valitsemaan luovan sisällön, joka on todennäköisesti sitova kohderyhmälle, kun taas kyky todella maksimoida kasvojen esteettinen vaikutus ilman, että ne ylitettäisiin deepfake-tyyppisesti, voisi parantaa jo tehokkaita kuvia, jotka on tarkoitettu herättämään yleisön mielenkiintoa.

Uusi työ on tuettu Kiinan kansallisen luonnontieteellisen tutkimussäätiön, avoimen hankkeen rahoituksen, valtion kompleksisten järjestelmien hallinnan ja ohjauksen avainlaboratorion hankkeen ja Kiinan opetusministeriön filosofian ja sosiaalitieteiden tutkimushankkeen avulla, muun muassa.

 

* Monet EigenGAN-artikkelin suositukset osoittavat kaupallisesti saatavissa olevaan vuoden 2016 kirjaan ‘Computer Models for Facial Beauty Analysis’, eikä akateemisiin resursseihin.

Julkaistu ensimmäisen kerran 11. elokuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai