Andersons vinkel

Et AI-system som kan gjøre bilder av mennesker mer ‘vakre’

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

Forskere fra Kina har utviklet et nytt AI-basert bildeforbedringssystem som kan gjøre bilder av en person mer ‘vakre’, basert på en ny tilnærming til forsterkingslæring.

Den nye tilnærmingen bruker et 'ansiktsvakrhetsprediksjonsnettverk' for å iterere gjennom variasjoner av et bilde basert på en rekke faktorer, hvorav 'belysning' og øyeposer kan være kritiske faktorer. Her er de originale kildene (til venstre i hver kolonne) fra EigenGAN-systemet, med de nye resultater til høyre for disse. Kilde: https://arxiv.org/pdf/2208.04517.pdf

Den nye tilnærmingen bruker et ‘ansiktsvakrhetsprediksjonsnettverk’ for å iterere gjennom variasjoner av et bilde basert på en rekke faktorer, hvorav ‘belysning’ og øyeposer kan være kritiske faktorer. Her er de originale kildene (til venstre i hver kolonne) fra EigenGAN-systemet, med de nye resultater til høyre for disse. Kilde: https://arxiv.org/pdf/2208.04517.pdf

Teknikken bygger på innovasjoner funnet for EigenGAN-generatoren, et annet kinesisk prosjekt fra 2021, som gjorde bemerkelsesverdige fremskritt i å identifisere og få kontroll over de mangfoldige semantiske attributtene i latentrommet til Generative Adversarial Networks (GANs).

EigenGAN-generatoren fra 2021 kunne individuere høynivåkonsepter som 'hårfarge' i latentrommet til en generativ adversarial nettverk. Det nye arbeidet bygger på denne innovative instrumenteringen for å levere et system som kan 'forbedre' kildebilder, men uten å endre den gjenkjennelige identiteten – et problem i tidligere tilnærminger. Kilde: https://arxiv.org/pdf/2104.12476.pdf

EigenGAN-generatoren fra 2021 kunne individuere høynivåkonsepter som ‘hårfarge’ i latentrommet til en generativ adversarial nettverk. Det nye arbeidet bygger på denne innovative instrumenteringen for å levere et system som kan ‘forbedre’ kildebilder, men uten å endre den gjenkjennelige identiteten – et problem i tidligere tilnærminger. Kilde: https://arxiv.org/pdf/2104.12476.pdf

Systemet bruker et ‘estetisk poengnettverk’ avledet fra SCUT-FBP5500 (SCUT), en 2018-benchmarkdataset for ansiktsvakrhetsprediksjon, fra South China University of Technology i Guangzhou.

Fra 2018-papiret 'SCUT-FBP5500: En mangfoldig benchmarkdataset for multi-paradigme ansiktsvakrhetsprediksjon', som tilbød et 'ansiktsvakrhetsprediksjonsnettverk' (FBP) i stand til å rangere ansikter etter oppfattningsmessig tiltrekning, men som ikke kunne faktisk transformere eller 'oppgradere' ansikter. Kilde: https://arxiv.org/pdf/1801.06345.pdf

Fra 2018-papiret ‘SCUT-FBP5500: En mangfoldig benchmarkdataset for multi-paradigme ansiktsvakrhetsprediksjon’, som tilbød et ‘ansiktsvakrhetsprediksjonsnettverk’ (FBP) i stand til å rangere ansikter etter oppfattningsmessig tiltrekning, men som ikke kunne faktisk transformere eller ‘oppgradere’ ansikter. Kilde: https://arxiv.org/pdf/1801.06345.pdf

I motsetning til det nye arbeidet, kan 2018-prosjektet ikke faktisk utføre transformasjoner, men inneholder algoritmiske verdijudikatorer for 5 500 ansikter, supplert av 60 mixed kjønnslabelere (en 50/50-deling). Disse er inkorporert i det nye systemet som en effektiv diskriminatore for å informere transformasjoner som sannsynligvis vil forbedre ’tiltrekningen’ av et bilde.

Interessant nok er det nye papiret tittelen Attributt-kontrollerbar vakker kaukasisk ansiktsgenerering ved estetisk drevet forsterkingslæring. Årsaken til at alle raser unntatt kaukasisk er ekskludert fra systemet (se også at forskerne selv er kinesiske) er at kildedataene for SCUT skuer betydelig mot asiatiske kilder (4 000 jevnt fordelt asiatiske kvinner/menn, 1 500 jevnt fordelt kaukasiske kvinner/menn), som gjør ‘gjennomsnittspersonen’ i den datasett brunhåret og brune øyne.

Derfor, for å kunne håndtere fargevariasjon innen minst en rase, var det nødvendig å ekskludere den asiatiske komponenten fra de originale dataene, eller gå til den betydelige utgift av å gjenopprette dataene for å utvikle en metode som kanskje ikke ville fungert. I tillegg variasjon i kulturelle oppfatninger av vakrhetsmessig betyr at slike systemer vil trenge en viss grad av geografisk konfigurasjon i forhold til hva som utgjør ’tiltrekning’.

Relevante attributter

For å bestemme de primære bidragende faktorene til et ’tiltreaktig’ bilde av en person, testet forskerne også effekten av ulike endringer i bildene, i forhold til hvor godt slike forbedringer forbedret algoritmenes oppfatning av ‘vakrhetsmessig’. De fant at minst en av aspektene er mer sentral for god fotografering enn god genetikk:

Bortsett fra belysning, var aspektene som hadde størst innvirkning på vakrhetspoeng var panne (som, i tilfelle av menn, ofte kan være ekvivalent med å ha et fullt hode hår), kroppsholdning og øyedisponering (hvor engasjement med kameraets synsvinkel er en fordel for tiltrekning).

(Med hensyn til ‘leppfarge’, kan det nye systemet, som kan fungere effektivt på både mannlige og kvinnelige fremstillinger av kjønn, ikke individuere kjønnsutseende, men heller avhenger av det nye diskriminatorensystemet som en ‘filter’ i denne hensikt)

Metode

Belønningsfunksjonen i forsterkingslæringmekanismen i det nye systemet er drevet av en enkel regresjon over SCUT-dataene, som utgangspunkt for ansiktsvakrhetsprediksjoner.

Treningsystemet itererer over datainndataene (nederst til venstre i skjemaet under). Først ekstraherer et forhåndstreent ResNet18-modell (trent på ImageNet) funksjoner fra de fem identiske (‘y’) bildene. Deretter blir en potensiell transformasjonsaksjon avledet fra det skjulte tilstanden til en fullt tilkoblet lag (GRUCell, i bildet under), og transformasjonene blir anvendt, som fører til fem endrede bilder som blir matet inn i estetisk poengnettverket, hvis rangeringer, Darwin-stil, vil bestemme hvilke variasjoner som vil bli utviklet og hvilke som blir forkastet.

En bred illustrasjon av arbeidsflyten for det nye systemet.

En illustrasjon av arbeidsflyten for det nye systemet.

Estetisk poengnettverket bruker en Efficient Channel Attention (ECA)-modul, mens en tilpasning av en forhåndstreent instans av EfficientNet-B4 er oppgitt med å ekstrahere 1 792 funksjoner fra hvert bilde.

Efter normalisering gjennom en ReLU-aktiveringsfunksjon, blir en 4-dimensjonal vektor oppnådd tilbake fra ECA-modulen, som deretter blir flattet til en en-dimensjonal vektor etter aktivering og adaptiv gjennomsnittlig pooling. Til slutt blir resultater matet inn i regresjonsnettverket, som henter en estetisk poeng.

En kvalitativ sammenligning av utgang fra systemet. I bunnen av raden ser vi den aggregerte summen av alle de individuerte aspektene som er identifisert av EigenGAN-metoden og deretter forbedret. Gjennomsnittlige FID-poeng for bildene er til venstre for bilderekkene (høyere er bedre).

En kvalitativ sammenligning av utgang fra systemet. I bunnen av raden ser vi den aggregerte summen av alle de individuerte aspektene som er identifisert av EigenGAN-metoden og deretter forbedret. Gjennomsnittlige FID-poeng for bildene er til venstre for bilderekkene (høyere er bedre).

Tester og brukerstudie

Fem variasjoner av den foreslåtte metoden ble evaluert algoritmissk (se bildet over), med Fréchet-inception-avstand (FID, kontroversiell i noen kvartaler) poeng tildelt til en total av 1000 bilder som ble satt gjennom systemet.

Forskerne merker at å forbedre belysningen oppnådde en bedre tiltrekningsscore for subjektene i bildene enn flere andre mer ‘åpenbare’ mulige endringer (dvs. til den faktiske utseendet til personen avbildet).

I en viss grad er testing av systemet på denne måten begrenset av eksentrisiteten til SCUT-dataene, som ikke har mange ‘lyse smiler’, og forfatterne argumenterer for at dette kunne over-rankere den mer typiske ‘enigmatiske’ looken i dataene, i sammenligning med de sannsynlige preferansene til potensielle målbrukere (antageligvis, i dette tilfelle, en vestlig marked).

Likevel, siden hele systemet henger på gjennomsnittsavgjørelsene til bare 60 personer (i EigenGAN-papiret), og siden kvaliteten som studeres er langt ifra empirisk, kan det argumenteres for at prosedyren er mer solid enn datasett.

Selv om det behandles svært kort i papiret, ble bilder fra EigenGAN og systemets egne fem variasjoner også vist i en begrenset brukerstudie (åtte deltakere), som ble bedt om å velge det ‘beste bildet’ (ordet ’tiltreaktig’ ble unngått).

Ovenfor, GUI-presentasjonen til den lille studiegruppen; under, resultater.

Ovenfor, GUI-presentasjonen til den lille studiegruppen; under, resultater.

Resultatene indikerer at det nye systemets utgang nådde den høyeste valgsfrekvensen blant deltakerne (‘MAES’ i bildet over).

Den (måløse?) jakten på vakrhetsmessig

Nyttien av et slikt system er vanskelig å etablere, til tross for hva som ser ut til å være en merkelig lokus av innsats i Kina mot disse målene. Ingen er omtalt i den nye publikasjonen.

Tidligere EigenGAN-papir antyder* at et vakrhetsgjenkjenningssystem kunne bli brukt i ansikts makeup-synteserekommendasjonssystemer, estetisk kirurgi, ansiktsforbedring, eller innholdsbasert bildehenting.

Antageligvis kunne en slik tilnærming også bli brukt på dating-nettsteder, av sluttbrukere, for å ‘forbedre’ sine egne profilbilder til en garantert ‘lykketrøff’, som et alternativ til å bruke foreldede bilder eller bilder av andre personer.

Likewise, dating-nettsteder selv kunne også ‘score’ sine klienter for å skape rangeringer og til og med begrensede-tilgangsnivåer, selv om dette antageligvis bare ville fungere via en liveness-autentiseringsfangst, snarere enn innsendte bilder (som likevel kunne bli ‘forbedret’ av klientene, hvis tilnærmingen skulle bli populær).

I reklame, kunne en algoritmisk metode for å vurdere vakrhetsmessig (en teknologi forutsagt av den avdøde science fiction-forfatteren Michael Crichton i hans 1982-kino-utgivelse Looker) bli brukt til å velge den ikke-forbedrede kreative utgangen som er mest sannsynlig til å engasjere en målgruppe, mens evnen til å faktisk maksimere den estetiske innvirkningen av ansiktsbilder, uten å faktisk overskrive dem i stil med deepfakes, kunne forbedre allerede effektive bilder som er ment til å skaffe offentlig interesse.

Det nye arbeidet støttes av National Natural Science Foundation of China, Open Fund Project of the State Key Laboratory of Complex System Management and Control, og Project of Philosophy and Social Science Research fra Kinas utdanningsministerium, blant andre støttespillere.

 

* Mange av EigenGAN-papirets anbefalinger peker mot en kommersielt tilgjengelig bok fra 2016 med tittelen ‘Computermodeller for ansiktsvakrhetsanalyse’, snarere enn akademiske ressurser.

Først publisert 11. august 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai