Andersons vinkel

SofGAN: En GAN-ansiktsgenerator som tilbyr større kontroll

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere i Shanghai og USA har utviklet et GAN-basert portrettgenereringssystem som lar brukerne opprette nye ansikter med en hittil utilgjengelig kontroll over enkeltaspekter som hår, øyne, briller, teksturer og farge.

For å demonstrere systemets fleksibilitet, har skaperne levert en Photoshop-liknende grensesnitt hvor en bruker kan tegne semantiske segmenterings-elementer direkte, som vil bli tolket om til realistiske bilder, og som også kan bli oppnådd ved å tegne direkte over eksisterende fotografier.

I eksemplet under, brukes et bilde av skuespilleren Daniel Radcliffe som en tegne-mal (og målet er ikke å produsere en likhet med ham, men heller et generelt fotorealistisk bilde). Mens brukeren fyller inn ulike elementer, inkludert diskrete aspekter som briller, blir de identifisert og tolket i utgangsbildet:

Bruker et bilde som tegne-materiale for et SofGAN-generert portrett. Kilde: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Bruker et bilde som tegne-materiale for et SofGAN-generert portrett. Kilde: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Den artikkelen heter SofGAN: En portrettbildegneratoren med dynamisk styling, og er ledet av Anpei Chen og Ruiyang Liu, sammen med to andre forskere fra ShanghaiTech University og en fra University of California i San Diego.

Disentangling Features

Den primære bidraget til arbeidet er ikke så mye i å tilby en brukervennlig brukergrensesnitt, men heller i å “disentangle” karakteristika av lært ansikts-trekk, som pose og tekstur, som lar SofGAN også generere ansikter som er indirekte vinkler til kameraets synspunkt.

Uvanlig blant ansikts-generatorene basert på Generative Adversarial Networks, kan SofGAN endre vinkel på synspunktet etter ønske, innenfor grensene av vinkel-arrays i treningsdataene. Kilde: https://arxiv.org/pdf/2007.03780.pdf

Uvanlig blant ansikts-generatorene basert på Generative Adversarial Networks, kan SofGAN endre vinkel på synspunktet etter ønske, innenfor grensene av vinkel-arrays i treningsdataene. Kilde: https://arxiv.org/pdf/2007.03780.pdf

Siden teksturer nå er disentangled fra geometri, kan ansiktsform og tekstur også manipuleres som separate enheter. I virkeligheten lar dette til å endre ansikts-rase på en kilde-ansikt, en skandaløs praksis som nå har en potensielt nyttig anvendelse, for skaping av rase-balanserte maskinlærings-datasett.

SofGAN støtter også kunstig aldring og attributt-konsistent stil-justering på et granulært nivå som ikke er sett i lignende segmentering>bilde-systemer som NVIDIA’s SPADE og Intel’s spill-basert neurale rendering system.

SofGAN kan implementere aldring som en iterativ stil.

SofGAN kan implementere aldring som en iterativ stil.

En annen gjennombrudd for SofGAN’s metode er at treningsdataene ikke krever parrede segmentering/ekte bilder, men heller kan trenes direkte på uparrede virkelige bilder.

Forskerne hevder at ‘disentangling’-arkitekturen til SofGAN ble inspirert av tradisjonelle bilde-renderingssystemer, som dekomponerer de enkelte aspektene av et bilde. I visuelle effekter-arbeidsflyter, brytes elementene for en komposisjon ned til de minste komponentene, med spesialister dedikert til hver komponent.

Semantisk Okkupasjonsfelt (SOF)

For å oppnå dette i et maskinlærings-bilde-syntese-rammeverk, utviklet forskerne en semantisk okkupasjonsfelt (SOF), en utvidelse av den tradisjonelle okkupasjonsfeltet som individuerer komponent-elementene av ansikts-portretter. SOF ble trenet på kalibrerte multi-viewport-semantiske segmenterings-kart, men uten noen grunn-sannhets-overvåking.

Flere iterasjoner fra ett enkelt segmenterings-kart (nederst til venstre).

Flere iterasjoner fra ett enkelt segmenterings-kart (nederst til venstre).

I tillegg blir 2D-segmenterings-kartene oppnådd ved å ray-trace utgangen av SOF, før de blir teksturert av en GAN-generatoren. De ‘syntetiske’ semantiske segmenterings-kartene blir også kodet i et lavt-dimensjonalt rom via en tre-lags-encoder for å sikre kontinuitet av utgang når synspunktet endres.

Trenings-scheme blandes spatialt to tilfeldige stiler for hver semantisk region:

Arkitekturen for SofGAN.

Arkitekturen for SofGAN.

Forskerne hevder at SofGAN oppnår en lavere Frechet Inception Distance (FID) enn den nåværende alternative stat-of-the-art (SOTA)-tilnærmingene, samt en høyere Learned Perceptual Image Patch Similarity (LPIPS)-metrikken.

Tidligere StyleGAN-tilnærminger har ofte blitt hindret av feature-entanglement, hvor elementene som utgjør et bilde er uoppløselig bundet sammen, og forårsaker uønskede elementer å dukke opp sammen med et ønsket element (dvs. øredobber kan dukke opp når en øre-form blir rendret som ble informert på trenings-tid av et bilde som viste øredobber).

Ray-marching brukes til å beregne volumet av semantiske segmenterings-kart, og muliggjør flere synspunkter.

Ray-marching brukes til å beregne volumet av semantiske segmenterings-kart, og muliggjør flere synspunkter.

Datasett og Treningsdata

Tre datasett ble brukt i utviklingen av ulike implementeringer av SofGAN: CelebAMask-HQ, et repository med 30 000 høy-oppløselige bilder tatt fra CelebA-HQ-datasettet; NVIDIA’s Flickr-Faces-HQ (FFHQ), som inneholder 70 000 bilder, hvor forskerne merket bildene med en forhånds-trent ansikts-parser; og en selv-produsert gruppe på 122 portrett-scans med manuelt merkte semantiske regioner.

SOF består av tre trenbare under-moduler – hyper-nettet, en ray-marcher (se bilde over), og en klassifiserer. Prosjektets Semantic Instance Wised (SIW) StyleGAN-generatoren er konfigurert lik StyleGAN2 i visse aspekter. Data-forstørrelse blir brukt gjennom tilfeldig skalerings- og beskjæring, og trenings-egenskaper inkluderer path-regularisering hver fjerde trening. Hele trenings-prosessen tok 22 dager å nå 800 000 iterasjoner på fire RTX 2080 Ti-GPU-er over CUDA 10.1.

Artikkelen nevner ikke konfigurasjonen av 2080-kortene, som kan akkommodere mellom 11 GB-22 GB VRAM hver, noe som betyr at totalt VRAM brukt for det meste av en måned for å trene SofGAN er noen hvor mellom 44 GB og 88 GB.

Forskerne observerer at akseptable, generaliserte, høyt-nivå-resultater begynte å dukke opp ganske tidlig i trenings-prosessen, ved 1500 iterasjoner, tre dager inn i trenings-prosessen. Resten av trenings-prosessen ble brukt til å nå fine detaljer som hår og øye-fasetter.

SofGAN oppnår generelt mer realistiske resultater fra ett enkelt segmenterings-kart enn rival-metoder som NIVDIA’s SPADE og Pix2PixHD, og SEAN.

Nedenfor er videoen som er utgitt av forskerne. Flere selv-vertede videoer er tilgjengelige på prosjekt-siden.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai