Andersons vinkel
SofGAN: En GAN-ansiktsgenerator som tilbyr større kontroll

Forskere i Shanghai og USA har utviklet et GAN-basert portrettgenereringssystem som lar brukerne opprette nye ansikter med en hittil utilgjengelig kontroll over enkeltaspekter som hår, øyne, briller, teksturer og farge.
For å demonstrere systemets fleksibilitet, har skaperne levert en Photoshop-liknende grensesnitt hvor en bruker kan tegne semantiske segmenterings-elementer direkte, som vil bli tolket om til realistiske bilder, og som også kan bli oppnådd ved å tegne direkte over eksisterende fotografier.
I eksemplet under, brukes et bilde av skuespilleren Daniel Radcliffe som en tegne-mal (og målet er ikke å produsere en likhet med ham, men heller et generelt fotorealistisk bilde). Mens brukeren fyller inn ulike elementer, inkludert diskrete aspekter som briller, blir de identifisert og tolket i utgangsbildet:

Bruker et bilde som tegne-materiale for et SofGAN-generert portrett. Kilde: https://www.youtube.com/watch?v=xig8ZA3DVZ8
Den artikkelen heter SofGAN: En portrettbildegneratoren med dynamisk styling, og er ledet av Anpei Chen og Ruiyang Liu, sammen med to andre forskere fra ShanghaiTech University og en fra University of California i San Diego.
Disentangling Features
Den primære bidraget til arbeidet er ikke så mye i å tilby en brukervennlig brukergrensesnitt, men heller i å “disentangle” karakteristika av lært ansikts-trekk, som pose og tekstur, som lar SofGAN også generere ansikter som er indirekte vinkler til kameraets synspunkt.

Uvanlig blant ansikts-generatorene basert på Generative Adversarial Networks, kan SofGAN endre vinkel på synspunktet etter ønske, innenfor grensene av vinkel-arrays i treningsdataene. Kilde: https://arxiv.org/pdf/2007.03780.pdf
Siden teksturer nå er disentangled fra geometri, kan ansiktsform og tekstur også manipuleres som separate enheter. I virkeligheten lar dette til å endre ansikts-rase på en kilde-ansikt, en skandaløs praksis som nå har en potensielt nyttig anvendelse, for skaping av rase-balanserte maskinlærings-datasett.

SofGAN støtter også kunstig aldring og attributt-konsistent stil-justering på et granulært nivå som ikke er sett i lignende segmentering>bilde-systemer som NVIDIA’s SPADE og Intel’s spill-basert neurale rendering system.

SofGAN kan implementere aldring som en iterativ stil.
En annen gjennombrudd for SofGAN’s metode er at treningsdataene ikke krever parrede segmentering/ekte bilder, men heller kan trenes direkte på uparrede virkelige bilder.
Forskerne hevder at ‘disentangling’-arkitekturen til SofGAN ble inspirert av tradisjonelle bilde-renderingssystemer, som dekomponerer de enkelte aspektene av et bilde. I visuelle effekter-arbeidsflyter, brytes elementene for en komposisjon ned til de minste komponentene, med spesialister dedikert til hver komponent.
Semantisk Okkupasjonsfelt (SOF)
For å oppnå dette i et maskinlærings-bilde-syntese-rammeverk, utviklet forskerne en semantisk okkupasjonsfelt (SOF), en utvidelse av den tradisjonelle okkupasjonsfeltet som individuerer komponent-elementene av ansikts-portretter. SOF ble trenet på kalibrerte multi-viewport-semantiske segmenterings-kart, men uten noen grunn-sannhets-overvåking.

Flere iterasjoner fra ett enkelt segmenterings-kart (nederst til venstre).
I tillegg blir 2D-segmenterings-kartene oppnådd ved å ray-trace utgangen av SOF, før de blir teksturert av en GAN-generatoren. De ‘syntetiske’ semantiske segmenterings-kartene blir også kodet i et lavt-dimensjonalt rom via en tre-lags-encoder for å sikre kontinuitet av utgang når synspunktet endres.
Trenings-scheme blandes spatialt to tilfeldige stiler for hver semantisk region:
Forskerne hevder at SofGAN oppnår en lavere Frechet Inception Distance (FID) enn den nåværende alternative stat-of-the-art (SOTA)-tilnærmingene, samt en høyere Learned Perceptual Image Patch Similarity (LPIPS)-metrikken.
Tidligere StyleGAN-tilnærminger har ofte blitt hindret av feature-entanglement, hvor elementene som utgjør et bilde er uoppløselig bundet sammen, og forårsaker uønskede elementer å dukke opp sammen med et ønsket element (dvs. øredobber kan dukke opp når en øre-form blir rendret som ble informert på trenings-tid av et bilde som viste øredobber).

Ray-marching brukes til å beregne volumet av semantiske segmenterings-kart, og muliggjør flere synspunkter.
Datasett og Treningsdata
Tre datasett ble brukt i utviklingen av ulike implementeringer av SofGAN: CelebAMask-HQ, et repository med 30 000 høy-oppløselige bilder tatt fra CelebA-HQ-datasettet; NVIDIA’s Flickr-Faces-HQ (FFHQ), som inneholder 70 000 bilder, hvor forskerne merket bildene med en forhånds-trent ansikts-parser; og en selv-produsert gruppe på 122 portrett-scans med manuelt merkte semantiske regioner.
SOF består av tre trenbare under-moduler – hyper-nettet, en ray-marcher (se bilde over), og en klassifiserer. Prosjektets Semantic Instance Wised (SIW) StyleGAN-generatoren er konfigurert lik StyleGAN2 i visse aspekter. Data-forstørrelse blir brukt gjennom tilfeldig skalerings- og beskjæring, og trenings-egenskaper inkluderer path-regularisering hver fjerde trening. Hele trenings-prosessen tok 22 dager å nå 800 000 iterasjoner på fire RTX 2080 Ti-GPU-er over CUDA 10.1.
Artikkelen nevner ikke konfigurasjonen av 2080-kortene, som kan akkommodere mellom 11 GB-22 GB VRAM hver, noe som betyr at totalt VRAM brukt for det meste av en måned for å trene SofGAN er noen hvor mellom 44 GB og 88 GB.
Forskerne observerer at akseptable, generaliserte, høyt-nivå-resultater begynte å dukke opp ganske tidlig i trenings-prosessen, ved 1500 iterasjoner, tre dager inn i trenings-prosessen. Resten av trenings-prosessen ble brukt til å nå fine detaljer som hår og øye-fasetter.
SofGAN oppnår generelt mer realistiske resultater fra ett enkelt segmenterings-kart enn rival-metoder som NIVDIA’s SPADE og Pix2PixHD, og SEAN.
Nedenfor er videoen som er utgitt av forskerne. Flere selv-vertede videoer er tilgjengelige på prosjekt-siden.














