Andersonin kulma
SofGAN: Kasvokuvien generoija, joka tarjoaa suuremman hallinnan

Tutkijat Shanghaissa ja Yhdysvalloissa ovat kehittäneet GAN-pohjaisen muotokuvien generointijärjestelmän, joka sallii käyttäjien luoda uusia kasvoja aiemmin tuntemattomalla tasolla hallintaa yksittäisten elementtien, kuten hiusten, silmien, silmälasien, tekstuurien ja värin, osalta.
Järjestelmän monipuolisuuden osoittamiseksi luojat ovat tarjonneet Photoshop-tyyppisen käyttöliittymän, jossa käyttäjä voi suoraan piirtää semanttisia segmentointielementtejä, jotka tulkitaan realistiseksi kuvaksi, ja jotka voidaan myös hankkia piirtämällä suoraan olemassa olevien valokuvien yli.
Esimerkissä käytetään näyttelijä Daniel Radcliffen valokuvaa jäljennysmallina (ja tavoitteena ei ole tuottaa hänen kaltaistensa, vaan yleisesti fotorealistinen kuva). Kun käyttäjä täyttää eri elementtejä, mukaan lukien erillisiä piirteitä kuten silmälasit, ne tunnistetaan ja tulkitaan tulostuskuvaan:

Käyttäen yhtä kuvaa jäljennysmateriaalina SofGAN-generoituun muotokuvaan. Lähde: https://www.youtube.com/watch?v=xig8ZA3DVZ8
Artikkeli paperi on otsikoitu SofGAN: Muotokuvien generoija dynaamisella tyylittelyllä, ja sen johtajina toimivat Anpei Chen ja Ruiyang Liu, yhdessä kahden muun Shanghain teknillisen yliopiston tutkijan ja yhden Kalifornian yliopiston San Diegon tutkijan kanssa.
Erilliset piirteet
Työn pääasiallinen panos ei ole niinkään käyttäjäystävällisen käyttöliittymän tarjoamisessa, vaan pikemminkin “erillisten” ominaisuuksien, kuten asennon ja tekstuurin, erottamisessa, mikä mahdollistaa SofGAN:in myös generoida kasvoja, jotka ovat epäsuorassa kulmassa kameran näkökulmaan nähden.

Epätavallista kasvokuvien generoijien joukossa, jotka perustuvat Generative Adversarial Networks -tekniikkaan, SofGAN voi muuttaa näkökulmaa halutessaan, koulutusdatan mukaisesti. Lähde: https://arxiv.org/pdf/2007.03780.pdf
Koska tekstuurit ovat nyt eriytetty geometriasta, kasvon muoto ja tekstuuri voidaan myös muokata erillisinä entiteetteinä. Tämä mahdollistaa myös rodun muuttamisen alkuperäisestä kasvosta, skandaalinen käytäntö, jolla on nyt mahdollisesti hyödyllinen sovellus tasapuolisen koneoppimisdatan luomiseksi.

SofGAN tukee myös keinotekoista vanhenemista ja ominaisuuskohtaista tyylin muokkausta hienojakoisella tasolla, jota ei ole aiemmin nähty vastaavissa segmentointi > kuva -järjestelmissä, kuten NVIDIA:n GauGAN ja Intelin pelipohjainen neuroniverkkotekniikka järjestelmä.

SofGAN pystyy toteuttamaan vanhenemisen iteratiivisena tyylina.
Toinen SofGAN:n metodologian läpimurto on, että koulutus ei vaadi pareittain segmentointi/reaalikuvia, vaan voidaan kouluttaa suoraan reaalimaailman kuvilla.
Tutkijat toteavat, että SofGAN:n “erillinen” arkkitehtuuri sai vaikutteita perinteisistä kuvan renderöintijärjestelmistä, jotka hajottavat yksittäisten kuvaelementtien. Visuaalisten efektien työvirroissa komponentit yhdistetään usein yksityiskohtaisesti, ja eri osia varten on omat asiantuntijat.
Semanttinen asuinalue (SOF)
Tämän saavuttamiseksi koneoppimisen kuvansynteesirunkossa tutkijat kehittivät semanttisen asuinalueen (SOF), joka on laajennus perinteisestä asuinalueesta, joka erottaa kasvokuvien yksittäiset komponentit. SOF:ia koulutettiin kalibroituilla moninäkökulmaisilla semanttisilla segmentointikartoilla, ilman minkäänlaista ohjausta.

Useita iteraatioita yhdestä segmentointikartasta (alhaalla vasemmalla).
Lisäksi 2D-segmentointikartat saadaan säteilyohjauksella SOF:n tulosteesta, ennen kuin ne teksturoidaan GAN-generaattorilla. “Synthetiset” semanttiset segmentointikartat koodataan myös matalatiheysavaruuteen kolmen kerroksen kooderin kautta, jotta varmistetaan jatkuvuus, kun näkökulmaa muutetaan.
Koulutussuunnitelma sekoittaa tilallisesti kaksi satunnaista tyyliä kullekin semanttiselle alueelle:
Tutkijat väittävät, että SofGAN saavuttaa alemman Frechet Inception Distance (FID) kuin nykyiset vaihtoehtoiset lähestymistavat, sekä korkeamman Learned Perceptual Image Patch Similarity (LPIPS) -mittarin.
Aiemmat StyleGAN-lähestymistavat ovat usein joutuneet ongelmiin ominaisuuksien sekoittumisen vuoksi, jossa kuvan muodostavat elementit ovat kiinteästi sidottuja toisiinsa, mikä aiheuttaa ei-toivottuja elementtejä halutun elementin rinnalla (esim. korvakorut saattavat ilmestyä, kun korvan muoto renderöidään, ja se on koulutettu kuvaan, jossa on korvakorut).

Säteilyohjausta käytetään semanttisten segmentointikarttojen tilavuuden laskemiseen, mikä mahdollistaa useita näkökulmia.
Tietokannat ja koulutus
Kolmea tietokantaa käytettiin SofGAN:n kehittämisessä: CelebAMask-HQ, joka sisältää 30 000 korkean resoluution kuvaa CelebA-HQ -tietokannasta; NVIDIA:n Flickr-Faces-HQ (FFHQ), joka sisältää 70 000 kuvaa, joita tutkijat merkitsivät esikoulutetulla kasvontunnistimella; ja itse tuotettu ryhmä 122 muotokuvaa, joissa on manuaalisesti merkityt semanttiset alueet.
SOF koostuu kolmesta koulutettavasta alimodulista – hyperverkosta, säteilyohjaimesta (ks. yllä oleva kuva) ja luokittelijasta. Projektin Semantic Instance Wised (SIW) StyleGAN-generaattori on konfiguroitu samalla tavalla kuin StyleGAN2 tietyissä suhteissa. Tietojen lisäksi sovelletaan satunnaista skaalausta ja leikkausta, ja koulutuksessa on polun säännöstely joka neljäs askel. Koko koulutusprosessi kesti 22 päivää saavuttaaksesi 800 000 iteraatiota neljällä RTX 2080 Ti -näytönohjaimella CUDA 10.1:llä.
Artikkelissa ei mainita 2080 -korttien konfiguraatiota, joka voi sisältää 11-22 Gt VRAM:ia kussakin, mikä tarkoittaa, että koulutuksen aikana käytetty kokonais-VRAM on jossakin välillä 44 Gt ja 88 Gt.
Tutkijat huomauttavat, että hyväksytty, yleinen, korkean tason tulos alkoi ilmestyä varhain koulutuksessa, 1500 iteraation jälkeen, kolme päivää koulutuksen aloittamisen jälkeen. Loppuosa koulutuksesta kului hitaasti tavoitteena saada hienojakoinen yksityiskohta, kuten hiukset ja silmänpienet.
SofGAN saavuttaa yleensä realistisemman tuloksen yhdestä segmentointikartasta kuin vastaavat menetelmät, kuten NIVDIA:n SPADE ja Pix2PixHD, sekä SEAN.
Alhaalla on tutkijoiden julkaisema video. Lisää itse isännöityjä videoita on saatavilla projektisivulla.














