Andersonin kulma
Adoben tutkimus laajentaa eriytettyjä GAN-kasvojen muokkausta

On helppo ymmärtää, miksi sidos on ongelma kuvansynteesissä, koska se on usein ongelma myös muilla elämänaloilla; esimerkiksi on paljon vaikeampaa poistaa kurkumaa currysämpylästä kuin heittää pois hapan sipuli burgerista, ja käytännössä mahdoton poistaa sokeri kupista kahvia. Jotkut asiat tulevat aina paketteina.
Vastaavasti sidos on este kuvansynteesirakenteille, jotka haluavat erottaa eri ominaisuuksia ja käsitteitä käyttäessään koneoppimista kasvojen luomiseen tai muokkaamiseen (tai koiria, veneitä tai muita aiheita).
Jos voit erottaa säikeitä, kuten ikä, sukupuoli, hiusten väri, ihon sävy, emotion ja niin edelleen, sinulla on todellinen instrumentaalisuus ja joustavuus kehyksessä, joka voi luoda ja muokata kasvoja todella hienojakoisella tasolla ilman epätoivottuja “matkustajia” näissä muunnoksissa.
Enimmillään sidos (ylävasen), voit vain muuttaa kuvaa oppimalla GAN-verkkoa toisen henkilön kuvaan.
Tämä on käytännössä viimeisimmän AI-tietokoneen näkötekniikan käyttäminen saavuttamaan jotain, mitä ratkaistiin muilla tavoilla yli 30 vuotta sitten.
Jonkin verran erottelulla (keskivertaisessa erottelussa ylempänä kuvassa), on mahdollista tehdä tyyliin perustuvia muutoksia, kuten hiusten väri, ilme, meikki ja rajoitettu pään kiertoliike, muun muassa.

Lähde: FEAT: Face Editing with Attention, helmikuu 2022, https://arxiv.org/pdf/2202.02713.pdf
On ollut useita yrityksiä viimeisen kahden vuoden aikana luoda interaktiivisia kasvojen muokkausympäristöjä, jotka sallivat käyttäjän muuttaa kasvonpiirteitä liukusäätimillä ja muiden perinteisten käyttöliittymätoimintojen avulla, säilyttäen kuitenkin kasvojen perusominaisuudet, kun tehdään lisäyksiä tai muutoksia. Tämä on kuitenkin osoittautunut haasteeksi johtuen latenttilaajan GAN:n perusominaisuuden ja tyylin sidosongelmasta.
Esimerkiksi silmiensuojien ominaisuus on usein sekoittunut vanhenemisen ominaisuuteen, mikä tarkoittaa, että silmiensuojien lisääminen voi myös “vanhentaa” kasvoja, kun taas vanheneminen voi lisätä silmiensuojia, riippuen sovelletun erottelun määrästä (ks. “Testaus” alla esimerkkejä).
Eniten on ollut lähes mahdotonta muuttaa hiusten väriä ja muita hiuksia koskevia piirteitä ilman, että hiuksia ja niiden asentoa on uudelleenlaskettu, mikä antaa “siristävän” siirtymävaikutuksen.

Lähde: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w
Latenttilaajan GAN-kierto
Uusi Adoben johdolla tehty tutkimus esitettiin WACV 2022:lle, ja se tarjoaa uuden lähestymistavan näihin perusongelmiin tutkimuksessa nimeltä Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images.

Lisämateriaalia tutkimuksesta Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Tässä nähdään, että perusominaisuudet oppimissa kasvoissa eivät ole vedetty mukaan muutoksiin, jotka eivät liity niihin. Katso tämän artikkelin lopussa oleva video, jossa on parempi tarkkuus ja yksityiskohdat. Lähde: https://www.youtube.com/watch?v=rf_61llRH0Q
Tutkimus on mielenkiintoinen osittain, koska Adobe on toiminut tässä alueessa jo jonkin aikaa, ja on houkuttelevaa ajatella, että tämä toiminnallisuus tulee sisällytettäväksi Creative Suite -projektiin seuraavien vuosien aikana; mutta ennen kaikkea, koska arkkitehtuuri, joka on luotu tämän projektiin, lähestyy visuaalisen eheytymisen ylläpitämistä GAN-kasvojen muokkaimessa muutosten aikana toisella tavalla.
Tekijät ilmoittavat:
‘[Me] koulutamme neuroverkon suorittamaan latenttilaajan muodonmuutoksen, joka löytää latentin koodauksen, joka vastaa kuvaa, jossa on muutettu ominaisuus. Koska tekniikka on yksittäinen, se ei riipu lineaarisesta tai epälineaarisesta ominaisuuksien muutoksen asteittaisesta polusta.
‘Kouluttamalla verkkoa loppuun asti koko generointiputken yli, järjestelmä voi sopeutua valmiiden generointirakenteiden latenttilaikkoihin. Säilytysominaisuudet, kuten henkilön identiteetin ylläpitäminen, voidaan koodata koulutusmenetelmien muodossa.
‘Kun latenttilaajan verkko on koulutettu, se voidaan uudelleenkäyttää mihin tahansa kuvaan ilman uudelleenkoulutusta.’
Tämä viimeinen osa tarkoittaa, että ehdotettu arkkitehtuuri saapuu loppukäyttäjälle valmiina. Se edellyttää edelleen neuroverkon suorittamista paikallisilla resursseilla, mutta uudet kuvat voidaan “laittaa” muokattaviksi lähes välittömästi, koska kehys on riittävän irrotettu, jotta se ei tarvitse lisää kuva-kohtaista koulutusta.

Sukupuoli ja parta muutettiin, kun liukusäätimet piirtävät satunnaisia ja mielivaltaisia polkuja latenttilaikan läpi, eivät vain ‘hiovat päätepisteiden välillä’. Katso video tämän artikkelin lopussa, jossa on enemmän muodonmuutoksia paremmalla resoluutiolla.
Yksi pääsaavutus tässä työssä on verkon kyky “jäädyttää” identiteetit latenttilaikassa muuttamalla vain ominaisuutta kohdevektorissa ja tarjoamalla “korjaustermejä”, jotka säilyttävät identiteetin muunnoksessa.
Itse asiassa ehdotettu verkko on upotettu laajempaan arkkitehtuuriin, joka orkesteroi kaikki prosessoidut elementit, jotka kulkevat esikoulutettujen komponenttien läpi, joiden painot on jäädytetty, eikä niistä aiheudu ei-toivottuja sivuvaikutuksia muutoksissa.
Koska koulutusprosessi perustuu tripletteihin, jotka voidaan luoda joko siemenkuvasta (GAN-kääntämisen alla) tai olemassa olevasta alkuperäisestä latenttikoodauksesta, koko koulutusprosessi on valvomaton, ja tavanomaiset merkitsemis- ja kuraattorijärjestelmien toimet ovat käytännössä sisällytetty arkkitehtuuriin. Itse asiassa uusi järjestelmä käyttää valmiita attribuuttimenetelmiä:
‘[Verkkomme] määrä ominaisuuksia, joita voidaan hallita itsenäisesti, on rajoitettu vain tunnistimien (attribuuttimenetelmien) kykyyn – jos sinulla on tunnistin ominaisuudelle, voit lisätä sen mihin tahansa kasvoihin. Kokeissamme koulutimme latenttilaajan verkon sallimaan 35 eri kasvon ominaisuuden säätämisen, enemmän kuin mikään aiempi lähestymistapa.’
Järjestelmä sisältää myös lisäsuojauden ei-toivottuja “sivuvaikutuksia” vastaan: jos ei ole pyydetty ominaisuuden muutosta, latenttilaajan verkko kartoittaa latenttivektorin itselleen, mikä lisää edelleen kohteen identiteetin vakaata säilymistä.
Kasvojen tunnistus
Yksi toistuva ongelma GAN- ja koodarin/puraajan perustuvissa kasvojen muokkaajissa viime vuosina on ollut, että sovelletut muutokset ovat heikentäneet muistinvaraisuutta. Tätä vastaan Adobe-projekti käyttää upotettua kasvojen tunnistusverkkoa nimeltä FaceNet erottimena.

Projektin arkkitehtuuri, katso alhaalla vasemmalla FaceNetin sisällyttäminen. Lähde: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.
(Henkilökohtaisena huomautuksena tämä näyttää rohkaisevalta askelelta kohti standardien kasvojen tunnistus- ja ilmeiden tunnistusjärjestelmien integroimista generatiivisiin verkostoihin, mikä on todennäköisesti paras tapa edetä ylittämään sokean pikseli-pikseli-kartan, joka hallitsee nykyisiä deepfake-arkkitehtuureja ilmeen uskottavuuden ja muiden tärkeiden alueiden kustannuksella kasvojen luomisessa.)
Kaikki alueet latenttilaikassa
Toinen vaikuttava ominaisuus tästä kehyksestä on sen kyky liikkua mielivaltaisesti potentiaalisissa muodonmuutoksissa latenttilaikassa käyttäjän mielin mukaan. Useat aiemmat järjestelmät, jotka tarjosivat tutkimisliittymät, jättivät käyttäjän käytännössä “hiovat” kiinteiden ominaisuusmuodonmuutosaikajanojen välillä – vaikuttava, mutta usein melko lineaarinen tai määrätty kokemus.

GAN-tasapainon parantamisesta spatial awarenessin kautta: tässä käyttäjä hioo joukkoa potentiaalisia siirtymäkohtia kahden latenttilaikan sijainnin välillä, mutta latenttilaikan ennalta määritettyjen sijaintien puitteissa. Soveltamaan muiden tyyppien muodonmuutoksia samasta aineistosta vaaditaan uudelleenkonfigurointia ja/tai uudelleenkoulutusta. Lähde: https://genforce.github.io/eqgan/
Lisäksi käyttäjä voi myös manuaalisesti “jäädyttää” elementtejä, jotka halutaan säilyttää muodonmuutosprosessin aikana. Tällä tavoin käyttäjä voi varmistaa, että (esimerkiksi) taustat eivät siirry tai että silmät pidetään auki tai kiinni.
Tiedot
Attribuuttimenetelmäverkko koulutettiin kolmella verkolla: FFHQ, CelebAMask-HQ ja paikallinen, GAN-luotu verkko, joka saatiin näyttelemällä 400 000 vektoria StyleGAN-V2:n Z-avaruudesta.
Poissa-jaosta (OOD) kuvat poistettiin, ja attribuutit purettiin Microsoftin Face API:n avulla, ja tuloksena oleva kuvakokoelma jaettiin 90/10, jättäen 721 218 koulutuskuvaa ja 72 172 testikuvaa vertailtavaksi.
Testaus
Vaikka kokeellinen verkko oli alun perin konfiguroitu ottamaan 35 potentiaalista muodonmuutosta, ne supistuivat kahdeksaan, jotta voidaan tehdä vertaileva testaus vertailukelpoisia kehyksiä InterFaceGAN, GANSpace ja StyleFlow vastaan.
Kahdeksan valittua attribuuttia olivat Ikä, Kaljuus, Parta, Ilme, Sukupuoli, Silmälasit, Pitch ja Yaw. Se oli välttämätöntä uudelleenkonfiguroida kilpailevia kehyksiä joillekin kahdeksasta attribuutista, jotka eivät olleet mukana alkuperäisessä jakelussa, kuten lisääminen kaljuus ja parta InterFaceGAN:lle.
Kuten odottaa, suurempi määrä sidosongelmaa tapahtui vastakkaisissa arkkitehtuureissa. Esimerkiksi yhdessä testissä InterFaceGAN ja StyleFlow molemmat muuttivat kohteen sukupuolta, kun pyydettiin soveltamaan ikä:

Kaksi kilpailevaa kehyksistä kietoi sukupuolen muutoksen ‘ikä’-muodonmuutokseen, muuttaen myös hiusten värin ilman suoran pyynnön käyttäjältä.
Lisäksi kaksi vastustajaa totesi, että silmälasit ja ikä ovat erottamattomia piirteitä:
Se ei ole yhdenmukainen voitto tutkimukselle: kuten voidaan nähdä tämän artikkelin lopussa olevasta upotetusta videosta, kehys on vähiten tehokas, kun yritetään ekstrapoloida monia kulmia (yaw), kun taas GANSpace saa yleisesti paremman tuloksen ikä ja silmälasien asettamisessa. Latenttilaajan kehys oli tasapuolinen GANSpaceen ja StyleFlow’hon verrattuna pitchin (pään kulman) lisäämisessä.

Tulokset laskettiin MTCNN-kasvontunnistimen kalibroinnin perusteella. Alempia tuloksia on parempia.
Lisätietoja ja parempaa resoluutiota esimerkeistä varten katso tutkimuksen liitteenä oleva video alla.
Julkaistu ensimmäisen kerran 16. helmikuuta 2022.














