Andersons vinkel

GAN som et ansiktsrendereingsverktÃļy for ‘tradisjonell’ CGI

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google

MeningDa Generative Adversarial Networks (GANs) fÃļrst demonstrerte sin evne til ÃĨ gjenskape slÃĨende realistiske 3D-ansikter, utlÃļste dette en gullrush for det uutnyttede potensialet for GANs til ÃĨ skape tidsmessig konsistente videoer med menneskeansikter.

Noen steder i GANs latente rom, syntes det at det mÃĨ vÃĶre skjult orden og rasjonalitet – en skjema av nasjonal semantisk logikk, gravert i de latente kodene, som ville tillate en GAN ÃĨ generere konsistente multiple visninger og multiple tolkninger (sÃĨsom endringer i uttrykk) av det samme ansiktet – og deretter tilby en tidsmessig overbevisende deepfake-video-metode som ville blÃĨse autoencodere ut av vannet.

HÃļyopplÃļselig utdata ville vÃĶre trivialt sammenlignet med de lavopplÃļselige miljÃļene som GPU-begrensninger tvinger DeepFaceLab og FaceSwap til ÃĨ operere i, mens “omrÃĨdet for utveksling” av et ansikt (i autoencoder-arbeidsflyter) ville bli “skapingsomrÃĨdet” for en GAN, informert av et hÃĨndfull innputtbilder eller selv bare ett enkelt bilde.

Det ville ikke vÃĶre noen mer mismatch mellom “utveksling” og “vert” ansikter, fordi hele bildet ville bli generert fra scratch, inkludert hÃĨr, kinnben og de ytre ytterpunktene av ansiktslinjene, som ofte viser seg ÃĨ vÃĶre en utfordring for “tradisjonelle” autoencoder-deepfakes.

GAN-ansiktsvideo-vinteren

Det viste seg ÃĨ vÃĶre mye vanskeligere enn det. Til slutt viste disentanglement seg ÃĨ vÃĶre det sentrale problemet, og er fremdeles det primÃĶre utfordringen. Hvordan kan du holde et distinkt ansiktsidentitet, og endre posen eller uttrykket uten ÃĨ samle sammen en korpus av tusenvis av referansebilder som lÃĶrer en neural nettverk hva som skjer nÃĨr disse endringene blir gjennomfÃļrt, pÃĨ samme mÃĨte som autoencoder-systemer sÃĨ mÃļysommelig gjÃļr?

I stedet var det pÃĨfÃļlgende tenking i GAN-ansiktsenactment og syntese-forskning at en innputt-identitet kanskje kunne gjÃļres til et mÃĨl for teleologiske, generiske, templatte transformasjoner som ikke er identitetsspesifikke. Et eksempel pÃĨ dette ville vÃĶre ÃĨ anvende et uttrykk pÃĨ et GAN-ansikt som ikke var til stede i noen av bildene av personen som GAN kjenner til.

Fra 2022-papiret Tensor-based Emotion Editing in the StyleGAN Latent Space, blir templatte uttrykk anvendt pÃĨ et innputt-ansikt fra FFHQ-datasettet. Kilde: https://arxiv.org/pdf/2205.06102.pdf

Fra 2022-papiret Tensor-based Emotion Editing in the StyleGAN Latent Space, blir templatte uttrykk anvendt pÃĨ et innputt-ansikt fra FFHQ-datasettet. Kilde: https://arxiv.org/pdf/2205.06102.pdf

Det er ÃĨpenbart at en “en stÃļrrelse passer alle”-tilnÃĶrming ikke kan dekke mangfoldet av ansiktsuttrykk som er unikt for en enkelt person. Vi mÃĨ undre oss pÃĨ om et smil sÃĨ unikt som Jack Nicholsons eller Willem Dafoes noen gang kunne motta en trofast tolkning under pÃĨvirkning av slike “gjennomsnittlige uttrykk”-latente koder.

Hvem er denne charmerende latinske fremmede? Selv om GAN-metoden produserer et mer realistisk og hÃļyopplÃļselig ansikt, er transformasjonen ikke informert av multiple virkelige bilder av skuespilleren, som er tilfelle med DeepFaceLab, som trener omfattende og ofte pÃĨ en database av tusenvis av slike bilder. Her (bakgrunn) er et DeepFaceLab-modell importert til DeepFaceLive, en strÃļmmingsimplementering av den populÃĶre og kontroversielle programvaren. Eksempler er fra https://www.youtube.com/watch?v=9tr35y-yQRY (2022) og https://arxiv.org/pdf/2205.06102.pdf.

Hvem er denne charmerende latinske fremmede? Selv om GAN-metoden produserer et mer realistisk og hÃļyopplÃļselig ansikt, er transformasjonen ikke informert av multiple virkelige bilder av skuespilleren, som er tilfelle med DeepFaceLab, som trener omfattende pÃĨ en database av tusenvis av slike bilder, og derfor er likheten kompromittert. Her (bakgrunn) er et DeepFaceLab-modell importert til DeepFaceLive, en strÃļmmingsimplementering av den populÃĶre og kontroversielle programvaren. Eksempler er fra https://www.youtube.com/watch?v=9tr35y-yQRY (2022) og https://arxiv.org/pdf/2205.06102.pdf.

Et antall GAN-ansiktsuttrykk-redigeringsverktÃļy har blitt fremmet over de siste ÃĨrene, de fleste av dem behandler ukjente identiteter, hvor trofastheten av transformasjonene er umulig for den vanlige leseren ÃĨ vite, siden disse er ikke kjente ansikter.

Ukjente identiteter transformert i 2020-tilbudet Cascade-EF-GAN. Kilde: https://arxiv.org/pdf/2003.05905.pdf

Ukjente identiteter transformert i 2020-tilbudet Cascade-EF-GAN. Kilde: https://arxiv.org/pdf/2003.05905.pdf

Kanskje det GAN-ansiktsredigeringsverktÃļyet som har mottatt mest interesse (og sitater) de siste tre ÃĨrene er InterFaceGAN, som kan utfÃļre latente rom-gjennomlÃļp i latente koder relatert til pose (kamera/vinkel), uttrykk, alder, rase, kjÃļnn og andre essensielle kvaliteter.

1980-ÃĨrenes “morphing”-evner i InterFaceGAN og lignende rammer er hovedsakelig en mÃĨte ÃĨ illustrere veien mot transformasjon som et bilde projiseres tilbake gjennom en passende latent kode (sÃĨsom “alder”). I terms av ÃĨ produsere videoopptak med tidsmessig kontinuitet, kvalifiserer slike skjemaer til dags dato som “imponerende katastrofer”.

Hvis du legger til det vanskeligheten med ÃĨ skape tidsmessig konsistente hÃĨr, og det faktum at teknikken for latent kode-utforskning/hÃĨndtering ikke har noen innate tidsmessige retningslinjer ÃĨ jobbe med (og det er vanskelig ÃĨ vite hvordan man kan injicere slike retningslinjer i en ramme designet for ÃĨ akseptere og generere stille bilder, og som ikke har noen naturlig provisjon for video-utdata), kan det vÃĶre logisk ÃĨ konkludere at GAN ikke er All You Needâ„Ē for ansiktsvideo-syntese.

Derfor har pÃĨfÃļlgende innsats fÃļrt til inkrementelle forbedringer i disentanglement, mens andre har boltet pÃĨ andre konvensjoner i datavisualisering som en “guidance-lag”, sÃĨsom bruken av semantisk segmentering som en kontrollmekanisme i den seneste 2021 papiret SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing.

Semantisk segmentering som en metode for latent rom-instrumentalitet i SemanticStyleGAN. Kilde: https://semanticstylegan.github.io/

Semantisk segmentering som en metode for latent rom-instrumentalitet i SemanticStyleGAN. Kilde: https://semanticstylegan.github.io/

Parametrisk veiledning

GAN-ansikts-syntese-forskningsmiljÃļet gÃĨr stadig mer mot ÃĨ bruke “tradisjonelle” parametrisk CGI-ansikter som en metode for ÃĨ guide og bringe orden til de imponerende, men ustyrlige, latente kodene i et GANs latente rom.

Selv om parametrisk ansikts-primitiver har vÃĶrt en standard i datavisualiseringsforskning i over tyve ÃĨr, har interessen for denne tilnÃĶrmingen Ãļkt nylig, med Ãļkt bruk av Skinned Multi-Person Linear Model (SMPL) CGI-primitiver, en tilnÃĶrming som ble innfÃļrt av Max Planck-instituttet og ILM, og siden forbedret med Sparse Trained Articulated Human Body Regressor (STAR)-rammen.

SMPL (i dette tilfellet en variant kalt SMPL-X) kan pÃĨlegge en CGI-parametrisk mesh som stemmer overens med den estimerte posen (inkludert uttrykk, hvis nÃļdvendig) av hele menneskekroppen i et bilde, og tillate nye operasjoner ÃĨ utfÃļres pÃĨ bildet ved hjelp av den parametrisk meshen som en volumetrisk eller perseptuell retningslinje. Kilde: https://arxiv.org/pdf/1904.05866.pdf

SMPL (i dette tilfellet en variant kalt SMPL-X) kan pÃĨlegge en CGI-parametrisk mesh som stemmer overens med den estimerte posen (inkludert uttrykk, hvis nÃļdvendig) av hele menneskekroppen i et bilde, og tillate nye operasjoner ÃĨ utfÃļres pÃĨ bildet ved hjelp av den parametrisk meshen som en volumetrisk eller perseptuell retningslinje. Kilde: https://arxiv.org/pdf/1904.05866.pdf

Den mest anerkjente utviklingen i denne linjen har vÃĶrt Disneys 2019 Rendering med stil-initiativet, som slo sammen bruken av tradisjonelle teksturer med GAN-generert bilde, i et forsÃļk pÃĨ ÃĨ skape forbedret, “deepfake-liknende” animert utdata.

Gammelt mÃļter nytt i Disneys hybridtilnÃĶrming til GAN-genererte deepfakes. Kilde: https://www.youtube.com/watch?v=TwpLqTmvqVk

Gammelt mÃļter nytt i Disneys hybridtilnÃĶrming til GAN-genererte deepfakes. Kilde: https://www.youtube.com/watch?v=TwpLqTmvqVk

Disneys tilnÃĶrming pÃĨlegger tradisjonelt renderte CGI-facetter inn i en StyleGAN2-nettverk for ÃĨ “inpaint” menneskeansikter i “problematisk” omrÃĨder, hvor tidsmessig konsistens er et problem for video-generering – omrÃĨder som hudtekstur.

Rendering med stil-arbeidsflyten.

Rendering med stil-arbeidsflyten.

Siden den parametrisk CGI-hodet som guider denne prosessen kan justeres og endres for ÃĨ tilpasse brukeren, kan GAN-generert ansikt reflektere disse endringene, inkludert endringer i hodeposisjon og uttrykk.

Men resultatene demonstrerer det verste av begge verdener, og feiler fortsatt i ÃĨ holde hÃĨrtrekst og selv grunnleggende trekk konsistente:

En ny type uncanny valley oppstÃĨr fra Rendering med stil, selv om prinsippet fortsatt har noen potensial.

En ny type uncanny valley oppstÃĨr fra Rendering med stil, selv om prinsippet fortsatt har noen potensial.

2020-papiret StyleRig: Rigging StyleGAN for 3D Control over Portrait Images tar en stadig mer populÃĶr tilnÃĶrming, med bruk av tredimensjonale morfable ansiktsmodeller (3DMMs) som stedfortredere for ÃĨ endre egenskaper i en StyleGAN-miljÃļ, i dette tilfellet gjennom et nytt rigging-nettverk kalt RigNet:

3DMMs stÃĨr som stedfortredere for latente rom-tolkninger i StyleRig. Kilde: https://arxiv.org/pdf/2004.00121.pdf

3DMMs stÃĨr som stedfortredere for latente rom-tolkninger i StyleRig. Kilde: https://arxiv.org/pdf/2004.00121.pdf

Men, som vanlig med disse initiativene, ser resultater til dags dato ut til ÃĨ vÃĶre begrenset til minimale pose-manipulasjoner, og “uinformerte” uttrykk/affekt-endringer.

StyleRig forbedrer kontrollnivÃĨet, selv om tidsmessig konsistent hÃĨr fortsatt er en ulÃļst utfordring.

StyleRig forbedrer kontrollnivÃĨet, selv om tidsmessig konsistent hÃĨr fortsatt er en ulÃļst utfordring. Kilde: https://www.youtube.com/watch?v=eaW_P85wQ9k

Lignende utdata kan finnes fra Mitsubishi Researchs MOST-GAN, en 2021 papir som bruker ikke-lineÃĶre 3DMMs som en disentanglement-arkitektur, men som ogsÃĨ kjemper for ÃĨ oppnÃĨ dynamisk og konsistent bevegelse.

Den siste forskningen som forsÃļker ÃĨ instrumentalisere og disentanglement er One-Shot Face Reenactment on Megapixels, som igjen bruker 3DMM-parametrisk hoder som en vennlig grensesnitt for StyleGAN.

I MegaFR-arbeidsflyten til One-Shot Face Reenactment, utfÃļrer nettverket ansikts-syntese ved ÃĨ kombinere et invertert virkelige bilde med parametre tatt fra en rendret 3DMM-modell. Kilde: https://arxiv.org/pdf/2205.13368.pdf

I MegaFR-arbeidsflyten til One-Shot Face Reenactment, utfÃļrer nettverket ansikts-syntese ved ÃĨ kombinere et invertert virkelige bilde med parametre tatt fra en rendret 3DMM-modell. Kilde: https://arxiv.org/pdf/2205.13368.pdf

OSFR tilhÃļrer en voksende klasse av GAN-ansiktsredigeringsverktÃļy som sÃļker ÃĨ utvikle Photoshop/After Effects-liknende lineÃĶre redigerings-arbeidsflyter hvor brukeren kan inputte et Ãļnsket bilde som transformasjoner kan anvendes pÃĨ, i stedet for ÃĨ jakte gjennom det latente rommet for latente koder relatert til en identitet.

Igjen representerer parametrisk uttrykk en overordnet og upersonlig metode for ÃĨ injicere uttrykk, som fÃļrer til manipulasjoner som synes “uncanny” pÃĨ deres egen, ikke alltid positive mÃĨte.

Injicerte uttrykk i OSFR.

Injicerte uttrykk i OSFR.

Liksom tidligere arbeid kan OSFR inferere nÃĶre originale posisjoner fra ett enkelt bilde, og ogsÃĨ utfÃļre “frontalisering”, hvor et avsides posisjonert bilde oversettes til et mugshot:

Originalt (Ãļverst) og inferert mugshot-bilder fra en av implementeringene av OSFR detaljert i den nye papiren.

Originalt (Ãļverst) og inferert mugshot-bilder fra en av implementeringene av OSFR detaljert i den nye papiren.

I praksis er denne type inferens lignende noen av de fotogrammetriske prinsippene som ligger til grunn for Neural Radiance Fields (NeRF), bortsett fra at geometrien her mÃĨ defineres av ett enkelt bilde, i stedet for de 3-4 synspunktene som tillater NeRF ÃĨ tolke de manglende interstitielle posisjonene og skape utforskbar neural 3D-scene med mennesker.

(Men NeRF er heller ikke All You Needâ„Ē, siden det bÃĶrer pÃĨ en nesten annen sett med hindringer enn GANs i terms av ÃĨ produsere ansiktsvideo-syntese)

Har GAN en plass i ansiktsvideo-syntese?

Å oppnÃĨ dynamiske uttrykk og utenfor-distribusjon posisjoner fra ett enkelt kildebilde synes ÃĨ vÃĶre en alkeymi-liknende besettelse i GAN-ansikts-syntese-forskning for Ãļyeblikket, hovedsakelig fordi GANs er den eneste metoden som for Ãļyeblikket kan produsere ganske hÃļyopplÃļselige og relativt hÃļykvalitets neurale ansikter: selv om autoencoder-deepfake-rammer kan trene pÃĨ en mengde virkelige posisjoner og uttrykk, mÃĨ de operere pÃĨ VRAM-begrensede inndata/utdata-opplÃļsninger, og krever en “vert”; mens NeRF er lignende begrenset, og – i motsetning til de to andre tilnÃĶrmingene – har for Ãļyeblikket ingen etablerte metoder for ÃĨ endre ansiktsuttrykk, og lider av begrenset redigerbarhet generelt.

Det ser ut til at den eneste mÃĨten fremover for et nÃļyaktig CGI/GAN-ansikts-syntese-system er for et nytt initiativ ÃĨ finne en mÃĨte ÃĨ samle sammen en multi-bilde identitet-entitet innenfor det latente rommet, hvor en latent kode for en persons identitet ikke trenger ÃĨ reise hele veien over det latente rommet for ÃĨ utnytte relaterte pose-parametre, men kan henvise til sine egne relaterte (virkelige) bilder som referanser for transformasjoner.

Even i et slikt tilfelle, eller selv om hele StyleGAN-nettverket ble trent pÃĨ ett enkelt-identitets ansiktssett (lignende de treningssettene som autoencodere bruker), ville den manglende semantiske logikken fortsatt sannsynligvis trenge ÃĨ bli supplert med hjelpeteknologier som semantisk segmentering eller parametrisk 3DMM-ansikter, som, i et slikt scenario, ville i hvert fall ha mer materiale ÃĨ jobbe med.

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]