Andersons vinkel

Adobe Research Udvider Disentangled GAN Ansigt Redigering

mm
Føj Unite.AI til dine foretrukne kilder på Google

Det er ikke svært at forstå, hvorfor entanglement er et problem i billedsynthese, fordi det ofte er et problem i andre områder af livet; for eksempel er det langt sværere at fjerne kurkuma fra en curry end at smide picklen ud af en burger, og det er praktisk taget umuligt at desødde en kop kaffe. Nogle ting kommer bare i pakken.

Ligeledes er entanglement en hindring for billedsynthese-arkitekturer, der gerne vil adskille forskellige funktioner og koncepter, når de bruger maskinel læring til at oprette eller redigere ansigter (eller hunde, både, eller enhver anden domæne).

Hvis man kunne adskille tråde som alder, køn, hårfarve, hudtone, følelse og så videre, ville man have begyndelsen på rigtig instrumentlighed og fleksibilitet i en ramme, der kunne oprette og redigere ansigtsbilleder på et virkelig detaljeret niveau, uden at trække uønskede “passagerer” med i disse omformninger.

Ved maksimal entanglement (øverst til venstre) kan man kun ændre billedet af et lært GAN-netværk til billedet af en anden person.

Dette er effektivt at bruge den seneste AI-computervisionsteknologi til at opnå noget, der blev løst ved andre midler for over 30 år siden.

Med en vis grad af adskillelse (‘Medium Separation’ i tidligere ovenstående billed) er det muligt at udføre stilbaserede ændringer såsom hårfarve, udtryk, kosmetisk ansøgning og begrænset hovedrotation, blandt andre.

Kilde: FEAT: Face Editing with Attention, februar 2022, https://arxiv.org/pdf/2202.02713.pdf

Kilde: FEAT: Face Editing with Attention, februar 2022, https://arxiv.org/pdf/2202.02713.pdf

Der har været en række forsøg i de sidste to år på at oprette interaktive ansigtsredigeringsmiljøer, der tillader en bruger at ændre ansigtskarakteristika med skydere og andre traditionelle brugergrænsefladeinteraktioner, mens de fastholdt kernefunktionerne af målansigtet intakt, når der tilføjes eller ændres noget. Det har dog vist sig at være en udfordring på grund af den underliggende funktion/stil-entanglement i GAN’ens latente rum.

For eksempel er briller-egenskaben ofte sammenflettet med aldrende-egenskaben, hvilket betyder, at tilføjelse af briller også kan “ældre” ansigtet, mens aldring af ansigtet kan tilføje briller, afhængigt af graden af anvendt adskillelse af højniveaufunktioner (se “Testing” nedenfor for eksempler).

Det er næsten umuligt at ændre hårfarve og andre hårfacetter uden, at håren og dens disposition bliver omregnet, hvilket giver en “sizzlig”, overgangseffekt.

Kilde: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Kilde: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Latent-til-Latent GAN Traversal

En ny Adobe -led paper indgivet til WACV 2022 tilbyder en ny tilgang til disse underliggende problemer i en paper med titlen Latent til Latent: En lært mapper til identitetsbevarende redigering af multiple ansigtsattributter i StyleGAN-genererede billeder.

Supplementalmateriale fra papiret Latent til Latent: En lært mapper til identitetsbevarende redigering af multiple ansigtsattributter i StyleGAN-genererede billeder. Her ser vi, at basis-karakteristika i det lært ansigt ikke trækkes ind i urelaterede ændringer. Se fuld video-embed nedenfor for bedre detalje og opløsning. Kilde: https://www.youtube.com/watch?v=rf_61llRH0Q

Supplementalmateriale fra papiret Latent til Latent: En lært mapper til identitetsbevarende redigering af multiple ansigtsattributter i StyleGAN-genererede billeder. Her ser vi, at basis-karakteristika i det lært ansigt ikke trækkes ind i urelaterede ændringer. Se fuld video-embed nedenfor for bedre detalje og opløsning. Kilde: https://www.youtube.com/watch?v=rf_61llRH0Q

Papiret er ledet af Adobe Applied Scientist Siavash Khodadadeh, sammen med fire andre Adobe-forskere og en forsker fra Department of Computer Science på University of Central Florida.

Arbejdet er interessant dels fordi Adobe har været aktiv i dette område i nogen tid, og det er fristende at forestille sig, at denne funktionalitet kommer ind i et Creative Suite-projekt i de næste få år; men primært fordi arkitekturen, der er oprettet til projektet, tager en anden tilgang til at fastholde visuel integritet i en GAN-ansigtsrediger, mens ændringer udføres.

Forfatterne erklærer:

‘[Vi] træner et neuralt netværk til at udføre en latent-til-latent-transformation, der finder den latente kodning, der svarer til billedet med den ændrede attribut. Da teknikken er one-shot, afhænger den ikke af en lineær eller ikke-lineær trajektorie af den gradvise ændring af attributterne.’

‘Ved at træne netværket end-to-end over hele genereringspipeline kan systemet tilpasse sig til de latente rum af off-the-shelf generator-arkitekturer. Bevarelsesejendomme, såsom fastholdelse af personens identitet, kan kodificeres i form af trænings-tab.

‘Når den latent-til-latent-netværk var trænet, kan det genbruges til vilkårlige billeder uden gen-træning.’

Dette sidste punkt betyder, at den foreslåede arkitektur ankommer hos slutbrugeren i en færdig tilstand. Det skal stadig køre et neuralt netværk på lokale ressourcer, men nye billeder kan “droppes ind” og være klar til ændring næsten med det samme, da rammen er tilstrækkeligt afkoblet til ikke at kræve yderligere billedspecifik træning.

Køn og ansigtsbehåring ændret, da skydere plotter tilfældige og vilkårlige stier gennem det latente rum, ikke kun 'scubber mellem endepunkter'.

Køn og ansigtsbehåring ændret, da skydere plotter tilfældige og vilkårlige stier gennem det latente rum, ikke kun ‘scubber mellem endepunkter’. Se video embed nedenfor for flere transformationer i bedre opløsning.

Among de vigtigste resultater i arbejdet er netværkets evne til at “fryse” identiteter i det latente rum ved at ændre kun attributten i en målvektor og give “korrektionsbetingelser”, der bevare identiteter, der omformes.

Essentiel set er det foreslåede netværk indlejret i en bredere arkitektur, der orkestrerer alle de behandlede elementer, der passerer gennem forudtrænede komponenter med frosne vægte, der ikke vil producere uønskede laterale effekter på transformationer.

Da træningsprocessen afhænger af triplets, der kan genereres enten af et seed-billede (under GAN-inversion) eller en eksisterende initial latent-kodning, er hele træningsprocessen unsupervised, med de underforståede handlinger af den sædvanlige række af mærknings- og kurations-systemer i sådanne systemer effektivt indlejret i arkitekturen. Faktisk bruger det nye system off-the-shelf-attribut-regressorer:

‘[Antallet af] attributter, som vores netværk kan uafhængigt kontrollere, er kun begrænset af erkendelses-evnene (s) – hvis man har en erkendelse for en attribut, kan vi tilføje det til vilkårlige ansigter. I vores eksperimenter trænede vi det latent-til-latent-netværk til at tillade justering af 35 forskellige ansigtsattributter, mere end nogen tidligere tilgang.’

Systemet inkorporerer en yderligere sikkerhedsforanstaltning mod uønskede “side-effekt”-transformationer: i mangelen på en anmodning om en attribut-ændring, vil det latent-til-latent-netværk kortlægge en latent-vektor til sig selv, hvilket yderligere øger den stabile vedvarende af mål-identiteten.

Ansigtsgenkendelse

En tilbagevendende problem med GAN og encoder/decoder-baserede ansigtsredigeringer i de sidste par år har været, at anvendte transformationer har en tendens til at degradere lighed. For at bekæmpe dette bruger Adobe-projektet et indlejret ansigtsgenkendelsesnetværk kaldet FaceNet som en diskriminator.

Projekt-arkitektur, se nedre midt-venstre for inklusion af FaceNet. Kilde: Latent til Latent: En lært mapper til identitetsbevarende redigering af multiple ansigtsattributter i StyleGAN-genererede billeder, OpenAccess.

Projekt-arkitektur, se nedre midt-venstre for inklusion af FaceNet. Kilde: Latent til Latent: En lært mapper til identitetsbevarende redigering af multiple ansigtsattributter i StyleGAN-genererede billeder, OpenAccess.

(På en personlig note synes dette at være en opmuntrende bevægelse mod integration af standard ansigtsgenkendelse og selv udtryksgenkendelsessystemer i generative netværk, sandsynligvis den bedste vej frem for at overvinde den blinde pixel-til-pixel-mapping, der dominerer nuværende deepfake-arkitekturer på bekostning af udtryksfidelitet og andre vigtige domæner i ansigtsgenereringssektoren.)

Adgang til alle områder i det latente rum

En anden imponerende funktion i rammen er dens evne til at rejse vilkårligt mellem potentielle transformationer i det latente rum, efter brugerens ønske. Flere tidligere systemer, der tilbød eksplorative grænseflader, efterlod ofte brugeren med at “scubbe” mellem faste funktionstransformations-tidslinjer – imponerende, men ofte ret lineære eller proskriptive oplevelser.

Fra Forbedring af GAN-ækvilibrium ved at øge spatial bevidsthed: her scubber brugeren gennem en række af potentielle overgangspunkter mellem to latente-rum-locater, men inden for rammerne af forudtrænede locater i det latente rum. For at anvende andre typer af transformationer baseret på samme materiale er omkonfiguration og/eller gen-træning nødvendig. Kilde: https://genforce.github.io/eqgan/

Fra Forbedring af GAN-ækvilibrium ved at øge spatial bevidsthed: her scubber brugeren gennem en række af potentielle overgangspunkter mellem to latente-rum-locater, men inden for rammerne af forudtrænede locater i det latente rum. For at anvende andre typer af transformationer baseret på samme materiale er omkonfiguration og/eller gen-træning nødvendig. Kilde: https://genforce.github.io/eqgan/

I tillæg til at være modtagelig for helt nye bruger-billeder kan brugeren også manuelt “fryse” elementer, som de ønsker at bevare under transformationsprocessen. På denne måde kan brugeren sikre, at (for eksempel) baggrunde ikke skifter, eller at øjne holdes åbne eller lukkede.

Data

Attribut-regressionsnetværket blev trænet på tre netværk: FFHQ, CelebAMask-HQ og et lokalt, GAN-genereret netværk, der blev erhvervet ved at sampile 400.000 vektorer fra Z-rummet af StyleGAN-V2.

Udenfor-distribution (OOD)-billeder blev filtreret væk, og attributter blev ekstraheret ved hjælp af Microsofts Face API, og det resulterende billedsæt blev delt 90/10, hvilket efterlod 721.218 træningsbilleder og 72.172 testbilleder til sammenligning.

Test

Selv om det eksperimentelle netværk oprindeligt var konfigureret til at kunne håndtere 35 potentielle transformationer, blev disse reduceret til otte for at kunne udføre analoge tests mod de sammenlignelige rammer InterFaceGAN, GANSpace og StyleFlow.

De otte valgte attributter var Alder, Kalthed, Skæg, Udtryk, Køn, Briller, Pitch og Yaw. Det var nødvendigt at omkonfigurere de konkurrerende rammer for visse af de otte attributter, der ikke var med i den oprindelige distribution, såsom tilføjelse af kalthed og skæg til InterFaceGAN.

Som forventet opstod en højere grad af entanglement i de rivaliserende arkitekturer. For eksempel ændrede InterFaceGAN og StyleFlow begge kønnet, når de blev bedt om at anvende alder:

To af de konkurrerende rammer rullede en kønsændring ind i 'alder'-transformationen, og ændrede også hårfarve uden direkte bud fra brugeren.

To af de konkurrerende rammer rullede en kønsændring ind i ‘alder’-transformationen, og ændrede også hårfarve uden direkte bud fra brugeren.

Dertil kom, at to af rivalerne fandt, at briller og alder er usammenhængende aspekter:

Briller og hårfarve-ændring kastet ind som en bonus!

Briller og hårfarve-ændring kastet ind som en bonus!

Det er ikke en uniform sejr for forskningen: som kan ses i den vedlagte video, der er indlejret i slutningen af artiklen, er rammen mindst effektiv, når det kommer til at ekstrapolere diverse vinkler (yaw), mens GANSpace har en bedre generel result for alder og påtværing af briller. Det latent-til-latent-netværk var på niveau med GANSpace og StyleFlow med hensyn til tilføjelse af pitch (hovedvinkel).

Resultater beregnet på basis af en kalibrering af MTCNN-ansigtsgenkendelsen. Lavere resultater er bedre.

Resultater beregnet på basis af en kalibrering af MTCNN-ansigtsgenkendelsen. Lavere resultater er bedre.

For yderligere detaljer og bedre opløsning af eksempler, se papirets vedlagte video nedenfor.

 

Offentliggjort første gang den 16. februar 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai