Andersons vinkel

Adobe Research Utvider Disentangled GAN Ansikt Redigering

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Det er ikke vanskelig å forstå hvorfor entanglement er et problem i bilde syntese, fordi det ofte er et problem i andre områder av livet; for eksempel, er det mye vanskeligere å fjerne kurkuma fra en karrirett enn det er å kaste pickles i en burger, og det er praktisk talt umulig å desødde en kopp kaffe. Noen ting kommer bare pakket.

Likewise er entanglement en hindring for bilde syntese arkitekturer som helst ville skille ut forskjellige funksjoner og konsepter når de bruker maskinlæring til å lage eller redigere ansikter (eller hunder, båter, eller noe annet område).

Hvis du kunne skille ut tråder som alder, kjønn, hårfarge, hudtone, emoticon, og så videre, ville du ha begynnelsen på virkelig instrumentell og fleksibilitet i en ramme som kunne lage og redigere ansiktsbilder på et virkelig granulert nivå, uten å dra uønskede “passasjerer” inn i disse konversjonene.

Ved maksimalt entanglement (øverst til venstre), er alt du kan gjøre å endre bildet av et lært GAN-nettverk til bildet av en annen person.

Dette er effektivt å bruke den siste AI datamaskin visjonsteknologien til å oppnå noe som ble løst av andre midler over tretti år siden.

Med en viss grad av separasjon (‘Medium Separation’ i tidligere ovenfor bilde), er det mulig å utføre stilbaserte endringer som hårfarge, uttrykk, kosmetisk anvendelse og begrenset hode rotasjon, blant andre.

Kilde: FEAT: Face Editing with Attention, februar 2022, https://arxiv.org/pdf/2202.02713.pdf

Kilde: FEAT: Face Editing with Attention, februar 2022, https://arxiv.org/pdf/2202.02713.pdf

Det har vært flere forsøk i løpet av de siste to årene på å lage interaktive ansiktsredigeringsmiljøer som lar en bruker endre ansiktskarakteristika med skyvere og andre tradisjonelle UI-interaksjoner, mens de holder fast ved kjernefunksjoner i målansiktet intakt når de legger til eller endrer ting. Men dette har vist seg å være en utfordring på grunn av den underliggende funksjon/stil entanglement i latentrommet til GAN.

For eksempel er briller ofte sammenflettet med alder, noe som betyr at å legge til briller kan også “alde” ansiktet, mens å alde ansiktet kan legge til briller, avhengig av graden av anvendt separasjon av høynivåfunksjoner (se “Testing” nedenfor for eksempler).

De fleste merkverdige er at det har vært nesten umulig å endre hårfarge og andre hårfacet uten at hårfilene og disposisjonen blir omregnet, noe som gir en “sizzlig”, overgangseffekt.

Kilde: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Kilde: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Latent-til-Latent GAN Traversering

En ny Adobe -ledet papir inngikk for WACV 2022 tilbyr en ny tilnærming til disse underliggende problemene i en papir med tittelen Latent til Latent: En Lært Mapper for Identitet Bevarende Redigering av Flere Ansiktsattributter i StyleGAN-genererte Bilder.

Supplementalmateriale fra papiret Latent til Latent: En Lært Mapper for Identitet Bevarende Redigering av Flere Ansiktsattributter i StyleGAN-genererte Bilder. Her ser vi at basekarakteristika i det lært ansiktet ikke blir trukket inn i urelaterte endringer. Se fullt videoinnlegg ved slutten av artikkelen for bedre detalj og oppløsning. Kilde: https://www.youtube.com/watch?v=rf_61llRH0Q

Supplementalmateriale fra papiret Latent til Latent: En Lært Mapper for Identitet Bevarende Redigering av Flere Ansiktsattributter i StyleGAN-genererte Bilder. Her ser vi at basekarakteristika i det lært ansiktet ikke blir trukket inn i urelaterte endringer. Se fullt videoinnlegg ved slutten av artikkelen for bedre detalj og oppløsning. Kilde: https://www.youtube.com/watch?v=rf_61llRH0Q

Papiret er ledet av Adobe Applied Scientist Siavash Khodadadeh, sammen med fire andre Adobe-forskere, og en forsker fra Department of Computer Science ved University of Central Florida.

Artikkelen er interessant delvis fordi Adobe har vært aktive i dette området i en stund, og det er fristende å forestille seg denne funksjonaliteten kommer inn i et Creative Suite-prosjekt i de neste årene; men hovedsakelig fordi arkitekturen som ble skapt for prosjektet tar en annen tilnærming til å vedlikeholde visuell integritet i en GAN-ansiktsredigeringsverktøy mens endringer blir gjort.

Forfatterne erklærer:

‘[Vi] trener et neuralt nettverk til å utføre en latent-til-latent transformasjon som finner den latente kodingen som tilsvarer bildet med den endrede attributten. Siden teknikken er one-shot, avhenger den ikke av en lineær eller ikke-lineær trajektorie av den gradvise endringen av attributtene.’

‘Ved å trene nettverket end-to-end over hele genereringspipelinen, kan systemet tilpasse seg til de latente rommene til ferdige generatorarkitekturer. Bevarende egenskaper, som å vedlikeholde identiteten til personen, kan kodeles i form av treningstap.

‘Når den latent-til-latent nettverket var trent, kan det gjenbrukes for vilkårlige bilder uten om-trening.’

Dette siste betyr at den foreslåtte arkitekturen kommer med sluttkunden i en ferdig tilstand. Det må fortsatt kjøre et neuralt nettverk på lokale ressurser, men nye bilder kan “droppes inn” og være klare for å endre nesten umiddelbart, siden rammen er dekket nok til ikke å trenge ytterligere bilde-spesifikk trening.

Kjønn og ansiktsbehåring endret som skyvere plotter vilkårlige og arbitrære stier gjennom det latente rommet, ikke bare 'skrubbing mellom endepunkter'.

Kjønn og ansiktsbehåring endret som skyvere plotter vilkårlige og arbitrære stier gjennom det latente rommet, ikke bare ‘skrubbing mellom endepunkter’. Se video innlegg ved slutten av artikkelen for flere transformasjoner i bedre oppløsning.

Blant de viktigste prestasjonene i arbeidet er nettverkets evne til å “fryse” identiteter i det latente rommet ved å endre bare attributten i en målvektor, og å gi “korreksjonsuttrykk” som konserverer identiteter som blir transformert.

Essensielt er det foreslåtte nettverket innbygget i en bredere arkitektur som orkestrerer alle prosesserte elementer, som passerer gjennom forhånds-trente komponenter med frosne vekter som ikke vil produsere uønskede laterale effekter på transformasjoner.

Siden treningsprosessen avhenger av tripletter som kan genereres enten av et seed-bilde (under GAN-inversjon) eller en eksisterende initial latent koding, er hele treningsprosessen usupert, med de tause handlingene til de vanlige rekkefølger av labeling og kureringssystemer i slike systemer effektivt bakket inn i arkitekturen. I virkeligheten bruker det nye systemet ferdige attributt-regressorer:

‘[Antallet] av attributter som vårt nettverk kan uavhengig kontrollere er bare begrenset av evnene til gjenkjenneren(e) – hvis du har en gjenkjenner for en attributt, kan vi legge til den til vilkårlige ansikter. I våre eksperimenter, trente vi det latent-til-latent nettverket til å tillate justering av 35 forskjellige ansiktsattributter, mer enn noen tidligere tilnærming.’

Systemet inkorporerer en ekstra sikkerhet mot uønskede “side-effekt” transformasjoner:

‘I fravær av en forespørsel om en attributtendring, vil det latent-til-latent nettverket kartlegge en latent vektor til seg selv, og øke stabiliteten til målidentiteten.’

Ansiktsgjenkjenning

En gjentakende problem med GAN og encoder/decoder-basert ansiktsredigeringsverktøy de siste årene har vært at anvendte transformasjoner tenderer til å degradere likhet. For å bekjempe dette, bruker Adobe-prosjektet et innbygget ansiktsgjenkjenning nettverk kalt FaceNet som en diskriminator.

Prosjektarkitektur, se nedre midt-venstre for inklusjon av FaceNet. Kilde: Latent til Latent: En Lært Mapper for Identitet Bevarende Redigering av Flere Ansiktsattributter i StyleGAN-genererte Bilder, OpenAccess.

Prosjektarkitektur, se nedre midt-venstre for inklusjon av FaceNet. Kilde: Latent til Latent: En Lært Mapper for Identitet Bevarende Redigering av Flere Ansiktsattributter i StyleGAN-genererte Bilder, OpenAccess.

(På en personlig note, dette ser ut til å være en oppmuntrende bevegelse mot integrasjon av standard ansiktsidentifikasjon og selv uttrykksgjenkjenningssystemer i generative nettverk, kanskje den beste måten fremover for å overvinne den blinde piksel-til-piksel-mapping som dominerer nåværende deepfake-arkitekturer på bekostning av uttrykksfidelitet og andre viktige domener i ansiktsgenereringssektoren.)

Tilgang til alle områder i det latente rommet

En annen imponerende funksjon i rammen er dens evne til å reise vilkårlig mellom potensielle transformasjoner i det latente rommet, på brukerens ønske. Flere tidligere systemer som ga utforskningsgrensesnitt lot brukeren essensielt “skrubbe” mellom faste funksjonstransformasjons-tidslinjer – imponerende, men ofte ganske lineære eller proskriptive erfaringer.

Fra Improving GAN Equilibrium by Raising Spatial Awareness: her skruber brukeren gjennom en rekke potensielle overgangspunkter mellom to latente romlokasjoner, men innenfor grensene av forhånds-trente lokasjoner i det latente rommet. For å anvende andre typer transformasjoner basert på samme materiale, er omkonfigurering og/eller om-trening nødvendig. Kilde: https://genforce.github.io/eqgan/

Fra Improving GAN Equilibrium by Raising Spatial Awareness: her skruber brukeren gjennom en rekke potensielle overgangspunkter mellom to latente romlokasjoner, men innenfor grensene av forhånds-trente lokasjoner i det latente rommet. For å anvende andre typer transformasjoner basert på samme materiale, er omkonfigurering og/eller om-trening nødvendig. Kilde: https://genforce.github.io/eqgan/

I tillegg til å være mottakelig for helt nye brukerbilder, kan brukeren også manuelt “fryse” elementer som de ønsker å konservere under transformasjonsprosessen. På denne måten kan brukeren sikre at (for eksempel) bakgrunner ikke skifter, eller at øyne holdes åpne eller lukket.

Data

Attributt-regressionsnettverket ble trent på tre nettverk: FFHQ, CelebAMask-HQ, og et lokalt, GAN-generert nettverk som ble oppnådd ved å sampel 400 000 vektorer fra Z-rommet til StyleGAN-V2.

Utenfor-distribusjon (OOD) bilder ble filtrert bort, og attributter ble trukket ut ved hjelp av Microsofts Face API, med det resulterende bilde-settet delt 90/10, og etterlot 721 218 treningbilder og 72 172 testbilder å sammenligne mot.

Testing

Til tross for at det eksperimentelle nettverket opprinnelig var konfigurert til å akkommodere 35 potensielle transformasjoner, ble disse slimmet ned til åtte for å kunne utføre analoge tester mot de sammenlignbare rammeverkene InterFaceGAN, GANSpace, og StyleFlow.

De åtte valgte attributtene var Alder, Skallethet, Skjegg, Uttrykk, Kjønn, Briller, Pitch, og Yaw. Det var nødvendig å omkonfigurere de konkurrerende rammeverkene for noen av de åtte attributtene som ikke var forsynt i den opprinnelige distribusjonen, som å legge til skallethet og skjegg til InterFaceGAN.

Som forventet, skjedde en større grad av entanglement i de rivaliserende arkitekturer. For eksempel, i en test, endret InterFaceGAN og StyleFlow begge kjønn til subjektet når de ble bedt om å anvende alder:

To av de konkurrerende rammeverkene rullet en kjønnsendring inn i 'alder'-transformasjonen, og endret også hårfarge uten direkte bud fra brukeren.

To av de konkurrerende rammeverkene rullet en kjønnsendring inn i ‘alder’-transformasjonen, og endret også hårfarge uten direkte bud fra brukeren.

I tillegg fant to av rivalene at briller og alder er uadskilige aspekter:

Briller og hårfarge endret uten ekstra kostnad!

Briller og hårfarge endret uten ekstra kostnad!

Det er ikke en enhetlig seier for forskningen: som kan ses i det vedlagte videoinnlegget ved slutten av artikkelen, er rammen den minst effektive når det gjelder å ekstrapolere diverse vinkler (yaw), mens GANSpace har en bedre generell resultat for alder og pålegg av briller. Den latent-til-latent rammen knyttet med GANSpace og StyleFlow med hensyn til å legge til pitch (hodevinkel).

Resultater beregnet basert på en kalibrering av MTCNN-ansiktsdetektoren. Lavere resultater er bedre.

Resultater beregnet basert på en kalibrering av MTCNN-ansiktsdetektoren. Lavere resultater er bedre.

For ytterligere detaljer og bedre oppløsning av eksempler, se papirets vedlagte video nedenfor.

 

Først publisert 16. februar 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai