Andersons vinkel

Adobe Research Utökar Disentangled GAN Ansiktsredigering

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Det är inte svårt att förstå varför sammanflätning är ett problem i bildsyntes, eftersom det ofta är ett problem i andra områden i livet; till exempel är det mycket svårare att ta bort kurkuma från en curry än att slänga pickles i en hamburgare, och det är praktiskt taget omöjligt att avsockra en kopp kaffe. Vissa saker kommer bara i paket.

På samma sätt är sammanflätning ett hinder för bildsyntesarkitekturer som helst skulle vilja separera olika funktioner och begrepp när de använder maskinlärning för att skapa eller redigera ansikten (eller hundar, båtar eller något annat område).

Om du kunde separera ut trådar som ålder, kön, hårfärg, hudton, emotion och så vidare, skulle du ha början på riktigt instrument och flexibilitet i ett ramverk som kunde skapa och redigera ansiktsbilder på en riktigt granulär nivå, utan att dra oönskade “passagerare” in i dessa omvandlingar.

Vid maximal sammanflätning (ovan till vänster) kan du bara ändra bilden av ett lärt GAN-nätverk till bilden av en annan person.

Detta är i princip att använda den senaste AI-datorseende-tekniken för att uppnå något som redan lösts med andra medel för över trettio år sedan.

Med en viss grad av separation (“Medium Separation” i tidigare ovan bild) är det möjligt att utföra stilbaserade ändringar som hårfärg, uttryck, kosmetisk applicering och begränsad huvudrotation, bland andra.

Källa: FEAT: Face Editing with Attention, februari 2022, https://arxiv.org/pdf/2202.02713.pdf

Källa: FEAT: Face Editing with Attention, februari 2022, https://arxiv.org/pdf/2202.02713.pdf

Det har funnits ett antal försök under de senaste två åren att skapa interaktiva ansiktsredigeringsmiljöer som tillåter en användare att ändra ansiktsdrag med reglage och andra traditionella användargränssnittsinteraktioner, samtidigt som de behåller grundläggande funktioner i målansiktet när tillägg eller ändringar görs. Men detta har visat sig vara en utmaning på grund av den underliggande funktion/stil-sammanflätning i GAN:s latenta utrymme.

Till exempel är glasögon-egenskapen ofta sammanflätad med åldrad-egenskapen, vilket innebär att lägga till glasögon också kan “åldra” ansiktet, medan åldring av ansiktet kan lägga till glasögon, beroende på graden av tillämpad separation av högnivåfunktioner (se “Testning” nedan för exempel).

Källa: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Källa: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Latent-till-Latent GAN Traversal

En ny Adobe -ledd artikel inlämnad för WACV 2022 erbjuder en ny approach till dessa underliggande problem i en artikel med titeln Latent till Latent: En inlärningsbar kartläggare för identitetsskyddande redigering av flera ansiktsattribut i StyleGAN-genererade bilder.

Tilläggsmaterial från artikeln Latent till Latent: En inlärningsbar kartläggare för identitetsskyddande redigering av flera ansiktsattribut i StyleGAN-genererade bilder. Här ser vi att basfunktioner i det inlärda ansiktet inte dras in i orelaterade ändringar. Se fullständig videofördjupning i slutet av artikeln för bättre detalj och upplösning. Källa: https://www.youtube.com/watch?v=rf_61llRH0Q

Tilläggsmaterial från artikeln Latent till Latent: En inlärningsbar kartläggare för identitetsskyddande redigering av flera ansiktsattribut i StyleGAN-genererade bilder. Här ser vi att basfunktioner i det inlärda ansiktet inte dras in i orelaterade ändringar. Se fullständig videofördjupning i slutet av artikeln för bättre detalj och upplösning. Källa: https://www.youtube.com/watch?v=rf_61llRH0Q

Artikeln är intressant delvis för att Adobe har varit verksamma inom detta område under en längre tid, och det är frestande att föreställa sig att denna funktionalitet kommer in i ett Creative Suite-projekt under de närmaste åren; men främst för att arkitekturen som skapats för projektet tar en annan approach till att upprätthålla visuell integritet i en GAN-ansiktsredigerare medan ändringar tillämpas.

Författarna förklarar:

‘[Vi] tränar ett neuronnätverk för att utföra en latent-till-latent-omvandling som hittar den latenta kodningen som motsvarar bilden med den ändrade attributen. Eftersom tekniken är one-shot, förlitar den sig inte på en linjär eller icke-linjär bana av den gradvisa ändringen av attributen.’

‘Genom att träna nätverket från slut till slut över hela genereringspipelinen, kan systemet anpassa sig till de latenta utrymmena i färdiga generatorarkitekturer. Bevarandeegenskaper, såsom att upprätthålla identiteten hos personen, kan kodas i form av träningsförluster. ‘

‘När den latent-till-latent-nätverket var tränat, kan det återanvändas för godtyckliga bilder utan omträning.’

Detta sista innebär att den föreslagna arkitekturen anländer till slutanvändaren i en färdig stat. Den behöver fortfarande köra ett neuronnätverk på lokala resurser, men nya bilder kan “droppas in” och vara redo för ändring nästan omedelbart, eftersom ramverket är tillräckligt avkopplat för att inte behöva ytterligare bildspecifik tränings.

Kön och ansiktsbehåring ändrad som reglage plotter godtyckliga och arbiträra banor genom det latenta utrymmet, inte bara 'scrubbing between endpoints'.

Kön och ansiktsbehåring ändrad som reglage plotter godtyckliga och arbiträra banor genom det latenta utrymmet, inte bara ‘scrubbing between endpoints’. Se video i slutet av artikeln för fler omvandlingar i bättre upplösning.

Bland de viktigaste prestationerna i arbetet är nätverkets förmåga att “frysa” identiteter i det latenta utrymmet genom att ändra endast attributen i en målbild, och tillhandahålla “korrektionsvillkor” som bevarar identiteter som omvandlas.

I princip är det föreslagna nätverket inbäddat i en bredare arkitektur som orkestrerar alla bearbetade element, som passerar genom förtränade komponenter med frusna vikter som inte kommer att producera oönskade laterala effekter på omvandlingar.

Eftersom träningsprocessen förlitar sig på tripletter som kan genereras antingen av en seedbild (under GAN-inversion) eller en befintlig initial latent kodning, är hela träningsprocessen ostrukturerad, med de underförstådda åtgärderna av de sedvanliga mängderna av märkning och kureringssystem i sådana system effektivt inbäddade i arkitekturen. I själva verket använder det nya systemet färdiga attributregressorer:

‘[Antalet attribut som vårt nätverk kan kontrollera oberoende är endast begränsat av erkännarens förmåga – om man har en erkännare för ett attribut, kan vi lägga till det till godtyckliga ansikten. I våra experiment tränade vi det latent-till-latent-nätverket för att tillåta justering av 35 olika ansiktsattribut, mer än någon tidigare approach.’

Systemet inkorporerar en ytterligare säkerhetsåtgärd mot oönskade “biprodukt”-omvandlingar: i avsaknad av en begäran om attributändring, kommer det latent-till-latent-nätverket att mappa en latent vektor till sig själv, vilket ytterligare ökar den stabila beständigheten av målidentiteten.

Ansiktsigenkänning

Ett återkommande problem med GAN och encoder/decoder-baserade ansiktsredigerare under de senaste åren har varit att tillämpade omvandlingar tenderar att försämra likheten. För att bekämpa detta använder Adobe-projektet ett inbäddat ansiktsigenkänningsnätverk som kallas FaceNet som diskriminatör.

Projektarkitektur, se nedre mitten till vänster för inkludering av FaceNet. Källa: Latent till Latent: En inlärningsbar kartläggare för identitetsskyddande redigering av flera ansiktsattribut i StyleGAN-genererade bilder, OpenAccess.

Projektarkitektur, se nedre mitten till vänster för inkludering av FaceNet. Källa: Latent till Latent: En inlärningsbar kartläggare för identitetsskyddande redigering av flera ansiktsattribut i StyleGAN-genererade bilder, OpenAccess.

(På en personlig not, detta verkar vara ett uppmuntrande steg mot integrationen av standardiserad ansiktsidentifiering och till och med uttrycksigenkänningssystem i generativa nätverk, vilket är det bästa sättet att övervinna den blinda pixel-till-pixel-mappningen som dominerar nuvarande deepfake-arkitekturer på bekostnad av uttrycksfidelitet och andra viktiga områden i ansiktsgenereringssektorn.)

Tillgång till alla områden i det latenta utrymmet

En annan imponerande funktion i ramverket är dess förmåga att resa godtyckligt mellan potentiella omvandlingar i det latenta utrymmet, efter användarens önskemål. Flera tidigare system som tillhandahöll utforskningsgränssnitt lämnade ofta användaren att “scrubba” mellan fasta funktionstransformations-tidslinjer – imponerande, men ofta ganska linjära eller proskriptiva upplevelser.

Från Förbättring av GAN-ekvilibrium genom att öka spatial medvetenhet: här scrubbar användaren genom en mängd potentiella övergångspunkter mellan två latenta utrymmesplatser, men inom ramen för förtränade platser i det latenta utrymmet. För att tillämpa andra typer av omvandling baserat på samma material, krävs omkonfigurering och/eller omträning. Källa: https://genforce.github.io/eqgan/

Från Förbättring av GAN-ekvilibrium genom att öka spatial medvetenhet: här scrubbar användaren genom en mängd potentiella övergångspunkter mellan två latenta utrymmesplatser, men inom ramen för förtränade platser i det latenta utrymmet. För att tillämpa andra typer av omvandling baserat på samma material, krävs omkonfigurering och/eller omträning. Källa: https://genforce.github.io/eqgan/

Förutom att vara mottaglig för helt nya användarbilder, kan användaren också manuellt “frysa” element som de vill ska bevaras under omvandlingsprocessen. På detta sätt kan användaren säkerställa att (till exempel) bakgrunder inte förändras, eller att ögon hålls öppna eller stängda.

Data

Attributregressionsnätverket tränades på tre nätverk: FFHQ, CelebAMask-HQ och ett lokalt, GAN-genererat nätverk som erhållits genom att samppla 400 000 vektorer från Z-utrymmet i StyleGAN-V2.

Utanför-distribution (OOD)-bilder filtrerades bort, och attribut extraherades med hjälp av Microsofts Face API, och den resulterande bilduppsättningen delades upp i 90/10, vilket lämnade 721 218 träningsbilder och 72 172 testbilder att jämföra med.

Testning

Även om det experimentella nätverket initialt konfigurerades för att hantera 35 potentiella omvandlingar, slimmandes dessa ner till åtta för att genomföra analog testning mot de jämförbara ramverken InterFaceGAN, GANSpace och StyleFlow.

De åtta valda attributen var Ålder, Skalighet, Skägg, Uttryck, Kön, Glasögon, Pitch och Yaw. Det var nödvändigt att omkonfigurera de konkurrerande ramverken för vissa av de åtta attributen som inte var förkonfigurerade i den ursprungliga distributionen, såsom att lägga till skalighet och skägg till InterFaceGAN.

Som väntat inträffade en större grad av sammanflätning i de rivaliserande arkitekturerna. Till exempel ändrade InterFaceGAN och StyleFlow båda kön på subjektet när de tillfrågades att tillämpa ålder:

Två av de konkurrerande ramverken rullade en könändring in i 'ålder'-omvandlingen, och ändrade också hårfärg utan direkt begäran från användaren.

Två av de konkurrerande ramverken rullade en könändring in i ‘ålder’-omvandlingen, och ändrade också hårfärg utan direkt begäran från användaren.

Dessutom fann två av rivalerna att glasögon och ålder är oskiljbara aspekter:

Glasögon och hårfärg ändrades utan extra kostnad!

Glasögon och hårfärg ändrades utan extra kostnad!

Det är inte en enhetlig seger för forskningen: som kan ses i den medföljande videon som är inbäddad i slutet av artikeln, är ramverket minst effektivt när det gäller att extrapolera olika vinklar (yaw), medan GANSpace har ett bättre allmänt resultat för ålder och tillämpning av glasögon. Det latent-till-latent-ramverket bands med GANSpace och StyleFlow när det gäller att lägga till pitch (huvudets vinkel).

Resultat beräknade baserat på en kalibrering av MTCNN-ansiktsdetektorn. Lägre resultat är bättre.

Resultat beräknade baserat på en kalibrering av MTCNN-ansiktsdetektorn. Lägre resultat är bättre.

För mer information och bättre upplösning av exempel, se artikeln som följer nedan.

 

Publicerad första gången den 16 februari 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai