Andersons vinkel

SofGAN: Ett GAN-baserat ansiktsgenereringsverktyg som erbjuder större kontroll

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare i Shanghai och USA har utvecklat ett GAN-baserat porträttgenereringssystem som tillåter användare att skapa nya ansikten med en tidigare otillgänglig nivå av kontroll över enskilda aspekter som hår, ögon, glasögon, texturer och färg.

För att demonstrera systemets flexibilitet har skaparna tillhandahållit ett Photoshop-liknande gränssnitt där en användare kan direkt rita semantiska segmenterings-element som kommer att tolkas om till realistiska bilder, och som även kan erhållas genom att rita direkt över existerande foton.

I exemplet nedan används en bild av skådespelaren Daniel Radcliffe som en spårningsmall (och målet är inte att producera en likhet med honom, utan snarare en allmänt fotorealistisk bild). När användaren fyller i olika element, inklusive diskreta aspekter som glasögon, identifieras och tolkas de i utdata-bilden:

Användning av en bild som spårningsmaterial för en SofGAN-genererad porträtt. Källa: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Användning av en bild som spårningsmaterial för en SofGAN-genererad porträtt. Källa: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Den artikeln heter SofGAN: A Portrait Image Generator with Dynamic Styling och leds av Anpei Chen och Ruiyang Liu, tillsammans med två andra forskare från ShanghaiTech University och en från University of California i San Diego.

Att separera funktioner

Den primära bidraget från arbetet är inte så mycket att tillhandahålla ett användarvänligt gränssnitt, utan snarare att “separera” egenskaper hos inlärda ansiktsfunktioner, såsom pose och textur, vilket tillåter SofGAN att också generera ansikten som är indirekta vinklar till kameravyn.

Ovanligt bland ansiktsgenererare baserade på Generative Adversarial Networks, kan SofGAN ändra vyvinkeln efter behag, inom gränserna för den uppsättning vinklar som finns i träningsdatat. Källa: https://arxiv.org/pdf/2007.03780.pdf

Ovanligt bland ansiktsgenererare baserade på Generative Adversarial Networks, kan SofGAN ändra vyvinkeln efter behag, inom gränserna för den uppsättning vinklar som finns i träningsdatat. Källa: https://arxiv.org/pdf/2007.03780.pdf

Eftersom texturer nu är separerade från geometri, kan ansiktsform och textur också manipuleras som separata enheter. I effekt, tillåter detta rasbyte av en källansikte, en skandalös praxis som nu har en potentiellt användbar tillämpning, för skapandet av rasbalanserade maskinlärningsdataset.

SofGAN stöder också konstgjord åldrande och attribut-konsekvent stiljustering på en granulär nivå som inte har setts i liknande segmentering>bildsystem som NVIDIA’s GauGAN och Intel’s spelbaserade neurala renderingsystem system.

SofGAN kan implementera åldrande som en iterativ stil.

SofGAN kan implementera åldrande som en iterativ stil.

En annan genombrott för SofGAN’s metodik är att träningsprocessen inte kräver parade segmenterings/verkliga bilder, utan kan direkt tränas på oparade verkliga världbilder.

Forskarna påstår att “separerings”-arkitekturen i SofGAN inspirerades av traditionella bildrenderingssystem, som bryter ner de enskilda aspekterna av en bild. I visuella effekter-arbetsflöden bryts elementen för en komposit ned till de minsta komponenterna, med specialister dedikerade till varje komponent.

Semantiskt Ockupationsfält (SOF)

För att uppnå detta i en maskinlärningsbildsyntesramverk utvecklade forskarna ett semantiskt ockupationsfält (SOF), en utvidgning av det traditionella ockupationsfältet som individuerar de komponentelementen i ansiktsporträtt. SOF tränades på kalibrerade multi-vysemantiska segmenteringskartor, men utan någon grund sanningssupervision.

Flera iterationer från en enda segmenteringskarta (nere till vänster).

Flera iterationer från en enda segmenteringskarta (nere till vänster).

Dessutom erhålls 2D-segmenteringskartor genom att spåra utdata från SOF, innan de textureras av en GAN-generator. De “syntetiska” semantiska segmenteringskartorna kodas också i ett lågdimensionellt utrymme via en tre-lagers encoder för att säkerställa kontinuitet i utdata när vyvinkeln ändras.

Träningsplanen spatialt blandar två slumpmässiga stilar för varje semantisk region:

Arkitekturen för SofGAN.

Arkitekturen för SofGAN.

Forskarna påstår att SofGAN uppnår en lägre Frechet Inception Distance (FID) än de nuvarande alternativa statliga tillvägagångssätten, samt en högre Learned Perceptual Image Patch Similarity (LPIPS)-mått.

Tidigare StyleGAN-tillvägagångssätt har ofta hämmats av funktionssammanflätning, där elementen som utgör en bild är oåterkalleligt bundna till varandra, vilket orsakar oönskade element att dyka upp tillsammans med ett önskat element (t.ex. örhängen kan dyka upp när en öraform renderas som informerades vid tränings tid av en bild som visade örhängen).

Ray-marching används för att beräkna volymen av semantiska segmenteringskartor, vilket möjliggör flera vyvinklar.

Ray-marching används för att beräkna volymen av semantiska segmenteringskartor, vilket möjliggör flera vyvinklar.

Dataset och Träningsdata

Tre dataset användes i utvecklingen av olika implementationer av SofGAN: CelebAMask-HQ, ett repository med 30 000 högupplösta bilder tagna från CelebA-HQ-datasetet; NVIDIA’s Flickr-Faces-HQ (FFHQ), som innehåller 70 000 bilder, där forskarna märkte bilderna med en förtränad ansiktsparser; och en självproducerad grupp med 122 porträttscansningar med manuellt märkta semantiska regioner.

SOF består av tre tränbara undermoduler – hyper-nät, en ray-marcher (se bild ovan), och en klassificerare. Projektets Semantic Instance Wised (SIW) StyleGAN-generator är konfigurerad liknande StyleGAN2 i vissa aspekter. Dataförstärkning tillämpas genom slumpmässig skalning och beskärning, och träningsfunktioner bana-regularisering var fjärde steg. Hela träningsförfarandet tog 22 dagar att nå 800 000 iterationer på fyra RTX 2080 Ti GPU:er över CUDA 10.1.

Artikeln nämner inte konfigurationen av 2080-korten, som kan rymma mellan 11 GB-22 GB VRAM var, vilket innebär att den totala VRAM som användes för att träna SofGAN är någonstans mellan 44 GB och 88 GB.

Forskarna observerar att acceptabla, allmänna, högnivåresultat började dyka upp ganska tidigt i träningsprocessen, vid 1500 iterationer, tre dagar in i träningsprocessen. Resten av träningsprocessen upptogs av den förutsägbara, långsamma kravlande mot att uppnå fina detaljer som hår och ögonfasetter.

SofGAN uppnår generellt mer realistiska resultat från en enda segmenteringskarta än rivaliserande metoder som NIVDIA’s SPADE och Pix2PixHD, och SEAN.

Nedan är videon som släpptes av forskarna. Ytterligare självvärdiga videor finns tillgängliga på projektsidan.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai