Andersons hoek

SofGAN: een GAN-gezichtsgenerator die meer controle biedt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers in Shanghai en de VS hebben een op GAN gebaseerd portretgeneratiesysteem ontwikkeld dat gebruikers in staat stelt om nieuwe gezichten te creëren met een niveau van controle over individuele aspecten zoals haar, ogen, bril, texturen en kleur dat tot nu toe niet beschikbaar was.

Om de veelzijdigheid van het systeem te demonstreren, hebben de makers een Photoshop-achtige interface geboden waarin een gebruiker rechtstreeks semantische segmentatie-elementen kan tekenen die opnieuw worden geïnterpreteerd in realistische beelden, en die zelfs kunnen worden verkregen door rechtstreeks te tekenen over bestaande foto’s.

In het onderstaande voorbeeld wordt een foto van acteur Daniel Radcliffe gebruikt als een tekenmal (en het doel is niet om een gelijkenis van hem te produceren, maar eerder een algemeen fotorealistisch beeld). Als de gebruiker verschillende elementen invult, waaronder discrete facetten zoals bril, worden ze geïdentificeerd en geïnterpreteerd in de uitvoerbeeld:

Het gebruik van een beeld als tekenmateriaal voor een SofGAN-gegenereerd portret. Bron: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Het gebruik van een beeld als tekenmateriaal voor een SofGAN-gegenereerd portret. Bron: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Het artikel heet SofGAN: een portretbeeldgenerator met dynamische stijl en wordt geleid door Anpei Chen en Ruiyang Liu, samen met twee andere onderzoekers van de ShanghaiTech University en een van de University of California in San Diego.

Ontwarren van kenmerken

De primaire bijdrage van het werk is niet zozeer het bieden van een gebruikersvriendelijke UX, maar eerder het ‘ontwarren’ van kenmerken van geleerde gezichtskenmerken, zoals pose en textuur, waardoor SofGAN ook gezichten kan genereren die indirect zijn ten opzichte van het camerastandpunt.

Ongebruikelijk onder gezichtsgeneratoren op basis van Generative Adversarial Networks, kan SofGAN het zichtpunt veranderen naar wens, binnen de grenzen van het bereik van hoeken in de trainingsgegevens. Bron: https://arxiv.org/pdf/2007.03780.pdf

Ongebruikelijk onder gezichtsgeneratoren op basis van Generative Adversarial Networks, kan SofGAN het zichtpunt veranderen naar wens, binnen de grenzen van het bereik van hoeken in de trainingsgegevens. Bron: https://arxiv.org/pdf/2007.03780.pdf

Aangezien texturen nu zijn ontward van geometrie, kunnen gezichtsvorm en textuur ook worden gemanipuleerd als afzonderlijke entiteiten. In feite maakt dit het mogelijk om het ras van een bron gezicht te veranderen, een schandalige praktijk die nu een potentieel nuttige toepassing heeft, voor de creatie van raciaal gebalanceerde machine learning-gegevenssets.

SofGAN ondersteunt ook kunstmatige veroudering en attribuut-consistente stijlaanpassing op een niveau dat niet is gezien in soortgelijke segmentatie>beeldsystemen zoals NVIDIA’s GauGAN en Intel’s game-gebaseerde neurale rendering systeem.

SofGAN kan veroudering implementeren als een iteratieve stijl.

SofGAN kan veroudering implementeren als een iteratieve stijl.

Een andere doorbraak voor SofGAN’s methodologie is dat de training niet vereist pairende segmentatie/echte beelden, maar eerder rechtstreeks getraind kan worden op ongepaarde werkelijke wereldbeelden.

De onderzoekers stellen dat de ‘ontwarrende’ architectuur van SofGAN werd geïnspireerd door traditionele beeldrenderingssystemen, die de individuele facetten van een beeld ontleden. In visuele effectenworkflows worden de elementen voor een compositie routinematig afgebroken tot de meest minute componenten, met specialisten die zijn toegewezen aan elke component.

Semantische bezettingsveld (SOF)

Om dit te bereiken in een machine learning-beeldsyntheseframework, ontwikkelden de onderzoekers een semantisch bezettingsveld (SOF), een uitbreiding van het traditionele bezettingsveld dat de componentelementen van gezichtsportretten individueert. De SOF werd getraind op gekalibreerde multi-view semantische segmentatiekaarten, maar zonder enige grondwaarheidsupervisie.

Meerdere iteraties van een enkele segmentatiekaart (linksonder).

Meerdere iteraties van een enkele segmentatiekaart (linksonder).

Bovendien worden 2D-segmentatiekaarten verkregen door ray-tracing van de uitvoer van de SOF, voordat ze worden getextureerd door een GAN-generator. De ‘synthetische’ semantische segmentatiekaarten worden ook gecodeerd in een lage dimensionale ruimte via een drie-laags encoder om de continuïteit van de uitvoer te waarborgen wanneer het zichtpunt wordt gewijzigd.

Het trainingsplan mengt twee willekeurige stijlen voor elk semantisch gebied:

De architectuur voor SofGAN.

De architectuur voor SofGAN.

De onderzoekers claimen dat SofGAN een lagere Frechet Inception Distance (FID) bereikt dan de huidige alternatieve state of the art (SOTA)-benaderingen, evenals een hogere Learned Perceptual Image Patch Similarity (LPIPS)-metriek.

Vorige StyleGAN-benaderingen zijn vaak gehinderd door feature-entanglement, waarbij de elementen die een beeld vormen onlosmakelijk met elkaar verbonden zijn, waardoor ongewenste elementen verschijnen naast een gewenst element (bijv. oorbellen kunnen verschijnen wanneer een oorvorm wordt weergegeven die is geïnformeerd door een afbeelding die oorbellen bevatte).

Ray-marching wordt gebruikt om het volume van semantische segmentatiekaarten te berekenen, waardoor meerdere zichtpunten mogelijk zijn.

Ray-marching wordt gebruikt om het volume van semantische segmentatiekaarten te berekenen, waardoor meerdere zichtpunten mogelijk zijn.

Gegevenssets en training

Drie gegevenssets werden gebruikt bij de ontwikkeling van verschillende implementaties van SofGAN: CelebAMask-HQ, een repository van 30.000 hoge resolutie-afbeeldingen die zijn genomen uit de CelebA-HQ-gegevensset; NVIDIA’s Flickr-Faces-HQ (FFHQ), die 70.000 afbeeldingen bevat, waarbij de onderzoekers de afbeeldingen hebben gelabeld met een vooraf getrainde gezichtsparser; en een zelfgemaakte groep van 122 portretscans met handmatig gelabelde semantische regio’s.

De SOF bestaat uit drie trainbare submodules – het hyper-net, een ray-marcher (zie bovenstaande afbeelding) en een classificator. De project-Semantic Instance Wised (SIW) StyleGAN-generator is geconfigureerd zoals StyleGAN2 in bepaalde aspecten. Gegevensverrijking wordt toegepast via willekeurige schaling en bijsnijden, en training kenmerken padregularisatie elke vier stappen. De hele trainingsprocedure duurde 22 dagen om 800.000 iteraties te bereiken op vier RTX 2080 Ti-GPU’s via CUDA 10.1.

Het artikel vermeldt niet de configuratie van de 2080-kaarten, die 11 GB-22 GB VRAM per stuk kunnen accommoderen, wat betekent dat het totale VRAM dat wordt gebruikt voor het grootste deel van een maand om SofGAN te trainen, ergens tussen 44 GB en 88 GB ligt.

De onderzoekers merken op dat aanvaardbare, gegeneraliseerde, hoogwaardige resultaten al vroeg in de training verschenen, bij 1500 iteraties, drie dagen in de training. De rest van de training werd besteed aan de voorspelbare, langzame kruip naar het verkrijgen van fijne details zoals haar en ogen.

SofGAN bereikt over het algemeen realistischere resultaten vanuit een enkele segmentatiekaart dan rivaliserende methoden zoals NIVDIA’s SPADE en Pix2PixHD, en SEAN.

Hieronder is de video die door de onderzoekers is vrijgegeven. Verdere zelfgehoste video’s zijn beschikbaar op de projectpagina.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai