Unghiul lui Anderson
SofGAN: Un generator de fețe GAN care oferă un control mai mare

Cercetători din Shanghai și Statele Unite au dezvoltat un sistem de generare de portrete bazat pe GAN care permite utilizatorilor să creeze fețe noi cu un nivel de control mai mare asupra aspectelor individuale, cum ar fi părul, ochii, ochelarii, texturile și culoarea.
Pentru a demonstra versatilitatea sistemului, creatorii au furnizat o interfață de tip Photoshop care permite utilizatorilor să deseneze direct elemente de segmentare semantică care vor fi reinterpretate în imagini realiste și care pot fi obținute chiar și prin desenarea direct pe fotografii existente.
În exemplul de mai jos, o fotografie a actorului Daniel Radcliffe este utilizată ca șablon de trasare (și obiectivul nu este de a produce o asemănare cu el, ci mai degrabă o imagine fotorealistă). Pe măsură ce utilizatorul completează diverse elemente, inclusiv aspecte discrete, cum ar fi ochelarii, acestea sunt identificate și interpretate în imaginea de ieșire:

Utilizarea unei imagini ca material de trasare pentru un portret generat de SofGAN. Sursă: https://www.youtube.com/watch?v=xig8ZA3DVZ8
Articolul științific se intitulează SofGAN: Un generator de imagini de portret cu stilare dinamică și este condus de Anpei Chen și Ruiyang Liu, împreună cu alți doi cercetători de la ShanghaiTech University și unul de la University of California din San Diego.
Disentangling Features
Contribuția principală a lucrării nu constă atât de mult în furnizarea unei interfețe utilizator prietenoase, ci mai degrabă în “dezlegarea” caracteristicilor fețelor învățate, cum ar fi poza și textura, ceea ce permite SofGAN să genereze și fețe care sunt la unghiuri indirecte față de punctul de vedere al camerei.

Neobișnuit printre generatorii de fețe bazate pe rețelele antagoniste generative, SofGAN poate schimba unghiul de vedere la voie, în limitele gamei de unghiuri prezente în datele de antrenare. Sursă: https://arxiv.org/pdf/2007.03780.pdf
Deoarece texturile sunt acum dezlegate de la geometrie, forma și textura feței pot fi manipulate ca entități separate. În efect, acest lucru permite schimbarea rasei unei fețe sursă, o practică scandaloasă care are acum o aplicație utilă, pentru crearea unor seturi de date de mașini de învățare echilibrate din punct de vedere rasial.

SofGAN susține, de asemenea, îmbătrânirea artificială și ajustarea stilului consistent cu atribute la un nivel granular neobișnuit în sistemele de segmentare a imaginilor, cum ar fi GauGAN și sistemul de renderizare neurală bazat pe jocuri al Intel.

SofGAN poate implementa îmbătrânirea ca un stil iterativ.
O altă inovație a metodei SofGAN constă în faptul că antrenamentul nu necesită imagini reale pereche și segmentate, ci poate fi antrenat direct pe imagini reale nepereche.
Cercetătorii afirmă că arhitectura “dezlegată” a SofGAN a fost inspirată de sistemele tradiționale de renderizare a imaginilor, care descompun elementele individuale ale unei imagini. În fluxurile de lucru de efecte vizuale, elementele pentru o compunere sunt descompuse în mod obișnuit în cele mai mici componente, cu specialiști dedicați fiecărui component.
Câmpul Semantic de Ocupare (SOF)
Pentru a realiza acest lucru într-un cadru de sinteză de imagini de mașină de învățare, cercetătorii au dezvoltat un câmp semantic de ocupare (SOF), o extensie a câmpului tradițional de ocupare care individualizează elementele componente ale portretelor faciale. SOF a fost antrenat pe hărți de segmentare semantică calibrate cu multiple puncte de vedere, dar fără nicio supraveghere a adevărului.

Multiple iterații dintr-o singură hartă de segmentare (jos-stânga).
În plus, hărțile de segmentare 2D sunt obținute prin urmărirea razei de ieșire a SOF, înainte de a fi texturate de un generator GAN. Hărțile de segmentare “sintetice” sunt, de asemenea, codificate într-un spațiu de dimensiune redusă prin intermediul unui encoder cu trei straturi pentru a asigura continuitatea ieșirii atunci când punctul de vedere este schimbat.
Schemă de antrenament combină spațial două stiluri aleatorii pentru fiecare regiune semantică:
Cercetătorii afirmă că SofGAN obține o distanță Frechet Inception Distance (FID) mai mică decât abordările actuale alternative de stat și o metrică de similaritate a imaginilor perceptuale învățate (LPIPS) mai mare.
Abordările anterioare StyleGAN au fost adesea împiedicate de încurcarea caracteristicilor, în care elementele care compun o imagine sunt legate în mod ireversibil de altele, provocând apariția unor elemente nedorite alături de un element dorit (de exemplu, cercei pot apărea atunci când o formă de ureche este redată, care a fost informată la antrenare de o imagine care a prezentat cercei).

Urmărirea razei este utilizată pentru a calcula volumul hărților de segmentare semantică, permițând multiple puncte de vedere.
Seturi de date și antrenament
Trei seturi de date au fost utilizate în dezvoltarea diverselor implementări ale SofGAN: CelebAMask-HQ, un depozit de 30.000 de imagini de înaltă rezoluție luate din setul de date CelebA-HQ; NVIDIA’s Flickr-Faces-HQ (FFHQ), care conține 70.000 de imagini, unde cercetătorii au etichetat imaginile cu un parser de fețe preantrenat; și un grup auto-produs de 122 de scanări de portret cu regiuni semantice etichetate manual.
SOF este alcătuit din trei submodule antrenabile – hiper-rețeaua, un urmăritor de raze (vezi imaginea de mai sus) și un clasificator. Generatorul Semantic Instance Wised (SIW) StyleGAN al proiectului este configurat similar cu StyleGAN2 în anumite aspecte. Augmentarea datelor este aplicată prin scalare și decupare aleatorie, iar antrenamentul include regularizarea căii la fiecare patru pași. Procedura de antrenament completă a durat 22 de zile pentru a ajunge la 800.000 de iterații pe patru GPU-uri RTX 2080 Ti cu CUDA 10.1.
Articolul nu menționează configurația cardurilor 2080, care pot avea între 11Gb-22Gb VRAM fiecare, ceea ce înseamnă că VRAM-ul total utilizat pentru cea mai mare parte a lunii pentru a antrena SofGAN este undeva între 44Gb și 88Gb.
Cercetătorii observă că rezultatele generalizate, de nivel înalt, acceptabile au început să apară devreme în antrenament, la 1500 de iterații, trei zile în antrenament. Restul antrenamentului a fost dedicat obținerii detaliilor fine, cum ar fi părul și aspectele ochilor.
SofGAN obține, în general, rezultate mai realiste dintr-o singură hartă de segmentare decât metodele rivale, cum ar fi SPADE și Pix2PixHD ale NIVDIA, și SEAN.
Mai jos este videoul lansat de cercetători. Mai multe videouri auto-găzduite sunt disponibile pe pagina proiectului.














