Unghiul lui Anderson

Cercetarea Adobe extinde editarea fețelor GAN disociate

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Nu este dificil de înțeles de ce entanglementul este o problemă în sinteza de imagini, deoarece este adesea o problemă și în alte domenii ale vieții; de exemplu, este mult mai greu să îndepărtați turmericul dintr-un curry decât să aruncați murătura dintr-un burger, și este practic imposibil să dezahățiți o cană de cafea. Unele lucruri vin împreună.

La fel, entanglementul este o piedică pentru arhitecturile de sinteză de imagini care ar dori să separe diferite caracteristici și concepte atunci când utilizează învățarea automată pentru a crea sau edita fețe (sau câini, bărci sau orice alt domeniu).

Dacă ați putea separa fire precum vârsta, sexul, culoarea părului, tonul pielii, emoția și așa mai departe, ați avea începutul adevăratului instrument și flexibilitate într-un cadru care ar putea crea și edita imagini cu fețe la un nivel cu adevărat granular, fără a atrage “pasageri” nedoriti în aceste conversii.

La entanglement maxim (sus-stânga), puteți face doar să schimbați imaginea unei rețele GAN învățate la imaginea unei alte persoane.

Acest lucru este, în esență, utilizarea celei mai recente tehnologii de viziune computerizată pentru a realiza ceva care a fost rezolvat prin alte mijloace cu peste treizeci de ani în urmă.

Cu un anumit grad de separare (“Separare medie” în imaginea de mai sus), este posibil să se efectueze schimbări bazate pe stil, cum ar fi culoarea părului, expresia, aplicarea cosmetică și rotația limitată a capului, printre altele.

Sursă: FEAT: Editare de fețe cu atenție, februarie 2022, https://arxiv.org/pdf/2202.02713.pdf

Sursă: FEAT: Editare de fețe cu atenție, februarie 2022, https://arxiv.org/pdf/2202.02713.pdf

A existat o serie de încercări în ultimii doi ani de a crea medii de editare interactive de fețe care să permită unui utilizator să schimbe caracteristici faciale cu slider-uri și alte interacțiuni UI tradiționale, păstrând intacte caracteristicile de bază ale feței țintă atunci când se adaugă sau se fac schimbări. Cu toate acestea, acest lucru s-a dovedit a fi o provocare din cauza entanglementului de caracteristici/stil din spațiul latent al GAN.

De exemplu, trăsătura “ochelari” este adesea împletită cu trăsătura “îmbătrânit”, ceea ce înseamnă că adăugarea de ochelari ar putea “îmbătrâni” și fața, în timp ce îmbătrânirea feței ar putea adăuga ochelari, în funcție de gradul de separare a caracteristicilor de nivel superior (vezi “Testare” mai jos pentru exemple).

Sursă: Demo InterFaceGAN (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Sursă: Demo InterFaceGAN (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w

Traversarea GAN Latent-la-Latent

O nouă lucrare condusă de Adobe, prezentată la WACV 2022, oferă o abordare nouă a problemelor subiacente într-o lucrare intitulată Latent la Latent: Un mapper învățat pentru editarea conservativă a identității a multiplelor atribute faciale în imagini generate de StyleGAN.

Material suplimentar din lucrarea Latent la Latent: Un mapper învățat pentru editarea conservativă a identității a multiplelor atribute faciale în imagini generate de StyleGAN. Aici se arată că caracteristicile de bază ale feței învățate nu sunt trase în schimbări nelegate. Vezi videoclipul încorporat la sfârșitul articolului pentru mai multe detalii și rezoluție.

Material suplimentar din lucrarea Latent la Latent: Un mapper învățat pentru editarea conservativă a identității a multiplelor atribute faciale în imagini generate de StyleGAN. Aici se arată că caracteristicile de bază ale feței învățate nu sunt trase în schimbări nelegate. Vezi videoclipul încorporat la sfârșitul articolului pentru mai multe detalii și rezoluție.

Lucrarea este condusă de Siavash Khodadadeh, om de știință aplicat la Adobe, împreună cu alți patru cercetători de la Adobe și un cercetător de la Departamentul de Informatică al Universității din Florida Centrală.

Articolul este interesant în parte pentru că Adobe a operat în acest spațiu de-a lungul timpului, și este tentant să ne imaginăm această funcționalitate intrând într-un proiect Creative Suite în următorii ani; dar mai ales pentru că arhitectura creată pentru proiectul ia o abordare diferită pentru menținerea integrității vizuale într-un editor de fețe GAN în timp ce se aplică schimbări.

Autorii declară:

‘[Noi] antrenăm o rețea neuronală pentru a efectua o transformare latent-la-latent care găsește codificarea latentă corespunzătoare imaginii cu atributul schimbat. Deoarece tehnica este una de tip “un singur schot”, nu se bazează pe o traiectorie liniară sau neliniară a schimbării graduale a atributelor.’

‘Prin antrenarea rețelei de la cap la coadă pe întregul pipeline de generare, sistemul poate adapta spațiile latente ale arhitecturilor generatoare of-the-shelf. Proprietățile de conservare, cum ar fi menținerea identității persoanei, pot fi codificate sub forma unor pierderi de antrenare. ‘

‘Odată ce rețeaua latent-la-latent a fost antrenată, poate fi reutilizată pentru imagini arbitrare fără reantrenare.’

Acest ultim punct înseamnă că arhitectura propusă sosește la utilizator într-o stare finisată. Încă trebuie să ruleze o rețea neuronală pe resurse locale, dar noile imagini pot fi “încărcate” și gata de modificat aproape imediat, deoarece cadrul este decuplat suficient de mult pentru a nu necesita o antrenare suplimentară specifică imaginii.

Sexul și părul facial schimbate în timp ce slider-urile trasează căi arbitrare și aleatorii prin spațiul latent, nu doar 'ștergerea între capete'.

Sexul și părul facial schimbate în timp ce slider-urile trasează căi arbitrare și aleatorii prin spațiul latent, nu doar ‘ștergerea între capete’. Vezi videoclipul încorporat la sfârșitul articolului pentru mai multe transformări la o rezoluție mai bună.

Printre principalele realizări ale lucrării se numără capacitatea rețelei de a “îngheța” identitățile în spațiul latent prin schimbarea doar a atributului într-un vector țintă și prin furnizarea unor “termeni corectivi” care conservă identitățile transformate.

În esență, rețeaua propusă este încorporată într-o arhitectură mai largă care orchestrează toate elementele procesate, care trec prin componente preantrenate cu greutăți înghețate care nu vor produce efecte laterale nedorite asupra transformărilor.

Deoarece procesul de antrenare se bazează pe tripleți care pot fi generați fie de o imagine de sămână (sub inversarea GAN) sau o codificare latentă inițială existentă, întregul proces de antrenare este nesupravegheat, cu acțiunile tacite ale sistemelor obișnuite de etichetare și curățare în astfel de sisteme efectiv încorporate în arhitectură. De fapt, noul sistem utilizează recunoscători de atribute of-the-shelf:

‘[Numărul de atribute pe care rețeaua noastră le poate controla independent este limitat doar de capacitățile recunoscătorului (lor) – dacă aveți un recunoscător pentru un atribut, îl putem adăuga la fețe arbitrare. În experimentele noastre, am antrenat rețeaua latent-la-latent pentru a permite ajustarea a 35 de atribute faciale diferite, mai mult decât orice abordare anterioară.’

Sistemul incorporează o gardă suplimentară împotriva transformărilor “efecte laterale” nedorite: în absența unei solicitări de schimbare a atributului, rețeaua latent-la-latent va mapa un vector latent la el însuși, sporind și mai mult persistența stabilă a identității țintă.

Recunoașterea facială

O problemă recurentă cu editorii de fețe GAN și bazati pe encoder/decoder din ultimii ani a fost că transformările aplicate tind să degradeze asemănarea. Pentru a combate acest lucru, proiectul Adobe utilizează o rețea încorporată de recunoaștere facială numită FaceNet ca discriminator.

Arhitectura proiectului, vezi partea de jos din mijloc-stânga pentru includerea FaceNet. Sursă: Latent la Latent: Un mapper învățat pentru editarea conservativă a identității a multiplelor atribute faciale în imagini generate de StyleGAN, OpenAccess.

Arhitectura proiectului, vezi partea de jos din mijloc-stânga pentru includerea FaceNet. Sursă: Latent la Latent: Un mapper învățat pentru editarea conservativă a identității a multiplelor atribute faciale în imagini generate de StyleGAN, OpenAccess.

(Pe o notă personală, acest lucru pare a fi o mișcare încurajatoare către integrarea sistemelor standard de identificare facială și chiar de recunoaștere a expresiilor în rețele generative, probabil cel mai bun mod de a depăși harta pixel-la-pixel oarbă care domină arhitecturile deepfake actuale în detrimentul fidelității expresiei și altor domenii importante în sectorul generării de fețe.)

Acces la toate zonele în spațiul latent

O altă trăsătură remarcabilă a cadrului este capacitatea sa de a călători arbitrar între transformări potențiale în spațiul latent, la bunul plac al utilizatorului. Mai multe sisteme anterioare care au oferit interfețe exploratorii au lăsat utilizatorul să “șteargă” în principal între linii de timp de transformare a caracteristicilor fixe – impresionant, dar adesea o experiență liniară sau prescriptivă.

De la Îmbunătățirea echilibrului GAN prin creșterea conștientizării spațiale: aici utilizatorul șterge printr-o serie de puncte de tranziție posibile între două locații în spațiul latent, dar în limitele locațiilor preantrenate în spațiul latent. Pentru a aplica alte tipuri de transformare pe baza aceluiași material, reconfigurarea și/sau reantrenarea este necesară. Sursă: https://genforce.github.io/eqgan/

De la Îmbunătățirea echilibrului GAN prin creșterea conștientizării spațiale: aici utilizatorul șterge printr-o serie de puncte de tranziție posibile între două locații în spațiul latent, dar în limitele locațiilor preantrenate în spațiul latent. Pentru a aplica alte tipuri de transformare pe baza aceluiași material, reconfigurarea și/sau reantrenarea este necesară. Sursă: https://genforce.github.io/eqgan/

În plus față de a fi receptiv la imagini cu totul noi, utilizatorul poate “îngheța” și elemente pe care le dorește să fie conservate în timpul procesului de transformare. În acest fel, utilizatorul poate asigura (de exemplu) că fundalurile nu se deplasează sau că ochii sunt ținuți deschiși sau închisi.

Date

Rețeaua de regresie a atributelor a fost antrenată pe trei rețele: FFHQ, CelebAMask-HQ și o rețea locală generată de GAN, obținută prin eșantionarea a 400.000 de vectori din spațiul Z al StyleGAN-V2.

Imaginile din afara distribuției (OOD) au fost filtrate, iar atributele au fost extrase utilizând Face API de la Microsoft, iar setul de imagini rezultat a fost împărțit 90/10, lăsând 721.218 de imagini de antrenare și 72.172 de imagini de test pentru a fi comparate.

Testare

Deși rețeaua experimentală a fost inițial configurată pentru a putea face față la 35 de transformări potențiale, acestea au fost reduse la opt pentru a efectua testări analoge împotriva cadrului InterFaceGAN, GANSpace și StyleFlow.

Atributele selectate au fost Vârsta, Chelia, Bărbăție, Expresie, Sex, Ochelari, Pitch și Yaw. A fost necesar să se reconfigureze cadrele concurente pentru unele dintre cele opt atribute care nu au fost prevăzute în distribuția originală, cum ar fi adăugarea cheliei și bărbăției la InterFaceGAN.

Într-un test, InterFaceGAN și StyleFlow au schimbat sexul subiectului atunci când li s-a cerut să aplice vârsta:

Două dintre cadrele concurente au rulat o schimbare de sex în transformarea 'vârsta', schimbând și culoarea părului fără o solicitare directă din partea utilizatorului.

Două dintre cadrele concurente au rulat o schimbare de sex în transformarea ‘vârsta’, schimbând și culoarea părului fără o solicitare directă din partea utilizatorului.

În plus, două dintre rivale au constatat că ochelarii și vârsta sunt fețe inseparabile:

Ochelari și schimbarea culorii părului aruncate fără costuri suplimentare!

Ochelari și schimbarea culorii părului aruncate fără costuri suplimentare!

Nu este o victorie uniformă pentru cercetare: așa cum se poate vedea în videoclipul însoțitor încorporat la sfârșitul articolului, cadrul este cel mai puțin eficient atunci când încearcă să extrapoleze unghiuri diverse (yaw), în timp ce GANSpace are un rezultat general mai bun pentru vârsta și impunerea ochelarilor. Cadrul latent-la-latent a egalat GANSpace și StyleFlow în ceea ce privește adăugarea pitch-ului (unghiul capului).

Rezultate calculate pe baza unei calibrări a detectorului de fețe MTCNN. Rezultatele mai mici sunt mai bune.

Rezultate calculate pe baza unei calibrări a detectorului de fețe MTCNN. Rezultatele mai mici sunt mai bune.

Pentru mai multe detalii și o rezoluție mai bună a exemplelor, consultați videoclipul însoțitor al lucrării de mai jos.

 

Publicat pentru prima dată pe 16 februarie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai