Unghiul lui Anderson

O metodă nouă și mai simplă de deepfake care depășește abordările anterioare

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O colaborare între un grup de cercetare AI din China și cercetători din Statele Unite a dezvoltat ceea ce poate fi considerat prima inovație reală în tehnologia deepfake de la apariția acesteia, acum patru ani.

Noua metodă poate efectua schimbări de fețe care depășesc toate celelalte cadre existente pe teste perceptuale standard, fără a necesita colectarea și curățarea exhaustivă a unor seturi de date dedicate mari și antrenarea lor timp de până la o săptămână pentru o singură identitate. Pentru exemplele prezentate în noul articol, modelele au fost antrenate pe întregul a două seturi de date populare de celebrități, pe un singur GPU NVIDIA Tesla P40, timp de aproximativ trei zile.

Videoul complet este încorporat la sfârșitul acestui articol. În acest exemplu dintr-un videoclip din materialele suplimentare pentru noul articol, fața lui Scarlett Johansson este transferată pe videoclipul sursă. CihaNet elimină problema mascării marginilor atunci când se efectuează un schimb, prin formarea și punerea în aplicare a unor relații mai profunde între identitățile sursă și țintă, ceea ce înseamnă sfârșitul „marginilor evidente” și a altor glitch-uri de suprapunere care apar în abordările tradiționale de deepfake. Sursă: https://mitchellx.github.io/#video

Videoul complet este disponibil la sfârșitul acestui articol. În acest exemplu dintr-un videoclip din materialele suplimentare furnizate de unul dintre autorii noului articol, fața lui Scarlett Johansson este transferată pe videoclipul sursă. CihaNet elimină problema mascării marginilor atunci când se efectuează un schimb, prin formarea și punerea în aplicare a unor relații mai profunde între identitățile sursă și țintă, ceea ce înseamnă sfârșitul „marginilor evidente” și a altor glitch-uri de suprapunere care apar în abordările tradiționale de deepfake. Sursă: https://mitchellx.github.io/#video

Noua abordare elimină nevoia de a „lipi” identitatea transplantată în mod grosier în videoclipul țintă, ceea ce duce adesea la artefacte care apar acolo unde se termină fața falsă și începe fața reală, subiacentă. În schimb, se folosesc „hărți de halucinație” pentru a efectua o amestecare mai profundă a facetelor vizuale, deoarece sistemul separă identitatea de context mult mai eficient decât metodele actuale și, prin urmare, poate amesteca identitatea țintă la un nivel mai profund.

Din articol. Transformările CihaNet sunt facilitate prin hărți de halucinație (rândul de jos). Sistemul folosește informații de context (de exemplu, direcția feței, părul, ochelarii și alte obstacole, etc.) în întregime din imaginea în care va fi suprapusă noua identitate și informații de identitate facială în întregime de la persoana care urmează să fie inserată în imagine. Această capacitate de a separa fața de context este critică pentru succesul sistemului. Sursă: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Din articol. Transformările CihaNet sunt facilitate prin hărți de halucinație (rândul de jos). Sistemul folosește informații de context (de exemplu, direcția feței, părul, ochelarii și alte obstacole, etc.) în întregime din imaginea în care va fi suprapusă noua identitate și informații de identitate facială în întregime de la persoana care urmează să fie inserată în imagine. Această capacitate de a separa fața de context este critică pentru succesul sistemului. Sursă: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

În esență, noua hartă de halucinație oferă un context mai complet pentru schimb, în contrast cu măștile rigide care adesea necesită o curățare extinsă (și, în cazul DeepFaceLab, antrenare separată) și oferă o flexibilitate limitată în ceea ce privește incorporarea reală a celor două identități.

Din mostrele furnizate în materialele suplimentare, folosind atât setul de date FFHQ, cât și Celeb-A HQ, pe VGGFace și Forensics++. Primele două coloane arată imaginile selectate aleatoriu (reale) care urmează să fie schimbate. Următoarele patru coloane arată rezultatele schimbului folosind cele patru metode actuale cel mai eficiente, în timp ce ultima coloană arată rezultatul de la CihaNet. Repositoriul FaceSwap a fost folosit, și nu DeepFaceLab, deoarece ambele proiecte sunt fork-uri ale codului original de deepfakes de pe GitHub din 2017. Deși fiecare proiect a adăugat modele, tehnici, interfețe cu utilizator diversificate și unelte suplimentare, codul care face posibile deepfake-urile nu s-a schimbat niciodată și rămâne comun pentru ambele. Sursă: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

Articolul științific, intitulat Rețea de halucinație contextuală și de identitate într-un singur stadiu, este scris de cercetători afiliați la JD AI Research și Universitatea din Massachusetts Amherst și a fost susținut de Programul Național de Cercetare și Dezvoltare al Chinei, sub Grantul nr. 2020AAA0103800. A fost prezentat la Conferința Internațională a ACM din 2021, pe 20-24 octombrie, la Chengdu, China.

Nu este necesară “paritatea feței”

Atât software-ul de deepfake cel mai popular în prezent, DeepFaceLab, cât și fork-ul său concurent, FaceSwap, efectuează fluxuri de lucru tortuoase și adesea curate manual pentru a identifica care este direcția feței, care sunt obstacolele care trebuie luate în considerare (din nou, manual) și trebuie să facă față multor alte impedimente iritante (inclusiv iluminarea) care fac utilizarea lor departe de experiența „point-and-click” inexact portretizată în mass-media de la apariția deepfake-urilor.

În schimb, CihaNet nu necesită ca două imagini să fie orientate direct către cameră pentru a extrage și exploata informații utile de identitate dintr-o singură imagine.

În aceste exemple, o suită de software de deepfake concurente sunt provocate cu sarcina de a schimba fețe care nu numai că sunt diferite în ceea ce privește identitatea, dar care nu sunt orientate în aceeași direcție. Software-ul derivat din depozitul original de deepfakes (cum ar fi popularul DeepFaceLab și FaceSwap, prezentate mai sus) nu poate face față disparității unghiurilor dintre cele două imagini care urmează să fie schimbate (a se vedea a treia coloană). Între timp, CihaNet poate abstractiza corect identitatea, deoarece „poza” feței nu face parte în mod inerent din informațiile de identitate.

În aceste exemple, o suită de software de deepfake concurente sunt provocate cu sarcina de a schimba fețe care nu numai că sunt diferite în ceea ce privește identitatea, dar care nu sunt orientate în aceeași direcție. Software-ul derivat din depozitul original de deepfakes (cum ar fi popularul DeepFaceLab și FaceSwap, prezentate mai sus) nu poate face față disparității unghiurilor dintre cele două imagini care urmează să fie schimbate (a se vedea a treia coloană). Între timp, CihaNet poate abstractiza corect identitatea, deoarece „poza” feței nu face parte în mod inerent din informațiile de identitate.

Arhitectură

Proiectul CihaNet, potrivit autorilor, a fost inspirat de colaborarea din 2019 între Microsoft Research și Universitatea Peking, numită FaceShifter, deși face unele modificări notabile și critice asupra arhitecturii metodei mai vechi.

FaceShifter folosește două rețele de normalizare a instanței adaptive (AdaIN) pentru a gestiona informațiile de identitate, care sunt apoi transpuse în imaginea țintă prin intermediul unei măști, într-un mod similar cu software-ul de deepfake popular în prezent (și cu toate limitările sale), folosind o rețea suplimentară HEAR-Net (care include o sub-rețea separată antrenată pe obstacole de occluzie – un strat suplimentar de complexitate).

În schimb, noua arhitectură folosește direct aceste informații „contextuale” pentru procesul de transformare, prin intermediul unei operațiuni de normalizare a instanței adaptive în cascadă (C-AdaIN) în două etape, care asigură coerența contextului (de exemplu, pielea feței și obstacolele) a zonelor relevante pentru identitate.

Al doilea sub-rețea crucial pentru sistem este blocul de schimb (SwapBlk), care generează o caracteristică integrată din contextul imaginii de referință și informațiile „de identitate” încorporate din imaginea sursă, ocolind etapele multiple necesare pentru a realiza acest lucru prin mijloace convenționale.

Pentru a ajuta la diferențierea contextului și a identității, se generează o hartă de halucinație pentru fiecare nivel, care înlocuiește o mască de segmentare moale și acționează asupra unei game mai largi de caracteristici pentru această parte critică a procesului de deepfake.

Pe măsură ce crește valoarea hărții de halucinație (prezentată mai jos, la dreapta), apare un drum mai clar între identități.

Pe măsură ce crește valoarea hărții de halucinație (prezentată mai jos, la dreapta), apare un drum mai clar între identități.

În acest fel, întregul proces de schimb este realizat într-un singur stadiu și fără post-procesare.

Date și testare

Pentru a testa sistemul, cercetătorii au antrenat patru modele pe două seturi de date deschise și variate de imagini – CelebA-HQ și setul de date Flickr-Faces-HQ al NVIDIA (FFHQ), fiecare conținând 30.000 și 70.000 de imagini, respectiv.

Nu s-a efectuat nicio curățare sau filtrare a acestor seturi de date de bază. În fiecare caz, cercetătorii au antrenat întregul set de date pe un singur GPU Tesla, timp de trei zile, cu o rată de învățare de 0,0002 pe optimizarea Adam.

Apoi, au generat o serie de schimburi aleatorii între miile de personalități prezentate în seturile de date, fără a ține cont de faptul că fețele erau similare sau chiar dacă erau potrivite ca sex, și au comparat rezultatele CihaNet cu ieșirile de la patru cadre de deepfake de top: FaceSwap (care înlocuiește DeepFaceLab mai popular, deoarece împărtășește o bază de cod în depozitul original de deepfakes din 2017 care a adus deepfake-urile în lume); FaceShifter menționat mai sus; FSGAN; și SimSwap.

Prin compararea rezultatelor prin VGG-Face, FFHQ, CelebA-HQ și FaceForensics++, autorii au constatat că noul lor model a depășit toate modelele anterioare, așa cum se arată în tabelul de mai jos.

Cei trei parametri folosiți pentru evaluarea rezultatelor au fost similaritatea structurală (SSIM), eroarea de estimare a poziției capului (pose estimation error) și acuratețea recuperării ID-ului (ID retrieval accuracy), care se calculează pe baza procentului de perechi recuperate cu succes.

Cercetătorii susțin că CihaNet reprezintă o abordare superioară în ceea ce privește rezultatele calitative și o avansare notabilă a stadiului actual al tehnologiilor de deepfake, prin eliminarea sarcinii arhitecturilor și metodelor de mascare extinse și laborioase și prin realizarea unei separări mai utile și mai eficiente a identității de context.

Vezi mai jos pentru a vedea exemple video suplimentare ale noii tehnici. Puteți găsi videoclipul complet aici.

Din materialele suplimentare pentru noul articol, CihaNet efectuează schimbări de fețe pe diverse identități. Sursă: https://mitchellx.github.io/#video

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai