Unghiul lui Anderson

Noua Metodă Deepfake Rezolvă Problema “Gazdei Feței”

mm
Adaugă Unite.AI la sursele tale preferate pe Google

În ciuda mai multor ani de hiperbolă mediatică cu privire la potențialul imaginilor deepfake de a submina încrederea noastră de lungă durată în autenticitatea filmelor, toate metodele populare actuale se bazează pe găsirea “gazdelor feței” care sunt în general similare ca formă cu fața țintă.

În cazul în care filmarea originală prezintă o față lată, dar subiectul țintă are o față îngustă, rezultatele au fost întotdeauna problematice, deoarece un astfel de transfer implică tăierea unei părți a feței originale și reconstruirea fundalului expus. Pachetele actuale, cum ar fi DeepFaceLab și FaceSwap, pot produce rezultate limitate atunci când configurația este inversată (îngust>lat), dar nu au nicio facilitate pentru a aborda convingător această scenă.

Acum, o colaborare între Tencent și Universitatea Xiamen din China a dezvoltat o nouă abordare, intitulată HifiFace, destinată să remedieze această lipsă.

Două deepfakes HifiFace, primul cu Anne Hathaway, unde o asemănare bună este obținută în ciuda incompatibilității formei feței gazdă. HifiFace funcționează bine și pe ținte cu ochelari, tradițional un obstacol în deepfakes. Sursă: https://arxiv.org/pdf/2106.09965.pdf

Două deepfakes HifiFace, primul cu Anne Hathaway, unde o asemănare bună este obținută în ciuda incompatibilității formei feței gazdă. HifiFace funcționează bine și pe ținte cu ochelari, tradițional un obstacol în deepfakes. Sursă: https://arxiv.org/pdf/2106.09965.pdf

Reconstruirea unei Fețe Deepfake

Abordările anterioare, cum ar fi Subject Agnostic Face Swapping and Reenactment (FSGAN), au depins de 3DMM fitting (3D Morphable Models) sau de alte metodologii bazate pe recunoașterea caracteristicilor feței sau transformare, unde liniamentele feței care urmează să fie “suprascrise” dictează practic limitele schimbului:

Sursă: https://github.com/Yinghao-Li/3DMM-fitting

Detectarea liniamentelor feței 3DMM. Sursă: https://github.com/Yinghao-Li/3DMM-fitting

Deși metodele concurente au folosit caracteristici derivate din rețele de recunoaștere a feței, acestea sunt în primul rând destinate reconstituirii texturii și nu a structurii, și produc, de asemenea, un efect “ca o mască” în cazurile în care fața gazdă nu este complet compatibilă (adică limitele și forma părului, linia maxilarului și obrajilor).

Pentru a aborda aceste probleme, cercetătorii chinezi, cu sediul în Laboratorul de Analiză și Calcul Media din cadrul Departamentului de Inteligență Artificială al universității, au dezvoltat o rețea de la capăt la capăt care regresează coeficienții feței țintă și ai feței sursă, utilizând un model de reconstrucție 3D, care este apoi recombinate ca informații de formă și concatenate cu informații de identitate vectorială dintr-o rețea de recunoaștere a feței.

Aceste date geometrice sunt apoi introduse într-un model encoder-decoder ca informații structurale, amestecându-se cu expresia și dispoziția feței țintă, care sunt folosite ca surse auxiliare pentru transferul precis.

Fuziune Facială Semantică

În plus, HifiFace include o componentă de Fuziune Facială Semantică (SFF), care utilizează o caracteristică de nivel scăzut în encoder pentru a păstra informațiile spațiale și texturale, fără a sacrifica identitatea imaginii țintă. Caracteristicile din encoder și decoder sunt integrate într-o mască adaptivă învățată, iar informațiile de fundal sunt amestecate în ieșire prin intermediul măștii feței învățate.

HifiFace în acțiune. Sursă: https://johann.wang/HifiFace/

HifiFace în acțiune. Sursă: https://johann.wang/HifiFace/

În acest fel, HifiFace se abate de la utilizarea limitelor originale ale feței ca limită dură, utilizând segmentarea semantică a feței dilatate, în care modelul poate efectua o fuziune adaptivă mai bună pe marginile feței.

Două abordări anterioare (stânga sus și jos) și noua arhitectură HifiFace, care constă dintr-un encoder, decoder, extractor de identitate 3D conștient de formă și modul SFF.

Două abordări anterioare (stânga sus și jos) și noua arhitectură HifiFace, care constă dintr-un encoder, decoder, extractor de identitate 3D conștient de formă și modul SFF.

Într-o comparație cu metodele anterioare FSGAN, SimSwap și FaceShifter, HifiFace demonstrează o reconstrucție superioară a formei feței, deoarece nu aproximează elemente “fantomatice” în care delimitările feței confundă mappingul identitate>identitate, ci le reconstruiește în mod definitiv.

Testare

Cercetătorii au implementat sistemul utilizând seturile de date VGGFace2 și DeepGlint Asian-Celeb. Fețele au fost aliniate prin 5 repere externe și recalculate la 256×256 pixeli. O rețea de îmbunătățire a portretului a fost utilizată și pentru a genera o versiune de 512×512 pixeli, pentru un model suplimentar de înaltă rezoluție. Modelul a fost antrenat sub Adam.

Deși FaceShifter păstrează identitatea bine, nu poate aborda problemele de expresie, culoare și occluzie la fel de eficient ca HifiFace și are o structură de rețea mai complexă. FSGAN are probleme la transferul iluminării de la sursă la țintă.

Cercetătorii utilizează FaceForensics++ pentru comparații cantitative, eșantionând zece cadre într-un lot de videoclipuri convertite prin metodele concurente și constatând că HifiFace a obținut un scor de recuperare a identității superior. La testarea unei game de alte factori, cum ar fi calitatea imaginii, cercetătorii au constatat, de asemenea, că metoda lor a depășit metodologiile rivale.

Liniamentele feței lui Benedict Cumberbatch sunt reproduse cu fidelitate.

Liniamentele feței lui Benedict Cumberbatch sunt reproduse cu fidelitate.

Lucrarea reprezintă o mișcare suplimentară către abstractizarea materialului sursă, astfel încât să fie doar un model aproximativ în care pot fi transferate identități precise. Unele dintre pachetele actuale FOSS, inclusiv DeepFaceLab, prezintă funcționalități incipiente pentru înlocuirea completă a capului, dar, la fel ca HifiFace, acestea nu iau în considerare părul și sunt mai eficiente la “construirea” unei fețe decât la “cioplirea” ei pentru a se potrivi cu o sursă țintă dorită.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai