Unghiul lui Anderson
Reconfigurarea fețelor în videoclipuri cu ajutorul învățării automate

O colaborare de cercetare între China și Regatul Unit a conceput o nouă metodă pentru a reconfigura fețele în videoclipuri. Tehnica permite o lărgire și îngustare convingătoare a structurii feței, cu o mare consistență și lipsă de artefacte.

Dintr-un videoclip de pe YouTube utilizat ca material sursă de către cercetători, actrița Jennifer Lawrence apare ca o personalitate mai slabă (dreapta). Vezi videoclipul însoțitor încorporat la sfârșitul articolului pentru mai multe exemple la o rezoluție mai bună. Sursă: https://www.youtube.com/watch?v=tA2BxvrKvjE
Acest tip de transformare este de obicei posibilă doar prin metode tradiționale de CGI care ar necesita să recreeze complet fața prin proceduri detaliate și scumpe de capturare a mișcării, montare și texturare.
În schimb, ceea ce există în tehnica CGI este integrat într-un pipeline neural ca informații parametrice 3D despre față, care sunt ulterior utilizate ca bază pentru un flux de lucru de învățare automată.

Fețele parametrice tradiționale sunt din ce în ce mai utilizate ca ghid pentru procese transformative care utilizează AI în loc de CGI. Sursă: https://arxiv.org/pdf/2205.02538.pdf
Autorii afirmă:
‘Scopul nostru este să generăm rezultate de înaltă calitate de reconfigurare a videoclipurilor portret, prin editarea formei generale a fețelor portret în conformitate cu deformarea naturală a feței în lumea reală. Acest lucru poate fi utilizat pentru aplicații precum generarea fețelor frumoase pentru înfrumusețare și exagerarea feței pentru efecte vizuale.’
Deși răsucirea și distorsionarea feței 2D a fost disponibilă consumatorilor de la apariția Photoshop (și a condus la subculturi ciudate și adesea inacceptabile around distorsionarea feței și dismorfofobia corporală), este o chestiune dificilă de a o realiza în videoclipuri fără a utiliza CGI.

Dimensiunile feței lui Mark Zuckerberg extinse și îngustate de noua tehnică chino-britanică.
Reconfigurarea corpului este în prezent un domeniu de interes intens în sectorul viziunii calculate, în principal datorită potențialului său în comerțul electronic cu modă, deși făcând ca cineva să pară mai înalt sau divers din punct de vedere scheletic este în prezent o provocare notabilă.
La fel, schimbarea formei capului în imagini video într-un mod consecvent și convingător a fost subiectul unor lucrări anterioare ale cercetătorilor de la noul articol, deși acea implementare a suferit de artefacte și alte limitări. Noua ofertă extinde capacitatea acelei cercetări anterioare de la ieșire statică la ieșire video.
Noul sistem a fost instruit pe un calculator de birou cu un procesor AMD Ryzen 9 3950X și 32 GB de memorie și utilizează un algoritm de flux optic de la OpenCV pentru hărți de mișcare, netezite de cadrul StructureFlow; Rețeaua de aliniere a feței (FAN) pentru estimarea reperelor, care este utilizată și în pachetele populare de deepfakes; și solverul Ceres pentru a rezolva provocările de optimizare.

Un exemplu extrem de lărgire a feței cu noul sistem.
Articolul se intitulează Reconfigurarea parametrică a portretelor în videoclipuri și provine de la trei cercetători de la Universitatea Zhejiang și unul de la Universitatea din Bath.
Despre Față
Sub noul sistem, videoclipul este extras într-o secvență de imagini, iar o poziție rigidă este estimată mai întâi pentru fiecare față. Apoi, un număr reprezentativ de cadre ulterioare sunt estimate împreună pentru a construi parametri de identitate consecvenți de-a lungul întregii secvențe de imagini (adică cadrele videoclipului).

Arhitectura fluxului de răsucire a feței.
După aceea, expresia este evaluată, ceea ce duce la un parametru de reconfigurare care este implementat prin regresie liniară. Apoi, o abordare nouă de funcție de distanță semnată (SDF) construiește o hartă densă 2D a liniamentelor feței înainte și după reconfigurare.
În final, se efectuează o optimizare a răsucirii conștiente de conținut pe videoclipul de ieșire.
Fețe Parametrice
Procesul utilizează un model de față maleabil 3D (3DMM), un ajutor din ce în ce mai popular pentru sistemele de sinteză a feței neuronale și bazate pe GAN, precum și fiind aplicabil pentru sisteme de detectare a deepfakes.

Nu din noul articol, dar un exemplu de model de față maleabil 3D (3DMM) – un prototip de față parametric utilizat în noul proiect. Sursă: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Fluxul de lucru al noului sistem trebuie să ia în considerare cazurile de ocultare, cum ar fi o instanță în care subiectul se uită în altă parte. Acesta este unul dintre cele mai mari provocări în software-ul de deepfakes, deoarece reperele FAN au o capacitate mică de a ține cont de aceste cazuri și tind să se deterioreze în calitate pe măsură ce fața se abate sau este ocluzionată.
Noul sistem este capabil să evite această capcană prin definirea unei energii de contur care poate să se potrivească cu granița dintre fața 3D (3DMM) și fața 2D (definită de reperele FAN).
Optimizare
O utilizare utilă a unui astfel de sistem ar fi să implementeze deformarea în timp real, de exemplu în filtrele de video-conferință. Cadrul actual nu permite acest lucru, iar resursele de calcul necesare ar face ca deformarea “live” să fie o provocare notabilă.
Conform articolului, și presupunând un obiectiv de videoclip cu 24 de cadre pe secundă, operațiunile pe cadru din pipeline reprezintă o întârziere de 16,344 de secunde pentru fiecare secundă de filmare, cu lovituri suplimentare unice pentru estimarea identității și deformarea feței 3D (321 ms și 160 ms, respectiv).
Prin urmare, optimizarea este cheia pentru a face progrese în direcția reducerii întârzierii. Deoarece optimizarea comună pe toate cadrele ar adăuga o sarcină severă procesului, iar optimizarea de tip “init” (presupunând identitatea consistentă a vorbitorului din primul cadru) ar putea duce la anomalii, autorii au adoptat un schema rară pentru a calcula coeficienții cadrelor eșantionate la intervale practice.
Optimizarea comună este apoi efectuată pe acest subset de cadre, ceea ce duce la un proces de reconstrucție mai eficient.
Răsucirea Feței
Tehnica de răsucire utilizată în proiect este o adaptare a lucrării autorilor din 2020 Portrete adânci (DSP).

Portrete adânci, o lucrare din 2020 prezentată la ACM Multimedia. Sursă: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Autorii observă ‘Ne extindem această metodă de la reconfigurarea unei singure imagini monoculare la reconfigurarea întregii secvențe de imagini.’
Teste
Articolul observă că nu a existat niciun material comparabil anterior pentru a evalua noua metodă. Prin urmare, autorii au comparat cadre din ieșirea video răsucită cu ieșirea statică DSP.

Testarea noului sistem împotriva imaginilor statice din Portrete adânci.
Autorii notează că artefactele rezultă din metoda DSP, din cauza utilizării sale a cartografierii rare – o problemă pe care noul cadru o rezolvă cu cartografierea densă. În plus, videoclipul produs de DSP, conform articolului, demonstrează lipsa de netezime și coerență vizuală.
Autorii afirmă:
‘Rezultatele arată că abordarea noastră poate produce în mod robust videoclipuri portret reconfigurate coerent, în timp ce metoda bazată pe imagine poate duce ușor la artefacte de clipire vizibile.’
Vezi videoclipul însoțitor de mai jos, pentru mai multe exemple:
Publicat pentru prima dată pe 9 mai 2022. Revizuit la 18:00 EET, înlocuit ‘câmp’ cu ‘funcție’ pentru SDF.












