Unghiul lui Anderson

RigNeRF: O Nouă Metodă de Deepfakes Care Utilizează Câmpuri de Radianță Neuronale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Noi cercetări dezvoltate la Adobe oferă prima metodă viabilă și eficientă de deepfakes bazată pe Câmpuri de Radianță Neuronale (NeRF) – poate prima inovație reală în arhitectură sau abordare în cei cinci ani de la apariția deepfakes în 2017.

Metoda, intitulată RigNeRF, utilizează modele de fețe morphabile 3D (3DMM) ca un strat intermediar de instrumentaritate între intrarea dorită (de exemplu, identitatea care urmează a fi impusă în NeRF) și spațiul neural, o metodă care a fost îmbrățișată pe scară largă în ultimii ani de abordările de sinteză a feței bazate pe Rețele Adversative Generative (GAN), niciuna dintre acestea nefiind capabilă să producă cadre funcționale și utile de înlocuire a feței pentru videoclipuri.

Din materialul suplimentar pentru noul articol, vedem modelul de față morphabilă 3D (3DMM) care acționează ca o interfață între 70 de secunde de filmări reale luate de pe un smartphone, care constituie setul de date de antrenare, și parametrii obișnuiți ai unei visualizări a Câmpului de Radianță Neuronale. Pentru o versiune de înaltă rezoluție a acestui clip, precum și pentru multe altele, vedeți pagina proiectului sau videoclipurile încorporate la sfârșitul acestui articol. Sursă: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

În contrast cu videoclipurile tradiționale de deepfakes, niciunul dintre conținutul în mișcare prezentat aici nu este ‘real’, ci mai degrabă un spațiu neural explorabil care a fost antrenat pe filmări scurte. În partea dreaptă, vedem modelul de față morphabilă 3D (3DMM) care acționează ca o interfață între manipulările dorite (‘zâmbire’, ‘privește la stânga’, ‘privește în sus’, etc.) și parametrii obișnuiți ai unei visualizări a Câmpului de Radianță Neuronale. Pentru o versiune de înaltă rezoluție a acestui clip, precum și pentru alte exemple, vedeți pagina proiectului, sau videoclipurile încorporate la sfârșitul acestui articol. Sursă: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

Modelele de fețe morphabile 3D (3DMM) sunt, în esență, modele CGI de fețe, ale căror parametri pot fi adaptați la sisteme de sinteză de imagini mai abstracte, cum ar fi NeRF și GAN, care altfel sunt dificil de controlat.

Ceea ce vedeți în imaginea de mai sus (imaginea din mijloc, bărbatul cu cămașa albastră), precum și imaginea de mai jos (imaginea din stânga, bărbatul cu cămașa albastră), nu este un videoclip ‘real’ în care a fost suprapus un mic fragment de ‘față falsă’, ci o scenă complet sintetizată care există doar ca o reprezentare neurală volumetrică – inclusiv corpul și fundalul:

În exemplul de mai sus, videoclipul real din partea dreaptă (femeia cu rochia roșie) este folosit pentru a ‘puppetiza’ identitatea capturată (bărbatul cu cămașa albastră) din partea stângă prin intermediul RigNeRF, care (autorii susțin) este primul sistem NeRF-bazat care reușește să separe poza și expresia, fiind capabil să efectueze sinteze de vedere noi.

Figura masculină din partea stângă a imaginii de mai sus a fost ‘capturată’ dintr-un videoclip de 70 de secunde, iar datele de intrare (inclusiv informațiile despre întreaga scenă) au fost ulterior antrenate pe 4 GPU V100 pentru a obține scena.

Deoarece modelele de fețe morphabile 3D (3DMM) sunt disponibile și sub formă de proxii CGI parametrici pentru întregul corp (și nu doar pentru fețe), RigNeRF deschide posibilitatea de a crea deepfakes cu corpul întreg, unde mișcarea, textura și expresia umană reală pot fi transmise către stratul parametric CGI, care ar traduce apoi acțiunea și expresia în medii NeRF și videoclipuri.

În ceea ce privește RigNeRF – califică el ca o metodă de deepfakes în sensul în care înțelegem termenul în prezent? Sau este doar o altă metodă semi-încetinită, asemănătoare cu DeepFaceLab și alte sisteme de deepfakes bazate pe autoencoder din 2017?

Cercetătorii noului articol sunt neînduplecați în acest punct:

‘Fiind o metodă capabilă să reanime fețe, RigNeRF este predispus la utilizare abuzivă de către actori răi pentru a genera deepfakes.’

Noul articol se intitulează RigNeRF: Portrete Neuronale 3D pe deplin controlabile și provine de la ShahRukh Atha de la Universitatea Stonybrook, un intern la Adobe în timpul dezvoltării RigNeRF, și alți patru autori de la Adobe Research.

Dincolo de Deepfakes bazate pe Autoencoder

Majoritatea deepfakes virale care au capturat titlurile de știri în ultimii ani sunt produse de sisteme bazate pe autoencoder, derivate din codul publicat pe subredditul r/deepfakes în 2017 – deși nu înainte de a fi copiat pe GitHub, unde a fost forkat de peste o mie de ori, nu în ultimul rând în distribuția populară (dar controvesată) DeepFaceLab, și de asemenea proiectul FaceSwap.

Pe lângă GAN și NeRF, cadrele de autoencoder au experimentat și cu 3DMM ca ‘ghid’ pentru îmbunătățirea sintezei faciale. Un exemplu al acestui lucru este proiectul HifiFace din iulie 2021. Cu toate acestea, nu pare să fi apărut nicio inițiativă utilă sau populară din această abordare până în prezent.

Datele pentru scenele RigNeRF sunt obținute prin capturarea unor videoclipuri scurte de pe un smartphone. Pentru proiect, cercetătorii RigNeRF au folosit un iPhone XR sau un iPhone 12 pentru toate experimentele. Pentru prima jumătate a capturării, subiectul este rugat să efectueze o gamă largă de expresii faciale și să vorbească în timp ce ține capul nemișcat, în timp ce camera este mișcată în jurul lui.

Pentru a doua jumătate a capturării, camera menține o poziție fixă, în timp ce subiectul trebuie să-și miște capul în jur, arătând o gamă largă de expresii. Rezultatul este de 40-70 de secunde de filmări (aproximativ 1200-2100 de cadre) care reprezintă întregul set de date care va fi folosit pentru antrenarea modelului.

Reducerea Colectării de Date

În contrast, sistemele bazate pe autoencoder, cum ar fi DeepFaceLab, necesită colectarea și curățarea relativ laborioasă a mii de fotografii diverse, adesea luate de pe YouTube, canale de social media și filme (în cazul deepfakes-urilor de celebrități).

Modelele antrenate de autoencoder sunt adesea destinate a fi utilizate în diverse situații. Cu toate acestea, cei mai meticuloși ‘deepfakers de celebrități’ pot antrena modele întregi de la zero pentru un singur videoclip, în ciuda faptului că antrenamentul poate dura o săptămână sau mai mult.

În ciuda notei de avertizare din partea cercetătorilor noului articol, seturile de date ‘în patchwork’ și ‘în ansamblu’ care alimentează pornografia AI, precum și ‘recastările de deepfakes’ populare de pe YouTube și TikTok, par să nu producă rezultate acceptabile și consistente într-un sistem de deepfakes, cum ar fi RigNeRF, care are o metodologie specifică scenei. Având în vedere restricțiile de capturare a datelor descrise în noul articol, acest lucru ar putea constitui, într-o oarecare măsură, un mijloc suplimentar de protecție împotriva utilizării abuzive a identității de către deepfakers malefici.

Adaptarea NeRF la Videoclipuri de Deepfakes

NeRF este o metodă bazată pe fotogrammetrie în care o mică serie de fotografii sursă luate din diverse puncte de vedere sunt asamblate într-un spațiu neural 3D explorabil. Această abordare a căpătat notorietate la începutul acestui an, când NVIDIA a prezentat sistemul Instant NeRF, capabil să reducă timpul de antrenament exorbitant pentru NeRF la minute sau chiar secunde:

Instant NeRF. Sursă: https://www.youtube.com/watch?v=DJ2hcC1orc4

Scena rezultată a Câmpului de Radianță Neuronale este, în esență, un mediu static care poate fi explorat, dar care este dificil de editat. Cercetătorii notează că două inițiative anterioare bazate pe NeRF – HyperNeRF + E/P și NerFACE – au încercat să sintetizeze videoclipuri faciale, și (aparent pentru sake de completitudine și diligență) au comparat RigNeRF cu aceste două cadre într-o rundă de testare:

Instant NeRF. Sursă: https://www.youtube.com/watch?v=DJ2hcC1orc4

O comparație calitativă între RigNeRF, HyperNeRF și NerFACE. Vedeți videoclipurile sursă și PDF-ul pentru versiuni de înaltă calitate. Sursă imagine statică: https://arxiv.org/pdf/2012.03065.pdf

O comparație calitativă între RigNeRF, HyperNeRF și NerFACE. Vedeți videoclipurile sursă și PDF-ul pentru versiuni de înaltă calitate. Sursă imagine statică: https://arxiv.org/pdf/2012.03065.pdf

Cu toate acestea, în acest caz, rezultatele, care favorizează RigNeRF, sunt destul de anormale, din două motive: primul, autorii observă că ‘nu există o comparație directă’; al doilea, acest lucru a necesitat limitarea capacităților RigNeRF pentru a se potrivi, cel puțin parțial, cu funcționalitatea mai restrictivă a sistemelor anterioare.

Deoarece rezultatele nu reprezintă o îmbunătățire incrementală a lucrărilor anterioare, ci mai degrabă o ‘înfrângere’ a editabilității și utilității NeRF, vom lăsa testarea deoparte și vom vedea ce face RigNeRF diferit de predecesorii săi.

Forțe Combinate

Limitarea principală a NerFACE, care poate crea controlul pozei și expresiei într-un mediu NeRF, este că presupune că filmările sursă vor fi capturate cu o cameră statică. Acest lucru înseamnă, în esență, că nu poate produce vedere noi care să depășească limitările sale de capturare. Acest lucru produce un sistem care poate crea ‘portrete în mișcare’, dar care este nepotrivit pentru videoclipuri de deepfakes.

HyperNeRF, pe de altă parte, deși capabil să genereze vedere noi și hiper-reale, nu are nicio instrumentare care să îi permită să schimbe pozele capului sau expresiile faciale, ceea ce nu duce la niciun fel de competitor pentru deepfakes bazate pe autoencoder.

RigNeRF este capabil să combine aceste două funcționalități izolate prin crearea unui ‘spațiu canonic’, o bază de referință de la care pot fi efectuate deviații și deformări prin intrarea din modulul 3DMM.

Crearea unui 'spațiu canonic' (fără poziționare, fără expresie), pe care pot acționa deformările (adică poziționări și expresii) produse prin modulul 3DMM.

Crearea unui ‘spațiu canonic’ (fără poziționare, fără expresie), pe care pot acționa deformările (adică poziționări și expresii) produse prin modulul 3DMM.

Deoarece sistemul 3DMM nu va fi exact potrivit cu subiectul capturat, este important să se compenseze acest lucru în proces. RigNeRF realizează acest lucru printr-un câmp de deformare anterior calculat dintr-un Perceptron Multistrat (MLP) derivat din filmările sursă.

Parametrii camerei necesari pentru a calcula deformările sunt obținuți prin COLMAP, în timp ce parametrii de expresie și formă pentru fiecare cadru sunt obținuți din DECA.

Poziționarea este ulterior optimizată prin ajustarea reperelor și parametrii camerei COLMAP, și, din cauza restricțiilor de resurse de calcul, ieșirea video este redimensionată la o rezoluție de 256×256 pentru antrenament (un proces de reducere hardware-constrâns care afectează și scena de deepfakes bazate pe autoencoder).

După aceea, rețeaua de deformare este antrenată pe cele patru V100 – hardware formidabil care nu este probabil să fie la îndemâna entuziaștilor casual (cu toate acestea, în ceea ce privește antrenamentul de învățare automată, adesea se poate face schimbul între putere și timp, și pur și simplu se acceptă că antrenamentul modelului va dura zile sau chiar săptămâni).

În concluzie, cercetătorii afirmă:

‘În contrast cu alte metode, RigNeRF, datorită utilizării unui modul de deformare ghidat de 3DMM, este capabil să modeleze poziția capului, expresiile faciale și scena completă a portretului 3D cu fidelitate ridicată, oferind astfel reconstrucții mai bune cu detalii clare.’

Vedeți videoclipurile încorporate mai jos pentru detalii și filmări suplimentare.

 

 

Publicat pentru prima dată pe 15 iunie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai