Andersons vinkel
RigNeRF: En ny metode til deepfakes, der anvender Neural Radiance Fields

Nyt forskning udviklet hos Adobe tilbyder den første viable og effektive deepfakes-metode baseret på Neural Radiance Fields (NeRF) – måske den første rigtige innovation i arkitektur eller tilgang i de fem år siden deepfakes opstod i 2017.
Metoden, der hedder RigNeRF, anvender 3D-morfable ansigtsmodeller (3DMMs) som en midlertidig lag mellem den ønskede input (dvs. identiteten, der skal påføres NeRF-renderingen) og den neurale rum, en metode, der er vidt udbredt i de seneste år af Generative Adversarial Network (GAN) ansigts-syntese-tilgange, ingen af hvilke har produceret funktionelle og nyttige ansigts-erstatnings-rammer for video.

Ulig traditionelle deepfake-videoer, er absolut ingen af de mobile indhold, der vises her, ‘rigtige’, men snarere en udforskbar neural rum, der er trænet på kort optaget video. På højre side ser vi 3D-morfable ansigtsmodel (3DMM) fungerer som en grænseflade mellem de ønskede manipulationer (‘smil’, ‘se til venstre’, ‘se op’, osv.) og de normalt uhåndterlige parametre for en Neural Radiance Field-visning. For en højopløselig version af denne klip, samt andre eksempler, se projekt-siden, eller de indlejrede videoer i artiklens slutning. Kilde: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
3DMMs er effektivt CGI-modeller af ansigter, hvis parametre kan tilpasses mere abstrakte billed-syntese-systemer, såsom NeRF og GAN, som ellers er svære at kontrollere.
Hvad du ser i billedet ovenfor (midterbillede, mand i blå skjorte), samt billedet lige under (venstre billede, mand i blå skjorte), er ikke en ‘rigtig’ video, hvori en lille del ‘falsk’ ansigt er påført, men en helt syntetiseret scene, der kun eksisterer som en volumetrisk neural rendering – herunder kroppen og baggrunden:

I eksemplet lige ovenfor, bruges den rigtige video på højre side (kvinde i rød kjole) til at ‘marionet’ den fangete identitet (mand i blå skjorte) på venstre side via RigNeRF, som (forfatterne hævder) er det første NeRF-baserede system, der opnår adskillelse af pose og udtryk, samtidig med at det kan udføre nye synssynteser.
Den mandlige figur på venstre side i billedet ovenfor blev ‘fanget’ fra en 70-sekunders smartphone-video, og input-dataen (herunder hele scenen-oplysningerne) trænet over 4 V100 GPU’er for at opnå scenen.
Siden 3DMM-stile parametrisk rigs også er tilgængelige som hele-kroppen parametrisk CGI-proxies (i stedet for kun ansigts-rigs), åbner RigNeRF potentielt muligheden for fuld-kropp deepfakes, hvor rigtigt menneskeligt bevægelse, tekstur og udtryk overføres til CGI-baseret parametrisk lag, der derefter oversætter handling og udtryk til renderede NeRF-miljøer og videoer.
Angående RigNeRF – kvalificerer det som en deepfake-metode i den nuværende forstand, som overskrifterne forstår begrebet? Eller er det bare endnu en semi-handicappet også-ran til DeepFaceLab og andre laborie–intensive, 2017-æra autoencoder deepfake-systemer?
De nye artiklens forskeres er ubestemte på dette punkt:
‘At være en metode, der kan genanimerer ansigter, er RigNeRF tilbøjelig til misbrug af dårlige aktører til at generere deep-fakes.’
Den nye artikel hedder RigNeRF: Fuldt kontrollerbare neurale 3D-portrætter, og kommer fra ShahRukh Atha fra Stonybrook University, en praktikant hos Adobe under RigNeRF’s udvikling, og fire andre forfattere fra Adobe Research.
Beyond Autoencoder-Based Deepfakes
De fleste virale deepfakes, der har fanget overskrifterne i de seneste år, er produceret af autoencoder-baserede systemer, der er afledt af koden, der blev offentliggjort på det prompte-forbudte r/deepfakes subreddit i 2017 – selv om det ikke før blev kopieret til GitHub, hvor det nu er blevet over 1000 gange, ikke mindst ind i den populære (omend kontroversielle) DeepFaceLab-distributionen, og også FaceSwap-projektet.
Foruden GAN og NeRF har autoencoder-rammer også eksperimenteret med 3DMMs som ‘retningslinjer’ for forbedret ansigts-syntese-rammer. Et eksempel på dette er HifiFace-projektet fra juli 2021. Men ingen brugbare eller populære initiativer synes at have udviklet sig fra denne tilgang indtil nu.
Data til RigNeRF-scener erhverves ved at fange korte smartphone-videoer. Til projektet brugte RigNeRF’s forskere en iPhone XR eller en iPhone 12 til alle eksperimenter. For den første halvdel af optagelsen bedes subjektet udføre en bred vifte af ansigtsudtryk og tale, mens hovedet holdes stille, mens kameraet bevæger sig rundt om dem.
For den anden halvdel af optagelsen holder kameraet en fast position, mens subjektet skal bevæge hovedet rundt, mens de udviser en bred vifte af udtryk. De resulterende 40-70 sekunders footage (omkring 1200-2100 billeder) repræsenterer det samlede datasæt, der vil blive brugt til at træne modellen.
Cutting Down on Data-Gathering
I modsætning hertil kræver autoencoder-systemer som DeepFaceLab den relativt omstændelige indsamling og kuratering af tusinder af forskellige billeder, ofte taget fra YouTube-videoer og andre sociale medie-kanaler, samt fra film (i tilfælde af celebrity deepfakes).
De resulterende trænede autoencoder-modeller er ofte tiltænkt at blive brugt i en række situationer. Men de mest omhyggelige ‘celebrity’-deepfakers kan træne hele modeller fra scratch for en enkelt video, på trods af at træning kan tage en uge eller mere.
Trods advarselsnoten fra den nye artikels forskere, synes det ‘patchwork’ og bredt-sammensatte datasæt, der driver AI-porn og populære YouTube/TikTok ‘deepfake-genindcastninger’, usandsynligt at producere acceptabelt og konsistent resultat i et deepfake-system som RigNeRF, der har en scene-specifik metode. Givet begrænsningerne på data-indsamling, som er fastlagt i den nye artikel, kunne dette bevise, i nogen grad, en ekstra sikkerhed mod casual misbrug af identitet af ondsindede deepfakers.
Adapting NeRF to Deepfake Video
NeRF er en fotogrammetri-baseret metode, hvor et lille antal kilde-billeder, taget fra forskellige synsvinkler, samles i en udforskbar 3D neural-rum. Denne tilgang fik fremme tidligere på året, da NVIDIA præsenterede sit Instant NeRF-system, der kan kutte den ekstreme træningstid for NeRF ned til minutter eller endda sekunder:

Instant NeRF. Kilde: https://www.youtube.com/watch?v=DJ2hcC1orc4
Det resulterende Neural Radiance Field-scene er essentielt en statisk miljø, der kan udforskes, men som er svær at redigere. Forskerne bemærker, at to tidligere NeRF-baserede initiativer – HyperNeRF + E/P og NerFACE – har forsøgt at syntetisere ansigts-video, og (apparent for kompletthed og flid) har sat RigNeRF op imod disse to rammer i en test-runde:


En kvalitativ sammenligning mellem RigNeRF, HyperNeRF og NerFACE. Se de linkede kilde-videoer og PDF for højere-kvalitets-versioner. Statiske billedkilder: https://arxiv.org/pdf/2012.03065.pdf
Men i dette tilfælde er resultaterne, der favoriserer RigNeRF, ret anomale, af to grunde: først bemærker forfatterne, at ‘der ikke er nogen eksisterende arbejde til en æble-til-æble-sammenligning’; anden, dette har nødtvunget begrænsningen af RigNeRF’s funktioner til at matche de mere begrænsede funktioner af de tidligere systemer.
Da resultaterne ikke er en inkrementel forbedring af tidligere arbejde, men snarere repræsenterer en ‘gennembrud’ i NeRF-redigering og nytte, vil vi lade test-runden være og i stedet se, hvad RigNeRF gør anderledes end sine forgængere.
Combined Strengths
Den primære begrænsning af NerFACE, der kan oprette pose/udtryks-kontrol i et NeRF-miljø, er, at det antager, at kilde-videoen vil blive optaget med en statisk kamera. Dette betyder effektivt, at det ikke kan producere nye synsvinkler, der går ud over dets optagelsesbegrænsninger. Dette resulterer i et system, der kan oprette ‘bevægelige portrætter’, men som er uegnet til deepfake-stil video.
HyperNeRF, på den anden side, mens det kan generere nye og hyper-realiserede synsvinkler, har ingen instrumentering, der tillader det at ændre hoved-poser eller ansigtsudtryk, hvilket igen ikke resulterer i nogen form for konkurrent til autoencoder-baserede deepfakes.
RigNeRF kan kombinere disse to isolerede funktioner ved at oprette en ‘kanonisk rum’, en standard-baseline, fra hvilken afvigelser og deformationer kan udføres via input fra 3DMM-modulen.

Oprettelse af en ‘kanonisk rum’ (ingen pose, ingen udtryk), på hvilken deformationerne (dvs. poser og udtryk) produceret via 3DMM kan virke.
Siden 3DMM-systemet ikke vil være nøjagtigt matchet til den fangete subjekt, er det vigtigt at kompensere for dette i processen. RigNeRF opnår dette med en deformation-felt-forudsigelse, der er beregnet fra en Multilayer Perceptron (MLP) afledt fra kilde-videoen.

Kamera-parametrene nødvendige for at beregne deformationer erhverves via COLMAP, mens udtryks- og form-parametrene for hvert billede erhverves fra DECA.
Positionen optimeres yderligere gennem landmark-tilpasning og COLMAP’s kamera-parametre, og på grund af begrænsninger i beregningsressourcer, er video-udgangen nedsamplet til 256×256 opløsning under træning (en hardware-begrænset formindskning, der også plager autoencoder deepfake-scenen).
Efter dette trænes deformation-netværket på de fire V100’er – imponerende hardware, der sandsynligvis ikke er inden for rækkevidde for almindelige entusiaster (dog, hvor maskinlærings-træning er involveret, er det ofte muligt at handle kraft for tid, og blot acceptere, at model-træning vil tage dage eller endda uger).
I konklusion siger forskerne:
‘I modsætning til andre metoder, er RigNeRF, takket være brugen af en 3DMM-vejledt deformation-modul, i stand til at modellere hoved-pose, ansigtsudtryk og det fulde 3D-portræt-scene med høj troværdighed, hvilket giver bedre rekonstruktioner med skarpe detaljer.’
Se de indlejrede videoer nedenfor for yderligere oplysninger og resultater.
Først udgivet 15. juni 2022.












