Andersons vinkel

RigNeRF: En ny metode for deepfakes som bruker Neural Radiance Fields

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ny forskning utviklet hos Adobe tilbyr den første brukbare og effektive metoden for deepfakes basert på Neural Radiance Fields (NeRF) – kanskje den første virkelige innovasjonen i arkitektur eller tilnærming i de fem årene siden deepfakes dukket opp i 2017.

Metoden, tittelen RigNeRF, bruker 3D-morfeerbare ansiktsmodeller (3DMMs) som en midlertidig instrumentell lag mellom ønsket innputt (dvs. identiteten som skal påtvynes NeRF-renderingen) og neuralrommet, en metode som har blitt vidt akseptert i de senere årene av Generative Adversarial Network (GAN) ansikts-syntese-tilnærming, ingen av disse har ennå produsert funksjonelle og nyttige ansikts-erstatnings-rammeverk for video.

Fra supplering av det nye papiret, ser vi 3D-morfeerbare ansiktsmodellen (3DMM) som fungerer som en grensesnitt mellom 70 sekunder med ekte film tatt fra en smarttelefon, som utgjør treningsdatasettet, og de vanligvis stoiske parameterne til en Neural Radiance Field-visning. For en høyoppløselig versjon av denne klippet, samt mange andre, se prosjektets side eller de innlejrede videoene ved slutten av denne artikkelen. Kilde: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

I motsetning til tradisjonelle deepfake-videoer, er absolutt ingen av den bevegelige innholdet avbildet her ‘ekte’, men heller en utforskbar neuralrom som ble trent på kort film. På høyresiden ser vi 3D-morfeerbare ansiktsmodellen (3DMM) som fungerer som en grensesnitt mellom ønskede manipulasjoner (‘smile’, ‘se til venstre’, ‘se opp’, osv.) og de vanligvis uinntagelige parameterne til en Neural Radiance Field-visning. For en høyoppløselig versjon av denne klippet, samt andre eksempler, se prosjektets side, eller de innlejrede videoene ved slutten av denne artikkelen. Kilde: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

3DMMs er i praksis CGI-modeller av ansikter, der parameterne kan tilpasses mer abstrakte bilde-syntese-systemer, som NeRF og GAN, som ellers er vanskelige å kontrollere.

Hva du ser i bildet ovenfor (midten, mannen i blå skjorte), samt bildet rett under (venstre, mannen i blå skjorte), er ikke en ‘ekte’ video hvor en liten del ‘falsk’ ansikt er påtvunget, men en helt syntetisk scene som eksisterer kun som en volumetrisk neural rendering – inkludert kropp og bakgrunn:

I eksempelet rett over, brukes den ekte videoen på høyresiden (kvinnen i rød kjole) til å ‘puppe’ den fangete identiteten (mannen i blå skjorte) på venstre siden via RigNeRF, som (forfatterne hevder) er det første NeRF-baserte systemet som oppnår separasjon av pose og uttrykk samtidig som det kan utføre nye visuelt-syntetiske analyser.

Den mannlige figuren på venstre siden i bildet ovenfor ble ‘fanget’ fra en 70-sekunders video fra en smarttelefon, og inndataene (inkludert hele sceneninformasjonen) ble deretter trent over 4 V100-GPUer for å oppnå scenen.

Siden 3DMM-stil parametrisk rigging også er tilgjengelig som hele-kroppen parametrisk CGI-proxies (i stedet for bare ansikts-rigging), åpner RigNeRF potensielt muligheten for full-kropp deepfakes hvor ekte menneskelig bevegelse, tekstur og uttrykk overføres til CGI-basert parametrisk lag, som deretter ville oversette handling og uttrykk til renderede NeRF-miljøer og videoer.

Så langt RigNeRF – kvalifiserer det som en deepfake-metode i den nåværende forståelsen av begrepet? Eller er det bare en annen semi-handicappet også-ran til DeepFaceLab og andre arbeidskrevende, 2017-æra autoencoder deepfake-systemer?

Forskerne bak det nye papiret er uambisiøse på dette punktet:

‘Som en metode som er i stand til å gjenopplive ansikter, er RigNeRF utsatt for misbruk av dårlige aktører for å generere deepfakes.’

Det nye papiret har tittelen RigNeRF: Fullstendig kontrollerbare neurale 3D-portretter, og kommer fra ShahRukh Atha fra Stonybrook University, en intern ved Adobe under RigNeRF-utviklingen, og fire andre forfattere fra Adobe Research.

Bortenfor Autoencoder-Baserte Deepfakes

De fleste virale deepfakes som har fanget overskriftene de siste årene er produsert av autoencoder-baserte systemer, avledet fra koden som ble publisert på det raskt-forbudte r/deepfakes-subreddit i 2017 – selv om ikke før det ble kopiert over til GitHub, hvor det har blitt forket over tusen ganger, ikke minst inn i den populære (om enn kontroversielle) DeepFaceLab-distribusjonen, og også FaceSwap-prosjektet.

Bortsett fra GAN og NeRF, har autoencoder-rammeverk også eksperimentert med 3DMMs som ‘veiledninger’ for bedret ansikts-syntese-rammeverk. Et eksempel på dette er HifiFace-prosjektet fra juli 2021. Imidlertid ser det ikke ut til at noen brukbare eller populære initiativer har utviklet seg fra denne tilnærmingen til nå.

Data for RigNeRF-scener hentes ved å fange kort smartphone-videoer. For prosjektet brukte RigNeRF-forskerne en iPhone XR eller en iPhone 12 for alle eksperimenter. For den første halvdelen av fangsten, blir subjektet bedt om å utføre en rekke ansiktsuttrykk og tale mens hodet holdes stille, mens kameraet beveges rundt dem.

For den andre halvdelen av fangsten, holder kameraet en fast posisjon mens subjektet må bevege hodet rundt mens det viser en rekke uttrykk. De resulterende 40-70 sekundene med film (omtrent 1200-2100 rammeverk) representerer hele datasettet som vil bli brukt til å trene modellen.

Redusere Data-Samling

I motsetning til dette, krever autoencoder-systemer som DeepFaceLab en relativt arbeidskrevende innsamling og kurering av tusenvis av diverse bilder, ofte tatt fra YouTube-videoer og andre sosiale medier, samt fra filmer (i tilfelle av celebrity deepfakes).

De resulterende trente autoencoder-modellene er ofte ment å brukes i en rekke situasjoner. Imidlertid kan de mest omhyggelige ‘celebrity’-deepfakers trene hele modeller fra scratch for en enkelt video, til tross for at trening kan ta en uke eller mer.

Til tross for advarselsnotatet fra de nye papirets forskere, ser det ut til at ‘patchwork’- og bredt-sammensatte datasettene som driver AI-porn og populære YouTube/TikTok ‘deepfake-omkasting’ ser ut til å være usannsynlige å produsere akseptable og konsistente resultater i et deepfake-system som RigNeRF, som har en scene-spesifikk metode. Gitt begrensningene på datafangst som er omtalt i det nye arbeidet, kan dette vise seg å være en ekstra sikkerhet mot uforbeholden misbruk av identitet av dårlige deepfakers.

Tilpasse NeRF til Deepfake-Video

NeRF er en fotogrammetri-basert metode hvor et lite antall kildebilder tatt fra forskjellige vinkler samles inn i en utforskbar 3D-neuralrom. Denne tilnærmingen kom til prominens tidligere i år da NVIDIA avduket sitt Instant NeRF-system, som er i stand til å kutte de ekstreme trenings-tidene for NeRF ned til minutter, eller selv sekunder:

Instant NeRF. Kilde: https://www.youtube.com/watch?v=DJ2hcC1orc4

Det resulterende Neural Radiance Field-scenen er essensielt en statisk miljø som kan utforskes, men som er vanskelig å redigere. Forskerne bemerker at to tidligere NeRF-baserte initiativer – HyperNeRF + E/P og NerFACE – har forsøkt å syntetisere ansikter i videoer, og (apparat for å være fullstendig og flittig) har satt RigNeRF opp mot disse to rammeverkene i en test-runde:

Instant NeRF. Kilde: https://www.youtube.com/watch?v=DJ2hcC1orc4

En kvalitativ sammenligning mellom RigNeRF, HyperNeRF og NerFACE. Se de lenkede kildevideoene og PDF for høyere kvalitet. Statiske bilde-kilder: https://arxiv.org/pdf/2012.03065.pdf

En kvalitativ sammenligning mellom RigNeRF, HyperNeRF og NerFACE. Se de lenkede kildevideoene og PDF for høyere kvalitet. Statiske bilde-kilder: https://arxiv.org/pdf/2012.03065.pdf

Imidlertid er resultater som favører RigNeRF ganske anomale, av to grunner: først og fremst observerer forfatterne at ‘det finnes ingen eksisterende arbeid for en eple-til-eple-sammenligning’; for det andre har dette nødvendiggjort å begrense RigNeRFs funksjonalitet til å være delvis sammenlignbar med de mer begrensede funksjonalitetene til de tidligere systemene.

Ettersom resultater ikke er en inkrementell forbedring av tidligere arbeid, men heller representerer en ‘gjennombrudd’ i NeRF-redigerbarhet og nytte, lar vi test-runden være, og ser i stedet hva RigNeRF gjør annerledes enn sine forgjengere.

Kombinerte Styrker

Den primære begrensningen til NerFACE, som kan skape pose/uttrykk-kontroll i en NeRF-miljø, er at det antar at kildevideoen blir fanget med en statisk kamera. Dette betyr effektivt at det ikke kan produsere nye visninger som går ut over dens fangst-begrensninger. Dette produserer et system som kan skape ‘bevegelige portretter’, men som er uegnet for deepfake-liknende videoer.

HyperNeRF, på den andre siden, kan generere nye og hyper-realistiske visninger, men har ingen instrumentellhet som tillater det å endre hode-poser eller ansiktsuttrykk, noe som igjen ikke resulterer i noen type konkurranse for autoencoder-baserte deepfakes.

RigNeRF kan kombinere disse to isolerte funksjonalitetene ved å skape en ‘kanonisk rom’, en standard-baselinje fra hvilken avvik og deformasjoner kan utføres via inndata fra 3DMM-modulen.

Opprettelse av en 'kanonisk rom' (ingen pose, ingen uttrykk), på hvilken deformasjonene (dvs. poser og uttrykk) produsert via 3DMM kan virke.

Opprettelse av en ‘kanonisk rom’ (ingen pose, ingen uttrykk), på hvilken deformasjonene (dvs. poser og uttrykk) produsert via 3DMM kan virke.

Siden 3DMM-systemet ikke vil være nøyaktig sammenlignbart med det fangete subjektet, er det viktig å kompensere for dette i prosessen. RigNeRF oppnår dette med en deformasjonsfelt-prior som er beregnet fra en Multilayer Perceptron (MLP) avledet fra kildevideoen.

Kamera-parameterne nødvendige for å beregne deformasjoner hentes via COLMAP, mens uttrykk- og form-parameterne for hver ramme hentes fra DECA.

Plasseringen blir ytterligere optimert gjennom landmark-tilpasning og COLMAPs kamera-parametre, og, på grunn av begrensninger i datamaskin-resursene, blir video-utgangen nedskalert til 256×256-oppløsning for trening (en maskinvare-begrenset prosess som også plager autoencoder deepfake-scenen).

Etter dette blir deformasjons-nettverket trent på de fire V100-GPUene – imponerende maskinvare som ikke er sannsynlig å være innenfor rekkevidde av hobby-entusiaster (imidlertid, hvor maskinlæring-trening er involvert, er det ofte mulig å bytte kraft for tid, og bare akseptere at modell-trening vil være et spørsmål om dager eller uker).

I konklusjon sier forfatterne:

‘I motsetning til andre metoder, er RigNeRF, takket være bruk av en 3DMM-veiledet deformasjonsmodul, i stand til å modellere hode-pose, ansiktsuttrykk og hele 3D-portrett-scenen med høy trofasthet, og gir dermed bedre rekonstruksjoner med skarpe detaljer.’

Se de innlejrede videoene nedenfor for mer informasjon og resultater.

 

 

Først publisert 15. juni 2022.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai