Andersons hoek
RigNeRF: Een nieuwe deepfake-methode die Neural Radiance Fields gebruikt

Nieuw onderzoek dat is ontwikkeld bij Adobe biedt de eerste haalbare en effectieve deepfake-methode op basis van Neural Radiance Fields (NeRF) – misschien wel de eerste echte innovatie in architectuur of benadering in de vijf jaar sinds het ontstaan van deepfakes in 2017.
De methode, getiteld RigNeRF, gebruikt 3D-morphable face-modellen (3DMM’s) als een intermediaire laag van instrumentatie tussen de gewenste invoer (d.w.z. de identiteit die moet worden opgelegd in de NeRF-render) en de neurale ruimte, een methode die in recente jaren wijdverbreid is geadopteerd door Generative Adversarial Network (GAN) face-synthese-benaderingen, waarvan geen enkele tot functionele en bruikbare gezichtsvervangingkaders voor video heeft geleid.

Anders dan traditionele deepfake-video’s is absoluut geen van de bewegende inhoud die hier wordt getoond ‘echt’, maar eerder een te verkennen neurale ruimte die is getraind op korte beelden. Aan de rechterkant zien we het 3D-morphable face-model (3DMM) als een interface tussen de gewenste manipulaties (‘glimlach’, ‘kijk links’, ‘kijk omhoog’, etc.) en de meestal-onbehandelbare parameters van een Neural Radiance Field-visualisatie. Voor een hoge-resolutieversie van deze clip, evenals andere voorbeelden, zie de projectpagina, of de ingesloten video’s aan het einde van dit artikel. Bron: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
3DMM’s zijn effectief CGI-modellen van gezichten, waarvan de parameters kunnen worden aangepast aan meer abstracte beeldsynthesesystemen, zoals NeRF en GAN, die anders moeilijk te controleren zijn.
Wat u in de afbeelding hierboven ziet (middenafbeelding, man in blauw overhemd), evenals de afbeelding rechtsonder (linker afbeelding, man in blauw overhemd), is geen ‘echte’ video waarin een klein stukje ‘nep’ gezicht is opgelegd, maar een geheel gesynthetiseerde scène die alleen bestaat als een volumetrische neurale rendering – inclusief het lichaam en de achtergrond:

In het voorbeeld recht boven, wordt de echte video aan de rechterkant (vrouw in rode jurk) gebruikt om de vastgelegde identiteit (man in blauw overhemd) aan de linkerkant via RigNeRF te ‘poppen’, wat (volgens de auteurs) het eerste NeRF-gebaseerde systeem is dat scheiding van pose en expressie kan bereiken en in staat is om nieuwe weergaven te synthetiseren.
De mannelijke figuur aan de linkerkant in de afbeelding hierboven werd ‘gevangen’ uit een 70-seconden smartphone-video, en de invoergegevens (inclusief de gehele scène-informatie) werden vervolgens getraind over 4 V100 GPU’s om de scène te verkrijgen.
Aangezien 3DMM-stijl parametriseerbare rigs ook beschikbaar zijn als gehele lichaam parametriseerbare CGI-proxies (in plaats van alleen gezichtsrigs), opent RigNeRF mogelijk de mogelijkheid tot full-body deepfakes waarbij echte menselijke beweging, textuur en expressie wordt doorgegeven aan de CGI-gebaseerde parametriseerbare laag, die vervolgens actie en expressie zou vertalen in gegenereerde NeRF-omgevingen en video’s.
Wat betreft RigNeRF – kwalificeert het als een deepfake-methode in de huidige zin dat de headlines het begrip begrijpen? Of is het gewoon een ander half-gehinderd ook-ran voor DeepFaceLab en andere arbeidsintensieve, 2017-era autoencoder deepfake-systemen?
De onderzoekers van het nieuwe artikel zijn ondubbelzinnig over dit punt:
‘Als een methode die in staat is om gezichten te heranimeren, is RigNeRF vatbaar voor misbruik door slechte actoren om deepfakes te genereren.’
Het nieuwe artikel is getiteld RigNeRF: Fully Controllable Neural 3D Portraits, en komt van ShahRukh Atha van de Stonybrook University, een stagiair bij Adobe tijdens de ontwikkeling van RigNeRF, en vier andere auteurs van Adobe Research.
Verder dan autoencoder-gebaseerde deepfakes
De meeste virale deepfakes die de afgelopen jaren de headlines hebben gehaald, zijn geproduceerd door autoencoder-gebaseerde systemen, afgeleid van de code die in 2017 op de prompt-banned r/deepfakes-subreddit werd gepubliceerd – hoewel niet voordat deze was gekopieerd naar GitHub, waar deze momenteel meer dan duizend keer is geforkt, niet in de laatste plaats in de populaire (maar omstreden) DeepFaceLab-distributie, en ook het FaceSwap-project.
Buiten GAN en NeRF om, hebben autoencoder-kaders ook geëxperimenteerd met 3DMM’s als ‘richtlijnen’ voor verbeterde gezichtssynthesekaders. Een voorbeeld hiervan is het HifiFace-project uit juli 2021. Echter, lijken geen bruikbare of populaire initiatieven te zijn ontwikkeld uit deze benadering tot nu toe.
Gegevens voor RigNeRF-scènes worden verkregen door korte smartphone-video’s te maken. Voor het project gebruikten RigNeRF’s onderzoekers een iPhone XR of een iPhone 12 voor alle experimenten. Voor de eerste helft van de opname, wordt de onderwerp gevraagd om een breed scala aan gezichtsuitdrukkingen en spraak te doen terwijl hij zijn hoofd stil houdt terwijl de camera om hem heen wordt bewogen.
Voor de tweede helft van de opname, houdt de camera een vaste positie aan terwijl de onderwerp zijn hoofd omhoog en omlaag moet bewegen terwijl hij een breed scala aan uitdrukkingen toont. De resulterende 40-70 seconden aan beelden (ongeveer 1200-2100 frames) vormen de gehele dataset die zal worden gebruikt om het model te trainen.
Het terugdringen van gegevensverzameling
In tegenstelling tot autoencoder-systemen zoals DeepFaceLab, die een relatief arbeidsintensieve verzameling en curatie van duizenden diverse foto’s vereisen, vaak genomen van YouTube-video’s en andere sociale media-kanalen, evenals van films (in het geval van celebrity deepfakes).
De resulterende getrainde autoencoder-modellen zijn vaak bedoeld om in een verscheidenheid aan situaties te worden gebruikt. Echter, de meest zorgvuldige ‘celebrity’-deepfakers kunnen hele modellen van scratch trainen voor één video, ondanks het feit dat training een week of meer kan duren.
Ondanks de waarschuwingsnota van de onderzoekers van het nieuwe artikel, lijken de ‘lappen’- en breed-gesamengeerde datasets die AI-porno en populaire YouTube/TikTok ‘deepfake-heruitzendingen’ aandrijven, onwaarschijnlijk om aanvaardbare en consistente resultaten te produceren in een deepfake-systeem zoals RigNeRF, dat een scène-specifieke methodologie heeft. Gezien de beperkingen op gegevensverzameling die in het nieuwe artikel worden uiteengezet, kan dit tot op zekere hoogte een extra waarborg tegen het misbruik van identiteit door kwaadwillige deepfakers zijn.
NeRF aanpassen voor deepfake-video
NeRF is een photogrammetry-gebaseerde methode waarbij een klein aantal bronafbeeldingen die vanuit verschillende gezichtspunten zijn genomen, worden samengesteld tot een te verkennen 3D-neurale ruimte. Deze benadering kwam eerder dit jaar onder de aandacht toen NVIDIA zijn Instant NeRF-systeem aankondigde, dat in staat is om de exorbitante trainingsuren voor NeRF terug te brengen tot minuten, of zelfs seconden:

Instant NeRF. Bron: https://www.youtube.com/watch?v=DJ2hcC1orc4
Het resulterende Neural Radiance Field-scène is essentieel een statische omgeving die kan worden verkend, maar die moeilijk te bewerken is. De onderzoekers merken op dat twee eerdere NeRF-gebaseerde initiatieven – HyperNeRF + E/P en NerFACE – hebben geprobeerd om gezichtsvideo-synthese te doen, en (blijkbaar voor de sake van volledigheid en zorgvuldigheid) hebben RigNeRF tegen deze twee kaders getest:


Een kwalitatieve vergelijking tussen RigNeRF, HyperNeRF en NerFACE. Zie de gelinkte bronvideo’s en PDF voor hogere kwaliteit. Statische afbeeldingsbron: https://arxiv.org/pdf/2012.03065.pdf
Echter, in dit geval zijn de resultaten, die RigNeRF bevoronen, vrijwel anomaal, om twee redenen: ten eerste, merken de auteurs op dat ‘er geen bestaand werk is voor een appel-tot-appel-vergelijking’; ten tweede, heeft dit het beperken van RigNeRF’s mogelijkheden noodzakelijk gemaakt om ten minste gedeeltelijk overeen te komen met de meer beperkte functionaliteit van de eerdere systemen.
Aangezien de resultaten geen incrementele verbetering van eerdere werken zijn, maar eerder een ‘doorbraak’ in NeRF-bewerkbaarheid en bruikbaarheid, zullen we de testronde terzijde leggen en in plaats daarvan zien wat RigNeRF anders doet dan zijn voorgangers.
Geombineerde sterke punten
De primaire beperking van NerFACE, die pose/uitdrukkingcontrole in een NeRF-omgeving kan creëren, is dat het ervan uitgaat dat bronbeelden zijn gemaakt met een statische camera. Dit betekent effectief dat het geen nieuwe weergaven kan produceren die verder gaan dan de beperkingen van de opname. Dit produceert een systeem dat ‘bewegende portretten’ kan maken, maar dat ongeschikt is voor deepfake-stijl video.
HyperNeRF, aan de andere kant, kan wel nieuwe en hyper-reële weergaven genereren, maar heeft geen instrumentatie die het in staat stelt om hoofdposities of gezichtsuitdrukkingen te veranderen, wat opnieuw geen enkele concurrentie voor autoencoder-gebaseerde deepfakes oplevert.
RigNeRF kan deze twee geïsoleerde functionaliteiten combineren door een ‘canonieke ruimte’ te creëren, een standaardbasislijn van waaruit afwijkingen en vervormingen kunnen worden uitgevoerd via invoer van de 3DMM-module.

Het creëren van een ‘canonieke ruimte’ (geen pose, geen uitdrukking), waarop de vervormingen (d.w.z. posities en uitdrukkingen) die via de 3DMM worden geproduceerd, kunnen werken.
Aangezien het 3DMM-systeem niet exact overeenkomt met de vastgelegde onderwerp, is het belangrijk om hierin te compenseren tijdens het proces. RigNeRF bereikt dit met een vervormingsveld-prior dat wordt berekend uit een Multilayer Perceptron (MLP) afgeleid van de bronbeelden.

De cameraparameters die nodig zijn om vervormingen te berekenen, worden verkregen via COLMAP, terwijl de uitdrukking- en vormparameters voor elke frame worden verkregen uit DECA.
De positie wordt verder geoptimaliseerd door landmark-fitting en COLMAP’s cameraparameters, en, vanwege beperkingen van de rekenkracht, wordt de video-uitvoer gedownsampeld tot 256×256 resolutie voor training (een door hardware beperkt verkleiningsproces dat ook de autoencoder deepfake-scène teistert).
Hierna wordt het vervormingsnetwerk getraind op de vier V100’s – formidabele hardware die niet waarschijnlijk binnen het bereik van casual enthousiasten ligt (hoewel, waar machine learning-training betreft, het vaak mogelijk is om kracht voor tijd te ruilen en simpelweg te accepteren dat modeltraining een kwestie van dagen of zelfs weken zal zijn).
In conclusie, stellen de onderzoekers:
‘In tegenstelling tot andere methoden, is RigNeRF, dankzij het gebruik van een 3DMM-geleide vervormingsmodule, in staat om hoofdpositie, gezichtsuitdrukkingen en de volledige 3D-portretscène met hoge geloofwaardigheid te modelleren, waardoor betere reconstructies met scherpe details worden gegenereerd.’
Zie de ingesloten video’s hieronder voor meer details en resultaatbeelden.
Origineel gepubliceerd op 15 juni 2022.












