Kąt Andersona
RigNeRF: Nowy sposób tworzenia deepfake’ów, który wykorzystuje Neural Radiance Fields

Nowe badania przeprowadzone w Adobe doprowadziły do stworzenia pierwszej skutecznej metody tworzenia deepfake’ów opartej na Neural Radiance Fields (NeRF) – być może pierwszej prawdziwej innowacji w architekturze lub podejściu od czasu pojawienia się deepfake’ów w 2017 roku.
Metoda, nazwana RigNeRF, wykorzystuje trójwymiarowe modele morfologiczne twarzy (3DMMs) jako warstwę pośrednią między pożądanym wejściem (tj. tożsamością, którą należy nałożyć na render NeRF) a przestrzenią neuronalną, metodą, która została powszechnie przyjęta w ostatnich latach przez podejścia syntezy twarzy oparte na Generative Adversarial Network (GAN), żadne z nich nie wyprodukowały jeszcze funkcjonalnych i użytecznych ramowych struktur dla filmów wideo.

W przeciwieństwie do tradycyjnych filmów wideo z deepfake’ami, żadna z poruszających się treści przedstawionych tutaj nie jest “rzeczywista”, ale raczej przestrzenią neuronalną, która została przeszkolona na krótkich nagraniach wideo. Po prawej stronie widzimy trójwymiarowy model morfologiczny twarzy (3DMM) działający jako interfejs między pożądanymi manipulacjami (“uśmiechnij się”, “spójrz w lewo”, “spójrz w górę” itp.) a zwykle nieprzystępnymi parametrami wizualizacji Neural Radiance Field. Aby uzyskać wersję o wysokiej rozdzielczości tego klipu, a także inne przykłady, zobacz stronę projektu, lub osadzone wideo na końcu tego artykułu. Źródło: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
3DMMs są skutecznie modelami CGI twarzy, których parametry mogą być dostosowane do bardziej abstrakcyjnych systemów syntezy obrazu, takich jak NeRF i GAN, które są w przeciwnym razie trudne do kontrolowania.
To, co widzisz na powyższym obrazie (środkowy obraz, mężczyzna w niebieskiej koszuli), a także na obrazie bezpośrednio poniżej (lewy obraz, mężczyzna w niebieskiej koszuli), nie jest “rzeczywistym” filmem wideo, do którego został nałożony mały fragment “fałszywej” twarzy, ale całkowicie zsyntetyzowaną sceną, która istnieje wyłącznie jako objętość renderowania neuronalnego – w tym ciało i tło:

W powyższym przykładzie prawdziwe nagranie wideo po prawej stronie (kobieta w czerwonej sukni) jest używane do “marionetkowania” ujętej tożsamości (mężczyzna w niebieskiej koszuli) po lewej stronie za pomocą RigNeRF, który (zdaniem autorów) jest pierwszym systemem opartym na NeRF, który osiągnął separację pozy i wyrażenia, a także potrafi wykonywać nowe syntezę widoku.
Postać mężczyzny po lewej stronie na powyższym obrazie została “ujęta” z 70-sekundowego nagrania wideo telefonem komórkowym, a dane wejściowe (w tym całą informację o scenie) przeszkolono na 4 procesorach V100, aby uzyskać scenę.
Ponieważ trójwymiarowe modele morfologiczne są również dostępne jako całościowe parametryczne proxy CGI (a nie tylko szkielety twarzy), RigNeRF potencjalnie otwiera możliwość tworzenia pełnych deepfake’ów, gdzie prawdziwy ruch ludzki, tekstura i wyrażenie są przenoszone do warstwy parametrycznej opartej na CGI, która następnie tłumaczy działanie i wyrażenie na renderowane środowiska NeRF i filmy wideo.
Czy RigNeRF kwalifikuje się jako metoda tworzenia deepfake’ów w tym sensie, w jakim rozumieją to nagłówki? Czy jest to po prostu kolejny pół-utworzony, pół-udany system w porównaniu z DeepFaceLab i innymi systemami opartymi na autoencoderach z 2017 roku?
Badacze nowego artykułu są niejednoznaczni w tej kwestii:
‘Jako metoda, która jest w stanie ożywić twarze, RigNeRF jest podatna na nadużycia przez złe aktorów w celu generowania deepfake’ów.’
Nowy artykuł nosi tytuł RigNeRF: w pełni kontrolowalne neuralne portrety 3D i pochodzi od ShahRukh Athara z Uniwersytetu Stonybrook, stażysty w Adobe podczas rozwoju RigNeRF, oraz czterech innych autorów z Adobe Research.
Poza autoencoderowymi deepfake’ami
Większość wirusowych deepfake’ów, które zdobyły nagłówki w ostatnich latach, została wyprodukowana przez systemy oparte na autoencoderach, pochodzące z kodu, który został opublikowany na subredditzie r/deepfakes w 2017 roku – chociaż nie przed tym, jak został skopiowany do GitHub, gdzie został obecnie rozgałęziony ponad tysiąc razy, nie wyłączając popularnego (choć kontrowersyjnego) DeepFaceLab dystrybucji, a także projektu FaceSwap.
Ponadto ramowe systemy autoencoderowe również eksperymentowały z 3DMM jako “wytycznymi” dla ulepszonych ramowych struktur syntezy twarzy. Przykładem tego jest projekt HifiFace z lipca 2021 roku. Jednak żadne użyteczne lub popularne inicjatywy nie zdają się być rozwinięte z tego podejścia do tej pory.
Dane do scen RigNeRF są uzyskiwane przez przechwycenie krótkich nagrań wideo telefonem komórkowym. Dla projektu badacze RigNeRF użyli iPhone’a XR lub iPhone’a 12 do wszystkich eksperymentów. W pierwszej połowie przechwycenia osoba jest proszona o wykonanie szerokiego zakresu wyrażeń twarzy i mówienia, podczas gdy głowa pozostaje nieruchoma, a kamera jest poruszana wokół nich.
W drugiej połowie przechwycenia kamera utrzymuje stałą pozycję, a osoba musi poruszać głową, wykazując szeroki zakres wyrażeń. Wynikowe 40-70 sekund nagrań wideo (około 1200-2100 klatek) reprezentują cały zestaw danych, który zostanie użyty do przeszkolenia modelu.
Ograniczanie zbierania danych
W przeciwieństwie do systemów autoencoderowych, takich jak DeepFaceLab, które wymagają dość pracochłonnego zbierania i kuracji tysięcy różnorodnych zdjęć, często pobranych z filmów wideo i innych kanałów mediów społecznościowych, a także z filmów (w przypadku deepfake’ów celebrytów).
Wynikowe przeszkolone modele autoencoderowe są często przeznaczone do użycia w różnych sytuacjach. Jednak najbardziej sumienni “celebryccy” twórcy deepfake’ów mogą przeszkolić całe modele od podstaw dla jednego filmu wideo, pomimo faktu, że przeszkolenie może trwać tydzień lub więcej.
Pomimo noty ostrzegawczej od badaczy nowego artykułu, “łatane” i szeroko zebrane zestawy danych, które napędzają AI pornografii, a także popularne “przełamywanie” deepfake’ów na YouTube/TikToku, wydają się mało prawdopodobne do wyprodukowania akceptowalnych i spójnych wyników w systemie deepfake, takim jak RigNeRF, który ma scenariusz określony. Biorąc pod uwagę ograniczenia na przechwycenie danych określone w nowej pracy, może to stanowić dodatkową ochronę przed przypadkowym nadużyciem tożsamości przez złe twórców deepfake’ów.
Adaptacja NeRF do filmów wideo z deepfake’ami
NeRF jest metodą fotogrametryczną, w której niewielka liczba źródłowych zdjęć wykonanych z różnych punktów widzenia jest złożona w przestrzeń neuronalną 3D. To podejście zyskało na popularności wcześniej tego roku, kiedy NVIDIA przedstawiła swój Instant NeRF system, który może skrócić czas przeszkolenia NeRF do kilku minut lub nawet sekund:

Instant NeRF. Źródło: https://www.youtube.com/watch?v=DJ2hcC1orc4
Wynikowa scena Neural Radiance Field jest podstawowo statycznym środowiskiem, które można eksplorować, ale które jest trudne do edycji. Badacze zauważają, że dwie poprzednie inicjatywy oparte na NeRF – HyperNeRF + E/P i NerFACE – próbowały syntezy twarzy wideo, i (wydaje się, dla kompletności i sumienności) ustawiły RigNeRF przeciwko tym dwóm ramom w rundzie testowej:


Jakościowe porównanie między RigNeRF, HyperNeRF i NerFACE. Zobacz powiązane źródła wideo i PDF dla wersji o wyższej jakości. Statyczne źródło obrazu: https://arxiv.org/pdf/2012.03065.pdf
Jednak w tym przypadku wyniki, które faworyzują RigNeRF, są dość anomalne, z dwóch powodów: po pierwsze, autorzy zauważają, że “nie ma istniejącej pracy dla porównania jabłka do jabłka”; po drugie, to wymagało ograniczenia możliwości RigNeRF do częściowego dopasowania do bardziej ograniczonej funkcjonalności poprzednich systemów.
Ponieważ wyniki nie są stopniową poprawą poprzedniej pracy, ale raczej “przełomem” w edytowalności i użyteczności NeRF, pozostawimy rundę testową i zobaczymy, co RigNeRF robi inaczej niż jego poprzednicy.
Połączone siły
Głównym ograniczeniem NerFACE, które może tworzyć kontrolę pozy i wyrażenia w środowisku NeRF, jest to, że zakłada, że źródłowe nagranie wideo zostanie wykonane z kamery statycznej. To skutecznie oznacza, że nie może produkować nowych widoków, które wykraczają poza ograniczenia przechwycenia. To produkuje system, który może tworzyć “poruszone portrety”, ale który jest nieodpowiedni dla filmów wideo z deepfake’ami.
HyperNeRF, z drugiej strony, chociaż może generować nowe i hiper-realne widoki, nie ma instrumentarium, które pozwala na zmianę pozy głowy lub wyrażeń twarzy, co ponownie nie skutkuje żadnym rodzajem konkurencji dla autoencoderowych deepfake’ów.
RigNeRF jest w stanie połączyć te dwie izolowane funkcjonalności, tworząc “przestrzeń kanoniczną”, podstawową linię bazową, od której można wykonywać odchylenia i deformacje za pomocą wejścia z modułu 3DMM.

Tworzenie “przestrzeni kanonicznej” (bez pozy, bez wyrażenia), na której deformacje (tj. pozy i wyrażenia) wytworzone za pomocą 3DMM mogą działać.
Ponieważ system 3DMM nie będzie dokładnie dopasowany do ujętej osoby, ważne jest, aby to skompensować w procesie. RigNeRF osiąga to za pomocą pola deformacji wcześniej obliczonego z wielowarstwowego perceptronu (MLP) pochodzącego z źródłowego nagrania wideo.

Parametry kamery niezbędne do obliczania deformacji są uzyskiwane za pomocą COLMAP, a parametry wyrażenia i kształtu dla każdej klatki są uzyskiwane z DECA.
Pozycjonowanie jest dalej optymalizowane za pomocą dopasowania punktów charakterystycznych i parametrów kamery COLMAP, a ze względu na ograniczenia zasobów obliczeniowych, wyjście wideo jest pomniejszane do rozdzielczości 256×256 dla szkolenia (proces pomniejszania, który również dotyka sceny autoencoderowych deepfake’ów).
Po tym sieć deformacji jest szkolona na czterech procesorach V100 – potężnym sprzęcie, który nie jest prawdopodobnie w zasięgu przypadkowych entuzjastów (jednak tam, gdzie szkolenie modelu jest zaangażowane, często można handlować ciężarem za czasem i po prostu zaakceptować, że szkolenie modelu będzie sprawą dni lub nawet tygodni).
W podsumowaniu badacze stwierdzają:
‘W przeciwieństwie do innych metod, RigNeRF, dzięki użyciu modułu deformacji sterowanego przez 3DMM, jest w stanie modelować pozę głowy, wyrażenia twarzy i całą scenę portretu 3D z wysoką wiernością, co daje lepsze rekonstrukcje z ostrymi detalami.’
Zobacz osadzone wideo poniżej dla dalszych szczegółów i fragmentów wideo.
Pierwotnie opublikowane 15 czerwca 2022.












