Kąt Andersona

Nowy sposób tworzenia deepfake’ów rozwiązuje problem “gospodarza twarzy”

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Pomimo kilku lat medialnej hiperboli na temat potencjału deepfake’ów do podważania naszej długo utrzymującej się wiary w autentyczność nagrania wideo, wszystkie obecnie popularne metody opierają się na znalezieniu “gospodarzy twarzy”, które są ogólnie podobne do kształtu twarzy docelowej.

Gdzie oryginalne nagranie zawiera szeroką twarz, ale osoba docelowa ma wąską twarz, wyniki zawsze były problematyczne, ponieważ taki transfer obejmuje wycięcie części oryginalnej twarzy i odtworzenie teraz odsłoniętego tła. Obecne pakiety, takie jak DeepFaceLab i FaceSwap, są w stanie wyprodukować ograniczone wyniki, gdy konfiguracja jest odwrócona (wąska > szeroka), ale nie mają możliwości przekonującego rozwiązania tego scenariusza.

Teraz, współpraca między Tencent a chińskim Uniwersytetem Xiamen doprowadziła do opracowania nowego podejścia, zatytułowanego HifiFace, zaprojektowanego w celu rozwiązania tego problemu.

Dwa HifiFace deepfakes, pierwszy z Anne Hathaway, gdzie uzyskano dobry wygląd, pomimo niezgodnego kształtu twarzy gospodarza. HifiFace działa również dobrze w przypadku celów z okularami, tradycyjnie będącymi przeszkodą w deepfake'ach.

Dwa HifiFace deepfakes, pierwszy z Anne Hathaway, gdzie uzyskano dobry wygląd, pomimo niezgodnego kształtu twarzy gospodarza. HifiFace działa również dobrze w przypadku celów z okularami, tradycyjnie będącymi przeszkodą w deepfake’ach. Źródło: https://arxiv.org/pdf/2106.09965.pdf

Przebudowa twarzy deepfake

Poprzednie podejścia, takie jak Subject Agnostic Face Swapping and Reenactment (FSGAN), opierały się na 3DMM fitting (3D Morphable Models) lub innych metodach opartych na rozpoznawaniu cech twarzy lub transformacji, gdzie cechy twarzy do “przepisania” w dużej mierze dyktują granice wymiany:

Źródło: https://github.com/Yinghao-Li/3DMM-fitting

Wykrywanie punktów charakterystycznych twarzy 3DMM. Źródło: https://github.com/Yinghao-Li/3DMM-fitting

Chociaż konkurencyjne metody korzystały z cech pochodzących z sieci rozpoznawania twarzy, są one głównie ukierunkowane na odtworzenie tekstury, a nie struktury, i podobnie powodują efekt “maski” w przypadku, gdy twarz gospodarza nie jest całkowicie kompatybilna (tj. granice i kształt linii włosów, szczęki i kości policzkowych).

Aby rozwiązać te problemy, chińscy badacze, z Laboratorium Medialnej Analityki i Obliczeń na Wydziale Sztucznej Inteligencji, opracowali sieć końcową, która regresuje współczynniki twarzy docelowej i twarzy źródłowej za pomocą modelu 3D, który jest następnie ponownie łączony jako informacje o kształcie, a następnie łączony z informacjami o identyfikacji z sieci rozpoznawania twarzy.

Te dane geometryczne są następnie wprowadzane do modelu encoder-decoder jako informacje strukturalne, łącząc się z wyrazem i dyspozycją twarzy docelowej, które są wykorzystywane jako źródła pomocnicze do dokładnego transferu.

Semantyczna fuzja twarzy

Dodatkowo, HifiFace zawiera składnik Semantycznej Fuzji Twarzy (SFF), który wykorzystuje niskopoziomową cechę w encoderze do zachowania informacji przestrzennych i tekstury, bez poświęcania tożsamości obrazu docelowego. Cechy z encodera i dekodera są integrowane z nauczonym maskiem adaptacyjnym, a informacje o tle są łączone z wyjściem za pomocą nauczonego maska twarzy.

HifiFace w działaniu. Źródło: https://johann.wang/HifiFace/

HifiFace w działaniu. Źródło: https://johann.wang/HifiFace/

W ten sposób HifiFace odbiega od korzystania z oryginalnych granic twarzy jako twardych limitów, wykorzystując rozszerzoną segmentację semantyczną twarzy, w której model może lepiej wykonywać adaptacyjną fuzję na granicach twarzy.

Dwa poprzednie podejścia (góra i dół po lewej) oraz nowa architektura HifiFace, składająca się z encodera, dekodera, 3D-wrażliwego ekstraktora tożsamości i modułu SFF.

Dwa poprzednie podejścia (góra i dół po lewej) oraz nowa architektura HifiFace, składająca się z encodera, dekodera, 3D-wrażliwego ekstraktora tożsamości i modułu SFF.

W porównaniu z poprzednimi metodami FSGAN, SimSwap i FaceShifter, HifiFace wykazuje lepszą rekonstrukcję kształtu twarzy, ponieważ nie aproksymuje “zjawisk” tam, gdzie granice twarzy powodują zakłócenia w mapowaniu tożsamości, ale odtwarza je w sposób definitywny.

Testowanie

Badacze zaimplementowali system przy użyciu zestawów danych VGGFace2 i DeepGlint Asian-Celeb. Twarze zostały wyrównane za pomocą 5 zewnętrznych punktów charakterystycznych i ponownie przycięte do 256×256 pikseli. Sieć wzmocnienia portretu została również użyta do wygenerowania wersji 512×512 pikseli, dla dodatkowego modelu o wyższej rozdzielczości. Model został przeszkolony przy użyciu Adama.

Chociaż FaceShifter zachowuje tożsamość dobrze, nie jest w stanie rozwiązać problemów, takich jak wyraz, kolor i zakrycie, tak skutecznie jak HifiFace, i ma bardziej złożoną strukturę sieci. FSGAN ma problemy z przeniesieniem oświetlenia z źródła do celu.

Badacze używają FaceForensics++ do porównań ilościowych, pobierając po 10 klatek z każdego z przekonwertowanych filmów wideo w ramach konkurencyjnych metod, i stwierdzają, że HifiFace osiągnął lepszy wynik odzyskiwania tożsamości. Podczas testowania szeregu innych czynników, takich jak jakość obrazu, badacze również stwierdzili, że ich metoda przewyższa rywalizujące metody.

Cechy twarzy Benedicta Cumberbatcha są wiernie odtworzone.

Cechy twarzy Benedicta Cumberbatcha są wiernie odtworzone.

Praca ta reprezentuje kolejny krok w stronę abstrakcji materiału źródłowego, tak aby był on tylko szkicem, do którego można przenieść dokładne tożsamości. Niektóre z obecnych pakietów FOSS, w tym DeepFaceLab, posiadają zaczątki funkcjonalności do pełnej wymiany głowy, ale, podobnie jak HifiFace, nie uwzględniają one włosów i są bardziej skuteczne w “budowaniu” twarzy niż w wykuwaniu jej, aby dopasować ją do pożądanego źródła docelowego.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai