Kąt Andersona

Nowy i prostszy sposób tworzenia deepfake, który przewyższa poprzednie podejścia

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Współpraca chińskiej grupy badawczej AI i amerykańskich naukowców doprowadziła do stworzenia pierwszej prawdziwej innowacji w technologii deepfake od czasu pojawienia się tego zjawiska cztery lata temu.

Nowa metoda umożliwia wykonywanie operacji zamiany twarzy, które przewyższają wszystkie inne istniejące ramy na standardowych testach percepcyjnych, bez potrzeby zbierania i kuracji dużych dedykowanych zbiorów danych i szkolenia ich przez tydzień dla jednej tożsamości. W przypadku przykładów przedstawionych w nowym artykule, modele były szkolone na całości dwóch popularnych zbiorów danych dotyczących sławnych osób, na jednej karcie graficznej NVIDIA Tesla P40, przez około trzy dni.

Pełny filmik znajduje się na końcu tego artykułu. W tym przykładzie z filmu z materiałów uzupełniających do nowego artykułu, twarz Scarlett Johansson jest przenoszona na film źródłowy. CihaNet usuwa problem maskowania krawędzi podczas wykonywania zamiany, tworząc i wykonywając głębsze relacje między źródłową a docelową tożsamością, co oznacza koniec 'oczywistych granic' i innych błędów nakładania, które występują w tradycyjnych podejściach do deepfake. Źródło: https://mitchellx.github.io/#video

Pełny filmik dostępny na końcu tego artykułu. W tym przykładzie z filmu z materiałów uzupełniających do nowego artykułu, twarz Scarlett Johansson jest przenoszona na film źródłowy. CihaNet usuwa problem maskowania krawędzi podczas wykonywania zamiany, tworząc i wykonywając głębsze relacje między źródłową a docelową tożsamością, co oznacza koniec ‘oczywistych granic’ i innych błędów nakładania, które występują w tradycyjnych podejściach do deepfake. Źródło: https://mitchellx.github.io/#video

Nowe podejście usuwa potrzebę ‘przyklejania’ przeszczepionej tożsamości w sposób nieelegancki do filmu docelowego, co często prowadzi do powstania artefaktów, które pojawiają się tam, gdzie fałszywa twarz kończy się, a prawdziwa, podstawowa twarz zaczyna się. Zamiast tego, ‘mapy hallucynacji’ są używane do wykonania głębszego mieszania cech wizualnych, ponieważ system oddziela tożsamość od kontekstu znacznie skuteczniej niż obecne metody, i może więc łączyć tożsamość docelową na głębszym poziomie.

Z artykułu. Przekształcenia CihaNet są ułatwione przez mapy hallucynacji (dolny rząd). System używa informacji kontekstowych (tj. kierunku twarzy, włosów, okularów i innych przeszkód itp.) w całości z obrazu, do którego nowa tożsamość będzie nakładana, i informacji o tożsamości twarzy w całości od osoby, która ma być wstawiona do obrazu. Ta zdolność do oddzielenia twarzy od kontekstu jest kluczowa dla sukcesu systemu. Źródło: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Z artykułu. Przekształcenia CihaNet są ułatwione przez mapy hallucynacji (dolny rząd). System używa informacji kontekstowych (tj. kierunku twarzy, włosów, okularów i innych przeszkód itp.) w całości z obrazu, do którego nowa tożsamość będzie nakładana, i informacji o tożsamości twarzy w całości od osoby, która ma być wstawiona do obrazu. Ta zdolność do oddzielenia twarzy od kontekstu jest kluczowa dla sukcesu systemu. Źródło: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Skutecznie nowa mapa hallucynacji zapewnia bardziej kompletny kontekst dla zamiany, w przeciwieństwie do twardych masek, które często wymagają obszernego kuracji (i w przypadku DeepFaceLab, oddzielnego szkolenia) podczas zapewniania ograniczonej elastyczności w zakresie rzeczywistego włączenia dwóch tożsamości.

Z przykładów dostarczonych w materiałach uzupełniających, używając obu zbiorów danych FFHQ i Celeb-A HQ, na VGGFace i Forensics++. Pierwsze dwie kolumny pokazują losowo wybrane (rzeczywiste) obrazy do zamiany. Następne cztery kolumny pokazują wyniki zamiany przy użyciu czterech najskuteczniejszych metod dostępnych obecnie, podczas gdy ostatnia kolumna pokazuje wynik z CihaNet. Repozytorium FaceSwap zostało użyte zamiast bardziej popularnego DeepFaceLab, ponieważ oba projekty są forkami oryginalnego kodu deepfakes z 2017 roku na GitHub. Chociaż każdy projekt dodał od tego czasu modele, techniki, różne interfejsy i narzędzia uzupełniające, podstawowy kod, który umożliwia tworzenie deepfakes, nigdy nie zmienił się i pozostaje wspólny dla obu. Źródło: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

Artykuł artykuł, zatytułowany One-stage Context and Identity Hallucination Network, został napisany przez naukowców z JD AI Research i Uniwersytetu Massachusetts Amherst, i został wsparty przez Narodowy Program Badań i Rozwoju Chin pod numerem 2020AAA0103800. Został on przedstawiony na 29. Międzynarodowej Konferencji ACM poświęconej multimediom, w dniach 20-24 października, w Chengdu, w Chinach.

Brak potrzeby ‘symetrii twarzy’

Najpopularniejsze obecnie oprogramowanie do tworzenia deepfakes, DeepFaceLab, oraz konkurujący fork FaceSwap, wykonują skomplikowane i często ręcznie kurowane przepływy pracy, aby określić, w jaki sposób twarz jest nachylona, jakie przeszkody są na drodze, które muszą być uwzględnione (ponownie, ręcznie), i muszą radzić sobie z wieloma innymi irytującymi przeszkodami (w tym oświetleniem), co sprawia, że ich użycie jest daleko od ‘wskazania i kliknięcia’ doświadczenia, nieścisłości przedstawianych w mediach od czasu pojawienia się deepfakes.

W przeciwieństwie do tego, CihaNet nie wymaga, aby dwie obrazy były skierowane bezpośrednio do kamery, aby wyodrębnić i wykorzystać przydatne informacje o tożsamości z jednego obrazu.

W tych przykładach, zestaw oprogramowania do tworzenia deepfakes jest wyzwany zadaniem zamiany twarzy, które nie tylko różnią się tożsamością, ale także nie są skierowane w tę samą stronę. Oprogramowanie pochodzące z oryginalnego repozytorium deepfakes (takie jak bardzo popularne DeepFaceLab i FaceSwap, przedstawione powyżej) nie może radzić sobie z różnicą w kątach między dwoma obrazami do zamiany (zobacz trzecią kolumnę). Tymczasem CihaNet może abstrakcyjnie określić tożsamość, ponieważ 'położenie' twarzy nie jest niezbędnie częścią informacji o tożsamości.

W tych przykładach, zestaw oprogramowania do tworzenia deepfakes jest wyzwany zadaniem zamiany twarzy, które nie tylko różnią się tożsamością, ale także nie są skierowane w tę samą stronę. Oprogramowanie pochodzące z oryginalnego repozytorium deepfakes (takie jak bardzo popularne DeepFaceLab i FaceSwap, przedstawione powyżej) nie może radzić sobie z różnicą w kątach między dwoma obrazami do zamiany (zobacz trzecią kolumnę). Tymczasem CihaNet może abstrakcyjnie określić tożsamość, ponieważ ‘położenie’ twarzy nie jest niezbędnie częścią informacji o tożsamości.

Architektura

Projekt CihaNet, według autorów, został zainspirowany współpracą z 2019 roku między Microsoft Research i Peking University, zwaną FaceShifter, chociaż wprowadza pewne znaczące i krytyczne zmiany w podstawowej architekturze starszej metody.

FaceShifter używa dwóch sieci Adaptive Instance Normalization (AdaIN) do obsługi informacji o tożsamości, które są następnie przenoszone do obrazu docelowego za pomocą maski, w sposób podobny do obecnie popularnego oprogramowania do tworzenia deepfakes (i z wszystkimi jego ograniczeniami), przy użyciu dodatkowej HEAR-Net (która zawiera oddzielną sieć szkoleniową szkoloną na przeszkodach – dodatkową warstwę złożoności).

Zamiast tego, nowa architektura bezpośrednio używa tej ‘kontekstowej’ informacji do procesu transformacji, za pomocą dwuetapowej operacji Cascading Adaptive Instance Normalization (C-AdaIN), która zapewnia spójność kontekstu (tj. skóry twarzy i przeszkód) obszarów istotnych dla tożsamości.

Druga podsieć niezbędna dla systemu nazywa się Swapping Block (SwapBlk), która generuje zintegrowaną cechę z kontekstu obrazu odniesienia i ‘zawartej’ informacji o tożsamości z obrazu źródłowego, omijając wiele etapów niezbędnych do wykonania tego w sposób konwencjonalny.

Aby pomóc odróżnić kontekst i tożsamość, mapa hallucynacji jest generowana dla każdego poziomu, zastępując miękką maskę segmentacji, i działając na szerszym zakresie cech dla tego krytycznego etapu procesu tworzenia deepfakes.

Im więcej rośnie wartość mapy hallucynacji (przedstawionej na dole po prawej), tym jaśniejsza staje się ścieżka między tożsamościami.

Im więcej rośnie wartość mapy hallucynacji (przedstawionej na dole po prawej), tym jaśniejsza staje się ścieżka między tożsamościami.

W ten sposób cały proces zamiany jest wykonany w jednym etapie i bez przetwarzania.

Dane i testowanie

Aby przetestować system, naukowcy szkolili cztery modele na dwóch bardzo popularnych i zróżnicowanych otwartych zbiorach danych obrazów – CelebA-HQ i NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), każdy zawierający odpowiednio 30 000 i 70 000 obrazów.

Żadne przycinanie ani filtrowanie nie zostało wykonane na tych podstawowych zbiorach danych. W każdym przypadku naukowcy szkolili całość każdego zbioru danych na jednej karcie graficznej Tesla GPU przez trzy dni, z szybkością uczenia 0,0002 na optymalizacji Adam.

Następnie wyrenderowali serię losowych zamian wśród tysięcy osobowości przedstawionych w zbiorach danych, bez względu na to, czy twarze były podobne czy nawet dopasowane pod względem płci, i porównali wyniki CihaNet z wynikami z czterech wiodących ram deepfakes: FaceSwap (który zastępuje bardziej popularne DeepFaceLab, ponieważ dzieli ten sam kod źródłowy w oryginalnym repozytorium z 2017 roku, które spopularyzowało deepfakes); wspomniany wcześniej FaceShifter; FSGAN; i SimSwap.

Porównując wyniki za pomocą VGG-Face, FFHQ, CelebA-HQ i FaceForensics++, autorzy stwierdzili, że ich nowy model przewyższa wszystkie poprzednie modele, jak wskazano w poniższej tabeli.

Trzy metryki użyte do oceny wyników to Similarity Structural (SSIM), błąd estymacji położenia i dokładność odzyskiwania tożsamości, która jest obliczana na podstawie procentu pomyślnie odzyskanych par.

Naukowcy twierdzą, że CihaNet reprezentuje lepsze podejście pod względem wyników jakościowych i znaczący postęp wobec obecnego stanu sztuki w technologiach deepfakes, poprzez usunięcie ciężaru obszernych i pracochłonnych architektur maskowania i metodologii, oraz osiągnięcie bardziej przydatnego i użytecznego oddzielenia tożsamości od kontekstu.

Spójrz poniżej, aby zobaczyć więcej przykładów wideo nowej techniki. Możesz znaleźć pełny filmik tutaj.

Z materiałów uzupełniających do nowego artykułu, CihaNet wykonuje zamianę twarzy na różnych tożsamościach. Źródło: https://mitchellx.github.io/#video

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai