Kąt Andersona

Świt emocji Deepfaked

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy opracowali nową technikę machine learning, która pozwala na arbitralne nakładanie nowych emocji na twarze w filmie, dostosowując istniejące technologie, które niedawno pojawiły się jako rozwiązania do dopasowania ruchu warg do dubbingu w języku obcym.

Badania są równym współpracą pomiędzy Northeastern University w Bostonie a Media Lab na MIT, i nosi tytuł Invertable Frowns: Video-to-Video Facial Emotion Translation. Chociaż naukowcy przyznają, że początkowa jakość wyników musi zostać rozwinięta przez dalsze badania, twierdzą, że technika, nazwana Wav2Lip-Emotion, jest pierwszą, która bezpośrednio zajmuje się modyfikacją pełnego wyrażenia filmu za pomocą technik sieci neuronowych.

Podstawowy kod został opublikowany na GitHubie, chociaż punkty kontrolne modelu zostaną dodane do repozytorium open source później, obiecuje autor.

Po lewej, 'smutna' klatka źródłowego filmu. Po prawej, 'wesoła' klatka. Na środku są dwa zalążkowe podejścia do syntezy alternatywnych emocji – górny rząd: całkowicie zamaskowana twarz, gdzie cała powierzchnia wyrażenia została zastąpiona; dolny rząd: bardziej tradycyjna metoda Wav2Lip, która zastępuje tylko dolną część twarzy. Źródło: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

Po lewej, ‘smutna’ klatka źródłowego filmu. Po prawej, ‘wesoła’ klatka. Na środku są dwa zalążkowe podejścia do syntezy alternatywnych emocji – górny rząd: całkowicie zamaskowana twarz, gdzie cała powierzchnia wyrażenia została zastąpiona; dolny rząd: bardziej tradycyjna metoda Wav2Lip, która zastępuje tylko dolną część twarzy. Źródło: https://raw.githubusercontent.com/jagnusson/Wav2Lip-Emotion/main/literature/ADGD_2021_Wav2Lip-emotion.pdf

Pojedynczy film jako dane źródłowe

W teorii, takie manipulacje są osiągalne teraz za pomocą pełnego szkolenia na tradycyjnych repozytoriach deepfake, takich jak DeepFaceLab lub FaceSwap. Jednak standardowy workflow wymagałby użycia alternatywnej tożsamości w stosunku do ‘celu’ tożsamości, takiej jak aktor naśladujący cel, którego własne wyrażenia zostałyby przeniesione na inną osobę, wraz z resztą występu. Dodatkowo, techniki głosowe deepfake zazwyczaj byłyby konieczne do uzupełnienia iluzji.

Dalej, zmiana wyrażenia target1>target1 w jednym filmie źródłowym w ramach tych popularnych frameworków wymagałaby zmiany wektorów wyrównania twarzy w sposób, który te architektury nie obsługują obecnie.

Wav2Lip-Emotion utrzymuje synchronizację ruchu warg oryginalnego dialogu audio, podczas gdy przekształca powiązane wyrażenia.

Wav2Lip-Emotion utrzymuje synchronizację ruchu warg oryginalnego dialogu audio, podczas gdy przekształca powiązane wyrażenia.

Zamiast tego, Wav2Lip-Emotion skutecznie stara się ‘skopiować i wkleić’ emocjonalne wyrażenia z jednej części filmu i zastąpić je w innych punktach, z samonakładaną oszczędnością danych źródłowych, której celem jest ostatecznie zaoferowanie niższego wysiłku metody manipulacji wyrażeniami.

Modele offline mogą być później opracowane, które są szkolone na alternatywnych filmach mówcy, eliminując potrzebę posiadania jednego filmu zawierającego ‘paletę’ stanów wyrażenia, z którymi można manipulować filmem.

Potencjalne cele

Autorzy sugerują kilka zastosowań dla modyfikacji wyrażeń, w tym filtr filmu na żywo w celu rekompensaty za skutki PTSD i zespołu mózgowo-rdzeniowego. Artykuł obserwuje:

‘Osoby z zahamowanymi lub niezahamowanymi wyrażeniami twarzy mogą skorzystać na dostosowaniu własnych wyrażeń do lepszego dopasowania do okoliczności społecznych. Można zmienić wyrażenia w filmach wyświetlanych im. Mówcy mogą krzyczeć na siebie podczas wideokonferencji, ale mimo to chcą uzyskać treść ich wymiany bez nieprzyjemnych wyrażeń. Lub reżyser filmowy może chcieć powiększyć lub zmniejszyć wyrażenia aktora.’

Ponieważ wyrażenie twarzy jest kluczowym i podstawowym wskaźnikiem intencji, nawet wtedy, gdy może drażnić słowa wypowiadane, możliwość zmiany wyrażenia oferuje również, w pewnym stopniu, możliwość zmiany, w jaki sposób komunikacja jest odbierana.

Poprzednie prace

Zainteresowanie machine learningiem w modyfikacji wyrażeń sięga co najmniej 2012 roku, kiedy współpraca pomiędzy Adobe, Facebookiem i Uniwersytetem Rutgersa zaproponowała metodę zmiany wyrażeń za pomocą podejścia opartego na tensorach i 3D geometrii, której celem było nałożenie siatki CGI na każdą klatkę filmu docelowego w celu dokonania zmiany.

Badania z 2012 roku Adobe/Facebook manipulowały wyrażeniami, nakładając tradycyjne, CGI-driven zmiany na nagranie wideo. Wyrażenia mogły być powiększone lub stłumione. Źródło: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

Badania z 2012 roku Adobe/Facebook manipulowały wyrażeniami, nakładając tradycyjne, CGI-driven zmiany na nagranie wideo. Wyrażenia mogły być powiększone lub stłumione. Źródło: https://yfalan.github.io/files/papers/FeiYang_CVPR2012.pdf

Chociaż wyniki były obiecujące, technika była uciążliwa, a wymagane zasoby były znaczne. W tym momencie CGI była znacznie bardziej zaawansowana niż podejścia oparte na widzeniu komputerowym do manipulacji cech i pikseli.

Bardziej związane z nowym artykułem jest MEAD, zestaw danych i model generacji wyrażeń, opublikowany w 2020 roku, który umożliwia generowanie filmów ‘talking-head’, chociaż bez poziomu złożoności, jaki można osiągnąć za pomocą modyfikacji filmu źródłowego bezpośrednio.

Generacja wyrażeń z 2020 roku MEAD, współpraca pomiędzy SenseTime Research, Carnegie Mellon i trzema chińskimi uniwersytetami. Źródło: https://wywu.github.io/projects/MEAD/MEAD.html

Generacja wyrażeń z 2020 roku MEAD, współpraca pomiędzy SenseTime Research, Carnegie Mellon i trzema chińskimi uniwersytetami. Źródło: https://wywu.github.io/projects/MEAD/MEAD.html

W 2018 roku pojawił się inny artykuł, zatytułowany GANimation: Anatomically-aware Facial Animation from a Single Image, jako współpraca akademicka pomiędzy USA i Hiszpanią, i wykorzystywał sieci generatywne przeciwne do powiększania lub zmiany wyrażeń na zdjęciach statycznych.

Zmiana wyrażeń na zdjęciach statycznych za pomocą GANimation. Źródło: https://arxiv.org/pdf/1807.09251.pdf

Zmiana wyrażeń na zdjęciach statycznych za pomocą GANimation. Źródło: https://arxiv.org/pdf/1807.09251.pdf

Wav2Lip-Emotion

Zamiast tego, nowy projekt opiera się na Wav2Lip, który zyskał rozgłos w 2020 roku, oferując potencjalną metodę ponownego synchronizowania ruchu warg z nowym wejściem mowy (lub piosenki), które nie pojawiło się w oryginalnym filmie.

Oryginalna architektura Wav2Lip była szkolona na korpusie zdań mówionych z archiwów BBC. Aby dostosować Wav2Lip do zadania modyfikacji wyrażeń, naukowcy ‘wydoskonalili’ architekturę na wcześniej wspomnianym zestawie danych MEAD.

MEAD składa się z 40 godzin filmu, na którym 60 aktorów czyta tę samą zdanie, wykonując różne wyrażenia twarzy. Aktorzy pochodzą z 15 różnych krajów i oferują międzynarodowe cechy, które mają pomóc projektowi (i pochodnym projektom) w wytworzeniu syntetyzowanych wyrażeń o dużym stopniu uogólnienia.

W momencie badań MEAD opublikował tylko pierwszą część zestawu danych, zawierającą 47 osób wykonujących wyrażenia, takie jak ‘zły’, ‘oburzony’, ‘strach’, ‘lekkomyślność’, ‘szczęśliwy’, ‘smutny’ i ‘zaskoczenie’. W tym wstępnym podejściu do nowego podejścia naukowcy ograniczyli zakres projektu do nakładania lub zmiany postrzeganych emocji ‘szczęśliwy’ i ‘smutny’, ponieważ są to najłatwiej rozpoznawalne.

Metoda i wyniki

Oryginalna architektura Wav2Lip zastępuje tylko dolną część twarzy, podczas gdy Wav2Lip-Emotion eksperymentuje również z pełnym maskowaniem twarzy i syntezą wyrażeń. Dlatego naukowcom było konieczne również zmodyfikowanie wbudowanych metod oceny, ponieważ nie były one zaprojektowane do pełnej konfiguracji twarzy.

Autorzy udoskonalają oryginalny kod, zachowując oryginalne wejście audio, utrzymując spójność ruchu warg.

Element generatora składa się z kodera tożsamości, kodera mowy i dekodera twarzy, zgodnie z wcześniejszą pracą. Element mowy jest zakodowany dodatkowo jako złożone 2D konwolucje, które są następnie łączone z ich powiązanymi klatkami.

Oprócz elementu generatywnego, zmodyfikowana architektura zawiera trzy główne składniki dyskryminacyjne, ukierunkowane na jakość synchronizacji warg, element celu emocjonalnego i wizualnie szkolony element jakości.

Dla pełnej rekonstrukcji twarzy oryginalna praca Wav2Lip nie zawierała poprzednika, i dlatego model został szkolony od podstaw. Dla szkolenia dolnej części twarzy (półmaski) naukowcy rozpoczęli od punktów kontrolnych zawartych w oryginalnym kodzie Wav2Lip.

Obok automatycznej oceny naukowcy wykorzystali opinie crowd-sourced dostarczone przez półautomatyczną platformę usługową. Pracownicy generalnie oceniali wyjście jako wysokie pod względem rozpoznawania nałożonych emocji, podczas gdy tylko zgłaszali ‘umiarkowane’ oceny jakości obrazu.

Autorzy sugerują, że poza poprawą jakości wygenerowanego filmu przez dalsze udoskonalenia, przyszłe iteracje pracy mogą objąć szerszy zakres emocji, i że praca mogłaby być równie dobrze zastosowana w przyszłości do danych źródłowych i zestawów danych, co ostatecznie doprowadziłoby do autentycznego systemu, w którym emocje mogłyby być regulowane w zależności od użytkownika, lub ostatecznie zastąpione przez przeciwstawne emocje w odniesieniu do oryginalnego filmu źródłowego.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai