Kąt Andersona

Zmiana emocji w nagraniach wideo za pomocą sztucznej inteligencji

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Naukowcy z Grecji i Wielkiej Brytanii opracowali nowatorskie podejście oparte na głębokim uczeniu się do zmiany wyrazu twarzy i pozornych nastrojów ludzi w nagraniach wideo, przy zachowaniu wierności ruchów warg do oryginalnego dźwięku w sposób, który wcześniejsze próby nie były w stanie osiągnąć.

Z filmu towarzyszącego artykułowi (umieszczonego na końcu tego artykułu), krótki klip aktora Al Pacino, któremu zmieniono wyraz twarzy za pomocą NED, na podstawie wysokiego poziomu semantycznych pojęć. Źródło: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Z filmu towarzyszącego artykułowi (umieszczonego na końcu tego artykułu), krótki klip aktora Al Pacino, któremu zmieniono wyraz twarzy za pomocą NED, na podstawie wysokiego poziomu semantycznych pojęć definiujących indywidualne wyrazy twarzy i ich skojarzone emocje. Metoda “Reference-Driven” po prawej stronie bierze interpretowaną emocję/emojce z filmu źródłowego i stosuje ją do całego ciągu wideo. Źródło: https://www.youtube.com/watch?v=Li6W8pRDMJQ

Ten konkretny obszar badań należy do rosnącej kategorii sztucznie wygenerowanych emocji, gdzie tożsamość oryginalnego mówcy jest zachowana, ale ich wyrazy twarzy i mikrowyrazy są zmienione. W miarę dojrzewania tej technologii sztucznej inteligencji, oferuje możliwość dla produkcji filmowych i telewizyjnych, aby wprowadzać subtelne zmiany w wyrazach twarzy aktorów – ale także otwiera nową kategorię “zmienionych emocjonalnie” filmów z głębokimi fałszerstwami.

Changing Faces

Wyrazy twarzy osób publicznych, takich jak politycy, są rygorystycznie opracowane; w 2016 roku wyrazy twarzy Hillary Clinton poddano intensywnej analizie medialnej ze względu na ich potencjalny negatywny wpływ na jej szanse wyborcze; wyrazy twarzy okazują się również tematem zainteresowania FBI; i są krytycznym wskaźnikiem w rozmowach kwalifikacyjnych, co sprawia, że (bardzo odległa) perspektywa na żywo “filtra kontroli wyrazu” jest pożądana dla osób ubiegających się o pracę, próbujących przejść wstępny wybór na Zoom.

Badanie z 2005 roku z Wielkiej Brytanii twierdziło, że wygląd twarzy wpływa na decyzje wyborcze, podczas gdy artykuł z 2019 roku w Washington Post zbadał użycie “poza kontekstem” udostępniania klipów wideo, co jest obecnie najbliższą rzeczą, jaką mają zwolennicy fałszywych wiadomości, aby móc zmieniać, jak osoba publiczna wydaje się się zachowywać, reagować lub czuć.

Towards Neural Expression Manipulation

W tym momencie stan sztuki w manipulowaniu wyrazem twarzy jest dość podstawowy, ponieważ wymaga rozłączenia wysokiego poziomu pojęć (takich jak smutek, złość, szczęście, uśmiech) od rzeczywistego wideo. Chociaż tradycyjne architektury deepfake wydają się osiągać to rozłączenie dość dobrze, lusterkowanie emocji w różnych tożsamościach wymaga, aby dwa zestawy twarzy szkoleniowych zawierały pasujące wyrazy dla każdej tożsamości.

Ponieważ cechy twarzy i pozy ID są obecnie tak splecione, potrzebna jest szeroka zgodność wyrazu, pozy głowy i (w mniejszym stopniu) oświetlenia w dwóch zbiorach twarzy, aby przeszkolić skuteczny model deepfake na systemach takich jak DeepFaceLab. Im mniej konkretna konfiguracja (taka jak 'widok z boku / uśmiech / nasłoneczniony') jest uwzględniona w obu zestawach twarzy, tym mniej dokładnie będzie renderowana w filmie deepfake, jeśli jest potrzebna.

Typowe przykłady obrazów twarzy w zbiorach danych używanych do szkolenia deepfakes. Obecnie możesz tylko manipulować wyrazem twarzy osoby, tworząc ścieżki wyrazu <> wyrazu w sieci deepfake. Oprogramowanie deepfake z 2017 roku nie ma wewnętrznej, semantycznej znajomości “uśmiechu” – po prostu mapuje i dopasowuje postrzegane zmiany geometrii twarzy między dwiema osobami.

Czym jest pożądane, a co jeszcze nie zostało doskonale osiągnięte, jest rozpoznanie, jak osoba B (na przykład) się uśmiecha, i po prostu utworzenie ‘przełącznika uśmiechu’ w architekturze, bez potrzeby mapowania go na równoważny obraz osoby B się uśmiechającej.

Nowy artykuł nosi tytuł Neural Emotion Director: Speech-preserving semantic control of facial expressions in “in-the-wild” videos i pochodzi od badaczy ze Szkoły Inżynierii Elektrycznej i Komputerowej na Narodowym Uniwersytecie Technicznym w Atenach, Instytutu Informatyki na Fundacji Badań i Technologii Hellas (FORTH) oraz Wydziału Inżynierii, Matematyki i Nauk Fizycznych na Uniwersytecie w Exeter w Wielkiej Brytanii.

Zespół opracował ramy o nazwie Neural Emotion Director (NED), zawierające sieć translatorską opartą na 3D, 3D-Based Emotion Manipulator.

NED przyjmuje otrzymaną sekwencję parametrów wyrazu i tłumaczy ją na docelowy obszar. Jest szkolony na nieparzystych danych, co oznacza, że nie jest konieczne szkolenie na zbiorach danych, w których każda tożsamość ma pasujące wyrazy twarzy.

Film, wyświetlany na końcu tego artykułu, przechodzi przez serię testów, w których NED nakłada pozorny stan emocjonalny na fragmenty z zestawu danych YouTube.

Film, wyświetlany na końcu tego artykułu, przechodzi przez serię testów, w których NED nakłada pozorny stan emocjonalny na fragmenty z zestawu danych YouTube.

Autorzy twierdzą, że NED jest pierwszą metodą wideo do “kierowania” aktorami w losowych i nieprzewidywalnych sytuacjach i udostępnili kod na stronie projektu.

Method and Architecture

System jest szkolony na dwóch dużych zbiorach wideo, które zostały opisane etykietami “emocja”.

Wynik jest możliwy dzięki renderowaniu twarzy wideo, które renderuje pożądany wyraz twarzy do wideo przy użyciu tradycyjnych technik syntezy obrazu twarzy, w tym segmentacji twarzy, wyrównania punktów orientacyjnych twarzy i mieszania, gdzie tylko obszar twarzy jest syntetyzowany, a następnie nakładany na oryginalne wideo.

Architektura potoku Neural Emotion Detector (NED). Źródło: https://arxiv.org/pdf/2112.00585.pdf

Architektura potoku Neural Emotion Detector (NED). Źródło: https://arxiv.org/pdf/2112.00585.pdf

Początkowo system uzyskuje 3D odzyskiwanie twarzy i nakłada wyrównanie punktów orientacyjnych twarzy na klatki wejściowe, aby zidentyfikować wyraz twarzy. Następnie te odzyskane parametry wyrazu są przekazywane do 3D-Based Emotion Manipulator, a wektor stylu obliczany jest za pomocą albo etykiety semantycznej (takiej jak “szczęśliwy”) lub pliku odniesienia.

Plik odniesienia jest filmem przedstawiającym określony rozpoznany wyraz twarzy/emoję, który jest następnie nakładany na całe wideo docelowe, zamieniając oryginalny wyraz twarzy.

Etap w potoku transferu emocji, przedstawiający różnych aktorów pobranych z filmów wideo YouTube.

Etap w potoku transferu emocji, przedstawiający różnych aktorów pobranych z filmów wideo YouTube.

Ostatecznie wygenerowany kształt twarzy 3D jest następnie łączony z Normalized Mean Face Coordinate (NMFC) i obrazami oczu (czerwone kropki na powyższym obrazie), a następnie przekazywany do renderera neuronalnego, który wykonuje ostateczną manipulację.

Results

Badacze przeprowadzili obszerną analizę, w tym badania użytkowników i ablację, aby ocenić skuteczność metody w porównaniu z poprzednimi pracami i stwierdzili, że w większości kategorii NED przewyższa obecny stan sztuki w tej poddziedzinie manipulacji twarzy neuronalnej.

Autorzy artykułu wyobrażają sobie, że późniejsze implementacje tej pracy i narzędzi podobnego rodzaju będą przydatne przede wszystkim w branży telewizyjnej i filmowej, stwierdzając:

‘Nasza metoda otwiera wiele nowych możliwości dla przydatnych aplikacji technologii renderowania neuronalnego, od postprodukcji filmowej i gier wideo do fotorealistycznych awatarów emocjonalnych.’

To wczesna praca w tej dziedzinie, ale jedna z pierwszych, która próbuje zmiany twarzy z wideo, a nie z obrazów statycznych. Chociaż filmy wideo są podstawowo wieloma obrazami statycznymi wyświetlanymi bardzo szybko, istnieją uwagi czasowe, które sprawiają, że poprzednie aplikacje transferu emocji są mniej skuteczne. W towarzyszącym filmie i przykładach w artykule autorzy przedstawiają porównania wizualne wyników NED z innymi porównywalnymi metodami z ostatnich czasów.

Więcej szczegółowych porównań i więcej przykładów NED można znaleźć w pełnym filmie poniżej:

 

3 grudnia 2021, 18:30 GMT+2 – Na prośbę jednego z autorów artykułu, wprowadzono poprawki dotyczące “pliku odniesienia”, który błędnie określiłem jako zdjęcie statyczne (w rzeczywistości jest to klip wideo). Również poprawiono nazwę Instytutu Informatyki na Fundacji Badań i Technologii.
3 grudnia 2021, 20:50 GMT+2 – Druga prośba od jednego z autorów artykułu o dalszą poprawkę nazwy wymienionej instytucji.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai