Kąt Andersona
Przebudowa twarzy w filmach wideo za pomocą uczenia maszynowego

Współpraca badawcza między Chinami a Wielką Brytanią doprowadziła do opracowania nowej metody przekształcania twarzy w filmach wideo. Technika ta pozwala na przekonywujące poszerzanie i zwężanie struktury twarzy, z wysoką spójnością i brakiem artefaktów.

Z filmu wideo wykorzystanego jako materiał źródłowy przez badaczy, aktorka Jennifer Lawrence pojawia się jako osobowość bardziej wyrazista (po prawej). Zobacz załączony film poniżej, aby zobaczyć więcej przykładów w lepszej rozdzielczości. Źródło: https://www.youtube.com/watch?v=tA2BxvrKvjE
Ten rodzaj transformacji jest zwykle możliwy tylko przy użyciu tradycyjnych metod CGI, które wymagałyby całkowitego odtworzenia twarzy za pomocą szczegółowych i kosztownych procedur motion-capping, rigging i texturing.
Zamiast tego, CGI w tej technice jest zintegrowane z neuralnym potokiem jako parametryczna informacja 3D twarzy, która jest następnie wykorzystywana jako podstawa dla przepływu pracy z uczeniem maszynowym.

Tradycyjne parametryczne twarze są coraz częściej wykorzystywane jako wytyczne dla procesów transformacyjnych, które wykorzystują AI zamiast CGI. Źródło: https://arxiv.org/pdf/2205.02538.pdf
Autorzy stwierdzają:
‘Naszym celem jest wygenerowanie wysokiej jakości filmów wideo z przekształconymi twarzami poprzez edycję ogólnej struktury twarzy zgodnie z naturalnymi deformacjami twarzy w świecie rzeczywistym. Może to być wykorzystane w aplikacjach takich jak generowanie twarzy dla urodzenia i eksageracja twarzy dla efektów wizualnych.’
Chociaż 2D przekształcanie i odkształcanie twarzy jest dostępne dla konsumentów od czasu pojawienia się programu Photoshop (co doprowadziło do powstania dziwnych i często nieakceptowalnych subkultur związanych z odkształcaniem twarzy i dysmorfią ciała), jest to trudne do wykonania w filmie wideo bez użycia CGI.

Wymiary Marka Zuckerberga zostały rozszerzone i zwężone przy użyciu nowej chińsko-brytyjskiej techniki.
Przekształcanie ciała jest obecnie dziedziną intensywnego zainteresowania w sektorze wizji komputerowej, głównie ze względu na jego potencjał w handlu elektronicznym, chociaż sprawienie, by ktoś wyglądał wyższy lub bardziej zróżnicowany, jest obecnie znacznym wyzwaniem.
Podobnie, zmiana kształtu głowy w filmie wideo w sposób spójny i przekonywujący była przedmiotem poprzednich badań przeprowadzonych przez autorów nowego artykułu, chociaż ta implementacja była dotknięta artefaktami i innymi ograniczeniami. Nowa oferta rozszerza możliwości tego poprzedniego badania z danych statycznych na dane wideo.
Nowy system został przeszkolony na komputerze stacjonarnym z procesorem AMD Ryzen 9 3950X i 32 GB pamięci, a do map ruchu wykorzystano algorytm optycznego przepływu z OpenCV, który został wygładzony za pomocą StructureFlow framework; sieć Facial Alignment Network (FAN) składnik do estymacji punktów charakterystycznych, który jest również wykorzystywany w popularnych pakietach deepfakes; oraz Ceres Solver do rozwiązywania problemów optymalizacji.

Ekstremalny przykład odkształcenia twarzy przy użyciu nowego systemu.
Artykuł artykuł nosi tytuł Parametryczne przekształcanie portretów w filmach wideo i pochodzi od trzech badaczy z Zhejiang University oraz jednego z University of Bath.
O twarzach
Pod nowym systemem, film wideo jest wyodrębniony w sekwencję obrazów, a następnie oszacowany jest sztywny kształt twarzy dla każdej twarzy. Następnie wspólnie oszacowanych jest kilka kolejnych klatek, aby utworzyć spójne parametry tożsamości na całej długości obrazów (tj. klatki filmu wideo).

Architektura systemu odkształcania twarzy.
Po tym, oceniany jest wyraz twarzy, co daje parametr przekształcenia, który jest implementowany za pomocą regresji liniowej. Następnie nowa funkcja odległości (SDF) podejście tworzy gęste mapowanie 2D rysunków twarzy przed i po przekształceniu.
W końcu, przeprowadzana jest optymalizacja odkształcania zawartości wideo.
Parametryczne twarze
Proces ten wykorzystuje 3D model twarzy (3DMM), który jest coraz bardziej popularnym dodatkiem do systemów syntezy twarzy opartych na neuronach i GAN, a także stosowanym w systemach wykrywania deepfakes.

Nie z nowego artykułu, ale przykład 3D modelu twarzy (3DMM) – parametrycznego prototypu twarzy wykorzystywanego w nowym projekcie. Góra po lewej, aplikacja punktów charakterystycznych na twarzy 3DMM. Góra po prawej, wierzchołki siatki 3D izomapy. Dół po lewej pokazuje dopasowanie punktów charakterystycznych; dół-środek, izomapę wyodrębnionego tekstu twarzy; i dół po prawej, wynikowe dopasowanie i kształt. Źródło: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
Przepływ pracy nowego systemu musi uwzględniać przypadki zakrycia, takie jak sytuacja, w której osoba patrzy w bok. Jest to jeden z największych wyzwań w oprogramowaniu deepfake, ponieważ punkty charakterystyczne FAN mają niewielką możliwość uwzględnienia tych przypadków i tendencję do degradacji jakości, gdy twarz jest zakryta lub odwrócona.
Nowy system jest w stanie uniknąć tej pułapki, definiując energię konturu, która jest w stanie dopasować granicę między 3D twarzą (3DMM) a 2D twarzą (zdefiniowaną przez punkty charakterystyczne FAN).
Optymalizacja
Przydatnym zastosowaniem takiego systemu byłoby wdrożenie deformacji w czasie rzeczywistym, na przykład w filtrach wideokonferencyjnych. Obecna ramka nie umożliwia tego, a wymagane zasoby obliczeniowe uczyniłyby “na żywo” deformację znacznym wyzwaniem.
Zgodnie z artykułem, a zakładając cel 24 klatek na sekundę, operacje klatkowe w potoku reprezentują opóźnienie 16,344 sekund na sekundę filmu, z dodatkowymi jednorazowymi uderzeniami dla estymacji tożsamości i deformacji twarzy 3D (321 ms i 160 ms, odpowiednio).
Dlatego optymalizacja jest kluczem do postępu w kierunku obniżenia opóźnienia. Ponieważ wspólna optymalizacja we wszystkich klatkach dodałaby znaczne obciążenie procesowi, a optymalizacja stylu init (zakładając spójną tożsamość mówcy od pierwszej klatki) mogłaby prowadzić do anomalii, autorzy przyjęli schemat rzadki do obliczania współczynników klatek próbkowanych w praktycznych odstępach.
Wspólna optymalizacja jest następnie wykonywana na tym podzbiorze klatek, prowadząc do lżejszego procesu rekonstrukcji.
Odkształcanie twarzy
Technika odkształcania wykorzystywana w projekcie jest adaptacją pracy autorów z 2020 roku Głębokie portrety (DSP).

Głębokie portrety, przesłanie z 2020 roku do ACM Multimedia. Artykuł jest prowadzony przez badaczy z ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Źródło: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
Autorzy zauważają ‘Rozszerzamy tę metodę z przekształcania jednego obrazu monokularnego do przekształcania całej sekwencji obrazów.’
Testy
Artykuł stwierdza, że nie było porównywalnego materiału wcześniejszego, z którym można byłoby ocenić nową metodę. Dlatego autorzy porównali klatki swojego odkształconego wideo z wyjściem statycznym DSP.

Testowanie nowego systemu w porównaniu z obrazami statycznymi z Głębokich portretów.
Autorzy zauważają, że artefakty wynikają z metody DSP, ze względu na jej użycie mapowania rzadkiego – problem, który nowy system rozwiązuje za pomocą gęstego mapowania. Ponadto, wideo wyprodukowane przez DSP, jak twierdzi artykuł, demonstruje brak gładkości i spójności wizualnej.
Autorzy stwierdzają:
‘Wyniki pokazują, że nasze podejście może niezawodnie produkować spójne przekształcone filmy wideo z portretami, podczas gdy metoda oparta na obrazach może łatwo prowadzić do zauważalnych artefaktów migotania.’
Zobacz załączony film poniżej, aby zobaczyć więcej przykładów:
Pierwotnie opublikowane 9 maja 2022. Zmienione o 18:00 czasu środkowoeuropejskiego, zastąpione ‘pole’ przez ‘funkcję’ dla SDF.












