Kąt Andersona
Oferowanie LipSync3D firmy Google zapewnia poprawioną synchronizację ruchu ust

Współpraca pomiędzy badaczami z Google AI a Indian Institute of Technology Kharagpur doprowadziła do stworzenia nowego frameworku do syntezy nagłówków rozmawiających z zawartości audio. Projekt ma na celu wytworzenie zoptymalizowanych i rozsądnie zasobowych sposobów tworzenia zawartości wideo z nagłówkami rozmawiającymi z audio, w celu synchronizacji ruchu ust z dubbingowanym lub tłumaczonym maszynowo audio, oraz do użycia w awatarach, aplikacjach interaktywnych i innych środowiskach czasu rzeczywistego.

Źródło: https://www.youtube.com/watch?v=L1StbX9OznY
Modele uczenia maszynowego wykorzystywane w tym procesie – zwane LipSync3D – wymagają jedynie jednego nagrania wideo z tożsamością twarzy jako danych wejściowych. Potok przygotowania danych oddziela ekstrakcję geometrii twarzy od oceny oświetlenia i innych aspektów nagrania wideo, co pozwala na bardziej ekonomiczne i ukierunkowane szkolenie.

Dwuetapowy przepływ pracy LipSync3D. Powyżej, generowanie dynamicznie teksturyzowanej twarzy 3D z audio; poniżej, wstawienie wygenerowanego siatka do nagrania wideo.
Faktycznie, najbardziej godny uwagi wkład LipSync3D w badania w tej dziedzinie może być jego algorytm normalizacji oświetlenia, który rozdziela szkolenie i inferencję oświetlenia.

Rozdzielanie danych oświetlenia od geometrii ogólnej pomaga LipSync3D wytwarzać bardziej realistyczne ruchy ust w trudnych warunkach. Inne podejścia z ostatnich lat ograniczały się do ‘stałych’ warunków oświetlenia, które nie ujawnią ich ograniczonej pojemności w tym zakresie.
Podczas przetwarzania ram danych wejściowych, system musi zidentyfikować i usunąć punkty odbicia, ponieważ są one specyficzne dla warunków oświetlenia, w których nagranie wideo zostało wykonane, i w przeciwnym razie będą przeszkadzać w procesie ponownego oświetlenia.

LipSync3D, jak sama nazwa wskazuje, nie wykonuje tylko analizy pikseli na twarzach, które ocenia, ale aktywnie wykorzystuje zidentyfikowane punkty orientacyjne twarzy do generowania motylich siatek CGI, wraz z ‘rozłożonymi’ teksturami, które są owijane wokół nich w tradycyjnym potoku CGI.

Normalizacja pozy twarzy w LipSync3D. Po lewej stronie są ramy wejściowe i wykryte cechy; w środku, znormalizowane wierzchołki wygenerowanej siatki; a po prawej stronie, odpowiadająca atlas tekstury, który dostarcza podstawę prawdy dla predykcji tekstury. Źródło: https://arxiv.org/pdf/2106.04185.pdf
Poza nowatorską metodą ponownego oświetlenia, badacze twierdzą, że LipSync3D oferuje trzy główne innowacje w porównaniu z poprzednimi pracami: separację geometrii, oświetlenia, pozy i tekstury na dyskretne strumienie danych w przestrzeni znormalizowanej; łatwo trenowalny model predykcji tekstury auto-regresyjnej, który wytwarza spójną syntezę wideo w czasie; oraz zwiększoną realizm, ocenianą przez oceny ludzkie i obiektywne metryki.

Rozdzielanie różnych aspektów obrazu twarzy pozwala na większą kontrolę w syntezie wideo.
LipSync3D może wywnioskować odpowiednią geometrię ruchu ust bezpośrednio z audio, analizując fonemy i inne aspekty mowy, i tłumacząc je na znane odpowiadające pozy mięśni wokół ust.

Proces ten wykorzystuje potok wspólnej predykcji, gdzie wywnioskowana geometria i tekstura mają dedykowane kodery w zestawie autoenkodera, ale dzielą jeden kodery audio z mową, która ma być nałożona na model:
Synteza ruchu LipSync3D jest również przeznaczona do zasilania stylizowanych awatarów CGI, które w istocie są tylko takimi samymi informacjami o siatce i teksturze, jak te w rzeczywistych obrazach:

Stylizowany awatar 3D ma swoje ruchy ust zasilane w czasie rzeczywistym przez nagranie wideo źródłowe. W takim przypadku najlepsze wyniki uzyskałoby się dzięki personalizowanemu wstępnemu szkoleniu.
Badacze również przewidują użycie awatarów z nieco bardziej realistycznym wyglądem:
![]()
Czas szkolenia próbek wideo wynosi od 3 do 5 godzin dla nagrania wideo trwającego od 2 do 5 minut, w potoku, który wykorzystuje TensorFlow, Python i C++ na GeForce GTX 1080. Sesje szkoleniowe wykorzystywały rozmiar partii 128 klatek przez 500-1000 epok, przy czym każda epoka reprezentowała pełną ocenę nagrania wideo.
Ku dynamicznej re-synchronizacji ruchu ust
Dziedzina re-synchronizacji ust do dostosowania nowego śladu audio otrzymała wiele uwagi w badaniach wizji komputerowej w ostatnich latach (patrz poniżej), nie tylko jako produkt uboczny kontrowersyjnej technologii deepfake.
W 2017 roku Uniwersytet Waszyngton przedstawił badania zdolne do nauki synchronizacji ust z audio, wykorzystując ją do zmiany ruchu ust byłego prezydenta Obamy. W 2018 roku; Max Planck Institute for Informatics prowadził inny projekt badawczy w celu umożliwienia transferu tożsamości wideo, z synchronizacją ust jako produktem ubocznym procesu; i w maju 2021 roku startup AI FlawlessAI ujawnił swoją własną technologię synchronizacji ust TrueSync, która została szeroko przyjęta w prasie jako umożliwiająca ulepszone technologie dubbingu dla głównych wydań filmowych w różnych językach.
I, oczywiście, ciągły rozwój otwartych repozytoriów deepfake dostarcza inną gałąź aktywnych badań użytkowników w tej sferze syntezy obrazu twarzy.
nc technology TrueSync, szeroko przyjęta w prasie jako umożliwiająca ulepszone technologie dubbingu dla głównych wydań filmowych w różnych językach. I, oczywiście, ciągły rozwój otwartych repozytoriów deepfake dostarcza inną gałąź aktywnych badań użytkowników w tej sferze syntezy obrazu twarzy.











