Modele i platformy AI
AniPortrait: Synteza portretu fotorealistycznego z wykorzystaniem dźwięku
Przez lata tworzenie realistycznych i wyrazistych animacji portretowych z obrazów statycznych i dźwięku znalazło zastosowanie w wielu dziedzinach, w tym w grach, mediach cyfrowych, rzeczywistości wirtualnej i wielu innych. Pomimo swojego potencjału, nadal jest trudno dla deweloperów stworzyć ramy, które mogą generować wysokiej jakości animacje, które zachowują spójność czasową i są wizualnie przekonywające. Główną przyczyną tej złożoności jest potrzeba skomplikowanej koordynacji ruchów warg, pozycji głowy i wyrazów twarzy, aby stworzyć wizualnie przekonywujący efekt.
W tym artykule będziemy rozmawiać o AniPortrait, nowatorskiej ramie, która została zaprojektowana w celu generowania wysokiej jakości animacji z wykorzystaniem obrazu referencyjnego i próbki dźwiękowej. Działanie ramy AniPortrait jest podzielone na dwa etapy. W pierwszym etapie, AniPortrait wyodrębnia pośrednie reprezentacje 3D z próbek dźwiękowych i projektyje je na sekwencję 2D punktów twarzy. Następnie, rama wykorzystuje potężny model dyfuzji wraz z modułem ruchu, aby przekształcić sekwencję punktów twarzy w animację fotorealistyczną i spójną czasowo. Wyniki eksperymentalne pokazują wyższość i zdolność ramy AniPortrait do generowania animacji o wysokiej jakości, z wyjątkową jakością wizualną, różnorodnością pozycji i naturalności twarzy, co oferuje wzmocnione i wzbogacone doświadczenie percepcyjne. Ponadto, rama AniPortrait ma znaczny potencjał pod względem sterowalności i elastyczności, i może być stosowana skutecznie w dziedzinach takich jak reenactment twarzy, edycja ruchu twarzy i wiele innych. Ten artykuł ma na celu omówienie ramy AniPortrait w głębi, i będziemy eksplorować mechanizm, metodologię, architekturę ramy oraz porównanie z ramami stanu sztuki. Zatem, zacznijmy.
AniPortrait: Animacja portretu fotorealistycznego
Tworzenie realistycznych i wyrazistych animacji portretowych było celem badaczy przez długi czas, ze względu na ich niesamowity potencjał i zastosowanie w dziedzinach takich jak media cyfrowe i rzeczywistość wirtualna, a także w grach i innych. Pomimo lat badań i rozwoju, wytwarzanie animacji o wysokiej jakości, które zachowują spójność czasową i są wizualnie przekonywające, nadal stanowi znaczne wyzwanie. Główną przeszkodą dla deweloperów jest potrzeba skomplikowanej koordynacji pomiędzy pozycjami głowy, wyrazami twarzy i ruchami warg, aby stworzyć wizualnie przekonywający efekt. Istniejące metody nie były w stanie pokonać tych wyzwań, głównie dlatego, że większość z nich opiera się na ograniczonych generatorach, takich jak NeRF, dekodery ruchu i GAN do tworzenia treści wizualnej. Sieci te wykazują ograniczone możliwości generalizacji i są niestabilne w generowaniu treści o wysokiej jakości. Jednakże, ostatnie pojawienie się modeli dyfuzji ułatwiło generowanie obrazów o wysokiej jakości, a niektóre ramy zbudowane na podstawie modeli dyfuzji wraz z modułami czasowymi umożliwiły tworzenie przekonywających filmów, pozwalając modelom dyfuzji na osiągnięcie sukcesu.
W oparciu o postępy modeli dyfuzji, rama AniPortrait ma na celu generowanie animacji portretowych o wysokiej jakości z wykorzystaniem obrazu referencyjnego i próbki dźwiękowej. Działanie ramy AniPortrait jest podzielone na dwa etapy. W pierwszym etapie, AniPortrait wykorzystuje modele oparte na transformatorach do wyodrębnienia sekwencji 3D siatki twarzy i pozycji głowy z wejścia dźwiękowego, i projektyje je następnie na sekwencję 2D punktów twarzy. Pierwszy etap umożliwia ramie AniPortrait przechwycenie ruchów warg i subtelnych wyrazów twarzy z dźwięku, a także ruchów głowy, które są synchronizowane z rytmem próbki dźwiękowej. W drugim etapie, AniPortrait wykorzystuje potężny model dyfuzji wraz z modułem ruchu, aby przekształcić sekwencję punktów twarzy w animację fotorealistyczną i spójną czasowo. Aby być bardziej szczegółowym, AniPortrait opiera się na architekturze sieciowej z istniejącego modelu AnimateAnyone, który wykorzystuje Stable Diffusion 1.5, potężny model dyfuzji do generowania obrazów o wysokiej jakości na podstawie obrazu referencyjnego i sekwencji ruchu ciała. Co jest godne uwagi, to fakt, że AniPortrait nie wykorzystuje modułu pose guider w ramach tej sieci, jak to ma miejsce w modelu AnimateAnyone, ale przeprojektowuje go, co pozwala AniPortrait nie tylko na utrzymanie lekkiej konstrukcji, ale także na wykazanie się zwiększoną precyzją w generowaniu ruchów warg.
Wyniki eksperymentalne pokazują wyższość ramy AniPortrait w tworzeniu animacji o wysokiej jakości, z wyjątkową jakością wizualną, różnorodnością pozycji i naturalnością twarzy. Wykorzystując reprezentacje 3D jako cechy pośrednie, AniPortrait zyskuje elastyczność w modyfikowaniu tych reprezentacji zgodnie z wymaganiami. Elastyczność ta znacznie zwiększa stosowalność ramy AniPortrait w różnych dziedzinach, w tym w reenactment twarzy i edycji ruchu twarzy.
AniPortrait: Działanie i Metodologia
Proponowana rama AniPortrait składa się z dwóch modułów, a mianowicie Lmk2Video i Audio2Lmk. Moduł Audio2Lmk próbuje wyodrębnić sekwencję punktów twarzy, która przechwytuje subtelne ruchy warg i wyrazy twarzy z wejścia dźwiękowego, podczas gdy moduł Lmk2Video wykorzystuje tę sekwencję punktów twarzy do generowania animacji portretowych o wysokiej jakości z czasową stabilnością. Poniższy rysunek przedstawia przegląd działania ramy AniPortrait. Jak można zauważyć, AniPortrait najpierw wyodrębnia 3D siatkę twarzy i pozycję głowy z dźwięku, i projektyje te elementy na 2D punkty twarzy. W drugim etapie, rama wykorzystuje model dyfuzji do przekształcenia 2D punktów twarzy w animację portretu z dwoma etapami szkolenia w sieci.

Audio2Lmk
Dla danej sekwencji fragmentów mowy, głównym celem ramy AniPortrait jest przewidzenie odpowiedniej sekwencji 3D siatki twarzy z wektorami translacji i rotacji. AniPortrait wykorzystuje pre-trenowany model wav2vec do wyodrębnienia cech dźwiękowych, i model ten wykazuje wysoki stopień generalizacji, i jest w stanie rozpoznać intonację i wymowę z dźwięku dokładnie, co odgrywa kluczową rolę w generowaniu realistycznych animacji twarzy. Wykorzystując uzyskane silne cechy dźwiękowe, AniPortrait jest w stanie skutecznie wykorzystać prostą architekturę składającą się z dwóch warstw fc do przekształcenia tych cech w 3D siatkę twarzy. AniPortrait obserwuje, że ten prosty projekt implementowany przez model nie tylko zwiększa wydajność procesu inferencyjnego, ale także zapewnia dokładność. Podczas konwersji dźwięku na pozycję, AniPortrait wykorzystuje tę samą sieć wav2vec jako trzon, chociaż model nie dzieli wag z modułem audio do siatki. Jest to głównie z powodu faktu, że pozycja jest bardziej związana z tonem i rytmem obecnym w dźwięku, co ma inny nacisk w porównaniu z zadaniem audio do siatki. Aby uwzględnić wpływ poprzednich stanów, AniPortrait wykorzystuje dekoder transformatora do dekodowania sekwencji pozycji. Podczas tego procesu, rama integruje cechy dźwiękowe z dekodera za pomocą mechanizmów uwagi krzyżowej, i dla obu modułów, rama trenuje je z wykorzystaniem straty L1. Gdy model uzyskuje sekwencję pozycji i siatki, wykorzystuje projekcję perspektywiczną do przekształcenia tych sekwencji w 2D sekwencję punktów twarzy, które są następnie wykorzystywane jako sygnały wejściowe dla następnego etapu.
Lmk2Video
Dla danego obrazu portretowego referencyjnego i sekwencji punktów twarzy, proponowany moduł Lmk2Video tworzy animację portretu spójną czasowo, i ta animacja jest wyrównana z ruchem zgodnie z sekwencją punktów twarzy, i utrzymuje wygląd, który jest spójny z obrazem referencyjnym, i ostatecznie, rama reprezentuje animację portretu jako sekwencję klatek portretu. Projekt struktury sieciowej Lmk2Video szuka inspiracji w istniejącej ramie AnimateAnyone. AniPortrait wykorzystuje model Stable Diffusion 1.5, potężny model dyfuzji jako trzon, i integruje moduł ruchu, który skutecznie konwertuje wieloklatkowe dane szumowe na sekwencję klatek wideo. Równocześnie, składnik sieciowy ReferenceNet odbija strukturę modelu Stable Diffusion 1.5, i wykorzystuje go do wyodrębnienia informacji o wyglądzie z obrazu referencyjnego, i integruje go z trzonem. Strategiczny projekt zapewnia, że tożsamość twarzy pozostaje spójna w całym wyjściowym filmie. W przeciwieństwie do ramy AnimateAnyone, AniPortrait zwiększa złożoność projektu PoseGuider. Oryginalna wersja ramy AnimateAnyone składa się tylko z kilku warstw konwolucyjnych, po których cechy punktów twarzy łączą się z danymi wejściowymi trzonu. AniPortrait odkrywa, że ten projekt jest niewystarczający do przechwycenia subtelnych ruchów warg, i aby rozwiązać ten problem, rama przyjmuje strategię wieloskalową architektury ConvNet, i integruje cechy punktów twarzy odpowiadających skal z różnymi blokami trzonu. Ponadto, AniPortrait wprowadza dodatkową poprawę, włączając punkty twarzy obrazu referencyjnego jako dodatkowe dane wejściowe. Moduł uwagi krzyżowej składnika PoseGuider umożliwia interakcję pomiędzy punktami twarzy docelowymi każdej klatki a punktami twarzy referencyjnymi. Ten proces zapewnia sieci dodatkowe wskazówki do zrozumienia korelacji pomiędzy wyglądem a punktami twarzy, co pomaga w generowaniu animacji portretowych o bardziej precyzyjnym ruchu.
AniPortrait: Implementacja i Wynik
Dla etapu Audio2Lmk, AniPortrait przyjmuje składnik wav2vec2.0 jako trzon, i wykorzystuje architekturę MediaPipe do wyodrębnienia 3D siatki i 6D pozycji dla adnotacji. Model czerpie dane treningowe dla komponentu Audio2Mesh z wewnętrznej bazy danych, która składa się z około 60 minut wysokiej jakości danych mowy pochodzących od jednego mówcy. Aby upewnić się, że 3D siatka wyodrębniona przez komponent MediaPipe jest stabilna, aktor głosowy jest instruowany, aby patrzeć prosto w kamerę i utrzymywać stabilną pozycję głowy podczas całego procesu nagrywania. Dla modułu Lmk2Video, AniPortrait wdraża dwuetapowe podejście treningowe. W pierwszym etapie, rama koncentruje się na trenowaniu ReferenceNet i PoseGuider, 2D składnika trzonu, i pomija moduł ruchu. W drugim etapie, AniPortrait zamyka wszystkie inne składniki i koncentruje się na trenowaniu modułu ruchu. Dla tego etapu, rama wykorzystuje dwie duże bazy danych wysokiej jakości filmów twarzy do trenowania modelu, i przetwarza wszystkie dane z wykorzystaniem komponentu MediaPipe do wyodrębnienia 2D punktów twarzy. Ponadto, aby zwiększyć wrażliwość sieci na ruchy warg, model AniPortrait różnicuje górne i dolne wargi odrębnymi kolorami podczas renderowania obrazu pozycji z 2D punktów twarzy.
Jak pokazano na poniższym obrazie, AniPortrait generuje serię animacji, które demonstrują wysoką jakość i realizm.

Rama następnie wykorzystuje pośrednią reprezentację 3D, która może być edytowana w celu manipulowania wyjściem zgodnie z wymaganiami. Na przykład, użytkownicy mogą wyodrębnić punkty twarzy z określonego źródła i zmienić ich tożsamość, co pozwala ramie AniPortrait na stworzenie efektu reenactmentu twarzy.
Podsumowanie
W tym artykule omówiliśmy AniPortrait, nowatorską ramę zaprojektowaną do generowania animacji o wysokiej jakości z wykorzystaniem obrazu referencyjnego i próbki dźwiękowej. Poprzez prosty wprowadzenie obrazu referencyjnego i próbki dźwiękowej, AniPortrait jest w stanie generować film portretowy, który prezentuje naturalny ruch głowy i gładki ruch warg. Wykorzystując silne możliwości generalizacji modelu dyfuzji, AniPortrait generuje animacje, które prezentują imponującą jakość obrazu i realistyczny ruch. Działanie AniPortrait jest podzielone na dwa etapy. W pierwszym etapie, AniPortrait wyodrębnia pośrednie reprezentacje 3D z próbek dźwiękowych i projektyje je na sekwencję 2D punktów twarzy. Następnie, rama wykorzystuje potężny model dyfuzji wraz z modułem ruchu, aby przekształcić sekwencję punktów twarzy w animację fotorealistyczną i spójną czasowo. Wyniki eksperymentalne pokazują wyższość i zdolność ramy AniPortrait do generowania animacji o wysokiej jakości, z wyjątkową jakością wizualną, różnorodnością pozycji i naturalnością twarzy, co oferuje wzmocnione i wzbogacone doświadczenie percepcyjne. Ponadto, rama AniPortrait ma znaczny potencjał pod względem sterowalności i elastyczności, i może być stosowana skutecznie w dziedzinach takich jak reenactment twarzy, edycja ruchu twarzy i wiele innych.












