Modele i platformy AI
MagicDance: Realistyczna Generacja Tańca Człowieka
Wizja komputerowa jest jednym z najczęściej dyskutowanych obszarów w branży AI, dzięki jej potencjalnym zastosowaniom w szerokim zakresie zadań w czasie rzeczywistym. W ostatnich latach, ramy wizji komputerowej znacznie się rozwinęły, a nowoczesne modele są w stanie analizować cechy twarzy, obiekty i wiele więcej w scenariuszach w czasie rzeczywistym. Pomimo tych możliwości, transfer ruchu ludzkiego pozostaje wyzwaniem dla modeli wizji komputerowej. Zadanie to polega na przenoszeniu ruchu twarzy i ciała z obrazu lub filmu źródłowego do obrazu lub filmu docelowego. Transfer ruchu ludzkiego jest powszechnie stosowany w modelach wizji komputerowej do stylizacji obrazów lub filmów, edycji multimediów, syntezy cyfrowej i nawet generowania danych dla ram percepcji.
W tym artykule skupiamy się na MagicDance, modelu opartym na dyfuzji, który ma rewolucjonizować transfer ruchu ludzkiego. Ramy MagicDance koncentrują się na przenoszeniu 2D wyrazów twarzy i ruchów na trudne filmy taneczne. Jego celem jest generowanie nowych sekwencji tanecznych dla określonych tożsamości docelowych, przy zachowaniu oryginalnej tożsamości. Ramy MagicDance wykorzystują strategię szkolenia dwuetapowego, koncentrując się na rozłączaniu ruchu ludzkiego i czynników wyglądu, takich jak odcień skóry, wyrazy twarzy i ubranie. Będziemy zgłębiać ramy MagicDance, eksplorując ich architekturę, funkcjonalność i wyniki w porównaniu z innymi ramami transferu ruchu ludzkiego. Zanurzmy się w tym.
MagicDance: Realistyczny Transfer Ruchu Ludzkiego
Jak wspomniano wcześniej, transfer ruchu ludzkiego jest jednym z najbardziej złożonych zadań wizji komputerowej ze względu na ogromną złożoność zaangażowaną w przenoszenie ruchu i wyrazów twarzy z obrazu lub filmu źródłowego do obrazu lub filmu docelowego. Tradycyjnie, ramy wizji komputerowej osiągały transfer ruchu ludzkiego, szkoląc model generatywny, w tym GAN lub Sieci Przeciwnicze, na zestawach danych docelowych dla wyrazów twarzy i pozycji ciała. Chociaż szkolenie i korzystanie z modeli generatywnych dają zadowalające wyniki w niektórych przypadkach, często cierpią na dwie główne ograniczenia.
- Opierają się mocno na składniku zginania obrazu, w wyniku czego często mają trudności z interpolacją części ciała niewidocznych w obrazie źródłowym, ze względu na zmianę perspektywy lub samozakrycie.
- Nie mogą uogólniać do innych obrazów pochodzących z zewnątrz, co ogranicza ich zastosowanie, szczególnie w scenariuszach w czasie rzeczywistym.

Nowoczesne modele dyfuzji wykazały wyjątkowe możliwości generowania obrazów w różnych warunkach, a modele dyfuzji są teraz w stanie prezentować potężne wizualizacje w szeregu zadań, takich jak generowanie filmów i wypełnianie luk w obrazach, ucząc się z zestawów obrazów na skalę sieci web. Dzięki swoim możliwościom, modele dyfuzji mogą być idealnym wyborem dla zadań transferu ruchu ludzkiego. Chociaż modele dyfuzji mogą być wdrożone w transferze ruchu ludzkiego, mają pewne ograniczenia, zarówno pod względem jakości generowanego treści, jak i zachowania tożsamości lub cierpią na niezgodności czasowe, wynikające z ograniczeń projektu modelu i strategii szkolenia. Ponadto, modele oparte na dyfuzji nie wykazują znaczącej przewagi nad ramami GAN pod względem uogólnialności.
Aby pokonać przeszkody stojące przed modelami dyfuzji i GAN w zadaniach transferu ruchu ludzkiego, deweloperzy wprowadzili MagicDance, nową ramę, która ma wykorzystać potencjał modeli dyfuzji w transferze ruchu ludzkiego, demonstrując bezprecedensowy poziom zachowania tożsamości, wyższą jakość wizualną i uogólnialność domen. Podstawowym pojęciem ramy MagicDance jest podzielenie problemu na dwa etapy: kontrolę wyglądu i kontrolę ruchu, dwie zdolności wymagane przez ramy dyfuzji do dostarczania dokładnych wyników transferu ruchu.

Powiększony obraz daje krótkie wprowadzenie do ramy MagicDance, a jak można zobaczyć, ramy wykorzystują model Stable Diffusion, a także wdrożenie dwóch dodatkowych komponentów: Model Kontroli Wyglądu i Sieć Kontroli Pozycji, gdzie pierwszy zapewnia wskazówki dotyczące wyglądu modelowi SD z obrazu referencyjnego za pomocą uwagi, a drugi zapewnia wskazówki dotyczące wyrazu/pozycji modelowi dyfuzji z warunkowanego obrazu lub filmu. Ramy również wykorzystują wieloetapową strategię szkolenia, aby nauczyć te podmoduły skutecznie, aby rozłączyć kontrolę pozycji i wyglądu.
Podsumowując, ramy MagicDance są
- Nową i skuteczną ramą, składającą się z rozłącznej kontroli pozycji i wstępnego szkolenia kontroli wyglądu.
- Ramy MagicDance są w stanie generować realistyczne wyrazy twarzy i ruchy ludzkie pod kontrolą warunków pozycji i obrazów referencyjnych lub filmów.
- Ramy MagicDance mają na celu generowanie treści ludzkiej spójnej z wyglądem, wprowadzając moduł uwagi wieloźródłowej, który zapewnia dokładne wskazówki dla ramy Stable Diffusion UNet.
- Ramy MagicDance mogą być również wykorzystane jako wygodne rozszerzenie lub wtyczka do ramy Stable Diffusion, a także zapewniają kompatybilność z istniejącymi wagami modelu, ponieważ nie wymaga dodatkowego dokształcania parametrów.
Ponadto, ramy MagicDance wykazują wyjątkowe zdolności uogólnialności zarówno dla wyglądu, jak i ruchu.
- Uogólnialność wyglądu: Ramy MagicDance wykazują wyższe zdolności, gdy chodzi o generowanie różnorodnych wyglądów.
- Uogólnialność ruchu: Ramy MagicDance mają również zdolność generowania szerokiego zakresu ruchów.
MagicDance: Cele i Architektura
Dla danego obrazu referencyjnego, czy to prawdziwego człowieka, czy stylizowanego obrazu, podstawowym celem ramy MagicDance jest wygenerowanie obrazu wyjściowego lub filmu warunkowanego na wejściu i wejściach pozycji {P, F}, gdzie P reprezentuje szkielet pozycji ludzkiej, a F reprezentuje punkty orientacyjne twarzy. Wygenerowany obraz wyjściowy lub film powinien zachować wygląd i tożsamość ludzi zaangażowanych, a także treści tła obecne w obrazie referencyjnym, przy zachowaniu pozycji i wyrazów określonych przez wejścia pozycji.
Architektura
Podczas szkolenia, ramy MagicDance są szkolone jako zadanie rekonstrukcji klatki, aby odtworzyć prawdę z obrazu referencyjnego i wejścia pozycji pochodzącego z tego samego filmu referencyjnego. Podczas testowania, aby osiągnąć transfer ruchu, wejście pozycji i obraz referencyjny pochodzą z różnych źródeł.
Całkowita architektura ramy MagicDance może być podzielona na cztery kategorie: wstępny etap, wstępne szkolenie kontroli wyglądu, rozłączna kontrola pozycji i moduł ruchu.
Wstępny Etap
Modele dyfuzji latentne, czyli LDM, reprezentują unikalnie zaprojektowane modele dyfuzji, które działają w przestrzeni latentnej, ułatwionej przez użycie autoenkodera, a ramy Stable Diffusion są godnymi uwagi przykładami LDM, które wykorzystują wektorowo skwantowaną wariancję autoenkodera i architekturę U-Net. Ramy Stable Diffusion wykorzystują transformator CLIP jako enkoder tekstu do przetwarzania wejść tekstowych, konwertując dane wejściowe tekstowe na załączniki. Faza szkolenia ramy Stable Diffusion naraża model na warunek tekstowy i obraz wejściowy, z procesem obejmującym kodowanie obrazu do latentnej reprezentacji i poddanie go określonej sekwencji kroków dyfuzji kierowanej przez metodę Gaussa. Wynikowa sekwencja daje głośną latentną reprezentację, która zapewnia standardową normalną dystrybucję, a głównym celem ramy Stable Diffusion jest oczyszczanie głośnych latentnych reprezentacji iteracyjnie w latentne reprezentacje.
Wstępne Szkolenie Kontroli Wyglądu
Jednym z głównych problemów oryginalnej ramy ControlNet jest jej niezdolność do kontroli wyglądu wśród przestrzennie zmiennych ruchów w sposób ciągły, chociaż tendencja do generowania obrazów z pozycjami podobnymi do tych w obrazie wejściowym, a ogólny wygląd jest wpływany głównie przez dane wejściowe tekstowe. Chociaż ta metoda działa, nie jest odpowiednia do zadań transferu ruchu, w których nie dane wejściowe tekstowe, ale obraz referencyjny służy jako podstawowe źródło informacji o wyglądzie.
Moduł wstępnego szkolenia kontroli wyglądu w ramach MagicDance jest zaprojektowany jako pomocnicza gałąź, aby zapewnić wskazówki dotyczące kontroli wyglądu w podejściu warstwa po warstwie. Zamiast polegać na danych wejściowych tekstowych, cały moduł koncentruje się na wykorzystaniu atrybutów wyglądu z obrazu referencyjnego, aby poprawić zdolność ramy do generowania cech wyglądu dokładnie, szczególnie w scenariuszach z złożonymi dynamikami ruchu. Ponadto, tylko model kontroli wyglądu jest szkolony podczas wstępnego szkolenia kontroli wyglądu.
Rozłączna Kontrola Pozycji
Prosta odpowiedź na kontrolę pozycji w obrazie wyjściowym polega na połączeniu wstępnie wytrenowanego modelu ControlNet z wstępnie wytrenowanym modelem kontroli wyglądu bez dalszego szkolenia. Jednakże, integracja może spowodować, że ramy będą miały trudności z kontrolą pozycji niezależną od wyglądu, co może prowadzić do rozbieżności między pozycjami wejściowymi a wygenerowanymi pozycjami. Aby rozwiązać tę rozbieżność, ramy MagicDance szkolą model sieci kontroli pozycji wspólnie z wstępnie wytrenowanym modelem kontroli wyglądu.
Moduł Ruchu
Gdy pracują razem, rozłączna sieć kontroli pozycji i model kontroli wyglądu mogą osiągnąć dokładny i skuteczny transfer obrazu na ruch, chociaż może to skutkować niezgodnością czasową. Aby zapewnić spójność czasową, ramy integrują dodatkowy moduł ruchu z podstawową architekturą Stable Diffusion UNet.
MagicDance: Wstępne Szkolenie i Zestawy Danych
Do wstępnego szkolenia, ramy MagicDance wykorzystują zestaw danych TikTok, który składa się z ponad 350 filmów tanecznych o różnej długości, między 10 a 15 sekund, pokazujących jedną osobę tańczącą, a większość z tych filmów zawiera twarz i górne części ciała ludzkiego. Ramy MagicDance wyodrębniają każdy film indywidualnie z częstotliwością 30 klatek na sekundę i uruchamiają OpenPose na każdej klatce, aby wywnioskować szkielet pozycji, pozycje rąk i punkty orientacyjne twarzy.
Do wstępnego szkolenia, model kontroli wyglądu jest wstępnie szkolony z rozmiarem partii 64 na 8 procesorach NVIDIA A100 przez 10 tysięcy kroków z rozmiarem obrazu 512 x 512, po czym wspólnie szkolą model kontroli pozycji i model kontroli wyglądu z rozmiarem partii 16 przez 20 tysięcy kroków. Podczas szkolenia, ramy MagicDance losowo wybierają dwa ramki jako cel i referencję, a obrazy są przycinane w tym samym położeniu i tej samej wysokości. Podczas oceny, model przycina obraz centralnie, zamiast przycinać go losowo.
MagicDance: Wyniki
Wyniki eksperymentalne przeprowadzone na ramach MagicDance są przedstawione na poniższym obrazie, a jak można zobaczyć, ramy MagicDance przewyższają istniejące ramy, takie jak Disco i DreamPose, w transferze ruchu ludzkiego we wszystkich metrykach. Ramy z gwiazdką przed nazwą używają obrazu docelowego bezpośrednio jako wejścia i zawierają więcej informacji w porównaniu z innymi ramami.

Interesujące jest to, że ramy MagicDance osiągają wynik Face-Cos na poziomie 0,426, co stanowi poprawę o 156,62% w porównaniu z ramą Disco i prawie 400% wzrost w porównaniu z ramą DreamPose. Wyniki wskazują na silną zdolność ram MagicDance do zachowania informacji o tożsamości i widocznego wzrostu wydajności, co wskazuje na wyższość ram MagicDance nad istniejącymi metodami najnowszymi.
Poniższe obrazy porównują jakość generowania filmów ludzkich między ramami MagicDance, Disco i TPS. Jak można zobaczyć, wyniki wygenerowane przez ramy GT, Disco i TPS cierpią na niezgodne tożsamości pozycji ludzkiej i wyrazy twarzy.

Ponadto, poniższy obraz demonstruje wizualizację transferu wyrazu twarzy i pozycji ludzkiej na zestawie danych TikTok, a ramy MagicDance są w stanie generować realistyczne i żywe wyrazy i ruchy pod różnymi punktami orientacyjnymi twarzy i szkieletem pozycji, przy zachowaniu informacji o tożsamości z obrazu referencyjnego.

Warto zauważyć, że ramy MagicDance posiadają wyjątkowe zdolności uogólnialności do obrazów referencyjnych poza domeną z nieznanymi stylami i pozycjami, z imponującą kontrolą wyglądu, nawet bez dodatkowego szkolenia na domenie docelowej, a wyniki są przedstawione na poniższym obrazie.

Poniższe obrazy demonstrują możliwości wizualizacji ram MagicDance w zakresie transferu wyrazu twarzy i ruchu ludzkiego. Jak można zobaczyć, ramy MagicDance uogólniają się idealnie do ruchów ludzkich w terenie.

MagicDance: Ograniczenia
OpenPose jest istotnym składnikiem ram MagicDance, ponieważ odgrywa kluczową rolę w kontroli pozycji, wpływając znacząco na jakość i spójność czasową generowanych obrazów. Jednak ramy MagicDance nadal mają trudności z wykrywaniem punktów orientacyjnych twarzy i szkieletu pozycji dokładnie, szczególnie gdy obiekty na obrazach są częściowo widoczne lub wykazują szybki ruch. Te problemy mogą skutkować artefaktami w generowanym obrazie.
Podsumowanie
W tym artykule omówiliśmy ramy MagicDance, model oparty na dyfuzji, który ma rewolucjonizować transfer ruchu ludzkiego. Ramy MagicDance próbują przenieść 2D wyrazy twarzy i ruchy na trudne filmy taneczne, z celem generowania nowych sekwencji tanecznych dla określonych tożsamości docelowych, przy zachowaniu tożsamości stałej. Ramy MagicDance są dwuetapową strategią szkolenia dla rozłączania ruchu ludzkiego i wyglądu, takiego jak odcień skóry, wyrazy twarzy i ubranie.
Ramy MagicDance są nowym podejściem do generowania realistycznych filmów ludzkich, wykorzystując transfer wyrazu twarzy i ruchu, oraz umożliwiając spójną animację w terenie bez potrzeby dalszego szkolenia, co stanowi znaczący postęp w porównaniu z istniejącymi metodami. Ponadto, ramy MagicDance wykazują wyjątkowe zdolności uogólnialności nad złożonymi sekwencjami ruchu i różnorodnymi tożsamościami ludzkimi, ustanawiając ramy MagicDance jako lidera w dziedzinie wspomagania transferu ruchu i generowania filmów za pomocą AI.












