Kąt Andersona
W kierunku ciągłej pełnej generacji filmów z głębokimi fałszerstwami

W dziedzinie, w której wymagana jest cierpliwość, nowy system zbliża nas nieco bardziej do nażywania symulacji ludzkiej bez frustrujących rund renderowania.
Stan sztuki w pełnej symulacji ludzkiej przeszedł długą drogę od momentu, gdy pojawiła się możliwość pełnych fałszerstw ciała po raz pierwszy w 2022 roku. Do tej pory przyzwyczailiśmy się do imponującej i często kontrowersyjnej zdolności systemów open source, takich jak Wan-Animate, oraz systemów zamkniętych, takich jak Grok, do konwertowania pojedynczych lub wielu obrazów w spójną i często przekształcającą wydajność wideo:
Kliknij, aby odtworzyć, jeśli jest to konieczne. Przykłady zastąpienia osoby za pomocą WanAnimate-2.2. Odwołaj się do źródła, aby uzyskać lepszą rozdzielczość. Źródło
Ponadto starszy autoencoder-based framework do fałszerstw twarzy w czasie rzeczywistym DeepFaceLive został już przewyższony przez bardziej zaawansowane ramy, takie jak Deep-Live-Cam, które wykorzystują orkiestrację LivePortrait iteracji, a także moduły legacy GAN i InsightFace, aby stworzyć skutecznego następcę projektu (porzuconego) DFLive:
Kliknij, aby odtworzyć: Elon Musk sfabrykowany w sesji wideo na żywo za pomocą Deep-Live-Cam. Odwołaj się do źródła, aby uzyskać lepszą rozdzielczość. Źródło
Jednakże, podczas gdy ramy takie jak Deep-Live-Cam mogą działać nieprzerwanie i fałszować nieprzerwanie, i chociaż są lepsze w generowaniu trudnych kątów twarzy niż dawniej, wyniki są jednak ograniczone pod względem rozdzielczości i możliwości: można uzyskać określoną twarz/tożsamość, i może wykonać wiele rzeczy, takich jak przekonywujące wyrażenia twarzy i synchronizacja ust – ale jest to podstawowo koń z jednym trikiem.
BRB…
Większość obecnej generacji systemów naśladujących ludzi jest podobnie ograniczona i/lub “wyspecjalizowana”. Jednym z częstych ograniczeń jest to, że najlepsze systemy symulacji/naśladujące ludzi są offline – to znaczy, że są zbyt wymagające, aby działać w czasie rzeczywistym, i zamiast tego muszą odejść, obliczyć rozwiązanie, i przedstawić wynik użytkownikowi później.
Oczywiście takie systemy są niewłaściwe dla nażywania AI transmutacji, takiej jak transformacja całego zakresu ruchu ciała, jak taniec, w strumieniu na żywo.
Przykładem tego w ostatnich latach jest starszy autoencoder-based system DeepFaceLive, który został już przewyższony przez bardziej zaawansowane ramy, takie jak Deep-Live-Cam, które wykorzystują orkiestrację LivePortrait iteracji, a także moduły legacy GAN i InsightFace, aby stworzyć skutecznego następcę projektu (porzuconego) DFLive:
Kliknij, aby odtworzyć: Elon Musk sfabrykowany w sesji wideo na żywo za pomocą Deep-Live-Cam. Odwołaj się do źródła, aby uzyskać lepszą rozdzielczość. Źródło
Jednakże, podczas gdy ramy takie jak Deep-Live-Cam mogą działać nieprzerwanie i fałszować nieprzerwanie, i chociaż są lepsze w generowaniu trudnych kątów twarzy niż dawniej, wyniki są jednak ograniczone pod względem rozdzielczości i możliwości: można uzyskać określoną twarz/tożsamość, i może wykonać wiele rzeczy, takich jak przekonywujące wyrażenia twarzy i synchronizacja ust – ale jest to podstawowo koń z jednym trikiem.
LiveAnimate
W tym meksykańskim impasie pojawia się nowa oferta z Chin, która skutecznie przekształca Wan2.2 Animate w ramy animacji na żywo, działające obecnie z szanowaną szybkością prawie 20 klatek na sekundę, z imponującymi wynikami w różnych scenariuszach:
Kliknij, aby odtworzyć: Z projektu, LiveAnimate przenosi pozycje sterujące przez taniec scenic, pełne ciało na zewnątrz i portret w pobliżu, odtwarzając całe ciało, rękę i ruch twarzy. Odwołaj się do źródła, aby uzyskać lepszą rozdzielczość. Źródło
Nowa praca rozszerza oryginalny system w wersję na żywo, zmieniając jak wideo jest generowane: zamiast przetwarzania klatek przeszłych i przyszłych razem, LiveAnimate generuje każdy nowy segment, gdy akcja się rozgrywa, używając tylko kilku kroków, podczas gdy zachowuje wybrane wcześniejsze pozycje, aby zachować spójny wygląd podmiotu w długich sesjach.
Skutecznie, system zachowuje wcześniejsze klatki jako metodę trwałej pamięci, aby czerpać z niej, gdy wideo się rozwija, tak że tożsamość pozostaje spójna – nie całkiem inaczej niż stare systemy CGI, które odwołują się do map tekstur.
Chociaż LoRA jest zaangażowany na etapie przetwarzania, LiveAnimate nie jest po prostu kolejnym systemem LoRA – jego generowanie strumieniowe, system pamięci/pamięci podręcznej, trzystopniowa inferencja i optymalizacje GPU reprezentują dodatkowe mechanizmy, ponadto różne inne technologie (niektóre niespodzianie stare) w jego repertuarze.
Nowy system może radzić sobie nie tylko z pełnymi scenariuszami sterowania ciałem, takimi jak te w powyższych przykładach, ale także z ruchami górnej części ciała, takimi jak w scenariuszach wywiadu:
Kliknij, aby odtworzyć. ‘Delikatny ruch głowy i ręki nad statyczną sceną biurową’.
Biorąc pod uwagę jego ograniczenia, nowy artykuł przyznaje, że dwa z rywalizujących frameworków testowanych z LiveAnimate były w stanie zachować tożsamość nieco lepiej w określonych okolicznościach; powiedziano, że żaden z rywali nie jest systemem online, a autorzy nowej pracy wyraźnie pchają granice w przekonywującym i optymistycznym kierunku.
Ponadto może być warte odnotowania, że inferencja wymaga dwóch kart graficznych H100 NVIDIA, łącznie 160 GB pamięci VRAM*.
Artykuł stwierdza:
‘LiveAnimate utrzymuje prawie stałą jakość percepcyjną i tożsamość od pierwszych 30 sekund do ostatniej [minuty], podczas gdy poprzednie systemy ulegają znacznemu pogorszeniu lub wymagają godzin obliczeń offline na ten sam rollout.
‘Te wyniki ustanawiają nowy punkt operacyjny pod względem jakości, opóźnienia i czasu trwania dla interaktywnej animacji pełnego ciała.’
Nowy artykuł nowy artykuł nosi tytuł LiveAnimate: Stabilna długa forma strumieniowej animacji ludzkiej w czasie rzeczywistym, i pochodzi od dziewięciu autorów z Chińskiego Uniwersytetu w Hongkongu, Qwen Applications Business Group of Alibaba, i Liblib AI. Strona projektu, zawierająca filmy również przedstawione w tym artykule, jest również dostępna, podczas gdy kod jest ‘wkrótce’, a wagi… kto wie?
Metoda
LiveAnimate składa się z dwuetapowego procesu szkolenia, zaprojektowanego w celu uczynienia Wan2.2-Animate generującym nieprzerwanie i szybko, a następnie systemu pamięci, który odzyskuje przydatne wcześniejsze pozycje, gdy każdy nowy blok wideo jest generowany:
Przegląd potoku LiveAnimate, pokazujący jego dwuetapowy proces szkolenia po lewej stronie i generowanie na żywo po prawej stronie, gdzie nadchodzące pozycje są dopasowane do przechowywanych wcześniejszych pozycji i łączone z ostatnimi klatkami, aby wygenerować każdy nowy blok wideo w trzech krokach. Źródło
Oryginalny Wan2.2-Animate jest zaprojektowany tak, aby rozważać całą sekwencję, a nie generować nieograniczoną wideo. Dlatego autorzy podzielili filmy szkoleniowe na następujące bloki, z których każdy jest generowany przy użyciu wcześniejszych bloków jako kontekstu/podstawy prawdy. To początkowo uczy model, aby kontynuować od niezawodnego wcześniejszego materiału, zanim będzie musiał radzić sobie z błędami nagromadzonymi z własnej produkcji.
Zapomnij mnie
W trakcie tego procesu oryginalny obraz odniesienia jest zachowany na zawsze dostępny za pomocą ‘Ref Sink’, zapewniając stałą przypomnienie o tożsamości i wyglądzie osoby. Gdy blok zostanie ukończony, ‘Clean KV Update’ konwertuje informacje uzyskane z niego w historyczny kontekst dla następnych bloków (chociaż nie naprawia już istniejących błędów).
Ten pierwszy etap szkolenia wciąż wymaga 50 kroków odwracania szumu na blok, co sprawia, że operacja na żywo jest niepraktyczna. Drugi etap destyluje proces do trzech kroków, podczas gdy model jest narażony na własną generowaną historię, ponieważ wdrożenie wymaga, aby każdy nowy segment zależał od niedoskonałego wcześniejszego wyjścia:
Dwa etapy szkolenia używane do przygotowania LiveAnimate do wdrożenia, najpierw ucząc się z czystych wcześniejszych bloków wideo – a następnie redukując generowanie do trzech kroków, podczas gdy model jest szkolony na własnym niedoskonałym wyjściu.
Szkolenie z tymi samymi sekwencjami generowanymi przedstawia kolejny problem, ponieważ zachowanie całej historii obliczeniowej wideo byłoby zbyt drogie. Zamiast tego, wykonuje się jeden pełny przebieg, a następnie odwiedza się go ponownie, blok po bloku, do szkolenia. Każy blok może otrzymać aktualizację bez utrzymania całej sekwencji komputacyjnie “na żywo”.
W połączeniu z adaptacją LoRA pozwala to 14-miliardowemu modelowi na destylację na jednym węźle zawierającym osiem kart graficznych H100 o pojemności 80 GB (zauważając, że ten klaster jest do szkolenia, a nie do inferencji w czasie wykonywania).
Nie przestawaj teraz
Dla nieograniczonej generacji LiveAnimate musi również zdecydować, co warto pamiętać. Zachowanie wszystkiego spowodowałoby, że wymagania dotyczące przetwarzania wzrosłyby niekontrolowanie; ale zachowanie tylko ostatnich klatek mogłoby również odrzucić przydatne wcześniejsze widoki.
Dlatego Pose-Retrieval Sink Attention (PR-Sink) rozwiązuje ten problem, zachowując pierwszy wygenerowany blok jako stały ‘Static Sink’ – wcześniejszą pozycję, działającą jako zastępowalny ‘Dynamic Sink’, i okno przewijane zawierające bieżący i dwa poprzednie bloki. Obraz odniesienia pozostaje oddzielnie dostępny za pomocą Ref Sink, podczas gdy stałe rozmiary pamięci zapobiegają wzrostowi kosztów wraz ze wzrostem długości wideo.
Wojny bloków
Aby wybrać starsze pozycje do tej ograniczonej pamięci, ViTPose redukuje pozycje ciała i ręki w trzech klatkach do zwartej reprezentacji. Pamięć-bank zawiera pięć takich reprezentatywnych pozycji i jest zaludniony podczas pierwszych 20 bloków, faworyzując zróżnicowane pozycje nad niemal duplikatami.
Podczas generowania, nadchodząca pozycja jest porównywana z tymi reprezentatywnymi i najbliższe dopasowanie jest odzyskiwane, zapewniając wcześniejsze dowody, jak osoba wyglądała w podobnej pozycji. Jednakże, bezpośrednio poprzedzający blok jest wykluczony, ponieważ już istnieje w oknie przewijanym, pozostawiając Dynamic Sink wolny do odzyskania informacji z dalszych części.
Wreszcie, sam czas wykonywania jest zoptymalizowany pod kątem szybkości przez rozkładanie przetwarzania uwagi na dwa procesory graficzne H100, nakładanie komunikacji na obliczenia i ponowne wykorzystywanie buforowanej informacji, gdziekolwiek jest to możliwe.
Dane i testy
LiveAnimate został przeszkolony na 40 000 filmów z AVSpeech, i 20 000 filmów z ludzkim ruchem z TikTok dataset i HumanVid, z szkoleniem i inferencją obsługującymi rozdzielczości 480×480; 384×672; i 672×384 pikseli.
Szkolenie rozpoczęło się od punktu startowego Wan2.2-Animate-14B, przy użyciu LoRA z rangą 128, i trwało na ośmiu procesorach graficznych H100 przez 10 000 kroków w pierwszym etapie, i 20 000 w drugim.
Wideo zostało wygenerowane w blokach trzech klatek latentnych (wewnętrznej reprezentacji modelu), co odpowiada 12 klatkom RGB, podczas gdy inferencja była wykonywana na dwóch H100.
Ocena porównywała LiveAnimate z istniejącymi metodami animacji sterowanymi pozycją w krótkich i długich sekwencjach, przy użyciu obrazów odniesienia i pozycji sterujących w spójnych ustawieniach. Testy długoterminowe przedłużyły generację do trzech minut, aby sprawdzić, czy jakość i tożsamość pozostają stabilne w czasie.
Przetestowane ramy to EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; i Wan2.2-Animate.
Metryki obejmowały jakość wizualną, spójność tożsamości, jakość dystrybucyjną i błąd reprezentacji czasowej. Wynik estetyczny (ASE) i ocena jakości obrazu bez odniesienia (IQA) mierzyły jakość wizualną na poziomie klatki; DINO, podobieństwo (DINO-S), i spójność wyglądu z tożsamością odniesienia; Fréchet Inception Distance (FID), jakość dystrybucyjna; i odległość cech VideoMAE (V-MAE), jak dobrze wygenerowane wideo zachowało ruch w czasie:

Wyniki testów dotyczące jakości i tożsamości w ciągu trzech minut ciągłej generacji, z LiveAnimate pozostającym względnie stabilnym we wszystkich pięciu metrykach, gdy sekwencja postępuje. Kilka metod porównawczych wykazuje większe pogorszenie w czasie. Wyższe odczyty są lepsze dla IQA, ASE i DINO-S, z niższymi odczytami lepszymi dla FID i V-MAE.
Podobnie jak widać w wykresie wyników powyżej, LiveAnimate osiągnął najwyższy początkowy wynik ASE o wartości 2,823, i IQA o wartości 4,047, w ciągu pierwszych 30 sekund. Autorzy twierdzą, że to wskazuje, że trzystopniowa destylacja zachowuje jakość percepcyjną, pomimo zmniejszonego budżetu inferencji.
Bardziej znacząco, LiveAnimate wykazał niewielkie pogorszenie w ciągu trzech minut ciągłej generacji, z wynikami jakości wizualnej i spójności tożsamości pozostającymi prawie niezmienionymi.
Odwrócenie, One-to-All uległo znacznemu pogorszeniu w czasie, z niższą jakością wizualną i spójnością tożsamości, oraz wyższym błędem dystrybucyjnym; i podstawowy Wan2.2-Animate również wykazał pewne utraty spójności tożsamości.
Autorzy stwierdzają:
‘Te trendy wspierają nasze centralne twierdzenie, że jawne zarządzanie kontekstem długoterminowym jest ważne dla strumieniowej animacji.’
Wydajność skalowania LiveAnimate została również przetestowana na procesorach graficznych. Jak widać poniżej, 12,41 klatek na sekundę zostało osiągnięte z jednym H100; 19,63 klatek na sekundę z dwoma; i 22,13 klatek na sekundę z czterema, przy czym zyski stawały się coraz bardziej ograniczone przez opóźnienie komunikacji. Dwa H100 zostały wybrane jako preferowana konfiguracja:

Wydajność skalowania na jednym, dwóch i czterech procesorach graficznych H100 w rozdzielczości 480×480, pokazując opóźnienie, szybkość klatek, przyrost i wydajność. Dwa procesory graficzne osiągnęły 19,63 klatki na sekundę, podczas gdy dalsze skalowanie do czterech spowodowało tylko niewielki wzrost do 22,13 klatek na sekundę.
Przy 19,63 klatkach na sekundę, każdy 12-klatkowy blok został wygenerowany w 0,611 sekund. Dla porównania, około 2–5 godzin było wymaganych przez systemy porównawcze, aby wygenerować tę samą trzyminutową sekwencję.
Testy jakościowe wykazały podobne różnice: w teście pełnego ciała, przedstawionym poniżej, zaobserwowano ciężkie pogorszenie w One-to-All; migotanie zostało wyprodukowane przez UniAnimate-DiT i SCAIL; i późniejsze przesunięcie koloru lub tła stało się widoczne w Wan-Animate i EverAnimate.

Wyniki testów porównawczych animacji pełnego ciała w ciągu trzech minut. Klatki zostały pobrane co 20 sekund, z czerwonymi adnotacjami wskazującymi długoterminowe pogorszenie w metodach porównawczych. Proszę odwołać się do źródła, aby uzyskać lepszą rozdzielczość.
LiveAnimate utrzymywał wygląd podmiotu i otaczającej sceny w ciągu trzech minut sekwencji. W mniej wymagającym teście górnej części ciała, przedstawionym poniżej, porównywalna długoterminowa stabilność została osiągnięta przez EverAnimate i LiveAnimate (chociaż generowanie w czasie rzeczywistym zostało dostarczone tylko przez LiveAnimate):

Wyniki testów porównawczych animacji górnej części ciała w ciągu trzech minut. Klatki pobrane co 20 sekund pokazują LiveAnimate, który utrzymuje tożsamość, ubranie i ciemne tło w sposób bardziej spójny niż metody porównawcze.
Autorzy kończą:
‘Na benchmarku trzech minut LiveAnimate utrzymuje prawie stałą jakość percepcyjną i tożsamość przy 19,63 klatkach na sekundę na dwóch procesorach graficznych H100, z pamięcią i opóźnieniem niezależnym od długości strumienia, podczas gdy systemy porównawcze offline ulegają widocznemu pogorszeniu lub wymagają godzin obliczeń.
‘Te wyniki przybliżają modele dyfuzji wideo o skali miliarda do zasięgu aplikacji interaktywnych, takich jak transmisja na żywo, teleobecność i awatary wirtualne.’
Podsumowanie
To zachęcające, że framework generowania na żywo podejmuje nowe podejście do trwałych problemów pamięci i tożsamości, które dotknęły generatywne wideo. Istnieje już wiele ram generatywnych, które mogą odnosić się do stałych obrazów dostarczonych przez użytkownika, bez potrzeby “wklejenia” obrazu odniesienia do podstawowego obrazu wideo:
Jednakże, to rozwiązuje tylko niektóre problemy generowania jednego klipu wideo, takiego jak utrzymanie tożsamości (w tym ubranie i fryzurę) osoby, która ponownie wchodzi na klatkę, lub która została chwilowo zakryta, a następnie jest widziana ponownie. Do tej pory tylko podejście LoRA, które jest ciężkie i nudne i tymczasowe, zrobiło jakiekolwiek postępy w tych kwestiach, chociaż ograniczone i tymczasowe.
Dla wideo, a w rzeczywistości dla całej obecnej rewolucji AI, rozwój skutecznej pamięci trwałej jest krytycznym, egzystencjalnym problemem – który prawdopodobnie zdefiniuje różnicę między pojawieniem się AGI, a trzecią zimą AI.
* Czy to jest już “haczyk”? Obecne myślenie polega na tym, że mniejsze, wyspecjalizowane modele mogą ostatecznie działać lokalnie, bez opłat, podczas gdy wyższe potrzeby są obsługiwane przez konkurencyjny i nadzieję, że zbałkanizowany rynek wynajmu GPU. Zakłada to, że firmy pionierskie nie EEE konkurencji, i że znaczna obliczeniowa moc GPU pozostanie dostępna niezależnie. Na tej podstawie nie uważam już rażących wymagań GPU za demerit, ale mam nadzieję, że dostęp stanie się coraz bardziej demokratyczny, i że późniejsze optymalizacje zmniejszą początkowe wymagania dotyczące zasobów.
† Wygenerowane przez AI i sprawdzane przeze mnie.
†† Dla testów długich wideo, SCAIL i UniAnimate-DiT zostały rozszerzone o tę samą procedurę przesuwania okna bez szkolenia, ponieważ żaden z nich nie obsługuje natywnie generacji długiej formy.
Publikowane po raz pierwszy w czwartek, 13 sierpnia 2026












