Modele i platformy AI

DynamiCrafter: Animacja obrazów otwartych domen z wykorzystaniem priorytetów dyfuzji wideo

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Wizja komputerowa jest jednym z najbardziej interesujących i najlepiej zbadanych dziedzin w społeczności AI, a pomimo szybkiej poprawy modeli wizji komputerowej, długotrwałym wyzwaniem, które nadal niepokoi deweloperów, jest animacja obrazów. Nawet dzisiaj, ramy animacji obrazów mają trudności z przekształceniem statycznych obrazów w ich odpowiedniki wideo, które wyświetlają naturalną dynamikę, zachowując oryginalny wygląd obrazów. Tradycyjnie, ramy animacji obrazów koncentrują się głównie na animowaniu naturalnych scen z domenowo-specyficznymi ruchami, takimi jak ruchy ludzkich włosów lub ciała, lub stochastycznymi dynamikami, takimi jak płyny i chmury. Chociaż ten podejście działa do pewnego stopnia, ogranicza ono stosowalność tych ram animacji do bardziej ogólnych treści wizualnych.

Ponadto, konwencjonalne podejścia do animacji obrazów koncentrują się głównie na syntezie oscylujących i stochastycznych ruchów, lub na dostosowaniu do określonych kategorii obiektów. Jednakże, znaczącą wadą tego podejścia jest to, że nakłada ono silne założenia, które ostatecznie ograniczają ich stosowalność, zwłaszcza w ogólnych scenariuszach, takich jak animacja obrazów otwartych domen. W ciągu ostatnich kilku lat, modele T2V lub Text to Video wykazały znaczący sukces w generowaniu żywych i zróżnicowanych wideo przy użyciu podpowiedzi tekstowych, a to właśnie te modele T2V stanowią podstawę dla ramy DynamiCrafter.

Rama DynamiCrafter jest próbą przezwyciężenia obecnych ograniczeń modeli animacji obrazów i rozszerzenia ich stosowalności do ogólnych scenariuszy z udziałem obrazów otwartych domen. Rama DynamiCrafter próbuje syntetyzować dynamiczną zawartość dla obrazów otwartych domen, przekształcając je w animowane wideo. Kluczową ideą ramy DynamiCrafter jest włączenie obrazu jako wskazówki do procesu generatywnego, próbując wykorzystać priorytet ruchu już istniejących modeli dyfuzji wideo. Dla danego obrazu, model DynamiCrafter najpierw wdraża transformator zapytania, który projekuje obraz na bogatą przestrzeń reprezentacji kontekstu, ułatwiając modelowi wideo trawienie zawartości obrazu w sposób kompatybilny. Jednakże, model DynamiCrafter nadal ma trudności z zachowaniem niektórych szczegółów wizualnych w wynikowych wideo, problem, który model DynamiCrafter rozwiązuje, podając pełny obraz do modelu dyfuzji, łącząc obraz z początkowymi szumami, tym samym uzupełniając model o bardziej precyjną informację o obrazie.

Artykuł ten ma na celu omówienie ramy DynamiCrafter w szczegółach, a my badamy mechanizm, metodologię, architekturę ramy wraz z porównaniem z najlepszymi ramami generacji obrazów i wideo. Zatem, zacznijmy.

DynamiCrafter: Animacja obrazów otwartych domen

Animowanie statycznego obrazu często oferuje angażujące wizualne doświadczenie dla widza, ponieważ wydaje się ożywiać statyczny obraz. Na przestrzeni lat, wiele ram próbowało różnych metod animowania statycznych obrazów. Początkowe ramy animacji wdrożyły podejścia oparte na symulacji fizycznej, które koncentrowały się na symulowaniu ruchu określonych obiektów. Jednakże, ze względu na niezależne modelowanie każdej kategorii obiektów, te podejścia nie były skuteczne ani nie miały ogólności. Aby odtworzyć bardziej realistyczne ruchy, pojawiły się metody oparte na odniesieniu, które przenosiły informację o ruchu lub wyglądzie z sygnałów odniesienia, takich jak wideo, do procesu syntezy. Chociaż metody oparte na odniesieniu dostarczyły lepsze wyniki z lepszą spójnością czasową w porównaniu z podejściami opartymi na symulacji, wymagały one dodatkowych wskazówek, co ograniczało ich praktyczne zastosowania.

W ostatnich latach, większość ram animacji koncentruje się głównie na animowaniu naturalnych scen z stochastycznymi, domenowo-specyficznymi lub oscylującymi ruchami. Chociaż podejście wdrożone przez te ramy działa do pewnego stopnia, wyniki, które generują, nie są zadowalające, z znaczącą możliwością poprawy. Znakomitych wyników osiągniętych przez modele generatywne Text to Video w ciągu ostatnich kilku lat, zainspirowało twórców ramy DynamiCrafter do wykorzystania potężnych możliwości generatywnych modeli Text to Video do animacji obrazów.

Kluczową podstawą ramy DynamiCrafter jest włączenie warunkowego obrazu w celu zarządzania procesem generacji wideo modeli dyfuzji wideo. Jednakże, ostatecznym celem animacji obrazu nadal pozostaje nie trywialne, ponieważ animacja obrazu wymaga zachowania szczegółów oraz zrozumienia kontekstu wizualnego niezbędnego do tworzenia dynamiki. Jednakże, wielomodalne kontrolowane modele dyfuzji wideo, takie jak VideoComposer, próbowały umożliwić generację wideo z wizualną wskazówką z obrazu. Jednakże, te podejścia nie są odpowiednie do animacji obrazu, ponieważ skutkują one nagłymi zmianami czasowymi lub niską zgodnością wizualną z obrazem wejściowym, ze względu na ich mniej kompleksowe mechanizmy wstrzyknięcia obrazu. Aby przeciwdziałać temu problemowi, rama DynamiCrafter proponuje podwójne podejście wstrzyknięcia, składające się z wskazówek szczegółów wizualnych i reprezentacji kontekstu wyalignowanego z tekstem. Podejście podwójnego wstrzyknięcia pozwala ramie DynamiCrafter zapewnić, że model dyfuzji wideo syntetyzuje dynamiczną zawartość z zachowaniem szczegółów w sposób uzupełniający.

Dla danego obrazu, rama DynamiCrafter najpierw projekuje obraz na przestrzeń reprezentacji kontekstu wyalignowanego z tekstem, przy użyciu specjalnie zaprojektowanej sieci uczenia kontekstu. Aby być bardziej precyzyjnym, przestrzeń reprezentacji kontekstu składa się z learnable transformatora zapytania, który dodatkowo promuje jego adaptację do modeli dyfuzji, oraz pre-trenowanego encodera obrazu CLIP, który wyodrębnia cechy obrazu wyalignowane z tekstem. Następnie model wykorzystuje bogate cechy kontekstu przy użyciu warstw uwagi krzyżowej, a model wykorzystuje połączenie bramkowe, aby połączyć te cechy tekstu z warstwami uwagi krzyżowej. Jednakże, to podejście wymienia nauczone reprezentacje kontekstu z wizualnymi szczegółami wyalignowanymi z tekstem, co ułatwia zrozumienie semantyczne kontekstu obrazu, pozwalając na syntezę rozsądnych i żywych dynamik. Ponadto, w celu uzupełnienia dodatkowych szczegółów wizualnych, rama łączy pełny obraz z początkowym szumem do modelu dyfuzji. W rezultacie, podejście podwójnego wstrzyknięcia wdrożone przez ramę DynamiCrafter gwarantuje zgodność wizualną, a także dynamiczną zawartość, która jest spójna z obrazem wejściowym.

Przechodząc dalej, modele dyfuzji lub DM wykazały znaczące osiągnięcia i możliwości generatywne w generowaniu obrazów z tekstu. Aby odtworzyć sukces modeli T2I w generowaniu wideo, proponowane są modele dyfuzji wideo, które wykorzystują architekturę U-Net z czynnikową przestrzenią, aby modelować niskiej rozdzielczości wideo. Przeniesienie wiedzy z modeli T2I do modeli T2V pomoże w zmniejszeniu kosztów szkolenia. Chociaż modele dyfuzji wideo mają możliwość generowania wysokiej jakości wideo, akceptują one tylko podpowiedzi tekstowe jako jedyne wskazówki semantyczne, które mogą nie odzwierciedlać prawdziwych intencji użytkownika lub mogą być niejasne. Jednakże, wyniki większości modeli VDM rzadko przypominają obraz wejściowy i cierpią na problem nierzeczywistej zmiany czasowej. Podejście DynamiCrafter opiera się na modelach dyfuzji wideo warunkowanych tekstem, które wykorzystują ich bogaty priorytet dynamiczny do animowania obrazów otwartych domen. Robi to, wdrażając dostosowane projekty w celu lepszego zrozumienia semantycznego i zgodności z obrazem wejściowym.

DynamiCrafter: Metoda i Architektura

Dla danego statycznego obrazu, rama DynamiCrafter próbuje animować obraz do wideo, tj. wyprodukować krótki klip wideo. Klip wideo dziedziczy zawartość wizualną z obrazu i wyświetla naturalną dynamikę. Jednakże, istnieje możliwość, że obraz może pojawić się w dowolnej lokalizacji wynikowej sekwencji klatek. Pojawienie się obrazu w dowolnej lokalizacji jest specyficznym wyzwaniem obserwowanym w zadaniach generacji wideo warunkowanej obrazem z wysokimi wymogami zgodności wizualnej. Rama DynamiCrafter pokonuje to wyzwanie, wykorzystując priorytety generatywne pre-trenowanych modeli dyfuzji wideo.

Dynamika obrazu z priorytetem dyfuzji wideo

Zwykle, otwarte modele dyfuzji wideo warunkowane tekstem są znane z wyświetlania dynamicznej zawartości wizualnej, uwarunkowanej opisami tekstowymi. Aby zanimować statyczny obraz z generatywnymi priorytetami Text to Video, ramy muszą najpierw wstrzyknąć informację wizualną do procesu generacji wideo w sposób kompleksowy. Ponadto, do syntezy dynamicznej, model T2V musi strawić obraz do zrozumienia kontekstu, a także musi być w stanie zachować szczegóły wizualne w generowanych wideo.

Reprezentacja kontekstu wyalignowana z tekstem

Aby kierować generacją wideo z kontekstem obrazu, rama DynamiCrafter próbuje projekować obraz na wyrównaną przestrzeń osadzania, pozwalając modelowi wideo wykorzystać informację o obrazie w sposób kompatybilny. Następnie rama DynamiCrafter wykorzystuje encoder obrazu, aby wyodrębnić cechy obrazu z obrazu wejściowego, ponieważ osadzanie tekstu jest generowane przy użyciu pre-trenowanego encodera tekstu CLIP. Teraz, chociaż globalne tokeny semantyczne z encodera obrazu CLIP są wyrównane z podpisami obrazu, reprezentują one głównie zawartość wizualną na poziomie semantycznym, nie ujmując pełnego zakresu obrazu. Rama DynamiCrafter wdraża pełne tokeny wizualne z ostatniej warstwy encodera CLIP, aby wyodrębnić więcej kompletnych informacji, ponieważ te tokeny wizualne wykazują wysoką wierność w zadaniach generacji obrazów warunkowanych. Ponadto, rama wykorzystuje osadzanie kontekstu i tekstu, aby współdziałać z warstwami pośrednimi U-Net przy użyciu podwójnych warstw uwagi krzyżowej. Projekt tego komponentu ułatwia modelowi absorbowanie warunków obrazu w sposób zależny od warstwy. Ponadto, ponieważ warstwy pośrednie architektury U-Net są bardziej związane z pozami obiektów lub kształtami, można oczekiwać, że cechy obrazu będą wpływać na wygląd wideo, zwłaszcza że warstwy końcowe są bardziej związane z wyglądem.

Wskazówki szczegółów wizualnych

Rama DynamiCrafter wykorzystuje bogatą reprezentację kontekstu, która pozwala modelowi dyfuzji wideo w swojej architekturze generować wideo, które przypominają obraz wejściowy. Jednakże, jak pokazano na poniższym obrazie, generowana zawartość może wyświetlać pewne niezgodności ze względu na ograniczoną możliwość pre-trenowanego encodera CLIP do pełnego zachowania informacji wejściowych, ponieważ został on zaprojektowany do wyrównania cech języka i wizualnych.

Aby poprawić zgodność wizualną, rama DynamiCrafter proponuje dostarczenie modelowi dyfuzji wideo dodatkowych szczegółów wizualnych wyodrębnionych z obrazu wejściowego. Aby to osiągnąć, model DynamiCrafter łączy warunkowy obraz z początkowym szumem na klatkę i podaje je do składnika U-Net jako wskazówkę.

Paradygmat szkolenia

Rama DynamiCrafter integruje warunkowy obraz przez dwa komplementarne strumienie, które odgrywają znaczącą rolę w wskazówkach szczegółów i kontroli kontekstu. Aby ułatwić to, model DynamiCrafter wykorzystuje trzystopniowy proces szkolenia

  1. W pierwszym kroku, model trenuje sieć reprezentacji kontekstu.
  2. W drugim kroku, model adaptuje sieć reprezentacji kontekstu do modelu Text to Video.
  3. W trzecim i ostatnim kroku, model doskonali sieć reprezentacji kontekstu łącznie z komponentem Wskazówek Szczegółów Wizualnych.

Aby dostosować informację o obrazie do kompatybilności z modelem T2V, rama DynamiCrafter sugeruje rozwinięcie sieci reprezentacji kontekstu, P, zaprojektowanej do przechwytywania szczegółów wizualnych wyrównanych z tekstem z danego obrazu. Rozpoznając, że P wymaga wielu kroków optymalizacji do zbieżności, podejście ramy polega na wstępnym szkoleniu go przy użyciu prostszego modelu T2I. Ta strategia pozwala sieci reprezentacji kontekstu skoncentrować się na nauce o kontekście obrazu przed integracją go z modelem T2V poprzez wspólne szkolenie z P i warstwami przestrzennymi, a nie warstwami czasowymi, modelu T2V.

Aby zapewnić kompatybilność z modelem T2V, rama DynamiCrafter łączy obraz wejściowy z szumem na klatkę, a następnie doskonali zarówno P, jak i warstwy przestrzenne modelu VDM. Tę metodę wybrano, aby zachować integralność istniejących wiedzy czasowych modelu T2V, bez negatywnych skutków gęstego łączenia obrazu, które mogłoby naruszyć wydajność i odbiegać od naszego głównego celu. Ponadto, rama wykorzystuje strategię losowego wyboru klatki wideo jako warunku obrazu, aby osiągnąć dwa cele: (i) uniknięcie rozwoju sieci, który bezpośrednio łączy łączony obraz z określoną lokalizacją klatki, oraz (ii) zachęcić do bardziej elastycznej reprezentacji kontekstu, uniemożliwiając podanie zbyt sztywnych informacji dla określonej klatki.

DynamiCrafter: Eksperymenty i Wyniki

Rama DynamiCrafter najpierw trenuje sieć reprezentacji kontekstu i warstwy uwagi krzyżowej na modelu Stable Diffusion. Następnie rama zastępuje składnik Stable Diffusion modelem VideoCrafter i dalej doskonali sieć reprezentacji kontekstu i warstwy przestrzenne do adaptacji, a także z łączeniem obrazu. Podczas wnioskowania, rama przyjmuje próbkę DDIM z wielowarunkową kontrolą bezklasową. Ponadto, aby ocenić spójność czasową i jakość wideo syntetyzowanych w domenach czasowych i przestrzennych, rama raportuje FVD lub Frechet Video Distance, a także KVD lub Kernel Video Distance, i ocenia wyniki zero-shot na wszystkich metodach benchmarków MSR-VTT i UCF-101. Aby zbadać percepcyjną zgodność między wynikami generowanymi a obrazem wejściowym, rama wprowadza PIC lub Perceptual Input Conformity, i przyjmuje metrykę odległości percepcyjnej DreamSim jako funkcję odległości.

Poniższy obraz pokazuje porównanie wizualne zawartości animowanej z różnymi stylami i treścią.

Jak można zobaczyć, wśród wszystkich różnych metod, rama DynamiCrafter dobrze przypomina warunek obrazu wejściowego i generuje spójne czasowo wideo. Poniższa tabela zawiera statystyki z badania użytkowników z 49 uczestnikami, w którym oceniono współczynnik preferencji dla Spójności Czasowej (T.C), Jakości Ruchu (M.C) oraz współczynnik wyboru dla zgodności wizualnej z obrazem wejściowym (I.C). Jak można zobaczyć, rama DynamiCrafter jest w stanie przewyższyć istniejące metody o znaczną różnicę.

Poniższy obraz pokazuje wyniki osiągnięte przy użyciu metody podwójnego wstrzyknięcia i paradygmatu szkolenia.

Końcowe Myśli

W tym artykule omówiliśmy ramę DynamiCrafter, próbę przezwyciężenia obecnych ograniczeń modeli animacji obrazów i rozszerzenia ich stosowalności do ogólnych scenariuszy z udziałem obrazów otwartych domen. Rama DynamiCrafter próbuje syntetyzować dynamiczną zawartość dla obrazów otwartych domen, przekształcając je w animowane wideo. Kluczową ideą ramy DynamiCrafter jest włączenie obrazu jako wskazówki do procesu generatywnego, próbując wykorzystać priorytet ruchu już istniejących modeli dyfuzji wideo. Dla danego obrazu, model DynamiCrafter najpierw wdraża transformator zapytania, który projekuje obraz na bogatą przestrzeń reprezentacji kontekstu, ułatwiając modelowi wideo trawienie zawartości obrazu w sposób kompatybilny. Jednakże, model DynamiCrafter nadal ma trudności z zachowaniem niektórych szczegółów wizualnych w wynikowych wideo, problem, który model DynamiCrafter rozwiązuje, podając pełny obraz do modelu dyfuzji, łącząc obraz z początkowymi szumami, tym samym uzupełniając model o bardziej precyjną informację o obrazie.

Kunal Kejriwal jest inżynierem backendu specjalizującym się w Pythonie, PostgreSQL, Redis oraz infrastrukturze chmurowej w GCP i AWS. Z trzyletnim doświadczeniem w budowaniu i skalowaniu systemów produkcyjnych pisze o infrastrukturze AI, systemach rozproszonych i architekturze wdrażania obciążeń uczenia maszynowego.