Modele i platformy AI

AnimateLCM: Przyspieszanie animacji personalizowanych modeli dyfuzyjnych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

W ciągu ostatnich kilku lat, modele dyfuzyjne osiągnęły ogromny sukces i uznanie w zadaniach generowania obrazów i filmów. Modele dyfuzyjne wideo, w szczególności, zyskały znaczącą uwagę ze względu na ich zdolność do produkcji filmów o wysokiej spójności i wierności. Te modele generują wysokiej jakości filmy, wykorzystując iteracyjny proces denoisingu w swojej architekturze, który stopniowo przekształca hałas wielowymiarowy w dane rzeczywiste.

Stable Diffusion jest jednym z najbardziej reprezentatywnych modeli dla zadań generowania obrazów, opierając się na Variational AutoEncoder (VAE) do mapowania między rzeczywistym obrazem a pomniejszonymi cechami latentnymi. To pozwala modelowi zmniejszyć koszty generowania, a mechanizm cross-attention w jego architekturze ułatwia generowanie obrazów warunkowych. Ostatnio, ramy Stable Diffusion stanowią podstawę dla kilku adapterów plug-and-play, aby osiągnąć bardziej innowacyjne i skuteczne generowanie obrazów lub filmów. Jednakże, iteracyjny proces generowania zastosowany przez większość modeli dyfuzyjnych wideo sprawia, że proces generowania obrazów jest czasochłonny i relatywnie drogi, ograniczając jego zastosowania.

W tym artykule, omówimy AnimateLCM, personalizowany model dyfuzyjny z adapterami, którego celem jest generowanie filmów o wysokiej jakości z minimalną liczbą kroków i kosztami obliczeniowymi. Ramy AnimateLCM są inspirowane modelem Consistency, który przyspiesza próbkowanie z minimalną liczbą kroków, destylując wstępnie wytrenowane modele dyfuzyjne obrazów. Ponadto, udana ekstensja modelu Consistency, model Latent Consistency (LCM), ułatwia generowanie warunkowe obrazów. Zamiast prowadzenia procesu uczenia się spójności bezpośrednio na surowych danych wideo, ramy AnimateLCM proponują zastosowanie strategii decoupled consistency learning. Ta strategia rozdziela destylację priorytetów generowania ruchu i priorytetów generowania obrazów, pozwalając modelowi poprawić jakość wizualną generowanych treści i jednocześnie zwiększyć wydajność szkolenia.

Artykuł ten ma na celu omówienie ram AnimateLCM w detalach. Eksplorujemy mechanizm, metodologię i architekturę ram, wraz z porównaniem z ramami generowania obrazów i filmów stanowiącymi obecnie stan sztuki. Więc, zacznijmy.

AnimateLCM: Animacja personalizowanych modeli dyfuzyjnych

Modele dyfuzyjne były frameworkiem wybieranym dla zadań generowania obrazów i filmów ze względu na ich wydajność i zdolności w zadaniach generowania. Większość modeli dyfuzyjnych opiera się na iteracyjnym procesie denoisingu dla generowania obrazów, który przekształca hałas wielowymiarowy w dane rzeczywiste stopniowo. Chociaż metoda ta daje satysfakcjonujące wyniki, iteracyjny proces i liczba iteracji spowalniają proces generowania i dodają do wymagań obliczeniowych modeli dyfuzyjnych, które są znacznie wolniejsze niż inne ramy generatywne, takie jak GAN lub Sieci Przeciwstawne Generatywne. W ostatnich latach, modele Consistency lub CM zostały zaproponowane jako alternatywa dla modeli dyfuzyjnych iteracyjnych, aby przyspieszyć proces generowania, utrzymując przy tym wymagania obliczeniowe na stałym poziomie.

Wyróżniającą cechą modeli Consistency jest to, że uczą się one mapowań spójności, które utrzymują samospójność trajektorii wprowadzonych przez wstępnie wytrenowane modele dyfuzyjne. Proces uczenia się modeli Consistency pozwala im generować obrazy o wysokiej jakości z minimalną liczbą kroków i eliminuje potrzebę obliczeń intensywnych iteracji. Ponadto, model Latent Consistency (LCM) zbudowany na ramach Stable Diffusion może być zintegrowany z interfejsem użytkownika sieci web z istniejącymi adapterami, aby osiągnąć szereg dodatkowych funkcjonalności, takich jak tłumaczenie obrazu na obraz w czasie rzeczywistym. W porównaniu, chociaż istniejące modele dyfuzyjne wideo dają akceptowalne wyniki, postęp jest jeszcze do zrobienia w dziedzinie przyspieszania próbkowania wideo, co jest bardzo istotne ze względu na wysokie koszty generowania wideo.

To prowadzi nas do AnimateLCM, ramy generowania filmów o wysokiej jakości, które wymagają minimalnej liczby kroków dla zadań generowania filmów. Ramy AnimateLCM są zainspirowane modelem Latent Consistency, traktując proces odwrotnego dyfuzyjnego jako rozwiązywanie CFG lub Classifier Free Guidance augmentowanego przepływu prawdopodobieństwa, i trenują model do przewidywania rozwiązania takich przepływów prawdopodobieństwa bezpośrednio w przestrzeni latentnej. Jednakże, zamiast prowadzenia uczenia się spójności bezpośrednio na surowych danych wideo, które wymaga wysokich kosztów szkolenia i obliczeniowych, i często prowadzi do niskiej jakości, ramy AnimateLCM proponują strategię decoupled consistency learning, która rozdziela destylację priorytetów generowania ruchu i priorytetów generowania obrazów.

Ramy AnimateLCM najpierw prowadzą destylację spójności, aby dostosować model dyfuzyjny obrazu do modelu spójności obrazu, a następnie prowadzą inflację 3D do modeli spójności i dyfuzyjnych, aby uwzględnić cechy 3D. Ostatecznie, ramy AnimateLCM uzyskują model spójności wideo, prowadząc destylację spójności na danych wideo. Ponadto, aby złagodzić potencjalne skutki korupcji cech wynikające z procesu dyfuzyjnego, ramy AnimateLCM proponują również zastosowanie strategii inicjalizacji. Ponieważ ramy AnimateLCM są zbudowane na ramach Stable Diffusion, mogą one zastąpić wagi przestrzenne wytrenowanego modelu spójności wideo z publicznie dostępnymi wagami dyfuzyjnymi obrazu, aby osiągnąć innowacyjne wyniki generowania.

Ponadto, aby wytrenować specjalne adaptory od podstaw lub dostosować istniejące adaptory lepiej, ramy AnimateLCM proponują skuteczną strategię przyspieszania adapterów, które nie wymagają szkolenia specjalnych modeli nauczycielskich.

Wkład ram AnimateLCM można podsumować jako: proponowane ramy AnimateLCM mają na celu osiągnięcie wysokiej jakości, szybkiego i wiernego generowania filmów, i aby to osiągnąć, ramy AnimateLCM proponują strategię decoupled distillation, która rozdziela priorytety generowania ruchu i priorytety generowania obrazów, co skutkuje lepszą jakością generowania i zwiększoną wydajnością szkolenia.

InstantID: Metodologia i Architektura

W swojej istocie, ramy InstantID czerpią inspirację z modeli dyfuzyjnych i strategii szybkości próbkowania. Modele dyfuzyjne, znane również jako score-based generative models, wykazały się niezwykłymi zdolnościami generowania obrazów. Pod kierunkiem kierunku score, iteracyjna strategia próbkowania zaimplementowana przez modele dyfuzyjne denoisingu stopniowo danych hałasowych. Wydajność modeli dyfuzyjnych jest jednym z głównych powodów, dla których są one stosowane przez większość modeli dyfuzyjnych wideo, trenując na dodatkowych warstwach czasowych.

Idąc dalej, ramy InstantID są zbudowane na ramach Stable Diffusion, co pozwala ramom InstantID zastosować odpowiednie pojęcia. Model traktuje dyskretny proces forward dyfuzyjny jako ciągły czasowy Variance Preserving SDE. Ponadto, model Stable Diffusion jest rozszerzeniem DDPM lub Denoising Diffusion Probabilistic Model, w którym punkt danych treningowych jest perturbowany stopniowo przez dyskretny łańcuch Markowa z jądrem perturbacji, pozwalając na rozkład danych hałasowych na różnych krokach czasowych.

Aby osiągnąć generowanie filmów o wysokiej jakości z minimalną liczbą kroków, ramy AnimateLCM ujarzmiają modele wideo oparte na Stable Diffusion, aby podążać za właściwością samospójności. Cała struktura szkolenia ram AnimateLCM składa się z strategii decoupled consistency learning dla adaptacji nauczyciela i skutecznego uczenia się spójności.

Przejście z modeli dyfuzyjnych do modeli spójności

Ramy AnimateLCM wprowadzają swoją adaptację modelu Stable Diffusion do modelu Consistency, zgodnie z projektem modelu Latent Consistency. Warto zauważyć, że chociaż modele Stable Diffusion typowo przewidują hałas dodany do próbek, są one istotnymi modelami sigma-dyfuzyjnymi. Jest to w przeciwieństwie do modeli spójności, które mają na celu przewidywać rozwiązanie trajektorii PF-ODE bezpośrednio. Ponadto, w modelach Stable Diffusion z pewnymi parametrami, jest istotne, aby model zastosował strategię classifier-free guidance, aby wygenerować obrazy o wysokiej jakości. Rany AnimateLCM zastosowują jednak classifier-free guidance augmentowany solver ODE, aby próbkować sąsiednie pary w tych samych trajektoriach, co skutkuje lepszą wydajnością i jakością.

Decoupled Consistency Learning

Dla procesu destylacji spójności, deweloperzy zaobserwowali, że dane użyte do szkolenia mają znaczący wpływ na jakość ostatecznej generacji modeli spójności. Jednak główny problem z obecnie dostępnymi zbiorami danych jest taki, że często składają się one z danych o niskiej jakości, zawierających zbyt krótkie lub niejasne podpisów. Ponadto, szkolenie modelu bezpośrednio na dużych rozdzielczościach wideo jest obliczeniowo kosztowne i czasochłonne, co sprawia, że jest to nieopłacalna opcja dla większości badaczy.

Biorąc pod uwagę dostępność przefiltrowanych, wysokiej jakości zbiorów danych, ramy AnimateLCM proponują rozdzielenie destylacji priorytetów generowania ruchu i priorytetów generowania obrazów. Aby być bardziej konkretnym, ramy AnimateLCM najpierw destylują modele Stable Diffusion do modeli spójności obrazu z przefiltrowanymi, wysokiej jakości danymi obrazu i tekstu z lepszą rozdzielczością. Następnie ramy trenują lekkie wagi LoRA na warstwach modelu Stable Diffusion, zamykając wagi modelu Stable Diffusion. Po tym, jak ramy AnimateLCM dostosują wagi LoRA, działają one jako wszechstronny moduł przyspieszania i wykazały swoją kompatybilność z innymi personalizowanymi modelami w społecznościach Stable Diffusion.

To jest istotne, aby rozpoznać, że podczas gdy wagi LoRA przestrzenne są zaprojektowane, aby przyspieszyć proces próbkowania bez uwzględniania modelowania czasowego, a moduły czasowe są rozwijane za pomocą standardowych technik dyfuzyjnych, ich bezpośrednia integracja ma tendencję do korupcji reprezentacji na początku szkolenia. To stwarza znaczące wyzwania w skutecznym i wydajnym łączeniu ich z minimalnym konfliktem. Za pomocą badań empirycznych, ramy AnimateLCM zidentyfikowały skuteczną strategię inicjalizacji, która nie tylko wykorzystuje priorytety spójności z wag LoRA przestrzennych, ale także łagodzi niekorzystne skutki ich bezpośredniego połączenia.

Na początku szkolenia spójności, wstępnie wytrenowane wagi LoRA przestrzenne są integrowane wyłącznie z modelem spójności online, oszczędzając modelowi docelowemu wstawiania. Ta strategia zapewnia, że model docelowy, służący jako przewodnik edukacyjny dla modelu online, nie generuje błędnych predykcji, które mogą niekorzystnie wpłynąć na proces uczenia się modelu online. W trakcie szkolenia, wagi LoRA są stopniowo integrowane z modelem docelowym za pomocą procesu średniej ruchomej wykładniczej (EMA), osiągając optymalny balans wag po kilku iteracjach.

Nauczyciel Wolna Adaptacja

Modele Stable Diffusion i adaptory plug-and-play często idą w parze. Jednak zaobserwowano, że nawet jeśli adaptory plug-and-play działają do pewnego stopnia, mają tendencję do utraty kontroli w detalach, nawet jeśli większość tych adapterów jest szkolona z modelami dyfuzyjnymi obrazów. Aby przeciwdziałać temu problemowi, ramy AnimateLCM wybierają nauczyciela wolną adaptację, prostą, ale skuteczną strategię, która albo dostosowuje istniejące adaptory do lepszej kompatybilności, albo trenuje adaptory od podstaw. Podejście to pozwala ramom AnimateLCM osiągnąć kontrolowane generowanie filmów i generowanie obrazu na film z minimalną liczbą kroków, bez wymogu modeli nauczycielskich.

AnimateLCM: Eksperymenty i Wyniki

Ramy AnimateLCM zastosowują model Stable Diffusion v1-5 jako model podstawowy i implementują solver ODE DDIM do celów szkoleniowych. Ramy również stosują model Stable Diffusion v1-5 z wagami ruchu otwartymi jako model nauczycielski wideo dyfuzyjny, przy czym eksperymenty są prowadzone na zbiorze danych WebVid2M bez dodatkowych lub uzupełniających danych. Ponadto, ramy zastosowują zbior danych TikTok z podpisami BLIP, aby osiągnąć kontrolowane generowanie filmów.

Wyniki Jakościowe

Poniższy rysunek demonstruje wyniki czterokrotnego generowania zaimplementowanego przez ramy AnimateLCM w generowaniu filmów z tekstu, generowaniu filmów z obrazu i kontrolowanym generowaniu filmów.

Jak można zauważyć, wyniki dostarczone przez każdy z nich są satysfakcjonujące, a wygenerowane wyniki demonstrują zdolność ram AnimateLCM do podążania za właściwością spójności, nawet przy zmieniających się krokach inferencyjnych, utrzymując podobny ruch i styl.

Wyniki Ilościowe

Poniższy rysunek ilustruje wyniki ilościowe i porównanie ram AnimateLCM z metodami DDIM i DPM++ stanowiącymi obecnie stan sztuki.

Jak można zauważyć, ramy AnimateLCM przewyższają istniejące metody o znaczną granicę, szczególnie w niskim zakresie kroków od 1 do 4. Ponadto, metryki AnimateLCM wyświetlane w tym porównaniu są oceniane bez użycia CFG lub classifier-free guidance, co pozwala ramom zaoszczędzić prawie 50% czasu inferencyjnego i kosztu pamięci szczytowej. Ponadto, aby dalej zwalidować ich wydajność, wagi przestrzenne w ramach AnimateLCM są zastąpione z publicznie dostępnym, realistycznym modelem, który dobrze balansuje wierność i różnorodność, co pomaga w dalszym poprawieniu wydajności.

Końcowe Myśli

W tym artykule, omówiliśmy ramy AnimateLCM, personalizowany model dyfuzyjny z adapterami, który ma na celu generowanie filmów o wysokiej jakości z minimalną liczbą kroków i kosztami obliczeniowymi. Ramy AnimateLCM są zainspirowane modelem Consistency, który przyspiesza próbkowanie z minimalną liczbą kroków, destylując wstępnie wytrenowane modele dyfuzyjne obrazów, i udaną ekstensją modelu Consistency, modelem Latent Consistency, który ułatwia generowanie warunkowe obrazów. Zamiast prowadzenia uczenia się spójności bezpośrednio na surowych danych wideo, ramy AnimateLCM proponują zastosowanie strategii decoupled consistency learning, która rozdziela destylację priorytetów generowania ruchu i priorytetów generowania obrazów, pozwalając modelowi poprawić jakość wizualną generowanych treści i jednocześnie zwiększyć wydajność szkolenia.

"Inżynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złożonych pojęć w tych dziedzinach poprzez swoje angażujące i informacyjne dokumentacje.