Modele i platformy AI

Stabilny Model Dyfuzji Wideo: Latentne Modele Dyfuzji Wideo do Dużych Zbiorów Danych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Sztuczna inteligencja generatywna była siłą napędową społeczności AI przez jakiś czas, a postępy w dziedzinie modelowania obrazów generatywnych, zwłaszcza z użyciem modeli dyfuzji, przyczyniły się znacznie do rozwoju modeli wideo generatywnych, nie tylko w badaniach, ale także w zastosowaniach praktycznych. Tradycyjnie, modele wideo generatywne są szkolone od podstaw lub częściowo lub całkowicie wykorzystują wstępnie wyszkolone modele obrazów z dodatkowymi warstwami czasowymi, na mieszance zbiorów danych obrazów i wideo.

Przechodząc do postępów w modelach wideo generatywnych, w tym artykule, będziemy rozmawiać o Stabilnym Modelu Dyfuzji Wideo, latentnym modelu dyfuzji wideo, który jest w stanie generować wysokiej jakości, najnowsze obrazy z filmów i treści wideo. Będziemy rozmawiać o tym, jak latentne modele dyfuzji, wyszkolone do syntezowania 2D obrazów, poprawiły możliwości i wydajność modeli wideo generatywnych, dodając warstwy czasowe i wykorzystując je do szkolenia modeli na małych zbiorach danych o wysokiej jakości. Będziemy głębiej analizować architekturę i działanie Stabilnego Modelu Dyfuzji Wideo i ocenić jego wydajność na różnych metrykach i porównać ją z aktualnym stanem sztuki w generowaniu wideo. Zatem, zacznijmy.

Stabilny Model Dyfuzji Wideo i Modele Wideo Generatywne: Wprowadzenie

Dzięki jego niemal nieograniczonemu potencjałowi, sztuczna inteligencja generatywna była głównym tematem badań dla praktyków AI i ML przez jakiś czas, a ostatnie lata przyniosły szybki postęp zarówno pod względem wydajności, jak i efektywności modeli obrazów generatywnych. Wnioski z modeli obrazów generatywnych pozwoliły badaczom i deweloperom na postęp w modelach wideo generatywnych, co skutkowało zwiększoną praktycznością i zastosowaniami w świecie rzeczywistym. Jednak większość badań, które próbują poprawić możliwości modeli wideo generatywnych, koncentruje się głównie na dokładnym układzie warstw czasowych i przestrzennych, z niewielką uwagą poświęconą badaniu wpływu wyboru odpowiednich danych na wynik tych modeli generatywnych.

Dzięki postępowi w modelach obrazów generatywnych, badacze zauważyli, że wpływ rozkładu danych szkoleniowych na wydajność modeli generatywnych jest znaczący i niezaprzeczalny. Ponadto, badacze zauważyli, że wstępne szkolenie modelu obrazu generatywnego na dużym i zróżnicowanym zbiorze danych, a następnie wykorzystanie go do szkolenia na mniejszym zbiorze danych o lepszej jakości, często skutkuje znaczną poprawą wydajności. Tradycyjnie, modele wideo generatywne wykorzystują wnioski z udanych modeli obrazów generatywnych, a badacze jeszcze nie zbadali wpływu danych i strategii szkolenia. Stabilny Model Dyfuzji Wideo jest próbą poprawy możliwości modeli wideo generatywnych, wkraczając w niezbadane dotąd terytoria, ze szczególnym uwzględnieniem wyboru danych.

Najnowsze modele wideo generatywne opierają się na modelach dyfuzji, podejściach warunkowych tekstowych lub warunkowych obrazowych do syntezy wielu spójnych klatek wideo lub obrazów. Modele dyfuzji są znane ze swojej zdolności do nauki, jak stopniowo odhałasować próbkę z normalnego rozkładu, implementując proces iteracyjnego udoskonalania, i przyniosły pożądane wyniki w syntezie wideo i obrazów o wysokiej rozdzielczości. Wykorzystując tę samą zasadę w swoim rdzeniu, Stabilny Model Dyfuzji Wideo szkoli latentny model dyfuzji wideo na swoim zbiorze danych wideo, wraz z użyciem sieci generatywno-dyskryminacyjnych lub GAN, a nawet modeli autoregresyjnych w pewnym stopniu.

Stabilny Model Dyfuzji Wideo stosuje unikalną strategię, nigdy wcześniej niezastosowaną przez żaden model wideo generatywny, ponieważ opiera się na latentnych modelach dyfuzji wideo z ustaloną architekturą i ustaloną strategią szkolenia, a następnie ocenia wpływ kuracji danych. Stabilny Model Dyfuzji Wideo ma na celu wprowadzenie następujących wkładów w dziedzinie modelowania wideo generatywnego.

  1. Przedstawienie systematycznego i skutecznego przepływu pracy kuracji danych w celu przekształcenia dużej kolekcji niekuratywnych próbek wideo w wysokiej jakości zbiór danych, który następnie wykorzystywany jest przez modele wideo generatywne.
  2. Wytrenowanie modeli obrazu do wideo i tekstu do wideo, które przewyższają istniejące ramy dla generowania wideo.
  3. Przeprowadzenie eksperymentów specyficznych dla domeny w celu zbadania zrozumienia 3D i silnego priorytetu ruchu modelu.

Teraz, Stabilny Model Dyfuzji Wideo wykorzystuje wnioski z latentnych modeli dyfuzji wideo i technik kuracji danych w swoim rdzeniu.

Latentne Modele Dyfuzji Wideo

Latentne Modele Dyfuzji Wideo lub Video-LDM wykorzystują podejście szkolenia podstawowego modelu generatywnego w przestrzeni latentnej z zmniejszoną złożonością obliczeniową, a większość Video-LDM wykorzystuje wstępnie wytrenowany model tekstu do obrazu, połączony z dodaniem warstw mieszania czasowego w architekturze wstępnego szkolenia. W rezultacie, większość latentnych modeli dyfuzji wideo albo szkoli tylko warstwy czasowe, albo pomija proces szkolenia, w przeciwieństwie do Stabilnego Modelu Dyfuzji Wideo, który wykorzystuje całą ramę. Ponadto, do syntezy danych wideo z warunkami tekstowymi, Stabilny Model Dyfuzji Wideo warunkuje się bezpośrednio na podstawie podpowiedzi tekstowej, a wyniki wskazują, że wynikowa rama może być łatwo wytrenowana w model multi-widokowy lub model obrazu do wideo.

Kuracja Danych

Kuracja danych jest niezbędnym składnikiem nie tylko Stabilnego Modelu Dyfuzji Wideo, ale także modeli generatywnych w ogóle, ponieważ jest niezbędne wstępne szkolenie dużych modeli na dużych zbiorach danych, aby poprawić wydajność w różnych zadaniach, w tym modelowaniu języka, generowaniu dyskryminatywnym tekstu do obrazu i wielu innych. Kuracja danych została z powodzeniem zaimplementowana w modelach obrazów generatywnych, wykorzystując możliwości efektywnych reprezentacji języka-obrazu, chociaż takie dyskusje nigdy nie były skupione na rozwijaniu modeli wideo generatywnych. Istnieją pewne przeszkody, z którymi twórcy muszą się zmierzyć przy kuracji danych dla modeli wideo generatywnych, a aby rozwiązać te wyzwania, Stabilny Model Dyfuzji Wideo wykorzystuje trzystopniową strategię szkolenia, co skutkuje lepszymi wynikami i znacznym wzrostem wydajności.

Kuracja Danych dla Wysokiej Jakości Syntezy Wideo

Jak omówiono w poprzedniej sekcji, Stabilny Model Dyfuzji Wideo wykorzystuje trzystopniową strategię szkolenia, co skutkuje lepszymi wynikami i znacznym wzrostem wydajności. Etap I to wstępne szkolenie obrazu, które wykorzystuje model dyfuzji 2D tekstu do obrazu. Etap II to wstępne szkolenie wideo, w którym rama szkoli się na dużej ilości danych wideo. Na koniec, mamy Etap III dla dokształcenia wideo, w którym model jest udoskonalany na małym podzbiorze wysokiej jakości i wysokiej rozdzielczości wideo.

Jednak przed zastosowaniem tych trzech etapów, Stabilny Model Dyfuzji Wideo musi przetworzyć i opisać dane, ponieważ służy jako podstawa dla Etapu II lub etapu wstępnego szkolenia wideo, i odgrywa krytyczną rolę w zapewnieniu optymalnego wyjścia. Aby zapewnić maksymalną efektywność, rama najpierw wykorzystuje potok wykrywania cięć w 3 różnych poziomach klatek na sekundę, a potrzeba tego potoku jest udowodniona na poniższym obrazie.

Następnie, Stabilny Model Dyfuzji Wideo opisuje każdy klip wideo, wykorzystując trzy różne metody syntetycznego opisu. Poniższa tabela porównuje zbiory danych wykorzystane w ramie Stabilnej Dyfuzji przed i po procesie filtracji.

Etap I: Wstępne Szkolenie Obrazu

Pierwszy etap w trzystopniowej fazie szkolenia wdrożonej w Stabilnym Modelu Dyfuzji Wideo to wstępne szkolenie obrazu, a aby to osiągnąć, początkowa rama Stabilnej Dyfuzji Wideo jest ugruntowana przeciwko wstępnie wytrenowanemu modelowi dyfuzji obrazu, a mianowicie modelowi Stable Diffusion 2.1, który wyposaża ją w silniejsze reprezentacje wizualne.

Etap II: Wstępne Szkolenie Wideo

Drugi etap to etap wstępnego szkolenia wideo, i opiera się na wnioskach, że użycie kuracji danych w multimodalnych modelach obrazów generatywnych często skutkuje lepszymi wynikami i zwiększoną efektywnością, wraz z potężną generacją obrazów dyskryminacyjnych. Jednak ze względu na brak podobnych potężnych, gotowych reprezentacji do filtrowania niechcianych próbek dla modeli wideo generatywnych, Stabilny Model Dyfuzji Wideo opiera się na preferencjach ludzkich jako sygnałach wejściowych do tworzenia odpowiedniego zbioru danych wykorzystanego do wstępnego szkolenia ramy. Poniższy rysunek demonstruje pozytywny efekt wstępnego szkolenia ramy na wykuratywnym zbiorze danych, co pomaga w zwiększeniu ogólnej wydajności szkolenia wideo na mniejszych zbiorach danych.

Aby być bardziej konkretnym, rama wykorzystuje różne metody do kuracji podzbiorów latentnej dyfuzji wideo, i rozważa ranking modeli LVD wytrenowanych na tych zbiorach danych. Ponadto, Stabilny Model Dyfuzji Wideo stwierdza, że użycie wykuratywnych zbiorów danych do szkolenia ramy pomaga w zwiększeniu wydajności ramy, i modeli dyfuzji w ogóle. Ponadto, strategia kuracji danych działa również na większych, bardziej istotnych i bardziej praktycznych zbiorach danych. Poniższy rysunek demonstruje pozytywny efekt wstępnego szkolenia ramy na wykuratywnym zbiorze danych, co pomaga w zwiększeniu ogólnej wydajności szkolenia wideo na mniejszych zbiorach danych.

Etap III: Wysokiej Jakości Doksztalcenie

Do etapu II, Stabilny Model Dyfuzji Wideo koncentruje się na poprawie wydajności przed szkoleniem wideo, a w trzecim etapie, rama kładzie nacisk na optymalizację lub dalsze zwiększenie wydajności ramy po wysokiej jakości doksztalceniu wideo, i jak przejście z Etapu II do Etapu III jest osiągane w ramie. W Etapie III, rama wykorzystuje techniki szkoleniowe zapożyczone z latentnych modeli dyfuzji obrazów, i zwiększa rozdzielczość przykładów szkoleniowych. Aby ocenić skuteczność tego podejścia, rama porównuje je z trzema identycznymi modelami, które różnią się tylko wagami inicjalizacji. Pierwszy identyczny model ma zainicjowane wagi, a proces szkolenia wideo jest pomijany, podczas gdy pozostałe dwa identyczne modele są inicjowane wagami pożyczonymi z innych latentnych modeli dyfuzji wideo.

Wyniki i Odkrycia

Nadszedł czas, aby przyjrzeć się, jak Stabilny Model Dyfuzji Wideo działa w zadaniach świata rzeczywistego, i jak porównuje się z aktualnym stanem sztuki w generowaniu wideo. Stabilny Model Dyfuzji Wideo najpierw wykorzystuje optymalne podejście do szkolenia, aby wytrenować model bazowy, a następnie wykorzystuje doksztalcenie, aby wygenerować kilka modeli stanu sztuki, z których każdy wykonuje określone zadanie.

Powyższy obraz reprezentuje wysokiej jakości próbki obrazu do wideo wygenerowane przez ramę, podczas gdy poniższy rysunek demonstruje zdolność ramy do generowania wysokiej jakości próbek wideo z warunkami tekstowymi.

Wstępnie Wytrenowany Model Bazowy

Jak omówiono wcześniej, Stabilny Model Dyfuzji Wideo opiera się na ramie Stable Diffusion 2.1, a na podstawie ostatnich odkryć, okazało się, że jest niezbędne dla deweloperów, aby przyjąć harmonogram szumu i zwiększyć szum, aby uzyskać obrazy o lepszej rozdzielczości podczas szkolenia modeli dyfuzji obrazów. Dzięki temu podejściu, Stabilny Model Dyfuzji Wideo bazowy uczy się potężnych reprezentacji ruchu, i w procesie, przewyższa modele bazowe dla generowania wideo z warunkami tekstowymi w ustawieniu zero-shot, a wyniki są wyświetlane w poniższej tabeli.

Interpolacja Klatek i Generowanie Wielu Widoków

Stabilny Model Dyfuzji Wideo wykorzystuje doksztalcenie modelu obrazu do wideo na zbiorach danych wielu widoków, aby uzyskać wiele nowych widoków obiektu, i ten model jest znany jako SVD-MV lub Stabilny Model Dyfuzji Wideo – Wielu Widoków. Oryginalny model SVD jest doksztalony z użyciem dwóch zbiorów danych w taki sposób, że rama wprowadza pojedynczy obraz, i zwraca sekwencję wielu widoków obrazów jako swój wynik.

Jak widać na poniższych obrazach, Stabilny Model Dyfuzji Wideo – Wielu Widoków osiąga wysoką wydajność porównywalną do stanu sztuki w ramach Scratch-MV, a wyniki są wyraźnym dowodem zdolności SVD-MV do wykorzystania wniosków z oryginalnej ramy SVD do generowania wielu widoków obrazów. Ponadto, wyniki wskazują również, że uruchomienie modelu przez relatywnie mniejszą liczbę iteracji pomaga w osiągnięciu optymalnych wyników, co jest charakterystyczne dla większości modeli doksztalonych z ramy SVD.

Na powyższym rysunku, metryki są wskazane po lewej stronie, i jak widać, Stabilny Model Dyfuzji Wideo – Wielu Widoków przewyższa Scratch-MV i SD2.1 Multi-Widokowy model o przyzwoitej marży. Drugi obraz demonstruje wpływ liczby iteracji szkolenia na ogólną wydajność ramy w zakresie wyniku Clip Score, i ramy SVD-MV osiągają zrównoważone wyniki.

Końcowe Myśli

W tym artykule, omówiliśmy Stabilny Model Dyfuzji Wideo, latentny model dyfuzji wideo, który jest w stanie generować wysokiej jakości, najnowsze obrazy z filmów i treści wideo. Stabilny Model Dyfuzji Wideo stosuje unikalną strategię, nigdy wcześniej niezastosowaną przez żaden model wideo generatywny, ponieważ opiera się na latentnych modelach dyfuzji wideo z ustaloną architekturą i ustaloną strategią szkolenia, a następnie ocenia wpływ kuracji danych.

Omówiliśmy, jak latentne modele dyfuzji, wyszkolone do syntezowania 2D obrazów, poprawiły możliwości i wydajność modeli wideo generatywnych, dodając warstwy czasowe i wykorzystując je do szkolenia modeli na małych zbiorach danych o wysokiej jakości. Aby zgromadzić dane szkoleniowe, rama prowadzi badanie skali i stosuje systematyczne praktyki zbierania danych, i ostatecznie proponuje metodę kuracji dużej ilości danych wideo, i konwertuje hałaśliwe wideo w dane wejściowe odpowiednie dla modeli wideo generatywnych.

Ponadto, Stabilny Model Dyfuzji Wideo wykorzystuje trzy odrębne etapy szkolenia modelu wideo, które są analizowane niezależnie, aby ocenić ich wpływ na wydajność ramy. Rama ostatecznie generuje reprezentację wideo wystarczająco silną, aby doksztalić modele do optymalnej syntezy wideo, a wyniki są porównywalne do modeli generowania wideo stanu sztuki już w użyciu.

"Inżynier z zawodu, pisarz z serca". Kunal jest technicznym pisarzem z głęboką miłością i zrozumieniem AI i ML, poświęconym uproszczeniu złożonych pojęć w tych dziedzinach poprzez swoje angażujące i informacyjne dokumentacje.