Modele i platformy AI

Gotowanie Spójności Narracyjnej dla Długich Generacji Wideo

mm
Dodaj Unite.AI do preferowanych źródeł w Google
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Ostatnie publiczne wydanie modelu generatywnego Hunyuan Video nasiliło trwające dyskusje na temat potencjału dużych modeli wielomodalnych do tworzenia cały filmów.

Jednak, jak już zauważyliśmy, jest to bardzo odległa perspektywa na razie, z powodu kilku powodów. Jednym z nich jest bardzo krótkie okno uwagi większości generatorów wideo AI, które mają trudności z utrzymaniem spójności nawet w krótkim jednym ujęciu, nie mówiąc już o serii ujęć.

Kolejnym powodem jest to, że spójne odniesienia do zawartości wideo (takie jak środowiska do eksploracji, które nie powinny zmieniać się losowo, jeśli przejdziemy przez nie ponownie) mogą być osiągnięte w modelach dyfuzyjnych tylko za pomocą technik dostosowywania, takich jak adaptacja o niskim ranku (LoRA), co ogranicza możliwości modeli podstawowych.

Stąd ewolucja generatywnych wideo wydaje się zatrzymać, chyba że zostaną opracowane nowe podejścia do ciągłości narracyjnej.

Przepis na Ciągłość

Mając to na uwadze, nowa współpraca między USA a Chinami zaproponowała użycie filmów instruktażowych jako możliwego szablonu dla przyszłych systemów ciągłości narracyjnej.

Kliknij, aby odtworzyć. System VideoAuteur systematyzuje analizę części procesu gotowania, aby wyprodukować nowy, szczegółowo opisany zestaw danych i metodę generowania filmów instruktażowych. Odwołaj się do strony źródłowej, aby uzyskać lepszą rozdzielczość. Źródło: https://videoauteur.github.io/

Tytuł VideoAuteur proponuje dwuetapową linię produkcyjną do generowania filmów instruktażowych za pomocą spójnych stanów łączących kluczowe klatki i napisy, osiągając wyniki na poziomie stanu sztuki – choć w zdecydowanie niedoinwestowanym obszarze.

Strona projektu VideoAuteur zawiera również kilka bardziej przyciągających uwagę filmów, które wykorzystują tę samą technikę, taką jak proponowany zwiastun filmu z crossoverem Marvel/DC:

Kliknij, aby odtworzyć. Dwa superbohaterowie z alternatywnych wszechświatów spotykają się w fałszywym zwiastunie z VideoAuteur. Odwołaj się do strony źródłowej, aby uzyskać lepszą rozdzielczość.

Na stronie znajdują się również podobnie stylizowane filmy promocyjne dla nieistniejącego serialu animalistycznego Netflix i reklamy samochodu Tesla (TSLA ).

Podczas tworzenia VideoAuteur, autorzy eksperymentowali z różnymi funkcjami straty i nowymi podejściami. Aby opracować przepis na generowanie instruktażu, opracowali również CookGen, największy zestaw danych skupiony na dziedzinie gotowania, zawierający 200 000 klipów wideo o średniej długości 9,5 sekundy.

Przy średniej 768,3 słów na wideo, CookGen jest wygodnie najbardziej szczegółowo opisanym zestawem danych swojego rodzaju. Różnorodne modele wzrokowo-językowe zostały wykorzystane, wśród innych podejść, aby zapewnić, że opisy są tak szczegółowe, istotne i dokładne, jak to możliwe.

Wideo gotowania zostały wybrane, ponieważ instruktaż kulinarny ma strukturalną i nieambitną narrację, co ułatwia zadanie anotacji i oceny. Z wyjątkiem filmów pornograficznych (które prawdopodobnie wejdą w ten konkretny obszar niebawem), trudno pomyśleć o innym gatunku, który byłby tak wizualnie i narracyjnie “formułowany”.

Autorzy stwierdzają:

‘Nasza proponowana dwuetapowa auto-regresyjna lina produkcyjna, która obejmuje długiego reżysera narracyjnego i warunkowaną wizualnie generację wideo, wykazuje obiecujące poprawy w spójności semantycznej i wierności wizualnej w generowanych długich narracyjnych wideo.

Poprzez eksperymenty na naszym zestawie danych, obserwujemy poprawy w przestrzennej i czasowej spójności w sekwencjach wideo.

‘Mamy nadzieję, że nasza praca może ułatwić dalsze badania w generowaniu długich narracyjnych wideo.’

Nowa praca jest zatytułowana VideoAuteur: Ku długim narracyjnym wideo i pochodzi od ośmiu autorów z Johns Hopkins University, ByteDance i ByteDance Seed.

Kuracja Zestawu Danych

Aby opracować CookGen, który napędza dwuetapowy system generatywny do produkcji AI wideo gotowania, autorzy wykorzystali materiały z kolekcji YouCook i HowTo100M. Autorzy porównują skalę CookGen do poprzednich zestawów danych skupionych na rozwoju narracyjnym w generowaniu wideo, takich jak zestaw Flintstones, zestaw kreskówki Pororo, StoryGen, StoryStream Tencent i VIST.

Porównanie obrazów i długości tekstu między CookGen a najbardziej zaludnionymi podobnymi zestawami danych. Źródło: https://arxiv.org/pdf/2501.06173

Porównanie obrazów i długości tekstu między CookGen a najbardziej zaludnionymi podobnymi zestawami danych. Źródło: https://arxiv.org/pdf/2501.06173

CookGen koncentruje się na realistycznych narracjach, szczególnie na czynnościach proceduralnych, takich jak gotowanie, oferując jaśniejsze i łatwiejsze do anotacji historie w porównaniu z zestawami komiksów opartych na obrazach. Przewyższa on największy istniejący zestaw danych, StoryStream, o 150 razy więcej klatek i 5 razy gęstsze opisy tekstowe.

Badacze dostosowali model opisujący za pomocą metody LLaVA-NeXT jako podstawy. Pseudo-etkiety rozpoznawania mowy (ASR) uzyskane dla HowTo100M zostały wykorzystane jako “działania” dla każdego wideo, a następnie dalej udoskonalone przez duże modele językowe (LLM).

Na przykład, ChatGPT-4o został wykorzystany do wyprodukowania zestawu opisów, i poproszono go o skupienie się na interakcjach między obiektami (takimi jak ręce trzymające narzędzia i żywność), atrybutach obiektów i dynamice czasowej.

Ponieważ skrypty ASR mogą zawierać nieścisłości i być generalnie “hałaśliwe”, wykorzystano IoU jako miarę, aby zmierzyć, jak ściśle opisy odpowiadają części wideo, które są adresowane. Autorzy zauważają, że było to kluczowe dla stworzenia spójności narracyjnej.

Przygotowane klipy zostały ocenione za pomocą Fréchet Video Distance (FVD), który mierzy różnicę między przykładami rzeczywistymi (światem rzeczywistym) a wygenerowanymi, zarówno z, jak i bez kluczowych klatek, osiągając wynik:

Użycie FVD do oceny odległości między wideo wygenerowanymi z nowymi opisami, zarówno z, jak i bez użycia klatek pobranych z próbek wideo.

Użycie FVD do oceny odległości między wideo wygenerowanymi z nowymi opisami, zarówno z, jak i bez użycia klatek pobranych z próbek wideo.

Dodatkowo, klipy zostały ocenione zarówno przez GPT-4o, jak i sześciu ludzkich anotatorów, zgodnie z definicją “halucynacji” (tj. zdolności modelu do wymyślania treści pozornych) z LLaVA-Hound.

Badacze porównali jakość opisów z zestawem Qwen2-VL-72B, uzyskując nieco lepszy wynik.

Porównanie wyników FVD i ocen ludzkich między Qwen2-VL-72B a zestawem autorów.

Porównanie wyników FVD i ocen ludzkich między Qwen2-VL-72B a zestawem autorów.

Metoda

Faza generatywna VideoAuteur jest podzielona między Długiego Reżysera Narracyjnego (LND) i model warunkowanego wizualnie generowania wideo (VCVGM).

LND generuje sekwencję wizualnych wektorów lub klatek, które charakteryzują przepływ narracyjny, podobnie do “niezbędnych punktów”. VCVGM generuje klipy wideo na podstawie tych wyborów.

Schemat potoku przetwarzania VideoAuteur. Długiego Reżysera Narracyjnego dokonuje odpowiednich wyborów, aby nakarmić moduł generatywny Seed-X.

Schemat potoku przetwarzania VideoAuteur. Długiego Reżysera Narracyjnego dokonuje odpowiednich wyborów, aby nakarmić moduł generatywny Seed-X.

Autorzy obszernie dyskutują o różnych zaletach interleaved image-text director i language-centric keyframe director, i dochodzą do wniosku, że pierwsze podejście jest bardziej skuteczne.

Interleaved image-text director generuje sekwencję, łącząc tokeny tekstu i wektory wizualne, wykorzystując auto-regresyjny model do przewidywania następnego tokenu, na podstawie połączonego kontekstu tekstu i obrazu. Zapewnia to ścisłe dopasowanie między wizualizacjami a tekstem.

W przeciwieństwie do tego, language-centric keyframe director syntetyzuje kluczowe klatki za pomocą modelu dyfuzyjnego warunkowanego tekstem, bez włączania wektorów wizualnych do procesu generowania.

Badacze stwierdzili, że chociaż metoda językowa generuje wizualnie atrakcyjne kluczowe klatki, brakuje jej spójności między klatkami, argumentując, że metoda interleaved osiąga wyższe wyniki w realizmie i spójności wizualnej. Stwierdzili również, że ta metoda była lepiej w stanie nauczyć się realistycznego stylu wizualnego podczas szkolenia, choć czasami z pewnymi powtarzającymi się lub hałaśliwymi elementami.

Niezwykle, w gałęzi badawczej, w której dominuje wykorzystywanie Stable Diffusion i Flux w potokach, autorzy wykorzystali model SEED-X 7B-parameter jako podstawę dla swojego potoku generatywnego (choć ten model wykorzystuje Stability.ai’s SDXL w ograniczonej części swojej architektury).

Autorzy stwierdzają:

‘W przeciwieństwie do klasycznego potoku Image-to-Video (I2V), który wykorzystuje obraz jako ramkę startową, nasze podejście wykorzystuje warunki ciągłe w całej sekwencji.

‘Ponadto, poprawiamy wytrzymałość i jakość generowanych wideo, dostosowując model do obsługi hałaśliwych wektorów wizualnych, ponieważ regresowane wektory wizualne mogą nie być idealne ze względu na błędy regresji.’

Typowy potok generatywny warunkowany wizualnie często wykorzystuje kluczowe klatki jako punkt startowy dla sterowania modelem, VideoAuteur rozwija ten paradygmat, generując wieloczęściowe stany wizualne w spójnym przestrzeni latentnej, unikając potencjalnego biasu opartego na “ramkach startowych”.

Schemat użycia osadzeń stanu wizualnego jako lepszej metody warunkowania.

Schemat użycia osadzeń stanu wizualnego jako lepszej metody warunkowania.

Testy

Zgodnie z metodami SeedStory, badacze wykorzystują SEED-X do zastosowania dostosowania LoRA na ich zestawie danych narracyjnych, opisując wynik jako “model podobny do Sora”, wstępnie wytrenowany na dużych zestawach danych wideo/tekstu, i zdolny do akceptowania zarówno wizualnych, jak i tekstowych podpowiedzi i warunków.

32 000 wideo narracyjnych zostało wykorzystanych do rozwoju modelu, z 1000 oddzielonymi jako próbki walidacyjne. Wideo zostało obcięte do 448 pikseli na krótszym boku, a następnie obcięte do środka, aby uzyskać rozdzielczość 448×448 pikseli.

Do szkolenia, generowanie narracji zostało ocenione głównie na zestawie walidacyjnym YouCook2. Zestaw Howto100M został wykorzystany do oceny jakości danych i również do generowania wideo z obrazu.

Dla straty warunkowania wizualnego, autorzy wykorzystali stratę dyfuzyjną z DiT i pracy z 2024 roku opartej na Stable Diffusion.

Aby udowodnić swoje twierdzenie, że interleaving jest lepszym podejściem, autorzy postawili VideoAuteur przeciwko kilku metodom, które polegają wyłącznie na wejściu tekstowym: EMU-2, SEED-X, SDXL i FLUX.1-s.

Dla globalnego podpowiedzi “Przewodnik krok po kroku, jak gotować mapo tofu”, interleaved director generuje akcje, opisy i wektory wizualne sekwencyjnie, aby opowiedzieć proces. Pierwsze dwa wiersze pokazują kluczowe klatki zakodowane z przestrzeni latentnej EMU-2 i SEED-X. Obrazy te są realistyczne i spójne, ale mniej wyrafinowane niż te z zaawansowanych modeli, takich jak SDXL i FLUX.

Autorzy stwierdzają:

‘Podejście językowe, wykorzystujące modele tekst-obraz, produkuje wizualnie atrakcyjne kluczowe klatki, ale cierpi na brak spójności między klatkami z powodu ograniczonej informacji wzajemnej. W przeciwieństwie do tego, metoda interleaved wykorzystuje warunkowane wizualnie wektory latentne, osiągając realistyczny styl wizualny podczas szkolenia.

‘Jednak czasami generuje obrazy z powtarzającymi się lub hałaśliwymi elementami, ponieważ auto-regresyjny model ma trudności z tworzeniem dokładnych wektorów w jednej iteracji.’

Ocena ludzka potwierdza również twierdzenie autorów o poprawionej wydajności metody interleaved, z wynikami interleaved osiągającymi najwyższe wyniki w ankiecie.

Porównanie podejść z badania przeprowadzonego dla artykułu.

Porównanie podejść z badania przeprowadzonego dla artykułu.

Jednak zauważamy, że podejścia językowe osiągają najlepsze estetyczne wyniki. Autorzy twierdzą jednak, że nie jest to główny problem w generowaniu długich narracyjnych wideo.

Kliknij, aby odtworzyć. Fragmenty wygenerowane dla wideo o budowaniu pizzy, przez VideoAuteur.

Wnioski

Najpopularniejszy kierunek badań w odniesieniu do tego wyzwania, tj. spójności narracyjnej w długich generacjach wideo, dotyczy pojedynczych obrazów. Przykładami takich projektów są DreamStory, StoryDiffusion, TheaterGen i ConsiStory NVIDIA.

W pewnym sensie, VideoAuteur również wpisuje się w tę “statyczną” kategorię, ponieważ wykorzystuje obrazy startowe, z których generowane są klipy. Jednak interleaving wideo i zawartości semantycznej przybliża proces do praktycznego potoku.

Pierwotnie opublikowano w czwartek, 16 stycznia 2025

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai