Kąt Andersona
Dlaczego systemy generatywne wideo nie mogą tworzyć kompletnych filmów?

Pojawienie się i postęp systemów generatywnych wideo skłoniło wielu obserwatorów do przewidywania, że sztuczna inteligencja może okazać się końcem przemysłu filmowego, jaki znamy – zamiast tego, pojedynczy twórcy będą mogli tworzyć hollywoodzkie blockbustery w domu, na lokalnych lub chmurowych systemach GPU.
Czy jest to możliwe? Nawet jeśli jest to możliwe, czy jest to nieuchronne, jak wielu ludzi sądzi?
Że osoby indywidualne będą w stanie tworzyć filmy, w formie, którą znamy, z ciągłymi postaciami, spójnością narracyjną i całkowitą fotorealizmem, jest całkiem możliwe – i być może nawet nieuniknione.
Jednakże istnieją kilka podstawowych powodów, dlaczego nie jest to prawdopodobne w przypadku systemów wideo opartych na modelach dyfuzji ukrytej.
Ten ostatni fakt jest ważny, ponieważ na razie kategoria ta obejmuje każdy popularny system tekst-do-wideo (T2) i obraz-do-wideo (I2V) dostępny, w tym Minimax, Kling, Sora, Imagen, Luma, Amazon Video Generator, Runway ML, Kaiber (i, jak się wydaje, nadchodzącą funkcjonalność wideo Adobe Firefly); wśród wielu innych.
Tutaj rozważamy perspektywę prawdziwych auteur pełnometrażowych produkcji gen-AI, tworzonych przez osoby indywidualne, z ciągłymi postaciami, kinematografią i efektami wizualnymi co najmniej na poziomie obecnego stanu sztuki w Hollywood.
Zobaczmy niektóre z największych praktycznych przeszkód na drodze do tych wyzwań.
1: Nie możesz uzyskać dokładnego ujęcia następnego
Niespójność narracyjna jest największą z tych przeszkód. Fakt jest taki, że żaden obecnie dostępny system generacji wideo nie może wytworzyć prawdziwie dokładnego ujęcia następnego*.
To wynika z faktu, że model dyfuzji denoising w sercu tych systemów opiera się na losowym szumie, a ten podstawowy princip nie jest podatny na reinterpretację tego samego contenu dwukrotnie (tj. z różnych kątów lub rozwijając poprzednie ujęcie w ujęcie następne, które utrzymuje spójność z poprzednim ujęciem).
Gdzie są używane podpowiedzi tekstowe, samodzielnie lub wraz z przekazanymi “nasionami” obrazami (wielomodalny wprowadzany), tokeny pochodzące z podpowiedzi wywołają semantycznie odpowiedni contenu z ukrytej przestrzeni modelu.
Jednakże, dalej utrudnione przez “losowy szum” czynnik, nigdy nie zrobi tego samego sposobem dwukrotnie.
To oznacza, że tożsamości osób w filmie będą tendencją do zmiany, a obiekty i środowiska nie będą odpowiadać początkowemu ujęciu.
To dlatego, że wirusowe klipy przedstawiające nadzwyczajne wizualizacje i hollywoodzki poziom wyjścia mają tendencję do bycia albo pojedynczymi ujęciami, albo “showcase montażem” możliwości systemu, gdzie każde ujęcie przedstawia różne postacie i środowiska.
Fragmenty z generatywnego montażu AI od Marco van Hylckama Vlieg – źródło: https://www.linkedin.com/posts/marcovhv_thanks-to-generative-ai-we-are-all-filmmakers-activity-7240024800906076160-nEXZ/
Implikacja w tych kolekcjach ad hoc generacji wideo (które mogą być nieuczciwe w przypadku systemów komercyjnych) jest taka, że podstawowy system może tworzyć ciągłe i spójne narracje.
Analogia wykorzystywana tutaj to zwiastun filmu, który zawiera tylko minutę lub dwie filmu, ale daje widzom powód, by uwierzyć, że cały film istnieje.
Jedynymi systemami, które obecnie oferują spójność narracyjną w modelu dyfuzji, są te, które produkują statyczne obrazy. Należą do nich ConsiStory od NVIDIA, oraz różne projekty w literaturze naukowej, takie jak TheaterGen, DreamStory i StoryDiffusion.

Dwa przykłady ‘statycznej’ spójności narracyjnej, z niedawnych modeli:: Źródła: https://research.nvidia.com/labs/par/consistory/ i https://arxiv.org/pdf/2405.01434
W teorii, można by użyć lepszej wersji takich systemów (żaden z powyższych nie jest prawdziwie spójny), aby utworzyć serię obrazów do wideo, które można by połączyć w sekwencję.
Na obecnym poziomie rozwoju, ten podejście nie produkuje wiarygodnych ujęć następnego; a w każdym razie, już odeszliśmy od auteur marzenia, dodając warstwę złożoności.
Możemy dodatkowo użyć Low Rank Adaptation (LoRA) modeli, specjalnie wytrenowanych na postaciach, rzeczach lub środowiskach, aby utrzymać lepszą spójność między ujęciami.
Jednakże, jeśli postać chce pojawić się w nowym kostiumie, zwykle wymaga to wytrenowania nowego LoRA, który uosabia postać ubraną w ten strój (chociaż podpojęcia, takie jak “czerwona sukienka”, mogą być wytrenowane w poszczególnych LoRAs, wraz z odpowiednimi obrazami, nie zawsze są łatwe do pracy).
To dodaje znaczną złożoność, nawet do otwierającej sceny filmu, gdzie osoba wstaje z łóżka, ubiera się, ziewa, spogląda przez okno sypialni i idzie do łazienki, aby umyć zęby.
Taka scena, zawierająca około 4-8 ujęć, może być nakręcona w jeden poranek przy użyciu konwencjonalnych procedur filmowych; na obecnym poziomie rozwoju sztucznej inteligencji, potencjalnie reprezentuje to tygodnie pracy, wiele wytrenowanych LoRAs (lub innych systemów pomocniczych) i znaczną ilość post-produkcji
Alternatywnie, można użyć wideo-do-wideo, gdzie nudne lub CGI-footage jest przekształcane za pomocą podpowiedzi tekstowych w alternatywne interpretacje. Runway oferta takiego systemu, na przykład.
Przykład interpretacji CGI (po lewej) przekształconej w eksperymentie wideo-do-wideo z użyciem Runway przez Mathieu Visnjevec – Źródło: https://www.linkedin.com/feed/update/urn:li:activity:7240525965309726721/
Istnieją dwa problemy tutaj: już musisz tworzyć podstawowe nagranie, więc już robisz film dwukrotnie, nawet jeśli używasz syntetycznego systemu, takiego jak UnReal’s MetaHuman.
Jeśli tworzysz modele CGI (jak na klipie powyżej) i używasz ich w transformacji wideo-do-obrazu, ich spójność między ujęciami nie może być polegana.
To dlatego, że modele dyfuzji wideo nie widzą “dużej pictures” – raczej, tworzą nowy klatkę na podstawie poprzedniej klatki/i, a w niektórych przypadkach, biorą pod uwagę pobliską przyszłą klatkę; ale, aby porównać ten proces do gry w szachy, nie mogą myśleć “o dziesięć ruchów do przodu” i nie mogą pamiętać dziesięciu ruchów wstecz.
Po drugie, model dyfuzji nadal będzie miał trudności z utrzymaniem spójnego wyglądu na przestrzeni ujęć, nawet jeśli uwzględnisz wiele LoRAs dla postaci, środowiska i stylu oświetlenia, z powodów wymienionych na początku tej sekcji.
2: Nie możesz edytować ujęcia łatwo
Jeśli przedstawiasz postać idącą ulicą przy użyciu starych metod CGI, i chcesz zmienić jakiś aspekt ujęcia, możesz dostosować model i ponownie go wyrenderować.
Jeśli jest to rzeczywiste nagranie, po prostu resetujesz i kręcisz je ponownie, z odpowiednimi zmianami.
Jednakże, jeśli wytworzyłeś ujęcie gen-AI, które kochasz, ale chcesz zmienić jeden aspekt z niego, możesz to osiągnąć tylko przy użyciu mozolnych metod post-produkcji opracowanych w ciągu ostatnich 30-40 lat: CGI, rotoskopia, modelowanie i matowanie – wszystkie są pracochłonne i drogie, czasochłonne procedury.
Sposób, w jaki modele dyfuzji działają, po prostu zmiana jednego aspektu podpowiedzi tekstowej (nawet w multimodalnej podpowiedzi, gdzie dostarczasz pełne źródłowe obrazu) spowoduje zmianę wielu aspektów wygenerowanego wyniku, prowadząc do gry “whack-a-mole”.
3: Nie możesz polegać na prawach fizyki
Tradycyjne metody CGI oferują różnorodne algorytmiczne modele fizyki, które mogą symulować takie rzeczy, jak dynamika płynów, ruch gazowy, kinematyka odwrotna (dokładne modelowanie ruchu ludzkiego), dynamika tkanin, wybuchy i różne inne zjawiska świata rzeczywistego.
Jednakże, metody oparte na dyfuzji, jak widzieliśmy, mają krótką pamięć, i również ograniczony zakres priors ruchu (przykłady takich działań, zawarte w zbiorze danych szkoleniowych) do dyspozycji.
W wcześniejszej wersji strony internetowej OpenAI dla systemu generatywnego Sora, firma przyznała, że Sora ma ograniczenia w tym zakresie (chociaż ten tekst został od tego czasu usunięty):
‘[Sora] może mieć trudności z symulacją fizyki złożonej sceny i może nie zrozumieć konkretnych przypadków przyczyny i skutku (na przykład: ciastko nie może wykazywać śladu po tym, jak postać je ugryzie).
‘Model może również mieć trudności ze zrozumieniem szczegółów przestrzennych zawartych w podpowiedzi, takich jak rozróżnianie lewej i prawej strony, lub może mieć trudności z dokładnymi opisami zdarzeń, które rozgrywają się w czasie, takimi jak konkretna trajektoria kamery.’
Praktyczne zastosowanie różnych systemów generatywnych wideo ujawnia podobne ograniczenia w przedstawianiu dokładnej fizyki. Jednak pewne powszechne zjawiska fizyczne, takie jak wybuchy, wydają się być lepiej reprezentowane w ich zbiorach danych szkoleniowych.
Niektóre osadzenia priors ruchu, albo wytrenowane w modelu generatywnym, albo wprowadzone z źródłowego wideo, zajmują trochę czasu (takie jak osoba wykonująca złożoną i niepowtarzalną sekwencję taneczną w ozdobnym kostiumie) i, ponownie, model dyfuzji będzie miał tendencję do transformacji contenu (identyfikacja twarzy, szczegóły kostiumu itp.) do czasu, gdy ruch zostanie zakończony. Jednak LoRAs mogą złagodzić to, w pewnym stopniu.
Naprawienie w postprodukcji
Istnieją inne słabości czystej generacji wideo AI, takie jak trudności w przedstawianiu szybkich ruchów, oraz ogólny i bardziej palący problem uzyskania spójności czasowej w wideo wyjściowym.
Ponadto, tworzenie konkretnych występów twarzy jest praktycznie sprawą szczęścia w generatywnym wideo, jak również synchronizacja ust do dialogu.
W obu przypadkach, użycie systemów pomocniczych, takich jak LivePortrait i AnimateDiff, staje się coraz bardziej popularne w społeczności VFX, ponieważ pozwala to na przeniesienie co najmniej ogólnych wyrazów twarzy i synchronizacji ust do istniejącego wygenerowanego wideo.
Przykład transferu wyrazu (prowadzący wideo w lewym dolnym rogu) nakładanego na wideo docelowe z użyciem LivePortrait. Wideo pochodzi od Generative Z TunisiaGenerative. Zobacz pełną wersję w lepszej jakości na https://www.linkedin.com/posts/genz-tunisia_digitalcreation-liveportrait-aianimation-activity-7240776811737972736-uxiB/?
Dalej, wiele złożonych rozwiązań, wykorzystujących narzędzia takie jak Stable Diffusion GUI ComfyUI i profesjonalne aplikacje komponujące i manipulujące Nuke, a także manipulacja przestrzenią ukrytą, pozwalają praktykom AI VFX na uzyskanie większej kontroli nad wyrazem twarzy i postawą.
Chociaż opisuje proces animacji twarzy w ComfyUI jako “mękę”, specjalista VFX Francisco Contreras opracował taki proces, który pozwala na nakładanie fonemów ust i innych aspektów przedstawienia twarzy/głowy
Stable Diffusion, wspomagany przez przepływ pracy ComfyUI zasilany przez Nuke, pozwolił specjaliście VFX Francisco Contreras na uzyskanie niezwykłej kontroli nad aspektami twarzy. Zobacz pełne wideo w lepszej jakości na https://www.linkedin.com/feed/update/urn:li:activity:7243056650012495872/
Wnioski
Żadne z powyższych nie wróży dobrze dla perspektywy pojedynczego użytkownika generującego spójne i fotorealistyczne pełnometrażowe filmy, z realistycznym dialogiem, synchronizacją ust, występami, środowiskami i ciągłością.
Ponadto, przeszkody opisane tutaj, przynajmniej w odniesieniu do modeli generatywnych wideo opartych na dyfuzji, nie są koniecznie rozwiązywalne “za minutę”, pomimo komentarzy na forum i uwagi medialnej, które twierdzą, że tak jest. Ograniczenia te wydają się być wewnętrzne dla architektury.
W badaniach nad syntezą AI, jak we wszystkich badaniach naukowych, genialne pomysły okazjonalnie olśniewają nas swoim potencjałem, tylko po to, by dalsze badania ujawniły ich fundamentalne ograniczenia.
W przestrzeni generatywnej/syntetycznej to już się wydarzyło z sieciami generatywnymi przeciwnymi (GAN) i polami promieniowania neuronowego (NeRF), które ostatecznie okazały się bardzo trudne do instrumentalizacji w systemy komercyjne, pomimo lat badań akademickich w tym kierunku. Te technologie pojawiają się teraz najczęściej jako składniki alternatywnych architektur.
Bardzo możliwe, że studia filmowe mogą mieć nadzieję, że szkolenie na legalnie udostępnionych katalogach filmowych może wyeliminować artystów VFX, AI dodaje role do siły roboczej w tej chwili.
Czy systemy wideo oparte na dyfuzji mogą być naprawdę przekształcone w generatory filmowe z narracją spójną i fotorealistyczną, czy cała sprawa jest po prostu kolejnym pościgiem alchemicznym, powinno się okazać w ciągu najbliższych 12 miesięcy.
Może być konieczne całkowicie nowe podejście; lub może splatowanie Gausowskie (GSplat), które zostało opracowane na początku lat 90. i które ostatnio zyskało na popularności w przestrzeni syntezy obrazu, może stanowić potencjalną alternatywę dla generacji wideo opartej na dyfuzji.
Ponieważ GSplat potrzebował 34 lat, aby zyskać uznanie, jest również możliwe, że starsi kandydaci, tacy jak NeRF i GAN, oraz nawet modele dyfuzji ukrytej – są jeszcze wczesne.
* Chociaż funkcja AI Storyboard Kaibera oferuje taką funkcjonalność, wyniki, które widziałem, nie są jakości produkcyjnej.
Martin Anderson jest byłym szefem treści naukowo-badawczych w metaphysic.ai
Po raz pierwszy opublikowano w poniedziałek, 23 września 2024












