Kąt Andersona
W kierunku pełnej kontroli w generowaniu filmów wideo za pomocą sztucznej inteligencji

Modele filmowe, takie jak Hunyuan i Wan 2.1, są potężne, ale nie oferują użytkownikom takiego poziomu kontroli, jaki jest wymagany w produkcji filmowej i telewizyjnej (szczególnie w produkcji efektów wizualnych).
W profesjonalnych studiach efektów wizualnych modele open-source, takie jak te, oraz wcześniejsze modele oparte na obrazach (a nie na filmach), takie jak Stable Diffusion, Kandinsky i Flux, są zwykle używane wraz z zestawem narzędzi wspomagających, które adaptują ich surowe dane wyjściowe do konkretnych potrzeb twórczych. Gdy reżyser mówi: “To wygląda dobrze, ale czy możemy to trochę zmienić?”, nie możesz odpowiedzieć, że model nie jest wystarczająco dokładny, aby obsłużyć takie prośby.
Zamiast tego zespół AI VFX użyje szeregu tradycyjnych CGI i technik kompozycyjnych, wraz z procedurami i przepływami pracy opracowanymi w czasie, aby spróbować posunąć granice syntezy wideo o krok dalej.
Podobnie, model filmowy jest jak domyślna instalacja przeglądarki internetowej, takiej jak Chrome; robi wiele pracy, ale jeśli chcesz, aby dostosował się do twoich potrzeb, a nie odwrotnie, będziesz potrzebować pewnych wtyczek.
Kontrola
W świecie syntezy obrazu opartej na dyfuzji najważniejszym takim systemem trzeciej strony jest ControlNet.
ControlNet to technika dodawania strukturalnej kontroli do modeli generatywnych opartych na dyfuzji, umożliwiająca użytkownikom kierowanie generowaniem obrazu lub filmu za pomocą dodatkowych danych wejściowych, takich jak mapy krawędzi, mapy głębi lub informacje o pozie.

Różne metody ControlNet umożliwiają generowanie obrazu z mapy głębi (pierwszy wiersz), segmentację semantyczną (dolny lewy) i generowanie obrazu z informacjami o pozie ludzi i zwierząt (dolny lewy).
Zamiast polegać wyłącznie na podpowiedziach tekstowych, ControlNet wprowadza oddzielne gałęzie sieci neuronowej, czyli adaptory, które przetwarzają te sygnały warunkowe, zachowując przy tym zdolności generatywne modelu podstawowego.
To umożliwia dostosowane dane wyjściowe, które są bardziej zgodne z określeniami użytkownika, co sprawia, że jest szczególnie przydatne w aplikacjach, w których wymagana jest precyzyjna kompozycja, struktura lub kontrola ruchu:

Z podpowiedzią pozy, można uzyskać różne rodzaje dokładnych danych wyjściowych za pomocą ControlNet. Źródło: https://arxiv.org/pdf/2302.05543
Jednak ramy adapterów tego rodzaju działają zewnętrznie na zestawie procesów neuronowych, które są bardzo wewnętrznie ukierunkowane. Podejścia te mają kilka wad.
Po pierwsze, adaptory są szkolone niezależnie, co prowadzi do konfliktów gałęzi, gdy łączy się wiele adapterów, co może prowadzić do obniżonej jakości generowania.
Po drugie, wprowadzają nadmiarowość parametrów, wymagając dodatkowych obliczeń i pamięci dla każdego adaptera, co sprawia, że skalowanie jest niewydajne.
Po trzecie, pomimo ich elastyczności, adaptory często dają pod-optymalne wyniki w porównaniu z modelami, które są w pełni dostosowane do generowania wielu warunków. Te problemy sprawiają, że metody oparte na adapterach są mniej skuteczne w zadaniach wymagających bezproblemowej integracji wielu sygnałów sterujących.
Idealnie, możliwości ControlNet powinny być szkolone rodzimie w modelu, w sposób modułowy, który mógłby pomieścić późniejsze i bardzo oczekiwane innowacje, takie jak jednoczesna generacja wideo i audio lub rodzime możliwości synchronizacji ust.
Jak jest teraz, każdy dodatkowy element funkcjonalności reprezentuje albo zadanie post-produkcyjne, albo procedurę nie-rodzimą, która musi nawigować wrażliwe i ściśle powiązane wagi modelu podstawowego.
FullDiT
W tym impasie pojawia się nowa propozycja z Chin, która zakłada system, w którym środki w stylu ControlNet są wbudowane bezpośrednio w model generatywny wideo w czasie szkolenia, zamiast być traktowane jako późniejsza myśl.

Z nowego artykułu: podejście FullDiT może uwzględniać nakładanie tożsamości, głębię i ruch kamery w generacji rodzimej i może przywołać dowolną kombinację tych elementów jednocześnie. Źródło: https://arxiv.org/pdf/2503.19907
Oznaczone jako FullDiT, nowe podejście łączy warunki wielozadaniowe, takie jak przeniesienie tożsamości, mapowanie głębi i ruch kamery, w integralną część wyszkolonego modelu generatywnego wideo, dla którego autorzy stworzyli model prototypowy i towarzyszące klipy wideo na stronie projektu.
W poniższym przykładzie widzimy generacje, które uwzględniają ruch kamery, informacje o tożsamości i informacje tekstowe (tj. podpowiedzi użytkownika):
Kliknij, aby odtworzyć. Przykłady nakładania kontroli użytkownika w stylu ControlNet z wykorzystaniem tylko rodzimego modelu podstawowego. Źródło: https://fulldit.github.io/
Należy zauważyć, że autorzy nie proponują swojego eksperymentalnego modelu szkoleniowego jako funkcjonalnego modelu podstawowego, ale raczej jako dowód pojęciowy dla modeli rodzimych text-to-video (T2V) i image-to-video (I2V), które oferują użytkownikom więcej kontroli niż tylko podpowiedź obrazu lub podpowiedź tekstową.
Ponieważ nie ma jeszcze podobnych modeli, badacze stworzyli nowy benchmark zatytułowany FullBench, do oceny wideo wielozadaniowych, i twierdzą, że osiągnęli najlepsze wyniki w testach, które sami opracowali w porównaniu z poprzednimi podejściami. Jednakże, ponieważ FullBench został opracowany przez samych autorów, jego obiektywność nie została przetestowana, a jego zestaw danych liczący 1 400 przypadków może być zbyt ograniczony do szerszych wniosków.
Być może najbardziej interesującym aspektem architektury przedstawionej w artykule jest jej potencjał do uwzględnienia nowych typów kontroli. Autorzy stwierdzają:
‘W tej pracy badaliśmy tylko warunki kontroli kamery, tożsamości i informacji o głębi. Nie badaliśmy dalej innych warunków i modalności, takich jak audio, mowa, chmura punktów, prostokąty obiektów, przepływ optyczny itp. Chociaż projekt FullDiT może bezproblemowo integrować inne modalności z minimalnymi modyfikacjami architektury, to w jaki sposób szybko i efektywnie dostosować istniejące modele do nowych warunków i modalności jest nadal ważnym pytaniem, które wymaga dalszego zbadania.’
Mimo że badacze przedstawiają FullDiT jako krok naprzód w generowaniu wideo wielozadaniowego, należy uwzględnić, że ta nowa praca opiera się na istniejących architekturach, a nie wprowadza fundamentalnie nowej idei.
Niemniej jednak FullDiT obecnie stoi samodzielnie (według mojej wiedzy) jako model filmowy z wbudowanymi funkcjami w stylu ControlNet – i dobrze widzieć, że proponowana architektura może pomieścić późniejsze innowacje również.
Kliknij, aby odtworzyć. Przykłady ruchu kamery sterowanego przez użytkownika, ze strony projektu.
Nowy artykuł zatytułowany FullDiT: Wielozadaniowy model generatywny wideo z pełną uwagą, pochodzi od dziewięciu badaczy z Kuaishou Technology i The Chinese University of Hong Kong. Strona projektu znajduje się tutaj, a nowy benchmark danych jest dostępny na Hugging Face.
Metoda
Autorzy twierdzą, że zunifikowana mechanizm uwagi FullDiT umożliwia silniejsze uczenie reprezentacji między modalnościami poprzez przechwycenie zarówno relacji przestrzennych, jak i czasowych między warunkami:

Według nowego artykułu, FullDiT integruje wiele warunków wejściowych za pomocą pełnej uwagi, konwertując je w zunifikowaną sekwencję. W przeciwieństwie do modeli opartych na adapterach (najbardziej na lewo), które używają oddzielnych modułów dla każdego wejścia, co prowadzi do redundancji, konfliktów i słabszych wyników.
W przeciwieństwie do układów opartych na adapterach, które przetwarzają każdy strumień wejściowy oddzielnie, ta współdzielona struktura uwagi unika konfliktów gałęzi i redukuje nadmiarowość parametrów. Twierdzą również, że architektura może skalować do nowych typów wejściowych bez znaczącej przebudowy – i że schemat modelu pokazuje oznaki uogólniania do kombinacji warunków, które nie były widziane podczas szkolenia, takich jak łączenie ruchu kamery z tożsamością postaci.
Kliknij, aby odtworzyć. Przykłady generowania tożsamości ze strony projektu.
W architekturze FullDiT wszystkie warunki wejściowe – takie jak tekst, ruch kamery, tożsamość i głębia – są najpierw konwertowane w zunifikowany format tokena. Te tokeny są następnie łączone w jedną długą sekwencję, która jest przetwarzana przez stos transformerów z pełną uwagą. To podejście jest zgodne z poprzednimi pracami, takimi jak Open-Sora Plan i Movie Gen.
Ten projekt pozwala modelowi nauczyć relacje czasowe i przestrzenne wspólnie we wszystkich warunkach. Każdy blok transformer działa nad całą sekwencją, umożliwiając dynamiczne interakcje między modalnościami bez polegania na oddzielnych modułach dla każdego wejścia – i, jak zauważyliśmy, architektura jest zaprojektowana do rozszerzalności, co znacznie ułatwia włączanie dodatkowych sygnałów sterujących w przyszłości, bez znaczących zmian strukturalnych.
Potęga Trzech
FullDiT konwertuje każdy sygnał sterujący w zunifikowany format tokena, aby wszystkie warunki mogły być przetwarzane razem w zunifikowanej ramie uwagi. Dla ruchu kamery model koduje sekwencję parametrów zewnętrznych – takich jak położenie i orientacja – dla każdego klatki. Te parametry są oznaczone czasem i projekowane w wektory osadzania, które odzwierciedlają naturę czasową sygnału.
Informacje o tożsamości są traktowane inaczej, ponieważ są one wewnętrznie przestrzenne, a nie czasowe. Model używa map tożsamości, które wskazują, które postacie są obecne w których częściach każdej klatki. Te mapy są podzielone na patche, z których każdy jest projekowany w wektor osadzania, który przechwytuje przestrzenne wskazówki tożsamości, pozwalając modelowi skojarzyć określone regiony klatki z określonymi jednostkami.
Głębia jest sygnałem przestrzennym i czasowym, a model traktuje ją, dzieląc filmy głębi na 3D patche, które rozciągają się zarówno w przestrzeni, jak i w czasie. Te patche są następnie osadzane w sposób, który zachowuje ich strukturę w czasie.
Gdy są osadzane, wszystkie te tokeny warunkowe (kamera, tożsamość i głębia) są łączone w jedną długą sekwencję, pozwalając FullDiT na przetwarzanie ich razem za pomocą pełnej uwagi. To współdzielone przedstawienie umożliwia modelowi nauczenie interakcji między modalnościami i w czasie bez polegania na izolowanych strumieniach przetwarzania.
Dane i testy
Podczas szkolenia FullDiT autorzy wykorzystali wybiórczo adnotowane zestawy danych dostosowane do każdego typu warunku, zamiast wymagać, aby wszystkie warunki były obecne jednocześnie.
Dla warunków tekstowych inicjatywa ta podąża za podejściem do adnotacji strukturalnej, przedstawionym w projekcie MiraData.

Kolekcja wideo i potok adnotacji z projektu MiraData. Źródło: https://arxiv.org/pdf/2407.06358
Dla ruchu kamery głównym źródłem danych była baza danych RealEstate10K, ze względu na jej wysokiej jakości adnotacje parametrów kamery.
Jednak autorzy zauważyli, że szkolenie wyłącznie na statycznych zestawach danych kamery, takich jak RealEstate10K, tendencję do redukowania dynamicznych ruchów obiektów i ludzi w generowanych filmach. Aby przeciwdziałać temu, przeprowadzili dodatkowe dostosowanie przy użyciu wewnętrznych zestawów danych, które zawierały więcej dynamicznych ruchów kamery.
Adnotacje tożsamości zostały wygenerowane przy użyciu potoku opracowanego dla projektu ConceptMaster, który pozwolił na efektywną filtrację i ekstrakcję drobnych informacji o tożsamości.

Ramka ConceptMaster jest zaprojektowana do rozwiązania problemów rozłączenia tożsamości, zachowując przy tym wierność pojęciową w filmach dostosowanych. Źródło: https://arxiv.org/pdf/2501.04698
Adnotacje głębi zostały uzyskane z bazy danych Panda-70M przy użyciu Depth Anything.
Optymalizacja poprzez porządkowanie danych
Autorzy wdrożyli również harmonogram szkolenia, wprowadzając bardziej wymagające warunki wcześniej w szkoleniu, aby upewnić się, że model nabył silne reprezentacje przed dodaniem prostszych zadań. Porządek szkolenia przebiegał od tekstu do kamery, a następnie tożsamości, i wreszcie głębi, z łatwiejszymi zadaniami wprowadzanymi później i z mniejszą liczbą przykładów.
Autorzy podkreślają wartość porządkowania obciążenia w ten sposób:
‘Podczas fazy pre-szkolenia zauważyliśmy, że bardziej wymagające zadania wymagają dłuższego czasu szkolenia i powinny być wprowadzane wcześniej w procesie uczenia. Te wymagające zadania obejmują złożone rozkłady danych, które różnią się znacznie od danych wyjściowych wideo, wymagając, aby model posiadał wystarczającą pojemność, aby dokładnie uchwycić i reprezentować je.
‘Odwracając, wprowadzanie łatwiejszych zadań zbyt wcześnie może spowodować, że model będzie się uczył ich najpierw, ponieważ zapewniają one natychmiastową informację zwrotną optymalizacji, co utrudnia zbieżność bardziej wymagających zadań.’

Ilustracja porządku szkolenia danych przyjętego przez badaczy, z czerwonym wskazaniem większej objętości danych.
Po wstępnym szkoleniu ostateczna faza dostosowania dalej udoskonaliła model, aby poprawić jakość wizualną i dynamikę ruchu. Następnie szkolenie przebiegało zgodnie ze standardową ramą dyfuzji*:
hałas dodany do latencji wideo, a model uczył się przewidywać i usuwać go, używając osadzonych tokenów warunkowych jako wskazówek.
Aby skutecznie ocenić FullDiT i zapewnić uczciwe porównanie z istniejącymi metodami, a w przypadku braku dostępności jakiegokolwiek innego odpowiedniego benchmarku, autorzy wprowadzili FullBench, zestaw benchmarkowy składający się z 1 400 odrębnych przypadków testowych.

Przykład eksploratora danych dla nowego benchmarku FullBench. Źródło: https://huggingface.co/datasets/KwaiVGI/FullBench
Każdy punkt danych zapewniał adnotacje danych wyjściowych dla różnych sygnałów warunkowych, w tym ruchu kamery, tożsamości i głębi.
Metryki
Autorzy oceniali FullDiT przy użyciu dziesięciu metryk, obejmujących pięć głównych aspektów wydajności: wyrównanie tekstu, kontrolę kamery, podobieństwo tożsamości, dokładność głębi i ogólną jakość wideo.
Wyrównanie tekstu było mierzone przy użyciu podobieństwa CLIP, podczas gdy kontrola kamery była oceniana za pomocą błędu obrotu (RotErr), błędu translacji (TransErr) i spójności ruchu kamery (CamMC), zgodnie z podejściem CamI2V (w projekcie CameraCtrl).
Podobieństwo tożsamości było oceniane przy użyciu DINO-I i CLIP-I, a dokładność kontroli głębi była ilościowo mierzona przy użyciu średniego błędu bezwzględnego (MAE).
Jakość wideo była oceniana przy użyciu trzech metryk z MiraData: podobieństwa CLIP na poziomie klatki dla gładkości; odległości ruchu optycznego dla dynamiki; i ocen estetycznych LAION-Aesthetic dla atrakcyjności wizualnej.
Szkolenie
Autorzy szkolili FullDiT przy użyciu wewnętrznego (nieujawnionego) modelu dyfuzji text-to-video zawierającego około jednego miliarda parametrów. Zamierzenie było celowe, aby wybrać skromną liczbę parametrów, aby utrzymać uczciwość w porównaniach z poprzednimi metodami i zapewnić odtwarzalność.
Ponieważ filmy szkoleniowe różniły się długością i rozdzielczością, autorzy standaryzowali każdą partię przez zmianę rozdzielczości i wypełnienie filmów do wspólnej rozdzielczości, wybierając 77 klatek na sekwencję i używając uwagi i masek strat, aby zoptymalizować skuteczność szkolenia.
Użyto optymalizatora Adam z szybkością uczenia 1×10−5 na klastrze 64 procesorów GPU NVIDIA H800, co dało łączną objętość pamięci VRAM 5 120 GB (zwróć uwagę, że w społecznościach entuzjastów syntezy, 24 GB na RTX 3090 jest nadal uważane za luksusowy standard).
Model został szkolony przez około 32 000 kroków, uwzględniając do trzech tożsamości na film, wraz z 20 klatkami warunków kamery i 21 klatkami warunków głębi, obie wybrane równomiernie z 77 klatek.
Podczas inferencji model generował filmy w rozdzielczości 384×672 pikseli (około pięć sekund przy 15 klatkach na sekundę) z 50 krokami inferencji dyfuzji i skalą wskazówek bezklasowych o wartości pięć.
Poprzednie metody
Dla oceny kamery-do-wideo autorzy porównali FullDiT z MotionCtrl, CameraCtrl i CamI2V, przy czym wszystkie modele były szkolone przy użyciu bazy danych RealEstate10k, aby zapewnić spójność i uczciwość.
W przypadku generowania warunkowanego tożsamością, ponieważ nie było porównywalnych modeli wielo-tożsamościowych open-source, model został porównany z modelem 1B-parametrowym ConceptMaster, używając tych samych danych szkoleniowych i architektury.
Dla zadań głębi-do-wideo porównania zostały przeprowadzone z Ctrl-Adapter i ControlVideo.

Wyniki ilościowe dla generowania wideo jednego zadania. FullDiT został porównany z MotionCtrl, CameraCtrl i CamI2V dla generowania kamery-do-wideo; ConceptMaster (wersja 1B-parametrowa) dla generowania tożsamości-do-wideo; i Ctrl-Adapter i ControlVideo dla generowania głębi-do-wideo.
Wyniki wskazują, że FullDiT, pomimo obsługi wielu sygnałów warunkowych jednocześnie, osiągnął najlepsze wyniki w metrykach związanych z kontrolą tekstu, ruchu kamery, tożsamości i głębi.
W ogólnych metrykach jakości system ogólnie przewyższał inne metody, chociaż jego gładkość była nieco niższa niż ConceptMaster. Tutaj autorzy komentują:
‘Gładkość FullDiT jest nieco niższa niż ConceptMaster, ponieważ obliczanie gładkości opiera się na podobieństwie CLIP między sąsiednimi klatkami. Ponieważ FullDiT wykazuje znacznie większą dynamikę w porównaniu z ConceptMaster, metryka gładkości jest wpływana przez duże zmiany między sąsiednimi klatkami.
‘Dla oceny estetycznej, ponieważ model oceny faworyzuje obrazy w stylu malarskim, a ControlVideo zwykle generuje filmy w tym stylu, osiąga wysoką ocenę estetyczną.’
Co się tyczy porównania jakościowego, być może lepiej byłoby odnieść się do próbek wideo na stronie projektu FullDiT, ponieważ przykłady w PDF są nieuniknienie statyczne (i również zbyt duże, aby je w całości odtworzyć tutaj).

Pierwsza sekcja wyników jakościowych w PDF. Proszę odnieść się do oryginalnego artykułu, aby zobaczyć dodatkowe przykłady, które są zbyt obszerne, aby je tutaj odtworzyć.
Autorzy komentują:
‘FullDiT wykazuje lepsze zachowanie tożsamości i generuje filmy o lepszej dynamice i jakości wizualnej w porównaniu z [ConceptMaster]. Ponieważ ConceptMaster i FullDiT są szkolone na tym samym rdzeniu, to podkreśla skuteczność wstrzyknięcia warunków z pełną uwagą.
‘…Inne wyniki demonstrują lepszą sterowalność i jakość generowania FullDiT w porównaniu z istniejącymi metodami głębi-do-wideo i kamery-do-wideo.’

Sekcja przykładów danych wyjściowych FullDiT z wieloma sygnałami. Proszę odnieść się do oryginalnego artykułu i strony projektu, aby zobaczyć dodatkowe przykłady.
Wnioski
Mimo że FullDiT jest interesującym wkroczeniem w bardziej funkcjonalny typ modelu filmowego, trudno powiedzieć, czy popyt na funkcjonalności w stylu ControlNet kiedykolwiek uzasadni ich wdrożenie na dużą skalę, przynajmniej dla projektów FOSS, które będą musiały stawić czoła ogromnej ilości mocy obliczeniowej GPU, niezbędnej do ich obsługi, bez komercyjnego wsparcia.
Głównym wyzwaniem jest to, że korzystanie z systemów takich jak Głębia i Poza wymaga nietrywialnej znajomości dość złożonych interfejsów użytkownika, takich jak ComfyUI. Wydaje się więc, że funkcjonalny model FOSS tego rodzaju jest najbardziej prawdopodobny do rozwoju przez grupę mniejszych firm VFX, które nie mają pieniędzy (lub woli, biorąc pod uwagę, że takie systemy są szybko przestarzałe przez aktualizacje modelu) na opracowanie i przeszkolenie takiego modelu za zamkniętymi drzwiami.
Z drugiej strony, systemy API-kierowane “wynajmij sztuczną inteligencję” mogą być dobrze zmotywowane do opracowania prostszych i bardziej przyjaznych użytkownikom metod interpretacyjnych dla modeli, w które wdrożono systemy kontroli.
Kliknij, aby odtworzyć. Kontrola Głębia+Tekst nałożona na generację wideo z wykorzystaniem FullDiT.
* Autorzy nie określają żadnego znanego modelu podstawowego (tj. SDXL itp.)
Pierwotnie opublikowane w czwartek, 27 marca 2025












