Kąt Andersona
AI Wideo Doskonale Przezwycięża Zdjęcia Kociego Selfie

Generatory wideo AI często dają wyniki, które są bliskie, ale nie całkiem trafne, jeśli chodzi o dostarczanie tego, czego chce tekstowy podpowiedź. Ale nowe wysokopoziomowe rozwiązanie sprawia, że wszystko się zmienia.
Systemy generatywne wideo często mają trudności z tworzeniem filmów, które są naprawdę kreatywne lub dzikie, i często nie spełniają oczekiwań użytkowników co do ich tekstowych podpowiedzi.
Częścią powodu tego jest splątanie – fakt, że modele widzenia/języka muszą kompromisować, jak długo trenują na danych źródłowych. Za mało treningu, a pojęcia są elastyczne, ale nie w pełni ukształtowane – za dużo, a pojęcia są dokładne, ale nie są już wystarczająco elastyczne, aby włączyć je do nowych kombinacji.
Można zrozumieć to z filmu osadzonego poniżej. Po lewej stronie jest rodzaj kompromisu pół-etatu, jaki wiele systemów AI dostarcza w odpowiedzi na wymagającą podpowiedź (podpowiedź jest na górze filmu we wszystkich czterech przykładach), która prosi o jakąś kontrastację elementów, która jest zbyt fantastyczna, aby była prawdziwym przykładem treningu. Po prawej stronie jest wyjście AI, które lepiej trzyma się podpowiedzi:
Kliknij, aby odtworzyć (bez dźwięku). Po prawej stronie widzimy ‘factorized’ WAN 2.2, który naprawdę dostarcza to, czego chcą podpowiedzi, w porównaniu z mglistymi interpretacjami ‘vanilla’ Wan 2.2. na lewej stronie. Proszę odnieść się do plików źródłowych wideo, aby uzyskać lepszą rozdzielczość i więcej przykładów, chociaż wybrane wersje widoczne tutaj nie istnieją na stronie projektu i zostały zmontowane dla tego artykułu. Źródło
Dobrze, chociaż musimy wybaczyć klaping duck’s human hands (!), jest jasne, że przykłady po prawej stronie przestrzegają oryginalnej tekstowej podpowiedzi znacznie lepiej niż te po lewej stronie.
Co ciekawe, obie architektury są podstawowo takie same – popularna i bardzo zdolna Wan 2.2, chińskie wydanie, które zyskało znaczną popularność w społecznościach open source i hobbystycznych w tym roku.
Różnica polega na tym, że drugi generatywny pipeline jest factorized, co w tym przypadku oznacza, że duży model językowy (LLM) został użyty do ponownej interpretacji pierwszego (seed) klatki wideo, aby było łatwiej dla systemu dostarczyć to, czego chce użytkownik.
Te ‘wizualne kotwiczenie’ obejmuje wstrzyknięcie obrazu stworzonego z tego LLM-u wzmocnionego podpowiedzi do generatywnego pipeline jako ‘start frame’, i używanie LoRA modelu interpretacyjnego, aby pomóc włączyć ‘intruder’ klatkę do procesu tworzenia wideo.
Wyniki, jeśli chodzi o wierność podpowiedzi, są dość godne uwagi, szczególnie dla rozwiązania, które wydaje się dość eleganckie:
Kliknij, aby odtworzyć (bez dźwięku). Kolejne przykłady ‘factorized’ generacji wideo, które naprawdę trzymają się scenariusza. Proszę odnieść się do plików źródłowych wideo, aby uzyskać lepszą rozdzielczość i więcej przykładów, chociaż wybrane wersje widoczne tutaj nie istnieją na stronie projektu i zostały zmontowane dla tego artykułu.
To rozwiązanie przychodzi w postaci nowego artykułu Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, i jego wideo-obszernego projektu strony internetowej.
Podczas gdy wiele obecnych systemów próbuje poprawić dokładność podpowiedzi, używając modeli językowych do przepisania niejasnych lub niedookreślonych tekstów, nowa praca twierdzi, że ta strategia nadal prowadzi do porażki, gdy wewnętrzna reprezentacja sceny modelu jest wadliwa.
Nawet z szczegółową przepisaną podpowiedzią, modele tekst-wideo często źle komponują kluczowe elementy lub generują niezgodne stanów początkowych, które łamią logikę animacji. Dopóki pierwsza klatka nie odzwierciedla tego, co opisuje podpowiedź, wynikowy film nie może odzyskać, niezależnie od tego, jak dobry jest model ruchu.
Artykuł stwierdza*:
‘[Text-to-video] modele często produkują rozproszone klatki, ale nadal osiągają [wyniki oceny] porównywalne z I2V modelami, wskazując, że ich modelowanie ruchu pozostaje rozsądnym nawet wtedy, gdy wierność sceny jest stosunkowo słaba.
‘[Image-to-Video] modele wykazują komplementarne zachowanie, silne [wyniki oceny] z dokładnymi scenami początkowymi i słabszą spójnością czasową, podczas gdy I2V+text równoważy oba aspekty.
‘To kontrast sugeruje strukturalną niezgodność w obecnych modelach T2V: kotwiczenie sceny i synteza czasowa korzystają z odrębnych indukcyjnych uprzedzeń, ale istniejące architektury próbują uczyć się obu jednocześnie w ramach jednego modelu.’
Porównawcza analiza trybów generacji wykazała, że modele bez jawnej kotwiczenia sceny uzyskały dobre wyniki w modelowaniu ruchu, ale często kompromitowały układ sceny, podczas gdy podejścia warunkowane obrazem wykazywały odwrotny wzorzec:

Porównanie trybów generacji wideo na dwóch zestawach danych, pokazujące, że I2V+text osiąga najlepszą jakość klatek (FID) i spójność czasową (FVD), podkreślając korzyść z oddzielenia konstrukcji sceny od ruchu. Źródło
Te wyniki wskazują na strukturalną wadę, w której obecne modele próbują uczyć się układu sceny i animacji w jednym czasie, chociaż oba zadania wymagają różnych rodzajów indukcyjnych uprzedzeń, i są lepiej obsługiwane oddzielnie.
Może najbardziej interesujące jest to, że ten ‘trick’ może potencjalnie być zastosowany do lokalnych instalacji modeli, takich jak Wan 2.1 i 2.2, oraz podobnych modeli dyfuzji wideo, takich jak Hunyuan Video. Anegdotycznie, porównując jakość wyjścia hobbystów z komercyjnymi portalami generatywnymi, takimi jak Kling i Runway, większość głównych dostawców API poprawia oferty open source, takie jak WAN, za pomocą LoR, i – wydaje się – z takimi trickami, jak te widoczne w nowym artykule. Dlatego to podejście może reprezentować dogonienie dla kontyngentu FOSS.
Testy przeprowadzone dla metody wskazują, że to proste i modułowe podejście oferuje nowy stan sztuki w T2V-CompBench benchmarku, znacznie poprawiając wszystkie przetestowane modele. Autorzy zauważają w podsumowaniu, że chociaż ich system radykalnie poprawia wierność, nie rozwiązuje (ani nie jest przeznaczony do rozwiązania) dryfu tożsamości, który jest obecnie plagą badań nad generatywną sztuczną inteligencją.
Nowy artykuł pochodzi od czterech badaczy z Ecole Polytechnique Fédérale de Lausanne (EPFL) w Szwajcarii.
Metoda i Dane
Centralną tezą nowej techniki jest to, że modele dyfuzji tekst-wideo (T2V) muszą być ‘zakotwiczone’ w klatkach startowych, które naprawdę pasują do pożądanej tekstowej podpowiedzi.
Aby upewnić się, że model przestrzega klatki startowej, nowa metoda przerywa standardowy proces dyfuzji przez wstrzyknięcie czystego latentu z kotwicy obrazu w czasie zero, zastępując jeden z zwykłych hałaśliwych wejść. To nieznane wejście dezorientuje model na początku, ale z minimalnym LoRA dostrojeniem, uczy się traktować wstrzykniętą klatkę jako stałą wizualną kotwicę, a nie część trajektorii hałasu:

Dwuetapowa metoda kotwiczenia generacji wideo z wizualną kotwicą: Po lewej, model jest dostrojony za pomocą lekkiego LoRA, aby traktować wstrzyknięty czysty latent jako stałe ograniczenie sceny. Po prawej, podpowiedź jest podzielona na podpowiedź dla pierwszej klatki, która jest używana do wygenerowania kotwicy obrazu, który prowadzi wideo.
Podczas wnioskowania metoda przepisuje podpowiedź, aby opisać tylko pierwszą klatkę, używając LLM, aby wyodrębnić prawdopodobny stan sceny na początku, skupiając się na układzie i wyglądzie.
Przepisana podpowiedź jest przekazana generatorowi obrazu, aby wyprodukować kandydującą klatkę kotwiczą (która może być opcjonalnie udoskonalona przez użytkownika). Wybrana klatka jest zakodowana w latent i wstrzyknięta do procesu dyfuzji, zastępując pierwszy krok czasowy, pozwalając modelowi wygenerować resztę wideo podczas pozostawania zakotwiczonego w początkowej scenie – proces, który działa bez wymagania zmian w podstawowej architekturze.
Proces został przetestowany przez stworzenie LoR dla Wan2.2-14B, Wan2.1-1B i CogVideo1.5-5B. Trening LoRA został przeprowadzony na rangę 256, na 5000 losowo wybranych klipach z UltraVideo kolekcji.
Trening trwał 6000 kroków i wymagał 48 godzin GPU† dla Wan-1B i CogVideo-5B, oraz 96 godzin GPU dla Wan-14B. Autorzy zauważają, że Wan-5B rodzinnie obsługuje warunkowanie tylko tekstowe i tekstowo-obrazowe (które są w tym przypadku nakładane na starsze ramy), i dlatego nie wymagały żadnego dostrojenia.
Testy
W eksperymentach przeprowadzonych dla procesu każda tekstowa podpowiedź była najpierw udoskonalona za pomocą Qwen2.5-7B-Instruct, który użył wyniku do wygenerowania szczegółowej ‘seed image’ podpowiedzi zawierającej opis całej sceny. Następnie została ona przekazana do QwenImage, który został zadany do wygenerowania ‘magicznej klatki’, która ma być wstrzyknięta do procesu dyfuzji.
Benchmarki użyte do oceny systemu obejmowały wspomniany T2V-CompBench, testujący zrozumienie kompozycyjne, oceniając, jak dobrze modele zachowują obiekty, atrybuty i działania w spójnej scenie; oraz VBench 2.0, oceniający szersze rozumowanie i spójność w 18 metrykach, pogrupowanych w kreatywność, rozumowanie zdroworozsądkowe, kontrola, ludzka wierność i fizyka:

Przez wszystkie siedem kategorii oceny T2V-CompBench, metoda T2V z kotwicą poprawiła zarówno standardowe, jak i powiększone podstawy T2V dla każdego testowanego modelu, z zyskami sięgającymi do 53,25%. Najlepiej oceniane warianty często dopasowywały lub przewyższały benchmark PixVerse-V3.
Co się tyczy tej pierwszej rundy testów, autorzy stwierdzają*:
‘[Przez] wszystkie modele, dodanie kotwicy obrazu konsekwentnie poprawia wyniki kompozycyjne. Wszystkie mniejsze modele z kotwicą (CogVideo 5B, Wan 5B i Wan 1B) przewyższają większy model T2V Wan 14B.
‘Nasza zaktoryzowana Wan 5B również przewyższa komercyjną linię bazową PixVerse-V3, która jest najlepszym zareportowanym modelem w benchmarku. To pokazuje, że wizualne kotwiczenie znacznie poprawia zrozumienie sceny i działania, nawet w mniejszych modelach.’
‘W ramach każdej rodziny modeli, wersja z kotwicą przewyższa oryginalny model. Godne uwagi jest to, że nasz lekki, zakotwiczony LoRA w Wan 14B osiąga wyniki porównywalne z wariantem I2V 14B (0,661 vs. 0,666), pomimo braku pełnego ponownego treningu.’
Następnie przyszedł VBench2.0:

Metoda T2V z kotwicą konsekwentnie poprawia wyniki VBench 2.0 w kompozycji, rozumowaniu zdroworozsądkowym, kontroli i fizyce, z niektórymi zyskami przekraczającymi 60% – chociaż wierność ludzka pozostała poniżej linii bazowej Veo 3.
Przez wszystkie architektury, podejście z kotwicą poprawiło wyniki we wszystkich kategoriach VBench, z wyjątkiem ludzkiej wierności, która nieznacznie spadła, nawet z powiększaniem podpowiedzi. Wan 5B przewyższył większy Wan 14B, potwierdzając wcześniejsze wyniki T2V-CompBench, że wizualne kotwiczenie przyczyniało się bardziej niż skala.
Chociaż zyski w VBench były konsekwentne, były one mniejsze niż te widoczne w T2V-CompBench, a autorzy przypisują to surowemu systemowi oceny binarnej VBench.
Dla testów jakościowych, artykuł dostarcza statyczne obrazy, ale odnosimy czytelnika do złożonych wideo osadzonych w tym artykule, aby uzyskać jaśniejszy obraz, z zastrzeżeniem, że źródłowe wideo są liczniejsze i bardziej różnorodne, a także posiadają większą rozdzielczość i szczegółowość. Znajdź je tutaj. Co się tyczy wyników jakościowych, artykuł stwierdza:
‘Wideo z kotwicą konsekwentnie wykazują bardziej dokładną kompozycję sceny, silniejsze powiązanie obiektu-atrybutu i jaśniejszy postęp czasowy.’
Metoda z kotwicą pozostała stabilna, nawet gdy liczba kroków dyfuzji została obcięta z 50 do 15, pokazując prawie żadnej utraty wyników w T2V-CompBench. W przeciwieństwie do tego, zarówno podstawy tekstowe, jak i powiększone uległy znacznemu pogorszeniu w tych samych warunkach.
Chociaż redukcja kroków mogłaby teoretycznie potroić szybkość, pełny pipeline generacji stał się tylko 2,1-krotnie szybszy w praktyce, ze względu na stałe koszty związane z generowaniem kotwicy obrazu. Nadal, wyniki wskazują, że kotwiczenie nie tylko poprawia jakość próbek, ale także pomaga stabilizować proces dyfuzji, wspierając szybszą i bardziej wydajną generację bez utraty dokładności.
Strona internetowa projektu dostarcza przykłady porównań między powiększonymi a nową metodą generacji, z których kilka (o niższej rozdzielczości) edytowanych przykładów jest tutaj:
Kliknij, aby odtworzyć (bez dźwięku). Źródła startowe vs. podejście z kotwicą autorów.
Autorzy kończą:
‘Nasze wyniki sugerują, że poprawiona kotwica, a nie tylko zwiększona pojemność, może być równie ważna. Ostatnie postępy w dyfuzji T2V opierają się głównie na zwiększaniu rozmiaru modelu i danych treningowych, ale nawet duże modele często mają trudności z wnioskowaniem o spójnej scenie początkowej z samego tekstu.
‘To kontrastuje z dyfuzją obrazu, gdzie skalowanie jest stosunkowo proste; w modelach wideo każda poprawa architektury musi działać nad dodatkową wymiarem czasowym, co czyni skalowanie znacznie bardziej wymagającym zasobów.
‘Nasze wyniki wskazują, że poprawiona kotwica może uzupełnić skalę, rozwiązując inny wąski gardło: ustanowienie prawidłowej sceny przed rozpoczęciem syntezy ruchu.
‘Poprzez zaktoryzowanie generacji wideo w konstrukcję sceny i modelowanie czasowe, łagodzimy kilka typowych trybów awaryjnych bez wymagania znacznie większych modeli. Uważamy to za komplementarny zasadę projektowania, który może prowadzić przyszłe architektury ku bardziej niezawodnej i ustrukturyzowanej syntezie wideo.’
Podsumowanie
Chociaż problemy splątania są bardzo realne i mogą wymagać dedykowanych rozwiązań (takich jak poprawiona kuracja i ocena dystrybucji przed treningiem), było to odkrywcze, aby zobaczyć, jak zaktoryzowanie ‘rozluźnia’ kilka uporczywych i ‘zablokowanych’ układów podpowiedzi w znacznie bardziej dokładne renderowania – z tylko umiarkowaną warstwą warunkowania LoRA i interwencją znacznie udoskonalonej startowej/seedowej klatki.
Przepaść w zasobach między lokalną inferencją hobbystów a komercyjnymi rozwiązaniami może nie być tak ogromna, jak się wydaje, biorąc pod uwagę, że prawie wszyscy dostawcy starają się racjonalizować swoje znaczne wydatki na zasoby GPU dla konsumentów.
Anegdotycznie, bardzo duża liczba obecnych dostawców generatywnych wideo wydaje się używać nazwanych i ogólnie ‘wzmocnionych’ wersji chińskich modeli FOSS. Główny ‘rów’ każdego z tych ‘pośrednich’ systemów wydaje się polegać na tym, że podjęli trud, aby przeszkolić LoR-y, lub – przy większym koszcie i nieco większej nagrodzie – przeprowadzić pełne dostrojenie wag modelu††.
Wglądy tego rodzaju mogą pomóc w dalszym zamykaniu tej luki, w kontekście sceny wydawniczej, w której Chiny wydają się zdeterminowane (niekoniecznie z altruistycznych lub idealistycznych powodów) do udemokratyzowania sztucznej inteligencji, podczas gdy zachodnie interesy biznesowe mogą wolać, aby rosnący rozmiar modelu i regulacje ostatecznie zastrzegły najlepsze modele za API i wieloma warstwami filtrów treści.
* Autorzy podkreślają, że.
† Artykuł nie określa, jaki GPU został wybrany, ani ile ich zostało użytych.
†† Chociaż podejście LoRA jest bardziej prawdopodobne, zarówno ze względu na ekonomiczną łatwość użycia, jak i dlatego, że pełne wagi, a nie kwantyzowane wagi, nie zawsze są dostępne.
Pierwotnie opublikowane w piątek, 19 grudnia 2025












