KÄ t Andersona
AI Wideo Doskonale PrzezwyciÄÅža ZdjÄcia Kociego Selfie

Generatory wideo AI czÄsto dajÄ wyniki, ktÃģre sÄ bliskie, ale nie caÅkiem trafne, jeÅli chodzi o dostarczanie tego, czego chce tekstowy podpowiedÅš. Ale nowe wysokopoziomowe rozwiÄ zanie sprawia, Åže wszystko siÄ zmienia.
Â
Systemy generatywne wideo czÄsto majÄ trudnoÅci z tworzeniem filmÃģw, ktÃģre sÄ naprawdÄ kreatywne lub dzikie, i czÄsto nie speÅniajÄ oczekiwaÅ uÅžytkownikÃģw co do ich tekstowych podpowiedzi.
CzÄÅciÄ powodu tego jest splÄ tanie â fakt, Åže modele widzenia/jÄzyka muszÄ kompromisowaÄ, jak dÅugo trenujÄ na danych ÅšrÃģdÅowych. Za maÅo treningu, a pojÄcia sÄ elastyczne, ale nie w peÅni uksztaÅtowane â za duÅžo, a pojÄcia sÄ dokÅadne, ale nie sÄ juÅž wystarczajÄ co elastyczne, aby wÅÄ czyÄ je do nowych kombinacji.
MoÅžna zrozumieÄ to z filmu osadzonego poniÅžej. Po lewej stronie jest rodzaj kompromisu pÃģÅ-etatu, jaki wiele systemÃģw AI dostarcza w odpowiedzi na wymagajÄ cÄ podpowiedÅš (podpowiedÅš jest na gÃģrze filmu we wszystkich czterech przykÅadach), ktÃģra prosi o jakÄ Å kontrastacjÄ elementÃģw, ktÃģra jest zbyt fantastyczna, aby byÅa prawdziwym przykÅadem treningu. Po prawej stronie jest wyjÅcie AI, ktÃģre lepiej trzyma siÄ podpowiedzi:
Kliknij, aby odtworzyÄ (bez dÅšwiÄku). Po prawej stronie widzimy âfactorizedâ WAN 2.2, ktÃģry naprawdÄ dostarcza to, czego chcÄ podpowiedzi, w porÃģwnaniu z mglistymi interpretacjami âvanillaâ Wan 2.2. na lewej stronie. ProszÄ odnieÅÄ siÄ do plikÃģw ÅšrÃģdÅowych wideo, aby uzyskaÄ lepszÄ rozdzielczoÅÄ i wiÄcej przykÅadÃģw, chociaÅž wybrane wersje widoczne tutaj nie istniejÄ na stronie projektu i zostaÅy zmontowane dla tego artykuÅu. ÅđrÃģdÅo
Dobrze, chociaÅž musimy wybaczyÄ klaping duckâs human hands (!), jest jasne, Åže przykÅady po prawej stronie przestrzegajÄ oryginalnej tekstowej podpowiedzi znacznie lepiej niÅž te po lewej stronie.
Co ciekawe, obie architektury sÄ podstawowo takie same â popularna i bardzo zdolna Wan 2.2, chiÅskie wydanie, ktÃģre zyskaÅo znacznÄ popularnoÅÄ w spoÅecznoÅciach open source i hobbystycznych w tym roku.
RÃģÅžnica polega na tym, Åže drugi generatywny pipeline jest factorized, co w tym przypadku oznacza, Åže duÅžy model jÄzykowy (LLM) zostaÅ uÅžyty do ponownej interpretacji pierwszego (seed) klatki wideo, aby byÅo Åatwiej dla systemu dostarczyÄ to, czego chce uÅžytkownik.
Te âwizualne kotwiczenieâ obejmuje wstrzykniÄcie obrazu stworzonego z tego LLM-u wzmocnionego podpowiedzi do generatywnego pipeline jako âstart frameâ, i uÅžywanie LoRA modelu interpretacyjnego, aby pomÃģc wÅÄ czyÄ âintruderâ klatkÄ do procesu tworzenia wideo.
Wyniki, jeÅli chodzi o wiernoÅÄ podpowiedzi, sÄ doÅÄ godne uwagi, szczegÃģlnie dla rozwiÄ zania, ktÃģre wydaje siÄ doÅÄ eleganckie:
Kliknij, aby odtworzyÄ (bez dÅšwiÄku). Kolejne przykÅady âfactorizedâ generacji wideo, ktÃģre naprawdÄ trzymajÄ siÄ scenariusza. ProszÄ odnieÅÄ siÄ do plikÃģw ÅšrÃģdÅowych wideo, aby uzyskaÄ lepszÄ rozdzielczoÅÄ i wiÄcej przykÅadÃģw, chociaÅž wybrane wersje widoczne tutaj nie istniejÄ na stronie projektu i zostaÅy zmontowane dla tego artykuÅu.
To rozwiÄ zanie przychodzi w postaci nowego artykuÅu Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, i jego wideo-obszernego projektu strony internetowej.
Podczas gdy wiele obecnych systemÃģw prÃģbuje poprawiÄ dokÅadnoÅÄ podpowiedzi, uÅžywajÄ c modeli jÄzykowych do przepisania niejasnych lub niedookreÅlonych tekstÃģw, nowa praca twierdzi, Åže ta strategia nadal prowadzi do poraÅžki, gdy wewnÄtrzna reprezentacja sceny modelu jest wadliwa.
Nawet z szczegÃģÅowÄ przepisanÄ podpowiedziÄ , modele tekst-wideo czÄsto Åšle komponujÄ kluczowe elementy lub generujÄ niezgodne stanÃģw poczÄ tkowych, ktÃģre ÅamiÄ logikÄ animacji. DopÃģki pierwsza klatka nie odzwierciedla tego, co opisuje podpowiedÅš, wynikowy film nie moÅže odzyskaÄ, niezaleÅžnie od tego, jak dobry jest model ruchu.
ArtykuÅ stwierdza*:
â[Text-to-video] modele czÄsto produkujÄ rozproszone klatki, ale nadal osiÄ gajÄ [wyniki oceny] porÃģwnywalne z I2V modelami, wskazujÄ c, Åže ich modelowanie ruchu pozostaje rozsÄ dnym nawet wtedy, gdy wiernoÅÄ sceny jest stosunkowo sÅaba.
â[Image-to-Video] modele wykazujÄ komplementarne zachowanie, silne [wyniki oceny] z dokÅadnymi scenami poczÄ tkowymi i sÅabszÄ spÃģjnoÅciÄ czasowÄ , podczas gdy I2V+text rÃģwnowaÅžy oba aspekty.
âTo kontrast sugeruje strukturalnÄ niezgodnoÅÄ w obecnych modelach T2V: kotwiczenie sceny i synteza czasowa korzystajÄ z odrÄbnych indukcyjnych uprzedzeÅ, ale istniejÄ ce architektury prÃģbujÄ uczyÄ siÄ obu jednoczeÅnie w ramach jednego modelu.â
PorÃģwnawcza analiza trybÃģw generacji wykazaÅa, Åže modele bez jawnej kotwiczenia sceny uzyskaÅy dobre wyniki w modelowaniu ruchu, ale czÄsto kompromitowaÅy ukÅad sceny, podczas gdy podejÅcia warunkowane obrazem wykazywaÅy odwrotny wzorzec:

PorÃģwnanie trybÃģw generacji wideo na dwÃģch zestawach danych, pokazujÄ ce, Åže I2V+text osiÄ ga najlepszÄ jakoÅÄ klatek (FID) i spÃģjnoÅÄ czasowÄ (FVD), podkreÅlajÄ c korzyÅÄ z oddzielenia konstrukcji sceny od ruchu. ÅđrÃģdÅo
Te wyniki wskazujÄ na strukturalnÄ wadÄ, w ktÃģrej obecne modele prÃģbujÄ uczyÄ siÄ ukÅadu sceny i animacji w jednym czasie, chociaÅž oba zadania wymagajÄ rÃģÅžnych rodzajÃģw indukcyjnych uprzedzeÅ, i sÄ lepiej obsÅugiwane oddzielnie.
MoÅže najbardziej interesujÄ ce jest to, Åže ten âtrickâ moÅže potencjalnie byÄ zastosowany do lokalnych instalacji modeli, takich jak Wan 2.1 i 2.2, oraz podobnych modeli dyfuzji wideo, takich jak Hunyuan Video. Anegdotycznie, porÃģwnujÄ c jakoÅÄ wyjÅcia hobbystÃģw z komercyjnymi portalami generatywnymi, takimi jak Kling i Runway, wiÄkszoÅÄ gÅÃģwnych dostawcÃģw API poprawia oferty open source, takie jak WAN, za pomocÄ LoR, i â wydaje siÄ â z takimi trickami, jak te widoczne w nowym artykule. Dlatego to podejÅcie moÅže reprezentowaÄ dogonienie dla kontyngentu FOSS.
Testy przeprowadzone dla metody wskazujÄ , Åže to proste i moduÅowe podejÅcie oferuje nowy stan sztuki w T2V-CompBench benchmarku, znacznie poprawiajÄ c wszystkie przetestowane modele. Autorzy zauwaÅžajÄ w podsumowaniu, Åže chociaÅž ich system radykalnie poprawia wiernoÅÄ, nie rozwiÄ zuje (ani nie jest przeznaczony do rozwiÄ zania) dryfu toÅžsamoÅci, ktÃģry jest obecnie plagÄ badaÅ nad generatywnÄ sztucznÄ inteligencjÄ .
Nowy artykuÅ pochodzi od czterech badaczy z Ecole Polytechnique FÃĐdÃĐrale de Lausanne (EPFL) w Szwajcarii.
Metoda i Dane
CentralnÄ tezÄ nowej techniki jest to, Åže modele dyfuzji tekst-wideo (T2V) muszÄ byÄ âzakotwiczoneâ w klatkach startowych, ktÃģre naprawdÄ pasujÄ do poÅžÄ danej tekstowej podpowiedzi.
Aby upewniÄ siÄ, Åže model przestrzega klatki startowej, nowa metoda przerywa standardowy proces dyfuzji przez wstrzykniÄcie czystego latentu z kotwicy obrazu w czasie zero, zastÄpujÄ c jeden z zwykÅych haÅaÅliwych wejÅÄ. To nieznane wejÅcie dezorientuje model na poczÄ tku, ale z minimalnym LoRA dostrojeniem, uczy siÄ traktowaÄ wstrzykniÄtÄ klatkÄ jako staÅÄ wizualnÄ kotwicÄ, a nie czÄÅÄ trajektorii haÅasu:

Dwuetapowa metoda kotwiczenia generacji wideo z wizualnÄ kotwicÄ : Po lewej, model jest dostrojony za pomocÄ lekkiego LoRA, aby traktowaÄ wstrzykniÄty czysty latent jako staÅe ograniczenie sceny. Po prawej, podpowiedÅš jest podzielona na podpowiedÅš dla pierwszej klatki, ktÃģra jest uÅžywana do wygenerowania kotwicy obrazu, ktÃģry prowadzi wideo.
Podczas wnioskowania metoda przepisuje podpowiedÅš, aby opisaÄ tylko pierwszÄ klatkÄ, uÅžywajÄ c LLM, aby wyodrÄbniÄ prawdopodobny stan sceny na poczÄ tku, skupiajÄ c siÄ na ukÅadzie i wyglÄ dzie.
Przepisana podpowiedÅš jest przekazana generatorowi obrazu, aby wyprodukowaÄ kandydujÄ cÄ klatkÄ kotwiczÄ (ktÃģra moÅže byÄ opcjonalnie udoskonalona przez uÅžytkownika). Wybrana klatka jest zakodowana w latent i wstrzykniÄta do procesu dyfuzji, zastÄpujÄ c pierwszy krok czasowy, pozwalajÄ c modelowi wygenerowaÄ resztÄ wideo podczas pozostawania zakotwiczonego w poczÄ tkowej scenie â proces, ktÃģry dziaÅa bez wymagania zmian w podstawowej architekturze.
Proces zostaÅ przetestowany przez stworzenie LoR dla Wan2.2-14B, Wan2.1-1B i CogVideo1.5-5B. Trening LoRA zostaÅ przeprowadzony na rangÄ 256, na 5000 losowo wybranych klipach z UltraVideo kolekcji.
Trening trwaÅ 6000 krokÃģw i wymagaÅ 48 godzin GPUâ dla Wan-1B i CogVideo-5B, oraz 96 godzin GPU dla Wan-14B. Autorzy zauwaÅžajÄ , Åže Wan-5B rodzinnie obsÅuguje warunkowanie tylko tekstowe i tekstowo-obrazowe (ktÃģre sÄ w tym przypadku nakÅadane na starsze ramy), i dlatego nie wymagaÅy Åžadnego dostrojenia.
Testy
W eksperymentach przeprowadzonych dla procesu kaÅžda tekstowa podpowiedÅš byÅa najpierw udoskonalona za pomocÄ Qwen2.5-7B-Instruct, ktÃģry uÅžyÅ wyniku do wygenerowania szczegÃģÅowej âseed imageâ podpowiedzi zawierajÄ cej opis caÅej sceny. NastÄpnie zostaÅa ona przekazana do QwenImage, ktÃģry zostaÅ zadany do wygenerowania âmagicznej klatkiâ, ktÃģra ma byÄ wstrzykniÄta do procesu dyfuzji.
Benchmarki uÅžyte do oceny systemu obejmowaÅy wspomniany T2V-CompBench, testujÄ cy zrozumienie kompozycyjne, oceniajÄ c, jak dobrze modele zachowujÄ obiekty, atrybuty i dziaÅania w spÃģjnej scenie; oraz VBench 2.0, oceniajÄ cy szersze rozumowanie i spÃģjnoÅÄ w 18 metrykach, pogrupowanych w kreatywnoÅÄ, rozumowanie zdroworozsÄ dkowe, kontrola, ludzka wiernoÅÄ i fizyka:

Przez wszystkie siedem kategorii oceny T2V-CompBench, metoda T2V z kotwicÄ poprawiÅa zarÃģwno standardowe, jak i powiÄkszone podstawy T2V dla kaÅždego testowanego modelu, z zyskami siÄgajÄ cymi do 53,25%. Najlepiej oceniane warianty czÄsto dopasowywaÅy lub przewyÅžszaÅy benchmark PixVerse-V3.
Co siÄ tyczy tej pierwszej rundy testÃģw, autorzy stwierdzajÄ *:
â[Przez] wszystkie modele, dodanie kotwicy obrazu konsekwentnie poprawia wyniki kompozycyjne. Wszystkie mniejsze modele z kotwicÄ (CogVideo 5B, Wan 5B i Wan 1B) przewyÅžszajÄ wiÄkszy model T2V Wan 14B.
âNasza zaktoryzowana Wan 5B rÃģwnieÅž przewyÅžsza komercyjnÄ liniÄ bazowÄ PixVerse-V3, ktÃģra jest najlepszym zareportowanym modelem w benchmarku. To pokazuje, Åže wizualne kotwiczenie znacznie poprawia zrozumienie sceny i dziaÅania, nawet w mniejszych modelach.â
âW ramach kaÅždej rodziny modeli, wersja z kotwicÄ przewyÅžsza oryginalny model. Godne uwagi jest to, Åže nasz lekki, zakotwiczony LoRA w Wan 14B osiÄ ga wyniki porÃģwnywalne z wariantem I2V 14B (0,661 vs. 0,666), pomimo braku peÅnego ponownego treningu.â
NastÄpnie przyszedÅ VBench2.0:

Metoda T2V z kotwicÄ konsekwentnie poprawia wyniki VBench 2.0 w kompozycji, rozumowaniu zdroworozsÄ dkowym, kontroli i fizyce, z niektÃģrymi zyskami przekraczajÄ cymi 60% â chociaÅž wiernoÅÄ ludzka pozostaÅa poniÅžej linii bazowej Veo 3.
Przez wszystkie architektury, podejÅcie z kotwicÄ poprawiÅo wyniki we wszystkich kategoriach VBench, z wyjÄ tkiem ludzkiej wiernoÅci, ktÃģra nieznacznie spadÅa, nawet z powiÄkszaniem podpowiedzi. Wan 5B przewyÅžszyÅ wiÄkszy Wan 14B, potwierdzajÄ c wczeÅniejsze wyniki T2V-CompBench, Åže wizualne kotwiczenie przyczyniaÅo siÄ bardziej niÅž skala.
ChociaÅž zyski w VBench byÅy konsekwentne, byÅy one mniejsze niÅž te widoczne w T2V-CompBench, a autorzy przypisujÄ to surowemu systemowi oceny binarnej VBench.
Dla testÃģw jakoÅciowych, artykuÅ dostarcza statyczne obrazy, ale odnosimy czytelnika do zÅoÅžonych wideo osadzonych w tym artykule, aby uzyskaÄ jaÅniejszy obraz, z zastrzeÅženiem, Åže ÅšrÃģdÅowe wideo sÄ liczniejsze i bardziej rÃģÅžnorodne, a takÅže posiadajÄ wiÄkszÄ rozdzielczoÅÄ i szczegÃģÅowoÅÄ. ZnajdÅš je tutaj. Co siÄ tyczy wynikÃģw jakoÅciowych, artykuÅ stwierdza:
âWideo z kotwicÄ konsekwentnie wykazujÄ bardziej dokÅadnÄ kompozycjÄ sceny, silniejsze powiÄ zanie obiektu-atrybutu i jaÅniejszy postÄp czasowy.â
Metoda z kotwicÄ pozostaÅa stabilna, nawet gdy liczba krokÃģw dyfuzji zostaÅa obciÄta z 50 do 15, pokazujÄ c prawie Åžadnej utraty wynikÃģw w T2V-CompBench. W przeciwieÅstwie do tego, zarÃģwno podstawy tekstowe, jak i powiÄkszone ulegÅy znacznemu pogorszeniu w tych samych warunkach.
ChociaÅž redukcja krokÃģw mogÅaby teoretycznie potroiÄ szybkoÅÄ, peÅny pipeline generacji staÅ siÄ tylko 2,1-krotnie szybszy w praktyce, ze wzglÄdu na staÅe koszty zwiÄ zane z generowaniem kotwicy obrazu. Nadal, wyniki wskazujÄ , Åže kotwiczenie nie tylko poprawia jakoÅÄ prÃģbek, ale takÅže pomaga stabilizowaÄ proces dyfuzji, wspierajÄ c szybszÄ i bardziej wydajnÄ generacjÄ bez utraty dokÅadnoÅci.
Strona internetowa projektu dostarcza przykÅady porÃģwnaÅ miÄdzy powiÄkszonymi a nowÄ metodÄ generacji, z ktÃģrych kilka (o niÅžszej rozdzielczoÅci) edytowanych przykÅadÃģw jest tutaj:
Kliknij, aby odtworzyÄ (bez dÅšwiÄku). ÅđrÃģdÅa startowe vs. podejÅcie z kotwicÄ autorÃģw.
Autorzy koÅczÄ :
âNasze wyniki sugerujÄ , Åže poprawiona kotwica, a nie tylko zwiÄkszona pojemnoÅÄ, moÅže byÄ rÃģwnie waÅžna. Ostatnie postÄpy w dyfuzji T2V opierajÄ siÄ gÅÃģwnie na zwiÄkszaniu rozmiaru modelu i danych treningowych, ale nawet duÅže modele czÄsto majÄ trudnoÅci z wnioskowaniem o spÃģjnej scenie poczÄ tkowej z samego tekstu.
âTo kontrastuje z dyfuzjÄ obrazu, gdzie skalowanie jest stosunkowo proste; w modelach wideo kaÅžda poprawa architektury musi dziaÅaÄ nad dodatkowÄ wymiarem czasowym, co czyni skalowanie znacznie bardziej wymagajÄ cym zasobÃģw.
âNasze wyniki wskazujÄ , Åže poprawiona kotwica moÅže uzupeÅniÄ skalÄ, rozwiÄ zujÄ c inny wÄ ski gardÅo: ustanowienie prawidÅowej sceny przed rozpoczÄciem syntezy ruchu.
âPoprzez zaktoryzowanie generacji wideo w konstrukcjÄ sceny i modelowanie czasowe, Åagodzimy kilka typowych trybÃģw awaryjnych bez wymagania znacznie wiÄkszych modeli. UwaÅžamy to za komplementarny zasadÄ projektowania, ktÃģry moÅže prowadziÄ przyszÅe architektury ku bardziej niezawodnej i ustrukturyzowanej syntezie wideo.â
Podsumowanie
ChociaÅž problemy splÄ tania sÄ bardzo realne i mogÄ wymagaÄ dedykowanych rozwiÄ zaÅ (takich jak poprawiona kuracja i ocena dystrybucji przed treningiem), byÅo to odkrywcze, aby zobaczyÄ, jak zaktoryzowanie ârozluÅšniaâ kilka uporczywych i âzablokowanychâ ukÅadÃģw podpowiedzi w znacznie bardziej dokÅadne renderowania â z tylko umiarkowanÄ warstwÄ warunkowania LoRA i interwencjÄ znacznie udoskonalonej startowej/seedowej klatki.
PrzepaÅÄ w zasobach miÄdzy lokalnÄ inferencjÄ hobbystÃģw a komercyjnymi rozwiÄ zaniami moÅže nie byÄ tak ogromna, jak siÄ wydaje, biorÄ c pod uwagÄ, Åže prawie wszyscy dostawcy starajÄ siÄ racjonalizowaÄ swoje znaczne wydatki na zasoby GPU dla konsumentÃģw.
Anegdotycznie, bardzo duÅža liczba obecnych dostawcÃģw generatywnych wideo wydaje siÄ uÅžywaÄ nazwanych i ogÃģlnie âwzmocnionychâ wersji chiÅskich modeli FOSS. GÅÃģwny ârÃģwâ kaÅždego z tych âpoÅrednichâ systemÃģw wydaje siÄ polegaÄ na tym, Åže podjÄli trud, aby przeszkoliÄ LoR-y, lub â przy wiÄkszym koszcie i nieco wiÄkszej nagrodzie â przeprowadziÄ peÅne dostrojenie wag modeluâ â .
WglÄ dy tego rodzaju mogÄ pomÃģc w dalszym zamykaniu tej luki, w kontekÅcie sceny wydawniczej, w ktÃģrej Chiny wydajÄ siÄ zdeterminowane (niekoniecznie z altruistycznych lub idealistycznych powodÃģw) do udemokratyzowania sztucznej inteligencji, podczas gdy zachodnie interesy biznesowe mogÄ wolaÄ, aby rosnÄ cy rozmiar modelu i regulacje ostatecznie zastrzegÅy najlepsze modele za API i wieloma warstwami filtrÃģw treÅci.
Â
* Autorzy podkreÅlajÄ , Åže.
â ArtykuÅ nie okreÅla, jaki GPU zostaÅ wybrany, ani ile ich zostaÅo uÅžytych.
â â ChociaÅž podejÅcie LoRA jest bardziej prawdopodobne, zarÃģwno ze wzglÄdu na ekonomicznÄ ÅatwoÅÄ uÅžycia, jak i dlatego, Åže peÅne wagi, a nie kwantyzowane wagi, nie zawsze sÄ dostÄpne.
Pierwotnie opublikowane w piÄ tek, 19 grudnia 2025












