Kąt Andersona

AI Wideo Doskonale PrzezwycięŞa Zdjęcia Kociego Selfie

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
A still from a demo video for the paper 'Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models', depicting a POV of a 'cat selfie', while a dog skateboards in the background. Source: https://vita-epfl.github.io/FVG/

Generatory wideo AI często dają wyniki, ktÃģre są bliskie, ale nie całkiem trafne, jeśli chodzi o dostarczanie tego, czego chce tekstowy podpowiedÅš. Ale nowe wysokopoziomowe rozwiązanie sprawia, Åže wszystko się zmienia.

 

Systemy generatywne wideo często mają trudności z tworzeniem filmÃģw, ktÃģre są naprawdę kreatywne lub dzikie, i często nie spełniają oczekiwań uÅžytkownikÃģw co do ich tekstowych podpowiedzi.

Częścią powodu tego jest splątanie – fakt, Åže modele widzenia/języka muszą kompromisować, jak długo trenują na danych ÅšrÃģdłowych. Za mało treningu, a pojęcia są elastyczne, ale nie w pełni ukształtowane – za duÅžo, a pojęcia są dokładne, ale nie są juÅž wystarczająco elastyczne, aby włączyć je do nowych kombinacji.

MoÅžna zrozumieć to z filmu osadzonego poniÅžej. Po lewej stronie jest rodzaj kompromisu pÃģł-etatu, jaki wiele systemÃģw AI dostarcza w odpowiedzi na wymagającą podpowiedÅš (podpowiedÅš jest na gÃģrze filmu we wszystkich czterech przykładach), ktÃģra prosi o jakąś kontrastację elementÃģw, ktÃģra jest zbyt fantastyczna, aby była prawdziwym przykładem treningu. Po prawej stronie jest wyjście AI, ktÃģre lepiej trzyma się podpowiedzi:

Kliknij, aby odtworzyć (bez dÅšwięku). Po prawej stronie widzimy ‘factorized’ WAN 2.2, ktÃģry naprawdę dostarcza to, czego chcą podpowiedzi, w porÃģwnaniu z mglistymi interpretacjami ‘vanilla’ Wan 2.2. na lewej stronie. Proszę odnieść się do plikÃģw ÅšrÃģdłowych wideo, aby uzyskać lepszą rozdzielczość i więcej przykładÃģw, chociaÅž wybrane wersje widoczne tutaj nie istnieją na stronie projektu i zostały zmontowane dla tego artykułu. ÅđrÃģdło

Dobrze, chociaÅž musimy wybaczyć klaping duck’s human hands (!), jest jasne, Åže przykłady po prawej stronie przestrzegają oryginalnej tekstowej podpowiedzi znacznie lepiej niÅž te po lewej stronie.

Co ciekawe, obie architektury są podstawowo takie same – popularna i bardzo zdolna Wan 2.2, chińskie wydanie, ktÃģre zyskało znaczną popularność w społecznościach open source i hobbystycznych w tym roku.

RÃģÅžnica polega na tym, Åže drugi generatywny pipeline jest factorized, co w tym przypadku oznacza, Åže duÅžy model językowy (LLM) został uÅžyty do ponownej interpretacji pierwszego (seed) klatki wideo, aby było łatwiej dla systemu dostarczyć to, czego chce uÅžytkownik.

Te ‘wizualne kotwiczenie’ obejmuje wstrzyknięcie obrazu stworzonego z tego LLM-u wzmocnionego podpowiedzi do generatywnego pipeline jako ‘start frame’, i uÅžywanie LoRA modelu interpretacyjnego, aby pomÃģc włączyć ‘intruder’ klatkę do procesu tworzenia wideo.

Wyniki, jeśli chodzi o wierność podpowiedzi, są dość godne uwagi, szczegÃģlnie dla rozwiązania, ktÃģre wydaje się dość eleganckie:

Kliknij, aby odtworzyć (bez dÅšwięku). Kolejne przykłady ‘factorized’ generacji wideo, ktÃģre naprawdę trzymają się scenariusza. Proszę odnieść się do plikÃģw ÅšrÃģdłowych wideo, aby uzyskać lepszą rozdzielczość i więcej przykładÃģw, chociaÅž wybrane wersje widoczne tutaj nie istnieją na stronie projektu i zostały zmontowane dla tego artykułu.

To rozwiązanie przychodzi w postaci nowego artykułu Factorized Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models, i jego wideo-obszernego projektu strony internetowej.

Podczas gdy wiele obecnych systemÃģw prÃģbuje poprawić dokładność podpowiedzi, uÅžywając modeli językowych do przepisania niejasnych lub niedookreślonych tekstÃģw, nowa praca twierdzi, Åže ta strategia nadal prowadzi do poraÅžki, gdy wewnętrzna reprezentacja sceny modelu jest wadliwa.

Nawet z szczegÃģłową przepisaną podpowiedzią, modele tekst-wideo często Åšle komponują kluczowe elementy lub generują niezgodne stanÃģw początkowych, ktÃģre łamią logikę animacji. DopÃģki pierwsza klatka nie odzwierciedla tego, co opisuje podpowiedÅš, wynikowy film nie moÅže odzyskać, niezaleÅžnie od tego, jak dobry jest model ruchu.

Artykuł stwierdza*:

‘[Text-to-video] modele często produkują rozproszone klatki, ale nadal osiągają [wyniki oceny] porÃģwnywalne z I2V modelami, wskazując, Åže ich modelowanie ruchu pozostaje rozsądnym nawet wtedy, gdy wierność sceny jest stosunkowo słaba.

‘[Image-to-Video] modele wykazują komplementarne zachowanie, silne [wyniki oceny] z dokładnymi scenami początkowymi i słabszą spÃģjnością czasową, podczas gdy I2V+text rÃģwnowaÅžy oba aspekty.

‘To kontrast sugeruje strukturalną niezgodność w obecnych modelach T2V: kotwiczenie sceny i synteza czasowa korzystają z odrębnych indukcyjnych uprzedzeń, ale istniejące architektury prÃģbują uczyć się obu jednocześnie w ramach jednego modelu.’

PorÃģwnawcza analiza trybÃģw generacji wykazała, Åže modele bez jawnej kotwiczenia sceny uzyskały dobre wyniki w modelowaniu ruchu, ale często kompromitowały układ sceny, podczas gdy podejścia warunkowane obrazem wykazywały odwrotny wzorzec:

PorÃģwnanie trybÃģw generacji wideo na dwÃģch zestawach danych, pokazujące, Åže I2V+text osiąga najlepszą jakość klatek (FID) i spÃģjność czasową (FVD), podkreślając korzyść z oddzielenia konstrukcji sceny od ruchu.

PorÃģwnanie trybÃģw generacji wideo na dwÃģch zestawach danych, pokazujące, Åže I2V+text osiąga najlepszą jakość klatek (FID) i spÃģjność czasową (FVD), podkreślając korzyść z oddzielenia konstrukcji sceny od ruchu. ÅđrÃģdło

Te wyniki wskazują na strukturalną wadę, w ktÃģrej obecne modele prÃģbują uczyć się układu sceny i animacji w jednym czasie, chociaÅž oba zadania wymagają rÃģÅžnych rodzajÃģw indukcyjnych uprzedzeń, i są lepiej obsługiwane oddzielnie.

MoÅže najbardziej interesujące jest to, Åže ten ‘trick’ moÅže potencjalnie być zastosowany do lokalnych instalacji modeli, takich jak Wan 2.1 i 2.2, oraz podobnych modeli dyfuzji wideo, takich jak Hunyuan Video. Anegdotycznie, porÃģwnując jakość wyjścia hobbystÃģw z komercyjnymi portalami generatywnymi, takimi jak Kling i Runway, większość głÃģwnych dostawcÃģw API poprawia oferty open source, takie jak WAN, za pomocą LoR, i – wydaje się – z takimi trickami, jak te widoczne w nowym artykule. Dlatego to podejście moÅže reprezentować dogonienie dla kontyngentu FOSS.

Testy przeprowadzone dla metody wskazują, Åže to proste i modułowe podejście oferuje nowy stan sztuki w T2V-CompBench benchmarku, znacznie poprawiając wszystkie przetestowane modele. Autorzy zauwaÅžają w podsumowaniu, Åže chociaÅž ich system radykalnie poprawia wierność, nie rozwiązuje (ani nie jest przeznaczony do rozwiązania) dryfu toÅžsamości, ktÃģry jest obecnie plagą badań nad generatywną sztuczną inteligencją.

Nowy artykuł pochodzi od czterech badaczy z Ecole Polytechnique FÃĐdÃĐrale de Lausanne (EPFL) w Szwajcarii.

Metoda i Dane

Centralną tezą nowej techniki jest to, Åže modele dyfuzji tekst-wideo (T2V) muszą być ‘zakotwiczone’ w klatkach startowych, ktÃģre naprawdę pasują do poŞądanej tekstowej podpowiedzi.

Aby upewnić się, Åže model przestrzega klatki startowej, nowa metoda przerywa standardowy proces dyfuzji przez wstrzyknięcie czystego latentu z kotwicy obrazu w czasie zero, zastępując jeden z zwykłych hałaśliwych wejść. To nieznane wejście dezorientuje model na początku, ale z minimalnym LoRA dostrojeniem, uczy się traktować wstrzykniętą klatkę jako stałą wizualną kotwicę, a nie część trajektorii hałasu:

Dwuetapowa metoda kotwiczenia generacji wideo z wizualną kotwicą: Po lewej, model jest dostrojony za pomocą lekkiego LoRA, aby traktować wstrzyknięty czysty latent jako stałe ograniczenie sceny. Po prawej, podpowiedÅš jest podzielona na podpowiedÅš dla pierwszej klatki, ktÃģra jest uÅžywana do wygenerowania kotwicy obrazu, ktÃģry prowadzi wideo.

Dwuetapowa metoda kotwiczenia generacji wideo z wizualną kotwicą: Po lewej, model jest dostrojony za pomocą lekkiego LoRA, aby traktować wstrzyknięty czysty latent jako stałe ograniczenie sceny. Po prawej, podpowiedÅš jest podzielona na podpowiedÅš dla pierwszej klatki, ktÃģra jest uÅžywana do wygenerowania kotwicy obrazu, ktÃģry prowadzi wideo.

Podczas wnioskowania metoda przepisuje podpowiedÅš, aby opisać tylko pierwszą klatkę, uÅžywając LLM, aby wyodrębnić prawdopodobny stan sceny na początku, skupiając się na układzie i wyglądzie.

Przepisana podpowiedÅš jest przekazana generatorowi obrazu, aby wyprodukować kandydującą klatkę kotwiczą (ktÃģra moÅže być opcjonalnie udoskonalona przez uÅžytkownika). Wybrana klatka jest zakodowana w latent i wstrzyknięta do procesu dyfuzji, zastępując pierwszy krok czasowy, pozwalając modelowi wygenerować resztę wideo podczas pozostawania zakotwiczonego w początkowej scenie – proces, ktÃģry działa bez wymagania zmian w podstawowej architekturze.

Proces został przetestowany przez stworzenie LoR dla Wan2.2-14B, Wan2.1-1B i CogVideo1.5-5B. Trening LoRA został przeprowadzony na rangę 256, na 5000 losowo wybranych klipach z UltraVideo kolekcji.

Trening trwał 6000 krokÃģw i wymagał 48 godzin GPU† dla Wan-1B i CogVideo-5B, oraz 96 godzin GPU dla Wan-14B. Autorzy zauwaÅžają, Åže Wan-5B rodzinnie obsługuje warunkowanie tylko tekstowe i tekstowo-obrazowe (ktÃģre są w tym przypadku nakładane na starsze ramy), i dlatego nie wymagały Åžadnego dostrojenia.

Testy

W eksperymentach przeprowadzonych dla procesu kaÅžda tekstowa podpowiedÅš była najpierw udoskonalona za pomocą Qwen2.5-7B-Instruct, ktÃģry uÅžył wyniku do wygenerowania szczegÃģłowej ‘seed image’ podpowiedzi zawierającej opis całej sceny. Następnie została ona przekazana do QwenImage, ktÃģry został zadany do wygenerowania ‘magicznej klatki’, ktÃģra ma być wstrzyknięta do procesu dyfuzji.

Benchmarki uÅžyte do oceny systemu obejmowały wspomniany T2V-CompBench, testujący zrozumienie kompozycyjne, oceniając, jak dobrze modele zachowują obiekty, atrybuty i działania w spÃģjnej scenie; oraz VBench 2.0, oceniający szersze rozumowanie i spÃģjność w 18 metrykach, pogrupowanych w kreatywność, rozumowanie zdroworozsądkowe, kontrola, ludzka wierność i fizyka:

Przez wszystkie siedem kategorii oceny T2V-CompBench, metoda T2V z kotwicą poprawiła zarÃģwno standardowe, jak i powiększone podstawy T2V dla kaÅždego testowanego modelu, z zyskami sięgającymi do 53,25%. Najlepiej oceniane warianty często dopasowywały lub przewyÅžszały benchmark PixVerse-V3.

Przez wszystkie siedem kategorii oceny T2V-CompBench, metoda T2V z kotwicą poprawiła zarÃģwno standardowe, jak i powiększone podstawy T2V dla kaÅždego testowanego modelu, z zyskami sięgającymi do 53,25%. Najlepiej oceniane warianty często dopasowywały lub przewyÅžszały benchmark PixVerse-V3.

Co się tyczy tej pierwszej rundy testÃģw, autorzy stwierdzają*:

‘[Przez] wszystkie modele, dodanie kotwicy obrazu konsekwentnie poprawia wyniki kompozycyjne. Wszystkie mniejsze modele z kotwicą (CogVideo 5B, Wan 5B i Wan 1B) przewyÅžszają większy model T2V Wan 14B.

‘Nasza zaktoryzowana Wan 5B rÃģwnieÅž przewyÅžsza komercyjną linię bazową PixVerse-V3, ktÃģra jest najlepszym zareportowanym modelem w benchmarku. To pokazuje, Åže wizualne kotwiczenie znacznie poprawia zrozumienie sceny i działania, nawet w mniejszych modelach.’

‘W ramach kaÅždej rodziny modeli, wersja z kotwicą przewyÅžsza oryginalny model. Godne uwagi jest to, Åže nasz lekki, zakotwiczony LoRA w Wan 14B osiąga wyniki porÃģwnywalne z wariantem I2V 14B (0,661 vs. 0,666), pomimo braku pełnego ponownego treningu.’

Następnie przyszedł VBench2.0:

Metoda T2V z kotwicą konsekwentnie poprawia wyniki VBench 2.0 w kompozycji, rozumowaniu zdroworozsądkowym, kontroli i fizyce, z niektÃģrymi zyskami przekraczającymi 60% – chociaÅž wierność ludzka pozostała poniÅžej linii bazowej Veo 3.

Metoda T2V z kotwicą konsekwentnie poprawia wyniki VBench 2.0 w kompozycji, rozumowaniu zdroworozsądkowym, kontroli i fizyce, z niektÃģrymi zyskami przekraczającymi 60% – chociaÅž wierność ludzka pozostała poniÅžej linii bazowej Veo 3.

Przez wszystkie architektury, podejście z kotwicą poprawiło wyniki we wszystkich kategoriach VBench, z wyjątkiem ludzkiej wierności, ktÃģra nieznacznie spadła, nawet z powiększaniem podpowiedzi. Wan 5B przewyÅžszył większy Wan 14B, potwierdzając wcześniejsze wyniki T2V-CompBench, Åže wizualne kotwiczenie przyczyniało się bardziej niÅž skala.

ChociaÅž zyski w VBench były konsekwentne, były one mniejsze niÅž te widoczne w T2V-CompBench, a autorzy przypisują to surowemu systemowi oceny binarnej VBench.

Dla testÃģw jakościowych, artykuł dostarcza statyczne obrazy, ale odnosimy czytelnika do złoÅžonych wideo osadzonych w tym artykule, aby uzyskać jaśniejszy obraz, z zastrzeÅženiem, Åže ÅšrÃģdłowe wideo są liczniejsze i bardziej rÃģÅžnorodne, a takÅže posiadają większą rozdzielczość i szczegÃģłowość. ZnajdÅš je tutaj. Co się tyczy wynikÃģw jakościowych, artykuł stwierdza:

‘Wideo z kotwicą konsekwentnie wykazują bardziej dokładną kompozycję sceny, silniejsze powiązanie obiektu-atrybutu i jaśniejszy postęp czasowy.’

Metoda z kotwicą pozostała stabilna, nawet gdy liczba krokÃģw dyfuzji została obcięta z 50 do 15, pokazując prawie Åžadnej utraty wynikÃģw w T2V-CompBench. W przeciwieństwie do tego, zarÃģwno podstawy tekstowe, jak i powiększone uległy znacznemu pogorszeniu w tych samych warunkach.

ChociaÅž redukcja krokÃģw mogłaby teoretycznie potroić szybkość, pełny pipeline generacji stał się tylko 2,1-krotnie szybszy w praktyce, ze względu na stałe koszty związane z generowaniem kotwicy obrazu. Nadal, wyniki wskazują, Åže kotwiczenie nie tylko poprawia jakość prÃģbek, ale takÅže pomaga stabilizować proces dyfuzji, wspierając szybszą i bardziej wydajną generację bez utraty dokładności.

Strona internetowa projektu dostarcza przykłady porÃģwnań między powiększonymi a nową metodą generacji, z ktÃģrych kilka (o niÅžszej rozdzielczości) edytowanych przykładÃģw jest tutaj:

Kliknij, aby odtworzyć (bez dÅšwięku). ÅđrÃģdła startowe vs. podejście z kotwicą autorÃģw.

Autorzy kończą:

‘Nasze wyniki sugerują, Åže poprawiona kotwica, a nie tylko zwiększona pojemność, moÅže być rÃģwnie waÅžna. Ostatnie postępy w dyfuzji T2V opierają się głÃģwnie na zwiększaniu rozmiaru modelu i danych treningowych, ale nawet duÅže modele często mają trudności z wnioskowaniem o spÃģjnej scenie początkowej z samego tekstu.

‘To kontrastuje z dyfuzją obrazu, gdzie skalowanie jest stosunkowo proste; w modelach wideo kaÅžda poprawa architektury musi działać nad dodatkową wymiarem czasowym, co czyni skalowanie znacznie bardziej wymagającym zasobÃģw.

‘Nasze wyniki wskazują, Åže poprawiona kotwica moÅže uzupełnić skalę, rozwiązując inny wąski gardło: ustanowienie prawidłowej sceny przed rozpoczęciem syntezy ruchu.

‘Poprzez zaktoryzowanie generacji wideo w konstrukcję sceny i modelowanie czasowe, łagodzimy kilka typowych trybÃģw awaryjnych bez wymagania znacznie większych modeli. UwaÅžamy to za komplementarny zasadę projektowania, ktÃģry moÅže prowadzić przyszłe architektury ku bardziej niezawodnej i ustrukturyzowanej syntezie wideo.’

Podsumowanie

ChociaÅž problemy splątania są bardzo realne i mogą wymagać dedykowanych rozwiązań (takich jak poprawiona kuracja i ocena dystrybucji przed treningiem), było to odkrywcze, aby zobaczyć, jak zaktoryzowanie ‘rozluÅšnia’ kilka uporczywych i ‘zablokowanych’ układÃģw podpowiedzi w znacznie bardziej dokładne renderowania – z tylko umiarkowaną warstwą warunkowania LoRA i interwencją znacznie udoskonalonej startowej/seedowej klatki.

Przepaść w zasobach między lokalną inferencją hobbystÃģw a komercyjnymi rozwiązaniami moÅže nie być tak ogromna, jak się wydaje, biorąc pod uwagę, Åže prawie wszyscy dostawcy starają się racjonalizować swoje znaczne wydatki na zasoby GPU dla konsumentÃģw.

Anegdotycznie, bardzo duÅža liczba obecnych dostawcÃģw generatywnych wideo wydaje się uÅžywać nazwanych i ogÃģlnie ‘wzmocnionych’ wersji chińskich modeli FOSS. GłÃģwny ‘rÃģw’ kaÅždego z tych ‘pośrednich’ systemÃģw wydaje się polegać na tym, Åže podjęli trud, aby przeszkolić LoR-y, lub – przy większym koszcie i nieco większej nagrodzie – przeprowadzić pełne dostrojenie wag modelu††.

Wglądy tego rodzaju mogą pomÃģc w dalszym zamykaniu tej luki, w kontekście sceny wydawniczej, w ktÃģrej Chiny wydają się zdeterminowane (niekoniecznie z altruistycznych lub idealistycznych powodÃģw) do udemokratyzowania sztucznej inteligencji, podczas gdy zachodnie interesy biznesowe mogą wolać, aby rosnący rozmiar modelu i regulacje ostatecznie zastrzegły najlepsze modele za API i wieloma warstwami filtrÃģw treści.

 

* Autorzy podkreślają, Åže.

† Artykuł nie określa, jaki GPU został wybrany, ani ile ich zostało uÅžytych.

†† ChociaÅž podejście LoRA jest bardziej prawdopodobne, zarÃģwno ze względu na ekonomiczną łatwość uÅžycia, jak i dlatego, Åže pełne wagi, a nie kwantyzowane wagi, nie zawsze są dostępne.

Pierwotnie opublikowane w piątek, 19 grudnia 2025

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]