Kąt Andersona
Dlaczego AI Video Czasami Jest Odwrotnie

Jeśli 2022 rok był rokiem, w którym generatywny AI zdobył wyobraźnię szerszej publiczności, 2025 rok jest rokiem, w którym nowa generacja generatywnych frameworków wideo pochodzących z Chin wydaje się gotowa zrobić to samo.
Hunyuan Video od Tencentu wywarł duży wpływ na społeczność hobbystów AI dzięki otwartemu wydaniu pełnego modelu dyfuzji wideo, który użytkownicy mogą dostosować do swoich potrzeb.
Tuż za nim idzie najnowszy model Alibaba, Wan 2.1, jeden z najpotężniejszych rozwiązań FOSS do tworzenia wideo z obrazu, który obecnie obsługuje dostosowanie za pomocą Wan LoRAs.
Oprócz dostępności niedawno wydanego modelu SkyReels-V1, w chwili pisania tego artykułu czekamy również na wydanie kompleksowego pakietu tworzenia i edycji wideo VACE od Alibaba:
Kliknij, aby odtworzyć. Nadchodzące wydanie wielofunkcyjnego pakietu edycji AI VACE od Alibaba wzbudziło podekscytowanie wśród użytkowników. Źródło: https://ali-vilab.github.io/VACE-Page/
Nagły Wpływ
Scena badawcza generatywnego AI wideo jest nie mniej wybuchowa; jest jeszcze pierwsza połowa marca, a wtorkowe zgłoszenia do sekcji Computer Vision na Arxiv (centrum badań nad generatywnym AI) wyniosły prawie 350 wpisów – liczba zwykle kojarzona z szczytem sezonu konferencyjnego.
Dwa lata od wydania Stable Diffusion w lecie 2022 roku (i późniejszego rozwoju Dreambooth i metod dostosowywania LoRA) charakteryzowały się brakiem dalszych dużych rozwojów, aż do ostatnich kilku tygodni, kiedy nowe wydania i innowacje posunęły się w takim tempie, że trudno nadążyć za tym wszystkim, nie mówiąc już o tym, aby to wszystko objąć.
Modele dyfuzji wideo, takie jak Hunyuan i Wan 2.1, rozwiązały wreszcie, po latach nieudanych prób setek inicjatyw badawczych, problem spójności czasowej w odniesieniu do generowania ludzi, a w dużej mierze również do środowisk i obiektów.
Nie ma wątpliwości, że studia VFX obecnie stosują personel i zasoby do adaptacji nowych chińskich modeli wideo w celu rozwiązania natychmiastowych wyzwań, takich jak zamiana twarzy, pomimo braku mechanizmów pomocniczych w stylu ControlNet dla tych systemów.
Musi to być ulga, że jeden z takich znaczących przeszkód został potencjalnie pokonany, choć nie takim sposobem, jak się spodziewano.
Wśród pozostałych problemów ten nie jest jednak nieistotny:
Kliknij, aby odtworzyć. Na podstawie podpowiedzi ‘Mały kamień toczy się w dół stromego, skalistego zbocza, przesuwając glebę i małe kamienie’, Wan 2.1, który osiągnął najwyższe wyniki w nowym artykule, popełnia jeden prosty błąd. Źródło: https://videophy2.github.io/
W Górę Pod Górę
Wszystkie systemy text-to-video i image-to-video dostępne obecnie, w tym komercyjne modele zamknięte, mają tendencję do tworzenia błędów fizycznych, takich jak ten powyżej, gdzie wideo pokazuje kamień toczący się pod górę, na podstawie podpowiedzi ‘Mały kamień toczy się w dół stromego, skalistego zbocza, przesuwając glebę i małe kamienie ‘.
Jedna z teorii, dlaczego tak się dzieje, niedawno zaproponowana w akademickiej współpracy między Alibaba a UAE, mówi, że modele szkolone są zawsze na pojedynczych obrazach, w pewnym sensie, nawet gdy szkolone są na wideo (które są zapisywane jako sekwencje klatek dla celów szkolenia); i mogą niekoniecznie nauczyć się poprawnej kolejności czasowej ‘przed’ i ‘po’ obrazach.
Najbardziej prawdopodobne rozwiązanie polega na tym, że modele wykorzystały rozszerzenia danych, które obejmują eksponowanie źródłowego klipu szkoleniowego na modelu zarówno do przodu i do tyłu, skutecznie podwajając dane szkoleniowe.
Od dawna wiadomo, że nie powinno się tego robić arbitralnie, ponieważ niektóre ruchy działają w odwrotnym kierunku, ale wiele nie. Badanie z 2019 roku z Uniwersytetu w Bristolu w Wielkiej Brytanii miało na celu opracowanie metody, która mogłaby odróżnić ekwiwalentne, niewzględne i niewsteczne klipy wideo w zbiorze danych (patrz poniżej), z założeniem, że niewłaściwe klipy źródłowe mogą zostać odfiltrowane z rutyn rozszerzania danych.

Przykłady trzech rodzajów ruchu, z których tylko jeden jest swobodnie odwracalny przy zachowaniu wiarygodnej dynamiki fizycznej. Źródło: https://arxiv.org/abs/1909.09422
Autorzy tej pracy wyjaśniają problem w następujący sposób:
‘Stwierdzamy, że realizm odwróconych wideo zdradza artefakty odwrócenia, aspekty sceny, które nie są możliwe w świecie rzeczywistym. Niektóre artefakty są subtelne, podczas gdy inne są łatwe do zauważenia, jak odwrócona akcja ‘rzucania’, gdzie rzucany obiekt spontanicznie unosi się z podłogi.
‘Obserwujemy dwa rodzaje artefaktów odwrócenia, fizyczne, te, które naruszają prawa natury, i nieprawdopodobne, te, które przedstawiają możliwy, ale nieprawdopodobny scenariusz. Nie są one wyłączne, a wiele odwróconych akcji cierpi na oba rodzaje artefaktów, jak na przykład gdy rozgładzamy kartkę papieru.
‘Przykłady artefaktów fizycznych obejmują: odwróconą grawitację (np. ‘upuszczanie czegoś’), spontaniczne impulsy na obiektach (np. ‘obracanie pióra’) i nieodwracalne zmiany stanu (np. ‘palenie świecy’). Przykład artefaktu nieprawdopodobnego: wzięcie talerza z szafki, osuszanie go i umieszczanie na suszarce.
‘Ten rodzaj ponownego użycia danych jest bardzo powszechny w czasie szkolenia i może być korzystny – na przykład w upewnieniu się, że model nie uczy się tylko jednego widoku obrazu lub obiektu, który można odwrócić lub obrócić bez utraty centralnej spójności i logiki.
‘To działa tylko dla obiektów, które są naprawdę symetryczne, oczywiście; i uczenie się fizyki z ‘odwróconego’ wideo działa tylko wtedy, gdy odwrócona wersja ma tak mucho sensu, jak wersja do przodu. ‘
Tymczasowe Odwrócenia
Nie mamy dowodów na to, że systemy takie jak Hunyuan Video i Wan 2.1 pozwalały na arbitralne ‘odwrócone’ klipy podczas szkolenia (żadna z grup badawczych nie była konkretna w odniesieniu do rutyn rozszerzania danych).
Jedyną rozsądną alternatywą byłoby to, że zestawy danych, które napędzają te modele, mogą zawierać klipy, które rzeczywiście zawierają ruchy wsteczne.
Kamień w przykładowym wideo wygenerowanym powyżej został wygenerowany przy użyciu Wan 2.1 i pojawia się w nowym badaniu, które bada, jak dobrze modele dyfuzji wideo radzą sobie z fizyką.
W testach tego projektu Wan 2.1 osiągnął wynik tylko 22% pod względem zdolności do konsekwentnego przestrzegania praw fizyki.
Jest to jednak najlepszy wynik spośród wszystkich przetestowanych systemów, co wskazuje, że możemy znaleźć następną przeszkodę dla AI wideo:

Wyniki uzyskane przez wiodące systemy otwartoźródłowe i zamknięte, z wyjściem ramion ocenianych przez ludzkich annotatorów. Źródło: https://arxiv.org/pdf/2503.06800
Autorzy nowej pracy opracowali system benchmarkingowy, obecnie w drugiej iteracji, o nazwie VideoPhy, z kodem dostępnym na GitHub.
Chociaż zakres pracy wykracza poza to, co możemy tu wyczerpująco objąć, przyjrzyjmy się ogólnie jego metodyce i potencjałowi ustanowienia metryki, która mogłaby pomóc skierować przyszłe sesje szkoleniowe modeli z dala od tych dziwacznych przypadków odwrócenia.
Badanie, przeprowadzone przez sześciu badaczy z UCLA i Google Research, nosi tytuł VideoPhy-2: Wyzwania w ocenie fizyki w generowaniu wideo. Dostępna jest również strona projektu, wraz z kodem i zestawami danych na GitHub, oraz widok zestawu danych na Hugging Face.
Kliknij, aby odtworzyć. Tutaj model OpenAI Sora nie potrafi zrozumieć interakcji między wiosłami a odbiciami i nie jest w stanie dostarczyć logicznego przepływu fizycznego ani dla osoby w łodzi, ani dla sposobu, w jaki łódź wchodzi w interakcje z nią.
Metoda
Autorzy opisują najnowszą wersję swojej pracy, VideoPhy-2, jako ‘wyzwania w ocenie fizyki w generowaniu wideo’. Zestaw zawiera 197 akcji w różnych dziedzinach, takich jak hula-hoop, gimnastyka i tenis, a także interakcje z obiektami, takie jak ugięcie obiektu aż do złamania.
Duży model językowy (LLM) jest używany do generowania 3840 podpowiedzi z tych akcji, a podpowiedzi są następnie wykorzystywane do syntetyzowania wideo za pomocą różnych frameworków będących testowanymi.
W trakcie procesu autorzy opracowali listę ‘kandydujących’ reguł i praw fizycznych, które wideo wygenerowane przez AI powinny spełniać, wykorzystując modele języka-wizji do oceny.
Autorzy stwierdzają:
‘Na przykład w wideo sportowca grającego w tenisa reguła fizyczna polegałaby na tym, że piłka tenisowa powinna poruszać się po trajektorii parabolicznej pod wpływem grawitacji. Dla ocen złotego standardu prosimy ludzkich annotatorów o ocenę każdego wideo pod kątem ogólnej zgodności semantycznej i zdrowego rozsądku fizycznego, oraz o oznaczenie ich zgodności z różnymi regułami fizycznymi.’

Powiązanie: powyżej: Podpowiedź jest generowana z akcji przy użyciu LLM i wykorzystywana do utworzenia wideo z generatora text-to-video. Model języka-wizji opatruje wideo podpisem, identyfikując możliwe reguły fizyczne. Poniżej: Ludzcy annotatorzy oceniają realistyczność wideo, potwierdzają naruszenia reguł, dodają brakujące reguły i sprawdzają, czy wideo odpowiada oryginalnej podpowiedzi.
Początkowo badacze opracowali zestaw akcji w celu oceny zdrowego rozsądku fizycznego w wideo wygenerowanych przez AI. Zaczęli od ponad 600 akcji pochodzących z zestawów danych Kinetics, UCF-101 i SSv2, koncentrując się na działaniach związanych ze sportem, interakcjami z obiektami i prawami fizyki.
Dwie niezależne grupy studentów ze specjalizacji STEM (z minimum licencjatem) przeglądały i filtrowały listę, wybierając akcje, które testowały zasady takie jak grawitacja, pęd i elastyczność, jednocześnie usuwając zadania o niskim ruchu, takie jak pisanie, głaskanie kota lub żucie.
Po dalszym udoskonaleniu za pomocą Gemini-2.0-Flash-Exp, aby wyeliminować duplikaty, ostateczny zestaw danych obejmował 197 akcji, z 54 związanych z interakcjami z obiektami i 143 skoncentrowanych na działaniach fizycznych i sportowych:

Przykłady zdestylowanych akcji.
W drugim etapie badacze wykorzystali Gemini-2.0-Flash-Exp do wygenerowania 20 podpowiedzi dla każdej akcji w zestawie danych, co dało łącznie 3 940 podpowiedzi. Proces generowania koncentrował się na widocznych interakcjach fizycznych, które mogły być wyraźnie przedstawione w wygenerowanym wideo. Wykluczało to elementy niewidoczne, takie jak emocje, szczegóły sensoryczne i język abstrakcyjny, ale obejmowało różnorodne postacie i obiekty.
Na przykład, zamiast prostej podpowiedzi ‘Łucznik wyzwala strzałę’, model został nakierowany na wygenerowanie bardziej szczegółowej wersji, takiej jak ‘Łucznik ciągnie cięciwę do pełnej napiętości, a następnie wyzwala strzałę, która leci prosto i trafia w cel na papierowej tarczy’.
Ponieważ nowoczesne modele wideo mogą interpretować dłuższe opisy, badacze dalej udoskonalili podpisów przy użyciu Mistral-NeMo-12B-Instruct, aby dodać szczegóły wizualne bez zmiany oryginalnego znaczenia.

Przykładowe podpowiedzi z VideoPhy-2, sklasyfikowane według akcji fizycznych lub interakcji z obiektami. Każda podpowiedź jest sparowana z odpowiednią akcją i istotnym prawem fizycznym, które testuje.
W trzecim etapie reguły fizyczne nie były pochodną podpowiedzi tekstowych, ale raczej wygenerowanych wideo, ponieważ modele generatywne mogą mieć trudności z przestrzeganiem warunkowych podpowiedzi tekstowych.
Wideo były najpierw tworzone przy użyciu podpowiedzi VideoPhy-2, a następnie ‘up-kapcionowane’ za pomocą Gemini-2.0-Flash-Exp w celu wyodrębnienia kluczowych szczegółów. Model zaproponował trzy oczekiwane reguły fizyczne na wideo, które ludzcy annotatorzy przeglądali i rozszerzali, identyfikując dodatkowe potencjalne naruszenia.

Przykłady z powiększonych podpisów.
Następnie, aby zidentyfikować najtrudniejsze akcje, badacze wygenerowali wideo przy użyciu CogVideoX-5B z podpowiedziami z zestawu danych VideoPhy-2. Następnie wybrali 60 akcji spośród 197, w których model konsekwentnie nie był w stanie przestrzegać podpowiedzi i podstawowego zdrowego rozsądku fizycznego.
Te akcje obejmowały interakcje bogate w fizykę, takie jak transfer pędu w rzucie dyskiem, zmiany stanu, takie jak ugięcie obiektu aż do złamania, zadania balansowe, takie jak chodzenie po linie, oraz złożone ruchy, w tym salta wsteczne, skoki o tyczce i rzuty pizzą, wśród innych. Łącznie wybrano 1 200 podpowiedzi, aby zwiększyć trudność podzestawu.
Wynikowy zestaw danych składał się z 3 940 podpisów – 5,72 razy więcej niż w poprzedniej wersji VideoPhy. Średnia długość oryginalnych podpisów wynosi 16 tokenów, podczas gdy powiększone podpisy osiągają 138 tokenów – 1,88 razy i 16,2 razy dłuższe odpowiednio.
Zestaw danych zawiera również 102 000 ludzkich adnotacji, obejmujących zgodność semantyczną, zdrowy rozsądek fizyczny i naruszenia reguł w różnych modelach generowania wideo.
Ocena
Badacze zdefiniowali wyraźne kryteria oceny wideo. Głównym celem było ocenienie, jak dobrze każde wideo odpowiadało swojej wejściowej podpowiedzi i przestrzegało podstawowych zasad fizycznych.
Zamiast po prostu rankować wideo według preferencji, wykorzystali oni ocenę opartą na ocenach, aby uchwycić szczegółowe sukcesy i niepowodzenia. Ludzcy annotatorzy oceniali wideo w skali pięciopunktowej, co umożliwiło bardziej szczegółowe oceny, a ocena sprawdzała również, czy wideo przestrzegało różnych reguł i praw fizycznych.
Dla oceny ludzkiej wybrano grupę 12 annotatorów z prób na Amazon Mechanical Turk (AMT), którzy otrzymali szczegółowe instrukcje zdalne. Dla uczciwości zgodność semantyczna i zdrowy rozsądek fizyczny były oceniane oddzielnie (w oryginalnym badaniu VideoPhy były one oceniane łącznie).
Annotatorzy najpierw oceniali, jak dobrze wideo odpowiadało swoim wejściowym podpowiedziom, a następnie oddzielnie oceniali realistyczność fizyczną, oceniali naruszenia reguł i ogólną realistyczność w skali pięciopunktowej. Pokazano tylko oryginalne podpowiedzi, aby utrzymać uczciwą porównanie między modelami.

Interfejs przedstawiony annotatorom AMT.
Chociaż ocena ludzka pozostaje złotym standardem, jest droga i ma wiele zastrzeżeń. Dlatego automatyczna ocena jest niezbędna do szybszych i bardziej skalowalnych ocen modeli.
Autorzy pracy przetestowali kilka modeli wideo-językowych, w tym Gemini-2.0-Flash-Exp i VideoScore, pod kątem ich zdolności do oceniania wideo pod względem dokładności semantycznej i ‘zdrowego rozsądku fizycznego’.
Modele oceniały każde wideo w skali pięciopunktowej, a oddzielne zadanie klasyfikacji określało, czy reguły fizyczne były przestrzegane, naruszone czy niejasne.
Doświadczenia wykazały, że istniejące modele wideo-językowe miały trudności z dopasowaniem się do ocen ludzkich, głównie ze względu na słabe rozumowanie fizyczne i złożoność podpowiedzi. Aby poprawić automatyczną ocenę, badacze opracowali VideoPhy-2-Autoeval, model o 7 miliardach parametrów, zaprojektowany do dostarczania bardziej dokładnych przewidywań w trzech kategoriach: zgodność semantyczna; zdrowy rozsądek fizyczny; i zgodność z regułami, dostrajany na modelu VideoCon-Physics przy użyciu 50 000 ludzkich adnotacji*.
Dane i Testy
Z tymi narzędziami w miejscu, autorzy przetestowali kilka systemów generatywnych wideo, zarówno za pomocą lokalnych instalacji, jak i, gdy było to konieczne, za pomocą komercyjnych API: CogVideoX-5B; VideoCrafter2; HunyuanVideo-13B; Cosmos-Diffusion; Wan2.1-14B; OpenAI Sora; i Luma Ray.
Modele były uruchamiane z podpowiedziami z powiększonymi podpisami, gdzie to możliwe, z wyjątkiem tego, że Hunyuan Video i VideoCrafter2 działają pod ograniczeniami 77-token CLIP i nie mogą akceptować podpowiedzi o długości powyżej pewnego limitu.
Wygenerowane wideo były ograniczone do mniej niż 6 sekund, ponieważ krótsze dane wyjściowe są łatwiejsze do oceny.
Dane napędzające pochodziły z zestawu danych VideoPhy-2, który został podzielony na zestaw benchmarkowy i zestaw szkoleniowy. Wygenerowano 590 wideo na model, z wyjątkiem Sora i Ray2; ze względu na czynnik kosztowy (wygenerowano mniejszą liczbę wideo dla tych modeli).
(Proszę odnieść się do oryginalnego artykułu dla dalszych szczegółów oceny, które są wyczerpująco udokumentowane tam)
Wstępna ocena dotyczyła działań fizycznych/sportowych (PA) i interakcji z obiektami (OI), i przetestowała zarówno ogólny zestaw danych, jak i wspomniany ‘trudniejszy’ podzbiór:

Wyniki z pierwszej rundy.
Autorzy komentują:
‘Nawet najlepszy model, Wan2.1-14B, osiąga tylko 32,6% i 21,9% w pełnym i trudnym podziale naszego zestawu danych. Jego względnie silna wydajność w porównaniu z innymi modelami można przypisać różnorodności jego multimodalnych danych szkoleniowych, a także solidnemu filtrowaniu ruchu, które zachowuje wysokiej jakości wideo w szerokim zakresie akcji.
‘Ponadto obserwujemy, że zamknięte modele, takie jak Ray2, radzą sobie gorzej niż otwarte modele, takie jak Wan2.1-14B i CogVideoX-5B. To sugeruje, że zamknięte modele nie są koniecznie lepsze od otwartych w odzwierciedlaniu zdrowego rozsądku fizycznego.
‘Godne uwagi jest to, że Cosmos-Diffusion-7B osiąga drugi najlepszy wynik w trudnym podziale, nawet wyprzedzając znacznie większy model HunyuanVideo-13B. Może to być spowodowane wysokim udziałem ludzkich działań w danych szkoleniowych, a także syntetycznie wyrenderowanymi symulacjami.’
Wyniki wykazały, że modele wideo radzą sobie gorzej z działaniami fizycznymi, takimi jak sport, niż z prostszymi interakcjami z obiektami. To sugeruje, że poprawa AI w tym obszarze będzie wymagała lepszych zestawów danych, szczególnie wysokiej jakości nagrania sportowych, takich jak tenis, dysk, baseball i krykiet.
Badanie również badało, czy fizyczna realistyczność modelu skorelowana jest z innymi metrykami jakości wideo, takimi jak estetyka i gładkość ruchu. Wyniki ujawniły brak silnej korelacji, co oznacza, że model nie może poprawić swojej wydajności w VideoPhy-2, po prostu generując wizualnie atrakcyjne lub płynne ruchy – potrzebuje głębszego zrozumienia zdrowego rozsądku fizycznego.
Chociaż artykuł dostarcza wiele przykładów jakościowych, niewiele z przykładów statycznych przedstawionych w PDF wydaje się powiązanych z obszernymi przykładami wideo, które autorzy dostarczają na stronie projektu. Dlatego też przyjrzymy się niewielkiej części przykładów statycznych, a następnie kilku przykładom wideo.
Kliknij, aby odtworzyć. Tutaj podpis brzmiał ‘Osoba energicznie skręca mokry ręcznik, woda jest rozpryskiwana na zewnątrz w widocznym łuku’ – ale wynikowy źródło wody jest bardziej podobne do węża hydraulicznego niż do ręcznika.
Kliknij, aby odtworzyć. Tutaj podpis brzmiał ‘Chemik wlewa przezroczystą ciecz z kolby do probówki, starannie unikając rozlewów’, ale widzimy, że objętość wody dodawanej do kolby nie jest spójna z ilością wychodzącą z dzbanka.
Jak wspomniałem na początku, objętość materiału związanego z tym projektem znacznie przekracza to, co można objąć tutaj. Dlatego też proszę odnieść się do oryginalnego artykułu, strony projektu i powiązanych stron, o których mowa powyżej, aby uzyskać wyczerpujący opis procedur autorów i znacznie więcej przykładów testowych i szczegółów proceduralnych.
* Co do pochodzenia adnotacji, artykuł określa tylko ‘zakupione do tych zadań’ – wydaje się, że jest to dużo, aby zostać wygenerowanym przez 12 pracowników AMT.
Pierwotnie opublikowane w czwartek, 13 marca 2025












