Kąt Andersona
Droga do lepszych edycji wideo opartych na sztucznej inteligencji

Sektor badań nad syntezą wideo/obrazu regularnie wytwarza architektury edycji wideo, a w ciągu ostatnich dziewięciu miesięcy tego typu wypuszczania stały się jeszcze częstsze. Powiedziałbym jednak, że większość z nich reprezentuje tylko niewielkie postępy w stanie sztuki, ponieważ podstawowe wyzwania są znaczne.
Jednak nowa współpraca pomiędzy Chinami a Japonią w tym tygodniu wyprodukowała kilka przykładów, które zasługują na bliższe zbadanie podejścia, nawet jeśli nie jest to koniecznie przełomowa praca.
W poniższym klipie wideo (z powiązanego projektu strony, która – ostrzegam – może obciążyć przeglądarkę) widzimy, że chociaż możliwości deepfaking systemu są nieistniejące w bieżącej konfiguracji, system robi świetną robotę, zmieniając w przekonywujący sposób i w znacznym stopniu tożsamość młodej kobiety na zdjęciu, na podstawie maski wideo (dolny lewy):
Kliknij, aby odtworzyć. Na podstawie maski segmentacji semantycznej uwidocznionej w lewym dolnym rogu, oryginalna (górny lewy) kobieta jest przekształcana w znacznie odmienną tożsamość, chociaż ten proces nie osiąga wymiany tożsamości wskazanej w podpowiedzi. Źródło: https://yxbian23.github.io/project/video-painter/ (bądźcie świadomi, że w momencie pisania, ta strona z odtwarzaniem automatycznym i wypełnionym wideo miała skłonność do awarii mojej przeglądarki). Proszę odnosić się do źródłowych filmów, jeśli możesz je uzyskać, w celu uzyskania lepszej rozdzielczości i szczegółów, lub sprawdź przykłady w filmie przeglądowym projektu na https://www.youtube.com/watch?v=HYzNfsD3A0s
Edycja oparta na masce tego rodzaju jest dobrze ugruntowana w statycznych modelach dyfuzyjnych, przy użyciu narzędzi takich jak ControlNet. Jednak utrzymanie spójności tła w wideo jest o wiele bardziej wymagające, nawet gdy obszary maskowane zapewniają modelowi elastyczność twórczą, jak pokazano poniżej:
Kliknij, aby odtworzyć. Zmiana gatunku, z nową metodą VideoPainter. Proszę odnosić się do źródłowych filmów, jeśli możesz je uzyskać, w celu uzyskania lepszej rozdzielczości i szczegółów, lub sprawdź przykłady w filmie przeglądowym projektu na https://www.youtube.com/watch?v=HYzNfsD3A0s
Autorzy nowej pracy uważają swoją metodę zarówno w odniesieniu do własnej architektury BrushNet Tencent, (której omówiliśmy w zeszłym roku), jak i w odniesieniu do ControlNet, obie z których zajmują się architekturą dwu gałęziową, zdolną do izolowania generacji pierwszego planu i tła.
Jednak zastosowanie tej metody bezpośrednio do bardzo produktywnej metody Diffusion Transformers (DiT) zaproponowanej przez OpenAI Sora, stwarza szczególne wyzwania, jak zauważają autorzy”
… (reszta treści)
Metoda
Potok zbierania danych dla VPData składa się z kolekcji, adnotacji, podziału, wyboru i podpisu:
… (reszta treści)
Dane i testy
VideoPainter został przeszkolony przy użyciu modelu CogVideo-5B-I2V, wraz z jego odpowiednikiem tekst-wideo. Zcurated korpus VPData został użyty w rozdzielczości 480x720px, przy stopy uczenia 1×10-5.
… (reszta treści)
Wnioski
VideoPainter wydaje się godnym dodatkiem do literatury. Typowy dla niedawnych rozwiązań, jednak ma znaczne wymagania obliczeniowe. Dodatkowo, wiele przykładów wybranych do prezentacji na stronie projektu jest znacznie gorszych niż najlepsze przykłady; byłoby więc interesujące zobaczyć tę ramę w konfrontacji z przyszłymi wpisami i szerszym zakresem poprzednich podejść.
… (reszta treści)












