Kąt Andersona
Kasowanie obiektów i osób z filmów wideo za pomocą sztucznej inteligencji

Nie, dziecko nie pozostaje na zdjęciu, jeśli sztuczna inteligencja ma coś do powiedzenia.
Usuwanie osób i obiektów z obrazów i filmów wideo jest popularnym kierunkiem badań w literaturze VFX, z rosnącą liczbą dedykowanych zbiorów danych i ram, które zajmują się tym wyzwaniem. Najnowszy z nich, z Instytutu Dużych Danych Uniwersytetu Fudan w Chinach, to EffectErase, system usuwania obiektów z filmów wideo, który, zdaniem autorów, znacznie poprawia stan sztuki w testach:
Zestawione z materiału ze strony projektu, przykłady metody EffectErase (zwróć uwagę, że podczas gdy dostarczamy link, strona źródłowa zawiera wiele filmów w wysokiej rozdzielczości i nie zoptymalizowanych, co może wpłynąć na stabilność Twojej przeglądarki. Towarzyszący film na YouTube jest łatwiejszym i pełniejszym odniesieniem i jest osadzony na końcu tego artykułu). Źródło
Nowa praca obejmowała stworzenie/zebranie pół-nowego zbioru danych, składającego się z prawie 350 oryginalnych scen z życia wziętych i syntetyzowanych (wykorzystując publiczne repozytoria*), które zostały zarejestrowane za pomocą specjalistycznego sprzętu lub pozyskane i przekształcone w procesie opartym na otwartym frameworku Blender 3D.
Hybrydowy zbiór danych Video Object Removal (VOR) stanowi podstawę dla samej aplikacji EffectErase, która jest zbudowana na systemie generowania filmów wideo Wan2.1. System ten definiuje również dwa nowe powiązane benchmarki: VOR Eval i VOR Wild – odpowiednio, dla próbek z i bez ground truth.
(Chociaż artykuł ma towarzyszącą stronę projektu, jest dość obciążona wieloma filmami w wysokiej rozdzielczości i trudna do załadowania; więc proszę odnosić się do wybranych przeze mnie fragmentów w osadzonym powyżej filmie, jeśli znajdzie Pan/Pani stronę projektu trudną do użycia)

Porównanie ilości w porównywalnych poprzednich zbiorach danych, w odniesieniu do nowej oferty. Źródło
Naukowcy twierdzą, że ich podejście daje najlepsze wyniki, zarówno w ilościowych miarach, jak i w jakościowych wynikach, ocenianych przez badanie ludzi.
Stwierdzają, że poprzednie prace nie zawsze powiodły się w usuwaniu efektów towarzyszących obiektom, takich jak cienie i odbicia, i że ich zbiór danych został starannie stworzony, aby naprawić tę wadę:

Przykłady niepowodzeń poprzednich podejść w usuwaniu obiektów i efektów wtórnych, takich jak cienie i odbicia.
Nowy artykuł nosi tytuł EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing i pochodzi od czterech naukowców z Wydziału Informatyki i Sztucznej Inteligencji Uniwersytetu Fudan.
Metoda
Hybrydowy zbiór danych VOR został zaprojektowany, aby objąć wystarczająco szeroki zakres scenariuszy, aby uwzględnić wszystkie implikacje prób usunięcia osoby lub obiektu z filmu wideo:

Para klatek z zbioru danych VOR ilustruje, jak usunięcie obiektu musi wykraczać poza widoczny przedmiot do jego wywołanych efektów, z przykładami pokazującymi zakrycie, cienie, zmiany oświetlenia, odbicia i deformację fizyczną, każdy przedstawiony jako wejście (obiekt obecny) obok odpowiedniego czystego tła po usunięciu. Dla dalszych przykładów, zobacz dołączony film na YouTube na końcu tego artykułu.
Pięć przedstawicielskich typów “zakłóceń” do rozwiązania zostało zdefiniowanych przez autorów jako zakrycie, w tym różne typy zakrycia szkła i dymu; cienie; oświetlenie (na przykład, gdy obiekt do usunięcia tworzy lub zmienia ścieżkę światła); odbić; i deformacja (na przykład, odcisk użytkownika na poduszce, który nie powinien przetrwać usunięcia osoby).

Potok budowy zbioru danych VOR, łączący sceny syntetyczne wygenerowane przez Blender z nagraniami z życia wziętymi, gdzie dane syntetyczne są budowane z wyselekcjonowanych środowisk 3D, obiektów i trajektorii kamery, a nagrania z życia wzięte są rejestrowane w różnych scenariuszach, uzupełnione o ruch Ken Burns. SAM2 segmentacja i ręczna refinezacja następnie produkują wyrównane triplety filmowe z odpowiednimi maskami.
Dla danych z życia wziętych, naukowcy użyli stałych kamer do rejestracji scen “z” i “bez” w różnych środowiskach, porach dnia i warunkach pogodowych.
Dla danych syntetycznych, wielokrotne punkty widzenia zostały wyrenderowane, a scenariusze z wieloma obiektami zostały stworzone, zawierające celowo złożone i wymagające typy ruchu kamery, takie jak mogą wystąpić w filmach z życia wziętych; i naukowcy zauważają, że ten podejście jest bardziej zaawansowane i wymagające niż to, które zostało użyte dla innych zbiorów danych, takich jak Remove Objects with Side Effects in Videos (ROSE) dataset.
Aby zwiększyć różnorodność ruchu, efekt Ken Burns został zastosowany do par nagraniowych, dodając kontrolowane przesuwania, powiększenia i lekkie ruchy ręki podczas czternastu przeddefiniowanych reguł, z pięcioma wzorcami ruchu próbkowanymi na parę, przy zachowaniu kadru wewnątrz oryginalnego kadru.
Skala i różnorodność zostały dalej rozszerzone przez łączenie obiektów syntetycznych z wieloma ustawieniami kamery, maski zostały wygenerowane przez umieszczenie punktowych wskazówek na kluczowych klatkach, propagując segmentację za pomocą Segment Anything 2 (SAM2), oczyszczając i rafinując wyniki, oraz montując zwalidowane triplety przedniego planu, tła i maski do szkolenia.
Końcowy zbiór obejmuje 145 godzin filmów wideo na ponad 60 000 par filmów, rzeczywistych i syntetycznych, obejmujących 366 klas obiektów w 443 scenach.
Sieć EffectErase sama wchłania materiał za pomocą Variational Auto-Encoder (VAE)†, z szumem latentnym obsługiwanym przez Wan2.1. Nad tym szkieletem EffectErase działa Removal-Insertion Joint Learning, który trenuje oba zadania razem na tych samych obszarach; Task-Aware Region Guidance (TARG), który używa tokenów obiektów i zadań z cross-attention, aby modelować przestrzenno-czasowe powiązania między obiektami i ich efektami, oraz umożliwić przełączanie zadań; i Effect Consistency Loss, który wyrównuje obszary efektów wyrównane w zadaniach usunięcia i wstawiania:

Schemat ramy EffectErase. Podczas szkolenia, pary filmów wideo są kodowane w wspólną przestrzeń latentną, połączone z szumem i przetworzone przez transformator dyfuzyjny kierowany przez cross-attention zorientowany na zadanie, podczas gdy strata spójności efektu wyrównuje obszary usunięcia i wstawiania, tak aby oba zadania koncentrowały się na tym samym obszarze.
Same procesy usunięcia i wstawiania są trenowane razem, używając wspólnej bazy dyfuzyjnej, tak aby model nauczył się koncentrować na tych samych obszarach i wskazówkach strukturalnych.
Filmy wideo z obiektami, filmy wideo tła tylko, i maski, są najpierw zakodowane w przestrzeń latentną; szum jest następnie dodany do szkolenia dyfuzyjnego, a model uczy się odzyskiwać czyste reprezentacje pod kierunkiem zorientowanym na zadanie. Lekki adapter następnie łączy szumy cech z warunkami usunięcia lub wstawiania, umożliwiając obu zadań dzielenie się nadzorem, przy zachowaniu sterowalności.
Task-Aware Region Guidance tworzy sygnał zorientowany na zadanie, łącząc tokeny językowe z cechami wizualnymi wyodrębnionymi z obiektu przedniego planu, używając CLIP, zastępując token obiektu ogólny z osadzaniem pochodzącym z rzeczywistej zawartości obrazu. To połączone reprezentowanie jest wstrzykiwane do bazy przez cross-attention, pozwalając modelowi śledzić, jak obiekt i jego efekty wizualne ewoluują w przestrzeni i czasie, umożliwiając elastyczne przełączanie między usunięciem a wstawianiem.
Effect Consistency Loss zmusza procesy usunięcia i wstawiania do koncentrowania się na tych samych zmienionych obszarach, ponieważ oba zadania dotyczą tego samego obiektu i jego efektów wizualnych. Mapy uwagi z każdej gałęzi są następnie łączone w miękkie mapy regionów, i wyrównane z mapą różnic obliczoną z filmów wideo obiektu i tła, tak aby zachować delikatne zmiany, takie jak oświetlenie i cienie. Ta dodatkowa strata pomaga wstawianiu kierować usunięciem i utrzymuje oba zadania spójne.
Dane i testy
Naukowcy przetestowali swoje podejście wobec różnych metod inpainting, inpainting filmów wideo i usuwania obiektów: OmniPaint; ObjectClear; VACE; DiffuEraser; ProPainter; ROSE; i MiniMax-Remover.
Wan2.1 został dostrojony z LoRA†† przy użyciu zbioru danych VOR w rozdzielczości 832x480px. 81 kolejnych klatek (efektywny limit dla WAN, poza którym błędy mają tendencję do występowania) zostało losowo wybranych do szkolenia, które odbyło się przez 129 000 iteracji przy rozmiarze partii 8, na ośmiu procesorach H100, każdym z 80 GB pamięci VRAM. Rozmiar partii został ustalony na 8, a współczynnik uczenia na 1×102, a rang LoRA na 256.
ROSE-Benchmark kolekcja syntetyczna była jedynym zewnętrznym zbiorem danych, który został przetestowany; dwa pozostałe to VOR-Eval, testowy podział zbioru danych VOR; i VOR-Wild, zestaw testowy składający się z 195 filmów wideo z Internetu, zawierających “dynamiczne obiekty”.
Użyte metryki to Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); i Fréchet Video Distance (FVD). Badanie użytkowników 195 wygenerowanych filmów wideo z VOR-Wild również zostało uwzględnione, z uwzględnieniem średnich ocen od 20 wolontariuszy.
Ponadto autorzy opracowali QScore, metrykę wykorzystującą model multimodalny Qwen-VL, w celu oceny jakości filmów wideo po usunięciu obiektów, pod względem pozostałych artefaktów lub pominiętych usunięć środowiskowych, takich jak cienie i efekty oświetlenia:

Porównanie ilościowe na benchmarkach ROSE i VOR, z najlepszymi i drugimi wynikami wyróżnionymi pogrubieniem i podkreśleniem.
W odniesieniu do tych wyników, autorzy zauważają:
‘[Aktualne] metody inpainting obrazów działają na pojedynczych klatkach, używając modeli 2D bez modelowania czasowego, i dlatego nie są w stanie utrzymać spójności czasowej w filmach wideo.
Najnowsze metody inpainting filmów wideo nie modelują jawnie efektów ubocznych obiektów, w wyniku czego usunięcie jest nienaturalne. Istniejące metody usuwania obiektów z filmów wideo nie posiadają modelowania korelacji przestrzenno-czasowej między obiektem a jego efektami ubocznymi, i w rezultacie często produkują artefakty i pozostałości usuniętych obiektów.
‘Ogólnie, EffectErase osiąga najlepsze wyniki we wszystkich zbiorach danych i metrykach oceny. Uzyskuje najlepsze wyniki w metryce jakości filmu wideo FVD, demonstrując wyższą gładkość czasową i spójność generowanych filmów wideo.
‘Nasza metoda również osiąga najwyższe wyniki QScore i oceny użytkowników, co dalej potwierdza jej skuteczność w produkcji przekonywujących wyników usunięcia.’
Dla oceny jakościowej, wyniki statyczne są przedstawione w artykule (pokazane) bezpośrednio poniżej, a wyniki dynamiczne są dostępne na stronie projektu i w prezentacji filmowej na YouTube:

Porównanie jakościowe na VOR-Eval w przypadkach zakrycia, cienia, oświetlenia, odbicia i deformacji. Metody inpainting mają trudności z usunięciem efektów poza maską, podczas gdy metody usuwania obiektów często pozostawiają widoczne artefakty. EffectErase usuwa zarówno obiekty docelowe, jak i ich skojarzone efekty w sposób bardziej czysty. Proszę odnosić się do oryginalnego artykułu dla lepszej rozdzielczości, a do strony projektu dla przykładów filmowych.
Odwołujemy się do różnych powiązanych przykładów na stronie projektu, zapowiedzianych poniżej, a także do oficjalnego filmu na YouTube osadzonego na końcu tego artykułu:
Kliknij, aby odtworzyć. Przykład porównawczy ze strony projektu EffectErase. Proszę odnosić się do strony dla lepszej rozdzielczości (z powyższymi zastrzeżeniami) i dla dalszych przykładów.
Autorzy komentują:
‘Metody inpainting filmów wideo często produkują artefakty w maskowanych regionach i nie są w stanie całkowicie usunąć efektów ubocznych powodowanych przez usunięte obiekty. Poprzednie podejścia do usuwania obiektów, takie jak [ROSE] i [MinMax-Remover], radzą sobie dobrze z usunięciem obiektów docelowych, ale nadal mają trudności z efektami ubocznymi, szczególnie w przypadkach zakrycia, cienia, oświetlenia, odbicia i deformacji.
‘W przeciwieństwie do tego, EffectErase skutecznie usuwa zarówno obiekty docelowe, jak i ich skojarzone efekty, w wyniku czego otrzymujemy czyste, spójne i wysokiej jakości wyniki.’
W podsumowaniu, naukowcy zauważają, że ich metoda może być również dostosowana do zadań wstawiania zamiast usuwania, bez potrzeby dodatkowego szkolenia:

Wyniki wstawiania obiektów w filmach wideo. EffectErase wstawia obiekty, zachowując zawartość tła i generując spójne efekty wywołane przez obiekt, takie jak cienie i odbicia, w całym filmie wideo.
Wyniki filmowe dla zadania wstawiania można zobaczyć w (czasowy) filmie na YouTube (również osadzonym bez znaczników czasu na końcu artykułu).
Wnioski
Spojrzenie na podobne projekty w literaturze ujawnia, że wiele z nich nadal liczy na to, że ogólne modele VFX będą w stanie włączyć tego rodzaju funkcjonalność do ogólnego “narzędzia” modelu zaprojektowanego dla szeregu efektów, a nie tylko dla tego konkretnego zadania.
Jednakże, zgodnie z zasadą “wszystko dla wszystkich”, wydaje się rozsądne założyć, że dedykowane systemy, takie jak EffectErase, będą nadal utrzymywać przewagę nad bardziej ogólnymi podejściami; z zastrzeżeniem, że luka może ostatecznie skurczyć się na tyle, aby różnica nie była warta dodatkowego wysiłku szkolenia oddzielnego modelu.
* Jednakże, z rosnącymi obawami dotyczącymi kwestii własności intelektualnej, można by oczekiwać, że wszystkie takie źródła będą cytowane; jednak jeśli dostępne materiały z nowej pracy wymieniają źródło modeli 3D, nie byłem w stanie znaleźć tego odniesienia.
† Odnośnik dostarczony wydaje się być ogólnym tekstem wyjaśniającym z 2013 roku, z konkretnym VAE nieopisany.
†† Pobrany z artykułu, jest to niejasne opisanie semantyczne, ponieważ dostrojenie i LoRA to różne procesy z bardzo różnymi wymaganiami.
Publikacja po raz pierwszy w sobotę, 21 marca 2026












