Kąt Andersona
Spójna edycja treści wideo z wykorzystaniem wejścia opartego na tekście

Pomimo że profesjonalna społeczność VFX jest zainteresowana – i czasem czuje się nieco zagrożona – nowymi innowacjami w syntezie obrazu i wideo, brak ciągłości czasowej w większości projektów edycji wideo opartych na AI powoduje, że wiele z tych wysiłków jest zaliczanych do sfery “psychedelicznej”, z lśniącymi i szybko zmieniającymi się teksturami i strukturami, niespójnymi efektami i rodzajem prymitywnej technologii, która przypomina erę fotochemiczną efektów wizualnych.
Jeśli chcesz zmienić coś bardzo konkretnego w filmie, co nie mieści się w kategorii deepfakes (tj. nakładania nowej tożsamości na istniejące nagranie osoby), większość obecnych rozwiązań działa pod bardzo surowymi ograniczeniami, jeśli chodzi o precyzję wymaganą do efektów wizualnych o wysokiej jakości.
Jednym z wyjątków jest ciągła praca luźnej grupy akademików z Instytutu Nauki Weizmann. W 2021 roku trzej z nich, we współpracy z Adobe, ogłosili nową metodę dekompozycji wideo i nakładania spójnego wewnętrznego mapowania – warstwowego atlasu neuronowego – do skomponowanego wyjścia, wraz z kanałami alfa i czasowo spójnym wyjściem.

Z 2021 roku: oszacowanie pełnego przejścia drogi w źródłowym klipie jest edytowane za pomocą sieci neuronowej w sposób, który tradycyjnie wymagałby obszernego rotoskopowania i dopasowywania. Ponieważ elementy tła i pierwszego planu są obsługiwane przez różne sieci, maski są naprawdę “automatyczne”. Źródło: https://layered-neural-atlases.github.io/
Chociaż częściowo pokrywa się z zakresem przepływu optycznego w pipeline VFX, warstwowy atlas nie ma bezpośredniego odpowiednika w tradycyjnych workflow CGI, ponieważ stanowi on podstawowo “mapę tekstury czasowej”, która może być wytwarzana i edytowana za pomocą tradycyjnych metod oprogramowania. Na drugim obrazie w powyższym ilustracji tło drogi jest reprezentowane (figuratywnie) w całym czasie trwania filmu. Zmiana tego obrazu podstawowego (trzeci obraz z lewej w ilustracji powyżej) powoduje spójną zmianę tła.
Obrazy “rozłożonego” atlasu powyżej reprezentują tylko poszczególne interpretowane klatki; spójne zmiany w dowolnej docelowej klatce wideo są mapowane z powrotem do oryginalnej klatki, zachowując wszelkie niezbędne nakrycia i inne wymagane efekty sceny, takie jak cienie lub odbicia.
Podstawowa architektura wykorzystuje wielowarstwowy perceptron (MLP) do reprezentowania rozłożonych atlasów, kanałów alfa i mapowań, wszystkich optymalizowanych jednocześnie i całkowicie w przestrzeni 2D, eliminując wiedzę wstępną o punktach geometrii 3D, mapach głębi i innych CGI-style ozdobach.
Odwołanie do atlasu poszczególnych obiektów można również wiarygodnie zmienić:

Spójna zmiana obiektu w ruchu w ramach ramy z 2021 roku. Źródło: https://www.youtube.com/watch?v=aQhakPFC4oQ
Zasadniczo system z 2021 roku łączy wyrównywanie geometrii, dopasowywanie, mapowanie, ponowne tekstowanie i rotoskopowanie w dyskretny proces neuronowy.
Text2Live
Trzej pierwotni badacze pracy z 2021 roku, wraz z NVIDIA Research, są wśród współtwórców nowej innowacji w technice, która łączy moc warstwowych atlasów z rodzajem techniki CLIP sterowanej tekstem, która wróciła do sławy w tym tygodniu z wydaniem DALL-E 2 przez OpenAI.
Nowa architektura, zatytułowana Text2Live, pozwala użytkownikowi końcowemu na tworzenie lokalnych edycji rzeczywistej zawartości wideo na podstawie podpowiedzi tekstowych:


Dwa przykłady edycji pierwszego planu. Dla lepszej rozdzielczości i definicji sprawdź oryginalne filmy na https://text2live.github.io/sm/pages/video_results_atlases.html
Text2Live oferuje semantyczną i wysoko zlokalizowaną edycję bez użycia wstępnie wytrenowanego generatora, dzięki wykorzystaniu wewnętrznej bazy danych, która jest specyficzna dla edytowanego klipu wideo.

Przekształcenia tła i pierwszego planu (obiektu) w Text2Live. Źródło: https://text2live.github.io/sm/pages/video_results_atlases.html
Technika ta nie wymaga od użytkownika dostarczania masek, takich jak typowy workflow rotoskopowania lub green-screen, ale raczej szacuje mapy istotności za pomocą techniki bootstrapowania opartej na badaniach z 2021 roku ze Szkoły Informatyki na Uniwersytecie w Tel Awiwie i Facebook AI Research (FAIR).
<img class="wp-image-180965 size-full" src="https://www.unite.ai/wp-content/uploads/2022/04/relevancy-maps.jpg" alt="Wygenerowane mapy wyjściowe za pomocą modelu uwagi ogólnego opartego na transformatore.” width=”1100″ height=”293″ /> Wygenerowane mapy wyjściowe za pomocą modelu uwagi ogólnego opartego na transformatore.
Nowy artykuł nosi tytuł Text2LIVE: Edycja warstwowa obrazu i wideo sterowana tekstem. Oryginalny zespół z 2021 roku dołączył do niego Omer Bar-Tal z Weizmann oraz Yoni Kasten z NVIDIA Research.
Architektura
Text2Live składa się z generatora wytrenowanego na pojedynczym obrazie wejściowym i podpowiedziach tekstowych. Model CLIP wstępnie wytrenowany na 400 milionach par tekstowo-obrazowych zapewnia powiązanego materiału wizualnego, z którego mogą być interpretowane transformacje wprowadzane przez użytkownika.

Generator akceptuje obraz wejściowy (klatkę) i wytwarza warstwę docelową RGBA zawierającą informacje o kolorze i przezroczystości. Warstwa ta jest następnie komponowana w oryginalne nagranie z dodatkowymi uzupełnieniami.

Kanał alfa w wygenerowanej warstwie RGBA zapewnia wewnętrzną funkcję komponowania bez odwoływania się do tradycyjnych pipeline z oprogramowaniem opartym na pikselach, takim jak After Effects.
Poprzez szkolenie na wewnętrznych obrazach istotnych dla docelowego wideo lub obrazu, Text2Live unika wymogu odwrotnej transformacji obrazu wejściowego do przestrzeni latentnej sieci GAN, co obecnie jest daleko od wystarczająco dokładnego dla wymagań edycji wideo o wysokiej jakości, lub użycia modelu dyfuzyjnego, który jest bardziej precyzyjny i konfigurowalny, ale nie może utrzymać wierności wideo docelowemu.

Różne edycje transformacyjne na podstawie podpowiedzi z Text2Live.
Poprzednie podejścia wykorzystywały metody oparte na propagacji lub podejścia oparte na przepływie optycznym. Ponieważ te techniki są w jakimś stopniu oparte na klatkach, żadna z nich nie jest w stanie utworzyć spójnego wyglądu zmian w wideo wyjściowym. Warstwowy atlas neuronowy zapewnia natomiast pojedynczą przestrzeń, w której można wprowadzać zmiany, które mogą pozostać wiernymi wprowadzonej zmianie, gdy wideo postępuje.

Brak “sizzling” lub losowych halucynacji: Text2Live uzyskuje interpretację podpowiedzi tekstowej “zardzewiały jeep” i stosuje ją raz do warstwowego atlasu neuronowego samochodu w filmie, zamiast ponownego uruchamiania transformacji dla każdej interpretowanej klatki.
Text2Live jest bliżej przełomu w komponowaniu opartym na AI, niż w płodnym obszarze text-to-image, który przyciągnął tak dużą uwagę w tym tygodniu z wydaniem drugiej generacji ramy DALL-E OpenAI (która może uwzględniać obrazy docelowe jako część procesu transformacji, ale nadal jest ograniczona w swojej zdolności do bezpośredniej ingerencji w zdjęcie, oprócz cenzurowania danych szkoleniowych i nakładania filtrów, zaprojektowanych w celu zapobiegania nadużyciom przez użytkowników).
Zamiast tego, Text2Live pozwala użytkownikowi końcowemu na wyodrębnienie atlasu, a następnie edycję go w jednym przejściu w środowiskach o wysokiej kontroli opartych na pikselach, takich jak Photoshop (i słusznie nawet bardziej abstrakcyjnych ramach syntezy obrazu, takich jak NeRF), zanim zostanie ponownie wprowadzony do środowiska o właściwej orientacji, które nie opiera się na estymacji 3D ani podejściach opartych na CGI.
Co więcej, Text2Live, jak twierdzą autorzy, jest pierwszą porównywalną ramą, która osiąga maskowanie i komponowanie w całkowicie automatyczny sposób.
Pierwotnie opublikowane 7 kwietnia 2022 r.













