Kąt Andersona

Microsoft Proponuje GODIVA, Ramowy System Uczenia Maszynowego do Generowania Wideo z Tekstu

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Współpraca między Microsoft Research Asia i Uniwersytetem Duke doprowadziła do stworzenia systemu uczenia maszynowego, który potrafi generować wideo wyłącznie na podstawie tekstu, bez użycia Sieci Adversarialnych Generatywnych (GAN).

Projekt, zatytułowany GODIVA (Generating Open-DomaIn Videos from nAtural Descriptions), opiera się na niektórych podejściach stosowanych przez system syntezowania obrazów OpenAI DALL-E, ujawniony wcześniej tego roku.

Wczesne wyniki z GODIVA, z klatkami z wideo utworzonymi z dwóch podpowiedzi. Dwa górne przykłady zostały wygenerowane z podpowiedzi 'Graj w golfa na trawie', a dolny trzeci z podpowiedzi 'Gra w baseball jest rozgrywana'. Źródło: https://arxiv.org/pdf/2104.14806.pdf

Wczesne wyniki z GODIVA, z klatkami z wideo utworzonymi z dwóch podpowiedzi. Dwa górne przykłady zostały wygenerowane z podpowiedzi ‘Graj w golfa na trawie’, a dolny trzeci z podpowiedzi ‘Gra w baseball jest rozgrywana’. Źródło: https://arxiv.org/pdf/2104.14806.pdf

GODIVA wykorzystuje model Vector Quantised-Variational AutoEncoder (VQ-VAE) po raz pierwszy wprowadzony przez badaczy z projektu DeepMind Google w 2018 roku, oraz kluczowy składnik w zdolnościach transformacyjnych DALL-E.

Architektura modelu VQ-VAE, z przestrzenią osadzania po prawej stronie i kodera/dekodera dzielącego przestrzeń wymiarową w celu obniżenia strat podczas odtwarzania. Źródło: https://arxiv.org/pdf/1711.00937.pdf

Architektura modelu VQ-VAE, z przestrzenią osadzania po prawej stronie i kodera/dekodera dzielącego przestrzeń wymiarową w celu obniżenia strat podczas odtwarzania. Źródło: https://arxiv.org/pdf/1711.00937.pdf

VQ-VAE został wykorzystany w kilku projektach do wygenerowania przewidywanego wideo, gdzie użytkownik dostarcza początkową liczbę klatek i prosi system o wygenerowanie dodatkowych klatek:

Poprzednia praca: VQ-VAE wnioskuje klatki z bardzo ograniczonego dostarczonego materiału źródłowego. Źródło: Materiały uzupełniające na https://openreview.net/forum?id=bBDlTR5eDIX

Poprzednia praca: VQ-VAE wnioskuje klatki z bardzo ograniczonego dostarczonego materiału źródłowego. Źródło: Materiały uzupełniające na https://openreview.net/forum?id=bBDlTR5eDIX

Jednak autorzy nowego artykułu twierdzą, że GODIVA reprezentuje pierwszą czystą implementację tekst-wideo (T2V), która wykorzystuje VQ-VAE, a nie bardziej nieprzewidywalne wyniki, które poprzednie projekty uzyskały za pomocą GAN.

Punkty Startowe w Tekst-Wideo

Chociaż wpis jest krótki w szczegóły dotyczących kryteriów, według których tworzone są ramy pochodzenia, GODIVA wydaje się wzywać obrazy startowe znikąd, zanim przejdzie do ekstrapolacji ich w niskiej rozdzielczości klatek wideo.

Kolumnowa reprezentacja trójwymiarowego systemu uwagi rozproszonej, który napędza GODIVA do zadań tekst-obraz. Autoregresja jest przewidywana przez cztery czynniki: wejściowy tekst, względne położenie z poprzednią klatką (podobnie jak NVIDIA's SPADE i inne metody, które rozwijają lub ewoluują poza podejścia Optical Flow), te same wiersze w tej samej klatce, i te same kolumny w tej samej kolumnie.

Kolumnowa reprezentacja trójwymiarowego systemu uwagi rozproszonej, który napędza GODIVA do zadań tekst-obraz. Autoregresja jest przewidywana przez cztery czynniki: wejściowy tekst, względne położenie z poprzednią klatką (podobnie jak NVIDIA’s SPADE i inne metody, które rozwijają lub ewoluują poza podejścia Optical Flow), te same wiersze w tej samej klatce, i te same kolumny w tej samej kolumnie.

Faktycznie, pochodzenie pochodzi z etykiet w danych wykorzystanych: GODIVA został wstępnie wyszkolony na zestawie danych Howto100M, składającym się z 136 milionów podpisanych klipów wideo pochodzących z YouTube przez 15 lat, i zawierającym 23 000 oznaczonych działań. Niemniej jednak, każde możliwe działanie jest obecne w bardzo dużej liczbie klipów, zwiększającej się z uogólnieniem (tj. ‘Zwierzęta i zwierzęta domowe’ mają 3,5 miliona klipów, podczas gdy ‘psy’ mają 762 000 klipów), i tak więc istnieje jeszcze wiele wyboru możliwych punktów startowych.

Model został oceniony na zestawie danych Microsoft’s MSR Video to Text (MSR-VTT). Jako dalsze testy architektury, GODIVA został wyszkolony od podstaw na zestawie danych Moving Mnist i Double Moving Mnist, oba pochodzące z oryginalnej bazy danych MNIST, współpracy między Microsoft, Google i Courant Institute of Mathematical Sciences at NYU.

Ocena Klatek w Ciągłej Syntezie Wideo

Zgodnie z IRC-GAN z Uniwersytetu Pekińskiego, GODIVA dodaje cztery dodatkowe sprawdzanie kolumnowe do oryginalnej metody MNIST, która oceniała poprzednie i następne klatki, przechodząc w górę>dół, a następnie w lewo>prawo. IRC-GAN i GODIVA również rozważają klatki, przechodząc uwagę w lewo>prawo, prawo>lewo, górę>dół i dół>górę.

Dodatkowe wygenerowane klatki z GODIVA.

Dodatkowe wygenerowane klatki z GODIVA.

Ocena Jakości Wideo i Wierności Podpowiedzi

Aby zrozumieć, jak dobrze udało się wygenerowanie obrazu, badacze wykorzystali dwie metryki: jedną opartą na podobieństwie CLIP, i nową metrykę Relatywne Dopasowanie (RM).

Ramowa CLIP OpenAI jest w stanie zero-shot dopasowywania obrazów do tekstu, a także ułatwia syntezę obrazu przez odwrócenie tego modelu. Badacze podzielili wynik CLIP przez obliczoną podobieństwo między podpowiedzią a prawdziwym wideo, aby uzyskać wynik RM. W oddzielnym cyklu oceny, wynik został oceniony przez 200 osób i porównany z programowymi wynikami.

W końcu GODIVA został przetestowany w porównaniu z dwoma poprzednimi ramami, TFGAN i współpracą Duke/NEC z 2017 roku, T2V.

T2V-vs-TFGAN-vs-GODIVA

TFGAN może wygenerować 128 pikseli kwadratowych w porównaniu z 64×64 wyjściem, które ogranicza GODIVA i T2V w powyższych przykładach, ale badacze zauważają, że GODIVA wytwarza bardziej zdecydowane i zaangażowane ruchy, oraz generuje zmiany sceny bez specjalnego nakazu, i nie boi się generować zbliżeń.

W późniejszych przebiegach, GODIVA również generuje 128x128px wyjście, z zmianami w POV:

godiva_baseball_128px

W własnej metryce RM, GODIVA jest w stanie osiągnąć wyniki zbliżone do 100% pod względem autentyczności (jakości wideo) i wierności (jak ściśle wygenerowany treść odpowiada podpowiedzi).

Badacze przyznają jednak, że rozwój metryk wideo-CLIP byłby mile widziany w tym obszarze syntezowania obrazów, ponieważ zapewniłby równy poziom dla oceny jakości wyników bez uciekania się do nadmiernego dopasowania i braku uogólnienia, które coraz częściej są krytykowane w odniesieniu do ‘standardowych’ wyzwań wizji komputerowej w ciągu ostatnich dziesięciu lat.

Zauważają również, że generowanie dłuższych wideo będzie rozważane w dalszym rozwoju systemu, ponieważ już 10 klatek 64x64px wyjścia wymaga 2560 tokenów wizualnych, co może szybko stać się drogie i niezarządzalne.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai