Unghiul lui Anderson
Microsoft Propune GODIVA, un cadru de învățare automată Text-To-Video

O colaborare între Microsoft Research Asia și Universitatea Duke a produs un sistem de învățare automată capabil să genereze videoclipuri doar dintr-un prompt de text, fără a utiliza Rețele Adversative Generative (GAN).
Proiectul, intitulat GODIVA (Generarea de Videoclipuri Deschise din Descrieri Naturale), se bazează pe unele dintre abordările utilizate de sistemul de sinteză de imagini DALL-E al OpenAI, prezentat mai devreme în acest an.

Rezultate inițiale din GODIVA, cu cadre din videoclipuri create din două prompturi. Primele două exemple au fost generate din promptul ‘Joacă golf pe iarbă’, iar al treilea de jos din promptul ‘Un meci de baseball este jucat’. Sursă: https://arxiv.org/pdf/2104.14806.pdf
GODIVA utilizează modelul Vector Quantised-Variational AutoEncoder (VQ-VAE) prezentat pentru prima dată de cercetători de la proiectul DeepMind al Google în 2018, și care este, de asemenea, o componentă esențială a capacităților transformaționale ale DALL-E.

Arhitectura modelului VQ-VAE, cu spațiul de încorporare în partea dreaptă și encoder/decoder care împărtășesc spațiul dimensional pentru a reduce pierderile în timpul reconstrucției. Sursă: https://arxiv.org/pdf/1711.00937.pdf
VQ-VAE a fost utilizat în numeroase proiecte pentru a genera videoclipuri prezise, unde utilizatorul furnizează un număr inițial de cadre și solicită sistemului să genereze cadre suplimentare:

Lucrări anterioare: VQ-VAE inferă cadre din materialul sursă furnizat în cantități limitate. Sursă: Materiale suplimentare la https://openreview.net/forum?id=bBDlTR5eDIX
Cu toate acestea, autorii noului articol susțin că GODIVA reprezintă prima implementare pură text-to-video (T2V) care utilizează VQ-VAE, și nu rezultatele eratice obținute de proiectele anterioare cu GAN.
Puncte de pornire în Text-To-Video
Deși depunerea este săracă în detalii cu privire la criteriile pe baza cărora se creează cadrele de origine, GODIVA pare să invoce imagini de pornire de nicăieri înainte de a le extrapolă în cadre de videoclip de rezoluție joasă.

O reprezentare columnară a sistemului de atenție spațială tridimensională care alimentează GODIVA pentru sarcinile text-to-imagini. Auto-regresia este prezisă prin patru factori: textul de intrare, poziționarea relativă cu cadru anterior (similar cu NVIDIA’s SPADE și alte metode care se bazează sau evoluează dincolo de abordările Fluxului Optic), aceleași rânduri pe același cadru și aceleași coloane pe același cadru.
În realitate, originea provine din etichetele din datele utilizate: GODIVA a fost pre-antrenat pe setul de date Howto100M, alcătuit din 136 de milioane de clipuri video captionate, sursate din YouTube pe o perioadă de 15 ani, și care prezintă 23.000 de activități etichetate. Cu toate acestea, fiecare activitate posibilă este prezentă într-un număr foarte mare de clipuri, crește odată cu generalizarea (de exemplu, ‘Animale și animale de companie’ are 3,5 milioane de clipuri, în timp ce ‘câini’ are 762.000 de clipuri), și astfel există încă o mare varietate de puncte de plecare posibile.
Modelul a fost evaluat pe setul de date MSR Video la Text (MSR-VTT) al Microsoft. Ca teste suplimentare ale arhitecturii, GODIVA a fost antrenat de la zero pe setul de date Moving Mnist și pe setul de date Double Moving Mnist, ambele derivate din baza de date originală MNIST, o colaborare între Microsoft, Google și Institutul de Științe Matematice Courant de la NYU.
Evaluarea cadrului în sinteza video continuă
În conformitate cu IRC-GAN al Universității Peking, GODIVA adaugă patru verificări columnare suplimentare metodei originale MNIST, care a evaluat cadrele anterioare și ulterioare prin deplasarea sus-jos și apoi stânga-dreapta. IRC-GAN și GODIVA iau în considerare, de asemenea, cadrele prin deplasarea atenției stânga-dreapta, dreapta-stânga, sus-jos și jos-sus.
Evaluarea calității videoclipului și a fidelității față de prompt
Pentru a înțelege cât de bine a reușit generarea de imagini, cercetătorii au utilizat două metrice: una bazată pe similaritatea CLIP și o metrică nouă de potrivire relativă (RM).
Framework-ul CLIP al OpenAI este capabil de potrivire zero-shot a imaginilor cu text, precum și de facilitare a sintezei de imagini prin inversarea acestui model. Cercetătorii au împărțit scorul CLIP derivat la similaritatea calculată între promptul de text și videoclipul de bază pentru a ajunge la un scor RM. Într-o rundă de evaluare separată, ieșirea a fost evaluată de 200 de persoane și rezultatele au fost comparate cu scorurile programatice.
În cele din urmă, GODIVA a fost testat împotriva a două cadre anterioare, TFGAN și colaborarea din 2017 dintre Duke și NEC, T2V.
TFGAN poate produce 128 de pixeli pătrați în comparație cu ieșirea de 64×64 care limitează GODIVA și T2V în exemplele de mai sus, dar cercetătorii observă că GODIVA produce mișcări mai îndrăznețe și mai fermă, va genera schimbări de scenă fără niciun prompt specific și nu se sfiește să genereze cadre cu planuri apropiate.
În rulări ulterioare, GODIVA generează, de asemenea, ieșire de 128x128px, cu schimbări în POV:
În metrica RM a proiectului, GODIVA reușește să atingă scoruri care se apropie de 100% în ceea ce privește autenticitatea (calitatea videoclipului) și fidelitatea (cât de strâns conținutul generat se potrivește cu promptul de intrare).
Cercetătorii recunosc, cu toate acestea, că dezvoltarea unor metrice video-bazate CLIP ar fi o completare binevenită în această zonă a sintezei de imagini, deoarece ar oferi un teren de joc egal pentru evaluarea calității rezultatelor fără a recurge la supra-ajustarea și lipsa de generalizare care a devenit din ce în ce mai criticată în ceea ce privește ‘standardele’ provocărilor de percepție a computerului din ultimii zece ani.
De asemenea, observă că generarea de videoclipuri mai lungi va fi o considerație logistică în dezvoltarea ulterioară a sistemului, deoarece doar 10 cadre de 64x64px necesită 2560 de tokeni vizuali, o umflătură a conductei care este probabil să devină scumpă și de necontrolat în curând.















