Andersonův úhel

Microsoft Navrhuje GODIVA, Rámec Učení Strojů Pro Text-To-Video

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Spolupráce mezi Microsoft Research Asia a Duke University vyprodukovala systém učení strojů, který je schopen generovat video pouze z textového podnětu, bez použití Generative Adversarial Networks (GANs).

Projekt je nazvaný GODIVA (Generování Otevřených Doménových Videí z Přirozených Popisů), a vychází z některých přístupů použitých v systému OpenAI’s DALL-E pro syntézu obrazů, odhaleného dříve tohoto roku.

Rané výsledky z GODIVA, s rámy z videí vytvořených ze dvou podnětů. Horní dva příklady byly generovány z podnětu 'Hrát golf na trávníku', a spodní třetí z podnětu 'Baseballový zápas se hraje'. Zdroj: https://arxiv.org/pdf/2104.14806.pdf

Rané výsledky z GODIVA, s rámy z videí vytvořených ze dvou podnětů. Horní dva příklady byly generovány z podnětu ‘Hrát golf na trávníku’, a spodní třetí z podnětu ‘Baseballový zápas se hraje’. Zdroj: https://arxiv.org/pdf/2104.14806.pdf

GODIVA používá model Vector Quantised-Variational AutoEncoder (VQ-VAE) poprvé představený výzkumníky z Google’s DeepMind projektu v roce 2018, a také jako základní součást transformačních schopností DALL-E.

Architektura modelu VQ-VAE, s prostorovým zakódováním vpravo a kodérem/dekodérem, který sdílí dimenzionální prostor, aby snížil ztráty během rekonstrukce. Zdroj: https://arxiv.org/pdf/1711.00937.pdf

Architektura modelu VQ-VAE, s prostorovým zakódováním vpravo a kodérem/dekodérem, který sdílí dimenzionální prostor, aby snížil ztráty během rekonstrukce. Zdroj: https://arxiv.org/pdf/1711.00937.pdf

VQ-VAE byl použit v několika projektech pro generování předpovězeného videa, kde uživatel poskytuje počáteční počet rámců a žádá systém, aby vygeneroval další rámy:

Předchozí práce: VQ-VAE odvozuje rámy z velmi omezeného zdrojového materiálu. Zdroj: Doplňkové materiály na https://openreview.net/forum?id=bBDlTR5eDIX

Předchozí práce: VQ-VAE odvozuje rámy z velmi omezeného zdrojového materiálu. Zdroj: Doplňkové materiály na https://openreview.net/forum?id=bBDlTR5eDIX

Nicméně, autoři nové studie tvrdí, že GODIVA představuje první čistou implementaci text-to-video (T2V), která používá VQ-VAE místo více nestálých výsledků, které předchozí projekty získaly pomocí GANs.

Startovní Body V Text-To-Video

Ačkoli podání je krátké na detaily o kritériích, podle kterých jsou vytvořeny počáteční rámy, GODIVA zdá se, že vyvolává startovní obraz ze vzduchu, než pokračuje v extrapolaci do nízkorozlišených videí.

Sloupcová reprezentace třídimenzionálního sparse attention systému, který pohání GODIVA pro text-to-image úkoly. Auto-regrese je předpovězena pomocí čtyř faktorů: vstupní text, relativní pozice s předchozím rámem (podobně jako NVIDIA's SPADE a další metody, které staví nebo evoluují za Optical Flow přístupy), stejné řádky ve stejném rámci a stejné sloupce ve stejném sloupci.

Sloupcová reprezentace třídimenzionálního sparse attention systému, který pohání GODIVA pro text-to-image úkoly. Auto-regrese je předpovězena pomocí čtyř faktorů: vstupní text, relativní pozice s předchozím rámem (podobně jako NVIDIA’s SPADE a další metody, které staví nebo evoluují za Optical Flow přístupy), stejné řádky ve stejném rámci a stejné sloupce ve stejném sloupci.

Ve skutečnosti pochází počátek z popisků v datech použitých: GODIVA byl předtrénován na sadě Howto100M, která se skládá z 136 milionů popiskovaných videí z YouTube za 15 let, a obsahuje 23 000 označených aktivit. Nicméně, každá možná aktivita je přítomna ve velmi vysokém počtu klipů, se zvyšující se generalizací (tj. ‘Pets and animals’ má 3,5 milionu klipů, zatímco ‘dogs’ má 762 000 klipů), a tak je stále velká volba možných startovních bodů.

Model byl vyhodnocen na Microsoftově sadě MSR Video to Text (MSR-VTT). Jako další testy architektury, GODIVA byl trénován od začátku na sadě Moving Mnist a Double Moving Mnist, obě odvozené z původní MNIST databáze, spolupráce mezi Microsoftem, Googlem a Courant Institute of Mathematical Sciences na NYU.

Hodnocení Rámců V Kontinuální Video Syntéze

V souladu s Peking University’s IRC-GAN, GODIVA přidává čtyři další sloupcové kontroly k původní MNIST metodě, která vyhodnocovala předchozí a následující rámy pohybem nahoru>dolů a poté vlevo>vpravo. IRC-GAN a GODIVA také vyhodnocovaly rámy pohybem pozornosti vlevo>vpravo, vpravo>vlevo, nahoru>dolů a dolů>nahoru.

Další vygenerované rámy z GODIVA.

Další vygenerované rámy z GODIVA.

Vyhodnocení Kvality Video A Víry K Podnětu

Aby pochopili, jak dobře se podařilo generovat obraz, výzkumníci využili dvě metriky: jednu založenou na CLIP podobnosti a novou Relativní Shody (RM) metriku.

OpenAI’s CLIP framework je schopen nulového snímání obrazů k textu, stejně jako usnadňuje obrazovou syntézu obrácením tohoto modelu. Výzkumníci rozdělili CLIP-derived skóre podle vypočtené podobnosti mezi textovým podnětem a skutečným videem, aby dospěli k RM skóre. V samostatném hodnocení, výstup byl vyhodnocen 200 lidmi a výsledky byly porovnány s programatickými skóre.

Nakonec GODIVA byl testován proti dvěma předchozím rámcům, TFGAN a 2017 Duke/NEC spolupráci, T2V.

T2V-vs-TFGAN-vs-GODIVA

TFGAN může produkovat 128 čtverečních pixelů v porovnání s 64×64 výstupem, který omezuje GODIVA a T2V v výše uvedených příkladech, ale výzkumníci poznamenají, že GODIVA produkuje smělejší a více oddané pohyby, a bude generovat změny scény bez jakéhokoli specifického podnětu, a nebude se bát generovat close-up záběry.

V pozdějších bězích, GODIVA také generuje 128x128px výstup, se změnami v POV:

godiva_baseball_128px

V projektu své vlastní RM metriky, GODIVA je schopen dosáhnout skóre blížící se 100% z hlediska autenticity (kvality videa) a víry (jak blízko generovaný obsah odpovídá vstupnímu podnětu).

Výzkumníci uznávají, že vývoj video-založených CLIP metrik by byl vítanou součástí této oblasti obrazové syntézy, protože by poskytl rovnocennou základnu pro hodnocení kvality výsledků bez použití nadměrného přizpůsobení a nedostatku generalizace, které se stále více kritizují v souvislosti s ‘standardními’ počítačovými výzvami vidění za posledních deset let.

Také pozorují, že generování delších videí bude logistickou úvahou při dalším rozvoji systému, protože již 10 rámců 64x64px výstupu vyžaduje 2560 vizuálních tokenů, což je potenciální zátěž, která se bude rychle zvyšovat.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai