Andersonin kulma
Microsoft ehdottaa GODIVA: a, teksti-videokoneoppimisviitekehyksen

Microsoft Research Asian ja Duke Universityn yhteistyö on tuottanut koneoppimisjärjestelmän, joka pystyy luomaan videoita pelkästään tekstipromptin perusteella, ilman Generative Adversarial Networks (GAN) -verkkoja.
Hanke on nimeltään GODIVA (Generating Open-DomaIn Videos from nAtural Descriptions), ja se perustuu joissain määrin OpenAI:n DALL-E -kuva-synteesijärjestelmän lähestymistapaan, joka paljastettiin aiemmin tänä vuonna.

Varhaiset tulokset GODIVasta, jossa on kehykset videoista, jotka on luotu kahdesta promptista. Lähde: https://arxiv.org/pdf/2104.14806.pdf
GODIVA käyttää Vector Quantised-Variational AutoEncoder (VQ-VAE) -mallia, joka esiteltiin ensimmäisen kerran Google DeepMind -projektin tutkijoille vuonna 2018, ja se on myös olennainen osa DALL-E:n muunnoskyvyssä.

VQ-VAE-mallin arkkitehtuuri, jossa on upotusavaruus oikealla ja kooderin/dekooderin jakavat ulottuvuuden avaruutta vähentääksesi häviöt jälleenrakennettaessa. Lähde: https://arxiv.org/pdf/1711.00937.pdf
VQ-VAE on käytetty useissa projekteissa ennustamaan videota, jossa käyttäjä antaa alkuperäisen määrän kehyksiä ja pyytää järjestelmää luomaan lisää kehyksiä:

Aikaisempi työ: VQ-VAE päättelee kehykset hyvin rajatusta lähdemateriaalista. Lähde: Liitteet osoitteessa https://openreview.net/forum?id=bBDlTR5eDIX
Kuitenkin hankekirjoittajat väittävät, että GODIVA edustaa ensimmäistä puhtaa teksti-videota (T2V) -toteutusta, joka käyttää VQ-VAE: a, eikä aikaisempien projektien GAN:ien epävakaita tuloksia.
Siemenpisteet teksti-videossa
Vaikka lähetys on vajavaista yksityiskohtia alkuperäisten kehyksien kriteereistä, GODIVA näyttää kutsuvan siemenkuvia tyhjästä ennen kuin se jatkaa niiden extrapolointia matalaresoluutioisiksi videokehyksiksi.

Pylväsmuotoinen esitys kolmiulotteisesta hajautetusta huomiojärjestelmästä, joka mahdollistaa GODIVAn teksti-kuva-tehtävät.
Todellisuudessa alkuperä tulee tietojen käytöstä: GODIVA oli esikoulutettu Howto100M -aineistoon, joka koostuu 136 miljoonasta kuvitetusta video-otoksesta, jotka on poimittu YouTubesta 15 vuoden ajan, ja siinä on 23 000 merkittyä toimintaa. Kuitenkin jokainen mahdollinen toiminta on läsnä hyvin suuressa määrässä klippejä, ja niiden yleistyminen kasvaa (esim. ‘Lemmet ja eläimet’ on 3,5 miljoonaa klippiä, kun taas ‘koiria’ on 762 000 klippiä), joten siellä on edelleen suuri valikoima mahdollisia aloituspisteitä.
Malli arvioitiin Microsoftin MSR Video to Text (MSR-VTT) -aineistolla. Lisäksi arkkitehtuuri testattiin koulutamalla se alusta alkaen Moving Mnist -aineistolla ja Double Moving Mnist -aineistolla, jotka perustuvat alkuperäiseen MNIST-tietokantaan, joka on yhteistyö Microsoftin, Google ja Courant-instituutin matemaattisten tieteiden kanssa NYU:ssa.
Kehtaan arviointi jatkuvassa videonsynteesissä
Pekingin yliopiston IRC-GAN:n mukaisesti GODIVA lisää neljä lisäkolmiulotteista tarkastusta alkuperäiseen MNIST-menetelmään, joka arvioi edellisiä ja seuraavia kehyksiä siirtymällä ylös/alas ja sitten vasemmalle/oikealle. IRC-GAN ja GODIVA tarkastelevat myös kehyksiä siirtymällä vasemmalle/oikealle, oikealle/vasemmalle, ylös/alas ja alhaalla/ympäri.
Videon laadun ja uskollisuuden arviointi
Ymmärtääkseen, kuinka hyvin kuvan luominen onnistui, tutkijat käyttivät kahta mittaria: yhtä, joka perustuu CLIP-yhtäläisyyteen, ja uutta suhteellista vastaavuusmittaria (RM).
OpenAI:n CLIP-kehyksen avulla voidaan tehdä nollasuorituskuva ja teksti, sekä helpottaa kuvansynteesiä kääntämällä tämän mallin. Tutkijat jakauttivat CLIP: n johtuvan pisteytyksen laskemalla sen samankaltaisuuden tekstipromptin ja perusvideon välillä saadakseen RM-pisteytyksen. Erillisessä pisteytyskierroksessa tulokset arvioitiin 200 henkilön toimesta ja vertasivat ohjelmallisia pisteytyksiä.
Lopulta GODIVA testattiin kahteen aikaisempaan kehykseen, TFGAN: iin ja Duke/NEC-yhteistyöhön vuonna 2017, T2V: hen.
TFGAN voi tuottaa 128 neliöpikseliä verrattuna 64×64-pikselin tuotantoon, joka rajoittaa GODIVAa ja T2V: ä edellä mainituissa esimerkeissä, mutta tutkijat huomauttavat, että GODIVA tuottaa rohkeampia ja sitoutuneempia liikkeitä, ja se voi luoda kohtauksenmuutoksia ilman erityistä ohjausta, eikä se ole peloissaan luo kuvalähetyksiä.
Myöhemmissä suorituksissa GODIVA tuottaa myös 128×128-pikselin tuotannon, jossa on muutoksia katselukulmasta:
Hankkeen oman RM-mittarin mukaan GODIVA pystyy saavuttamaan lähes 100 prosentin tulokset sekä autenttisuuden (videon laatu) että uskollisuuden (kuinka hyvin luotu sisältö vastaa syöte-ohjelmaa) osalta.
Tutkijat myöntävät kuitenkin, että videopohjaisen CLIP-mittarin kehittäminen olisi tervetullut tämän kuvansynteesin alueelle, koska se tarjoaisi tasapuolisen areenan tuloksien arviointiin ilman turvautumista ylikoulutukseen ja yleistymisen puutteeseen, joita on yhä enemmän kritisoitu “standardien” tietokoneen näköhaasteiden suhteen viimeisen kymmenen vuoden aikana.
He huomauttavat myös, että pidempien videoiden luominen olisi logistinen huomio järjestelmän kehittämisessä, koska vain 10 kehyksen 64×64-pikselin tuotanto vaatii 2560 visuaalista merkkiä, josta tulee kalliiksi ja hallitsematon hyvin nopeasti.















