Andersonin kulma

Microsoft ehdottaa GODIVA: a, teksti-videokoneoppimisviitekehyksen

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Microsoft Research Asian ja Duke Universityn yhteistyö on tuottanut koneoppimisjärjestelmän, joka pystyy luomaan videoita pelkästään tekstipromptin perusteella, ilman Generative Adversarial Networks (GAN) -verkkoja.

Hanke on nimeltään GODIVA (Generating Open-DomaIn Videos from nAtural Descriptions), ja se perustuu joissain määrin OpenAI:n DALL-E -kuva-synteesijärjestelmän lähestymistapaan, joka paljastettiin aiemmin tänä vuonna.

Varhaiset tulokset GODIVasta, jossa on kehykset videoista, jotka on luotu kahdesta promptista. Ylin kaksi esimerkkiä on luotu promptista 'Play golf on grass', ja alin kolmas promptista 'A baseball game is played'. Lähde: https://arxiv.org/pdf/2104.14806.pdf

Varhaiset tulokset GODIVasta, jossa on kehykset videoista, jotka on luotu kahdesta promptista. Lähde: https://arxiv.org/pdf/2104.14806.pdf

GODIVA käyttää Vector Quantised-Variational AutoEncoder (VQ-VAE) -mallia, joka esiteltiin ensimmäisen kerran Google DeepMind -projektin tutkijoille vuonna 2018, ja se on myös olennainen osa DALL-E:n muunnoskyvyssä.

VQ-VAE-mallin arkkitehtuuri, jossa on upotusavaruus oikealla ja kooderin/dekooderin jakavat ulottuvuuden avaruutta vähentääksesi häviöt jälleenrakennettaessa. Lähde: https://arxiv.org/pdf/1711.00937.pdf

VQ-VAE-mallin arkkitehtuuri, jossa on upotusavaruus oikealla ja kooderin/dekooderin jakavat ulottuvuuden avaruutta vähentääksesi häviöt jälleenrakennettaessa. Lähde: https://arxiv.org/pdf/1711.00937.pdf

VQ-VAE on käytetty useissa projekteissa ennustamaan videota, jossa käyttäjä antaa alkuperäisen määrän kehyksiä ja pyytää järjestelmää luomaan lisää kehyksiä:

Aikaisempi työ: VQ-VAE päättelee kehykset hyvin rajatusta lähdemateriaalista. Lähde: Liitteet osoitteessa https://openreview.net/forum?id=bBDlTR5eDIX

Aikaisempi työ: VQ-VAE päättelee kehykset hyvin rajatusta lähdemateriaalista. Lähde: Liitteet osoitteessa https://openreview.net/forum?id=bBDlTR5eDIX

Kuitenkin hankekirjoittajat väittävät, että GODIVA edustaa ensimmäistä puhtaa teksti-videota (T2V) -toteutusta, joka käyttää VQ-VAE: a, eikä aikaisempien projektien GAN:ien epävakaita tuloksia.

Siemenpisteet teksti-videossa

Vaikka lähetys on vajavaista yksityiskohtia alkuperäisten kehyksien kriteereistä, GODIVA näyttää kutsuvan siemenkuvia tyhjästä ennen kuin se jatkaa niiden extrapolointia matalaresoluutioisiksi videokehyksiksi.

Pylväsmuotoinen esitys kolmiulotteisesta hajautetusta huomiojärjestelmästä, joka mahdollistaa GODIVAn teksti-kuva-tehtävät. Autoregressio arvioidaan neljän tekijän kautta: syöte-teksti, suhteellinen sijoittuminen edellisen kehyksen kanssa (samankaltainen kuin NVIDIA:n SPADE ja muut menetelmät, jotka perustuvat tai kehittävät optisen virtauslähestymistapaa), samat rivit samalla kehyksellä ja samat sarakkeet samalla sarakkeella.

Pylväsmuotoinen esitys kolmiulotteisesta hajautetusta huomiojärjestelmästä, joka mahdollistaa GODIVAn teksti-kuva-tehtävät.

Todellisuudessa alkuperä tulee tietojen käytöstä: GODIVA oli esikoulutettu Howto100M -aineistoon, joka koostuu 136 miljoonasta kuvitetusta video-otoksesta, jotka on poimittu YouTubesta 15 vuoden ajan, ja siinä on 23 000 merkittyä toimintaa. Kuitenkin jokainen mahdollinen toiminta on läsnä hyvin suuressa määrässä klippejä, ja niiden yleistyminen kasvaa (esim. ‘Lemmet ja eläimet’ on 3,5 miljoonaa klippiä, kun taas ‘koiria’ on 762 000 klippiä), joten siellä on edelleen suuri valikoima mahdollisia aloituspisteitä.

Malli arvioitiin Microsoftin MSR Video to Text (MSR-VTT) -aineistolla. Lisäksi arkkitehtuuri testattiin koulutamalla se alusta alkaen Moving Mnist -aineistolla ja Double Moving Mnist -aineistolla, jotka perustuvat alkuperäiseen MNIST-tietokantaan, joka on yhteistyö Microsoftin, Google ja Courant-instituutin matemaattisten tieteiden kanssa NYU:ssa.

Kehtaan arviointi jatkuvassa videonsynteesissä

Pekingin yliopiston IRC-GAN:n mukaisesti GODIVA lisää neljä lisäkolmiulotteista tarkastusta alkuperäiseen MNIST-menetelmään, joka arvioi edellisiä ja seuraavia kehyksiä siirtymällä ylös/alas ja sitten vasemmalle/oikealle. IRC-GAN ja GODIVA tarkastelevat myös kehyksiä siirtymällä vasemmalle/oikealle, oikealle/vasemmalle, ylös/alas ja alhaalla/ympäri.

Lisäksi luodut kehykset GODIVasta.

Lisäksi luodut kehykset GODIVasta.

Videon laadun ja uskollisuuden arviointi

Ymmärtääkseen, kuinka hyvin kuvan luominen onnistui, tutkijat käyttivät kahta mittaria: yhtä, joka perustuu CLIP-yhtäläisyyteen, ja uutta suhteellista vastaavuusmittaria (RM).

OpenAI:n CLIP-kehyksen avulla voidaan tehdä nollasuorituskuva ja teksti, sekä helpottaa kuvansynteesiä kääntämällä tämän mallin. Tutkijat jakauttivat CLIP: n johtuvan pisteytyksen laskemalla sen samankaltaisuuden tekstipromptin ja perusvideon välillä saadakseen RM-pisteytyksen. Erillisessä pisteytyskierroksessa tulokset arvioitiin 200 henkilön toimesta ja vertasivat ohjelmallisia pisteytyksiä.

Lopulta GODIVA testattiin kahteen aikaisempaan kehykseen, TFGAN: iin ja Duke/NEC-yhteistyöhön vuonna 2017, T2V: hen.

T2V-vs-TFGAN-vs-GODIVA

TFGAN voi tuottaa 128 neliöpikseliä verrattuna 64×64-pikselin tuotantoon, joka rajoittaa GODIVAa ja T2V: ä edellä mainituissa esimerkeissä, mutta tutkijat huomauttavat, että GODIVA tuottaa rohkeampia ja sitoutuneempia liikkeitä, ja se voi luoda kohtauksenmuutoksia ilman erityistä ohjausta, eikä se ole peloissaan luo kuvalähetyksiä.

Myöhemmissä suorituksissa GODIVA tuottaa myös 128×128-pikselin tuotannon, jossa on muutoksia katselukulmasta:

godiva_baseball_128px

Hankkeen oman RM-mittarin mukaan GODIVA pystyy saavuttamaan lähes 100 prosentin tulokset sekä autenttisuuden (videon laatu) että uskollisuuden (kuinka hyvin luotu sisältö vastaa syöte-ohjelmaa) osalta.

Tutkijat myöntävät kuitenkin, että videopohjaisen CLIP-mittarin kehittäminen olisi tervetullut tämän kuvansynteesin alueelle, koska se tarjoaisi tasapuolisen areenan tuloksien arviointiin ilman turvautumista ylikoulutukseen ja yleistymisen puutteeseen, joita on yhä enemmän kritisoitu “standardien” tietokoneen näköhaasteiden suhteen viimeisen kymmenen vuoden aikana.

He huomauttavat myös, että pidempien videoiden luominen olisi logistinen huomio järjestelmän kehittämisessä, koska vain 10 kehyksen 64×64-pikselin tuotanto vaatii 2560 visuaalista merkkiä, josta tulee kalliiksi ja hallitsematon hyvin nopeasti.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai