Andersons vinkel

Microsoft Forslar GODIVA, et Tekst-Til-Video Maskinlæring-Rammeverk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et samarbeid mellom Microsoft Research Asia og Duke University har produsert et maskinlæringssystem som kan generere video utelukkende fra en tekstprompt, uten å bruke Generative Adversarial Networks (GANs).

Prosjektet heter GODIVA (Generating Open-DomaIn Videos from nAtural Descriptions), og bygger på noen av tilnærmingene brukt av OpenAI’s DALL-E bilde-syntese-system, avdekket tidligere i år.

Tidlige resultater fra GODIVA, med rammeverk fra videoer skapt fra to promter. De øverste to eksemplene ble generert fra prompten 'Spill golf på gress', og den nederste tredje fra prompten 'En baseballkamp spilles'.

Tidlige resultater fra GODIVA, med rammeverk fra videoer skapt fra to promter. De øverste to eksemplene ble generert fra prompten ‘Spill golf på gress’, og den nederste tredje fra prompten ‘En baseballkamp spilles’.

GODIVA bruker Vector Quantised-Variational AutoEncoder (VQ-VAE) modellen først introdusert av forskere fra Google’s DeepMind-prosjekt i 2018, og også en essensiell komponent i DALL-E’s transformasjonsmuligheter.

Arkitektur av VQ-VAE-modellen, med innkapslingsrom til høyre og encoder/decoder som deler dimensjonsrom for å redusere tap under rekonstruksjon.

Arkitektur av VQ-VAE-modellen, med innkapslingsrom til høyre og encoder/decoder som deler dimensjonsrom for å redusere tap under rekonstruksjon.

VQ-VAE har blitt brukt i flere prosjekter for å generere forutsagt video, hvor brukeren tilbyr en initial mengde rammeverk og ber systemet om å generere flere rammeverk:

Tidligere arbeid: VQ-VAE infererer rammeverk fra svært begrensede tilbudsmateriale.

Tidligere arbeid: VQ-VAE infererer rammeverk fra svært begrensede tilbudsmateriale.

Men forfatterne av den nye artikkelen hevder at GODIVA representerer den første rene tekst-til-video (T2V) implementeringen som bruker VQ-VAE i stedet for de mer uregelmessige resultatene som tidligere prosjekter har oppnådd med GANs.

Friske Punkter I Tekst-Til-Video

Selv om innleveringen er kort på detaljer om kriteriene for hvordan opprinnelsesrammeverk skapes, ser GODIVA ut til å fremkalle seed-bilder fra ingensteds før den går videre til å ekstrapolere dem til lavoppløselige video-rammeverk.

En kolonn-representasjon av den tredimensjonale sparse oppmerksomhetssystemet som driver GODIVA for tekst-til-bilde-oppdrag. Auto-regresjonen forutsies gjennom fire faktorer: inndata-tekst, relativ posisjon med forrige rammeverk (lignende NVIDIA's SPADE og andre metoder som bygger på eller utvikler seg beyond Optical Flow-tilnærmingene), samme rader på samme rammeverk, og samme kolonner på samme kolonne.

En kolonn-representasjon av den tredimensjonale sparse oppmerksomhetssystemet som driver GODIVA for tekst-til-bilde-oppdrag. Auto-regresjonen forutsies gjennom fire faktorer: inndata-tekst, relativ posisjon med forrige rammeverk (lignende NVIDIA’s SPADE og andre metoder som bygger på eller utvikler seg beyond Optical Flow-tilnærmingene), samme rader på samme rammeverk, og samme kolonner på samme kolonne.

I virkeligheten kommer opprinnelsen fra merker i dataene som brukes: GODIVA ble forhåndstrent på Howto100M-datasetten, som består av 136 millioner annoterte video-klipp hentet fra YouTube over 15 år, og med 23 000 merkte aktiviteter. Likevel er hver mulig aktivitet til stede i svært høye antall klipp, økende med generalisering (dvs. ‘Pets and animals’ har 3,5 millioner klipp, mens ‘dogs’ har 762 000 klipp), og det er fortsatt et stort valg av mulige startpunkter.

Modellen ble evaluert på Microsofts MSR Video til Tekst (MSR-VTT) datasett. Som ytterligere tester av arkitekturen, ble GODIVA trent fra scratch på Moving Mnist-datasetten og Double Moving Mnist-datasetten, begge avledet fra den originale MNIST-databasen, et samarbeid mellom Microsoft, Google og Courant Institute of Mathematical Sciences ved NYU.

Rammeverks-Evaluering I Kontinuerlig Video-Syntese

I linje med Peking Universitys IRC-GAN, legger GODIVA til fire ekstra kolonn-tilsjekker til den opprinnelige MNIST-metoden, som evaluerte forrige og følgende rammeverk ved å flytte opp>ned og deretter venstre>høyre. IRC-GAN og GODIVA vurderer også rammeverk ved å flytte oppmerksomhet venstre>høyre, høyre>venstre, opp>ned og ned>opp.

Ekstra genererte rammeverk fra GODIVA.

Ekstra genererte rammeverk fra GODIVA.

Evaluering Av Video-Kvalitet Og Trofasthet Til Prompt

For å forstå hvor godt bilde-genereringen lyktes, brukte forskerne to metrikker: en basert på CLIP-lignelse, og en ny Relativ Matching (RM) metrikk.

OpenAI’s CLIP-rammeverk er i stand til å gjøre null-skudd matching av bilder til tekst, samt å fasilitere bilde-syntese ved å reversere denne modellen. Forskerne delte CLIP-avledede poeng på beregnet lignelse mellom tekst-prompten og grunn-sannhetsvideoen for å komme til en RM-poeng. I en separat vurderingsrunde ble utgangen evaluert av 200 personer og resultater sammenlignet med programmeringspoengene.

Til slutt ble GODIVA testet mot to tidligere rammeverk, TFGAN og Duke/NEC-samarbeidet fra 2017, T2V.

T2V-vs-TFGAN-vs-GODIVA

TFGAN kan produsere 128 kvadrat-piksler i sammenligning med 64×64-utgangen som begrenser GODIVA og T2V i ovenstående eksempler, men forskerne bemerker ikke bare at GODIVA produserer mer dristige og mer engasjerte bevegelser, men vil også generere scene-endringer uten noen spesifikke promter, og unngår ikke å generere nærbilder.

I senere løp genererer GODIVA også 128x128px-utgang, med endringer i POV:

godiva_baseball_128px

I prosjektets egen RM-metrikk er GODIVA i stand til å oppnå poeng nær 100% når det gjelder autentisitet (kvalitet på video) og trofasthet (hvor godt generert innhold matcher inndata-prompten).

Forskerne innrømmer likevel at utviklingen av video-basert CLIP-metrikker ville være en velkommen tillegg til dette området av bilde-syntese, siden det ville gi en jevn spillende felt for å evaluere kvaliteten på resultater uten å måtte ty til over-tilpasning og mangel på generalisering som har blitt kritisert i forhold til ‘standard’ datamaskin-syn-utfordringer over de siste ti årene.

De observerer også at generering av lengre videoer vil være en logistisk overvegelse i videre utvikling av systemet, siden bare 10 rammeverk av 64x64px-utgang krever 2560 visuelle token, en pipeline-svulm som sannsynligvis vil bli dyrt og umåtelig raskt.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai