Η γωνία του Anderson
Η Microsoft Προτείνει το GODIVA, Ένα Πλαίσιο Μηχανικής Μάθησης για Text-To-Video

Μια συνεργασία μεταξύ της Microsoft Research Asia και του Πανεπιστημίου Duke έχει παραγάγει ένα σύστημα μηχανικής μάθησης ικανό να γεννήσει βίντεο αποκλειστικά από μια κείμενη πρόταση, χωρίς τη χρήση των Γεννητικών Αντιπαλών Δικτύων (GANs).
Το έργο έχει τον τίτλο GODIVA (Γεννήτρια Ανοικτό-Δομικού Χώρου Βίντεο από Φυσικές Περιγραφές), και βασίζεται σε ορισμένες από τις προσεγγίσεις που χρησιμοποιούνται από το σύστημα σύνθεσης εικόνας DALL-E της OpenAI, αποκαλυφθέν νωρίτερα αυτό το έτος.

Πρώιμα αποτελέσματα από το GODIVA, με καρέ από βίντεο που δημιουργήθηκαν από δύο προτάσεις. Τα δύο πρώτα παραδείγματα δημιουργήθηκαν από την πρόταση ‘Παίξε γκολφ στο γκαζόν’, και το τρίτο από την πρόταση ‘Ένα παιχνίδι μπέιζμπολ παίζεται’. Πηγή: https://arxiv.org/pdf/2104.14806.pdf
Το GODIVA χρησιμοποιεί το μοντέλο Vector Quantised-Variational AutoEncoder (VQ-VAE) πρώτα εισαχθέν από ερευνητές του προγράμματος DeepMind της Google το 2018, και επίσης ένα βασικό συστατικό στις μετασχηματιστικές ικανότητες του DALL-E.

Αρχιτεκτονική του μοντέλου VQ-VAE, με χώρο ενσωμάτωσης στη δεξιά πλευρά και κωδικοποιητή/αποκωδικοποιητή που μοιράζονται τον διαστατικό χώρο για να μειώσουν τις απώλειες κατά την ανασυγκρότηση. Πηγή: https://arxiv.org/pdf/1711.00937.pdf
Το VQ-VAE έχει χρησιμοποιηθεί σε πολλά έργα για γεννήτρια προβλεπόμενου βίντεο, όπου ο χρήστης παρέχει αρχικά ένα αριθμό καρέ και ζητά από το σύστημα να γεννήσει επιπλέον καρέ:

Προηγούμενο έργο: VQ-VAE υποθέτει καρέ από πολύ περιορισμένο παρεχόμενο υλικό. Πηγή: Υλικό στο https://openreview.net/forum?id=bBDlTR5eDIX
Ωστόσο, οι συγγραφείς της νέας εργασίας ισχυρίζονται ότι το GODIVA αντιπροσωπεύει την πρώτη καθαρή υλοποίηση text-to-video (T2V) που χρησιμοποιεί VQ-VAE αντί των πιο ακανόνιστων αποτελεσμάτων που έχουν ληφθεί από προηγούμενα έργα με GANs.
Σημεία Σπέρματος στο Text-To-Video
Αν και η υποβολή είναι σύντομη στις λεπτομέρειες σχετικά με τα κριτήρια με τα οποία δημιουργούνται τα αρχικά καρέ, το GODIVA φαίνεται να καλεί σημεία σπέρματος από το πουθενά πριν να προχωρήσει στην εξαγωγή τους σε καρέ βίντεο χαμηλής ανάλυσης.

Μια στήλη-παράσταση του τριδιάστατου συστήματος σπαργανικής προσοχής που δίνει ενέργεια στο GODIVA για εργασίες text-to-image. Η αυτο-πρόβλεψη προβλέπεται μέσω τεσσάρων παραγόντων: εισαγόμενο κείμενο, σχετική τοποθέτηση με το προηγούμενο καρέ (παρόμοιο με το SPADE της NVIDIA και άλλες μεθόδους που οικοδομούν ή εξελίσσονται πέρα από τις προσεγγίσεις Optical Flow), ίδια σειρές στο ίδιο καρέ, και ίδιες στήλες στην ίδια στήλη.
Στην πραγματικότητα, η προέλευση προέρχεται από ετικέτες στα δεδομένα που χρησιμοποιούνται: το GODIVA είχε προ-εκπαιδευτεί στο σύνολο δεδομένων Howto100M, που αποτελείται από 136 εκατομμύρια καρέ βίντεο με ετικέτες από το YouTube κατά τη διάρκεια 15 ετών, και που διαθέτει 23.000 ετικετες δραστηριοτήτων. Παρόλα αυτά, κάθε πιθανή δραστηριότητα είναι παρόντα σε πολύ υψηλές ποσότητες καρέ, που αυξάνονται με γενίκευση (π.χ. ‘Πέτσα και ζώα’ έχει 3,5 εκατομμύρια καρέ, ενώ ‘σκύλοι’ έχει 762.000 καρέ), και έτσι υπάρχει ακόμη μια μεγάλη επιλογή πιθανών σημείων εκκίνησης.
Το μοντέλο αξιολογήθηκε στο σύνολο δεδομένων MSR Video to Text (MSR-VTT) της Microsoft. Jako περαιτέρω δοκιμές της αρχιτεκτονικής, το GODIVA εκπαιδεύτηκε από την αρχή στο σύνολο δεδομένων Moving Mnist και στο σύνολο δεδομένων Double Moving Mnist, και τα δύο παραγόμενα από την αρχική βάση δεδομένων MNIST, μια συνεργασία μεταξύ της Microsoft, της Google και του Ινστιτούτου Μαθηματικών Επιστημών στο NYU.
Αξιολόγηση Πλαισίων στη Συνεχής σύνθεση Βίντεο
Σε συμφωνία με το IRC-GAN του Πανεπιστημίου Πεκίνου, το GODIVA προσθέτει τέσσερις επιπλέον στήλες-ελέγχους στην αρχική μέθοδο MNIST, η οποία αξιολογούσε τα προηγούμενα και τα επόμενα καρέ με την κίνηση πάνω-κάτω και μετά αριστερά-δεξιά. Το IRC-GAN και το GODIVA λαμβάνουν επίσης υπόψη τα καρέ με την κίνηση αριστερά-δεξιά, δεξιά-αριστερά, πάνω-κάτω και κάτω-πάνω.
Αξιολόγηση Ποιότητας Βίντεο και Πιστότητας στην Πρόταση
Για να κατανοήσουν πόσο καλά η γεννήτρια εικόνας πέτυχε, οι ερευνητές χρησιμοποίησαν δύο μετρήσεις: μια βασισμένη στη συσχέτιση CLIP, και μια νέα μετρική Σχετικής Αντιστοίχισης (RM).
Το πλαίσιο CLIP της OpenAI είναι ικανό για zero-shot αντιστοίχηση εικόνων σε κείμενο, καθώς και για διευκόλυνση της σύνθεσης εικόνας με την αντιστροφή αυτού του μοντέλου. Οι ερευνητές διέλυσαν το σκορ CLIP με τη συσχέτιση μεταξύ της πρότασης κειμένου και του πραγματικού βίντεο για να φτάσουν σε ένα σκορ RM. Σε μια ξεχωριστή γύρο σκορ, η έξοδος αξιολογήθηκε από 200 άτομα και τα αποτελέσματα συγκρίθηκαν με τα προγραμματικά σκορ.
Τελικά, το GODIVA δοκιμάστηκε ενάντια σε δύο προηγούμενα πλαίσια, TFGAN και τη συνεργασία του 2017 μεταξύ του Duke και της NEC, T2V.
Το TFGAN μπορεί να παράγει 128 τετραγωνικά εικονοστοιχεία σε σύγκριση με την έξοδο 64×64 που περιορίζει το GODIVA και το T2V στα παραπάνω παραδείγματα, αλλά οι ερευνητές σημειώνουν όχι μόνο ότι το GODIVA παράγει πιο τολμηρά και πιο δεσμευμένα κινήματα, αλλά θα γεννήσει αλλαγές σκηνής χωρίς οποιαδήποτε συγκεκριμένη πρόταση, και δεν φοβάται να γεννήσει κλείστερες λήψεις.
Σε μεταγενέστερες εκτελέσεις, το GODIVA γεννά επίσης έξοδο 128x128px, με αλλαγές στη ΓΟΒ:
Στη δική του μετρική RM, το GODIVA είναι ικανό να επιτύχει σκορ που προσεγγίζουν το 100% όσον αφορά την αυθεντικότητα (ποιότητα βίντεο) και την πιστότητα (πόσο στενά το γεννημένο περιεχόμενο αντιστοιχεί στην εισαγώμενη πρόταση).
Οι ερευνητές παραδέχονται, ωστόσο, ότι η ανάπτυξη μετρήσεων βίντεο-βασισμένων CLIP θα ήταν μια ευπρόσδεκτη προσθήκη σε这一 περιοχή της σύνθεσης εικόνας,既然 θα παρείχε ένα επίπεδο έδαφος για την αξιολόγηση της ποιότητας των αποτελεσμάτων χωρίς να καταφεύγει στην υπερ-προσαρμογή και την έλλειψη γενίκευσης που έχει αυξανθεί με την κριτική σε σχέση με τις ‘τυπικές’ προκλήσεις της υπολογιστικής όρασης τα τελευταία δέκα χρόνια.
Παρατηρούν επίσης ότι η γεννήτρια μεγαλύτερων βίντεο θα είναι μια λογιστική σκέψη στην περαιτέρω ανάπτυξη του συστήματος,既然 μόνο 10 καρέ 64x64px απαιτούν 2560 οπτικά token, μια φούσκα pipeline που πιθανό να γίνει ακριβή και ακατάλληλη γρήγορα.















