Μοντέλα και πλατφόρμες AI
CameraCtrl: Ενεργοποίηση Ελέγχου Κάμερας για Γεννήτρια Βίντεο Κειμένου προς Βίντεο
Οι πρόσφατες προσπάθειες για την ανάπτυξη πλαισίων κειμένου προς βίντεο ή T2V generation, που αξιοποιούν μοντέλα διάχυσης για την προσθήκη σταθερότητας στη διαδικασία εκπαίδευσης, και το Video Diffusion Model, ένα από τα πιονέρια πλαισίων για την γεννήτρια κειμένου προς βίντεο, επεκτείνει μια αρχιτεκτονική διάχυσης εικόνας 2D σε μια προσπάθεια να προσαρμόσει τα δεδομένα βίντεο και να εκπαιδεύσει το μοντέλο σε βίντεο και εικόνες από την αρχή. Βασισμένα σε αυτά, και για την εφαρμογή ενός ισχυρού προ-εκπαιδευμένου γεννήτορα εικόνας όπως το Stable Diffusion, πρόσφατες εργασίες φουσκώνουν την αρχιτεκτονική 2D με την εναλλαγή των χρονικών στρωμάτων μεταξύ των προ-εκπαιδευμένων στρωμάτων 2D και την επιμέρους εκπαίδευση του νέου μοντέλου σε μεγάλα μη είδη δεδομένα.尽管 उनकες προσπάθειες, τα μοντέλα διάχυσης κειμένου προς βίντεο αντιμετωπίζουν μια σημαντική πρόκληση, καθώς η αμφιβολία της αποκλειστικής χρήσης περιγραφών κειμένου για τη γεννήτρια του δείγματος βίντεο συχνά οδηγεί στο μοντέλο να έχει ασθενέστερο έλεγχο στη γεννήτρια. Για την αντιμετώπιση αυτής της περιορισμένης, ορισμένα μοντέλα παρέχουν ενισχυμένες οδηγίες, ενώ άλλα εργάζονται με ακριβείς σήματα για τον έλεγχο της σκηνής ή των κινήσεων ανθρώπων στα συνθετικά βίντεο. Από την άλλη πλευρά, υπάρχουν quelques πλαισιά για την γεννήτρια κειμένου προς βίντεο που υιοθετούν εικόνες ως σήματα ελέγχου για τον γεννήτορα βίντεο, με αποτέλεσμα είτε την ακριβή μοντελοποίηση χρονικών σχέσεων είτε την υψηλή ποιότητα βίντεο.
Θα ήταν ασφαλές να πούμε ότι ο έλεγχος παίζει一个 κρίσιμο ρόλο στις εργασίες γεννήτριας εικόνας και βίντεο, καθώς επιτρέπει στους χρήστες να δημιουργούν το περιεχόμενο που επιθυμούν. Ωστόσο, τα υπάρχοντα πλαισιά συχνά παραμελούν τον ακριβή έλεγχο της θέσης της κάμερας, η οποία χρησιμεύει ως μια κινηματογραφική γλώσσα για την έκφραση των βαθύτερων νουανσών της αφήγησης στο μοντέλο. Για την αντιμετώπιση των τρεχουσών περιορισμών ελέγχου, σε αυτό το άρθρο, θα μιλήσουμε για το CameraCtrl, μια νέα ιδέα που επιχειρεί να ενεργοποιήσει τον ακριβή έλεγχο της θέσης της κάμερας για τα μοντέλα κειμένου προς βίντεο. Μετά την παραμετροποίηση της τροχιάς της κάμερας ακριβώς, το μοντέλο εκπαιδεύει ένα μοντέλο κάμερας που μπορεί να συνδεθεί και να αποσυνδεθεί σε ένα μοντέλο κειμένου προς βίντεο, αφήνοντας τα άλλα компоненты αμετάβλητα. Επιπλέον, το μοντέλο CameraCtrl πραγματοποιεί μια綜合τική μελέτη για την επίδραση των διαφόρων συνόλων δεδομένων και προτείνει ότι τα βίντεο με παρόμοια εμφάνιση και ποικιλία κατανομής κάμερας μπορούν να βελτιώσουν την tổngική ικανότητα ελέγχου και γενίκευσης του μοντέλου. Οι πειραματικές μελέτες που διεξάγονται για την ανάλυση της απόδοσης του μοντέλου CameraCtrl σε πραγματικές εργασίες δείχνουν την αποτελεσματικότητα του πλαισίου στην επίτευξη ακριβούς και domaine-προσαρμοσμένου ελέγχου κάμερας, ανοίγοντας τον δρόμο για την διεκδίκηση της εξατομικευμένης και δυναμικής γεννήτριας βίντεο από τη θέση της κάμερας και τις εισόδους κειμένου.
Το άρθρο αυτό έχει ως στόχο να καλύψει το πλαισίο CameraCtrl σε βάθος, και εξετάζουμε τη μηχανική, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου μαζί με τη σύγκριση με τα πλαισιά της状态-of-the-art. Έτσι, ας ξεκινήσουμε.
CameraCtrl: Έλεγχος Κάμερας για Γεννήτρια Κειμένου προς Βίντεο
Η πρόσφατη ανάπτυξη και εξέλιξη των μοντέλων διάχυσης έχουν προωθήσει σημαντικά τη γεννήτρια κειμένου προς βίντεο τα τελευταία χρόνια, και επαναπροσδιόρισαν τις διαδικασίες σχεδιασμού περιεχομένου. Ο έλεγχος παίζει σημαντικό ρόλο στις πρακτικές εφαρμογές γεννήτριας βίντεο, καθώς επιτρέπει στους χρήστες να προσαρμόζουν τα αποτελέσματα που παράγονται σύμφωνα με τις ανάγκες και τις απαιτήσεις τους. Με υψηλό έλεγχο, το μοντέλο μπορεί να βελτιώσει την πραγματικότητα, την ποιότητα και τη χρησιμότητα των βίντεο που παράγονται, και ενώ οι εισόδους κειμένου και εικόνας χρησιμοποιούνται συνήθως από τα μοντέλα για την ενίσχυση του ελέγχου, συχνά λείπουν ακριβής έλεγχος над την κίνηση και το περιεχόμενο. Για την αντιμετώπιση αυτού του περιορισμού, ορισμένα πλαισιά έχουν προτείνει να αξιοποιήσουν σήματα ελέγχου όπως το σκελετός της θέσης, η οπτική ροή και άλλα σήματα πολλαπλών modality για να ενεργοποιήσουν πιο ακριβή έλεγχο για την οδήγηση της γεννήτριας βίντεο. Ένας άλλος περιορισμός που αντιμετωπίζουν τα υπάρχοντα πλαισιά είναι ότι λείπουν ακριβής έλεγχος над την κίνηση της κάμερας στη γεννήτρια βίντεο, καθώς η ικανότητα ελέγχου της κάμερας είναι κρίσιμη, όχι μόνο για την ενίσχυση της πραγματικότητας των παραγόμενων βίντεο, αλλά και για την παροχή προσαρμοσμένων σημείων θέασης, που είναι μια λειτουργία που είναι απαραίτητη στις εφαρμογές ανάπτυξης παιχνιδιών, επαυξημένης πραγματικότητας και εικονικής πραγματικότητας. Επιπλέον, η αποτελεσματική διαχείριση των κινήσεων της κάμερας επιτρέπει στους δημιουργούς να υπογραμμίσουν τις σχέσεις των χαρακτήρων, να τονίσουν τα συναισθήματα και να οδηγήσουν την προσοχή του στόχου κοινού, κάτι που είναι πολύ σημαντικό στις βιομηχανίες κινηματογράφου και διαφήμισης.
Για την αντιμετώπιση και την υπέρβαση αυτών των περιορισμών, το πλαισίο CameraCtrl, ένα μοντέλο κάμερας που μπορεί να συνδεθεί και να αποσυνδεθεί με την ικανότητα να ελέγχει τις οπτικές γωνίες της κάμερας για τη γεννήτρια βίντεο. Ωστόσο, η ενσωμάτωση μιας προσαρμοσμένης κάμερας σε μια υπάρχουσα διαδικασία μοντέλου κειμένου προς βίντεο είναι μια εργασία που είναι πιο εύκολη να πει niż να κάνει,迫使 το πλαισίο CameraCtrl να αναζητήσει τρόπους για να αναπαραστήσει και να εγχέει την κάμερα στη αρχιτεκτονική του μοντέλου αποτελεσματικά. Σε αυτό το σημείο, το πλαισίο CameraCtrl υιοθετεί τις εμβυθώσεις plucker ως την πρωταρχική μορφή παραμέτρων κάμερας, και ο λόγος για την επιλογή των εμβυθώσεων plucker μπορεί να αποδοθεί στην ικανότητά τους να κωδικοποιούν γεωμετρικές περιγραφές της θέσης της κάμερας. Επιπλέον, για να διασφαλιστεί η γενίκευση και η εφαρμοσιμότητα του μοντέλου CameraCtrl μετά την εκπαίδευση, το μοντέλο εισάγει ένα μοντέλο ελέγχου κάμερας που δέχεται μόνο εμβυθώσεις plucker ως είσοδο. Για να διασφαλιστεί ότι το μοντέλο ελέγχου κάμερας εκπαιδεύεται αποτελεσματικά, το πλαισίο και οι dévelopπεurs του διεξάγουν μια綜合τική μελέτη για να điều tra hvordan διαφορετικά δεδομένα εκπαίδευσης επηρεάζουν το πλαισίο από συνθετικά σε πραγματικά δεδομένα. Τα πειραματικά αποτελέσματα δείχνουν ότι η εφαρμογή δεδομένων με ποικιλία κατανομής κάμερας και παρόμοια εμφάνιση με το αρχικό μοντέλο βασικής εκπαίδευσης επιτυγχάνει την καλύτερη συμφωνία μεταξύ ελέγχου και γενίκευσης. Οι dévelopπεurs του πλαισίου CameraCtrl έχουν εφαρμόσει το μοντέλο πάνω από το πλαισίο AnimateDiff, ermögνωντας έτσι τον ακριβή έλεγχο στη γεννήτρια βίντεο σε διάφορες προσωπικές περιπτώσεις, αποδεικνύοντας την ευελιξία και τη χρησιμότητα του σε ένα ευρύ φάσμα περιπτώσεων δημιουργίας βίντεο.

Το πλαισίο AnimateDiff υιοθετεί την αποτελεσματική προσέγγιση LoRA για την απόκτηση των βαρών του μοντέλου για διαφορετικά είδη λήψεων. Το πλαισίο Direct-a-video προτείνει να εφαρμόσει einen εμβυθωτή κάμερας για τον έλεγχο της θέσης της κάμερας κατά τη διαδικασία της γεννήτριας βίντεο, αλλά συνδέεται μόνο με τρεις παραμέτρους κάμερας, περιοριζοντας την ικανότητα ελέγχου της κάμερας στα περισσότερα βασικά είδη. Από την άλλη πλευρά, πλαισιά όπως το MotionCtrl σχεδιάζουν einen ελεγκτή κίνησης που δέχεται περισσότερες από τρεις παραμέτρους εισόδου και είναι能够 να παράγει βίντεο με πιο σύνθετες θέσεις κάμερας. Ωστόσο, η ανάγκη για επιμέρους εκπαίδευση τμημάτων των παραγόμενων βίντεο εμποδίζει την γενίκευση του μοντέλου. Επιπλέον, ορισμένα πλαισιά ενσωματώνουν πρόσθετα σήματα ελέγχου όπως χάρτες βάθους στη διαδικασία για να ενισχύσουν τον έλεγχο για τη γεννήτρια εικόνας και κειμένου. Συνήθως, το μοντέλο τροφοδοτεί αυτά τα σήματα ελέγχου σε έναν επιπλέον κωδικοποιητή και στη συνέχεια εγχέει τα σήματα σε einen γεννήτορα χρησιμοποιώντας διάφορες λειτουργίες.
CameraCtrl: Αρχιτεκτονική Μοντέλου
Πριν μπορέσουμε να εξετάσουμε την αρχιτεκτονική και την εκπαιδευτική παραλλαγή για τον κωδικοποιητή κάμερας, είναι σημαντικό για μας να κατανοήσουμε τις διαφορετικές αναπαραστάσεις κάμερας. Συνήθως, η θέση της κάμερας αναφέρεται σε εσωτερικές και εξωτερικές παραμέτρους, και μια από τις απλές επιλογές για να αφήσει einen γεννήτορα βίντεο να συνδεθεί με τη θέση της κάμερας είναι να τροφοδοτήσει τις raw τιμές των παραμέτρων κάμερας στο γεννήτορα. Ωστόσο, η εφαρμογή μιας τέτοιας προσέγγισης μπορεί να μην ενισχύσει τον ακριβή έλεγχο της κάμερας για κάποια λόγια. Πρώτον, ενώ η πίνακας περιστροφής είναι περιορισμένος από την ορθογωνικότητα, ο διανυσματικός μεταφραστής είναι συνήθως ακαθόριστος σε μέγεθος, και οδηγεί σε μια ανισότητα στη διαδικασία μάθησης που μπορεί να επηρεάσει τη συνέπεια του ελέγχου. Δεύτερον, η χρήση raw παραμέτρων κάμερας trực tiếp μπορεί να κάνει δύσκολο για το μοντέλο να συσχετίσει αυτές τις τιμές με pixels εικόνας, οδηγώντας σε μειωμένο έλεγχο των οπτικών λεπτομερειών. Για να αποφευχθούν αυτές οι περιορισμοί, το πλαισίο CameraCtrl επιλέγει τις εμβυθώσεις plucker ως την αναπαράσταση της θέσης της κάμερας, καθώς οι εμβυθώσεις plucker έχουν γεωμετρικές περιγραφές κάθε pixel της εικόνας βίντεο και μπορούν να παρέχουν μια πιο περίπλοκη περιγραφή της θέσης της κάμερας.
Ελέγχος Κάμερας σε Γεννήτορες Βίντεο
Όπως το μοντέλο παραμετροποιεί την τροχιά της κάμερας σε μια ακολουθία εμβυθώσεων plucker, δηλαδή χωρικές χάρτες, το μοντέλο έχει την επιλογή να χρησιμοποιήσει einen κωδικοποιητή για να εξάγει τις λειτουργίες κάμερας και στη συνέχεια να συνδυάσει τις λειτουργίες κάμερας με einen γεννήτορα βίντεο. Παρόμοια με τον προσαρμοστή κειμένου προς εικόνα, το μοντέλο CameraCtrl εισάγει einen κωδικοποιητή κάμερας που σχεδιάστηκε ειδικά για βίντεο. Ο κωδικοποιητής κάμερας περιλαμβάνει einen χρονικό μοντέλο προσοχής μετά από κάθε μπλοκ συναρτήσεων, επιτρέποντας του να καταγράψει τις χρονικές σχέσεις των θέσεων κάμερας καθ’ όλη τη διάρκεια του clip βίντεο. Όπως φαίνεται στην επόμενη εικόνα, ο κωδικοποιητής κάμερας δέχεται μόνο είσοδο εμβυθώσεων plucker και παρέχει λειτουργίες πολλαπλών κλιμάκων. Μετά την απόκτηση των λειτουργιών κάμερας πολλαπλών κλιμάκων, το μοντέλο CameraCtrl στοχεύει να ενσωματώσει αυτές τις λειτουργίες στην αρχιτεκτονική U-Net του μοντέλου κειμένου προς βίντεο χωρίς προβλήματα, και καθορίζει τα στρώματα που πρέπει να χρησιμοποιηθούν για την ενσωμάτωση της κάμερας αποτελεσματικά. Επιπλέον,既然 η πλειοψηφία των υπάρχοντων πλαισίων υιοθετεί μια αρχιτεκτονική U-Net που περιέχει τόσο χρονικές όσο και χωρικές λειτουργίες προσοχής, το μοντέλο CameraCtrl εγχέει τις αναπαραστάσεις κάμερας στο μπλοκ χρονικής προσοχής, μια απόφαση που υποστηρίζεται από την ικανότητα των χρονικών λειτουργιών προσοχής να καταγράψουν τις χρονικές σχέσεις, που συμφωνούν με τη φυσική και σειριακή φύση της τροχιάς της κάμερας με τις χωρικές λειτουργίες προσοχής που απεικονίζουν τα ξεχωριστά πλαίσια.

Μάθηση Κατανομών Κάμερας
Η εκπαίδευση του κωδικοποιητή κάμερας στο πλαισίο CameraCtrl σε einen γεννήτορα βίντεο απαιτεί ένα μεγάλο σύνολο καλά ετικετών και αναγνωρισμένων βίντεο με το μοντέλο να είναι能够 να αποκτήσει την τροχιά της κάμερας χρησιμοποιώντας την προσέγγιση SfM. Το πλαισίο CameraCtrl επιχειρεί να επιλέξει το σύνολο δεδομένων με εμφάνιση που ταιριάζει με τα δεδομένα εκπαίδευσης του βασικού μοντέλου κειμένου προς βίντεο και να έχει μια κατανομή κάμερας όσο το δυνατόν ευρύτερη. Τα δείγματα στο σύνολο δεδομένων που παράγονται χρησιμοποιώντας εικονικές μηχανές παρουσιάζουν ποικιλία κατανομής κάμερας, поскольку οι dévelopπεurs έχουν την ευελιξία να ελέγχουν τις παραμέτρους της κάμερας κατά τη διάρκεια της φάσης απόδοσης, αν και αυτό υποφέρει από ένα χάσμα κατανομής όταν συγκρίνεται με συλλογές που περιέχουν δείγματα του πραγματικού κόσμου. Όταν εργαζόμαστε με συλλογές που περιέχουν δείγματα του πραγματικού κόσμου, η κατανομή της κάμερας είναι συνήθως στενή, και σε τέτοιες περιπτώσεις, το πλαισίο πρέπει να βρει μια ισορροπία μεταξύ της ποικιλίας μεταξύ των διαφορετικών τροχιών κάμερας και της πολυπλοκότητας της ατομικής τροχιάς κάμερας. Η πολυπλοκότητα της ατομικής τροχιάς κάμερας διασφαλίζει ότι το μοντέλο μαθαίνει να ελέγχει σύνθετες τροχιές κατά τη διάρκεια της εκπαίδευσης, ενώ η ποικιλία μεταξύ των διαφορετικών τροχιών κάμερας διασφαλίζει ότι το μοντέλο δεν υπερβαίνει σε ορισμένα σταθερά πρότυπα. Επιπλέον, για να παρακολουθήσετε την εκπαίδευση του κωδικοποιητή κάμερας, το πλαισίο CameraCtrl προτείνει το μέτρο ευθυγράμμισης κάμερας για να μετρήσει την ποιότητα ελέγχου της κάμερας quantifying το σφάλμα μεταξύ της τροχιάς της κάμερας των παραγόμενων δειγμάτων και των εισόδων κάμερας.
CameraCtrl: Πειραματικά Αποτελέσματα
Το πλαισίο CameraCtrl εφαρμόζει το μοντέλο AnimateDiff ως το βασικό μοντέλο κειμένου προς βίντεο και ένας από τους κύριους λόγους γι’ αυτό είναι ότι η στρατηγική εκπαίδευσης του μοντέλου AnimateDiff επιτρέπει στο μοντέλο κίνησης να ενσωματωθεί με μοντέλα κειμένου προς εικόνα ή μοντέλα κειμένου προς εικόνα LoRAs για να προσαρμοστεί η γεννήτρια βίντεο σε διάφορες κατηγορίες και τομείς. Το μοντέλο χρησιμοποιεί τον βελτιστοποιητή Adam για την εκπαίδευση του μοντέλου με μια σταθερή ταχύτητα μάθησης 1e-4. Επιπλέον, για να διασφαλιστεί ότι το μοντέλο δεν επηρεάζει αρνητικά τις ικανότητες γεννήτριας βίντεο του αρχικού μοντέλου κειμένου προς βίντεο, το πλαισίο CameraCtrl χρησιμοποιεί το μέτρο FID για να αξιολογήσει την ποιότητα εμφάνισης του βίντεο και συγκρίνει την ποιότητα του παραγόμενου βίντεο πριν και μετά την ένταξη του μοντέλου κάμερας.
Για να αξιολογήσει την απόδοσή του, το πλαισίο CameraCtrl αξιολογείται έναντι δύο υπάρχοντων πλαισίων ελέγχου κάμερας: MotionCtrl και AnimateDiff. Ωστόσο, поскольку το πλαισίο AnimateDiff έχει υποστήριξη μόνο για οκτώ βασικές τροχιές κάμερας, η σύγκριση μεταξύ CameraCtrl και AnimateDiff περιορίζεται σε τρεις βασικές τροχιές. Από την άλλη πλευρά, για την σύγκριση με το MotionCtrl, το πλαισίο επιλέγει πάνω από χίλια τυχαία δείγματα τροχιών κάμερας από υπάρχοντα σύνολα δεδομένων,除了 τις βασικές τροχιές κάμερας, και παράγει βίντεο χρησιμοποιώντας αυτές τις τροχιές, και αξιολογεί τα αποτελέσματα χρησιμοποιώντας τα μέτρα TransErr και RotErr.

Όπως μπορείτε να δείτε, το πλαισίο CameraCtrl υπερέχει του πλαισίου AnimateDiff στις βασικές τροχιές και παρέχει καλύτερα αποτελέσματα όταν συγκρίνεται με το πλαισίο MotionCtrl στο μέτρο τροχιάς.
Επιπλέον, η επόμενη εικόνα δείχνει την επίδραση της αρχιτεκτονικής του κωδικοποιητή κάμερας στην tổngική ποιότητα των παραγόμενων δειγμάτων. Η σειρά α έως δ αντιπροσωπεύει τα αποτελέσματα που παράγονται με τον κωδικοποιητή κάμερας που εφαρμόζεται στην αρχιτεκτονική: ControlNet, ControlNet με χρονική προσοχή, T2I Adaptor, και T2I adaptor με χρονική προσοχή, αντίστοιχα.

Στην επόμενη εικόνα, οι πρώτες δύο θέσεις δείχνουν το βίντεο που παράγεται χρησιμοποιώντας eine συνδυασμένη προσέγγιση του μοντέλου SparseCtrl και της μεθόδου που χρησιμοποιείται στο πλαισίο CameraCtrl.

Τελικές Σκέψεις
Σε αυτό το άρθρο, μιλήσαμε για το CameraCtrl, μια νέα ιδέα που επιχειρεί να ενεργοποιήσει τον ακριβή έλεγχο της θέσης της κάμερας για τα μοντέλα κειμένου προς βίντεο. Μετά την παραμετροποίηση της τροχιάς της κάμερας ακριβώς, το μοντέλο εκπαιδεύει einen μοντέλο κάμερας που μπορεί να συνδεθεί και να αποσυνδεθεί σε ένα μοντέλο κειμένου προς βίντεο, αφήνοντας τα άλλα компоненты αμετάβλητα. Επιπλέον, το μοντέλο CameraCtrl πραγματοποιεί μια綜合τική μελέτη για την επίδραση των διαφόρων συνόλων δεδομένων και προτείνει ότι τα βίντεο με παρόμοια εμφάνιση και ποικιλία κατανομής κάμερας μπορούν να βελτιώσουν την tổngική ικανότητα ελέγχου και γενίκευσης του μοντέλου. Οι πειραματικές μελέτες που διεξάγονται για την ανάλυση της απόδοσης του μοντέλου CameraCtrl σε πραγματικές εργασίες δείχνουν την αποτελεσματικότητα του πλαισίου στην επίτευξη ακριβούς και domaine-προσαρμοσμένου ελέγχου κάμερας, ανοίγοντας τον δρόμο για την διεκδίκηση της εξατομικευμένης και δυναμικής γεννήτριας βίντεο από τη θέση της κάμερας και τις εισόδους κειμένου.












