Μοντέλα και πλατφόρμες AI
Γέφυρα του Χάσματος στο Γεννητικό Βίντεο

Νέα έρευνα από την Κίνα προσφέρει μια βελτιωμένη μέθοδο για την διασύνδεση του χάσματος μεταξύ δύο χρονικά απομακρυσμένων καδρών βίντεο – μια από τις πιο κρίσιμες προκλήσεις στην τρέχουσα προσπάθεια για ρεαλισμό σε γεννητικά βίντεο AI, καθώς και για συμπίεση βίντεο codec.
Στο παρακάτω βίντεο, βλέπουμε στη στήλη αριστερά μια ‘αρχική’ (πάνω αριστερά) και ‘τελική’ (κάτω αριστερά) καρέ. Η εργασία που πρέπει να αναλάβουν τα ανταγωνιστικά συστήματα είναι να μαντέψουν πώς το αντικείμενο στις δύο εικόνες θα μετακινηθεί από το καρέ Α στο καρέ Β. Στην animation, αυτή η διαδικασία ονομάζεται tweening, και ανάγεται στην εποχή του σιωπηλού κινηματογράφου.
Πατήστε για αναπαραγωγή. Στη πρώτη, αριστερότερη στήλη, βλέπουμε την προτεινόμενη αρχική και τελική καρέ. στη μέση στήλη, και στην κορυφή της τρίτης (δεξιά) στήλης, βλέπουμε τρεις προηγούμενες προσεγγίσεις σε αυτήν την πρόκληση. Κάτω δεξιά, βλέπουμε ότι η νέα μέθοδος επιτυγχάνει ένα πολύ πιο πειστικό αποτέλεσμα στην παροχή των διαμεσολαβικών καδρών. Πηγή: https://fcvg-inbetween.github.io/
Η νέα μέθοδος που προτείνεται από τους Κινέζους ερευνητές ονομάζεται Γεννητική Διασύνδεση μέσω Πλαίσια-Καθοδηγούμενης Γεννήτριας Βίντεο (FCVG), και τα αποτελέσματά της μπορούν να φανεί στην κάτω δεξιά του βίντεο παραπάνω, παρέχοντας μια ομαλή και λογική μετάβαση από μια στατική καρέ σε μια άλλη.
Αντίθετα, μπορούμε να δούμε ότι ένα από τα πιο διακεκριμένα πλαίσια για διασύνδεση βίντεο, το πρόγραμμα Frame Interpolation for Large Motion (FILM) της Google, δυσκολεύεται, όπως και πολλές άλλες παρόμοιες προσπάθειες, με την ερμηνεία μεγάλων και τολμηρών κινήσεων.
Τα άλλα δύο ανταγωνιστικά πλαίσια που απεικονίζονται στο βίντεο, Time Reversal Fusion (TRF) και Generative Inbetweening (GI), παρέχουν μια λιγότερο στρεβλή ερμηνεία, αλλά έχουν δημιουργήσει φρενήρεις και ακόμη και κωμικές χορευτικές κινήσεις, καμία από τις οποίες δεν σέβεται την ضمنτική λογική των δύο προσφερόμενων καδρών.
Πατήστε για αναπαραγωγή. Δύο ατελείς λύσεις στο πρόβλημα της διασύνδεσης. Αριστερά, το FILM αντιμετωπίζει τις δύο καρέ ως απλές στόχους μορφοποίησης. Δεξιά, το TRF γνωρίζει ότι κάποια μορφή χορευτικής κίνησης πρέπει να εισαχθεί, αλλά προτείνει μια απρακτική λύση που αποκαλύπτει ανατομικές ανωμαλίες.
Πάνω αριστερά, μπορούμε να δούμε πιο κοντά πώς το FILM αντιμετωπίζει το πρόβλημα. Αν και το FILM σχεδιάστηκε για να μπορεί να χειριστεί μεγάλες κινήσεις, σε αντίθεση με προηγούμενες προσεγγίσεις που βασίζονται σε οπτική ροή, ακόμη δεν έχει μια σεμαντική κατανόηση του τι πρέπει να συμβαίνει μεταξύ των δύο προσφερόμενων καδρών, και απλώς εκτελεί μια μορφοποίηση μεταξύ των καδρών.
Για να δούμε τη προσπάθεια του TRF, όπου Stable Video Diffusion (SVD) χρησιμοποιείται για να μαντέψει πιο έξυπνα πώς μια χορευτική κίνηση που ταιριάζει στις δύο προσφερόμενες καρέ μπορεί να είναι – αλλά έχει κάνει μια τολμηρή και απίστευτη προσέγγιση.
Το FCVG, που φαίνεται παρακάτω, κάνει ένα πιο πιστευτό έργο στην πρόβλεψη της κίνησης και του περιεχομένου μεταξύ των δύο καδρών:
Πατήστε για αναπαραγωγή. Το FCVG βελτιώνει τις προηγούμενες προσεγγίσεις, αλλά είναι ακόμη μακριά από την τελειότητα.
Υπάρχουν ακόμη τεχνικές ανωμαλίες, όπως η μη επιθυμητή μορφοποίηση των χεριών και της προσώπης, αλλά αυτή η έκδοση είναι επιφανειακά η πιο πιθανή – και οποιαδήποτε βελτίωση της κατάστασης της τέχνης πρέπει να θεωρηθεί ενάντια στην τεράστια δυσκολία που προτείνει η εργασία: και το μεγάλο εμπόδιο που η πρόκληση παρουσιάζει για το μέλλον του AI-γεννημένου βίντεο.
Γιατί η Διασύνδεση έχει Σημασία
Όπως έχουμε σημειώσει προηγουμένως, η ικανότητα να γεμίσει πειστικά το περιεχόμενο του βίντεο μεταξύ δύο προσφερόμενων καδρών είναι ένας από τους καλύτερους τρόπους για να διατηρηθεί χρονική σταθερότητα σε γεννητικά βίντεο,既然 δύο πραγματικές και συνεχόμενες φωτογραφίες του ίδιου προσώπου θα περιέχουν συνεχόμενα στοιχεία όπως ρούχα, μαλλιά και περιβάλλον.
Όταν χρησιμοποιείται μόνο μια μονάδα αρχική καρέ, το περιορισμένο παράθυρο προσοχής ενός γεννητικού συστήματος, το οποίο συχνά λαμβάνει υπόψη μόνο τις κοντινές καρέ, θα τείνει να εξελίξει σταδιακά τα στοιχεία του αντικειμένου, μέχρι (για παράδειγμα) ένας άνθρωπος να γίνει ένας άλλος άνθρωπος (ή μια γυναίκα), ή να αποδείξει ότι έχει ‘μορφοποίηση’ ρούχα – μεταξύ πολλών άλλων αποσπάσεων που παράγονται συνήθως σε ανοιχτά συστήματα T2V και στις περισσότερες πληρωμένες λύσεις, όπως η Kling:
Πατήστε για αναπαραγωγή. Τροφοδοτώντας το νέο έγγραφο με τις δύο (πραγματικές) πηγαίες καρέ, με την πρόκληση ‘Ένας άνθρωπος χορεύει σε ένα δώμα’, δεν οδήγησε σε một ιδανική λύση. Αν και η Kling 1.6 ήταν διαθέσιμη την εποχή της δημιουργίας, η V1.5 είναι η τελευταία που υποστηρίζει προσφερόμενες αρχικές και τελικές καρέ. Πηγή: https://klingai.com/
Είναι ήδη η Πρόκληση Λυμένη;
Αντίθετα, ορισμένα εμπορικά, κλειστά και ιδιόκτητα συστήματα φαίνεται να κάνουν καλύτερα με το πρόβλημα – ιδιαίτερα το RunwayML, το οποίο μπόρεσε να δημιουργήσει πολύ πειστικές διασυνδέσεις των δύο πηγαίων καδρών:
Πατήστε για αναπαραγωγή. Η διασύνδεση της RunwayML με βάση τη διάχυση είναι πολύ αποτελεσματική. Πηγή: https://app.runwayml.com/
Επαναλαμβάνοντας την άσκηση, το RunwayML παρήγαγε ένα δεύτερο, εξίσου πιστευτό αποτέλεσμα:
Πατήστε για αναπαραγωγή. Η δεύτερη εκτέλεση της ακολουθίας του RunwayML.
Ένα πρόβλημα εδώ είναι ότι δεν μπορούμε να μάθουμε τίποτα για τις προκλήσεις που εμπλέκονται, ούτε να προχωρήσουμε την κατάσταση της τέχνης από ένα ιδιόκτητο σύστημα. Δεν μπορούμε να γνωρίζουμε αν αυτή η ανώτερη απόδοση έχει επιτευχθεί με μοναδικές αρχιτεκτονικές προσεγγίσεις, με δεδομένα (ή μεθόδους καλλιέργειας δεδομένων όπως φιλτράρισμα και αναγραφή), ή οποιαδήποτε συνδυασμός αυτών και άλλων πιθανών ερευνητικών καινοτομιών.
Δεύτερον, μικρότερα σχήματα, όπως εταιρείες οπτικών εφέ, δεν μπορούν να βασιστούν μακροπρόθεσμα σε υπηρεσίες API που οδηγούνται από επιχειρήσεις που θα μπορούσαν να υπονομεύσουν την λογιστική τους σχεδιασμό με μια単ή價 αύξηση – ιδιαίτερα αν μια υπηρεσία έρθει να κυριαρχήσει στην αγορά και, ως εκ τούτου, να είναι πιο διατεθειμένη να αυξήσει τις τιμές.
Όταν τα Δικαιώματα είναι Λάθος
Πολύ σημαντικότερο, αν ένα εμπορικό μοντέλο που εκτελείται καλά έχει εκπαιδευτεί σε μη αδειοδοτημένα δεδομένα, όπως φαίνεται να είναι η περίπτωση με το RunwayML, οποιαδήποτε εταιρεία που χρησιμοποιεί τέτοιες υπηρεσίες θα μπορούσε να κινδυνεύσει με νομική έκθεση κατάτω.
Καθώς οι νόμοι (και ορισμένες αγωγές) διαρκούν περισσότερο από τους προέδρους, και поскольку η κρίσιμη αγορά των ΗΠΑ είναι μεταξύ των πιο δικαστικών στον κόσμο, η τρέχουσα τάση προς μεγαλύτερη νομοθετική επιτήρηση για δεδομένα εκπαίδευσης AI φαίνεται να θα επιβιώσει της ‘ελαφράς άπτησης’ της επόμενης προεδρικής θητείας του Donald Trump.
Επομένως, ο τομέας της έρευνας υπολογιστικής όρασης θα πρέπει να αντιμετωπίσει αυτό το πρόβλημα με τον σκληρό τρόπο, ώστε οποιαδήποτε αναδυόμενη λύση να μπορεί να επιβιώσει μακροπρόθεσμα.
FCVG
Η νέα μέθοδος από την Κίνα παρουσιάζεται σε ένα έγγραφο με τίτλο Γεννητική Διασύνδεση μέσω Πλαίσια-Καθοδηγούμενης Γεννήτριας Βίντεο, και προέρχεται από πέντε ερευνητές από το Ινστιτούτο Τεχνολογίας Χαρμπίν και το Πανεπιστήμιο Τιεντσίν.
Το FCVG giải決 το πρόβλημα της αμφιβολίας στη διασύνδεση χρησιμοποιώντας πλαίσια-συνθήκες, μαζί με ένα πλαίσιο που περιγράφει περιγράμματα στις προσφερόμενες αρχικές και τελικές καρέ, το οποίο βοηθά τη διαδικασία να διατηρήσει μια πιο σταθερή πορεία των μεταβάσεων μεταξύ των μεμονωμένων καδρών, καθώς και την συνολική επίδραση.
Η πλαίσια-συνθήκη περιλαμβάνει την κατάτμηση της δημιουργίας των διαμεσολαβικών καδρών σε υπο-εργασίες, αντί να προσπαθήσει να γεμίσει ένα πολύ μεγάλο σεμαντικό κενό μεταξύ δύο καδρών (και όσο μεγαλύτερο είναι το ζητούμενο βίντεο, τόσο μεγαλύτερο είναι το σεμαντικό κενό).
Στην εικόνα παρακάτω, από το έγγραφο, οι συγγραφείς συγκρίνουν τη μέθοδο χρόνου-αναστροφής (TRF) με τη δική τους. Το TRF δημιουργεί δύο διαδρομές γεννήτριας βίντεο χρησιμοποιώντας ένα προ-εκπαιδευμένο μοντέλο εικόνας-προς-βίντεο (SVD). Η μια είναι μια ‘πρόωρη’ διαδρομή που συνδέεται με την αρχική καρέ, και η άλλη是一 ‘πίσω’ διαδρομή που συνδέεται με την τελική καρέ. Και οι δύο διαδρομές ξεκινούν από το ίδιο τυχαίο θόρυβο. Αυτό φαίνεται στο αριστερό μέρος της εικόνας παρακάτω:

Σύγκριση προηγούμενων προσεγγίσεων με το FCVG. Πηγή: https://arxiv.org/pdf/2412.11755
Οι συγγραφείς ισχυρίζονται ότι το FCVG είναι μια βελτίωση των μεθόδων χρόνου-αναστροφής, επειδή μειώνει την αμφιβολία στη γεννήτρια βίντεο, δίνοντας σε κάθε καρέ μια ρητή συνθήκη, οδηγώντας σε πιο σταθερή και συνεπή έξοδο.
Οι μέθοδοι χρόνου-αναστροφής, όπως το TRF, το έγγραφο ισχυρίζεται ότι μπορούν να οδηγήσουν σε αμφιβολία, επειδή οι πρόωρες και πίσω διαδρομές γεννήτριας μπορούν να απομακρύνθούν, προκαλώντας αποσύνδεση ή ασυνέπεια. Το FCVG αντιμετωπίζει αυτό το πρόβλημα χρησιμοποιώντας πλαίσια-συνθήκες που προέρχονται από ταίριασμα γραμμών μεταξύ των αρχικών και τελικών καδρών (κάτω δεξιά στην εικόνα παραπάνω), οι οποίες οδηγούν τη διαδικασία γεννήτριας.
Πατήστε για αναπαραγωγή. Μια άλλη σύγκριση από την σελίδα του έργου FCVG.
Η αναστροφή του χρόνου επιτρέπει τη χρήση προ-εκπαιδευμένων μοντέλων γεννήτριας βίντεο για διασύνδεση, αλλά έχει ορισμένα μειονεκτήματα. Η κίνηση που παράγεται από τα μοντέλα I2V είναι ποικίλη αντί για σταθερή. Ενώ αυτό είναι χρήσιμο για καθαρές εργασίες εικόνας-προς-βίντεο (I2V), δημιουργεί αμφιβολία και οδηγεί σε μη-ταίριαστες ή ασυνέπετες διαδρομές βίντεο.
Η αναστροφή του χρόνου απαιτεί επίσης εργαστηρή Tuning των υπερ-παραμέτρων, όπως η ταχύτητα καρέ για κάθε γεννημένο βίντεο. Επιπλέον, ορισμένες από τις τεχνικές που εμπλέκονται στην αναστροφή του χρόνου για να μειώσουν την αμφιβολία επιβραδύνουν σημαντικά την εύρεση, αυξάνοντας τους χρόνους επεξεργασίας.
Μέθοδος
Οι συγγραφείς παρατηρούν ότι εάν το πρώτο από αυτά τα προβλήματα (ποικιλία vs. σταθερότητα) μπορεί να επιλυθεί, όλα τα επόμενα προβλήματα είναι πιθανό να επιλυθούν από μόνα τους. Αυτό έχει προσπαθήσει σε προηγούμενες προσπάθειες, όπως η GI, και επίσης ViBiDSampler.
Το έγγραφο αναφέρει:
‘Ωστόσο [υπάρχει ακόμη] σημαντική τυχαία μεταβλητότητα μεταξύ αυτών των διαδρομών, και αυτό περιορίζει την αποτελεσματικότητα αυτών των μεθόδων στην αντιμετώπιση σzenariών που εμπλέκουν μεγάλες κινήσεις, όπως γρήγορες αλλαγές σε στάσεις ανθρώπων. Η αμφιβολία στη διασύνδεση οφείλεται σε ανεπαρκείς συνθήκες για τις μεσολαβικές καρέ,既然 δύο εισαγόμενα εικόνες παρέχουν συνθήκες μόνο για τις αρχικές και τελικές καρέ.’
‘Επομένως [προτείνουμε] να παρέχουμε μια ρητή συνθήκη για κάθε καρέ, η οποία μειώνει σημαντικά την αμφιβολία της διασύνδεσης.’
Μπορούμε να δούμε τις βασικές концепτές του FCVG σε λειτουργία στο σχήμα παρακάτω. Το FCVG γεννάει μια ακολουθία καδρών βίντεο που αρχίζει και τελειώνει συνεπώς με δύο εισαγόμενα καρέ. Αυτό διασφαλίζει ότι οι καρέ είναι χρονικά σταθεροί, παρέχοντας πλαίσια-συνθήκες για τη διαδικασία γεννήτριας βίντεο.

Σχήμα για την εύρεση του FCVG.
Σε αυτήν την αναθεώρηση της προσεγγίσης αναστροφής του χρόνου, η μέθοδος συνδυάζει πληροφορίες από cả τις πρόωρες και πίσω κατευθύνσεις, τις οποίες συνδυάζει για να δημιουργήσει ομαλές μεταβάσεις. Μέσω μιας επαναληπτικής διαδικασίας, το μοντέλο σταδιακά βελτιώνει τις θορυβώδεις εισαγωγές μέχρι να παραχθεί το τελικό σύνολο των διαμεσολαβικών καδρών.
Το επόμενο στάδιο περιλαμβάνει τη χρήση του προ-εκπαιδευμένου GlueStick μοντέλου ταίριασμα γραμμών, το οποίο δημιουργεί αντιστοιχίες μεταξύ των δύο υπολογισμένων αρχικών και τελικών καδρών, με την προαιρετική χρήση σκελετικών στάσεων για να οδηγήσει το μοντέλο, μέσω του μοντέλου Stable Video Diffusion.

Το GlueStick παράγει γραμμές από ερμηνευμένες μορφές. Αυτές οι γραμμές παρέχουν ταίριασμα μεταξύ των αρχικών και τελικών καδρών στο FCVG*.
Οι συγγραφείς σημειώνουν:
‘Εμπειρικά βρήκαμε ότι η γραμμική διασύνδεση είναι επαρκής για τις περισσότερες περιπτώσεις για να διασφαλίσει τη χρονική σταθερότητα στις διαμεσολαβικές καρέ. Η μέθοδός μας επιτρέπει στους χρήστες να ορίσουν μη-γραμμικές διαδρομές διασύνδεσης για τη γεννήτρια των επιθυμητών [βίντεο].’

Η ροή εργασίας για την καθοδήγηση των πρόωρων και πίσω πλαίσια-συνθηκών. Μπορούμε να δούμε τα ταίριασμα χρωμάτων που διατηρούν το περιεχόμενο συνεπές καθώς η animation εξελίσσεται.
Για να ενject τις ληφθείσες πλαίσια-συνθήκες στο SVD, το FCVG χρησιμοποιεί τη μέθοδο που αναπτύχθηκε για την πρωτοβουλία ControlNeXt του 2024. Σε αυτήν τη διαδικασία, οι συνθήκες ελέγχου αρχικά κωδικοποιούνται από πολλαπλά ResNet μπλοκ, πριν από την δια-κανονικοποίηση μεταξύ των συνθηκών και των διακλαδώσεων της ροής εργασίας.
Μια μικρή συλλογή βίντεο χρησιμοποιείται για λεπτή-ρυθμίση του μοντέλου SVD, με τα περισσότερα από τα παράμετρα του μοντέλου παγωμένα.
‘[Οι προαναφερθέντες περιορισμοί] έχουν λυθεί σε μεγάλο βαθμό στο FCVG: (i) Καθορίζοντας ρητά την συνθήκη για κάθε καρέ, η αμφιβολία μεταξύ των πρόωρων και πίσω διαδρομών μειώνεται σημαντικά; (ii) Μόνο ένας ρυθμιζόμενος [παράμετρος εισαγωγής], ενώ διατηρούνται οι υπερ-παράμετροι στο SVD ως προεπιλογή, αποδίδει ευνοϊκούς αποτελέσματα στις περισσότερες περιπτώσεις; (iii) Μια απλή μέση συγχώνευση, χωρίς επανα-εισαγωγή θορύβου, είναι επαρκής στο FCVG, και τα βήματα εύρεσης μπορούν να μειωθούν σημαντικά κατά 50% σε σύγκριση με [GI].’

Γενικό σχήμα για την ένεση πλαίσια-συνθηκών στο Stable Video Diffusion για το FCVG.
Δεδομένα και Τεστ
Για να δοκιμάσουν το σύστημα, οι ερευνητές συνέλεξαν ένα σύνολο δεδομένων που περιλαμβάνει ποικίλες σκηνές, συμπεριλαμβανομένων εξωτερικών περιβαλλόντων, στάσεων ανθρώπων και εσωτερικών τοποθεσιών, συμπεριλαμβανομένων κινήσεων όπως κίνησης κάμερας, χορευτικών ενεργειών και εκφράσεων προσώπου, μεταξύ άλλων. Οι 524 κλιπ που επιλέχθηκαν λήφθηκαν από τα σύνολα δεδομένων DAVIS και RealEstate10k. Αυτή η συλλογή συμπληρώθηκε με βίντεο υψηλής ταχύτητας καρέ που λήφθηκαν από το Pexels. Η συλλογή χωρίστηκε 4:1 μεταξύ λεπτής-ρυθμίσεως και δοκιμής.
Οι μετρήσεις που χρησιμοποιήθηκαν ήταν Μαθημένες Μετρήσεις Ομοιότητας (LPIPS); Απόσταση Εισαγωγής Fréchet (FID); Απόσταση Βίντεο Fréchet (FVD); VBench; και Απόσταση Κίνησης Βίντεο Fréchet.
Οι συγγραφείς σημειώνουν ότι καμία από αυτές τις μετρήσεις δεν είναι καλά προσαρμοσμένη για να εκτιμήσει τη χρονική σταθερότητα, και μας παραπέμπουν στα βίντεο στη σελίδα του έργου FCVG.
Επιπλέον, η DWPose χρησιμοποιήθηκε για την εκτίμηση των στάσεων ανθρώπων.
Η λεπτή-ρυθμίση πραγματοποιήθηκε για 70.000 επαναλήψεις υπό τον AdamW βελτιστοποιητή σε μια NVIDIA A800 GPU, με ρυθμό μάθησης 1×10-6, με καρέ που έχουν περικοπεί σε 512×320 patches.
Τα ανταγωνιστικά προηγούμενα πλαίσια που δοκιμάστηκαν ήταν FILM, GI, TRF, και DynamiCrafter.
Για ποσοτική αξιολόγηση, οι κενές καρέ που αντιμετωπίστηκαν κυμαίνονταν μεταξύ 12 και 23.

Ποσοτικά αποτελέσματα ενάντια σε προηγούμενα πλαίσια.
Σχετικά με αυτά τα αποτελέσματα, το έγγραφο παρατηρεί:
‘[Η] μέθοδός μας επιτυγχάνει την καλύτερη απόδοση μεταξύ τεσσάρων γεννητικών προσεγγίσεων σε όλα τα μέτρα. Όσον αφορά τη σύγκριση LPIPS με το FILM, το FCVG μας είναι ελαφρώς κατώτερο, ενώ επιδεικνύει ανώτερη απόδοση σε άλλα μέτρα. Λαμβάνοντας υπόψη την απουσία χρονικής πληροφορίας στο LPIPS, μπορεί να είναι πιο κατάλληλο να προτεραιοποιήσουμε άλλα μέτρα και οπτική παρατήρηση.
‘Επιπλέον, συγκρίνοντας τα αποτελέσματα υπό διαφορετικές κενές καρέ, το FILM μπορεί να λειτουργήσει καλά όταν η κενή καρέ είναι μικρή, ενώ οι γεννητικές μέθοδοι είναι πιο κατάλληλες για μεγάλες κενές καρέ. Μεταξύ αυτών των γεννητικών μεθόδων, το FCVG μας εμφανίζει σημαντική υπεροχή λόγω των ρητών πλαίσια-συνθηκών του.’
Για ποιοτική δοκιμή, οι συγγραφείς παρήγαγαν τα βίντεο που φαίνονται στη σελίδα του έργου (μερικά από τα οποία είναι ενσωματωμένα σε αυτό το άρθρο), και στατικά και κινούμενα† αποτελέσματα στο PDF έγγραφο,

Δείγματα στατικών αποτελεσμάτων από το έγγραφο. Παρακαλούμε ανατρέξτε στο αρχικό PDF για καλύτερη ανάλυση, και να γνωρίζετε ότι το PDF περιέχει κινούμενα που μπορούν να παιχτούν σε εφαρμογές που υποστηρίζουν αυτήν τη δυνατότητα.
Οι συγγραφείς σχολιάζουν:
‘Ενώ το FILM παράγει ομαλές αποτελέσματα διασύνδεσης για σzenaria μικρών κινήσεων, δυσκολεύεται με μεγάλες κινήσεις λόγω των εγγενών περιορισμών της οπτικής ροής, οδηγώντας σε εμφανή ανωμαλίες όπως κίνηση φόντου και κίνησης χεριών (στη πρώτη περίπτωση).
‘Γεννητικά μοντέλα όπως το TRF και το GI υποφέρουν από αμφιβολίες στις διαδρομές συγχώνευσης, οδηγώντας σε ασταθή ενδιάμεση κίνηση, ιδιαίτερα εμφανή σε σύνθετα σzenaria που εμπλέκουν κίνηση ανθρώπων και αντικειμένων.
‘Αντίθετα, η μέθοδός μας παρέχει συνεπώς ικανοποιητικά αποτελέσματα σε διάφορα σzenaria.’Ακόμη και όταν υπάρχει σημαντική οκκλουσία (στη δεύτερη περίπτωση και στην έκτη περίπτωση), η μέθοδός μας μπορεί ακόμη να πιάσει λογική κίνηση. Επιπλέον, η προσέγγισή μας εμφανίζει ανθεκτικότητα για σύνθετες ενέργειες ανθρώπων (στην τελευταία περίπτωση).’
Οι συγγραφείς βρήκαν επίσης ότι το FCVG γενικεύεται ασυνήθιστα καλά σε βίντεο στυλ animation:
Πατήστε για αναπαραγωγή. Το FCVG παράγει πολύ πειστικά αποτελέσματα για cartoon-style animation.
Συμπέρασμα
Το FCVG αντιπροσωπεύει τουλάχιστον μια σταδιακή βελτίωση για την κατάσταση της τέχνης στη διασύνδεση καδρών σε ένα μη-ιδιόκτητο πλαίσιο. Οι συγγραφείς έχουν κάνει τον κώδικα για το έργο διαθέσιμο στο GitHub, αν και το συνδεδεμένο σύνολο δεδομένων δεν έχει κυκλοφορήσει την εποχή της γραφής.
Εάν οι ιδιόκτητες εμπορικές λύσεις υπερβαίνουν τις ανοιχτές προσπάθειες μέσω της χρήσης web-σκαμμένων, μη-αδειοδοτημένων δεδομένων, φαίνεται να υπάρχει περιορισμένος ή κανένας μέλλον σε τέτοιου είδους προσέγγιση, τουλάχιστον για εμπορική χρήση: οι κίνδυνοι είναι απλώς πολύ μεγάλοι.
Επομένως, ακόμη και αν η ανοιχτή σκηνή παραμένει πίσω από τις εντυπωσιακές επιδείξεις των ηγετών της αγοράς, είναι, επιχείρημα, η χελώνα που μπορεί να νικήσει τον ιππόποδα στο τελικό στάδιο.
* Πηγή: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf
† Απαιτεί Acrobat Reader, Okular, ή οποιοδήποτε άλλο πρόγραμμα ανάγνωσης PDF που μπορεί να αναπαράγει ενσωματωμένες animations του PDF.
Πρώτη δημοσίευση Παρασκευή, 20 Δεκεμβρίου 2024












