Η γωνία του Anderson

Εκτός Οράσεως, Εκτός Νοός: Αντιμετωπίζοντας το Μεγαλύτερο Πρόβλημα στα Βίντεο AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Detail from the first page of the Μάρτιος 2026 paper 'Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models'. Source - https://arxiv.org/pdf/2603.25716

Το μεγαλύτερο πρόβλημα ακόμη και με τις καλύτερες γεννήτριες βίντεο AI είναι ότι έχουν χρόνια αμνησία – μια πρόκληση που η νέα έρευνα από την Κίνα αντιμετωπίζει τώρα.

 

Το μεγαλύτερο πρόβλημα με τις καλύτερες και πιο προηγμένες γεννήτριες βίντεο AI είναι ότι όλες έχουν χρόνια αμνησία: αν η κάμερα στρέψει την προσοχή μακριά από αυτό που εστιάζει και μετά στρέψει πίσω, δεν θα βρει ποτέ αυτό που ήταν εκεί στην αρχή – οι χαρακτήρες θα έχουν εξαφανιστεί, θα έχουν αλλάξει εμφάνιση και/ή τύπο κίνησης, και το φόντο θα έχει επίσης αλλάξει.

Αυτό οφείλεται στο ότι το σύστημα γεννήτριας που βασίζεται στη διάχυση έχει ένα περιορισμένο ρολόι προσοχής, και επειδή αντιμετωπίζει πάντα αυτό που μπορεί να δει σε εκείνη τη στιγμή; σε μια αληθινή εκδήλωση σολιψισμού, αυτό που είναι εξωτερικό του πλαισίου δεν υπάρχει για τη γεννήτρια AI – γίνεται κυριολεκτικά απορριμμένο από τη μνήμη.

Αυτό δεν ήταν ποτέ πρόβλημα στη παραδοσιακή CGI, η οποία μπορεί πάντα να αναφερθεί και να αναδημιουργήσει ένα αντικείμενο, συμπεριλαμβανομένης της εμφάνισης και της κίνησης, σε οποιοδήποτε σημείο ενός αποδοθέντος βίντεο όπου μπορεί να χρειαστεί ξανά:

Παραδοσιακές CGI meshes και bitmapped textures μπορούν πάντα να σχεδιαστούν πίσω σε ένα render, παρέχοντας συνεπή εμφάνιση – ένα κόλπο που είναι πολύ πιο δύσκολο να επιτευχθεί σε προσεγγίσεις AI, επειδή δεν υπάρχει ισοδύναμο 'πλατύ αρχείο'.

Παραδοσιακές CGI meshes και bitmapped textures μπορούν πάντα να σχεδιαστούν πίσω σε ένα render, παρέχοντας συνεπή εμφάνιση – ένα κόλπο που είναι πολύ πιο δύσκολο να επιτευχθεί σε προσεγγίσεις AI, επειδή δεν υπάρχει ισοδύναμο ‘πλατύ αρχείο’ ή συλλογή συναφών αρχείων.

Αυτό οφείλεται στο ότι τα στοιχεία της CGI, όπως το mesh και οι textures (βλέπε εικόνα παραπάνω), καθώς και αρχεία κίνησης και άλλες δυναμικές συμπεριφορές, μπορούν να ζήσουν διακριτά στο δίσκο και να σχεδιαστούν σε μια σύνθεση οποιαδήποτε στιγμή.

Δεν υπάρχει τέτοιο ‘πλατύ αποθετήριο’ στη γεννήτρια βίντεο AI· η κοντινότερη που μπορεί να φτάσει σε αυτή τη λειτουργικότητα είναι LoRAs – ειδικά εκπαιδευμένα αρχέτυπα που μπορούν να εκπαιδευτούν σε καταναλωτική εξοπλισμό, επιτρέποντας νέα πρόσωπα και συγκεκριμένα ρούχα να ‘βιαστούν’ στο βίντεο:

Πατήστε για αναπαραγωγή. Το πρόβλημα σολιψισμού της γεννήτριας βίντεο AI μπορεί να μετριαστεί μέχρι κάποιο βαθμό με τη χρήση LoRAs – αλλά τα αποτελέσματα μπορούν να είναι καταπιεστικά.

Αυτό δεν είναι ιδανική λύση, όμως. Για ένα πράγμα, οι LoRAs είναι δεσμευμένοι σε μια ακριβή συγκεκριμένη έκδοση ενός μοντέλου (όπως Wan2+ ή Hunyuan Video), και χρειάζονται αναδημιουργία κάθε φορά που το βασικό μοντέλο αλλάζει. Για άλλο, οι LoRAs τείνουν να διαστρεβλώνουν τα βάρη του μοντέλου, ώστε η ταυτότητα LoRA να επιβάλλεται σε όλα τα πρόσωπα σε μια σκηνή. Επιπλέον, μεθόδους αυτού του είδους είναι πολύ ευαίσθητες σε κακοδιατηρημένα σύνολα δεδομένων.

Ακριβείς Επανεμφανίσεις

Τώρα, μια νέα ακαδημαϊκή/βιομηχανική συνεργασία από την Κίνα προσφέρει την πρώτη σημαντική θεραπεία που έχει έρθει στην προσοχή μου σε πάνω από τρία χρόνια αναφοράς σε αυτό το ζήτημα. Η μέθοδος χρησιμοποιεί αυτό που οι ερευνητές ονομάζουν υβριδική μνήμη για να διατηρήσει τους χαρακτήρες εκτός οθόνης και τα άμεσα περιβάλλοντά τους ενεργούς και ακριβείς στη λατινική μνήμη του μοντέλου, ώστε όταν η οπτική μας γωνία επιστρέψει σε αυτούς, το αποτέλεσμα είναι συνεπές:

Πατήστε για αναπαραγωγή. Από τον ιστότοπο του έργου για το νέο έγγραφο, δύο παραδείγματα AI-γεννημένων (WAN) χαρακτήρων που εξέρχονται από το πλαίσιο και ακριβώς επανεμφανίζονται. Πηγή 

Θα πρέπει να τονιστεί ότι αυτό δεν είναι το ίδιο πράγμα με την επίτευξη συνέπειας χαρακτήρων σε διαφορετικές λήψεις – κάτι που ισχυρίστηκε ότι είχε επιτευχθεί πέρυσι στη Gen 4 του Runway, και που παραμένει μια συνεχιζόμενη πρόκληση στη βιβλιογραφία της έρευνας.

Αντίθετα, αυτό που έχει λυθεί εδώ είναι κάτι που δεν έχει επιτύχει κανένα εμπορικό ή πειραματικό πλαίσιο που έχω δει – η οπτικά συνεπής επανεμφάνιση της προηγούμενης εμφάνισης, κίνησης και περιβάλλοντος ενός χαρακτήρα εκτός οθόνης:

Πατήστε για αναπαραγωγή. Τα άλλα δύο κύρια παραδείγματα που δίνονται στον ιστότοπο του νέου έργου.

Προφανώς, οι αρχές που λειτουργούν εδώ μπορούν να εφαρμοστούν εξίσου σε άλλους τομείς, όπως η αστική εξερεύνηση, ο οδηγός POV, ή άλλων ειδών μη-χαρακτήρων αποδοτήσεων.

Θα πρέπει επίσης να τονιστεί ότι αυτή η νέα προσέγγιση δεν λύνει ή αντιμετωπίζει το ζήτημα που το Runway Gen4 και άλλα κλειστά πλαίσια ισχυρίζονται ότι έχουν αντιμετωπίσει, αναδημιουργώντας χαρακτήρες σε διαφορετικές λήψεις; αντίθετα, κάνει αυτό που δεν έχουν ακόμη επιτύχει – διατηρώντας έναν χαρακτήρα και περιβάλλον στη μνήμη, χωρίς να χρειάζεται να παραμείνουν ορατοί στο θεατή σε όλες τις στιγμές.

Το νέο έργο αποτελείται από μια αφοσιωμένη βάση δεδομένων που δημιουργήθηκε μέσω Unreal Engine, καθώς και προσαρμοσμένα μετρικά για το πρόβλημα σολιψισμού*, και ένα εξειδικευμένο γεννητικό πλαίσιο που κατασκευάστηκε πάνω από το WAN. Σε δοκιμές ενάντια στα λίγα αναλογικά συστήματα που είναι διαθέσιμα, οι συγγραφείς ισχυρίζονται αποτελέσματα στοιχείο-της-τέχνης, και σχολιάζουν:

‘[Μηχανισμοί μνήμης] έχουν αναδυθεί ως κρίσιμη πλευρά στην προώθηση των μοντέλων του κόσμου, καθώς η ικανότητα μνήμης καθορίζει τη χωρική και χρονική συνέπεια του γεννημένου περιεχομένου.

‘Συγκεκριμένα, είναι το γνωστικό άγκυρο που επιτρέπει στο μοντέλο να διατηρεί ιστορικό контέκστο κατά τη μετατόπιση της οπτικής γωνίας ή την μακροχρόνια εξαγωγή.

‘Χωρίς ρομποτική μνήμη, ένας προσομοιωμένος κόσμος γρήγορα αποσυντίθεται σε ασύνδετα, χαотικά πλαίσια.’

Το νέο έγγραφο έχει τον τίτλο Εκτός Οράσεως, Όχι Εκτός Νοός: Υβριδική Μνήμη για Δυναμικά Μοντέλα Κόσμου Βίντεο, και προέρχεται από επτά ερευνητές σε Πανεπιστήμιο Επιστημών και Τεχνολογίας Huazhong, και την Ομάδα Kling στην Kuaishou Technology.

Μέθοδος

Η κεντρική πλάκα του νέου έργου είναι η υβριδική μνήμη, η οποία διευκολύνει την ‘εξω-από-θεάση-εξαγωγή’ – τη διατήρηση χαρακτήρων και των контέκστ τους ενώ ο θεατής ‘κοιτάζει μακριά’ (ή ενώ ο χαρακτήρας εξέρχεται από το πεδίο зрения). Σε αυτή τη σκηνή, το πλαίσιο απαιτεί να thực hiệnήσει χωροχρονική αποσύνδεση,其中 είναι ταυτόχρονα εστιασμένο στη γεννήτρια ορατού και την εκτός-οθόνης ύπαρξη του τώρα εκτός-οθόνης χαρακτήρα.

Παραδείγματα κίνησης κάμερας είσοδου/εξόδου. Σε αυτές τις περιπτώσεις, είναι η κίνηση της κάμερας που προκαλεί τον χαρακτήρα να εξέρχεται από το πλαίσιο, αλλά σε διάφορες δείγματα μπορούμε επίσης να παρατηρήσουμε τον χαρακτήρα να προωθεί τον εαυτό του προσωρινά εκτός οθόνης. Πηγή - https://arxiv.org/pdf/2603.25716

Παραδείγματα κίνησης κάμερας είσοδου/εξόδου. Σε αυτές τις περιπτώσεις, είναι η κίνηση της κάμερας που προκαλεί τον χαρακτήρα να εξέρχεται από το πλαίσιο, αλλά σε διάφορες δείγματα μπορούμε επίσης να παρατηρήσουμε τον χαρακτήρα να προωθεί τον εαυτό του προσωρινά εκτός οθόνης. Πηγή

Οι συγγραφείς σημειώνουν ότι στις διαχυτικές λατινικές εμφυτεύσεις, τα χαρακτηριστικά που πρέπει να εξαχθούν και να χρησιμοποιηθούν είναι βαθιά ενταγμένα με άλλα χαρακτηριστικά και ιδιότητες· και ότι η απόπειρα να τα εξαγάγει συχνά προκαλεί το αντικείμενο να ‘παγώσει’ στο φόντο. Επομένως, επινόησαν και καλλιέργησαν το HM-World σύνολο δεδομένων**, ειδικά για την εκπαίδευση υβριδικής μνήμης:

Από το έγγραφο, δείγματα από τις τέσσερις κατηγορίες που περιέχονται στη βάση δεδομένων HM-World.

Από το έγγραφο, δείγματα από τις τέσσερις κατηγορίες που περιέχονται στη βάση δεδομένων HM-World.

Η συλλογή κατασκευάζεται κατά μήκος τεσσάρων διαστάσεων: τράjectories αντικειμένων, τράjectories κάμερας, σκηνές, και αντικείμενα.

Τα συνθετικά δεδομένα στη βάση δεδομένων HM-World περιλαμβάνουν 17 σκηνές και 49 αντικείμενα, συμπεριλαμβανομένων ανθρώπων με διαφορετική εμφάνιση, καθώς και ζώων πολλών ειδών. Συνδυασμοί αυτών τοποθετούνται διαδικαστικά σε μια σκηνή μέσω του Unreal Engine, κάθε ένας με μια διαφορετική κίνηση, και στη συνέχεια τοποθετούνται σε μια τυχαία επιλεγμένη τροχιά.

Οι συγγραφείς δηλώνουν ότι μια ποικιλία εξόδου-εισόδου συμβάντων απεικονίζονται στη βάση δεδομένων, με 28 διαφορετικές τροχιές κάμερας, κάθε μια με πολλαπλά σημεία εκκίνησης.

Η τελική συλλογή φτάνει τις 59.225 βίντεο-κλιπ, κάθε ένα από τα οποία έχει ανατεθεί από το MiniCPM-V Πολυμεσικό Μεγάλο Γλωσσικό Μοντέλο (MLLM).

Οι ερευνητές υπογραμμίζουν τις στατιστικές πλεονεκτήματα της συλλογής τους έναντι προηγούμενων συνόλων δεδομένων WorldScore; Context-As-Memory; Multi-Cam Video; και 360° Motion:

Σύγκριση μεταξύ υφιστάμενων συνόλων δεδομένων και της βάσης δεδομένων HM-World, όπου 'Δυναμικό Αντικείμενο' υποδηλώνει την παρουσία κινούμενων οντοτήτων, 'Εξόδου-Είσοδου Αντικειμένου' υποδηλώνει κλιπ που περιέχουν αντικείμενα που εξέρχονται και επανεμφανίζονται στο πλαίσιο, και 'Στάση Αντικειμένου' αναφέρεται στην ένταξη ανατεθειμένων 3D στάσεων.

Σύγκριση μεταξύ υφιστάμενων συνόλων δεδομένων και της βάσης δεδομένων HM-World, όπου ‘Δυναμικό Αντικείμενο’ υποδηλώνει την παρουσία κινούμενων οντοτήτων, ‘Εξόδου-Είσοδου Αντικειμένου’ υποδηλώνει κλιπ που περιέχουν αντικείμενα που εξέρχονται και επανεμφανίζονται στο πλαίσιο, και ‘Στάση Αντικειμένου’ αναφέρεται στην ένταξη ανατεθειμένων 3D στάσεων.

Η Λιγότερο Διαβατή Οδός

Δεδομένων plusieurs προηγούμενων πλαισίων και μιας γνωστής τροχιάς κάμερας, η εργασία είναι να προβλέψουμε μελλοντικές απόψεις καθώς η οπτική γωνία του θεατή μετατοπίζεται, λαμβάνοντας υπόψη αντικείμενα που κινούνται ανεξάρτητα και μπορεί να εξέρχονται από το πλαίσιο πριν επανεμφανιστούν. Αυτό απαιτεί περισσότερα από τη διατήρηση ενός σταθερού φόντου,既然 το μοντέλο πρέπει επίσης να διατηρήσει μια συνεχή εσωτερική εγγραφή του πώς κάθε κινούμενο αντικείμενο εμφανίζεται και συμπεριφέρεται, ακόμη και κατά τη διάρκεια περιόδων που δεν είναι ορατό.

Η μέθοδος Υβριδική Δυναμική Αναζήτηση Προσοχής (HyDRA) των συγγραφέων αντιμετωπίζει αυτό εισάγοντας μια αφοσιωμένη οδό μνήμης που分离ει δυναμικά αντικείμενα από την στατική αναπαράσταση σκηνής, επιτρέποντας τους να διαρκέσουν στον χρόνο, και να επανεμφανιστούν με συνεπή εμφάνιση και κίνηση:

Εννοιολογικό σχήμα για το μοντέλο HyDRA.

Εννοιολογικό σχήμα για το μοντέλο HyDRA.

Η HyDRA είναι κατασκευασμένη πάνω από Wan2.1-T2V-1.3B, με την πυρήνα διαχυτική διαδικασία να παραμένει σε μεγάλο βαθμό άθικτη, ενώ εισάγει μια τροποποιημένη μετασχηματιστή μπλοκ που ενσωματώνει δυναμική αναζήτηση προσοχής. Αυτό επιτρέπει στο μοντέλο να ανακαλεί επιλεκτικά κίνηση και εμφάνιση από προηγούμενα πλαίσια, αντί να βασίζεται σε σταθερή ή τοπική контέκστο.

Αυτή η διαδικασία χρησιμοποιεί einen προσαρμοσμένο Flow Matching στόχο εκπαίδευσης αντί του τυπικού διαχυτικού αποθέματος.

Για να διατηρήσει τις σκηνές ευθυγραμμισμένες με την κίνηση της κάμερας, οι τροχιές κάμερας εγχέονται ως μια ρητή σήμα κατάστασης, με κάθε πλαισιο του να ορίζεται από περιστροφή και μετάφραση, και στη συνέχεια μετατρέπονται σε μια συμπαγή αναπαράσταση που καπνίζει πώς η οπτική γωνία εξελίσσεται στον χρόνο.

Σε ευθυγράμμιση με την προηγούμενη (Kling) ReCamMaster πρωτοβουλία, το αποτέλεσμα είναι στη συνέχεια να αναλυθεί από τον κωδικοποιητή κάμερας, που υλοποιείται ως Πολυ-στιβάδα Περσέπτρον, και στη συνέχεια να μεταδοθεί και να προστεθεί στις Διαχυτική Μετασχηματιστή χαρακτηριστικά, επιτρέποντας στο μοντέλο να διατηρήσει συνεπή τοποθέτηση αντικειμένων καθώς η κάμερα μετακινείται.

Τυποποίηση

Ακατέργαστες διαχυτικές λατινικές μίγματα κίνησης αντικειμένου, εμφάνισης και φόντου σε μια ενωμένη ενταγμένη αναπαράσταση, και η απόπειρα να ανακαλέσει απευθείας από αυτό το χώρο κινδυνεύει να εισαγάγει μη σχετικό контέκστο, ή να προκαλέσει κινούμενα αντικείμενα να ‘μιγούν’ στο φόντο.

Η HyDRA αντιμετωπίζει αυτό με έναν 3D-συνβολικό-με-χρόνο Τυποποιητή Μνήμης που επεξεργάζεται χώρο και χρόνο μαζί – αντί να προωθεί πλήρη ιστορίες λατινικών, συμπιέζει τις σε συμπαγείς, κίνηση-ενήμερες μνήμης-τυποποιητές που διατηρούν πώς τα αντικείμενα εμφανίζονται και κινούνται:

Επισκόπηση της HyDRA. Αριστερά, ο Τυποποιητής Μνήμης μετατρέπει προηγούμενα πλαίσια σε συμπαγείς, κίνηση-ενήμερες μνήμης-τυποποιητές· δεξιά, η Δυναμική Αναζήτηση Προσοχής αξιολογεί την τρέχουσα ερώτηση ενάντια σε αυτούς τους τυποποιητές, ανακτά τους πιο σχετικούς, και τους χρησιμοποιεί για να αποκαταστήσει συνεπή εμφάνιση και κίνηση στο γεννημένο πλαισιο.

Επισκόπηση της HyDRA. Αριστερά, ο Τυποποιητής Μνήμης μετατρέπει προηγούμενα πλαίσια σε συμπαγείς, κίνηση-ενήμερες μνήμης-τυποποιητές· δεξιά, η Δυναμική Αναζήτηση Προσοχής αξιολογεί την τρέχουσα ερώτηση ενάντια σε αυτούς τους τυποποιητές, ανακτά τους πιο σχετικούς, και τους χρησιμοποιεί για να αποκαταστήσει συνεπή εμφάνιση και κίνηση στο γεννημένο πλαισιο.

Αυτοί οι τυποποιητές σχηματίζουν μια δομημένη υβριδική μνήμη που φιλτράρει θόρυβο ενώ διατηρεί μακροχρόνιες δυναμικές. Παροχετεύονται στη Δυναμική Αναζήτηση Προσοχής, αυτοί επιτρέπουν στο μοντέλο να ανακαλεί επιλεκτικά εκτός-οθόνης αντικείμενα, ώστε να επανεμφανιστούν με συνεπή εμφάνιση, κίνηση και контέκστο.

Δυναμική Αναζήτηση Προσοχής

Η διπλή μηχανική μνήμης της HyDRA χρησιμοποιεί επίσης δυναμική αναζήτηση προσοχής σε ένα διαφορετικό αλλά συμπληρωματικό ρόλο μέσα στο πλαίσιο.

Η τυποποίηση μνήμης συμπιέζει προηγούμενες λατινικές αναπαραστάσεις σε δομημένες, κίνηση-ενήμερες τυποποιητές που διαχωρίζουν δυναμικά αντικείμενα από στατικό περιεχόμενο σκηνής, μειώνοντας την εντάξη που συχνά προκαλεί αντικείμενα να ‘μιγούν’ στο φόντο. Αυτοί οι τυποποιητές σχηματίζουν μια μόνιμη τράπεζα μνήμης αντί για μια πλήρη ιστορία πλαισίων.

Η Δυναμική Αναζήτηση Προσοχής στη συνέχεια λειτουργεί πάνω από αυτή τη τράπεζα κατά τη διάρκεια της γεννήτριας, αξιολογώντας την τρέχουσα ερώτηση ενάντια σε αποθηκευμένους τυποποιητές και ανακαλώντας επιλεκτικά αυτούς που είναι πιο σχετικοί με το εξελισσόμενο πλαισιο. Αυτό επιτρέπει σε εκτός-οθόνης αντικείμενα να συνεχίσουν την.latent εξέλιξή τους (δηλαδή, να συνεχίσουν να περπατούν, να τρέχουν, όταν δεν είναι ορατά), και να επανεμφανιστούν με συνεπή εμφάνιση και κίνηση όταν επανεμφανίζονται, αντί να επαναρχίζουν ή να χειροτερεύουν.

Δεδομένα και Δοκιμές

Σε δοκιμές, το σύστημα HyDRA Wan-μπαζιάθηκε και υποδείγματα 77 контέκστ πλαισίων πριν να τους αναλύσει με έναν 3D Variational Autoencoder (VAE), ενώ ο Τυποποιητής Μνήμης χρησιμοποιούσε 3D-συνβολικό σε ένα μέγεθος πυρήνα 2x4x4.

Το μοντέλο εκπαιδεύτηκε στη HM-World για 10.000 επαναλήψεις σε 32 (απροσδιόριστους) GPU, σε ένα μέγεθος δείγματος 32.

Ένα ασυνήθιστα μεγάλο αριθμός μετρικών χρησιμοποιήθηκε στις δοκιμές: εκτός από το συνήθη Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM), και Learned Perceptual Similarity Metrics (LPIPS), οι συγγραφείς χρησιμοποίησαν επίσης συνέπεια αντικειμένου και συνέπεια φόντου από το VBench σύνολο, για να αξιολογήσουν την εσωτερική συνάφεια πλαισίων.

Επιπλέον, επινόησαν einen προσαρμοσμένο μετρικό που ονομάζεται Δυναμική Συνέπεια Αντικειμένου (DSC), το οποίο χρησιμοποιεί bounding boxes από YOLO V11, για να δημιουργήσει περικομμένα περιοχές που περιέχουν κινούμενα αντικείμενα, από τα οποία εξαγόμενα σεμαντικά χαρακτηριστικά και στη συνέχεια υπολογίζονται οι ομοιότητές τους.

Η HyDRA αντιπαρατέθηκε με Diffusion Forcing Transformer (DFoT), και Context-As-Memory, έναντι ενός βασικού μοντέλου Wan2.1-T2V-1.3B που εξοπλίστηκε με έναν κωδικοποιητή κάμερας (για να αντιπροσωπεύσει την υποκειμενική οπτική που είναι κοινή σε όλα τα κλιπ). Όλα τα μοντέλα εκπαιδεύτηκαν στη HM-World, και WorldPlay χρησιμοποιήθηκε επίσης ως μια μηδενική, δευτερεύουσα δοκιμαστική συλλογή:

Στις αρχικές ποσοτικές συγκρίσεις, η HyDRA ξεπέρασε όλα τα βασικά μοντέλα, αυξάνοντας το PSNR από 18.696 σε 20.357, και το SSIM από 0.517 σε 0.606. Επίσης, επιτεύχθηκαν τα υψηλότερα μετρικά Dice, 0.827 και 0.849, με Συνέπεια Αντικειμένου και Συνέπεια Φόντου να φτάνουν 0.926 και 0.932:

Αποτελέσματα της αρχικής ποσοτικής σύγκρισης ενάντια σε προηγούμενες προσεγγίσεις.

Αποτελέσματα της αρχικής ποσοτικής σύγκρισης ενάντια σε προηγούμενες προσεγγίσεις.

Το DFoT έφτασε στο 17.693 PSNR και το Context-as-Memory 18.921, με τα κέρδη να αποδίδονται στην τυποποίηση μνήμης σε συνδυασμό με τη δυναμική αναζήτηση προσοχής:

Ποσοτική σύγκριση που αντιπαρατέθηκε την HyDRA με το τρέχον status quo.

Ποσοτική σύγκριση που αντιπαρατέθηκε την HyDRA με το τρέχον status quo.

Σχετικά με τις δοκιμές ενάντια στο WorldPlay, οι συγγραφείς δηλώνουν:

‘Η μέθοδός μας ξεπερνά το WorldPlay σε όλα τα μετρικά, με μια αξιοσημείωτη διαφορά PSNR 5.502. Αν και το WorldPlay εμφανίζει χαμηλότερη απόδοση στα μετρικά GT-αναφοράς (π.χ. PSNR 14.855, DSCGT 0.832) λόγω του χάσματος κατανομής και έλλειψης ειδικής εκπαίδευσης, αποδεικνύει αξιοσημείωτη ανθεκτικότητα στα μετρικά контέκστου-αναφοράς με την επίτευξη DSCctx 0.822.

‘Αυτή η παρατήρηση όχι μόνο επιβεβαιώνει ότι εκτενώς εκπαιδευμένα μοντέλα κατέχουν δίκαιη υβριδική συνέπεια, αλλά επίσης έμμεσα επικυρώνει τη λογική της προτεινόμενης μας μετρικής DSC.

‘Τελικά, αυτά τα εντυπωσιακά αποτελέσματα υπογραμμίζουν τις εξαιρετικές ικανότητες του μοντέλου μας, αποδεικνύοντας την υπεροχή του ακόμη και έναντι καθιερωμένων εμπορικών μοντέλων.’

Το έγγραφο προσφέρει στατική αναπαράσταση ποιοτικών συγκρίσεων που αναλήφθηκαν για τις δοκιμές:

Ποιοτική σύγκριση εξόδου και επανεμφάνισης υπό κίνηση κάμερας. Οι συγγραφείς ισχυρίζονται ότι η HyDRA διατηρεί ταυτότητα αντικειμένου, στάση και συνέχεια κίνησης μετά την έξοδο και επανεμφάνιση από το πλαισιο, ταιριάζοντας στενά με την πραγματική απόδοση, ενώ ανταγωνιστικές μεθόδους εμφανίζουν διασπορά, ασυνέπεια κίνησης ή υποβάθμιση αντικειμένου, υπογραμμισμένα σε κόκκινο (συνεπείς ανακτήσεις σημειώνονται σε πράσινο).

Ποιοτική σύγκριση εξόδου και επανεμφάνισης υπό κίνηση κάμερας. Οι συγγραφείς ισχυρίζονται ότι η HyDRA διατηρεί ταυτότητα αντικειμένου, στάση και συνέχεια κίνησης μετά την έξοδο και επανεμφάνιση από το πλαισιο, ταιριάζοντας στενά με την πραγματική απόδοση, ενώ ανταγωνιστικές μεθόδους εμφανίζουν διασπορά, ασυνέπεια κίνησης ή υποβάθμιση αντικειμένου, υπογραμμισμένα σε κόκκινο (συνεπείς ανακτήσεις σημειώνονται σε πράσινο).

Από αυτά τα αποτελέσματα, οι συγγραφείς σχολιάζουν:

‘Στην περίπτωση σύνθετων εξόδου-εισόδου συμβάντων, η βάση και το Context-as-Memory εμφανίζουν σοβαρή διασπορά αντικειμένου και ασυνέπεια κίνησης. Το DFoT αποτυγχάνει να διατηρήσει την ακεραιότητα του αντικειμένου, οδηγώντας σε πλήρη εξαφάνιση. Ενώ το WorldPlay καταφέρνει να διατηρήσει τη συνέπεια της εμφάνισης του αντικειμένου, υποφέρει από τρεμόπαιξη και μη φυσικές ενέργειες.

‘Αντίθετα, η μέθοδός μας επιτυγχάνει να διατηρήσει υβριδική συνέπεια, διατηρώντας τόσο την ταυτότητα του αντικειμένου όσο και τη συνέχεια κίνησης μετά την επανεμφάνιση στο πλαισιο.’

Επιπλέον αποτελέσματα μπορούν να φανερωθούν σε μορφή βίντεο στο συμπληρωματικό ιστότοπο, από τα οποία τα πρώτα τέσσερα παραδείγματα έχουν συναρμολογηθεί (από εμάς) στο βίντεο παρακάτω:

Πατήστε για αναπαραγωγή. Τέσσερα από τα έξι δοκιμαστικά αποτελέσματα που παρουσιάζονται στον ιστότοπο του έργου. Πηγή 

Συμπέρασμα

Ενώ οποιαδήποτε απόπειρα να αντιμετωπίσει ένα από τα μεγαλύτερα προβλήματα της γεννήτριας βίντεο AI είναι ευπρόσδεκτη, φαίνεται αναπόφευκτο ότι η βέλτιστη λύση για ζητήματα εξόδου/εισόδου αυτού του είδους θα αποδειχθεί, όπως και με την CGI, στη μορφή διακριτών αναφορών που μπορούν να επεξεργαστούν και να εισαχθούν σε einen συνθέτη-χώρο.

Αυτό το ζήτημα προσπαθώντας να διατηρήσει μια εμφύτευση ζωντανή με έναν ad hoc και επί τόπου τρόπο φαίνεται εξαντλητικό, και δεν προσφέρει επίσης κανένα σαφές μέλλον για τη συνέπεια εντός λήψεων που προσφέρεται τώρα σε διάφορους μαύρους πύργους όπως το Runway. Αν αποδειχθεί ότι μια επόμενη λήψη θα χρειαστεί πρόσβαση στο λατινικό χώρο της προηγούμενης λήψης, γιατί να μην έχουν και τα δύο περιστατικά μια διακριτή και ξεχωριστή εμφύτευση χαρακτήρα;

 

* Κανείς άλλος δεν το έχει ονομάσει, και η συζήτηση είναι δύσκολη χωρίς κοινές ορολογίες.

** Τώρα αναφέρεται ως ‘ερχόμενη σύντομα’, στη σελίδα του έργου.

Πρώτη δημοσίευση Παρασκευή, 27 Μαρτίου 2026

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai