Η γωνία του Anderson
Προς τη Διαρκή Πλήρη-Σώματος Βαθιά Ψεύτικη Βίντεο Γεννήτρια

Σε ένα πεδίο όπου απαιτείται υπομονή, ένα νέο σύστημα μας οδηγεί λίγο πιο κοντά στη ζωντανοβόληση ανθρώπινης προσομοίωσης χωρίς εξοργιστικές στροφές απόδοσης.
Η κατάσταση της τέχνης στη πλήρη-μιάς-σώματος ανθρώπινη προσομοίωση έχει προχωρήσει πολύ από τότε που η δυνατότητα των πλήρων-σώματος βαθιά ψεύτικων πρώτη εμφανίστηκε το 2022. Μέχρι τώρα έχουμε συνηθίσει στην επιβλητική και συχνά αμφιλεγόμενη ικανότητα των ανοιχτών πηγών συστημάτων όπως Wan-Animate, και κλειστών πηγών συστημάτων όπως Grok, να μετατρέπουν μια ή πολλές εικόνες σε μια συνεπή και συχνά μεταμορφωτική βίντεο απόδοση:
Πατήστε για αναπαραγωγή αν είναι απαραίτητο. Παραδείγματα αντικατάστασης προσώπου με WanAnimate-2.2. Παρακαλώ αναφερθείτε στην πηγή για καλύτερη ανάλυση. Πηγή
Επιπλέον, το παλαιότερο αυτο-κωδικοποιητή-βασισμένο ζωντανοβόλησης πρόσωπου βαθιά ψεύτικη πλαίσιο DeepFaceLive έχει υπερκεραστεί από πιο εξελιγμένα πλαίσια όπως Deep-Live-Cam, το οποίο αξιοποιεί μια ορχήστρα LivePortrait επαναλήψεων, καθώς και κλασικά GAN και InsightFace ενότητες, για να δημιουργήσει έναν αποτελεσματικό διάδοχο του (τώρα εγκαταλελειμμένου) DFLive έργου:
Πατήστε για αναπαραγωγή: Ο Elon Musk βαθιά ψεύτικος σε μια ζωντανοβόληση βίντεο μέσω Deep-Live-Cam. Παρακαλώ αναφερθείτε στην πηγή για καλύτερη ανάλυση. Πηγή
Ωστόσο, ενώ τα πλαίσια όπως το Deep-Live-Cam μπορούν να τρέξουν για πάντα και να ψεύδουν για πάντα, και αν και είναι καλύτερα στην παραγωγή σκληρών γωνιών προσώπου από ό,τι ήταν πριν, τα αποτελέσματα είναι ωστόσο περιορισμένα όσον αφορά την ανάλυση και την ικανότητα:
BRB…
Η πλειοψηφία των τρεχουσών συστημάτων ανθρώπινης προσομοίωσης είναι επίσης περιορισμένα και/ή «ειδικευμένα». Ένας συγκεκριμένος, επαναλαμβανόμενος περιορισμός είναι ότι τα καλύτερα συστήματα ανθρώπινης προσομοίωσης/μιμήσεως είναι αποθηκευμένα – δηλαδή, είναι πολύ απαιτητικά σε πόρους για να λειτουργήσουν σε πραγματικό χρόνο, και αντίθετα χρειάζονται να φύγουν, να υπολογίσουν την λύση, και να παρουσιάσουν το αποτέλεσμα στο χρήστη αργότερα.
Προφανώς, τέτοια συστήματα δεν είναι κατάλληλα για ζωντανοβόληση AI μεταμόρφωση, όπως η μεταμόρφωση ολόκληρης σειράς σώματος, όπως η χορός, σε μια ζωντανοβόληση.
Ένα παράδειγμα αυτού τα τελευταία χρόνια είναι το ανοιχτό-βαρών Wan2.2. Animate, το οποίο αποδείχθηκε ένα χτύπημα με την κοινότητα των χομπί και των επαγγελματιών πωλητών – αλλά και πάλι, είναι ένα σενάριο «γεννήστε και περιμένετε»:
Πατήστε για αναπαραγωγή. Από το 2025, παραδείγματα των εντυπωσιακών ικανοτήτων του Wan2.2-Animate – αν μπορείτε να περιμένετε λίγο. Παρακαλώ αναφερθείτε στην πηγή για καλύτερη ανάλυση. Πηγή
Οπότε, όπως είναι τώρα, μπορείτε να το έχετε υπέροχο, να το έχετε ποικίλο, ή να το έχετε τώρα – επιλέξτε δύο.
LiveAnimate
Σε αυτό το μεξικανικό αδιέξοδο έρχεται μια νέα προσφορά από την Κίνα, η οποία μετατρέπει αποτελεσματικά το Wan2.2 Animate σε ένα ζωντανοβόλησης-ωδηγούμενο πλαίσιο λειτουργίας,目前 σε μια σεβαστική近-20fps, με εντυπωσιακά αποτελέσματα σε eine σειρά σενариών:
Πατήστε για αναπαραγωγή: Από τον ιστότοπο του έργου, το LiveAnimate μεταφέρει τις οδηγούμενες στάσεις σε στάδια χορού, εξωτερικές πλήρεις-σώματος και κοντινές πορτρέτα, αναπαράγοντας ολόκληρη σώματος, χέρι και κινήσεις προσώπου. Παρακαλώ αναφερθείτε στην πηγή για καλύτερη ανάλυση. Πηγή
Το νέο έργο επεκτείνει το αρχικό σύστημα σε μια ζωντανοβόλησης-ικανή έκδοση, αλλάζοντας πώς παράγεται το βίντεο:
Επιτυχώς, το σύστημα διατηρεί τις προηγούμενες πλαισιώσεις ως一种 μέθοδο μνήμης για να διατηρήσει την εμφάνιση του υποκειμένου σταθερή για μεγάλα διαστήματα.
Αν και ένα LoRA εμπλέκεται στο στάδιο επεξεργασίας, το LiveAnimate δεν είναι απλά ένα άλλο LoRA σύστημα – η ζωντανοβόλησης-γεννήτρια, το σύστημα μνήμης/κρυφής, τα τρία-βήματα-συμπέρασμα και οι βελτιώσεις GPU αντιπροσωπεύουν πρόσθετες μηχανισμούς, πάνω στα πολλά άλλα τεχνολογικά (μερικά εκπληκτικά παλιά) στο ρεπερτόριό του.
Το νέο σύστημα μπορεί να αντιμετωπίσει όχι μόνο πλήρεις-σώματος οδηγούμενες σενάρια, όπως αυτά στα παραπάνω παραδείγματα, αλλά και ανώτερα-σώματος κινήσεις, όπως σε σενάρια συνεντεύξεων:
Πατήστε για αναπαραγωγή. ‘Λεπτές κινήσεις κεφαλής και χεριών σε ένα στατικό γραφείο’.
Για να είναι δίκαιος σχετικά με τις περιορισμούς του, η νέα εργασία παραδέχεται ότι δύο από τα αντίπαλα πλαίσια που δοκιμάστηκαν ενάντια στο LiveAnimate ήταν σε θέση να διατηρήσουν την ταυτότητα ελαφρώς καλύτερα σε ορισμένες συγκεκριμένες περιπτώσεις· ότι όμως, κανένα από τα αντίπαλα δεν είναι ένα online αντί για offline σύστημα, και οι συγγραφείς της νέας εργασίας είναι σαφώς πιέζοντας τα όρια σε μια πιθανή και αισιόδοξη κατεύθυνση.
Επιπλέον, μπορεί να αξίζει να σημειωθεί ότι η συμπέρασμα απαιτεί δύο H100 NVIDIA GPUs, για ένα σύνολο 160GB VRAM*.
Η εργασία αναφέρει:
‘Το LiveAnimate διατηρεί σχεδόν σταθερή αισθητική ποιότητα και ταυτότητα από τα πρώτα 30 δευτερόλεπτα μέχρι το τέλος [λεπτό], ενώ τα προηγούμενα συστήματα χειροτερεύουν σημαντικά ή απαιτούν ώρες offline υπολογισμού για την ίδια εκτέλεση.
‘Αυτά τα αποτελέσματα καθιερώνουν einen νέο λειτουργικό σημείο σε ποιότητα, καθυστέρηση και διάρκεια για διαδραστική πλήρης-σώματος animation’.
Η νέα εργασία έχει τον τίτλο LiveAnimate: Σταθερή Μακροχρόνια Ζωντανοβόληση Ανθρώπινης Animation σε Πραγματικό Χρόνο, και προέρχεται από εννέα συγγραφείς από το Chinese University of Hong Kong, Qwen Applications Business Group of Alibaba, και Liblib AI. Ένας ιστότοπος έργου, πλήρης με τα βίντεο που επίσης εμφανίζονται σε αυτό το άρθρο, είναι διαθέσιμος, ενώ ο κώδικας είναι ‘ερχόμενη σύντομα’, και τα βάρη… ποιος ξέρει;
Method
Το LiveAnimate αποτελείται από μια δι-στάδιο εκπαίδευσης διαδικασία που σχεδιάστηκε για να κάνει το Wan2.2-Animate να παράγει συνεχώς και γρήγορα, ακολουθούμενη από ένα σύστημα μνήμης που ανακτά χρήσιμες προηγούμενες στάσεις καθώς παράγεται κάθε νέο μπλοκ βίντεο:

Μια επισκόπηση της διαδικασίας LiveAnimate, που δείχνει την δι-στάδιο εκπαίδευσης στη gauche και ζωντανοβόληση στη δεξιά, όπου οι εισερχόμενοι στάσεις αντιστοιχούν με αποθηκευμένες προηγούμενες στάσεις και συνδυάζονται με πρόσφατες πλαισιώσεις για να παράγουν κάθε νέο μπλοκ βίντεο σε τρία βήματα. Πηγή
Το αρχικό Wan2.2-Animate είναι σχεδιασμένο για να εξετάσει μια ολόκληρη ακολουθία αντί να παράγει μια ατελείωτη βίντεο. Για αυτό, οι συγγραφείς χώρισαν τα βίντεο εκπαίδευσης σε διαδοχικά μπλοκ, με κάθε uno που παράγεται χρησιμοποιώντας προηγούμενα μπλοκ ως контекст/ground truth. Αυτό αρχικά διδάσκει το μοντέλο να συνεχίσει από αξιόπιστα προηγούμενο υλικό, πριν πρέπει να αντιμετωπίσει σφάλματα που συσσωρεύονται από την δική του έξοδο.
Forget Me Not
Κατά τη διάρκεια αυτής της διαδικασίας, η αρχική εικόνα αναφοράς διατηρείται μόνιμα διαθέσιμη μέσω ενός ‘Ref Sink’, παρέχοντας μια σταθερή υπενθύμιση της ταυτότητας και της εμφάνισης του ατόμου. Μόλις ολοκληρωθεί ένα μπλοκ, ένα ‘Clean KV Update’ μετατρέπει πληροφορίες που λαμβάνονται από αυτό σε ιστορικό контекστ για επόμενα μπλοκ (αν και αυτό δεν επιδιορθώνει υπάρχοντα σφάλματα).
Αυτό το πρώτο στάδιο εκπαίδευσης ακόμα απαιτεί 50 denoising βήματα ανά μπλοκ, καθιστώντας τη ζωντανοβόληση λειτουργία ακατόρθωτη. Το δεύτερο στάδιο λοιπόν αποσταξυμονίζει τη διαδικασία σε τρία βήματα, ενώ εκθέτει το μοντέλο στην δική του γεννημένη ιστορία,既然 η ανάπτυξη απαιτεί κάθε νέο τμήμα να εξαρτάται από ατελή προηγούμενη έξοδο:

Τα δύο στάδια εκπαίδευσης† που χρησιμοποιούνται για να προετοιμάσουν το LiveAnimate για ανάπτυξη, πρώτα μαθαίνοντας από καθαρές προηγούμενες βίντεο μπλοκ – στη συνέχεια μειώνοντας την γεννήτρια σε τρία βήματα, ενώ εκπαιδεύοντας στο δικό του ατελή έξοδο.
Η εκπαίδευση ενάντια σε αυτές τις αυτο-γεννημένες ακολουθίες παρουσιάζει ένα άλλο πρόβλημα,既然 η διατήρηση ολόκληρης της υπολογιστικής ιστορίας του βίντεο θα ήταν απαγορευτικά ακριβή. Αντίθετα, μια ολοκληρωμένη πρακτική εκτέλεση γίνεται, στη συνέχεια επαναλαμβάνεται, ένα μπλοκ κάθε φορά, για εκπαίδευση. Κάθε μπλοκ μπορεί λοιπόν να λάβει μια ενημέρωση χωρίς να διατηρεί ολόκληρη την ακολουθία υπολογιστικά ‘ζωντανοβόληση’.
Συνδυασμένο με LoRA προσαρμογή, αυτό επιτρέπει το 14-δισεκατομμύριο-παράμετρο μοντέλο να αποσταχθεί σε ένα μόνο κόμβο που περιέχει οκτώ 80GB H100 GPUs (σημειώνοντας ότι αυτό το cluster είναι για εκπαίδευση, όχι runtime συμπέρασμα).
Don’t Stop Now
Για ατελείωτη γεννήτρια, το LiveAnimate πρέπει επίσης να αποφασίσει τι είναι αξιοθρήνητο να θυμάται. Διατηρώντας όλα θα έκανε τις απαιτήσεις επεξεργασίας να εκραγούν εκτός ελέγχου· αλλά διατηρώντας μόνο πρόσφατες πλαισιώσεις μπορεί επίσης να απορρίψει χρήσιμες προηγούμενες απόψεις.
Για αυτό, Pose-Retrieval Sink Attention (PR-Sink) αντιμετωπίζει αυτό, διατηρώντας το πρώτο γεννημένο μπλοκ ως μόνιμο ‘Static Sink’ – μια σχετική προηγούμενη στάση, λειτουργώντας ως αντικαταστάσιμο ‘Dynamic Sink’, και ένα κυλιόμενο παράθυρο που περιέχει το τρέχον και τα δύο προηγούμενα μπλοκ. Η εικόνα αναφοράς παραμένει ξεχωριστά διαθέσιμη μέσω του Ref Sink, ενώ σταθερές μεγέθη αποθήκευσης αποτρέπουν τα κόστη από το να αυξάνονται καθώς η διάρκεια του βίντεο αυξάνεται.
Block Wars
Για να επιλέξει παλαιότερες στάσεις για αυτήν τη σχετικά περιορισμένη μνήμη, ViTPose μειώνει σώματος και χεριών θέσεις σε τρεις πλαισιώσεις σε μια συμπαγή αναπαράσταση. Η μνήμη-τράπεζα περιέχει πέντε τέτοιες αναπαραστάσεις, και γεμίζει κατά τη διάρκεια των πρώτων 20 μπλοκ, προτιμώντας ποικίλες στάσεις από gần-απλοποιήσεις.
Κατά τη διάρκεια της γεννήτριας, η εισερχόμενη στάση συγκρίνεται με αυτές τις αναπαραστάσεις και η πιο κοντινή αντιστοίχηση ανακτά, παρέχοντας προηγούμενη απόδειξη για το πώς το άτομο φαινόταν σε μια παρόμοια θέση. Ωστόσο, το αμέσως-προηγούμενο μπλοκ εξαιρείται,既然 ήδη υπάρχει στο κυλιόμενο παράθυρο, αφήνοντας το Dynamic Sink ελεύθερο να ανακτά πληροφορίες από πιο πίσω.
Τέλος, η runtime είναι βελτιστοποιημένη για ταχύτητα με τη διανομή της προσοχής επεξεργασίας σε δύο H100 GPUs, την επικάλυψη της επικοινωνίας με την επεξεργασία, και την επαναχρησιμοποίηση της αποθηκευμένης πληροφορίας όπου είναι δυνατό.
Δεδομένα και Τεστ
Το LiveAnimate εκπαιδεύτηκε σε 40.000 ομιλίες βίντεο από AVSpeech, και 20.000 ανθρώπινης-κίνησης βίντεο από TikTok dataset και HumanVid, με εκπαίδευση και συμπέρασμα που υποστηρίζουν ανάλυσεις 480×480; 384×672; και 672×384 pixels.
Η εκπαίδευση ξεκίνησε από το Wan2.2-Animate-14B base checkpoint, χρησιμοποιώντας LoRA με rank 128, και προχώρησε σε οκτώ NVIDIA H100 GPUs για 10.000 βήματα στο πρώτο στάδιο, και 20.000 στο δεύτερο.
Το βίντεο παράχθηκε σε μπλοκ τριών.latent πλαισιώσεων (η εσωτερική αναπαράσταση του μοντέλου), που αντιστοιχούν σε 12 RGB πλαισιώσεις, ενώ το συμπέρασμα πραγματοποιήθηκε στα δύο H100s.
Η αξιολόγηση σύγκρινε το LiveAnimate με υπάρχοντα στάσεων-ωδηγούμενα ανθρώπινης-animation μεθόδους σε cả σύντομες και μακρές ακολουθίες, χρησιμοποιώντας εικόνες αναφοράς και οδηγούμενες στάσεις σε συνεπείς ρυθμίσεις. Μακροχρόνιες δοκιμές επέκτειναν τη γεννήτρια σε τρία λεπτά για να εξετάσουν εάν η ποιότητα και η ταυτότητα παρέμειναν σταθερές με το χρόνο.
Τα πλαίσια που δοκιμάστηκαν ήταν EverAnimate; One-to-All; SCAIL††; UniAnimate-DiT; και Wan2.2-Animate.
Οι μετρήσεις που χρησιμοποιήθηκαν καλύπτουν οπτική ποιότητα, συνεπή ταυτότητα, κατανομική ποιότητα και χρονική αναπαράσταση σφάλματος. Αισθητική Bewertung (ASE) και no-reference Image-Quality Bewertung (IQA) μετρούν πλαισιο-επίπεδο οπτική ποιότητα; DINO, ομοιότητα (DINO-S), και εμφάνιση συνεπή με την εικόνα αναφοράς; Fréchet Inception Distance (FID), κατανομική ποιότητα; και VideoMAE feature distance (V-MAE), πώς καλά το γεννημένο βίντεο διατηρεί την κίνηση με το χρόνο:

Αποτελέσματα δοκιμών που αφορούν ποιότητα και ταυτότητα σε τρία λεπτά συνεχούς γεννήτριας, με το LiveAnimate που παραμένει συγκριτικά σταθερό σε όλα τα πέντε μετρήσεις καθώς η ακολουθία προχωρά. Κάποια αντίπαλα μεθόδους δείχνουν μεγαλύτερη επιδείνωση με το χρόνο. Υψηλότερες αναγνώσεις είναι καλύτερες για IQA, ASE, και DINO-S, με χαμηλότερες αναγνώσεις καλύτερες για FID και V-MAE.
Όπως φαίνεται στο αρχικό γράφημα αποτελεσμάτων παραπάνω, το LiveAnimate πέτυχε την υψηλότερη αρχική ASE 2.823, και IQA 4.047, στα πρώτα 30 δευτερόλεπτα. Οι συγγραφείς ισχυρίζονται ότι αυτό υποδηλώνει ότι η τρι-βήματη αποσταξυμωνία διατηρεί την αισθητική ποιότητα, παρά την μειωμένη inference προϋπολογισμό.
Περισσότερο σημαντικά, το LiveAnimate έδειξε μικρή επιδείνωση κατά τη διάρκεια τριών λεπτών συνεχούς γεννήτριας, με τις οπτικές-ποιότητας και ταυτότητας-συνέπειας σκορ να παραμένουν σχεδόν αμετάβλητα.
Αντίθετα, το One-to-All επιδείνωσε σημαντικά με το χρόνο, με χαμηλότερη οπτική ποιότητα και ταυτότητα-συνέπεια και υψηλότερο κατανομικό σφάλμα; και η βάση Wan2.2-Animate cũng έδειξε κάποια απώλεια ταυτότητας-συνέπειας.
Οι συγγραφείς αναφέρουν:
‘Αυτές οι τάσεις υποστηρίζουν την κεντρική μας αξίωση ότι η ρητή διαχείριση μακρο-πρόθεσμου контекστ είναι σημαντική για streaming animation’.
Η κλιμάκωση-αποτελεσματικότητα του LiveAnimate δοκιμάστηκε επίσης σε GPUs. Όπως φαίνεται παρακάτω, 12.41 FPS επιτεύχθηκε με ένα H100; 19.63 FPS με δύο; και 22.13 FPS με τέσσερα, με τα κέρδη που αυξάνονται όλο και περισσότερο περιορισμένα από την επικοινωνιακή υπερβολική φόρτωση. Δύο H100s επιλέχθηκαν ως η προτιμώμενη ρύθμιση:

Κλιμάκωση-αποτελεσματικότητα σε ένα, δύο και τέσσερα H100 GPUs σε ανάλυση 480×480, που δείχνει καθυστέρηση, frame rate, ταχύτητα και αποτελεσματικότητα. Δύο GPUs πέτυχαν 19.63 FPS, ενώ η περαιτέρω κλιμάκωση σε τέσσερα παρήγαγε μόνο μια μετρίως αύξηση σε 22.13 FPS.
Σε 19.63 FPS, κάθε 12-πλαισιο-μπλοκ παράχθηκε σε 0.611 δευτερόλεπτα. Σε σύγκριση, περίπου 2–5 ώρες απαιτήθηκαν από τα αντίπαλα συστήματα για να παράγουν την ίδια τρι-λεπτή ακολουθία.
Ποιοτικές δοκιμές ανέβηκαν σε παρόμοιες διαφορές: στο πλήρες-σώματος δοκιμή που δείχνεται παρακάτω, σοβαρή επιδείνωση παρατηρήθηκε στο One-to-All; τρεμόπαιγμα παράχθηκε από το UniAnimate-DiT και SCAIL; και αργότερα χρωματική ή φόντο-παρέκκλιση έγινε εμφανής με το Wan-Animate και EverAnimate.

Αποτελέσματα δοκιμών που συγκρίνουν πλήρες-σώματος animation σε τρία λεπτά. Πλαισιώσεις δείχθηκαν κάθε 20 δευτερόλεπτα, με κόκκινες σημειώσεις που υπογραμμίζουν μακρο-πρόθεσμες επιδείνωσης σε αντίπαλα μεθόδους. Οι βασικές απαιτούσαν περίπου 2–5 ώρες για να παράγουν την ακολουθία, σε σύγκριση με περίπου τέσσερα λεπτά για το LiveAnimate. Παρακαλώ αναφερθείτε στην πηγή για καλύτερη ανάλυση.
Το LiveAnimate διατήρησε την εμφάνιση του υποκειμένου και της γύρω σκηνής καθ’ όλη τη διάρκεια της τρι-λεπτής ακολουθίας. Στην λιγότερο απαιτητική ανώτερη-σώματος δοκιμή που δείχνεται παρακάτω, συγκρίσιμη μακρο-πρόθεσμη σταθερότητα επιτεύχθηκε από το EverAnimate και το LiveAnimate (αν και η ζωντανοβόληση-γεννήτρια παρέχθηκε μόνο από το LiveAnimate):

Αποτελέσματα δοκιμών που συγκρίνουν ανώτερη-σώματος animation σε τρία λεπτά. Πλαισιώσεις δείχθηκαν κάθε 20 δευτερόλεπτα, που δείχνουν το LiveAnimate να διατηρεί την ταυτότητα, το ρούχο και το σκοτεινό φόντο πιο συνεπώς από τις αντίπαλες μεθόδους.
Οι συγγραφείς καταλήγουν:
‘Στο τρι-λεπτό benchmark, το LiveAnimate διατηρεί σχεδόν σταθερή αισθητική ποιότητα και ταυτότητα σε 19.63 FPS σε δύο H100 GPUs, με μνήμη και καθυστέρηση ανεξάρτητες από τη διάρκεια της ροής, ενώ τα offline αντίπαλα συστήματα επιδείνωνονται ορατά ή απαιτούν ώρες υπολογισμού.
‘Αυτά τα αποτελέσματα φέρνουν δισεκατομμύρια-κλίμακας βίντεο-διασπορά μοντέλα εντός φάσματος διαδραστικών εφαρμογών όπως ζωντανοβόληση, τηλε-παρουσία και εικονικά άβατα’.
Συμπέρασμα
Είναι ενθαρρυντικό να δούμε ένα ωδηγούμενο-γεννήτρια πλαίσιο να λαμβάνει μια νέα προσέγγιση στα επιμένουσες προβλήματα της μνήμης και της ταυτότητας που ταλαιπωρούν τη γεννήτρια βίντεο. Υπάρχουν ήδη πολλά γεννήτρια-πλαίσια που μπορούν να αναφερθούν σε σταθερές εικόνες που παρέχονται από το χρήστη, χωρίς την ανάγκη να ‘κολλήσουν’ την εικόνα αναφοράς στο ζωντανοβόληση-περιεχόμενο.
Ωστόσο, αυτό μόνο λύνει κάποια από τα προβλήματα της γεννήτριας ενός μεμονωμένου βίντεο-κλιπ, όπως η διατήρηση της ταυτότητας (συμπεριλαμβανομένου του ρούχου και του στυλ μαλλιών) ενός ατόμου που επανεμφανίζεται στο κάδρο, ή έχει γίνει προσωρινά αποκρυμμένο, και στη συνέχεια είναι ορατό ξανά. Μέχρι τώρα, μόνο η βαρέα και ενοχλητική LoRA προσέγγιση έχει κάνει κάποια πρόοδο με αυτά τα ζητήματα, αν και περιορισμένα και προσωρινά.
Για το βίντεο, και στην πραγματικότητα για ολόκληρη την τρέχουσα AI επανάσταση, η ανάπτυξη αποτελεσματικής μνήμης είναι ένα κρίσιμο, υπαρξιακό ζήτημα – ένα που θα ορίσει τη διαφορά μεταξύ της έλευσης της AGI, ή ενός τρίτου AI-χειμώνα.
* Είναι αυτό ένα ‘gotcha’ nữa; Η τρέχουσα σκέψη είναι ότι μικρότερα, εξειδικευμένα μοντέλα μπορεί να τρέξουν τοπικά, χωρίς ενοίκιο, ενώ υψηλότερες ανάγκες εξυπηρετούνται από μια ανταγωνιστική και ελπιδοφόρα GPU-ενοικίαση αγορά. Αυτό υποθέτει ότι οι εταιρείες-πρόνοιας αποτυγχάνουν να EEE τον ανταγωνισμό, και ότι σημαντική GPU-υπολογιστική παραμένει διαθέσιμη ανεξάρτητα. Σε αυτή τη βάση, δεν θεωρώ πλέον τις απαιτήσεις GPU ως μιαν ελάττωμα, αλλά ελπίζω ότι η πρόσβαση θα γίνει όλο και περισσότερο δημοκρατική, και ότι μεταγενέστερες βελτιώσεις θα μειώσουν τις αρχικές απαιτήσεις πόρων.
† Αυτό-γεννημένο και ελεγχόμενο από εμένα.
†† Για μακρο-πρόθεσμες δοκιμές, το SCAIL και το UniAnimate-DiT επεκτάθηκαν με την ίδια εκπαίδευση-ελεύθερη ολισθηρή-παράθυρο διαδικασία,既然 κανένα από αυτά δεν υποστηρίζει φυσικά μακρο-πρόθεσμες γεννήτρια. Το EverAnimate και το One-to-All αξιολογήθηκαν χρησιμοποιώντας τις δικές τους μακρο-πρόθεσμες γεννήτρια-μεθόδους.
Πρώτη δημοσίευση Πέμπτη, 13 Αυγούστου 2026












