Η γωνία του Anderson

Καλύτερη Γεννητική Ιντελιγένσια Βίντεο με Ανακατεύθυνση Πλαισίων Κατά τη Διαδικασία Εκπαίδευσης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Adobe Firefly, various prompts and edits.

Μια νέα εργασία που κυκλοφόρησε αυτή την εβδομάδα στο Arxiv αντιμετωπίζει ένα ζήτημα που όλοι όσοι έχουν υιοθετήσει το Hunyuan Video ή Wan 2.1 γεννήτορες βίντεο AI θα έχουν συναντήσει μέχρι τώρα: χρονικές αναταραχές, όπου η γεννητική διαδικασία έχει την τάση να επιταχύνει απότομα, να συγχωνεύει, να παραλείπει ή να διαταράσσει άλλως σημαντικά σημεία σε μια γεννημένη βίντεο:

Πατήστε για αναπαραγωγή. Κάποια από τις χρονικές δυσλειτουργίες που γίνονται ολοένα και πιο οικείες στους χρήστες των νέων γεννητικών συστημάτων βίντεο, υπογραμμισμένες στην νέα εργασία. Στη δεξιά πλευρά, η ανακουφιστική επίδραση της νέας προσέγγισης FluxFlow. Πηγή: https://haroldchen19.github.io/FluxFlow/

Το βίντεο παραπάνω περιλαμβάνει αποσπάσματα από παραδείγματα βίντεο σε (προειδοποίηση: khá χαотική) ιστοσελίδα του έργου για την εργασία. Μπορούμε να δούμε διάφορα ολοένα και πιο οικεία ζητήματα που αντιμετωπίζονται από τη μέθοδο των συγγραφέων (εικονιζόμενο στη δεξιά πλευρά στο βίντεο), η οποία είναι στην ουσία μια τεχνική προεπεξεργασίας του συνόλου δεδομένων που μπορεί να εφαρμοστεί σε οποιαδήποτε αρχιτεκτονική γεννητικού βίντεο.

Στο πρώτο παράδειγμα, που απεικονίζει ‘δύο παιδιά που παίζουν με μια μπάλα’, που παράγεται από CogVideoX, βλέπουμε (στην αριστερή πλευρά στο βίντεο και στο συγκεκριμένο παράδειγμα παρακάτω) ότι η εγγενής γεννήτρια ταξίδεψε γρήγορα μέσω πολλών απαραίτητων μικροκινήσεων, επιταχύνοντας τη δραστηριότητα των παιδιών σε ένα ‘καρτούν’ στυλ. Αντίθετα, το ίδιο σύνολο δεδομένων και η μέθοδος παράγουν καλύτερα αποτελέσματα με τη νέα τεχνική προεπεξεργασίας, που ονομάζεται FluxFlow (στη δεξιά πλευρά της εικόνας στο βίντεο παρακάτω):

Πατήστε για αναπαραγωγή.

Στο δεύτερο παράδειγμα (χρησιμοποιώντας NOVA-0.6B) βλέπουμε ότι μια κεντρική κίνηση που αφορά μια γάτα έχει με κάποιο τρόπο διαταραχθεί ή υποδειγματίσει σημαντικά στο στάδιο της εκπαίδευσης, μέχρι το σημείο που το γεννητικό σύστημα γίνεται ‘παραλυμένο’ και δεν μπορεί να κάνει το αντικείμενο να κινηθεί:

Πατήστε για αναπαραγωγή.

Αυτό το σύνδρομο, όπου η κίνηση ή το αντικείμενο ‘κολλάει’, είναι ένα από τα πιο συχνά αναφερόμενα προβλήματα του HV και του Wan, στις διάφορες ομάδες σύνθεσης εικόνων και βίντεο.

Ορισμένα από αυτά τα προβλήματα σχετίζονται με ζητήματα υποτιτλισμού βίντεο στο σύνολο δεδομένων, τα οποία εξετάσαμε αυτή την εβδομάδα. Tuy nhiên, οι συγγραφείς της νέας εργασίας εστιάζουν τις προσπάθειές τους στις χρονικές ιδιότητες των δεδομένων εκπαίδευσης και κάνουν ένα πειστικό επιχείρημα ότι η αντιμετώπιση των προκλήσεων από αυτή την οπτική μπορεί να αποφέρει χρήσιμα αποτελέσματα.

Όπως αναφέρθηκε στην προηγούμενη εργασία σχετικά με τον υποτιτλισμό βίντεο, ορισμένα αθλήματα είναι ιδιαίτερα δύσκολα να αποσταλούν σε κρίσιμες στιγμές, με αποτέλεσμα τα κρίσιμα γεγονότα (όπως ένα σλαμ-ντάνκ) να μην λαμβάνουν την προσοχή που χρειάζονται κατά την εκπαίδευση:

Πατήστε για αναπαραγωγή.

Στο παραπάνω παράδειγμα, το γεννητικό σύστημα δεν ξέρει πώς να φτάσει στο επόμενο στάδιο της κίνησης και μεταβαίνει αλογικά από μια στάση στην επόμενη, αλλάζοντας την στάση και τη γεωμετρία του παίκτη κατά τη διαδικασία.

Αυτές είναι μεγάλες κινήσεις που χάθηκαν κατά την εκπαίδευση – αλλά εξίσου ευάλωτες είναι πολύ μικρότερες αλλά κρίσιμες κινήσεις, όπως η κίνηση των πτερύγων ενός πεταλούδας:

Πατήστε για αναπαραγωγή.

Αντίθετα με το σλαμ-ντάνκ, η κίνηση των πτερύγων δεν είναι ένα ‘σπάνιο’ αλλά μάλλον ένα συνεχές και μονότονο γεγονός. Tuy nhiên, η συνέχεια του χάνεται στη διαδικασία δειγματοληψίας, επειδή η κίνηση είναι τόσο γρήγορη που είναι πολύ δύσκολο να καθοριστεί χρονικά.

Αυτά τα ζητήματα δεν είναι ιδιαίτερα νέα, αλλά λαμβάνουν μεγαλύτερη προσοχή τώρα που ισχυρά γεννητικά μοντέλα βίντεο είναι διαθέσιμα για τους ενθουσιώδεις για τοπική εγκατάσταση και ελεύθερη γεννήτρια.

Οι κοινότητες στο Reddit και Discord έχουν αρχικά αντιμετωπίσει αυτά τα ζητήματα ως ‘σχετικά με τον χρήστη’. Αυτό είναι μια κατανοητή υπόθεση, επειδή τα συστήματα που αναφέρονται είναι πολύ νέα και ελάχιστα τεκμηριωμένα. Έτσι, διάφοροι εμπειρογνώμονες έχουν προτείνει διάφορες (και όχι πάντα αποτελεσματικές) θεραπείες για κάποια από τις δυσλειτουργίες που τεκμηριώνονται εδώ, όπως η αλλαγή των ρυθμίσεων σε διάφορα συστατικά των διαφόρων τύπων ComfyUI εργοστασίων για Hunyuan Video (HV) και Wan 2.1.

Σε ορισμένες περιπτώσεις, αντί να παράγουν ταχεία κίνηση, και τα HV και Wan θα παράγουν αργή κίνηση. Προτάσεις από το Reddit και το ChatGPT (το οποίο αξιοποιεί σε μεγάλο βαθμό το Reddit) περιλαμβάνουν αλλαγή του αριθμού των πλαισίων στην αιτούμενη γεννήτρια, ή ριζική μείωση του ρυθμού καρέ*.

Αυτό είναι όλα απελπισμένα πράγματα. Η αναδυόμενη αλήθεια είναι ότι δεν ξέρουμε ακόμη την ακριβή αιτία ή το ακριβές αντίδοτο για αυτά τα ζητήματα. Είναι φανερό ότι η ταλαιπωρία των ρυθμίσεων γεννήτριας για να εργαστεί γύρω από αυτά (ιδιαίτερα όταν αυτό μειώνει την ποιότητα εξόδου, για παράδειγμα με ένα πολύ χαμηλό ρυθμό καρέ) είναι μόνο ένα προσωρινό μέτρο, και είναι καλό να δούμε ότι η ερευνητική σκηνή αντιμετωπίζει αυτές τις αναδυόμενες προκλήσεις τόσο γρήγορα.

Έτσι, εκτός από την εξέταση του υποτιτλισμού βίντεο αυτή την εβδομάδα, ας δούμε την νέα εργασία σχετικά με την χρονική κανονικοποίηση και τις βελτιώσεις που μπορεί να προσφέρει στη τρέχουσα γεννητική σκηνή βίντεο.

Η κεντρική ιδέα είναι bastante απλή και ήπια, και δεν είναι χειρότερη για αυτό. Tuy nhiên, η εργασία είναι κάπως γεμάτη για να φτάσει τις οκτώ σελίδες, και θα παραλείψουμε αυτή τη γεμάτη ως αναγκαίο.

Το ψάρι στη φυσική γεννήτρια του πλαισίου VideoCrafter είναι στατικό, ενώ η FluxFlow-τροποποιημένη έκδοση καταγράφει τις απαραίτητες αλλαγές. Πηγή: https://arxiv.org/pdf/2503.15417

Το ψάρι στη φυσική γεννήτρια του πλαισίου VideoCrafter είναι στατικό, ενώ η FluxFlow-τροποποιημένη έκδοση καταγράφει τις απαραίτητες αλλαγές. Πηγή: https://arxiv.org/pdf/2503.15417

Η νέα εργασία ονομάζεται Χρονική Κανονικοποίηση Κάνει τον Γεννήτρια Βίντεο Σας Ισχυρότερο, και προέρχεται από οκτώ ερευνητές σε Everlyn AI, Πανεπιστήμιο Επιστημών και Τεχνολογίας του Χονγκ Κονγκ (HKUST), Πανεπιστήμιο της Κεντρικής Φλόριντα (UCF) και Πανεπιστήμιο του Χονγκ Κονγκ (HKU).

(στην ώρα της γραφής, υπάρχουν κάποια ζητήματα με την ιστοσελίδα του έργου που συνοδεύει την εργασία)

FluxFlow

Η κεντρική ιδέα πίσω από FluxFlow, το νέο σχήμα προ-εκπαίδευσης των συγγραφέων, είναι να υπερβεί τα διαδεδομένα προβλήματα φlickering και χρονική ασυνέπεια με την ανακατεύθυνση μπλοκ και ομάδων μπλοκ στη χρονική σειρά πλαισίων κατά την εκπαίδευση:

Η κεντρική ιδέα πίσω από FluxFlow είναι να μετακινήσει μπλοκ και ομάδες μπλοκ σε απρόσμενες και μη χρονικές θέσεις, ως一种 μορφή δεδομένων增強.

Η κεντρική ιδέα πίσω από FluxFlow είναι να μετακινήσει μπλοκ και ομάδες μπλοκ σε απρόσμενες και μη χρονικές θέσεις, ως一种 μορφή δεδομένων增強.

Η εργασία εξηγεί:

‘[Αρτεφάκτα] προέρχονται από μια θεμελιώδη περιορισμό: παρά την αξιοποίηση μεγάλων συνόλων δεδομένων, τα τρέχοντα μοντέλα συχνά βασίζονται σε απλοποιημένα χρονικά μοτίβα στα δεδομένα εκπαίδευσης (π.χ. σταθερές κατευθύνσεις περπατήματος ή επαναλαμβανόμενες μεταβάσεις πλαισίων) αντί να μάθουν ποικίλες και πιθανές χρονικές δυναμικές.

‘Αυτό το ζήτημα ενισχύεται από την έλλειψη ρητής χρονικής αυξανόμενης κατά την εκπαίδευση, αφήνοντας τα μοντέλα ευάλωτα σε υπερ-προσαρμογή σε ψευδείς χρονικές συσχετίσεις (π.χ. “το πλαισίο #5 πρέπει να ακολουθήσει το #4”) αντί να γενικεύουν σε διάφορες κινήσεις.’

Τα περισσότερα μοντέλα γεννήτριας βίντεο, οι συγγραφείς εξηγούν, εξακολουθούν να δανείζονται πολύ από σύνθεση εικόνων, εστιάζοντας στην πιστότητα του χώρου ενώ αγνοούν σε μεγάλο βαθμό τον χρονικό άξονα. Αν και τεχνικές όπως το κούρεμα, το αναστροφή και η χρωματική δόνηση έχουν βοηθήσει να βελτιώσουν την ποιότητα των στατικών εικόνων, δεν είναι επαρκείς λύσεις όταν εφαρμόζονται σε βίντεο, όπου η ψευδαίσθηση της κίνησης εξαρτάται από συνεχείς μεταβάσεις μεταξύ πλαισίων.

Τα αντίστοιχα προβλήματα περιλαμβάνουν φликερίσματα υφών, ακατάλληλες κοπές μεταξύ πλαισίων και επαναλαμβανόμενες ή υπερβολικά απλές μοτίβα κίνησης.

Πατήστε για αναπαραγωγή.

Η εργασία επιχειρηματολογεί ότι αν και κάποια μοντέλα – συμπεριλαμβανομένων Stable Video Diffusion και LlamaGen – αντισταθμίζουν με ολοένα και πιο σύνθετες αρχιτεκτονικές ή μηχανικές περιορισμούς, αυτά έρχονται με ένα κόστος σε όρους υπολογισμού και ευελιξίας.

Καθώς η χρονική αυξανόμενη έχει ήδη αποδείξει χρήσιμη σε εργασίες κατανόησης βίντεο (σε πλαισια όπως FineCliper, SeFAR και SVFormer) είναι εκπληκτικό, οι συγγραφείς ισχυρίζονται, ότι αυτή η τακτική σπάνια εφαρμόζεται σε einen γεννητικό контекスト.

Διαταρακτική Συμπεριφορά

Οι ερευνητές υποστηρίζουν ότι απλές, δομημένες διαταραχές στη χρονική σειρά κατά την εκπαίδευση βοηθούν τα μοντέλα να γενικεύουν καλύτερα σε πραγματικές, ποικίλες κινήσεις:

‘Με την εκπαίδευση σε διαταραγμένες ακολουθίες, ο γεννήτρια μαθαίνει να ανακτά πιθανές τροχιές, αποτελεσματικά κανονικοποιώντας τη χρονική εντροπία. Η FluxFlow γεφυρώνει το χάσμα μεταξύ διακριτικών και γεννητικών χρονικών αυξανόμενων, προσφέροντας μια λύση ενίσχυσης για τη γεννήτρια βίντεο που είναι χρονικά πιθανή, ενώ βελτιώνει την tổngική ποιότητα.

‘Αντίθετα με τις υπάρχουσες μεθόδους που εισάγουν αρχιτεκτονικές αλλαγές ή βασίζονται σε μετα-επεξεργασία, η FluxFlow λειτουργεί απευθείας στο επίπεδο δεδομένων, εισάγοντας ελεγχόμενες χρονικές διαταραχές κατά την εκπαίδευση.’

Πατήστε για αναπαραγωγή.

Οι διαταραχές σε επίπεδο πλαισίου, οι συγγραφείς δηλώνουν, εισάγουν λεπτομερείς διαταραχές μέσα σε μια ακολουθία. Αυτή η διαταραχή δεν είναι πολύ διαφορετική από αυξανόμενη μάσκας, όπου τμήματα δεδομένων μπλοκαρίζονται τυχαία, για να αποτρέψουν το σύστημα υπερ-προσαρμογή σε δεδομένα σημεία, και να ενθαρρύνουν καλύτερη γενίκευση.

Δοκιμές

Αν και η κεντρική ιδέα εδώ δεν φτάνει σε μια πλήρη εργασία, λόγω της απλότητάς της, Tuy nhiên, υπάρχει ένα τμήμα δοκιμών που μπορούμε να εξετάσουμε.

Οι συγγραφείς ε-tested για τέσσερις ερωτήσεις σχετικά με τη βελτίωση της χρονικής ποιότητας ενώ διατηρούν την πιστότητα του χώρου. η ικανότητα να μάθουν δυναμικές κίνησης/οπτικής ροής. τη διατήρηση της χρονικής ποιότητας σε εξωτερική γεννήτρια. και την ευαισθησία σε βασικά υπερπαράμετρα.

Οι ερευνητές εφαρμόστηκαν την FluxFlow σε τρεις γεννητικές αρχιτεκτονικές: U-Net-βασισμένες, στην μορφή VideoCrafter2. DiT-βασισμένες, στην μορφή CogVideoX-2B. και AR-βασισμένες, στην μορφή NOVA-0.6B.

Για δίκαιη σύγκριση, έκαναν fine-tuning τις αρχικές αρχιτεκτονικές με την FluxFlow ως μια πρόσθετη φάση εκπαίδευσης, για ένα epoch, στο OpenVidHD-0.4M σύνολο δεδομένων.

Τα μοντέλα αξιολογήθηκαν έναντι δύο δημοφιλών βεντσών: UCF-101. και VBench.

Για το UCF, χρησιμοποιήθηκαν τα Fréchet Video Distance (FVD) και Inception Score (IS) μετρικά. Για το VBench, οι ερευνητές εστιάστηκαν στη χρονική ποιότητα, την ποιότητα πλαισίου και την tổngική ποιότητα.

Ποσοτική αρχική αξιολόγηση της FluxFlow-Frame.

Ποσοτική αρχική αξιολόγηση της FluxFlow-Frame. "+ Original" υποδηλώνει εκπαίδευση χωρίς FLUXFLOW, ενώ "+ Num × 1" δείχνει διαφορετικές ρυθμίσεις FluxFlow-Frame. Τα καλύτερα αποτελέσματα είναι σκιωμένα. τα δεύτερα καλύτερα είναι υπογραμμισμένα για κάθε μοντέλο.

Σχολιάζοντας αυτά τα αποτελέσματα, οι συγγραφείς δηλώνουν:

‘Και η FLUXFLOW-FRAME και η FLUXFLOW-BLOCK βελτιώνουν σημαντικά τη χρονική ποιότητα, όπως φαίνεται από τα μετρικά στοιχεία στα Πίνακες 1, 2 (δηλ. FVD, Subject, Flicker, Motion, και Dynamic) και ποιοτικά αποτελέσματα σε [εικόνα παρακάτω].

‘Για παράδειγμα, η κίνηση του οχήματος στο VC2, η γάτα που κυνηγάει την ουρά της στο NOVA, και ο σέρφερ που καβαλάει ένα κύμα στο CVX γίνονται πιο ρευστά με την FLUXFLOW. Είναι σημαντικό ότι αυτές οι χρονικές βελτιώσεις επιτυγχάνονται χωρίς να θυσιάζουν την πιστότητα του χώρου, όπως φαίνεται από τις οξυές λεπτομέρειες των σπλάχνων νερού, των καπνικών ιχνημάτων και των υφών κύματος, μαζί με μετρικά στοιχεία πιστότητας χώρου και tổngικής πιστότητας.’

Κάτω από την εικόνα βλέπουμε επιλογές από τα ποιοτικά αποτελέσματα που αναφέρουν οι συγγραφείς (παρακαλούμε δείτε την αρχική εργασία για πλήρη αποτελέσματα και καλύτερη ανάλυση):

Επιλογές από τα ποιοτικά αποτελέσματα.

Επιλογές από τα ποιοτικά αποτελέσματα.

Η εργασία υποδηλώνει ότι ενώ και οι διαταραχές σε επίπεδο πλαισίου και σε επίπεδο μπλοκ βελτιώνουν τη χρονική ποιότητα, οι διαταραχές σε επίπεδο πλαισίου τείνουν να εκτελούν καλύτερα. Αυτό αποδίδεται στη λεπτότερη τους γρανάζι, η οποία επιτρέπει πιο ακριβείς χρονικές ρυθμίσεις. Οι διαταραχές σε επίπεδο μπλοκ, από την άλλη πλευρά, μπορεί να εισαγάγουν θόρυβο λόγω των στενά συνδεδεμένων χωρικών και χρονικών μοτίβων μέσα στα μπλοκ, μειώνοντας την αποτελεσματικότητά τους.

Συμπέρασμα

Αυτή η εργασία, μαζί με τη συνεργασία Bytedance-Tsinghua υποτιτλισμού που κυκλοφόρησε αυτή την εβδομάδα, έχει κάνει σαφές ότι τα φαινομενικά ελαττώματα στα νέα γεννητικά μοντέλα βίντεο μπορεί να μην οφείλονται σε λάθη του χρήστη, θεσμικές παραλείψεις ή περιορισμούς χρηματοδότησης, αλλά μάλλον σε μια ερευνητική εστίαση που έχει προτεραιότητα σε πιο επείγουσες προκλήσεις, όπως η χρονική συνάφεια και η συνέπεια, πάνω από αυτά τα δευτερεύοντα ζητήματα.

Μέχρι πρόσφατα, τα αποτελέσματα από ελεύθερα διαθέσιμα και ληψίμα γεννητικά συστήματα βίντεο ήταν τόσο ατελή που δεν υπήρχε μεγάλο εστιασμό προσπάθειας από την κοινότητα των ενθουσιωδών για να αντιμετωπιστούν τα ζητήματα (όχι τουλάχιστον επειδή τα ζητήματα ήταν θεμελιώδη και όχι εύκολα λυσιμάτα).

Τώρα που είμαστε τόσο κοντά στην προβλεπόμενη εποχή της καθαρώς AI-γεννημένης φωτορεαλιστικής εξόδου βίντεο, είναι σαφές ότι και η ερευνητική και η κοινή κοινότητα λαμβάνουν einen βαθύτερο και πιο παραγωγικό ενδιαφέρον για την επίλυση των υπολοιπόμενων ζητημάτων. με τύχη, αυτά δεν είναι ακατανίκητα εμπόδια.

 

* Ο εγγενής ρυθμός καρέ του Wan είναι ένα φτωχό 16fps, και σε απάντηση στα δικά μου ζητήματα, σημειώνω ότι τα φόρουμ έχουν προτείνει τη μείωση του ρυθμού καρέ σε τόσο χαμηλά όσο 12fps, και στη συνέχεια χρησιμοποιώντας FlowFrames ή άλλα AI-βασισμένα συστήματα ανα-ροής για την παρεμβολή των κενών μεταξύ ενός τόσο σπάνιου αριθμού πλαισίων.

Πρώτη δημοσίευση Παρασκευή, 21 Μαρτίου 2025

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]