Η γωνία του Anderson

Προς την Ολική Έλεγχο στην Γεννήτρια Βίντεο AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
ChatGPT-4o, Adobe Firefly: lower right, imagery from the paper FullDiT: Multi-Task Video Generative Foundation Model with Full Attention (https://arxiv.org/pdf/2503.19907)

Τα μοντέλα βίντεο ιδρυμάτων όπως το Hunyuan και το Wan 2.1, αν και ισχυρά, δεν προσφέρουν στους χρήστες τον είδος του ελέγχου που απαιτεί η παραγωγή ταινιών και τηλεόρασης (ιδιαίτερα η παραγωγή VFX).

Στα επαγγελματικά στούντιο οπτικών εφέ, τα ανοιχτά μοντέλα όπως αυτά, μαζί με τα προηγούμενα μοντέλα εικόνας (αντί για βίντεο) όπως το Stable Diffusion, το Kandinsky και το Flux, χρησιμοποιούνται συνήθως μαζί με eine σειρά από εργαλεία που προσαρμόζουν την πρωτότυπη έξοδο για να ανταποκρίνεται σε συγκεκριμένες δημιουργικές ανάγκες. Όταν ένας σκηνοθέτης λέει, “Αυτό φαίνεται καλό, αλλά μπορείτε να το κάνετε λίγο πιο [n]?” δεν μπορείτε να απαντήσετε ότι το μοντέλο δεν είναι αρκετά ακριβές για να χειριστεί τέτοιες αιτήσεις.

Αντίθετα, μια ομάδα AI VFX θα χρησιμοποιήσει μια σειρά από παραδοσιακές τεχνικές CGI και σύνθεσης, συμμαχισμένες με προσαρμοσμένες διαδικασίες και ροές εργασίας που έχουν αναπτυχθεί με τον καιρό, για να προσπαθήσουν να推 την σύνθεση βίντεο λίγο πιο μακριά.

Με ανάλογο τρόπο, ένα μοντέλο βίντεο ιδρυμάτων είναι πολύ σαν μια προεπιλογή εγκατάστασης ενός web browser όπως το Chrome· κάνει πολλά εξ ού και απλά, αλλά αν θέλετε να προσαρμοστεί στις ανάγκες σας, αντί να κάνετε το αντίστροφο, θα χρειαστείτε κάποια πρόσθετα.

Έλεγχος Φρενών

Στον κόσμο της διάχυσης εικόνας, το πιο σημαντικό τέτοιο σύστημα τρίτων είναι το ControlNet.

Το ControlNet είναι μια τεχνική για την προσθήκη δομημένου ελέγχου σε γεννητικά μοντέλα διάχυσης, επιτρέποντας στους χρήστες να οδηγούν την γεννήτρια εικόνας ή βίντεο με πρόσθετες εισόδους όπως χάρτες ακμής, χάρτες βάθους ή πληροφορίες στάσης.

εικόνα (πρώτη σειρά), σεμαντική διαίρεση->εικόνα (κάτω αριστερά) και οδηγούμενη από στάση γεννήτρια εικόνας ανθρώπων και ζώων (κάτω αριστερά).” width=”779″ height=”422″ /> Οι διάφορες μέθοδοι του ControlNet επιτρέπουν βάθος->εικόνα (πρώτη σειρά), σεμαντική διαίρεση->εικόνα (κάτω αριστερά) και οδηγούμενη από στάση γεννήτρια εικόνας ανθρώπων και ζώων (κάτω αριστερά).

Αντί να βασίζονται αποκλειστικά σε κείμενο προτύπωση, το ControlNet εισάγει ξεχωριστές νευρωνικές διακλαδώσεις, ή προσαρμογείς, που επεξεργάζονται αυτά τα σήματα κατάστασης ενώ διατηρούν τις γεννητικές ικανότητες του βασικού μοντέλου.

Αυτό επιτρέπει τις εξευγενισμένες εξόδους που συμμορφώνονται πιο στενά με τις προδιαγραφές του χρήστη, καθιστώντας το ιδιαίτερα χρήσιμο σε εφαρμογές όπου απαιτείται ακριβής σύνθεση, δομή ή έλεγχος κίνησης:

Με μια οδηγούμενη στάση, μπορεί να ληφθεί eine ποικιλία ακριβών τύπων εξόδου μέσω του ControlNet. Πηγή: https://arxiv.org/pdf/2302.05543

Με μια οδηγούμενη στάση, μπορεί να ληφθεί eine ποικιλία ακριβών τύπων εξόδου μέσω του ControlNet. Πηγή: https://arxiv.org/pdf/2302.05543

Ωστόσο, τα πλαίσια προσαρμογέων αυτού του είδους λειτουργούν εξωτερικά σε ένα σύνολο νευρωνικών διαδικασιών που είναι πολύ εσωτερικά εστιασμένες. Αυτές οι προσεγγίσεις έχουν beberapa μειονεκτήματα.

Πρώτον, οι προσαρμογείς εκπαιδεύονται ανεξάρτητα, οδηγώντας σε συγκρούσεις διακλαδώσεων όταν συνδυάζονται πολλαπλοί προσαρμογείς, που μπορεί να οδηγήσει σε μειωμένη ποιότητα γεννήτριας.

Δεύτερον, εισάγουν πλεονασμό παραμέτρων, απαιτώντας επιπλέον υπολογισμό και μνήμη για κάθε προσαρμογέα, καθιστώντας την κλιμάκωση αναποτελεσματική.

Τρίτον, παρά την ευελιξία τους, οι προσαρμογείς συχνά παράγουν υποβελτιστοποιημένα αποτελέσματα σε σύγκριση με μοντέλα που είναι πλήρως επιμελημένα για πολλαπλή γεννήτρια.

Ιδανικά, οι ικανότητες του ControlNet θα εκπαιδεύονταν εγγενώς στο μοντέλο, με einen modulaire τρόπο που θα μπορούσε να φιλοξενήσει μεταγενέστερες και πολύ αναμενόμενες καινοτομίες όπως η ταυτόχρονη γεννήτρια βίντεο/ήχου ή οι ιθαγενείς ικανότητες lip-sync (για εξωτερικό ήχο).

Ως खडει, κάθε επιπλέον κομμάτι λειτουργικότητας αντιπροσωπεύει είτε μια εργασία μετά-παραγωγής είτε μια μη ιθαγενή διαδικασία που πρέπει να πλοηγηθεί μέσα στα στενά και ευαίσθητα βάρη του οποιοδήποτε μοντέλου ιδρυμάτων πάνω στο οποίο λειτουργεί.

FullDiT

Σε αυτή τη στάση έρχεται μια νέα προσφορά από την Κίνα, που υποστηρίζει ένα σύστημα όπου τα μέτρα του ControlNet ενσωματώνονται απευθείας σε ένα γεννητικό μοντέλο βίντεο κατά την εκπαίδευση, αντί να θεωρούνται ως μια μετάνοια.

Από το νέο έγγραφο: η προσέγγιση FullDiT μπορεί να ενσωματώσει επιβολή ταυτότητας, βάθος και κίνηση κάμερας σε μια ιθαγενή γεννήτρια, και μπορεί να καλέσει οποιαδήποτε συνδυασμό αυτών ταυτόχρονα. Πηγή: https://arxiv.org/pdf/2503.19907

Από το νέο έγγραφο: η προσέγγιση FullDiT μπορεί να ενσωματώσει επιβολή ταυτότητας, βάθος και κίνηση κάμερας σε μια ιθαγενή γεννήτρια, και μπορεί να καλέσει οποιαδήποτε συνδυασμό αυτών ταυτόχρονα. Πηγή: https://arxiv.org/pdf/2503.19907

Με τον τίτλο FullDiT, η νέα προσέγγιση συνδυάζει πολλαπλά συνθήκες εργασιών όπως η μεταφορά ταυτότητας, η χαρτογράφηση βάθους και η κίνηση κάμερας σε einen ενιαίο μέρος ενός εκπαιδευμένου γεννητικού μοντέλου βίντεο, για το οποίο οι συγγραφείς έχουν παράγει ένα πρωτότυπο εκπαιδευμένο μοντέλο και συνοδευτικά βίντεο-κλιπ σε μια ιστοσελίδα έργου.

Στο παρακάτω παράδειγμα, βλέπουμε γεννήτρια που ενσωματώνουν κίνηση κάμερας, πληροφορίες ταυτότητας και κείμενο (δηλ. οδηγούμενο από το χρήστη κείμενο προτύπωση):

Πατήστε για αναπαραγωγή. Παραδείγματα ελέγχου χρήστη με μόνο ένα ιθαγενές εκπαιδευμένο μοντέλο ιδρυμάτων. Πηγή: https://fulldit.github.io/

Πρέπει να σημειωθεί ότι οι συγγραφείς δεν προτείνουν το πειραματικό εκπαιδευμένο μοντέλο τους ως一个 λειτουργικό μοντέλο ιδρυμάτων, αλλά ως απόδειξη концепτού για ιθαγενή μοντέλα κειμένου-προς-βίντεο (T2V) και εικόνας-προς-βίντεο (I2V) που προσφέρουν στους χρήστες περισσότερο έλεγχο από ένα απλό προτύπωμα εικόνας ή κειμένου.

Επειδή δεν υπάρχουν παρόμοια μοντέλα αυτού του είδους ακόμη, οι ερευνητές δημιούργησαν einen νέο βεληνεκέ για την αξιολόγηση πολλαπλών εργασιών βίντεο, και ισχυρίζονται την κορυφαία απόδοση σε δοκιμές που έχουν σχεδιαστεί εναντίον προηγούμενων προσεγγίσεων. Ωστόσο, поскольку ο FullBench σχεδιάστηκε από τους ίδιους τους συγγραφείς, η αντικειμενικότητά του είναι ανεξέταστη, και το σύνολο δεδομένων των 1.400 περιπτώσεων μπορεί να είναι πολύ περιορισμένο για ευρύτερες συμπεράσματα.

Πιθανότατα το πιο ενδιαφέρον μέρος της αρχιτεκτονικής που το έγγραφο προτείνει είναι η δυνατότητά του να ενσωματώσει νέους τύπους ελέγχου. Οι συγγραφείς δηλώνουν:

‘Σε αυτό το έργο, εξερευνούμε μόνο συνθήκες ελέγχου της κάμερας, ταυτότητας και πληροφοριών βάθους. Δεν διερευνήσαμε περαιτέρω άλλες συνθήκες και modalities όπως ήχος, ομιλία, σημείο-σύννεφο, οριοθέτηση αντικειμένων, οπτική ροή, κ.λπ. Αν και ο σχεδιασμός του FullDiT μπορεί να ενσωματώσει εύκολα άλλες modalities με ελάχιστη τροποποίηση αρχιτεκτονικής, το πώς να προσαρμόσετε γρήγορα και οικονομικά υπάρχοντα μοντέλα σε νέες συνθήκες και modalities είναι ακόμη ένα σημαντικό ερώτημα που απαιτεί περαιτέρω διερεύνηση.’

Αν και οι ερευνητές παρουσιάζουν το FullDiT ως ένα βήμα προς τα εμπρός στη γεννήτρια βίντεο πολλαπλών εργασιών, πρέπει να θεωρηθεί ότι αυτό το νέο έργο βασίζεται σε υπάρχουσες αρχιτεκτονικές παρά να εισάγει einen θεμελιωδώς νέο парадίγματος.

Ωστόσο, το FullDiT βρίσκεται目前 ως ένα μοντέλο βίντεο ιδρυμάτων με ‘σκληρά κωδικοποιημένα’ μέτρα ελέγχου τύπου ControlNet – και είναι καλό να δούμε ότι η προτεινόμενη αρχιτεκτονική μπορεί να φιλοξενήσει μεταγενέστερες καινοτομίες επίσης.

Πατήστε για αναπαραγωγή. Παραδείγματα ελέγχου κάμερας από την ιστοσελίδα του έργου.

Το νέο έγγραφο έχει τον τίτλο FullDiT: Μοντέλο γεννήτριας βίντεο πολλαπλών εργασιών με πλήρη προσοχή, και προέρχεται από εννέα ερευνητές σε διάφορες εταιρείες και το Πανεπιστήμιο του Χονγκ Κονγκ. Η σελίδα του έργου είναι εδώ και τα νέα δεδομένα βεληνεκέ είναι εδώ.

Μέθοδος

Οι συγγραφείς ισχυρίζονται ότι η ενιαία μηχανισμός προσοχής του FullDiT επιτρέπει ισχυρότερη εκμάθηση αναπαράστασης δια modałities, καταγράφοντας τόσο χωρικές όσο και χρονικές σχέσεις μεταξύ συνθηκών:

Σύμφωνα με το νέο έγγραφο, το FullDiT ενσωματώνει πολλαπλά входικά δεδομένα μέσω πλήρους αυτοπροσοχής, μετατρέποντάς τα σε μια ενιαία ακολουθία. Σε αντίθεση, τα μοντέλα με προσαρμογείς (αριστερά) χρησιμοποιούν ξεχωριστά 모듈ά για κάθε είσοδο, οδηγώντας σε πλεονασμό, συγκρούσεις και ασθενέστερη απόδοση. Σύμφωνα με το νέο έγγραφο, το FullDiT ενσωματώνει πολλαπλά входικά δεδομένα μέσω πλήρους αυτοπροσοχής, μετατρέποντάς τα σε μια ενιαία ακολουθία. Σε αντίθεση, τα μοντέλα με προσαρμογείς (αριστερά) χρησιμοποιούν ξεχωριστά 모

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai