Η γωνία του Anderson
Ένας Νέος Μηχανισμός για Χρονικά Συνεπείς Σταθερές Διαχύσεις Βίντεο Χαρακτήρων

Μια νέα πρωτοβουλία από την Alibaba Group προσφέρει einen από τους καλύτερους τρόπους που έχω δει για τη δημιουργία πλήρως σωματικών ανθρώπινων अवταρών από ένα μοντέλο foundation Stable Diffusion.
Ονομάζεται MIMO (MIMicking με Object Interactions), το σύστημα χρησιμοποιεί eine σειρά από δημοφιλείς τεχνολογίες και μονάδες, συμπεριλαμβανομένων CGI-βασισμένων ανθρώπινων μοντέλων και AnimateDiff, για να ενεργοποιήσει χρονικά συνεπείς αντικατάσταση χαρακτήρων σε βίντεο – ή αλλιώς να οδηγήσει έναν χαρακτήρα με einen προκαθορισμένο σκελετικό πόση.
Εδώ βλέπουμε χαρακτήρες που.interpolate από μια単一ή εικόνα πηγή, και οδηγούμενοι από μια προκαθορισμένη κίνηση:
[Πατήστε το βίντεο παρακάτω για να το παίξετε]
[βίντεο πλάτος=”2160″ ύψος=”588″ mp4=”https://www.unite.ai/wp-content/uploads/2024/09/driving-3d-pose-site.mp4″][/βίντεο]
Από μονές εικόνες πηγή, τρεις διαφορετικοί χαρακτήρες οδηγούνται από μια 3D πόση ακολουθία (μακρυά αριστερά) χρησιμοποιώντας το σύστημα MIMO. Δείτε την ιστοσελίδα του έργου και το συνοδευτικό βίντεο στο YouTube (εμφανίζεται στο τέλος του άρθρου) για περισσότερα παραδείγματα και ανώτερη ανάλυση. Πηγή: https://menyifang.github.io/projects/MIMO/index.html
Γεννημένοι χαρακτήρες, οι οποίοι μπορούν επίσης να προέρχονται από καρέ βίντεο και σε διάφορους άλλους τρόπους, μπορούν να ενσωματωθούν σε πραγματικά βίντεο.
Το MIMO προσφέρει einen καινοτόμο μηχανισμό που γεννά τρεις διακριτές κωδικοποιήσεις, κάθε μια για χαρακτήρα, σκηνή και απόκρυψη (δηλαδή, matting, όταν κάποιο αντικείμενο ή πρόσωπο περνά μπροστά από τον χαρακτήρα που απεικονίζεται). Αυτές οι κωδικοποιήσεις ενσωματώνονται κατά τη διάρκεια της εύρεσης.
[Πατήστε το βίντεο παρακάτω για να το παίξετε]
[βίντεο πλάτος=”1000″ ύψος=”500″ mp4=”https://www.unite.ai/wp-content/uploads/2024/09/MIMO-SITE-EXAMPLES-AE.mp4″][/βίντεο]
Το MIMO μπορεί να αντικαταστήσει τους αρχικούς χαρακτήρες με φωτορεαλιστικούς ή στιλισμένους χαρακτήρες που ακολουθούν την κίνηση από το στόχο βίντεο. Δείτε την ιστοσελίδα του έργου και το συνοδευτικό βίντεο στο YouTube (εμφανίζεται στο τέλος του άρθρου) για περισσότερα παραδείγματα και ανώτερη ανάλυση.
Το σύστημα έχει εκπαιδευτεί πάνω στο μοντέλο Stable Diffusion V1.5, χρησιμοποιώντας einen προσαρμοσμένο dataset που έχει δημιουργηθεί από τους ερευνητές, και αποτελείται εξίσου από πραγματικά και προσομοιωμένα βίντεο.
Το μεγάλο πρόβλημα της διαχύσεως βίντεο είναι η χρονική σταθερότητα, όπου το περιεχόμενο του βίντεο είτε τρεμοπαίζει είτε «εξελίσσεται» με τρόπους που δεν είναι επιθυμητοί για συνεπή αναπαράσταση χαρακτήρων.
Το MIMO, αντίθετα, χρησιμοποιεί αποτελεσματικά μια單η εικόνα ως χάρτη για συνεπή καθοδήγηση, η οποία μπορεί να ορχηστρωθεί και να περιοριστεί από το μεσολαβικό SMPL CGI μοντέλο.
Εφόσον η πηγή αναφορά είναι συνεπής, και το βασικό μοντέλο πάνω στο οποίο έχει εκπαιδευτεί το σύστημα έχει ενισχυθεί με επαρκείς αντιπροσωπευτικές κινήσεις, οι ικανότητες του συστήματος για χρονικά συνεπή εξόδους είναι πάνω από τον γενικό стандарт για διαχύσεις अवταρών.
[Πατήστε το βίντεο παρακάτω για να το παίξετε]
[βίντεο πλάτος=”800″ ύψος=”400″ mp4=”https://www.unite.ai/wp-content/uploads/2024/09/More-Mimo-examples-AE.mp4″][/βίντεο]
Παραδείγματα χαρακτήρων MIMO που οδηγούνται από πόση. Δείτε την ιστοσελίδα του έργου και το συνοδευτικό βίντεο στο YouTube (εμφανίζεται στο τέλος του άρθρου) για περισσότερα παραδείγματα και ανώτερη ανάλυση.
Γίνεται όλο και πιο συχνό για μονές εικόνες να χρησιμοποιούνται ως πηγή για αποτελεσματικές νευρωνικές αναπαραστάσεις, είτε μεμονωμένα είτε σε einen πολυτροπικό τρόπο, σε συνδυασμό με κείμενο προrompt. Για παράδειγμα, το δημοφιλές LivePortrait σύστημα μεταφοράς προσώπου μπορεί επίσης να γεννήσει πολύ πιθανές deepfaked πρόσωπα από μονές εικόνες προσώπου.
Οι ερευνητές πιστεύουν ότι οι αρχές που χρησιμοποιούνται στο σύστημα MIMO μπορούν να επεκταθούν σε άλλους και καινοτόμους τύπους γεννητικών συστημάτων και πλαισίων.
Το νέο έγγραφο έχει τον τίτλο MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling, και προέρχεται από τέσσερις ερευνητές στο Institute for Intelligent Computing της Alibaba Group. Το έργο έχει eine βίντεο-φορτωμένη ιστοσελίδα του έργου και einen συνοδευτικό βίντεο στο YouTube, το οποίο είναι επίσης ενσωματωμένο στο τέλος του άρθρου.
Μέθοδος
Το MIMO επιτυγχάνει αυτόματη και ακαδημαϊκή διάκριση των τριών χωρικών συνιστωσών, σε eine ακαδημαϊκή αρχιτεκτονική (δηλαδή, όλα τα υπο-διαδικασίες είναι ενσωματωμένα στο σύστημα, και ο χρήστης χρειάζεται μόνο να παρέχει το εισαγόμενο υλικό).

Το концепτουαλικό σχήμα για το MIMO. Πηγή: https://arxiv.org/pdf/2409.16160
Αντικείμενα σε πηγαία βίντεο μεταφράζονται από 2D σε 3D, αρχικά χρησιμοποιώντας τον μονοπτικό εκτιμητή βάθους Depth Anything. Το ανθρώπινο στοιχείο σε κάθε καρέ εξάγεται με μεθόδους που προσαρμόζονται από το Tune-A-Video έργο.
Αυτά τα χαρακτηριστικά μεταφράζονται затем σε βίντεο-βασισμένα όγκους через την αρχιτεκτονική Segment Anything 2 της Facebook Research.
Η στρωματική στρώση herself λαμβάνεται με την αφαίρεση αντικειμένων που ανιχνεύονται στις άλλες δύο στρώσεις, παρέχοντας effectively eine rotoscope-στύλ μάσκα αυτόματα.
Για την κίνηση, ένα σύνολο εξαγμένων λατινικών κωδικών για το ανθρώπινο στοιχείο είναι αγκυροβόλητο σε ένα προκαθορισμένο ανθρώπινο CGI-βασισμένο SMPL μοντέλο, των οποίων οι κινήσεις παρέχουν το контέκστ για το αποδομένο ανθρώπινο περιεχόμενο.
Μια 2D χαρακτηριστική χάρτα για το ανθρώπινο περιεχόμενο λαμβάνεται από einen διαφορετικό ραστεριστή που προέρχεται από eine 2020 πρωτοβουλία από την NVIDIA. Συνδυάζοντας τα ληφθέντα 3D δεδομένα από το SMPL με τα 2D δεδομένα που λαμβάνονται από τη μέθοδο της NVIDIA, οι λατινικοί κώδικες που αντιπροσωπεύουν το «νευρωνικό άτομο» έχουν eine στενή αντιστοιχία με το τελικό контέκστ τους.
Σε αυτό το σημείο, είναι απαραίτητο να καθορίσετε eine κοινή αναφορά που χρειάζεται σε αρχιτεκτονικές που χρησιμοποιούν SMPL – eine κανωνική πόση. Αυτή είναι ευρέως παρόμοια με το «Vitruvian man» του Da Vinci, σε ότι αντιπροσωπεύει ένα μηδενικό-πόση πρότυπο που μπορεί να chấpδεχε περιεχόμενο και να το μεταμορφώσει, φέρνοντας το (πρακτικά) texture-χαρτογραφημένο περιεχόμενο μαζί του.
Αυτές οι μεταμορφώσεις, ή «αποκλίσεις από το κανονικό», αντιπροσωπεύουν ανθρώπινη κίνηση, ενώ το SMPL μοντέλο διατηρεί τους λατινικούς κώδικες που συνθέτουν την ανθρώπινη ταυτότητα που έχει εξαχθεί, και έτσι αντιπροσωπεύει το αποτέλεσμα avatar σωστά σε ότι αφορά πόση και υφή.

Παράδειγμα μιας κανονικής πόσης σε ένα SMPL μοντέλο. Πηγή: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264
Σχετικά με το ζήτημα της ενσωμάτωσης (το βαθμό στον οποίο τα εκπαιδευμένα δεδομένα μπορούν να αποδειχθούν άκαμπτα όταν τα εκτείνετε πέρα από τα εκπαιδευμένα τους περιγράμματα και συνδέσεις), οι συγγραφείς δηλώνουν*:
‘Για να αποσυνδέσετε πλήρως την εμφάνιση από τις πόσεις βίντεο, eine ιδανική λύση είναι να μάθετε την δυναμική ανθρώπινη αναπαράσταση από το μονοπτικό βίντεο και να τη μετατρέψετε από το χώρο πόσης στο κανονικό χώρο.
‘Λαμβάνοντας υπόψη την αποτελεσματικότητα, χρησιμοποιούμε eine απλοποιημένη μέθοδο που μετατρέπει απευθείας την πόση ανθρώπινη εικόνα στο κανονικό αποτέλεσμα χρησιμοποιώντας einen προ-εκπαιδευμένο ανθρώπινο repose μοντέλο. Η συνθετική κανονική εμφάνιση εικόνας τροφοδοτείται στους ID κωδικοποιητές για να ληφθεί ο κωδικός ταυτότητας.
‘Αυτή η απλή σχεδίαση ermöglicht πλήρη αποσύνδεση της ταυτότητας και των ιδιοτήτων κίνησης. Ακολουθώντας [Animate Anyone], οι ID κωδικοποιητές περιλαμβάνουν einen CLIP εικόνα κωδικοποιητή και μια αρχιτεκτονική αναφοράς για να ενσωματώσουν το συνολικό και τοπικό χαρακτηριστικό, [αντίστοιχα].’
Για τις σκηνές και τις απόκρυψεις, χρησιμοποιείται eine κοινή και σταθερή Αυτο-κωδικοποιητής (VAE – σε αυτήν την περίπτωση προερχόμενος από eine 2013 δημοσίευση) για να ενσωματώσει τις σκηνές και τις απόκρυψεις στο λατινικό χώρο. Οι ασυμφωνίες χειρίζονται από eine εικόνα inpainting μέθοδο από το 2023 ProPainter έργο.
Μόλις συναρμολογηθούν και ανακαινισθούν με αυτόν τον τρόπο, και το φόντο και οποιαδήποτε απόκρυψη αντικείμενα στο βίντεο θα παρέχουν eine μάσκα για το κινούμενο ανθρώπινο avatar.
Αυτές οι αποσυντεθειμένες ιδιότητες τότε τροφοδοτούνται σε eine U-Net πλάτη βασισμένο στην αρχιτεκτονική Stable Diffusion V1.5. Ο πλήρης κώδικας σκηνής είναι συγχρονισμένος με το εγγενές λατινικό θόρυβο του συστήματος. Το ανθρώπινο στοιχείο είναι ενσωματωμένο μέσω αυτο-προσοχής και δια-προσοχής στρώσεων, αντίστοιχα.
Τότε, το απο-θορυβωμένο αποτέλεσμα είναι εξόδου μέσω του VAE αποκωδικοποιητή.
Δεδομένα και Δοκιμές
Για την εκπαίδευση, οι ερευνητές δημιούργησαν ένα ανθρώπινο βίντεο dataset με τίτλο HUD-7K, το οποίο αποτελούνταν από 5.000 πραγματικά χαρακτήρα βίντεο και 2.000 συνθετικά animations που δημιουργήθηκαν από το En3D σύστημα. Τα πραγματικά βίντεο δεν χρειάζονταν καμία αναnotation, λόγω της μη σεμαντικής φύσης των διαδικασιών εξαγωγής σχημάτων στο MIMO. Τα συνθετικά δεδομένα ήταν πλήρως αναnotated.
Το μοντέλο εκπαιδεύτηκε σε οκτώ NVIDIA A100 GPUs (αν και το έγγραφο δεν αναφέρει αν αυτά ήταν τα 40GB ή 80GB VRAM μοντέλα), για 50 επαναλήψεις, χρησιμοποιώντας 24 βίντεο καρέ και einen μπατς μέγεθος του четырех, μέχρι συνέργεια.
Το module κίνησης για το σύστημα εκπαιδεύτηκε στα βάρη του AnimateDiff. Κατά τη διάρκεια της εκπαιδευτικής διαδικασίας, τα βάρη του VAE κωδικοποιητή/αποκωδικοποιητή και του CLIP εικόνας κωδικοποιητή ήταν παγωμένα (σε αντίθεση με πλήρη λεπτο-ρυθμισμό, ο οποίος θα είχε einen πολύ ευρύτερο αποτέλεσμα σε ένα foundation μοντέλο).
Αν και το MIMO δεν δοκιμάστηκε ενάντια σε ανалогικά συστήματα, οι ερευνητές το δοκίμασαν σε δυσκολές out-of-distribution κινήσεις ακολουθίες που προέρχονται από AMASS και Mixamo. Αυτές οι κινήσεις περιελάμβαναν αναρρίχηση, παιχνίδι και χορό.
Επίσης, το σύστημα δοκιμάστηκε σε βίντεο ανθρώπων στο wild. Σε ambas περιπτώσεις, το έγγραφο αναφέρει «υψηλή αντοχή» για αυτές τις απρόβλεπτες 3D κινήσεις, από διαφορετικές οπτικές γωνίες.
Αν και το έγγραφο προσφέρει πολλά στατικά εικόνα αποτελέσματα που δείχνουν την αποτελεσματικότητα του συστήματος, η πραγματική απόδοση του MIMO αξιολογείται καλύτερα με τα εκτενέα βίντεο αποτελέσματα που παρέχονται στην ιστοσελίδα του έργου και στο βίντεο του YouTube που είναι ενσωματωμένο παρακάτω (από το οποίο τα βίντεο στην αρχή του άρθρου έχουν ληφθεί).
Οι συγγραφείς συμπεραίνουν:
‘Πειραματικά αποτελέσματα [δείχνουν] ότι η μέθοδός μας ermöglicht όχι μόνο ευέλικτη χαρακτήρα, κίνηση και σκηνή ελέγχου, αλλά και προηγμένη κλιμάκωση σε τυχαίους χαρακτήρες, γενικότητα σε νέες 3D κινήσεις, και εφαρμοσιμότητα σε διαδραστικές σκηνές.
‘Πιστεύουμε επίσης ότι η λύση μας, η οποία λαμβάνει υπόψη την εγγενή 3D φύση και αυτόματα κωδικοποιεί το 2D βίντεο σε ιεραρχικές χωρικές συνιστώσες, μπορεί να εμπνεύσει μελλοντικές έρευνες για 3D-ενήμερη βίντεο σύνθεση.
‘Επιπλέον, το πλαίσιο μας δεν είναι μόνο κατάλληλο για τη δημιουργία χαρακτήρων βίντεο, αλλά μπορεί επίσης να προσαρμοστεί σε άλλες ελέγχου βίντεο σύνθεση εργασίες.’
Συμπέρασμα
Είναι αναζωογονητικό να δούμε ένα σύστημα avatar που βασίζεται στη Stable Diffusion που φαίνεται ικανό για τέτοια χρονική σταθερότητα – όχι μόνο γιατί οι Gaussian Avatars φαίνεται να κερδίζουν το υψηλότερο έδαφος σε αυτόν τον συγκεκριμένο ερευνητικό τομέα.
Οι στιλισμένοι avatars που αντιπροσωπεύονται στα αποτελέσματα είναι αποτελεσματικοί, και ενώ το επίπεδο φωτορεαλισμού που μπορεί να παραγάγει το MIMO δεν είναι目前 ίσο με αυτό που είναι ικανό το Gaussian Splatting, οι διάφοροι πλεονεκτήματα της δημιουργίας χρονικά συνεπών ανθρώπων σε einen σεμαντικά-βασισμένο Latent Diffusion Network (LDM) είναι σημαντικά.
* Η μετατροπή των εσωτερικών αναφορών των συγγραφέων σε υπερ-σύνδεσμους, και όπου απαιτείται, εξωτερικούς εξηγητικούς υπερ-σύνδεσμους.
Πρώτη δημοσίευση Τετάρτη, 25 Σεπτεμβρίου 2024












