Μοντέλα και πλατφόρμες AI
MagicDance: Πραγματιστική Μεταφορά Ανθρώκινης Κίνησης σε Βίντεο
Η υπολογιστική όραση είναι ένα από τα πιο συζητημένα πεδία της βιομηχανίας του AI, χάρη στις πολλές潜ικές εφαρμογές σε πραγματικές εργασίες. Τα τελευταία χρόνια, τα πλαίσια υπολογιστικής όρασης έχουν προοδεύσει ταχύτατα, με τα σύγχρονα μοντέλα να είναι ικανά να αναλύουν χαρακτηριστικά προσώπου, αντικείμενα και πολλά άλλα σε πραγματικές συνθήκες.尽管 αυτά τα μοντέλα έχουν πολλές ικανότητες, η μεταφορά ανθρώκινης κίνησης παραμένει ένα σημαντικό πρόβλημα για τα μοντέλα υπολογιστικής όρασης. Αυτή η εργασία περιλαμβάνει την ανακατεύθυνση κινήσεων και εκφράσεων προσώπου από μια πηγή εικόνας ή βίντεο σε μια στόχο εικόνα ή βίντεο. Η μεταφορά ανθρώκινης κίνησης χρησιμοποιείται ευρέως σε μοντέλα υπολογιστικής όρασης για το στυλ εικόνων ή βίντεο, την επεξεργασία πολυμεσικού περιεχομένου, τη σύνθεση ψηφιακών ανθρώπων και ακόμη και τη γεννήση δεδομένων για πλαίσια αντίληψης.
Σε αυτό το άρθρο, εστιάζουμε στο MagicDance, ένα μοντέλο που βασίζεται στη διάχυση και σχεδιάστηκε για να επαναφέρει τη μεταφορά ανθρώκινης κίνησης. Το πλαίσιο MagicDance έχει ως στόχο να μεταφέρει εκφράσεις και κινήσεις προσώπου σε βίντεο χορού, με στόχο να γεννήσει νέες ακολουθίες κίνησης για συγκεκριμένες ταυτότητες στόχου, διατηρώντας την αρχική ταυτότητα. Το πλαίσιο MagicDance χρησιμοποιεί μια στρατηγική εκπαίδευσης δύο σταδίων, επικεντρωμένη στην αποσύνδεση ανθρώκινης κίνησης και εμφάνισης, όπως το χρώμα δέρματος, οι εκφράσεις προσώπου και τα ρούχα. Θα διερευνήσουμε το πλαίσιο MagicDance, εξετάζοντας την αρχιτεκτονική, τη λειτουργικότητα και την απόδοση σε σύγκριση με άλλα μοντέλα μεταφοράς ανθρώκινης κίνησης. Ας το ερευνήσουμε.
MagicDance: Πραγματιστική Μεταφορά Ανθρώκινης Κίνησης
Όπως αναφέρθηκε νωρίτερα, η μεταφορά ανθρώκινης κίνησης είναι μια από τις πιο σύνθετες εργασίες υπολογιστικής όρασης, λόγω της πολυπλοκότητας που εμπλέκεται στη μεταφορά κινήσεων και εκφράσεων από μια πηγή εικόνας ή βίντεο σε μια στόχο εικόνα ή βίντεο. Παραδοσιακά, τα μοντέλα υπολογιστικής όρασης έχουν επιτύχει τη μεταφορά ανθρώκινης κίνησης με την εκπαίδευση ενός γενετικού μοντέλου, συμπεριλαμβανομένων GAN ή Γενετικών Αντιπαλών Δικτύων σε συνόλους δεδομένων για εκφράσεις προσώπου και σώματος. Αν και η εκπαίδευση και η χρήση γενετικών μοντέλων παρέχουν ικανοποιητικά αποτελέσματα σε ορισμένες περιπτώσεις, συνήθως υποφέρουν από δύο σημαντικές περιορισμοί.
- Εξαρτώνται έντονα από ένα στοιχείο παραμόρφωσης εικόνας, ως αποτέλεσμα του οποίου συχνά δυσκολεύονται να.interpolate μέρη του σώματος που είναι ορατά στην πηγή εικόνας, είτε λόγω αλλαγής προοπτικής είτε λόγω αυτο-οσκότησης.
- Δεν μπορούν να γενικεύσουν σε άλλες εικόνες που προέρχονται εξωτερικά, το οποίο περιορίζει τις εφαρμογές τους, ιδιαίτερα σε πραγματικές συνθήκες.

Τα σύγχρονα μοντέλα διάχυσης έχουν展示 výjimečné ικανότητες γεννήσεων εικόνων σε διάφορες συνθήκες, και τα μοντέλα διάχυσης είναι τώρα ικανά να παρουσιάζουν ισχυρά οπτικά σε μια σειρά από εργασίες, όπως η γεννήσεις βίντεο και η συμπλήρωση εικόνων, μαθαίνοντας από συνόλους δεδομένων εικόνων σε κλίμακα web. Λόγω των ικανοτήτων τους, τα μοντέλα διάχυσης μπορεί να είναι η ιδανική επιλογή για εργασίες μεταφοράς ανθρώκινης κίνησης. Αν και τα μοντέλα διάχυσης μπορούν να εφαρμοστούν για τη μεταφορά ανθρώκινης κίνησης, έχουν ορισμένα περιορισμοί, είτε όσον αφορά την ποιότητα του γεννημένου περιεχομένου, είτε όσον αφορά τη διατήρηση της ταυτότητας ή την πάθηση από χρονικές ασυνέπειες ως αποτέλεσμα του σχεδιασμού του μοντέλου και της στρατηγικής εκπαίδευσης. Επιπλέον, τα μοντέλα διάχυσης δεν παρουσιάζουν σημαντικό πλεονέκτημα σε σχέση με τα πλαίσια GAN όσον αφορά τη γενικευσιμότητα.
Για να υπερβούν τα εμπόδια που αντιμετωπίζουν τα μοντέλα διάχυσης και GAN στις εργασίες μεταφοράς ανθρώκινης κίνησης, οι dévelopπεurs έχουν εισαγάγει το MagicDance, ένα καινούριο πλαίσιο που στοχεύει να εκμεταλλευτεί το δυναμικό των μοντέλων διάχυσης για τη μεταφορά ανθρώκινης κίνησης,展示ώντας ένα беспреCEDENT επίπεδο διατήρησης ταυτότητας, υπεροχή οπτικής ποιότητας και γενικευσιμότητας. Στο κέντρο του, η θεμελιώδης концепτός του πλαισίου MagicDance είναι να διασπάσει το πρόβλημα σε δύο στάδια: έλεγχο εμφάνισης και έλεγχο κίνησης, δύο ικανότητες που απαιτούνται από τα μοντέλα διάχυσης για να παραγάγουν ακριβείς αποτελέσματα μεταφοράς κίνησης.

Η παραπάνω εικόνα δίνει μια σύντομη επισκόπηση του πλαισίου MagicDance, και όπως είναι ορατό, το πλαίσιο χρησιμοποιεί το μοντέλο Stable Diffusion και επίσης αναπτύσσει δύο επιπλέον συνιστώσες: Appearance Control Model και Pose ControlNet, όπου το πρώτο παρέχει καθοδήγηση εμφάνισης στο μοντέλο SD από μια αναφορά εικόνας μέσω προσοχής, ενώ το δεύτερο παρέχει καθοδήγηση έκφρασης/στάσης στο μοντέλο διάχυσης από μια συνθηκική εικόνα ή βίντεο. Το πλαίσιο επίσης χρησιμοποιεί μια στρατηγική εκπαίδευσης πολλαπλών σταδίων για να μάθει αυτά τα υπο-μοντέλα αποτελεσματικά, ώστε να αποσυνδέσει τον έλεγχο στάσης και την εμφάνιση.
Συνοπτικά, το πλαίσιο MagicDance είναι ένα
- Νέο και αποτελεσματικό πλαίσιο που αποτελείται από αποσυνδεμένο έλεγχο στάσης και προ-εκπαίδευση εμφάνισης.
- Το πλαίσιο MagicDance είναι ικανό να γεννήσει πραγματιστικές ανθρώπινες εκφράσεις και κινήσεις υπό τον έλεγχο των συνθηκών στάσης και αναφορά εικόνας ή βίντεο.
- Το πλαίσιο MagicDance στοχεύει να γεννήσει περιεχόμενο ανθρώπινης εμφάνισης που είναι συνεπές, εισάγοντας ένα υπο-μοντέλο πολλαπλής προσοχής που παρέχει ακριβή καθοδήγηση για το πλαίσιο Stable Diffusion UNet.
- Το πλαίσιο MagicDance μπορεί επίσης να χρησιμοποιηθεί ως μια βολική επέκταση ή προσθήκη για το πλαίσιο Stable Diffusion, και επίσης διασφαλίζει τη συμβατότητα με τα υπάρχοντα βάρη μοντέλων, καθώς δεν απαιτεί πρόσθετη εκπαίδευση των παραμέτρων.
Επιπλέον, το πλαίσιο MagicDance παρουσιάζει εξαιρετικές ικανότητες γενικευσιμότητας για cả την εμφάνιση και την κίνηση.
- Γενικευσιμότητα Εμφάνισης: Το πλαίσιο MagicDance παρουσιάζει υπεροχή ικανότητες όταν πρόκειται για τη γεννήσεις ποικίλων εμφανίσεων.
- Γενικευσιμότητα Κίνησης: Το πλαίσιο MagicDance έχει επίσης την ικανότητα να γεννήσει eine ευρεία ποικιλία κινήσεων.
MagicDance: Στόχοι και Αρχιτεκτονική
Για μια δεδομένη αναφορά εικόνας, είτε πραγματικού ανθρώπου είτε στιλισμένης εικόνας, ο πρωταρχικός στόχος του πλαισίου MagicDance είναι να γεννήσει μια έξοδο εικόνας ή βίντεο που συνθήκευεται με την είσοδο και τις συνθήκες στάσης {P, F}, όπου P αντιπροσωπεύει το σκελετό ανθρώπινης στάσης και F αντιπροσωπεύει τα χαρακτηριστικά προσώπου. Η γεννημένη έξοδος εικόνας ή βίντεο πρέπει να διατηρήσει την εμφάνιση και την ταυτότητα των ανθρώπων που εμπλέκονται, μαζί με το περιεχόμενο του φόντου που υπάρχει στην αναφορά εικόνας, ενώ διατηρεί τη στάση και τις εκφράσεις που ορίζονται από τις συνθήκες στάσης.
Αρχιτεκτονική
Κατά τη διάρκεια της εκπαίδευσης, το πλαίσιο MagicDance εκπαιδεύεται ως μια εργασία ανακατασκευής πλαισίου για να ανακατασκευάσει την πραγματική αλήθεια με την αναφορά εικόνας και την είσοδο στάσης που προέρχεται από το ίδιο βίντεο αναφοράς. Κατά τη διάρκεια του τεστ για να επιτύχουν τη μεταφορά κίνησης, η είσοδος στάσης και η αναφορά εικόνας προέρχεται από διαφορετικές πηγές.
Η συνολική αρχιτεκτονική του πλαισίου MagicDance μπορεί να χωριστεί σε τέσσερις κατηγορίες: Προκαταρκτικό στάδιο, Προ-εκπαίδευση Ελέγχου Εμφάνισης, Αποσυνδεμένος Έλεγχος Στάσης και Μοντέλο Κίνησης.
Προκαταρκτικό Στάδιο
Τα μοντέλα διάχυσης Latent ή LDM αντιπροσωπεύουν μοναδικά σχεδιασμένα μοντέλα διάχυσης για να λειτουργήσουν στο χώρο Latent που διευκολύνεται από τη χρήση ενός autoencoder, και το πλαίσιο Stable Diffusion είναι ένα αξιοσημείωτο παράδειγμα LDM που χρησιμοποιεί einen Vector Quantized-Variational AutoEncoder και αρχιτεκτονική U-Net. Το μοντέλο Stable Diffusion χρησιμοποιεί einen CLIP- आधαρημένο μετασχηματισμό ως κωδικοποιητή κειμένου για να επεξεργαστεί κειμενικές εισόδους, μετατρέποντας κειμενικές εισόδους σε ενσωματώσεις. Η φάση εκπαίδευσης του πλαισίου Stable Diffusion εκθέτει το μοντέλο σε μια συνθήκη κειμένου και μια είσοδο εικόνας, με τη διαδικασία που περιλαμβάνει την κωδικοποίηση της εικόνας σε μια.latent αναπαράσταση, και την υποβάλλει σε μια προκαθορισμένη ακολουθία βημάτων διάχυσης που κατευθύνεται από μια μεθοδολογία Gaussian. Η αποτελεσματική ακολουθία παράγει μια θορυβώδη.latent αναπαράσταση που παρέχει μια τυπική κανονική κατανομή, με το πρωταρχικό στόχο της εκπαίδευσης του πλαισίου Stable Diffusion να είναι η απο-θορύβωση των θορυβωδών.latent αναπαραστάσεων σε.latent αναπαραστάσεις.
Προ-εκπαίδευση Ελέγχου Εμφάνισης
Ένα σημαντικό πρόβλημα με το αρχικό πλαίσιο ControlNet είναι η αδυναμία του να ελέγξει την εμφάνιση μεταξύ των χωρικά μεταβαλλόμενων κινήσεων συνεχώς, αν και έχει την τάση να γεννήσει εικόνες με στάσεις που μοιάζουν με αυτές στην είσοδο εικόνας, με την συνολική εμφάνιση να επηρεάζεται κυρίως από κειμενικές εισόδους. Αν και αυτή η μέθοδος λειτουργεί, δεν είναι κατάλληλη για εργασίες μεταφοράς κίνησης που δεν είναι οι κειμενικές εισόδους αλλά η αναφορά εικόνας που υπηρετεί ως η πρωταρχική πηγή για πληροφορίες εμφάνισης.
Το υπο-μοντέλο Προ-εκπαίδευσης Ελέγχου Εμφάνισης στο πλαίσιο MagicDance σχεδιάστηκε ως ένα βοηθητικό κλάδο για να παρέχει καθοδήγηση για τον έλεγχο εμφάνισης με μια προσεγγιστική προσέγγιση. Αντί να βασίζεται σε κειμενικές εισόδους, το συνολικό υπο-μοντέλο επικεντρώνεται στο να εκμεταλλευτεί τις ιδιότητες εμφάνισης από την αναφορά εικόνας, με στόχο να ενισχύσει την ικανότητα του πλαισίου να γεννήσει τις ιδιότητες εμφάνισης ακριβώς, ιδιαίτερα σε σενάρια που εμπλέκουν σύνθετες δυναμικές κίνησης. Επιπλέον, είναι μόνο το υπο-μοντέλο Ελέγχου Εμφάνισης που είναι εκπαιδεύσιμο κατά τη διάρκεια της προ-εκπαίδευσης ελέγχου εμφάνισης.
Αποσυνδεμένος Έλεγχος Στάσης
Μια αφελής λύση για τον έλεγχο της στάσης στην έξοδο εικόνας είναι να ενσωματώσει το προ-εκπαιδευμένο μοντέλο ControlNet με το προ-εκπαιδευμένο υπο-μοντέλο Ελέγχου Εμφάνισης απευθείας χωρίς να το εξειδικεύσει. Ωστόσο, η ενσωμάτωση μπορεί να οδηγήσει το πλαίσιο να δυσκολεύεται με τον έλεγχο στάσης που είναι ανεξάρτητος από την εμφάνιση, το οποίο μπορεί να οδηγήσει σε μια διαφορά μεταξύ των εισόδων στάσης και των γεννημένων στάσεων. Για να αντιμετωπίσουμε αυτή τη διαφορά, το πλαίσιο MagicDance εξειδικεύει το υπο-μοντέλο Pose ControlNet μαζί με το προ-εκπαιδευμένο υπο-μοντέλο Ελέγχου Εμφάνισης.
Μοντέλο Κίνησης
Όταν λειτουργούν μαζί, το υπο-μοντέλο Αποσυνδεμένου Έλεγχου Στάσης και το υπο-μοντέλο Ελέγχου Εμφάνισης μπορούν να επιτύχουν ακριβή και αποτελεσματική μεταφορά εικόνας σε κίνηση, αν και μπορεί να οδηγήσει σε χρονική ασυνέπεια. Για να διασφαλίσουν τη χρονική συνέπεια, το πλαίσιο ενσωματώνει ένα επιπλέον μοντέλο κίνησης στην αρχιτεκτονική του πλαισίου Stable Diffusion UNet.
MagicDance: Προ-εκπαίδευση και Συνόλους Δεδομένων
Για την προ-εκπαίδευση, το πλαίσιο MagicDance χρησιμοποιεί ένα σύνολο δεδομένων TikTok που αποτελείται από πάνω από 350 βίντεο χορού διαφορετικών μήκους μεταξύ 10 και 15 δευτερολέπτων, που απαθανάτιζαν ένα άτομο που χορεύει με την πλειονότητα αυτών των βίντεο να περιέχουν το πρόσωπο και το άνω μέρος του σώματος. Το πλαίσιο MagicDance εξάγει κάθε βίντεο σε 30 καρέ ανά δευτερόλεπτο και τρέχει το OpenPose σε κάθε καρέ για να ανακαλύψει το σκελετό στάσης, τις στάσεις χεριών και τα χαρακτηριστικά προσώπου.
Για την προ-εκπαίδευση, το υπο-μοντέλο ελέγχου εμφάνισης προ-εκπαιδεύεται με μια παρτίδα μεγέθους 64 σε 8 NVIDIA A100 GPUs για 10.000 βήματα με μέγεθος εικόνας 512 x 512, ακολουθούμενο από την κοινή εξειδίκευση του υπο-μοντέλου ελέγχου στάσης και του υπο-μοντέλου ελέγχου εμφάνισης με μια παρτίδα μεγέθους 16 για 20.000 βήματα. Κατά τη διάρκεια της εκπαίδευσης, το πλαίσιο MagicDance τυχαία δειγματίζει δύο καρέ ως στόχο και αναφορά, αντίστοιχα, με τις εικόνες να croppονται στην ίδια θέση και στο ίδιο ύψος. Κατά τη διάρκεια της αξιολόγησης, το μοντέλο croppει την εικόνα κεντρικά αντί να την κάνει τυχαία.
MagicDance: Αποτελέσματα
Τα πειραματικά αποτελέσματα που διεξήχθησαν στο πλαίσιο MagicDance παρουσιάζονται στην ακόλουθη εικόνα, και όπως είναι ορατό, το πλαίσιο MagicDance υπερέχει των υφιστάμενων πλαισίων όπως το Disco και το DreamPose για τη μεταφορά ανθρώκινης κίνησης σε όλους τους δείκτες. Τα πλάισια που αποτελούνται από ένα “*” στο όνομά τους χρησιμοποιούν την εικόνα στόχου απευθείας ως είσοδο και περιλαμβάνουν περισσότερες πληροφορίες σε σύγκριση με τα άλλα πλάισια.

Είναι ενδιαφέρον να σημειωθεί ότι το πλαίσιο MagicDance επιτύχει ένα Face-Cos score 0,426, μια βελτίωση 156,62% σε σύγκριση με το πλαίσιο Disco, και μια αύξηση σχεδόν 400% σε σύγκριση με το πλαίσιο DreamPose. Τα αποτελέσματα υποδεικνύουν τη ροβούστα ικανότητα του πλαισίου MagicDance να διατηρήσει πληροφορίες ταυτότητας και η ορατή βελτίωση της απόδοσης υποδηλώνει την υπεροχή του πλαισίου MagicDance σε σύγκριση με τα υφιστάμενα state-of-the-art μεθόδους.
Οι ακόλουθες εικόνες συγκρίνουν την ποιότητα της γεννήσεως βίντεο ανθρώπινης κίνησης μεταξύ του πλαισίου MagicDance, Disco και TPS. Όπως είναι ορατό, τα αποτελέσματα που παράγονται από τα πλάισια GT, Disco και TPS υποφέρουν από ασυνέπειες στην ταυτότητα ανθρώπινης στάσης και εκφράσεων.

Επιπλέον, η ακόλουθη εικόνα δείχνει την οπτικοποίηση της μεταφοράς έκφρασης και ανθρώπινης κίνησης στο σύνολο δεδομένων TikTok με το πλαίσιο MagicDance να είναι ικανό να γεννήσει πραγματιστικές και ζωηρές εκφράσεις και κινήσεις υπό διαφορετικές συνθήκες στάσης και αναφορά εικόνας ή βίντεο, ενώ διατηρεί ακριβώς τις πληροφορίες ταυτότητας από την είσοδο αναφοράς.

Είναι αξιοσημείωτο ότι το πλαίσιο MagicDance διαθέτει εξαιρετικές ικανότητες γενικευσιμότητας σε εικόνες αναφοράς εκτός του πεδίου με άγνωστες στάσεις και στυλ, με εντυπωσιακή ελέγχο εμφάνισης ακόμη και χωρίς πρόσθετη εξειδίκευση στο πεδίο στόχου, με τα αποτελέσματα να παρουσιάζονται στην ακόλουθη εικόνα.

Οι ακόλουθες εικόνες δείχνουν την οπτικοποίηση των ικανοτήτων του πλαισίου MagicDance όσον αφορά τη μεταφορά έκφρασης και την κίνηση ανθρώπινης κίνησης. Όπως είναι ορατό, το πλαίσιο MagicDance γενικεύεται σε κινήσεις ανθρώπινης κίνησης στο φυσικό περιβάλλον.

MagicDance: Περιορισμοί
Το OpenPose είναι ένα βασικό στοιχείο του πλαισίου MagicDance, καθώς παίζει einen κρίσιμο ρόλο για τον έλεγχο στάσης, επηρεάζοντας σημαντικά την ποιότητα και τη χρονική συνέπεια των γεννημένων εικόνων. Ωστόσο, το πλαίσιο MagicDance vẫn αντιμετωπίζει κάποια προκλήσεις για την ακριβή ανίχνευση των χαρακτηριστικών προσώπου και του σκελετού στάσης, ιδιαίτερα όταν τα αντικείμενα στις εικόνες είναι μερικά ορατά ή εμφανίζουν ταχεία κίνηση. Αυτά τα προβλήματα μπορούν να οδηγήσουν σε αρτεφάκτα στις γεννημένες εικόνες.
Συμπέρασμα
Σε αυτό το άρθρο, μιλήσαμε για το MagicDance, ένα μοντέλο που βασίζεται στη διάχυση και στοχεύει να επαναφέρει τη μεταφορά ανθρώκινης κίνησης. Το πλαίσιο MagicDance προσπαθεί να μεταφέρει 2D ανθρώπινες εκφράσεις και κινήσεις σε βίντεο χορού, με στόχο να γεννήσει νέες ακολουθίες κίνησης για συγκεκριμένες ταυτότητες στόχου, διατηρώντας την ταυτότητα σταθερή. Το πλαίσιο MagicDance είναι μια στρατηγική εκπαίδευσης δύο σταδίων για την αποσύνδεση ανθρώκινης κίνησης και εμφάνισης, όπως το χρώμα δέρματος, οι εκφράσεις προσώπου και τα ρούχα.
Το MagicDance είναι μια νέα προσέγγιση για τη γεννήσεως πραγματιστικών βίντεο ανθρώπινης κίνησης, ενσωματώνοντας τη μεταφορά έκφρασης και κίνησης, και επιτρέποντας τη συνεχή γεννήσεως κίνησης στο φυσικό περιβάλλον χωρίς την ανάγκη πρόσθετης εξειδίκευσης, που δείχνει σημαντική πρόοδο σε σύγκριση με τις υφιστάμενες μεθόδους. Επιπλέον, το πλαίσιο MagicDance παρουσιάζει εξαιρετικές ικανότητες γενικευσιμότητας σε σύνθετες ακολουθίες κίνησης και διαφορετικές ταυτότητες ανθρώπινης κίνησης, καθιστώντας το πλαίσιο MagicDance ως τον ηγέτη στο πεδίο της υποβοηθούμενης από το AI μεταφοράς κίνησης και γεννήσεως βίντεο.












