Μοντέλα και πλατφόρμες AI

AniPortrait: Συνθετική Εικόνα Photorealistic Portrait Animation

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Με τα χρόνια, η δημιουργία ρεαλιστικών και εκφραστικών πορτρέτων κινουμένων σχεδίων από στατικές εικόνες και ήχο έχει βρει μια σειρά εφαρμογών, συμπεριλαμβανομένων παιχνιδιών, ψηφιακών μέσων, εικονικής πραγματικότητας και πολλών άλλων. Παρά την потенτική εφαρμογή, είναι ακόμη δύσκολο για τους développers να δημιουργήσουν πλαισια που μπορούν να παράγουν υψηλής ποιότητας κινουμένα σχέδια που διατηρούν τη χρονική συνεκτικότητα και είναι οπτικά ελκυστικά. Ένας σημαντικός λόγος για τη σύνθετη αυτή είναι η ανάγκη για λεπτομερή συντονισμό των κινήσεων των χειλιών, των θέσεων του κεφαλιού και των εκφράσεων του προσώπου για να δημιουργηθεί ένα οπτικά ελκυστικό αποτέλεσμα.

Σε αυτό το άρθρο, θα μιλήσουμε για το AniPortrait, ένα καινούριο πλαισιο που σχεδιάστηκε για να παράγει υψηλής ποιότητας κινουμένα σχέδια που οδηγούνται από μια αναφορά εικόνας πορτρέτου και ένα δείγμα ήχου. Η λειτουργία του πλαισίου AniPortrait διαιρείται σε δύο στάδια. Πρώτα, το πλαισιο AniPortrait εξάγει τις ενδιάμεσες 3D αναπαραστάσεις από τα δείγματα ήχου και τις προβάλει σε μια σειρά 2D σημείων προσώπου. Ακολουθώντας αυτό, το πλαισιο χρησιμοποιεί ένα ρομποτικό μοντέλο διάχυσης μαζί με ένα μοντέλο κίνησης για να μετατρέψει τη σειρά σημείων σε χρονικά συνεχή και φωτορεαλιστικά κινουμένα σχέδια. Τα πειραματικά αποτελέσματα δείχνουν την υπεροχή και την ικανότητα του πλαισίου AniPortrait να παράγει υψηλής ποιότητας κινουμένα σχέδια με εξαιρετική οπτική ποιότητα, ποικιλία στάσεων και φυσικότητα του προσώπου, προσφέροντας έτσι μια ενισχυμένη και εμπλουτισμένη αισθητηριακή εμπειρία. Επιπλέον, το πλαισιο AniPortrait έχει αξιοσημείωτο δυναμικό σε όρους ελέγχου και ευελιξίας και μπορεί να εφαρμοστεί αποτελεσματικά σε περιοχές που περιλαμβάνουν την ανασύνθεση του προσώπου, την επεξεργασία κίνησης του προσώπου και πολλά άλλα. Αυτό το άρθρο έχει ως στόχο να καλύψει το πλαισιο AniPortrait σε βάθος και να εξερευνήσουμε τον μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου μαζί με την σύγκρισή του με τα πλαισια της τεχνολογίας.

AniPortrait: Φωτορεαλιστικά Κινουμένα Σχέδια Πορτρέτου

Η δημιουργία ρεαλιστικών και εκφραστικών πορτρέτων κινουμένων σχεδίων έχει sido το επίκεντρο των ερευνητών για ένα χρονικό διάστημα τώρα, λόγω του αξιοσημείωτου δυναμικού και των εφαρμογών που διαρκούν από τα ψηφιακά μέσα και την εικονική πραγματικότητα στα παιχνίδια και πολλά άλλα. Παρά τα χρόνια έρευνας και ανάπτυξης, η παραγωγή υψηλής ποιότητας κινουμένων σχεδίων που διατηρούν τη χρονική συνεκτικότητα και είναι οπτικά ελκυστικά vẫn παρουσιάζει μια σημαντική πρόκληση. Ένας σημαντικός εμπόδιο για τους développers είναι η ανάγκη για λεπτομερή συντονισμό μεταξύ των θέσεων του κεφαλιού, των οπτικών εκφράσεων και των κινήσεων των χειλιών για να δημιουργηθεί ένα οπτικά ελκυστικό αποτέλεσμα. Οι υφιστάμενες μεθόδους έχουν αποτύχει να αντιμετωπίσουν αυτές τις προκλήσεις, κυρίως επειδή η πλειοψηφία τους βασίζεται σε περιορισμένες δυνατότητες γενераторών όπως το NeRF, οι κωδικοποιητές κίνησης και το GAN για τη δημιουργία οπτικού περιεχομένου. Αυτά τα δίκτυα παρουσιάζουν περιορισμένες δυνατότητες γενίκευσης και είναι ασταθή στη δημιουργία υψηλής ποιότητας περιεχομένου. Ωστόσο, η πρόσφατη εμφάνιση των μοντέλων διάχυσης έχει διευκολύνει τη δημιουργία υψηλής ποιότητας εικόνων, και κάποια πλαισια που βασίζονται σε μοντέλα διάχυσης μαζί με χρονικά μοντέλα έχουν διευκολύνει τη δημιουργία ελκυστικών βίντεο, επιτρέποντας στα μοντέλα διάχυσης να εξέχουν.

Βασισμένο στις προόδους των μοντέλων διάχυσης, το πλαισιο AniPortrait έχει ως στόχο να παράγει υψηλής ποιότητας κινουμένα πορτρέτα χρησιμοποιώντας μια αναφορά εικόνας και ένα δείγμα ήχου. Η λειτουργία του πλαισίου AniPortrait διαιρείται σε δύο στάδια. Στο πρώτο στάδιο, το πλαισιο AniPortrait χρησιμοποιεί μοντέλα βασισμένα σε μετασχηματιστές για να εξάγει μια σειρά 3D facial mesh και θέσεις κεφαλιού από είσοδο ήχου, και τις προβάλει στη συνέχεια σε μια σειρά 2D σημείων προσώπου. Το πρώτο στάδιο επιτρέπει στο πλαισιο AniPortrait να καταγράψει τις κινήσεις των χειλιών και τις λεπτομέρειες των εκφράσεων από τον ήχο, καθώς και τις κινήσεις του κεφαλιού που συγχρονίζονται με τον ρυθμό του δείγματος ήχου. Το δεύτερο στάδιο, το πλαισιο AniPortrait χρησιμοποιεί ένα ρομποτικό μοντέλο διάχυσης και το ενσωματώνει με ένα μοντέλο κίνησης για να μετατρέψει τη σειρά σημείων σε χρονικά συνεχή και φωτορεαλιστικά κινουμένα πορτρέτα. Για να seja πιο συγκεκριμένος, το πλαισιο AniPortrait βασίζεται στην αρχιτεκτονική του μοντέλου AnimateAnyone που χρησιμοποιεί το Stable Diffusion 1.5, ένα ισχυρό μοντέλο διάχυσης για να παράγει ελκυστικές και ρευστές εικόνες βασισμένες σε μια αναφορά εικόνας και μια σειρά κίνησης σώματος. Τι αξίζει να σημειωθεί είναι ότι το πλαισιο AniPortrait δεν χρησιμοποιεί το μοντέλο οδηγού στάσεων μέσα σε αυτό το δίκτυο, όπως έχει εφαρμοστεί στο μοντέλο AnimateAnyone, αλλά το ξανασχεδιάζει, επιτρέποντας στο πλαισιο AniPortrait όχι μόνο να διατηρεί einen ελαφρύ σχεδιασμό αλλά και να παρουσιάζει ενισχυμένη ακρίβεια στη δημιουργία κινήσεων των χειλιών.

Τα πειραματικά αποτελέσματα δείχνουν την υπεροχή του πλαισίου AniPortrait στη δημιουργία κινουμένων σχεδίων με εντυπωσιακή φυσικότητα του προσώπου, εξαιρετική οπτική ποιότητα και ποικιλία στάσεων. Με τη χρήση 3D αναπαραστάσεων ως ενδιάμεσων χαρακτηριστικών, το πλαισιο AniPortrait κερδίζει την ευελιξία να τροποποιήσει αυτές τις αναπαραστάσεις σύμφωνα με τις απαιτήσεις του. Η προσαρμοστικότητα αυξάνει σημαντικά την εφαρμοσιμότητα του πλαισίου AniPortrait σε διάφορους τομείς, συμπεριλαμβανομένης της ανασύνθεσης του προσώπου και της επεξεργασίας κίνησης του προσώπου.

AniPortrait: Λειτουργία και Μεθοδολογία

Το προτεινόμενο πλαισιο AniPortrait αποτελείται από δύο μονάδες, τις Lmk2Video και Audio2Lmk. Η μονάδα Audio2Lmk προσπαθεί να εξάγει μια σειρά σημείων που καταγράφουν τις λεπτομέρειες των κινήσεων των χειλιών και των εκφράσεων του προσώπου από είσοδο ήχου, ενώ η μονάδα Lmk2Video χρησιμοποιεί αυτή τη σειρά σημείων για να παράγει υψηλής ποιότητας βίντεο πορτρέτου με χρονική σταθερότητα. Η ακόλουθη εικόνα παρουσιάζει μια επισκόπηση της λειτουργίας του πλαισίου AniPortrait. Όπως μπορεί να παρατηρηθεί, το πλαισιο AniPortrait πρώτα εξάγει το 3D facial mesh και τη θέση κεφαλιού από τον ήχο, και τις προβάλει στη συνέχεια σε 2D σημεία. Στο δεύτερο στάδιο, το πλαισιο χρησιμοποιεί ένα μοντέλο διάχυσης για να μετατρέψει τα 2D σημεία σε βίντεο πορτρέτου με δύο στάδια που εκπαιδεύονται ταυτόχρονα μέσα στο δίκτυο.

Audio2Lmk

Για μια δεδομένη σειρά δειγμάτων ομιλίας, ο κύριος στόχος του πλαισίου AniPortrait είναι να προβλέψει την αντίστοιχη σειρά 3D facial mesh με διανυσματικές αναπαραστάσεις μετάφρασης και περιστροφής. Το πλαισιο AniPortrait χρησιμοποιεί την προ-εκπαιδευμένη μέθοδο wav2vec για να εξάγει χαρακτηριστικά ήχου, και το μοντέλο παρουσιάζει υψηλό βαθμό γενίκευσης, και είναι ικανό να αναγνωρίζει τον τόνο και την προφορά από τον ήχο με ακρίβεια, που παίζει einen κρίσιμο ρόλο στη δημιουργία ρεαλιστικών κινήσεων προσώπου. Με τη χρήση των αποκτηθέντων ρομποτικών χαρακτηριστικών ήχου, το πλαισιο AniPortrait είναι σε θέση να χρησιμοποιήσει μια απλή αρχιτεκτονική που αποτελείται από δύο στρώματα fc για να μετατρέψει αυτά τα χαρακτηριστικά σε 3D facial mesh. Το πλαισιο AniPortrait παρατηρεί ότι αυτό το απλό σχέδιο που εφαρμόζεται από το μοντέλο όχι μόνο αυξάνει την αποτελεσματικότητα της διαδικασίας εκτίμησης, αλλά και διασφαλίζει την ακρίβεια. Όταν μετατρέπει τον ήχο σε στάση, το πλαισιο AniPortrait χρησιμοποιεί το ίδιο δίκτυο wav2vec ως πυρήνα, αν και το μοντέλο δεν μοιράζεται τα βάρη με το μοντέλο ήχου σε mesh. Αυτό οφείλεται κυρίως στο γεγονός ότι η στάση είναι πιο συνδεδεμένη με τον τόνο και τον ρυθμό που παρουσιάζονται στον ήχο, που έχει διαφορετική έμφαση σε σύγκριση με την εργασία ήχου σε mesh. Για να ληφθούν υπόψη οι επιπτώσεις των προηγούμενων καταστάσεων, το πλαισιο AniPortrait χρησιμοποιεί einen μετασχηματιστή αποκωδικοποιητή για να αποκωδικοποιήσει τη σειρά στάσεων. Κατά τη διάρκεια αυτής της διαδικασίας, το πλαισιο ενσωματώνει τα χαρακτηριστικά ήχου στο αποκωδικοποιητή χρησιμοποιώντας μηχανισμούς δια-προσοχής, και για cả τα μοντέλα, το πλαισιο τα εκπαιδεύει χρησιμοποιώντας την απώλεια L1. Μόλις το μοντέλο αποκτήσει τη στάση και το mesh, χρησιμοποιεί την προοπτική προβολή για να μετατρέψει αυτές τις σειρές σε μια 2D σειρά σημείων προσώπου που χρησιμοποιούνται ως είσοδος σήματα για το επόμενο στάδιο.

Lmk2Video

Για μια δεδομένη αναφορά εικόνας πορτρέτου και μια σειρά σημείων προσώπου, η μονάδα Lmk2Video δημιουργεί ένα χρονικά συνεχή πορτρέτο κινουμένων σχεδίων, και αυτό το κινουμένο σχέδιο συγχρονίζεται με την κίνηση της σειράς σημείων, και διατηρεί μια εμφάνιση που είναι συνεχή με την αναφορά εικόνας, και τελικά, το πλαισιο αντιπροσωπεύει το πορτρέτο κινουμένων σχεδίων ως μια σειρά πλαισίων πορτρέτου. Η σχεδίαση της αρχιτεκτονικής του δικτύου Lmk2Video αναζητά έμπνευση από το ήδη υπάρχον πλαισιο AnimateAnyone. Το πλαισιο AniPortrait χρησιμοποιεί το Stable Diffusion 1.5, ένα εξαιρετικά ισχυρό μοντέλο διάχυσης, ως πυρήνα, και ενσωματώνει ένα χρονικό μοντέλο κίνησης που μετατρέπει αποτελεσματικά τις πολλαπλές είσοδοι θορύβου σε μια σειρά πλαισίων βίντεο. Ταυτόχρονα, ένα компонент δίκτυου ReferencenNet αντανακλά την αρχιτεκτονική του Stable Diffusion 1.5, και χρησιμοποιεί το για να εξάγει πληροφορίες εμφάνισης από την αναφορά εικόνας, και τις ενσωματώνει στο πυρήνα. Η στρατηγική σχεδίαση διασφαλίζει ότι η ταυτότητα του προσώπου παραμένει συνεχή σε όλο το βίντεο εξόδου. Σε σύγκριση με το πλαισιο AnimateAnyone, το πλαισιο AniPortrait αυξάνει την πολυπλοκότητα του σχεδιασμού του PoseGuider. Η αρχική έκδοση του πλαισίου AnimateAnyone αποτελείται μόνο από quelques στρώματα συζυγούς μετά τη συγχώνευση των χαρακτηριστικών σημείων με τα latents στο επίπεδο εισόδου του πυρήνα. Το πλαισιο AniPortrait ανακαλύπτει ότι ο σχεδιασμός αυτός δεν είναι επαρκής για την καταγραφή των λεπτομερειών των κινήσεων των χειλιών, και για να αντιμετωπίσει αυτό το ζήτημα, το πλαισιο υιοθετεί την πολυπρόσωπη στρατηγική της αρχιτεκτονικής ConvNet, και ενσωματώνει χαρακτηριστικά σημείων αντίστοιχων κλιμάκων σε διαφορετικά μπλοκ του πυρήνα. Επιπλέον, το πλαισιο AniPortrait εισάγει μια πρόσθετη βελτίωση εισάγοντας τα σημεία της αναφοράς εικόνας ως πρόσθετη είσοδο. Ο μηχανισμός δια-προσοχής του компонόντα PoseGuider διευκολύνει την αλληλεπίδραση μεταξύ των στόχων σημείων κάθε πλαισίου και των σημείων αναφοράς. Αυτή η διαδικασία παρέχει στο δίκτυο πρόσθετες ενδείξεις για να κατανοήσει τη συσχέτιση μεταξύ εμφάνισης και σημείων προσώπου, βοηθώντας στην παραγωγή πορτρέτων κινουμένων σχεδίων με πιο ακριβή κίνηση.

AniPortrait: Εφαρμογή και Αποτέλεσμα

Για το στάδιο Audio2Lmk, το πλαισιο AniPortrait υιοθετεί το компонент wav2vec2.0 ως πυρήνα, και χρησιμοποιεί την αρχιτεκτονική MediaPipe για να εξάγει 3D mesh και 6D στάσεις για ανακοινώσεις. Το μοντέλο πηγαίνει τα δεδομένα εκπαίδευσης για το componente Audio2Mesh από το εσωτερικό του σύνολο δεδομένων που αποτελείται από लगभग 60 λεπτά υψηλής ποιότητας δεδομένων ομιλίας από έναν seul ομιλητή. Για να διασφαλιστεί ότι το 3D mesh που εξάγεται από το компонент MediaPipe είναι σταθερό, ο ηθοποιός φωνής οδηγείται να κοιτάζει την κάμερα και να διατηρεί μια σταθερή θέση κεφαλιού κατά τη διάρκεια της ολόκληρης διαδικασίας εγγραφής. Για το μοντέλο Lmk2Video, το πλαισιο AniPortrait εφαρμόζει μια δι-σταδιακή προσέγγιση εκπαίδευσης. Στο πρώτο στάδιο, το πλαισιο επικεντρώνεται στην εκπαίδευση του ReferenceNet και του PoseGuider, του 2D компонόντα του πυρήνα, και αφήνει εκτός του μοντέλου κίνησης. Στο δεύτερο στάδιο, το πλαισιο AniPortrait παγώνει όλα τα άλλα компонόντα και επικεντρώνεται στην εκπαίδευση του μοντέλου κίνησης. Για αυτό το στάδιο, το πλαισιο χρησιμοποιεί δύο μεγάλης κλίμακας υψηλής ποιότητας συνόλων δεδομένων βίντεο προσώπου για να εκπαιδεύσει το μοντέλο, και επεξεργάζεται όλα τα δεδομένα χρησιμοποιώντας το компонент MediaPipe για να εξάγει 2D σημεία προσώπου. Επιπλέον, για να αυξήσει την ευαισθησία του δικτύου προς τις κινήσεις των χειλιών, το μοντέλο AniPortrait διακρίνει τα ανώτερα και κατώτερα χείλη με διαφορετικά χρώματα κατά την απόδοση της εικόνας στάσης από 2D σημεία.

Όπως φαίνεται στην ακόλουθη εικόνα, το πλαισιο AniPortrait παράγει μια σειρά κινουμένων σχεδίων που δείχνουν υψηλή ποιότητα και ρεαλισμό.

Το πλαισιο AniPortrait χρησιμοποιεί μια ενδιάμεση 3D αναπαράσταση που μπορεί να τροποποιηθεί για να χειριστεί την έξοδο σύμφωνα με τις απαιτήσεις. Για παράδειγμα, οι χρήστες μπορούν να εξάγουν σημεία από μια συγκεκριμένη πηγή και να τροποποιήσουν την ταυτότητά τους, επιτρέποντας στο πλαισιο AniPortrait να δημιουργήσει μια ανασύνθεση προσώπου.

Τελικές Σκέψεις

Σε αυτό το άρθρο, έχουμε μιλήσει για το AniPortrait, ένα καινούριο πλαισιο που σχεδιάστηκε για να παράγει υψηλής ποιότητας κινουμένα σχέδια που οδηγούνται από μια αναφορά εικόνας πορτρέτου και ένα δείγμα ήχου. Με την απλή εισαγωγή μιας αναφοράς εικόνας και ενός δείγματος ήχου, το πλαισιο AniPortrait είναι ικανό να παράγει ένα βίντεο πορτρέτου που παρουσιάζει φυσική κίνηση κεφαλιού και ομαλή κίνηση χειλιών. Με τη χρήση των ρομποτικών δυνατοτήτων του μοντέλου διάχυσης, το πλαισιο AniPortrait παράγει κινουμένα σχέδια που δείχνουν εντυπωσιακή ρεαλιστική ποιότητα εικόνας και κίνηση. Η λειτουργία του πλαισίου AniPortrait διαιρείται σε δύο στάδια. Πρώτα, το πλαισιο AniPortrait εξάγει τις ενδιάμεσες 3D αναπαραστάσεις από τα δείγματα ήχου και τις προβάλει σε μια σειρά 2D σημείων προσώπου. Ακολουθώντας αυτό, το πλαισιο χρησιμοποιεί ένα ρομποτικό μοντέλο διάχυσης μαζί με ένα μοντέλο κίνησης για να μετατρέψει τη σειρά σημείων σε χρονικά συνεχή και φωτορεαλιστικά κινουμένα σχέδια. Τα πειραματικά αποτελέσματα δείχνουν την υπεροχή και την ικανότητα του πλαισίου AniPortrait να παράγει υψηλής ποιότητας κινουμένα σχέδια με εξαιρετική οπτική ποιότητα, ποικιλία στάσεων και φυσικότητα του προσώπου, προσφέροντας έτσι μια ενισχυμένη και εμπλουτισμένη αισθητηριακή εμπειρία. Επιπλέον, το πλαισιο AniPortrait έχει αξιοσημείωτο δυναμικό σε όρους ελέγχου και ευελιξίας και μπορεί να εφαρμοστεί αποτελεσματικά σε περιοχές που περιλαμβάνουν την ανασύνθεση του προσώπου, την επεξεργασία κίνησης του προσώπου και πολλά άλλα.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.