Η γωνία του Anderson

Αναδιαμορφώνοντας Πρόσωπα σε Βίντεο με Μηχανική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια συνεργασία ερευνών μεταξύ της Κίνας και του Ηνωμένου Βασιλείου έχει αναπτύξει μια νέα μέθοδο για να αναδιαμορφώσει πρόσωπα σε βίντεο. Η τεχνική επιτρέπει μια πειστική ελάττωση και αύξηση της δομής του προσώπου, με υψηλή συντηρητικότητα και απουσία τεχνικών προβλημάτων.

Από ένα βίντεο στο YouTube που χρησιμοποιήθηκε ως υλικό από τους ερευνητές, η ηθοποιός Jennifer Lawrence εμφανίζεται ως ένα πιο γαμψό πρόσωπο (δεξιά). Δείτε το συνημμένο βίντεο στο κάτω μέρος του άρθρου για πολλά περισσότερα παραδείγματα σε καλύτερη ανάλυση. Πηγή: https://www.youtube.com/watch?v=tA2BxvrKvjE

Από ένα βίντεο στο YouTube που χρησιμοποιήθηκε ως υλικό από τους ερευνητές, η ηθοποιός Jennifer Lawrence εμφανίζεται ως ένα πιο γαμψό πρόσωπο (δεξιά). Δείτε το συνημμένο βίντεο στο κάτω μέρος του άρθρου για πολλά περισσότερα παραδείγματα σε καλύτερη ανάλυση. Πηγή: https://www.youtube.com/watch?v=tA2BxvrKvjE

Αυτού του είδους η μεταμόρφωση είναι συνήθως δυνατή μόνο μέσω παραδοσιακών μεθόδων CGI που θα χρειαζόταν να αναδημιουργήσουν το πρόσωπο μέσω λεπτομερών και ακριβών διαδικασιών motion-capping, rigging και texturing.

Αντίθετα, η CGI που χρησιμοποιείται στην τεχνική αυτή ενσωματώνεται σε einen νευρωνικό αγωγό ως παραμετρικές 3D πληροφορίες προσώπου που χρησιμοποιούνται στη συνέχεια ως βάση για μια διαδικασία μηχανικής μάθησης.

Παραμετρικές αναδιαμορφώσεις είναι όλο και περισσότερο χρησιμοποιούμενες ως οδηγίες για διαδικασίες μεταμόρφωσης που χρησιμοποιούν AI αντί για CGI. Πηγή: https://arxiv.org/pdf/2205.02538.pdf

Παραμετρικές αναδιαμορφώσεις είναι όλο και περισσότερο χρησιμοποιούμενες ως οδηγίες για διαδικασίες μεταμόρφωσης που χρησιμοποιούν AI αντί για CGI. Πηγή: https://arxiv.org/pdf/2205.02538.pdf

Οι συγγραφείς δηλώνουν:

‘Ο στόχος μας είναι να παράγουμε υψηλής ποιότητας αναδιαμορφώσεις βίντεο με την επεξεργασία του γενικού σχήματος των προσώπων σύμφωνα με τη φυσική παραμόρφωση του προσώπου στον πραγματικό κόσμο. Αυτό μπορεί να χρησιμοποιηθεί για εφαρμογές όπως η δημιουργία ωραίων προσώπων για καλλωπισμός και η υπερβολική αναπαράσταση για οπτικά εφέ.’

Αν και η αναμόρφωση προσώπων 2D και η παραμόρφωση έχουν διατεθεί στους καταναλωτές από την εποχή του Photoshop (και έχουν οδηγήσει σε περίεργες και συχνά απαράδεκτες υποκουλτούρες γύρω από την παραμόρφωση προσώπων και τη δυσμορφία του σώματος), είναι ένα δύσκολο κόλπο να το κάνεις σε βίντεο χωρίς να χρησιμοποιήσεις CGI.

Ο Μαρκ Ζούκερμπεργκ με τις διαστάσεις του να επεκτείνονται και να στενεύουν από την κινεζο-βρετανική τεχνική.

Ο Μαρκ Ζούκερμπεργκ με τις διαστάσεις του να επεκτείνονται και να στενεύουν από την κινεζο-βρετανική τεχνική.

Η αναμόρφωση του σώματος είναι目前 ένα πεδίο εντατικής έρευνας στο τομέα της οπτικής αναγνώρισης, κυρίως λόγω της δυνατότητας εφαρμογής στη μόδα ηλεκτρονικών συναλλαγών, αν και η μεταμόρφωση κάποιου σε ψηλότερο ή σκελετικό διαφορετικό είναι目前 ένα σημαντικό πρόκληση.

Ομοίως, η αλλαγή του σχήματος του κεφαλιού σε βίντεο σε συνεπή και πειστικό τρόπο έχει sido το αντικείμενο προηγούμενης εργασίας από τους ερευνητές του νέου εγγράφου, αν και η εφαρμογή αυτή είχε προβλήματα και περιορισμούς. Η νέα προσφορά επεκτείνει την ικανότητα της προηγούμενης έρευνας από στατικά σε βίντεο.

Το νέο σύστημα εκπαιδεύτηκε σε ένα επιτραπέζιο υπολογιστή με AMD Ryzen 9 3950X και 32GB μνήμης, και χρησιμοποιεί einen αλγόριθμο οπτικής ροής από OpenCV για χάρτες κίνησης, που λειαίνεται από το StructureFlow πλαίσιο: το Δίκτυο Προσαρμογής Προσώπου (FAN) για εκτίμηση ορόσημων, που χρησιμοποιείται επίσης στα δημοφιλή πακέτα deepfakes: και τον Ceres Solver για την επίλυση προβλημάτων βελτιστοποίησης.

Ένα ακραίο παράδειγμα παραμόρφωσης προσώπου με το νέο σύστημα.

Ένα ακραίο παράδειγμα παραμόρφωσης προσώπου με το νέο σύστημα.

Το έγγραφο έχει τον τίτλο Παραμετρική Αναδιαμόρφωση Προσώπων σε Βίντεο, και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο Zhejiang και έναν από το Πανεπιστήμιο του Bath.

Για το Πρόσωπο

Υπό το νέο σύστημα, το βίντεο εξάγεται σε eine ακολουθία εικόνων, και μια σκληρή θέση εκτιμάται για κάθε πρόσωπο. Στη συνέχεια, ένας αντιπροσωπευτικός αριθμός επόμενων καρέτων εκτιμάται από κοινού για να κατασκευαστούν συνεπή παραμετρικές ταυτότητας καθ’ όλη τη διάρκεια της εκτέλεσης (δηλαδή τα καρέ του βίντεο).

Αρχιτεκτονική ροή του συστήματος παραμόρφωσης προσώπου.

Αρχιτεκτονική ροή του συστήματος παραμόρφωσης προσώπου.

Μετά από αυτό, η έκφραση αξιολογείται, δίνοντας einen παραμετρικό παράγοντα που εφαρμόζεται με γραμμική παλινδρόμηση. Στη συνέχεια, μια νέα υπογεγραμμένη απόσταση (SDF) προσέγγιση κατασκευάζει μια πυκνή 2D χαρτογράφηση των χαρακτηριστικών του προσώπου πριν και μετά την αναδιαμόρφωση.

Τέλος, μια συνειδητή βελτιστοποίηση παραμόρφωσης εφαρμόζεται στο εξοδοβίντεο.

Παραμετρικά Πρόσωπα

Η διαδικασία χρησιμοποιεί ένα 3D Μοντέλο Προσώπου (3DMM), einen όλο και περισσότερο δημοφιλή βοηθό για νευρωνικά και GAN-βασισμένα συστήματα σύνθεσης προσώπου, καθώς και για συστήματα ανίχνευσης deepfakes.

Όχι από το έγγραφο, αλλά ένα παράδειγμα ενός 3D Μοντέλου Προσώπου (3DMM) – ενός παραμετρικού πρωτοτύπου προσώπου που χρησιμοποιείται στο νέο έργο. Πάνω αριστερά, εφαρμογή ορόσημων σε ένα 3DMM πρόσωπο. Πάνω δεξιά, οι κόμβοι του 3D πλέγματος. Κάτω αριστερά, εφαρμογή ορόσημων: κάτω-μέση, ένα ισοπλάνο του εξαγόμενου προσώπου. Κάτω δεξιά, ένα τελικό αποτέλεσμα και σχήμα. Πηγή: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Όχι από το νέο έγγραφο, αλλά ένα παράδειγμα ενός 3D Μοντέλου Προσώπου (3DMM) – ενός παραμετρικού πρωτοτύπου προσώπου που χρησιμοποιείται στο νέο έργο. Πάνω αριστερά, εφαρμογή ορόσημων σε ένα 3DMM πρόσωπο. Πάνω δεξιά, οι κόμβοι του 3D πλέγματος. Κάτω αριστερά, εφαρμογή ορόσημων: κάτω-μέση, ένα ισοπλάνο του εξαγόμενου προσώπου. Κάτω δεξιά, ένα τελικό αποτέλεσμα και σχήμα. Πηγή: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

Η διαδικασία του νέου συστήματος πρέπει να λαμβάνει υπόψη περιπτώσεις οπτικής αποκρύφης, όπως μια περίπτωση όπου ο υποκείμενος κοιτάζει μακριά. Αυτό είναι ένα από τα μεγαλύτερα προβλήματα στο λογισμικό deepfakes, поскольку τα ορόσημα FAN έχουν μικρή ικανότητα να αντιμετωπίσουν αυτές τις περιπτώσεις και να διατηρήσουν την ποιότητα τους καθώς το πρόσωπο αποστρέφεται ή είναι οπτικά αποκρυμμένο.

Το νέο σύστημα μπορεί να αποφύγει αυτή την παγίδα ορίζοντας μια ενέργεια περιγράμματος που είναι ικανή να ταιριάζει στα όρια μεταξύ του 3D προσώπου (3DMM) και του 2D προσώπου (όπως ορίζεται από τα ορόσημα FAN).

Βελτιστοποίηση

Μια χρήσιμη εφαρμογή για ένα τέτοιο σύστημα θα ήταν να εφαρμόσει πραγματική αναμόρφωση σε πραγματικό χρόνο, για παράδειγμα σε φίλτρα βίντεο-κλήσεων. Το τρέχον πλαίσιο δεν επιτρέπει这一, και οι υπολογιστικές πόρους που απαιτούνται θα έκαναν την “ζωντανή” αναμόρφωση một σημαντική πρόκληση.

Σύμφωνα με το έγγραφο, και με την υπόθεση ενός στόχου βίντεο 24fps, οι επιχειρήσεις ανά καρέ στην αγωγή αντιπροσωπεύουν καθυστέρηση 16,344 δευτερολέπτων για κάθε δευτερόλεπτο βίντεο, με πρόσθετες μονοκράτηδες χτυπήματα για εκτίμηση ταυτότητας και αναμόρφωση 3D προσώπου (321ms και 160ms, αντίστοιχα).

Επομένως, η βελτιστοποίηση είναι κλειδί για την πρόοδο προς την μείωση της καθυστέρησης.既然 η κοινή βελτιστοποίηση σε όλα τα καρέ θα προσθέσει σοβαρή επιβάρυνση στη διαδικασία, και η βελτιστοποίηση init-στυλ (υποθέτοντας την συνεχή επόμενη ταυτότητα του ομιλητή από το πρώτο καρέ) θα μπορούσε να οδηγήσει σε ανωμαλίες, οι συγγραφείς έχουν υιοθετήσει ένα稀疏 σχήμα για τον υπολογισμό των συντελεστών των καρέ που δειγματίζονται σε πρακτικά διαστήματα.

Η κοινή βελτιστοποίηση εφαρμόζεται στη συνέχεια σε αυτό το υποσύνολο καρέτων, οδηγώντας σε μια πιο λιτή διαδικασία ανακατασκευής.

Παραμόρφωση Προσώπου

Η τεχνική παραμόρφωσης που χρησιμοποιείται στο έργο είναι μια προσαρμογή της εργασίας των συγγραφέων του 2020 Βαθιά Παραμορφωμένα Πρόσωπα (DSP).

Βαθιά Παραμορφωμένα Πρόσωπα, μια υποβολή του 2020 στο ACM Multimedia. Το έγγραφο είναι υπό την ηγεσία ερευνητών από το ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Πηγή: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Βαθιά Παραμορφωμένα Πρόσωπα, μια υποβολή του 2020 στο ACM Multimedia. Το έγγραφο είναι υπό την ηγεσία ερευνητών από το ZJU-Tencent Game and Intelligent Graphics Innovation Technology Joint Lab. Πηγή: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

Οι συγγραφείς παρατηρούν ‘Εκτείνουμε αυτή τη μέθοδο από την αναμόρφωση μιας μονοπтиικής εικόνας στην αναμόρφωση της ολόκληρης ακολουθίας εικόνων.’

Δοκιμές

Το έγγραφο παρατηρεί ότι δεν υπήρχε συγκρίσιμο προηγούμενο υλικό για να αξιολογήσει τη νέα μέθοδο. Επομένως, οι συγγραφείς σύγκριναν καρέ του παραμορφωμένου βίντεο με στατικά αποτελέσματα DSP.

Δοκιμή του νέου συστήματος με στατικές εικόνες από τα Βαθιά Παραμορφωμένα Πρόσωπα.

Δοκιμή του νέου συστήματος με στατικές εικόνες από τα Βαθιά Παραμορφωμένα Πρόσωπα.

Οι συγγραφείς σημειώνουν ότι τα τεχνικά προβλήματα προκύπτουν από τη μέθοδο DSP, λόγω της χρήσης σπάνιας χαρτογράφησης – ένα πρόβλημα που το νέο πλαίσιο λύνει με πυκνή χαρτογράφηση. Επιπλέον, το βίντεο που παράγεται από το DSP, το έγγραφο υποστηρίζει, δείχνει έλλειψη ομαλότητας και οπτικής συνάφειας.

Οι συγγραφείς δηλώνουν:

‘Τα αποτελέσματα δείχνουν ότι η προσέγγισή μας μπορεί να παράγει συνεπή και πειστικά αναμορφωμένα βίντεο προσώπων, ενώ η μέθοδος βασισμένη σε εικόνες μπορεί να οδηγήσει σε φανερά σφαλματικά τεχνικά προβλήματα.’

Δείτε το συνημμένο βίντεο παρακάτω, για περισσότερα παραδείγματα:

 

Πρώτη δημοσίευση 9ης Μαΐου 2022. Τροποποιήθηκε 6μμ EET, αντικατέστησε ‘πεδίο’ με ‘συνάρτηση’ για SDF.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai