Η γωνία του Anderson
Η Disney Συνδυάζει CGI με Νευρωνική Απόδοση για να Αντιμετωπίσει την “Παραξενιά της Κοιλάδας”

Η ερευνητική ομάδα AI της Disney έχει αναπτύξει μια υβριδική μέθοδο για την προσομοίωση προσώπου υψηλής ποιότητας, συνδυάζοντας τα πλεονεκτήματα της νευρωνικής απόδοσης προσώπου με τη συνεπή προσέγγιση CGI.
Το εκκρεμές έγγραφο έχει τον τίτλο Απόδοση με Στυλ: Συνδυασμός Παραδοσιακών και Νευρωνικών Προσεγγίσεων για Υψηλής Ποιότητας Απόδοση Προσώπου και παρουσιάζεται σε ένα νέο 10λεπτο βίντεο στο κανάλι YouTube της Disney Research (εμφανίζεται στο τέλος του άρθρου*).

Πλέγματα που συνδυάζονται με νευρωνικές αποδόσεις προσώπου. Δείτε το βίντεο στο τέλος του άρθρου για καλύτερη λεπτομέρεια και ποιότητα. Πηγή: https://www.youtube.com/watch?v=k-RKSGbWLng (αντικαταστάθηκε από https://www.youtube.com/watch?v=TwpLqTmvqVk)
Όπως σημειώνει το βίντεο, η νευρωνική απόδοση προσώπου (συμπεριλαμβανομένων των deepfakes) μπορεί να παράγει πιο ρεαλιστικά μάτια και εσωτερικά του στόματος από ό,τι η CGI, ενώ οι υφές προσώπου CGI είναι πιο συνεπείς και κατάλληλες για κινηματογραφική παραγωγή VFX.
Ως εκ τούτου, η Disney πειραματίζεται με την Nutzung του νευρωνικού γεννήτορα StyleGan2 της NVIDIA για να χειριστεί τα περιβάλλοντα χαρακτηριστικά του προσώπου και τα “ζωντανοκρίσιμα” στοιχεία όπως τα μάτια, ενώ επιβάλλει συνεπείς υφές προσώπου CGI και σχετικά στοιχεία στο αποτέλεσμα.

Από το βίντεο (δείτε το τέλος του άρθρου), η αρχιτεκτονική концепция της υβριδικής προσέγγισης της Disney, όπου ένα πλέγμα CGI παλαιού τύπου, του τύπου που χρησιμοποιήθηκε για να αναδημιουργηθεί η ‘νέα’ Κάρι Φίσερ και ο αείμνηστος Πίτερ Κάσινγκ για το Rogue One (2016), ενσωματώνεται σε νευρωνικά αποδομένα περιβάλλοντα προσώπου.
Το βίντεο αναφέρει επίσης:
‘[Υπάρχει] ακόμη ένα τεράστιο χάσμα μεταξύ του τι μπορούν οι άνθρωποι να πιάσουν και να αποδώσουν και του τελικού φωτορεαλιστικού ψηφιακού διπλού, πλήρως εξοπλισμένου με μαλλιά, μάτια και εσωτερικό στόματος. Για να κλείσει αυτό το χάσμα, συνήθως απαιτείται πολλή χειρωνακτική εργασία από εξειδικευμένους καλλιτέχνες.’
Στην πραγματικότητα, ακόμη και τα πιο σύγχρονα συστήματα αποδοχής προσώπου δεν προσπαθούν να αναδημιουργήσουν μάτια, εσωτερικά του στόματος ή μαλλιά, τα οποία είτε έχουν ζητήματα αυθεντικότητας σε τέτοιες τεχνικές (μάτια) είτε ζητήματα χρονικής συνεπής (μαλλιά).

Το βίντεο δείχνει τι θα λάβουν οι καλλιτέχνες VFX μετά από μια τυπική σύγχρονη σύναψη προσώπου. Τα μάτια, τα μαλλιά, τα γένια και τα εσωτερικά του στόματος θα πρέπει όλα να χειριστούν από ξεχωριστές ομάδες στη διαδικασία παραγωγής, επιπλέον της υφής και του φωτισμού.
Έλεγχος Φωτισμού
Η υβριδική προσέγγιση είναι επίσης ένα πλεονέκτημα με την επαναφωτισμό – μια αξιοσημείωτη πρόκληση για την νευρωνική απόδοση προσώπου, поскольку οι υφές προσώπου CGI μπορούν να επαναφωτιστούν πιο εύκολα.

Μια κινούμενη εκδοχή της CGI/Νευρωνικής προσέγγισης.
Σε πιο απαιτητικά περιβάλλοντα, όπως εξωτερικές λήψεις, οι ερευνητές έχουν αναπτύξει μια μέθοδο για την επανασύνθεση γύρω από μια ζώνη που περιβάλλει το άτομο που ‘δημιουργείται’.

Μια μαύρη περιφέρεια δημιουργείται για να επιτρέψει ένα ‘κανβά’ για την επανασύνθεση των εξωτερικών μερών της ταυτότητας και την ενσωμάτωση της υφής προσώπου CGI στο συνδυασμένο αποτέλεσμα CGI/νευρωνικό.
Το βίντεο αναφέρει επίσης:
‘[Η] νευρωνική απόδοση δεν ταιριάζει τέλεια με την περιοριστική πρόταση του φόντου. – προορίζεται μόνο ως οδηγός, поскольку η βελτιστοποίηση για ρεαλιστικά ανθρώπινα στοιχεία όπως τα μαλλιά, τα μάτια και τα δόντια είναι ο κύριος στόχος. Πιο απαιτητικό είναι να διατηρήσουμε μια συνεπή ταυτότητα, ενώ αλλάζουμε την φωτισμό του περιβάλλοντος.’
Δημιουργία Πλεγμάτων CGI από Νευρωνικές Αποδόσεις
Η ερευνητική ομάδα έχει επίσης αναπτύξει einen αυτο-κωδικοποιητή που εκπαιδεύτηκε σε μια μεγάλη βάση δεδομένων 3D εικόνων προσώπου και ισχυρίζεται ότι μπορεί να παράγει ‘τυχαία αλλά πιθανές’ 3D πλέγματα προσώπου από δεδομένα αλήθειας.
Υπάρχουν περιορισμοί για αυτή την έρευνα να ξεπεραστούν, συμπεριλαμβανομένης της δυσκολίας να διατηρηθούν τα μαλλιά σταθερά στις νευρωνικές αποδόσεις και το βίντεο (δείτε παρακάτω) δείχνει πολλά παραδείγματα ταχέως μεταβαλλόμενων μαλλιών σε μια αλλιώς συνεπή περιστροφή γύρω από ένα CGI/νευρωνικό πρόσωπο.
Η χρονική συνεπής στην νευρωνική απόδοση βίντεο είναι ένα πολύ rộngτερο πρόβλημα από το πρόβλημα της Disney, και φαίνεται πιθανό ότι μεταγενέστερες εκδοχές αυτού του συστήματος μπορεί να καταφύγουν στην προσθήκη μαλλιών ‘σε μετα-παραγωγή’, ή διάφορες άλλες πιθανές προσεγγίσεις για την παραγωγή μαλλιών παρά την ελπίδα ότι μια νέα νευρωνική προσέγγιση θα λύσει最終 το πρόβλημα.
Χρήσεις για τη Δημιουργία Δεδομένων
Η μέθοδος προτείνεται επίσης ως μια πιθανή μέθοδος για τη δημιουργία συνθετικών δεδομένων και την εμπλουτισμένη τοπίο εικόνων προσώπου, το οποίο έχει τα τελευταία χρόνια γίνει επικίνδυνα μονότονο.

Η Disney φαντάζεται την καινούρια τεχνική να πληρώνει τις εικόνες δεδομένων προσώπου.
‘[Κάθε] φωτορεαλιστικό αποτέλεσμα που παράγουμε έχει μια υποκείμενη αντίστοιχη γεωμετρία και χάρτες εμφάνισης, αποδομένα από άγνωστες οπτικές γωνίες με γνωστή φωτισμό. Αυτή η ‘αλήθεια’ πληροφορία μπορεί να είναι ζωτικής σημασίας για την εκπαίδευση εφαρμογών, όπως η μονοοπτική 3D ανακατασκευή προσώπου, η αναγνώριση προσώπου ή η κατανόηση σκηνής. Και έτσι κάθε αποτέλεσμα απόδοσης μπορεί να θεωρηθεί ως δείγμα δεδομένων, και μπορούμε να παράγουμε πολλές παραλλαγές διαφόρων ατόμων.
‘Επιπλέον, ακόμη και για ένα μόνο άτομο που αποδίδεται σε μια seule έκφραση με μια seule οπτική γωνία και φωτισμό, μπορούμε να παράγουμε τυχαίες παραλλαγές της φωτορεαλιστικής απόδοσης, μεταβάλλοντας τον τυχαίο κώδικα κατά την оптимποίηση.’
Οι ερευνητές σημειώνουν ότι αυτή η ποικιλία των ρυθμίσεων εξόδου θα μπορούσε να είναι χρήσιμη για την εκπαίδευση εφαρμογών αναγνώρισης προσώπου, καταλήγοντας:
‘[Η] μέθοδος μας είναι σε θέση να αξιοποιήσει την τρέχουσα τεχνολογία για την σύναψη, μοντελοποίηση και απόδοση δέρματος προσώπου, και να δημιουργήσει αυτόματα πλήρη φωτορεαλιστικές αποδόσεις προσώπου που ταιριάζουν στην επιθυμητή ταυτότητα, έκφραση και ρύθμιση σκηνής. Αυτή η προσέγγιση έχει εφαρμογές και στην απόδοση προσώπου για κινηματογράφο και ψυχαγωγία, σώζοντας χειρωνακτική εργασία καλλιτεχνών και επίσης για τη δημιουργία δεδομένων σε διάφορους τομείς του βαθύ μαθηματικού μοντέλου.’
Για μια πιο sâuμένη ματιά στην καινούρια προσέγγιση, δείτε το 10λεπτο βίντεο που κυκλοφόρησε σήμερα:
* Το αρχικό βίντεο αντικαταστάθηκε με ένα άλλο που φαίνεται να είναι πανομοιότυπο 8 ώρες μετά την δημοσίευση του άρθρου. Αλλάξα όλα τα σχετικά συνδέσμους, καθώς δεν υπάρχει ίχνος του αρχικού βίντεο.
8:24 GMT+2 – Αντικαταστάθηκε το βίντεο, καθώς αντικαταστάθηκε από το κανάλι YouTube της Disney Research για κάποιο λόγο.












