Η γωνία του Anderson

Η Disney συνδυάζει CGI με νευρωνική απόδοση για να αντιμετωπίσει το ‘απροσδόκητο χάσμα’

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το τμήμα έρευνας AI της Disney ανέπτυξε μια υβριδική μέθοδο για προσομοίωση προσώπων κινηματογραφικής ποιότητας, συνδυάζοντας τις δυνάμεις της νευρωνικής απόδοσης προσώπων με τη σταθερότητα μιας προσέγγισης βασισμένης σε CGI.

Το εν αναμονή άρθρο έχει τίτλο Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering και προβάλλεται σε ένα νέο 10‑λεπτο βίντεο στο κανάλι Disney Research του YouTube (ενσωματωμένο στο τέλος του άρθρου*).

Meshes combined with neural facial renders. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Δίκτυα συνδυασμένα με νευρωνικές αποδόσεις προσώπων. Δείτε το ενσωματωμένο βίντεο στο τέλος του άρθρου για καλύτερη λεπτομέρεια και ποιότητα. Πηγή: https://www.youtube.com/watch?v=TwpLqTmvqVk

Όπως σημειώνει το βίντεο, η νευρωνική απόδοση προσώπων (συμπεριλαμβανομένων των deepfake) μπορεί να παράγει πολύ πιο ρεαλιστικά μάτια και εσωτερικά του στόματος από ό,τι μπορεί το CGI, ενώ οι υφές προσώπου που προέρχονται από CGI είναι πιο συνεπείς και κατάλληλες για παραγωγή VFX κινηματογραφικού επιπέδου.

Ως εκ τούτου, η Disney πειραματίζεται με το να αφήσει τον νευρωνικό γεννήτρια StyleGan2 της NVIDIA να διαχειρίζεται τα περιβάλλοντα χαρακτηριστικά ενός προσώπου και τα ‘ζωτικής σημασίας’ στοιχεία όπως τα μάτια, ενώ επικάλυπτε συνεπή CGI δέρμα προσώπου και σχετικά στοιχεία στην έξοδο.

From the video (see end of article), the architectural concept behind Disney's hybrid approach, where an old-school CGI mesh, of the type used to recreate 'young' Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

Από το βίντεο (δείτε το τέλος του άρθρου), η αρχιτεκτονική έννοια πίσω από την υβριδική προσέγγιση της Disney, όπου ένα παραδοσιακό δίκτυο CGI, του τύπου που χρησιμοποιήθηκε για την αναδημιουργία της ‘νεαρής’ Carrie Fisher και του αποθανόντος Peter Cushing για το Rogue One (2016), ενσωματώνεται σε νευρωνικά αποδομένα περιβάλλοντα προσώπων.

«[Υπάρχει] ακόμη ένα τεράστιο χάσμα μεταξύ του τι μπορεί εύκολα να καταγράψει και να αποδώσει κάποιος και των τελικών φωτορεαλιστικών ψηφιακών διπλών, πλήρων με μαλλιά, μάτια και εσωτερικό του στόματος. Για να κλείσουμε αυτό το χάσμα, συνήθως απαιτείται πολύ χειροκίνητη εργασία από εξειδικευμένους καλλιτέχνες.»

Στην πραγματικότητα, ακόμη και τα πιο σύγχρονα συστήματα λήψης προσώπων δεν προσπαθούν καν να αναδημιουργήσουν τα μάτια, τα εσωτερικά του στόματος ή τα μαλλιά, τα οποία είτε αντιμετωπίζουν προβλήματα αυθεντικότητας σε τέτοιες τεχνικές (μάτια) είτε προβλήματα χρονικής συνέπειας (μαλλιά).

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline.

Το βίντεο δείχνει τι θα έχουν οι καλλιτέχνες VFX μετά από μια τυπική σύγχρονη συνεδρία λήψης προσώπου. Τα μάτια, τα μαλλιά, τα γένια και τα εσωτερικά του στόματος θα πρέπει όλα να διαχειρίζονται από ξεχωριστές ομάδες στην παραγωγική αλυσίδα, εκτός από την υφή και το φωτισμό.

Έλεγχος Φωτισμού

Η υβριδική προσέγγιση είναι επίσης επωφελής για επαναφωτισμό – μια αξιοσημείωτη πρόκληση για τη νευρωνική απόδοση προσώπων, καθώς οι επικάλυψεις δέρματος CGI μπορούν να επαναφωτιστούν πιο εύκολα.

An animated version of the CGI/Neural approach.

Μια κινούμενη έκδοση της προσέγγισης CGI/Neural.

Σε πιο απαιτητικά περιβάλλοντα, όπως εξωτερικές λήψεις, οι ερευνητές έχουν αναπτύξει μια μέθοδο επανασχέδιασης γύρω από ένα είδος αποπυρολεξικού ζώνης που περιβάλλει το άτομο που ‘δημιουργείται’.

A black margin is generated to allow a 'canvas' for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

Δημιουργείται ένα μαύρο περιθώριο για να επιτρέψει ένα ‘καμβά’ επανασχέδιασης των εξωτερικών τμημάτων της ταυτότητας και την ενσωμάτωση του δέρματος CGI στην συνδυασμένη έξοδο CGI/νευρωνική.

«[Το] νευρωνικό απόσπασμα δεν ταιριάζει τέλεια με τον περιορισμό του φόντου. – προορίζεται μόνο ως οδηγός, καθώς η βελτιστοποίηση για ρεαλιστικά ανθρώπινα στοιχεία όπως τα μαλλιά, τα μάτια και τα δόντια είναι ο κύριος στόχος. Πιο προκλητικό είναι να προσπαθήσουμε να διατηρήσουμε μια συνεπή ταυτότητα, ενώ αλλάζουμε το φωτισμό του περιβάλλοντος.»

Δημιουργία Δικτύων CGI από Νευρωνικές Αποδόσεις

Η ερευνητική ομάδα έχει επίσης αναπτύξει έναν παραλλαγικό αυτοκωδικοποιητή (variational autoencoder) εκπαιδευμένο σε μια (μη καθορισμένη) μεγάλη βάση δεδομένων 3D εικόνων προσώπων, και ισχυρίζεται ότι μπορεί να παράγει ‘τυχαία αλλά ρεαλιστικά’ 3D δίκτυα προσώπων από δεδομένα ground truth.

Υπάρχουν περιορισμοί που πρέπει να ξεπεραστούν, συμπεριλαμβανομένης της δυσκολίας να διατηρηθούν τα μαλλιά χρονικά συνεπή στις νευρωνικές αποδόσεις, και το βίντεο (δείτε παρακάτω) δείχνει αρκετά παραδείγματα γρήγορης μεταβολής των μαλλιών σε μια διαφορετικά συνεπή περιστροφή γύρω από ένα πρόσωπο CGI/νευρωνικό.

Η χρονική συνέπεια στην νευρωνική απόδοση βίντεο είναι ένα πολύ ευρύτερο πρόβλημα από το μόνο της Disney, και είναι πιθανό ότι μελλοντικές εκδόσεις αυτού του συστήματος θα καταφύγουν στην προσθήκη μαλλιών ‘μετά την επεξεργασία’, ή σε διάφορες άλλες προσεγγίσεις δημιουργίας μαλλιών, αντί να ελπίζουν ότι μια καινοτόμος νευρωνική μέθοδος θα το λύσει τελικά.

Χρήσεις για Δημιουργία Συνόλων Δεδομένων

Η μέθοδος προτείνεται επίσης ως ενδεχόμενη μέθοδος δημιουργίας συνθετικών δεδομένων και εμπλουτισμού του τοπίου συνόλων εικόνων προσώπων, το οποίο τα τελευταία χρόνια έχει γίνει επικίνδυνα μονότονο.

Disney envisages the new technique populating facial image datasets.

Η Disney προβλέπει ότι η νέα τεχνική θα γεμίσει τα σύνολα εικόνων προσώπων.

«[Κάθε] φωτορεαλιστικό αποτέλεσμα που παράγουμε διαθέτει μια υποκείμενη αντίστοιχη γεωμετρία και χάρτες εμφάνισης, αποδομένα από άγνωστες γωνίες κάμερας με γνωστό φωτισμό. Αυτές οι πληροφορίες ‘ground truth’ μπορούν να είναι κρίσιμες για την εκπαίδευση επόμενων εφαρμογών, όπως μονοκαμερατική, 3D ανακατασκευή προσώπου, αναγνώριση προσώπων ή κατανόηση σκηνής. Έτσι, κάθε απόδοση αποτελέσματος θα μπορούσε να θεωρηθεί δείγμα δεδομένων, και μπορούμε να δημιουργήσουμε πολλές παραλλαγές πολλών διαφορετικών ατόμων.»

«Επιπλέον, ακόμη και για ένα μόνο άτομο αποδομένο με μία έκφραση, μία γωνία και ένα φωτισμό, μπορούμε να δημιουργήσουμε τυχαίες παραλλαγές της φωτορεαλιστικής απόδοσης μεταβάλλοντας τον σπόρο τυχαιότητας κατά τη βελτιστοποίηση.»

Οι ερευνητές σημειώνουν ότι αυτή η ποικιλία ρυθμιζόμενης εξόδου θα μπορούσε να είναι χρήσιμη στην εκπαίδευση εφαρμογών αναγνώρισης προσώπων, καταλήγοντας:

«[Η] μέθοδός μας μπορεί να αξιοποιήσει την τρέχουσα τεχνολογία λήψης, μοντελοποίησης και απόδοσης δέρματος προσώπου, και να δημιουργήσει αυτόματα πλήρεις φωτορεαλιστικές αποδόσεις προσώπου που ταιριάζουν στην επιθυμητή ταυτότητα, έκφραση και διαμόρφωση σκηνής. Αυτή η προσέγγιση έχει εφαρμογές στην απόδοση προσώπων για ταινίες και ψυχαγωγία, εξοικονομώντας την εργασία των καλλιτεχνών, καθώς και για δημιουργία δεδομένων σε διάφορους τομείς της βαθιάς μάθησης.»

Για μια πιο λεπτομερή ματιά στη νέα προσέγγιση, δείτε το 10‑λεπτο βίντεο που κυκλοφόρησε σήμερα:

 * Ο αρχικός σύνδεσμος βίντεο αντικαταστάθηκε με έναν άλλον φαινομενικά πανομοιότυπο 8 ώρες μετά τη δημοσίευση του άρθρου. Ανέφερα όλες τις σχετικές συνδέσεις, καθώς δεν υπάρχει ίχνος του αρχικού βίντεο.

 

8:24 GMT+2 – Αντικαταστάθηκε το βίντεο, καθώς αφαιρέθηκε από το κανάλι Disney Research στο YouTube για κάποιο λόγο.

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai