Η γωνία του Anderson
RigNeRF: Μια Νέα Μέθοδος Deepfakes που Χρησιμοποιεί Νευρωνικά Πεδία Ραδιάντσας

Νέα έρευνα που αναπτύχθηκε στην Adobe προσφέρει την πρώτη βιώσιμη και αποτελεσματική μέθοδο deepfakes που βασίζεται σε Νευρωνικά Πεδία Ραδιάντσας (NeRF) – ίσως η πρώτη πραγματική καινοτομία στην αρχιτεκτονική ή προσέγγιση τα τελευταία πέντε χρόνια από την εμφάνιση των deepfakes το 2017.
Η μέθοδος, με τίτλο RigNeRF, χρησιμοποιεί τρισδιάστατα μοντέλα προσώπου (3DMMs) ως ενδιάμεσο στρώμα εργαλείων μεταξύ της επιθυμητής εισόδου (δηλαδή της ταυτότητας που θα επιβληθεί στο NeRF render) και του νευρωνικού χώρου, μια μέθοδος που έχει εγκαταλειφθεί ευρέως τα τελευταία χρόνια από προσεγγίσεις σύνθεσης προσώπου με τη χρήση Generative Adversarial Network (GAN), καμία από τις οποίες δεν έχει ακόμη παράγει λειτουργικά και χρήσιμα πλαίσια αντικατάστασης προσώπου για βίντεο.

Αντίθετα με τις παραδοσιακές deepfakes βίντεο, κανένα από το κινούμενο περιεχόμενο που απεικονίζεται εδώ δεν είναι ‘πραγματικό’, αλλά μάλλον είναι ένας εξερευνήσιμος νευρωνικός χώρος που εκπαιδεύτηκε σε σύντομο βίντεο. Στη δεξιά πλευρά βλέπουμε το τρισδιάστατο μοντέλο προσώπου (3DMM) να λειτουργεί ως διεπαφή μεταξύ των επιθυμητών χειρισμών (‘γέλιο’, ‘κοίταξε αριστερά’, ‘κοίταξε πάνω’, κ.λπ.) και των συνήθως αδιάβαστων παραμέτρων της οπτικής απεικόνισης του Νευρωνικού Πεδίου Ραδιάντσας. Για μια υψηλής ανάλυσης εκδοχή αυτού του clip, μαζί με άλλα παραδείγματα, δείτε τη σελίδα του έργου, ή τα ενσωματωμένα βίντεο στο τέλος του άρθρου. Πηγή: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html
Τα τρισδιάστατα μοντέλα προσώπου (3DMMs) είναι αποτελεσματικά μοντέλα CGI προσώπων, των οποίων οι παράμετροι μπορούν να προσαρμοστούν σε πιο αφηρημένα συστήματα σύνθεσης εικόνας, όπως το NeRF και το GAN, τα οποία είναι αλλιώς δύσκολο να ελεγχθούν.
Αυτό που βλέπετε στην εικόνα παραπάνω (μεσαία εικόνα, άνθρωπος με μπλε πουκάμισο), καθώς και την εικόνα ακριβώς κάτω (αριστερή εικόνα, άνθρωπος με μπλε πουκάμισο), δεν είναι ένα ‘πραγματικό’ βίντεο στο οποίο έχει επιβληθεί ένα μικρό τμήμα ‘ψεύτικου’ προσώπου, αλλά μια εντελώς συνθετημένη σκηνή που υπάρχει μόνο ως οπτική απεικόνιση νευρωνικού όγκου – συμπεριλαμβανομένου του σώματος και του φόντου:

Στο παράδειγμα ακριβώς πάνω, το βίντεο της πραγματικής ζωής στη δεξιά πλευρά (γυναίκα με κόκκινο φόρεμα) χρησιμοποιείται για να ‘κουκουλώσει’ την αναγνωρισμένη ταυτότητα (άνθρωπος με μπλε πουκάμισο) στην αριστερή πλευρά μέσω του RigNeRF, το οποίο (οι συγγραφείς ισχυρίζονται) είναι το πρώτο σύστημα NeRF που επιτυγχάνει διαχωρισμό στάσης και έκφρασης ενώ μπορεί να thựcείσει καινοφανείς συνθέσεις απόψεων.
Ο άνθρωπος στην αριστερή πλευρά της εικόνας πάνω был ‘καταγραφεί’ από ένα βίντεο 70 δευτερολέπτων από ένα smartphone, και τα δεδομένα εισόδου (συμπεριλαμβανομένης της ολόκληρης σκηνής) στη συνέχεια εκπαιδεύτηκαν σε 4 V100 GPUs για να ληφθεί η σκηνή.
Εφόσον τα τρισδιάστατα μοντέλα προσώπου (3DMMs) είναι επίσης διαθέσιμα ως ολικό σώμα παραμετρικώνproxies (και όχι μόνο ως ρίγες προσώπου), το RigNeRF ανοίγει την πιθανότητα για deepfakes ολόκληρου του σώματος, όπου η πραγματική ανθρώπινη κίνηση, υφή και έκφραση μεταφέρεται στο στρώμα CGI-παραμετρικής, το οποίο στη συνέχεια θα μεταφράσει δράση και έκφραση σε περιβάλλοντα NeRF και βίντεο.
Όσον αφορά το RigNeRF – κατάτασσε ως μέθοδο deepfakes με την τρέχουσα έννοια που οι τίτλοι καταλαβαίνουν τον όρο; Ή είναι απλά άλλο ημι-απενεργοποιημένο also-ran στο DeepFaceLab και άλλα συστήματα autoencoder deepfakes της εποχής του 2017;
Οι ερευνητές του νέου εγγράφου είναι αδιαμφισβήτητοι σε αυτό το σημείο:
‘Όντας μια μέθοδος που είναι ικανή να αναζωογονήσει τα πρόσωπα, το RigNeRF είναι ευάλωτο σε κακό uso από κακούς ηθοποιούς για τη δημιουργία deep-fakes.’
Το νέο έγγραφο έχει τίτλο RigNeRF: Πλήρως Ελεγχόμενα Νευρωνικά 3D Πορτρέτα, και προέρχεται από τον ShahRukh Atha του Πανεπιστημίου Stonybrook, einem стажист στην Adobe κατά την ανάπτυξη του RigNeRF, και τέσσερις άλλους συγγραφείς από την Adobe Research.
Πέρα από τις Autoencoder-Βάσεις Deepfakes
Η πλειοψηφία των ιογενών deepfakes που έχουν κατακτήσει τους τίτλους τα τελευταία χρόνια παράγονται από συστήματα autoencoder, που προέρχονται από τον κώδικα που δημοσιεύθηκε στο prompt-banned r/deepfakes subreddit το 2017 – αν και όχι πριν να αντιγραφεί στο GitHub, όπου έχει τώρα forked πάνω από χίλιες φορές, όχι τουλάχιστον στο δημοφιλές (αν αμφιλεγόμενο) DeepFaceLab distribution, και επίσης το FaceSwap project.
Εκτός από το GAN και το NeRF, τα συστήματα autoencoder έχουν επίσης πειραματιστεί με τα τρισδιάστατα μοντέλα προσώπου (3DMMs) ως ‘οδηγούς’ για βελτιωμένες συστήματα σύνθεσης προσώπου. Ένα παράδειγμα αυτού είναι το HifiFace project από τον Ιούλιο του 2021. Ωστόσο, δεν φαίνεται να έχουν αναπτυχθεί χρήσιμες ή δημοφιλείς πρωτοβουλίες από αυτήν την προσέγγιση μέχρι σήμερα.
Τα δεδομένα για τις σκηνές του RigNeRF λαμβάνονται με τη λήψη σύντομων βίντεο από smartphone. Για το έργο, οι ερευνητές του RigNeRF χρησιμοποίησαν ένα iPhone XR ή ένα iPhone 12 για όλα τα πειράματα. Για το πρώτο μισό της λήψης, ο υποκείμενος ζητείται να εκτελέσει eine ευρεία ποικιλία εκφράσεων προσώπου και ομιλίας ενώ κρατάει το κεφάλι του ακίνητο καθώς η κάμερα κινείται γύρω του.
Για το δεύτερο μισό της λήψης, η κάμερα διατηρεί μια σταθερή θέση ενώ ο υποκείμενος πρέπει να κινεί το κεφάλι του γύρω ενώ εκφράζει eine ευρεία ποικιλία εκφράσεων. Τα αποτέλεσμα 40-70 δευτερολέπτων βίντεο (περίπου 1200-2100 καρέ) αντιπροσωπεύουν το σύνολο δεδομένων που θα χρησιμοποιηθούν για την εκπαίδευση του μοντέλου.
Μειώνοντας τη Συλλογή Δεδομένων
Αντίθετα, τα συστήματα autoencoder όπως το DeepFaceLab απαιτούν τη σχετικά εργατική συλλογή και επιμέλεια χιλιάδων διαφορετικών φωτογραφιών, συχνά ληφθέντων από βίντεο YouTube και άλλα κοινωνικά μέσα, καθώς και από ταινίες (στην περίπτωση των deepfakes διασημοτήτων).
Τα αποτέλεσμα εκπαιδευμένα μοντέλα autoencoder συχνά προορίζονται να χρησιμοποιηθούν σε eine ποικιλία καταστάσεων. Ωστόσο, οι πιο φανταχτερές ‘διασημότητες’ deepfakers μπορεί να εκπαιδεύσουν ολόκληρα μοντέλα από την αρχή για ένα μόνο βίντεο, παρά το γεγονός ότι η εκπαίδευση μπορεί να διαρκέσει μια εβδομάδα ή περισσότερο.
Παρά την προειδοποιητική σημείωση από τους ερευνητές του νέου εγγράφου, τα ‘patchwork’ και ευρέως συναρμολογημένα σύνολα δεδομένων που τροφοδοτούν το AI πορνό καθώς και τις δημοφιλείς ανακατασκευές ‘deepfake’ στο YouTube/TikTok φαίνεται απίθανο να παράγουν αποδεκτά και συνεπή αποτελέσματα σε ένα σύστημα deepfakes όπως το RigNeRF, το οποίο έχει μια μεθοδολογία ειδική για σκηνή. Δεδομένων των περιορισμών στη λήψη δεδομένων που περιγράφονται στο νέο έργο, αυτό μπορεί να αποδειχθεί, σε κάποιο βαθμό, μια πρόσθετη ασφάλεια ενάντια στην εύκολη αθέμιτη χρήση ταυτότητας από κακούς deepfakers.
Προσαρμόζοντας το NeRF στα Deepfake Βίντεο
Το NeRF είναι μια μεθοδολογία φωτογραμμετρίας με την οποία ένα μικρό αριθμό πηγαίων εικόνων που λήφθηκαν από διάφορες οπτικές γωνίες συναρμολογούνται σε einen εξερευνήσιμο 3D νευρωνικό χώρο. Αυτή η προσέγγιση ήρθε στην προώθηση νωρίτερα αυτό το χρόνο όταν η NVIDIA παρουσίασε το Instant NeRF σύστημα, ικανό να μειώσει τους υπερβολικούς χρόνους εκπαίδευσης για το NeRF σε λεπτά, ή ακόμη και δευτερόλεπτα:

Instant NeRF. Πηγή: https://www.youtube.com/watch?v=DJ2hcC1orc4
Το αποτέλεσμα Neural Radiance Field σκηνή είναι ουσιαστικά μια στατική περιβάλλον που μπορεί να εξερευνηθεί, αλλά η οποία είναι δύσκολο να επεξεργαστεί. Οι ερευνητές σημειώνουν ότι δύο προηγούμενες πρωτοβουλίες NeRF-βασισμένες – HyperNeRF + E/P και NerFACE – έχουν δοκιμάσει τη σύνθεση βίντεο προσώπου, και (παραδόξως για χάρη της πληρότητας και της επιμέλειας) έχουν τοποθετήσει το RigNeRF ενάντια σε αυτές τις δύο αρχιτεκτονικές σε μια δοκιμή:


Μια ποιοτική σύγκριση μεταξύ RigNeRF, HyperNeRF, και NerFACE. Δείτε τις συνδεδεμένες πηγές βίντεο και PDF για υψηλότερης ποιότητας εκδόσεις. Στατική εικόνα πηγή: https://arxiv.org/pdf/2012.03065.pdf
Ωστόσο, σε αυτήν την περίπτωση, τα αποτελέσματα, τα οποία ευνοούν το RigNeRF, είναι κάπως ανωμαλά, για δύο λόγους: πρώτον, οι συγγραφείς παρατηρούν ότι ‘δεν υπάρχει υπάρχουσα εργασία για μια apple-to-apple σύγκριση’; δεύτερον, αυτό έχει απαιτήσει την περιορισμό των ικανοτήτων του RigNeRF για να αντιστοιχίσουν 至 τουλάχιστον μερικά την πιο περιορισμένη λειτουργικότητα των προηγούμενων συστημάτων.
Εφόσον τα αποτελέσματα δεν είναι μια σταδιακή βελτίωση της προηγούμενης εργασίας, αλλά μάλλον αντιπροσωπεύουν μια ‘βελτίωση’ στην επεξεργασία NeRF και χρησιμότητα, θα αφήσουμε την δοκιμή πλευρά και θα δούμε τι κάνει το RigNeRF διαφορετικά από τους προκατόχους του.
Συνδυασμένες Ισχύες
Η основная περιορισμός του NerFACE, το οποίο μπορεί να δημιουργήσει έλεγχο στάσης/έκφρασης σε ένα περιβάλλον NeRF, είναι ότι υποθέτει ότι η πηγή βίντεο θα ληφθεί με μια στατική κάμερα. Αυτό ουσιαστικά σημαίνει ότι δεν μπορεί να παράγει καινοφανείς απόψεις που υπερβαίνουν τις περιορισμούς λήψης. Αυτό παράγει ένα σύστημα που μπορεί να δημιουργήσει ‘κινούμενα πορτρέτα’, αλλά το οποίο είναι ακατάλληλο για deepfake-στυλ βίντεο.
Το HyperNeRF, από την άλλη πλευρά, ενώ μπορεί να παράγει καινοφανείς και υπερ-πραγματικές απόψεις, δεν έχει κανένα εργαλείο που να του επιτρέπει να αλλάξει στάσεις κεφαλιού ή εκφράσεις προσώπου, το οποίο και πάλι δεν οδηγεί σε κανένα είδος ανταγωνιστή για τα autoencoder-βασισμένα deepfakes.
Το RigNeRF είναι σε θέση να συνδυάσει αυτές τις δύο απομονωμένες λειτουργίες δημιουργώντας ένα ‘canonical space’, μια βασική γραμμή από την οποία οι αποκλίσεις και οι παραμορφώσεις μπορούν να ενεργηθούν μέσω της εισόδου από το 3DMM module.

Δημιουργία ενός ‘canonical space’ (χωρίς στάση, χωρίς έκφραση), στο οποίο οι παραμορφώσεις (δηλαδή οι στάσεις και οι εκφράσεις) που παράγονται από το 3DMM μπορούν να ενεργηθούν.
Εφόσον το σύστημα 3DMM δεν θα αντιστοιχεί ακριβώς με τον καταγεγραμμένο υποκείμενο, είναι σημαντικό να αποζημιωθεί αυτό κατά τη διαδικασία. Το RigNeRF επιτυγχάνει αυτό με ένα πεδίο παραμόρφωσης που υπολογίζεται από ένα Multilayer Perceptron (MLP) που προέρχεται από τα πηγή δεδομένα.

Οι παράμετροι κάμερας που απαιτούνται για τον υπολογισμό των παραμορφώσεων λαμβάνονται μέσω COLMAP, ενώ οι παράμετροι έκφρασης και σχήματος για κάθε καρέ λαμβάνονται από DECA.
Η τοποθέτηση είναι περαιτέρω βελτιωμένη μέσω landmark fitting και των παραμέτρων κάμερας του COLMAP, και, λόγω περιορισμών υπολογιστικών πόρων, η έξοδος βίντεο είναι downsampled σε 256×256 ανάλυση για εκπαίδευση (μια διαδικασία συρρίκνωσης που επίσης πλήττει την σκηνή autoencoder deepfaking).
Μετά από αυτό, το δίκτυο παραμόρφωσης εκπαιδεύεται στα τέσσερα V100s – ένα φοβερό υλικό που δεν είναι πιθανό να είναι εντός της εμβέλειας των ερασιτεχνών (ωστόσο, όπου η εκπαίδευση μοντέλων είναι ενδιαφερόμενη, είναι συχνά δυνατό να ανταλλάξει βαρύτητα με χρόνο, και απλά να αποδεχτεί ότι η εκπαίδευση μοντέλων θα είναι θέμα ημερών ή ακόμη και εβδομάδων).
Συμπερασματικά, οι ερευνητές δηλώνουν:
‘Σε αντίθεση με άλλες μεθόδους, το RigNeRF, χάρη στη χρήση eines 3DMM-οδηγού δίκτυου παραμόρφωσης, είναι σε θέση να μοντελοποιήσει στάση κεφαλιού, εκφράσεις προσώπου και την ολόκληρη σκηνή 3D πορτρέτου με υψηλή πιστότητα, δίνοντας καλύτερες ανακατασκευές με οξυμένες λεπτομέρειες.’
Δείτε τα ενσωματωμένα βίντεο παρακάτω για περαιτέρω λεπτομέρειες και αποτέλεσματα.
Πρώτη δημοσίευση 15η Ιουνίου 2022.












