Η γωνία του Anderson
Νέα Μέθοδος Deepfake Λύει το Πρόβλημα του “Face Host”

Παρά τις πολλές χρόνια υπερβολής των μέσων ενημέρωσης σχετικά με το потенциαλικό των εικονικών εικόνων να υπονομεύσουν την πίστη μας στην αυθεντικότητα των βίντεο, όλες οι τρέχουσες μεθόδοι βασίζονται στην εύρεση “face hosts” που είναι γενικά παρόμοια σε σχήμα με το στόχο πρόσωπο.
Όπου η αρχική εγγραφή παρουσιάζει ένα ευρύ πρόσωπο, αλλά το στόχο πρόσωπο έχει ένα στενό πρόσωπο, τα αποτελέσματα έχουν πάντα προβλήματα, επειδή μια τέτοια μεταφορά περιλαμβάνει το κόψιμο的一部分 του αρχικού προσώπου και την ανακατασκευή του τώρα-εμφανιζόμενου φόντου. Τα τρέχοντα πακέτα όπως το DeepFaceLab και το FaceSwap μπορούν να παράγουν περιορισμένα αποτελέσματα όταν η διαμόρφωση είναι αντεστραμμένη (στενό > ευρύ), αλλά δεν έχουν τη δυνατότητα να αντιμετωπίσουν πειστικά αυτή την περίπτωση.
Τώρα, μια συνεργασία μεταξύ της Tencent και του Πανεπιστημίου της Ξιάνεν στην Κίνα έχει αναπτύξει μια νέα προσέγγιση, με τίτλο HifiFace, σχεδιασμένη για να διορθώσει αυτήν την ελλειπή.

Δύο HifiFace deepfakes, το πρώτο της Anne Hathaway, όπου μια καλή ομοιότητα επιτυγχάνεται παρά την ασυμβατότητα του σχήματος του προσώπου. Το HifiFace λειτουργεί επίσης καλά σε στόχους με γυαλιά, παραδοσιακά ένα εμπόδιο στις εικονικές εικόνες. Πηγή: https://arxiv.org/pdf/2106.09965.pdf
Αναμόρφωση του Προσώπου του Deepfake
Προηγούμενες προσεγγίσεις, όπως το Subject Agnostic Face Swapping and Reenactment (FSGAN), έχουν βασιστεί στην 3DMM fitting (3D Morphable Models) ή άλλες μεθόδοι που βασίζονται σε αναγνώριση προσώπου ή μετασχηματισμό, όπου τα χαρακτηριστικά του προσώπου που θα “γραφτούν” ορίζουν τα όρια της ανταλλαγής:

Αναγνώριση χαρακτηριστικών προσώπου 3DMM. Πηγή: https://github.com/Yinghao-Li/3DMM-fitting
Αν και οι ανταγωνιστικές μεθόδοι έχουν βασιστεί σε χαρακτηριστικά που προέρχονται από δίκτυα αναγνώρισης προσώπου, αυτά στοχεύουν κυρίως στην ανακατασκευή της υφής παρά της δομής, και παράγουν ένα “mask-like” αποτέλεσμα σε περιπτώσεις όπου το πρόσωπο του ξενιστή δεν είναι εντελώς συμβατό (δηλ. τα όρια και το σχήμα των μαλλιών, της γνάθου και των ζυγωματικών).
Για να αντιμετωπίσουν αυτά τα προβλήματα, οι Κινέζοι ερευνητές, που базίζονται στο Εργαστήριο Αναλυτικών Μέσων και Υπολογιστών του Τμήματος Τεχνητής Νοημοσύνης, ανέπτυξαν ένα δίκτυο από άκρο σε άκρο που εκτιμά τους συντελεστές του στόχου και του αρχικού προσώπου χρησιμοποιώντας ένα 3D μοντέλο ανακατασκευής, το οποίο στη συνέχεια ανασυνδυάζεται ως πληροφορίες σχήματος, και συνδυάζεται με πληροφορίες διαύθυνσης από ένα δίκτυο αναγνώρισης προσώπου.
Αυτά τα γεωμετρικά δεδομένα στη συνέχεια εισάγονται σε ένα μοντέλο κωδικοποιητή-αποκωδικοποιητή ως δομικές πληροφορίες, αναμιγνύοντας με την έκφραση και τη διάθεση του στόχου, τα οποία χρησιμοποιούνται ως βοηθητικές πηγές για ακριβή μεταφορά.
Σημαντική Ανασύνθεση του Προσώπου
Επιπλέον, το HifiFace περιλαμβάνει ένα στοιχείο Σημαντικής Ανασύνθεσης του Προσώπου (SFF), το οποίο χρησιμοποιεί μια χαμηλού επιπέδου χαρακτηριστικό στο κωδικοποιητή για να διατηρήσει χωρικές και υφής πληροφορίες, χωρίς να θυσιάσει την ταυτότητα της εικόνας του στόχου. Χαρακτηριστικά από τον κωδικοποιητή και τον αποκωδικοποιητή ενσωματώνονται σε μια εκμαθημένη προσαρμοστική μάσκα, και οι πληροφορίες φόντου αναμιγνύονται στο αποτέλεσμα με τη μάσκα του προσώπου.

HifiFace σε δράση. Πηγή: https://johann.wang/HifiFace/
Με αυτόν τον τρόπο, το HifiFace απομακρύνεται από τη χρήση των αρχικών ορίων του προσώπου ως σκληρό όριο, χρησιμοποιώντας τη διασταλική ανασύνθεση του προσώπου, όπου το μοντέλο μπορεί να εκτελέσει καλύτερη προσαρμοστική σύντηξη στα όρια του προσώπου.

Δύο προηγούμενες προσεγγίσεις (πάνω και κάτω αριστερά), και η νέα αρχιτεκτονική του HifiFace, η οποία αποτελείται από einen κωδικοποιητή, αποκωδικοποιητή, 3D σχήματος-ευαίσθητο εξαγωγέα ταυτότητας, και SFF μονάδα.
Σε μια σύγκριση με προηγούμενες μεθόδοι FSGAN, SimSwap και FaceShifter, το HifiFace παρουσιάζει μια ανώτερη ανακατασκευή του σχήματος του προσώπου, επειδή δεν προσεγγίζει “φανταστικά” στοιχεία όπου τα όρια του προσώπου μπερδεύουν την ταυτότητα, αλλά ανακατασκευάζει τα σαφώς.
Δοκιμή
Οι ερευνητές υλοποίησαν το σύστημα χρησιμοποιώντας το VGGFace2 και τα δεδομένα DeepGlint Asian-Celeb. Τα πρόσωπα ευθυγραμμίστηκαν μέσω 5 εξωτερικών σημείων και ανα-κομμάτιασαν σε 256×256 εικονοστοιχεία. Ένα δίκτυο ενίσχυσης πορτρέτου χρησιμοποιήθηκε επίσης για να δημιουργηθεί μια εκδοχή 512×512 εικονοστοιχείων, για ένα επιπλέον υψηλής ανάλυσης μοντέλο. Το μοντέλο εκπαιδεύτηκε με Adam.
Αν και το FaceShifter διατηρεί την ταυτότητα καλά, δεν μπορεί να αντιμετωπίσει προβλήματα όπως η έκφραση, το χρώμα και η απόκρυψη τόσο αποτελεσματικά όσο το HifiFace, και έχει μια πιο σύνθετη δομή δικτύου. Το FSGAN έχει προβλήματα στη μεταφορά του φωτισμού από την πηγή στο στόχο.
Οι ερευνητές χρησιμοποιούν FaceForensics++ για ποσοτικές συγκρίσεις, δειγματοληψία δέκα καρέ σε μια παρτίδα μετατρεπόμενων βίντεο σε ανταγωνιστικές μεθόδοι, και βρήκαν ότι το HifiFace πέτυχε ένα ανώτερο σκορ ανάκτησης ταυτότητας. Σε δοκιμές μιας σειράς άλλων παραγόντων, όπως την ποιότητα της εικόνας, οι ερευνητές também βρήκαν ότι η μέθοδός τους υπερέβη τις ανταγωνιστικές μεθόδοι.
Το έργο αντιπροσωπεύει μια περαιτέρω κίνηση προς την αφαίρεση του υλικού så ώστε να είναι μόνο ένα χαλαρό πρότυπο στο οποίο ακριβείς ταυτότητες μπορούν να μεταφερθούν. Κάποια από τα τρέχοντα FOSS πακέτα, συμπεριλαμβανομένου του DeepFaceLab, έχουν νασέντα λειτουργικότητα για αντικατάσταση ολόκληρου του κεφαλιού, αλλά, όπως το HifiFace, αυτά δεν λαμβάνουν υπόψη τα μαλλιά, και είναι πιο αποτελεσματικά στο “χτίσιμο” ενός προσώπου παρά στο “γλύψιμο” για να ταιριάζει σε ένα επιθυμητό στόχο.

















