Η γωνία του Anderson
Αναγνώριση Ψευδών Προσώπων Celebrities από τις Εξωτερικές Περιοχές του Προσώπου

Μια νέα συνεργασία μεταξύ της Microsoft και ενός κινεζικού πανεπιστημίου έχει προτείνει έναν νέο τρόπο για την αναγνώριση ψευδών προσώπων διασημοτήτων, αξιοποιώντας τις ελλείψεις των τρεχουσών τεχνικών ψευδών προσώπων για την αναγνώριση των ταυτοτήτων που έχουν “προβλεφθεί” σε άλλους ανθρώπους.
Η προσέγγιση ονομάζεται Transformer Συνέπειας Ταυτότητας (ICT), και λειτουργεί συγκρίνοντας τα εξωτερικά μέρη του προσώπου (γνάθος, ζυγωματικά, γραμμή μαλλιών, και άλλα εξωτερικά χαρακτηριστικά) με το εσωτερικό του προσώπου. Το σύστημα αξιοποιεί διαθέσιμα δημόσια δεδομένα εικόνων διασημοτήτων, τα οποία περιορίζουν την αποτελεσματικότητά του σε δημοφιλείς διασημότητες, των οποίων οι εικόνες είναι διαθέσιμες σε μεγάλους αριθμούς σε ευρέως διαθέσιμα σύνολα δεδομένων όρασης υπολογιστή και στο διαδίκτυο.

Η κάλυψη της ψευδούς προσώπου σε επτά τεχνικές: DeepFake σε FF+; DeepFake σε Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; και DF-VAE. Δημοφιλή πακέτα όπως το DeepFaceLab και το FaceSwap παρέχουν παρόμοια περιορισμένη κάλυψη. Πηγή: https://arxiv.org/pdf/2203.01318.pdf
Όπως δείχνει η εικόνα παραπάνω, οι τρέχουσες δημοφιλείς μεθόδοι για ψευδούς πρόσωπα είναι khá περιορισμένες και βασίζονται σε κατάλληλες εικόνες ξενιστή (η εικόνα ή το βίντεο ενός ατόμου που θα έχει την ταυτότητά του αντικατασταθεί από το ψευδές πρόσωπο) για να ελαττώσουν τις ενδείξεις αντικατάστασης προσώπου.
Αν και διαφορετικές μεθόδοι μπορεί να καλύπτουν το πλήρες μέτωπο και ένα μεγάλο μέρος των περιοχών της γνάθου και των ζυγωματικών, όλες είναι πιο ή λιγότερο περιορισμένες μέσα στο πλαίσιο του προσώπου ξενιστή.

Ένα χάρτης που τονίζει τις ‘εσωτερικές’ και ‘εξωτερικές’ ταυτότητες που υπολογίζονται από το ICT. Όπου μια εσωτερική ταυτότητα αντιστοιχεί αλλά μια εξωτερική ταυτότητα δεν αντιστοιχεί, το ICT αξιολογεί την εικόνα ως ψευδή.
Σε δοκιμές, το ICT απέδειξε ότι μπορεί να ανιχνεύσει περιεχόμενο ψευδούς προσώπου σε ψευδείς φιλικές συνθήκες, όπως χαμηλή ανάλυση βίντεο, όπου το περιεχόμενο του ολόκληρου βίντεο είναι υποβαθμισμένο από αρτεφάκτα συμπίεσης, βοηθώντας να κρυφούν τα υπολείμματα της διαδικασίας ψευδούς προσώπου – μια περίσταση που μπερδεύει πολλές ανταγωνιστικές μεθόδοι ανίχνευσης ψευδούς προσώπου.

Το ICT υπερέχει των ανταγωνιστών στην αναγνώριση περιεχομένου ψευδούς προσώπου. Δείτε το βίντεο που είναι ενσωματωμένο στο τέλος του άρθρου για περισσότερα παραδείγματα και καλύτερη ανάλυση. Δείτε το ενσωματωμένο πηγή βίντεο στο τέλος του άρθρου για περαιτέρω παραδείγματα. Πηγή: https://www.youtube.com/watch?v=zgF50dcymj8
Το έγγραφο έχει τον τίτλο Προστασία Διασημοτήτων με Transformer Συνέπειας Ταυτότητας, και προέρχεται από εννέα ερευνητές που συνδέονται με το Πανεπιστήμιο Επιστημών και Τεχνολογίας της Κίνας, την Ερευνητική Μονάδα της Microsoft στην Ασία, και την Microsoft Cloud + AI.
Η Χωρητικότητα Πιστότητας
Υπάρχουν τουλάχιστον δύο λόγοι για τους οποίους δημοφιλείς αλγόριθμοι ανταλλαγής προσώπων, όπως το DeepFaceLab και το FaceSwap, παραμελούν την εξωτερική περιοχή των ανταλλαγμένων ταυτοτήτων προσώπου.
Πρώτον, η εκπαίδευση μοντέλων ψευδούς προσώπου είναι χρονοβόρα και κρίσιμη για τους πόρους, και η υιοθέτηση “συμβατών” προσώπων/σώματος απελευθερώνει κύκλους GPU και επαναλήψεις για να εστιάσει στις σχετικά αμετάβλητες εσωτερικές περιοχές του προσώπου, τις οποίες χρησιμοποιούμε για να διακρίνουμε την ταυτότητα (καθώς μεταβλητές όπως η διακύμανση του βάρους και η γήρανση είναι λιγότερο πιθανό να αλλάξουν αυτά τα βασικά χαρακτηριστικά του προσώπου στο σύντομο χρονικό διάστημα).
Δεύτερον, οι περισσότερες μεθόδοι ψευδούς προσώπου (και αυτό είναι σίγουρα η περίπτωση με το DeepFaceLab, το λογισμικό που χρησιμοποιείται από τους πιο δημοφιλείς ή γνωστούς πρακτικούς) έχουν περιορισμένη ικανότητα να αναπαράγουν “τέλος του προσώπου” περιθώρια, όπως περιοχές ζυγωματικών και γνάθου, και είναι περιορισμένες από το γεγονός ότι ο κώδικας τους δεν αντιμετωπίζει εκτενώς αυτό το ζήτημα.
Στις περιπτώσεις όπου οι ταυτότητες δεν ταιριάζουν καλά, ο αλγόριθμος ψευδούς προσώπου πρέπει να “περιγράψει” περιοχές φόντου γύρω από το πρόσωπο, το οποίο το κάνει αδέξια ακόμη και στα χέρια των καλύτερων ψευδούς προσώπου, όπως το Ctrl Shift Face, του οποίου το περιεχόμενο χρησιμοποιήθηκε στις μελέτες του εγγράφου.
<img class="wp-image-180492 size-full" src="https://www.unite.ai/wp-content/uploads/2022/03/ctrl-shift-face.jpg" alt="Το καλύτερο από τα καλύτερα: στιγμιότυπα από ένα βίντεο ψευδούς προσώπου από τον αξιόλογο ψευδούς πρόσωπο Ctrl-Shift-Face, ανταλλάσσοντας τον Jim Carrey με τον Gary Oldman. Αυτό το έργο αντιπροσωπεύει πιθανώς το καλύτερο διαθέσιμο περιεχόμενο μέσω του DeepFaceLab και τεχνικών μετα-επεξεργασίας. Παρόλα αυτά, οι ανταλλαγές παραμένουν περιορισμένες στην σχετικά σπάνια προσοχή που δίνει το DFL στην εξωτερική περιοχή του προσώπου, απαιτώντας μια ηρωική προσπάθεια συλλογής δεδομένων και εκπαίδευσης για να αντιμετωπιστούν τα εξωτερικά χαρακτηριστικά. Πηγή: https://www.youtube.com/watch?v=x8igrh1eyLk
Αυτή η “πανδή” ή απόκρυψη της προσοχής σε μεγάλο βαθμό διαφεύγει της δημόσιας προσοχής στην τρέχουσα ανησυχία για την αυξανόμενη πραγματικότητα των ψευδών προσώπων, επειδή οι κρίσιμες ικανότητές μας γύρω από τα ψευδούς πρόσωπα εξακολουθούν να αναπτύσσονται πέρα από το στάδιο “έκπληξη και θαύμα”.
Διχωρισμένες Ταυτότητες
Το νέο έγγραφο σημειώνει ότι οι περισσότερες προηγούμενες μεθόδοι ανίχνευσης ψευδούς προσώπου βασίζονται σε τεχνικές που προδίδουν τη διαδικασία ανταλλαγής, όπως ασύμβατες στάσεις κεφαλής και αναπνοή, μεταξύ πολλών άλλων τεχνικών. Μόνο αυτή την εβδομάδα, ένα νέο έγγραφο ανίχνευσης ψευδούς προσώπου έχει προτείνει την χρήση της “υπογραφής” των διαφορετικών τύπων μοντέλων στο πλαίσιο FaceSwap για να βοηθήσει στην αναγνώριση ψευδούς βίντεο που δημιουργήθηκε με αυτό (δείτε την εικόνα παρακάτω).

Αναγνώριση ψευδών προσώπων με την χαρακτηριστική των υπογραφών των διαφορετικών τύπων μοντέλων στο πλαίσιο FaceSwap. Πηγή: https://arxiv.org/pdf/2202.12951.pdf
Αντίθετα, η αρχιτεκτονική του ICT δημιουργεί δύο ξεχωριστές εμβυθισμένες ταυτότητες για ένα άτομο, каждая από τις οποίες πρέπει να επαληθευτεί πριν από την ολοκλήρωση της ταυτότητας ως “αληθινή” εικόνα ή βίντεο.

Αρχιτεκτονική για τις φάσεις εκπαίδευσης και δοκιμής του ICT.
Η διχοτόμηση των ταυτοτήτων διευκολύνεται από einen μεταφραστή όρασης, ο οποίος thực hiện αναγνώριση προσώπου πριν από τη διαίρεση των ερευνώμενων περιοχών σε tokens που ανήκουν στις εσωτερικές ή εξωτερικές ταυτότητες.

Κατανομή patches μεταξύ των δύο παράλληλων σημάνσεων ταυτότητας.
Το έγγραφο αναφέρει:
‘Δυστυχώς, οι υφιστάμενες μεθόδοι επαλήθευσης προσώπου tend να χαρακτηρίζουν την πιο διακριτική περιοχή, δηλαδή το εσωτερικό πρόσωπο για επαλήθευση και να μην καταγράφουν την πληροφορία ταυτότητας στο εξωτερικό πρόσωπο. Με το Transformer Συνέπειας Ταυτότητας, εκπαιδεύουμε ένα μοντέλο για να μάθει ένα ζευγάρι διανυσμάτων ταυτότητας, ένα για το εσωτερικό πρόσωπο και ένα για το εξωτερικό πρόσωπο, σχεδιάζοντας einen μεταφραστή τέτοιο ώστε οι εσωτερικές και οι εξωτερικές ταυτότητες να μπορούν να μάθουν ταυτόχρονα σε ένα ενιαίο μοντέλο.’
Καθώς δεν υπάρχει υπάρχουσα μοντέλο για αυτή τη διαδικασία ταυτοποίησης, οι συγγραφείς έχουν δημιουργήσει einen νέο τύπο απώλειας συνέπειας που μπορεί να λειτουργήσει ως μετρητής αυθεντικότητας. Τα “εσωτερικά tokens” και “εξωτερικά tokens” που προκύπτουν από το μοντέλο εξαγωγής ταυτότητας προστίθενται στα συνήθη patch embeddings που παράγονται από πλαισιά των αναγνώρισης προσώπου.
Δεδομένα και Εκπαίδευση
Το δίκτυο ICT εκπαιδεύτηκε στο σύνολο δεδομένων MS-Celeb-1M της Microsoft Research, το οποίο περιέχει 10 εκατομμύρια εικόνες προσώπων διασημοτήτων που καλύπτουν 1 εκατομμύριο ταυτότητες, συμπεριλαμβανομένων ηθοποιών, πολιτικών και πολλών άλλων τύπων εξέχοντων προσωπικοτήτων. Σύμφωνα με τη διαδικασία της προηγούμενης μεθόδου Face X-ray (μια άλλη πρωτοβουλία της Microsoft Research), η διαδικασία δημιουργίας ψευδών του ICT ανταλλάσσει τις εσωτερικές και εξωτερικές περιοχές των προσώπων που προέρχονται από αυτό το σύνολο δεδομένων, για να δημιουργήσει υλικό για δοκιμή του αλγορίθμου.
Για να thực hiện αυτές τις εσωτερικές ανταλλαγές, το ICT αναγνωρίζει δύο εικόνες στο σύνολο δεδομένων που εμφανίζουν παρόμοιες στάσεις κεφαλής και χαρακτηριστικά προσώπου, δημιουργεί μια περιοχή μάσκας των κεντρικών χαρακτηριστικών (στην οποία μπορεί να πραγματοποιηθεί μια ανταλλαγή) και πραγματοποιεί μια ανταλλαγή ψευδούς προσώπου με διόρθωση χρωμάτων RGB.
Ο λόγος για τον οποίο το ICT περιορίζεται στην αναγνώριση διασημοτήτων είναι ότι βασίζεται (στην πιο αποτελεσματική του παραλλαγή) σε einen νέο σύνολο αναφοράς που περιλαμβάνει παραγόμενα διανύσματα προσώπου από einen κεντρικό κορμό (σε αυτή την περίπτωση το MS-Celeb-1M, αν και η αναφορά μπορεί να επεκταθεί σε διαθέσιμες εικόνες στο διαδίκτυο, οι οποίες θα ήταν πιθανό να υπάρχουν σε επαρκείς ποσότητες μόνο για γνωστές δημόσιες προσωπικότητες).
Αυτά τα ζευγάρια διανυσμάτων ταυτότητας που προκύπτουν από αυτές τις μεθόδοιες λειτουργούν ως tokens αυθεντικότητας για να επαληθεύσουν τις εσωτερικές και εξωτερικές περιοχές του προσώπου ταυτόχρονα.
Οι συγγραφείς σημειώνουν ότι τα tokens που προκύπτουν από αυτές τις μεθόδοιες αντιπροσωπεύουν “υψηλού επιπέδου” χαρακτηριστικά, οδηγώντας σε μια διαδικασία ανίχνευσης ψευδούς προσώπου που είναι πιο πιθανό να επιβιώσει σε απαιτητικά περιβάλλοντα, όπως χαμηλή ανάλυση βίντεο ή άλλα υποβαθμισμένα βίντεο.
Κρίσιμο είναι ότι το ICT δεν αναζητά αποδεικτικά στοιχεία που βασίζονται σε αρτεφάκτα, αλλά αντίθετα επικεντρώνεται σε μεθόδοι επαλήθευσης ταυτότητας που είναι πιο σύμφωνες με τεχνικές αναγνώρισης προσώπου – μια προσέγγιση που είναι δύσκολη με χαμηλή ποσότητα δεδομένων, όπως είναι η περίπτωση της διερεύνησης περιπτώσεων ψευδούς προσώπου εκδίκησης κατά μη διασημοτήτων στόχων.
Δοκιμές
Εκπαιδευμένο στο MS-Celeb-1M, το ICT χωρίστηκε σε εκδόσεις με αναφορά και “τυφλές” του αλγορίθμου και δοκιμάστηκε κατά μήκος μιας σειράς ανταγωνιστικών συνόλων δεδομένων και μεθόδων. Αυτά περιελάμβαναν FaceForensics++ (FF++), ένα σύνολο δεδομένων 1000 αυθεντικών και ψευδών βίντεο που δημιουργήθηκαν με τέσσερις μεθόδοι, συμπεριλαμβανομένων Face2Face και FaceSwap; το Deepfake Detection (DFD) της Google, το οποίο αποτελείται από χιλιάδες ψευδούς βίντεο που δημιουργήθηκαν από την Google; Celeb-DeepFake v1 (CD1), το οποίο περιλαμβάνει 408 αυθεντικά και 795 συνθετικά, χαμηλής ποιότητας βίντεο; Celeb-DeepFake v2, μια επέκταση της v1 που περιλαμβάνει 590 αυθεντικά και 5.639 ψευδούς βίντεο; και το Deeper-Forensics (Deeper) της Κίνας το 2020.
Αυτά είναι τα σύνολα δεδομένων; οι μεθόδοι ανίχνευσης που χρησιμοποιήθηκαν στις δοκιμές ήταν Μultitask, MesoInc4, Capsule, Xception-c0, c2 (μια μέθοδος που χρησιμοποιείται στο FF++), FWA/DSP-FW από το Πανεπιστήμιο του Albany, Two-Branch, PCL+I2G, και η μέθοδος context-discrepancy του Yuval Nirkin.
Οι ανωτέρω μεθόδοι ανίχνευσης στοχεύουν στην ανίχνευση συγκεκριμένων τύπων χειρισμού προσώπου. Επιπλέον, οι συγγραφείς του νέου εγγράφου δοκιμάσαν επίσης πιο γενικές προσεγγίσεις ανίχνευσης ψευδούς προσώπου Face X-ray, το FFD του Πανεπιστημίου του Michigan, CNNDetection, και Patch-Forensics από το CSAIL του MIT.
Το πιο εμφανές αποτέλεσμα από τη δοκιμή είναι ότι οι ανταγωνιστικές μεθόδοι πέφτουν δραματικά σε αποτελεσματικότητα καθώς η ανάλυση και η ποιότητα του βίντεο μειώνονται. Καθώς κάποια από τα πιο σοβαρά πιθανά για ψευδούς πρόσωπα να διεισδύσουν στις κρίσιμες μας ικανότητες (όχι τουλάχιστον αυτή τη στιγμή) βρίσκονται σε μη HD ή άλλα υποβαθμισμένα βίντεο, αυτό θα φαινόταν να είναι ένα σημαντικό αποτέλεσμα.

Στο γράφημα των αποτελεσμάτων παραπάνω, οι μπλε και κόκκινες γραμμές δείχνουν την ανθεκτικότητα των μεθόδων ICT στην υποβάθμιση της εικόνας σε όλες τις περιοχές εκτός από το εμπόδιο του θορύβου Gaussian (που δεν είναι πιθανό σε βίντεο Zoom και webcam-στυλ), ενώ η αξιοπιστία των ανταγωνιστικών μεθόδων πέφτει δραματικά.
Στον πίνακα των αποτελεσμάτων παρακάτω, βλέπουμε την αποτελεσματικότητα των διαφορετικών μεθόδων ανίχνευσης ψευδούς προσώπου στα μη είδημένα σύνολα δεδομένων. Οι γκρίζες και αστερισμένες γραμμές δείχνουν σύγκριση από αρχικά δημοσιευμένα αποτελέσματα σε κλειστά έργα, τα οποία δεν μπορούν να εξωτερικά επικυρωθούν. Σε σχεδόν όλα τα συγκρίσιμα πλαίσια, το ICT υπερέχει των ανταγωνιστικών μεθόδων ανίχνευσης ψευδούς προσώπου (που εμφανίζονται με έντονα γράμματα) στα δοκιμασμένα σύνολα δεδομένων.

Ως πρόσθετη δοκιμή, οι συγγραφείς έτρεξαν περιεχόμενο από το κανάλι του YouTube του αξιόλογου ψευδούς προσώπου Ctrl Shift Face, και βρήκαν ότι οι ανταγωνιστικές μεθόδοι πέτυχαν αξιοσημείωτα κατώτερα σκορ:

Εμφανές εδώ είναι ότι οι μεθόδοι FF++ (Xception-c23) και FFD, οι οποίες επιτύγχαναν κάποια από τα υψηλότερα σκορ σε κάποια από τα δοκιμασμένα δεδομένα στις γενικές δοκιμές του νέου εγγράφου, εδώ επιτύγχαναν ένα πολύ χαμηλότερο σκορ από το ICT σε ένα “πραγματικό κόσμο” περιβάλλον ψευδούς προσώπου υψηλής προσπάθειας.
Οι συγγραφείς ολοκληρώνουν το έγγραφο με την ελπίδα ότι τα αποτελέσματά του θα οδηγήσουν την κοινότητα ανίχνευσης ψευδούς προσώπου προς παρόμοιες πρωτοβουλίες που επικεντρώνονται σε πιο εύκολα γενικεύσιμα υψηλού επιπέδου χαρακτηριστικά, και μακριά από τον “ψυχρό πόλεμο” της ανίχνευσης αρτεφάκτων, όπου οι τελευταίες μεθόδοι είναι συνήθως αντικαταστάθηκαν από
Δείτε το συνηθισμένο βίντεο που συνοδεύει το άρθρο για περισσότερα παραδείγματα του ICT που αναγνωρίζει περιεχόμενο ψευδούς προσώπου που συχνά ξεπερνά τις εναλλακτικές μεθόδοι.
Πρώτη δημοσίευση 4ης Μαρτίου 2022.












