Η γωνία του Anderson
Αναίρεση Deepfake με βάση τα Πρωτότυπα Ανθρώπινα Βιομετρικά Χαρακτηριστικά

Μια νέα εργασία ερευνητών στην Ιταλία και τη Γερμανία προτείνει μια μέθοδο για την ανίχνευση βίντεο deepfake με βάση τη βιομετρική συμπεριφορά του προσώπου και της φωνής, αντί για τεχνικές που βασίζονται σε εικονικές συνθέσεις ή ακριβές λύσεις υδατογράφησης.
Το πλαίσιο απαιτεί εισαγωγή 10 ή περισσότερων διαφορετικών, μη ψευδών βίντεο του υποκειμένου. Ωστόσο, δεν απαιτεί να εκπαιδευτεί, να επαναεκπαιδευτεί ή να αυξηθεί σε περίπτωση βίντεο, καθώς το ενσωματωμένο μοντέλο έχει ήδη απομακρύνει τις πιθανές διανυσματικές αποστάσεις μεταξύ πραγματικών και ψευδών βίντεο με ευρύτατο τρόπο.

Η αντιθετική μάθηση υποστηρίζει την προσέγγιση του POI-Forensics. Διανύσματα που προέρχονται από υλικό πηγή σε κάθε περίπτωση συγκρίνονται με τα ίδια διανύσματα σε ένα πιθανό ψευδές βίντεο, με πτυχές και χαρακτηριστικά που προέρχονται και από τα οπτικά και τα ηχητικά στοιχεία του πιθανώς ψευδούς βίντεο. Source: https://arxiv.org/pdf/2204.03083.pdf
Ο τίτλος της μεθόδου είναι POI-Forensics και βασίζεται σε κινήσεις και ήχους που είναι μοναδικοί για τον πραγματικό άνθρωπο που υποβάλλεται σε deepfake.
Ένα τέτοιο σύστημα θα μπορούσε να επιτρέψει πλήρως αυτοματοποιημένα πλαισια για την αυθεντικοποίηση διασημοτήτων, πολιτικών, επιρροών στο YouTube και άλλων ανθρώπων για τους οποίους υπάρχει πολύ υλικό βίντεο. Επίσης, θα μπορούσε να προσαρμοστεί σε ένα πλαίσιο όπου οι θύτες των τεχνολογιών deepfake θα μπορούσαν να έχουν μια πλατφόρμα για να αποδείξουν την μη αυθεντικότητα των επιθέσεων εναντίον τους.

Οπτικοποιήσεις των εξαγόμεων χαρακτηριστικών από γνήσια και ψευδών βίντεο σε τέσσερις υποκειμένους στο POI-Forensics, μέσω του πλαισίου t-SNE.
Οι συγγραφείς ισχυρίζονται ότι το POI-Forensics επιτυγχάνει ένα νέο επίπεδο στην ανίχνευση deepfake. Σε μια ποικιλία από κοινά σύνολα δεδομένων σε αυτό το πεδίο, το πλαίσιο αναφέρει μια βελτίωση των AUC scores κατά 3%, 10% και 7% για υψηλής ποιότητας, χαμηλής ποιότητας και “επιτιθέμενα” βίντεο, αντίστοιχα. Οι ερευνητές υπόσχονται να κυκλοφορήσουν τον κώδικα σύντομα.

Η απόδοση του POI-Forensics σε σχέση με άλλα πλαίσια SOTA pDFDC, DeepFakeTIMIT, FakeAVCelebV2 και KoDF. Η εκπαίδευση σε κάθε περίπτωση πραγματοποιήθηκε στο FaceForensics++ και τη μέθοδο των συγγραφέων ID-Reveal στο VoxCeleb2. Τα αποτελέσματα περιλαμβάνουν υψηλής και χαμηλής ποιότητας βίντεο.
Οι συγγραφείς δηλώνουν:
‘Η εκπαίδευση πραγματοποιείται αποκλειστικά σε βίντεο με πραγματικά ομιλούντα πρόσωπα, έτσι ο ανιχνευτής δεν εξαρτάται από κάποια συγκεκριμένη μέθοδο και προσφέρει την υψηλότερη γενικευσιμότητα. Επιπλέον, η μέθοδός μας μπορεί να ανιχνεύσει τόσο μονο-τροπικές (μόνο ήχος, μόνο βίντεο) όσο και πολυ-τροπικές (ήχος-βίντεο) επιθέσεις και είναι ανθεκτική σε χαμηλής ποιότητας ή κατεστραμμένα βίντεο, χτίζοντας μόνο σε υψηλό-επίπεδο σημασιολογικά χαρακτηριστικά.’
Η νέα ερευνητική εργασία, η οποία ενσωματώνει στοιχεία από κάποια προηγούμενα έργα των συγγραφέων, όπως το ID-Reveal του 2021, έχει τίτλο Ανίχνευση Deepfake με βάση το Άνθρωπο-Ενδιαφέρον με ήχο και εικόνα και είναι μια συνεργασία μεταξύ του Πανεπιστημίου Federico II της Νάπολης και του Τεχνικού Πανεπιστημίου του Μονάχου.
Ο Αγώνας των Deepfake
Για να νικήσει ένα σύστημα ανίχνευσης αυτής της φύσης, τα συστήματα deepfake και ανθρώπινης σύνθεσης θα χρειαζόταν να έχουν την ικανότητα να προσομοιώσουν τουλάχιστον οπτικά και ηχητικά βιομετρικά στοιχεία από τον προορισμό της σύνθεσης – τεχνολογία που είναι πολλά χρόνια μακριά και πιθανό να παραμείνει στο πεδίο ακριβών και κλειστών συστημάτων που αναπτύσσονται από εταιρείες VFX, οι οποίες θα έχουν το πλεονέκτημα της συνεργασίας και συμμετοχής των προοριζόμενων στόχων (ή των κληρονόμων τους, στην περίπτωση προσομοίωσης νεκρών ανθρώπων).

Η προηγούμενη προσέγγιση των συγγραφέων, ID-Reveal, επικεντρώθηκε αποκλειστικά σε οπτικές πληροφορίες. Source: https://arxiv.org/pdf/2012.02512.pdf
Επιτυχημένες και δημοφιλείς μεθόδοι deepfake όπως το FaceSwap και το DeepFaceLab/Live δεν έχουν την ικανότητα να δημιουργήσουν τέτοιες λεπτομερείς βιομετρικές προσεγγίσεις, βασίζονται καλύτερα σε ταλαντούχους μιμητές στους οποίους η ψευδής ταυτότητα επιβάλλεται, και πολύ συχνότερα σε κατάλληλο υλικό από το πεδίο των “παρόμοιων” ανθρώπων. Ούτε η δομή του πυρήνα του κώδικα του 2017, ο οποίος έχει λίγη modularity και ο οποίος παραμένει η πηγή για DFL και FaceSwap, κάνει την προσθήκη τέτοιου είδους λειτουργικότητας εφικτή.
Αυτά τα δύο κυρίαρχα πακέτα deepfake βασίζονται σε αυτο-κωδικοποιητές. Εναλλακτικές μεθόδοι ανθρώπινης σύνθεσης μπορούν να χρησιμοποιήσουν μια Προσθετική Ανταγωνιστική Δίκτυο (GAN) ή Νευρωνικό Πεδίο Ραδιότητας (NeRF) για την αναδημιουργία ανθρώπινης ταυτότητας. Ωστόσο, και αυτές οι δύο γραμμές έρευνας έχουν χρόνια δουλειά μπροστά τους ακόμη και για την παραγωγή πλήρως φωτορεαλιστικών ανθρώπινων βίντεο.
Με την εξαίρεση του ήχου (ψευδών φωνών), η προσομοίωση βιομετρικών στοιχείων είναι πολύ μακριά στη λίστα των προκλήσεων που αντιμετωπίζει η ανθρώπινη εικόνα σύνθεσης. Σε κάθε περίπτωση, η αναπαραγωγή του τίμβρου και άλλων ιδιοτήτων της ανθρώπινης φωνής δεν αναπαράγει τις ιδιομορφίες και “παραμύθια” της φωνής, ή τον τρόπο που ο πραγματικός υποκείμενος χρησιμοποιεί σημασιολογική κατασκευή. Έτσι, ακόμη και η τελειοποίηση της προσομοίωσης φωνής με AI δεν λύνει το πιθανό φράγμα της βιομετρικής αυθεντικότητας.
Στο Arxiv μόνο, πολλές στρατηγικές ανίχνευσης deepfake και καινοτομίες κυκλοφορούν κάθε εβδομάδα. Πρόσφατες προσεγγίσεις έχουν βασιστεί σε Ομοιομορφία Προσώπου-Φωνής, Τοπικό Ιστογράφημα Υστέρησης (FF-LBPH), ανθρώπινη αντίληψη των ψευδών φωνών, ανάλυση των ορίων του προσώπου, υπολογισμός της υποβάθμισης του βίντεο και ‘Νομική Βαλιστική’ – μεταξύ πολλών άλλων.

Η ανάλυση ιστογράμματος είναι μια από τις τελευταίες τεχνικές που προσφέρονται για την βελτίωση της ανίχνευσης deepfake. Source: https://arxiv.org/pdf/2203.09928.pdf
Προσέγγιση, Δεδομένα και Αρχιτεκτονική
Το POI-Forensics ακολουθεί μια πολυ-τροπική προσέγγιση για την επαλήθευση ταυτότητας, αξιοποιώντας μαλακά βιομετρικά στοιχεία με βάση οπτικές και ηχητικές ενδείξεις. Το πλαίσιο διαθέτει ξεχωριστά δίκτυα ήχου και εικόνας, τα οποία τελικά εξάγουν χαρακτηριστικά διανύσματα που μπορούν να συγκριθούν με τα ίδια εξαγόμενα χαρακτηριστικά σε ένα πιθανό ψευδές βίντεο που μελετάται.

Η αρχιτεκτονική του POI-Forensics.
Και οι δύο ξεχωριστές (ήχος ή εικόνα) και η σύνθετη ανάλυση μπορούν να πραγματοποιηθούν σε στοχευμένα κλιπ, φτάνοντας τελικά σε ένα δείκτη ομοιότητας POI. Η αντιθετική συνάρτηση απώλειας που χρησιμοποιείται βασίζεται σε μια ακαδημαϊκή συνεργασία του 2021 μεταξύ Google Research, Boston University, Snap Inc. και MIT.
Η βάση δεδομένων χωρίστηκε σε κάθε ταυτότητα. 4608 ταυτότητες χρησιμοποιήθηκαν για την εκπαίδευση, ενώ 512 αποτέλεσαν την επαλήθευση. Οι 500 ταυτότητες που χρησιμοποιήθηκαν στο FakeAVCelebV2 (ένα υποψήφιο δοκιμής, δείτε παρακάτω) εξαιρέθηκαν για να ληφθούν μη πολωμένα αποτελέσματα.
Τα δύο δίκτυα εκπαιδεύτηκαν για 12 επαναλήψεις με ένα ασυνήθιστα μεγάλο μέγεθος δείγματος 2304 δείγματα ανά επανάληψη, με κάθε δείγμα να αποτελείται από 8×8 τμήματα βίντεο – 8 τμήματα για 8 διαφορετικές ταυτότητες. Ο βελτιωτής Adam χρησιμοποιήθηκε με αποσύνδεση της απώλειας βάρους σε μια ταχύτητα μάθησης 10−4, και μια απώλεια βάρους 0.01.
Δοκιμές και Αποτελέσματα
Τα σύνολα δεδομένων deepfake που δοκιμάστηκαν για το έργο ήταν το πρόγραμμα DeepFake Detection Challenge, το οποίο περιλαμβάνει ανταλλαγές προσώπων σε 68 υποκείμενα, από τα οποία 44 ταυτότητες επιλέχθηκαν που έχουν περισσότερα από εννέα συναφείς βίντεο, συνολικά 920 πραγματικά βίντεο και 2925 ψευδών βίντεο. Επίσης, το DeepFake-TIMIT, ένα σύνολο δεδομένων που βασίζεται σε GAN, που περιλαμβάνει 320 βίντεο 32 υποκειμένων, συνολικά 290 πραγματικά βίντεο και 580 ψευδών βίντεο διάρκειας τουλάχιστον 4 δευτερολέπτων. Επιπλέον, το FakeAVCelebV2, το οποίο αποτελείται από 500 πραγματικά βίντεο από το Voxceleb2 και περίπου 20.000 ψευδών βίντεο από διάφορα σύνολα δεδομένων, στα οποία προστέθηκαν ψευδείς κλωνοποιημένοι ήχοι με SV2TTS για συμβατότητα. Τέλος, το KoDF, ένα κορεατικό σύνολο δεδομένων deepfake με 403 ταυτότητες που έχουν υποβληθεί σε FaceSwap, DeepFaceLab και FSGAN, καθώς και τρία μοντέλα κίνησης πρώτου τάξης (FOMM).
Το τελευταίο επίσης περιλαμβάνει ηχητική σύνθεση προσώπου ATFHP και έξοδο από Wav2Lip, με τους συγγραφείς να χρησιμοποιούν ένα παράγωγο σύνολο δεδομένων που περιλαμβάνει 276 πραγματικά βίντεο και 544 ψευδών βίντεο.
Οι μετρήσεις που χρησιμοποιήθηκαν περιλαμβάνουν την περιοχή κάτω από την καμπύλη του δέκτη (AUC) και μια προσεγγιστική ταχύτητα ψευδών ενεργειών 10%, η οποία θα ήταν προβληματική σε πλαισια που ενσωματώνουν και εκπαιδεύουν σε ψευδών δεδομένα, αλλά η οποία ανησυχία εξαλείφεται από το γεγονός ότι το POI-Forensics λαμβάνει μόνο γνήσια βίντεο ως εισαγωγή.
Οι μεθόδοι δοκιμάστηκαν ενάντια στο Seferbekov ανιχνευτή deepfake, ο οποίος κατέκτησε την πρώτη θέση στο Αγών Deepfake Detection του Kaggle. Επίσης, το FTCN (Πλήρως Χρονολογικό Συμβολικό Δίκτυο), μια συνεργασία μεταξύ του Πανεπιστημίου Xiamen της Κίνας και της Microsoft Research Asia. Τέλος, το LipForensics, μια κοινή εργασία του 2021 μεταξύ του Imperial College London και της Facebook, και το ID-Reveal, một προηγούμενο έργο κάποιων από τους συγγραφείς της νέας εργασίας, το οποίο παραλείπει την ηχητική πτυχή και χρησιμοποιεί 3D Μορφολογικά Μοντέλα σε συνδυασμό με ένα ανταγωνιστικό σενάριο για την ανίχνευση ψευδών εξόδων.
Στα αποτελέσματα (δείτε το πίνακα παραπάνω), το POI-Forensics ξεπέρασε το Seferbekov κατά 2,5% σε AUC και 1,5% σε ακρίβεια. Η απόδοση ήταν πιο ανταγωνιστική σε άλλα σύνολα δεδομένων σε υψηλή ποιότητα.
Ωστόσο, η νέα προσέγγιση έδειξε μια αξιοσημείωτη προβάδισμα σε σχέση με όλες τις άλλες μεθόδοι για ψευδών βίντεο χαμηλής ποιότητας, τα οποία παραμένουν η πιθανότερη περίπτωση που τα deepfake θα μπορέσουν να εξαπατήσουν τους μη προσεκτικούς θεατές, με βάση “πραγματικές” συνθήκες.
Οι συγγραφείς δηλώνουν:
‘Πράγματι, σε αυτήν την προκλητική περίπτωση, μόνο οι προσεγγίσεις που βασίζονται στην ταυτότητα παρέχουν μια καλή απόδοση, καθώς βασίζονται σε υψηλό-επίπεδο σημασιολογικά χαρακτηριστικά, τα οποία είναι αρκετά ανθεκτικά σε ελαττώματα εικόνας.’
Εξετάζοντας ότι το POI-Forensics χρησιμοποιεί μόνο γνήσια βίντεο ως εισαγωγή, η επιτυχία είναι ουσιαστικά μεγαλύτερη, και υποδηλώνει ότι η χρήση των ιδιαίτερων βιομετρικών χαρακτηριστικών των πιθανών θυμάτων των τεχνολογιών deepfake είναι ένας ικανοποιητικός δρόμος για την αποφυγή του “πολέμου των τεχνολογιών” μεταξύ των συστημάτων deepfake και ανίχνευσης deepfake.
Σε μια τελική δοκιμή, οι ερευνητές πρόσθεσαν ανταγωνιστική θόρυβη στην εισαγωγή, μια μέθοδος που μπορεί να εξαπατήσει τους ταξινομητές. Η παλιά γρήγορη μέθοδος σημείου κλίσης αποδείχθηκε ιδιαίτερα αποτελεσματική σε αυτό το πλαίσιο.
Οι στρατηγικές ανταγωνιστικών επιθέσεων μειώνουν το ποσοστό επιτυχίας σε όλα τα μέθοδο και σύνολα δεδομένων, με την AUC να μειώνεται σε ποσοστά μεταξύ 10% και 38%. Ωστόσο, μόνο το POI-Forensics και η προηγούμενη μέθοδος ID-Reveal των συγγραφέων ήταν σε θέση να διατηρήσουν μια λογική απόδοση υπό αυτήν την επίθεση, υποδηλώνοντας ότι τα υψηλό-επίπεδο χαρακτηριστικά που συνδέονται με τα μαλακά βιομετρικά είναι εξαιρετικά ανθεκτικά στην αποφυγή ανίχνευσης deepfake.
Οι συγγραφείς καταλήγουν:
‘Συνολικά, πιστεύουμε ότι η μέθοδός μας είναι ένα πρώτο βήμα. Συγκεκριμένα, η χρήση υψηλό-επίπεδο σημασιολογικών χαρακτηριστικών είναι μια υποσχόμενη μελλοντική οδός για μελλοντική έρευνα. Επιπλέον, η πολυ-τροπική ανάλυση θα μπορούσε να εμπλουτιστεί με την ένταξη περισσότερων πληροφοριών από άλλα πεδία, όπως κείμενο.’
Πρώτη δημοσίευση 8ης Απριλίου 2022.












