Η γωνία του Anderson
Ερευνητές Ανακάλυψαν Ένα Ανθεκτικό Χαρακτηριστικό των Deepfakes που Μπορεί να Βοηθήσει στη Μακροχρόνια Ανίχνευση

Από τότε που εμφανίστηκαν οι πρώτες λύσεις ανίχνευσης deepfakes το 2018, ο τομέας της έρευνας υπολογιστικής όρασης και ασφάλειας έχει προσπαθήσει να ορίσει ένα απαραίτητο χαρακτηριστικό των βίντεο deepfakes – σήματα που θα μπορούσαν να αποδειχθούν ανθεκτικά στις βελτιώσεις των δημοφιλών τεχνολογιών σύνθεσης προσώπου (όπως τα πακέτα deepfakes που βασίζονται σε autoencoder όπως το DeepFaceLab και το FaceSwap, και η χρήση Γεννητικών Αντιπαλικών Δικτύων για να αναπαράγουν, να προσομοιώνουν ή να τροποποιούν ανθρώπινα πρόσωπα).
Πολλοί από τους “δείκτες”, όπως η έλλειψη αναβληθέντος βλέμματος, έγιναν αναχρονιστικοί λόγω βελτιώσεων στα deepfakes, ενώ η πιθανή χρήση ψηφιακών τεχνικών απόδειξης (όπως η πρωτοβουλία Content Authenticity Initiative της Adobe ) – συμπεριλαμβανομένων των προσεγγίσεων blockchain και ψηφιακής σφραγίδας των πιθανών πηγαίων φωτογραφιών – θα απαιτούσε εκτεταμένες και ακριβές αλλαγές στο υπάρχον σώμα διαθέσιμων πηγαίων εικόνων στο διαδίκτυο, ή θα χρειαζόταν μια αξιοσημείωτη συνεργατική προσπάθεια μεταξύ εθνών και κυβερνήσεων για τη δημιουργία συστημάτων επιτήρησης και αυθεντικοποίησης.
Επομένως, θα ήταν πολύ χρήσιμο αν ένα πραγματικά θεμελιώδες και ανθεκτικό χαρακτηριστικό μπορούσε να διακριθεί στο περιεχόμενο εικόνας και βίντεο που περιλαμβάνει τροποποιημένα, εφευρεμένα ή ανταλλαγμένα ανθρώπινα πρόσωπα· ένα χαρακτηριστικό που θα μπορούσε να εξαχθεί απευθείας από ψευδείς βίντεο, χωρίς μεγάλη επαλήθευση, κρυπτογραφική διαδικασία ελέγχου, έλεγχο περιεχομένου, αξιολόγηση πιθανοτήτων, διαδικασίες ανίχνευσης αντικειμένων ή άλλες επιβαρυντικές προσεγγίσεις ανίχνευσης deepfakes.
Deepfakes στο Πλαίσιο
Μια νέα συνεργασία ερευνών μεταξύ Κίνας και Αυστραλίας πιστεύει ότι έχει βρει αυτό το “άγιο δισκοπότηρο”, με τη μορφή διατάραξης της τακτοτητας.
Οι συγγραφείς έχουν αναπτύξει μια μέθοδο σύγκρισης της διαστημικής ακεραιότητας και της χρονικής συνέχειας των πραγματικών βίντεο με αυτά που περιέχουν περιεχόμενο deepfakes, και έχουν διαπιστώσει ότι οποιαδήποτε μορφή παρέμβασης deepfakes διαταράσσει την τακτοτητα της εικόνας, όσο αόρατα κι αν είναι.
Αυτό συμβαίνει εν μέρει γιατί η διαδικασία deepfakes διασπά το στόχο βίντεο σε καρέ και εφαρμόζει την επίδραση ενός εκπαιδευμένου μοντέλου deepfakes σε κάθε (αντικαταστατικό) καρέ. Οι δημοφιλείς διανομές deepfakes λειτουργούν με τον ίδιο τρόπο όπως οι animators, σε αυτόν τον ohled, δίνοντας περισσότερη προσοχή στην αυθεντικότητα κάθε καρέ παρά στη συμβολή κάθε καρέ στη συνολική διαστημική ακεραιότητα και χρονική συνέχεια του βίντεο.

Από το έγγραφο: A) Διαφορές μεταξύ των τύπων δεδομένων. Εδώ βλέπουμε ότι οι διαταραχές του p-fake αλλάζουν την χωροχρονική ποιότητα της εικόνας με τον ίδιο τρόπο όπως ένα deepfake, χωρίς να ανταλλάσσουν ταυτότητα. B) Ανάλυση θορύβου των τριών τύπων δεδομένων, δείχνοντας πώς ο p-fake μιμείται τη διαταραχή του deepfake. C) Χρονική οπτικοποίηση των τριών τύπων δεδομένων, με τα πραγματικά δεδομένα να δείχνουν μεγαλύτερη ακεραιότητα στη διακύμανση. D) η T-SNE οπτικοποίηση των εξαγόμεων χαρακτηριστικών για πραγματικά, ψευδή και p-faked βίντεο. Πηγή: https://arxiv.org/pdf/2207.10402.pdf
Αυτό δεν είναι ο τρόπος με τον οποίο ένας κωδικοποιητής βίντεο αντιμετωπίζει μια σειρά καρέ όταν καταγράφεται ή επεξεργάζεται ένα πρωτότυπο βίντεο. Για να αποθηκεύσει χώρο αρχείου ή να κάνει ένα βίντεο κατάλληλο για ροή, ένας τεράστιος όγκος πληροφοριών απορρίπτεται από τον κωδικοποιητή βίντεο.
Τα διαμεσολαβικά καρέ μεταξύ των key-frames είναι, σε κάποιο βαθμό, εκτιμώμενα ως μια παραλλαγή των καρέ, και θα επαναχρησιμοποιήσουν όσο το δυνατόν περισσότερες πληροφορίες από τα liền cận key-frames, αντί να είναι πλήρη καρέ με δικά τους δικαιώματα.

Αριστερά, ένα πλήρες key-frame, ή ‘i-frame’, αποθηκεύεται στο συμπιεσμένο βίντεο, με κάποιο κόστος σε μέγεθος αρχείου· δεξιά, ένα διαμεσολαβικό ‘delta frame’ επαναχρησιμοποιεί οποιοδήποτε εφαρμόσιμο μέρος του πιο πλουσιού key-frame. Πηγή: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/
Με αυτόν τον τρόπο, το μπλοκ (περιέχοντας x αριθμό καρέ, ανάλογα με τις ρυθμίσεις key-frame) είναι ομολογουμένως η μικρότερη μονάδα που θεωρείται σε ένα τυπικό συμπιεσμένο βίντεο, αντί για οποιοδήποτε μεμονωμένο καρέ. Ακόμη και το key-frame itu, γνωστό ως i-frame, αποτελεί μέρος αυτής της μονάδας.
Σε σχέση με την παραδοσιακή animation, ένας κωδικοποιητής βίντεο εκτελεί ένα είδος in-betweening, με τα key-frames να λειτουργούν ως στήλες για τα διαμεσολαβικά, παραγόμενα καρέ, γνωστά ως delta frames.

Αντίθετα, η υπέρθεση deepfakes αφιερώνει τεράστιες προσοχές και πόροι σε κάθε μεμονωμένο καρέ, χωρίς να λαμβάνει υπόψη το ευρύτερο περιβάλλον, και χωρίς να κάνει προβλέψεις για τον τρόπο με τον οποίο η συμπίεση και η κωδικοποίηση με βάση το μπλοκ επηρεάζουν τις ιδιότητες του “αυθεντικού” βίντεο.

Μια πιο προσεχτική ματιά στη διακοπή μεταξύ της χρονικής ποιότητας ενός αυθεντικού βίντεο (αριστερά) και του ίδιου βίντεο όταν διαταράσσεται από deepfakes (δεξιά).
Αν και κάποιοι από τους καλύτερους deepfakers χρησιμοποιούν εκτεταμένη μετα-επεξεργασία, σε πακέτα όπως το After Effects, και αν το DeepFaceLab έχει κάποια εγγενή ικανότητα να εφαρμόζει “συνδυασμούς” διαδικασιών όπως το motion blur, τέτοιου είδους δόλους δεν επηρεάζουν την ανταπόκριση της χωροχρονικής και χρονικής ποιότητας μεταξύ αυθεντικών και deepfaked βίντεο.
Το νέο έγγραφο έχει τον τίτλο Ανίχνευση Deepfake με τη Δημιουργία Χωροχρονικής Διατάραξης Τακτοτητας, και προέρχεται από ερευνητές στο Πανεπιστήμιο Tsinghua, το Τμήμα Τεχνολογίας Υπολογιστικής Όρασης (VIS) στην Baidu Inc. και το Πανεπιστήμιο του Melbourne
‘Ψευδή’ Ψευδείς Βίντεο
Οι ερευνητές πίσω από το έγγραφο έχουν ενσωματώσει τη λειτουργικότητα της έρευνας σε ένα μοντέλο με το όνομα Pseudo-fake Generator (P-fake Generator), το οποίο μετατρέπει πραγματικά βίντεο σε ψευδείς ψευδείς βίντεο, διαταράσσοντας τα με τον ίδιο τρόπο που η διαδικασία deepfakes πράττει, χωρίς να εκτελεί πραγματικές λειτουργίες deepfakes.
Δοκιμές δείχνουν ότι το μοντέλο μπορεί να προστεθεί σε όλα τα υπάρχοντα συστήματα ανίχνευσης deepfakes με πρακτικά μηδενικό κόστος πόρων, και ότι βελτιώνει σημαντικά την απόδοσή τους.
Η ανακάλυψη αυτή μπορεί να βοηθήσει να αντιμετωπιστεί ένα από τα άλλα εμπόδια στην έρευνα ανίχνευσης deepfakes: η έλλειψη αυθεντικών και επικαιροποιημένων συνόλων δεδομένων.既然 η δημιουργία deepfakes είναι μια περίπλοκη και χρονοβόρα διαδικασία, η κοινότητα έχει αναπτύξει μια σειρά από συνόλου δεδομένων deepfakes τα τελευταία πέντε χρόνια, πολλά από τα οποία είναι khá παλιά.
Βάσει της διατάραξης της τακτοτητας ως ενός deepfake-αγνοστικού σήματος για βίντεο που έχουν τροποποιηθεί μετά, η νέα μέθοδος καθιστά δυνατή τη δημιουργία απεριόριστων δειγμάτων και συνόλων δεδομένων που επικεντρώνονται σε αυτό το σημείο των deepfakes.

Επισκόπηση του μπλοκ STE, όπου χρησιμοποιείται η καναλιωτή χρονική σύγκλιση ως ένα ερέθισμα για τη δημιουργία χωροχρονικά ενισχυμένων κωδικοποιήσεων, με αποτέλεσμα το ίδιο σήμα που θα έδινε ακόμη και ένα πολύ πειστικό deepfake. Με αυτόν τον τρόπο, ‘ψευδείς’ ψευδείς βίντεο μπορούν να δημιουργηθούν που φέρουν τα ίδια χαρακτηριστικά σήματος με οποιοδήποτε τροποποιημένο, deepfake-στυλ βίντεο, και που δεν εξαρτώνται από συγκεκριμένες διανομές ή από εύθραυστα σημεία όπως η συμπεριφορά χαρακτηριστικών ή τα τεχνικά артеφάκτα.
Δοκιμές
Οι ερευνητές διεξήγαγαν πειράματα σε έξι γνωστά συνόλου δεδομένων που χρησιμοποιούνται στην έρευνα ανίχνευσης deepfakes: FaceForensics++ (FF++); WildDeepFake; Δοκιμαστική Πρόκληση Ανίχνευσης Deepfakes (DFDCP); Celeb-DF; Ανίχνευση Deepfakes (DFD); και Face Shifter (FSh).
Για το FF++, οι ερευνητές εκπαίδευσαν το μοντέλο τους στο πρωτότυπο σύνολο δεδομένων και έκαναν δοκιμές σε κάθε einen από τα τέσσερα υποσύνολα ξεχωριστά. Χωρίς τη χρήση οποιασδήποτε υλικού deepfakes κατά την εκπαίδευση, η νέα μέθοδος κατάφερε να ξεπεράσει τα αποτελέσματα του state of the art.

Η μέθοδος επίσης κατέλαβε την πρώτη θέση όταν συγκριθήκαμε με το FF++ C23 compressed dataset, το οποίο παρέχει παραδείγματα που περιέχουν είδη συμπιεστικών αρτεφάκτων που είναι πιστά σε πραγματικές περιβάλλοντες προβολής deepfakes.

Οι συγγραφείς σχολιάζουν:
‘Οι επιδόσεις στο FF++ επικυρώνουν τη δυνατότητα της βασικής μας ιδέας, ενώ η γενικευσιμότητα παραμένει ένα σημαντικό πρόβλημα των υφιστάμενων μεθόδων ανίχνευσης deepfakes, καθώς η απόδοση δεν εγγυάται όταν δοκιμάζεται σε deepfakes που παράγονται με μη觀 techniques.
‘Σκεφτείτε περαιτέρω την πραγματικότητα του αγώνα μεταξύ ανιχνευτών και δημιουργών, η γενικευσιμότητα είναι ένα σημαντικό κριτήριο για τη μέτρηση της αποτελεσματικότητας μιας μεθόδου ανίχνευσης στη πραγματική ζωή.’
Αν και οι ερευνητές διεξήγαγαν μια σειρά από υπο-δοκιμές (δείτε το έγγραφο για λεπτομέρειες) γύρω από τη “robustness” και την αλλαγή των τύπων βίντεο εισόδου (π.χ. πραγματικά, ψευδή, p-faked, κ.λπ.), τα πιο ενδιαφέροντα αποτελέσματα προέρχονται από τη δοκιμή για την απόδοση σε διαφορετικά συνόλου δεδομένων.
Για αυτό, οι συγγραφείς εκπαίδευσαν το μοντέλο τους στο “πραγματικό” c23 version του FF++ και το δοκιμάσανε ενάντια σε τέσσερα συνόλου δεδομένων, αποκτώντας, όπως αναφέρουν, υπεροχή απόδοση σε όλα αυτά.

Αποτελέσματα από τη δοκιμή δια-συνόλου δεδομένων. Το έγγραφο σημειώνει ότι η SBI χρησιμοποιεί μια παρόμοια προσέγγιση με τη δική μας, ενώ, όπως ισχυρίζονται οι ερευνητές, ο p-fake δείχνει καλύτερη απόδοση για τη διατάραξη της χωροχρονικής τακτοτητας.
Το έγγραφο αναφέρει:
‘Στο πιο απαιτητικό Deepwild, η μέθοδός μας ξεπερνά τη μέθοδο SOTA περίπου 10 ποσοστιαίες μονάδες σε όρους AUC%. Νομίζουμε ότι αυτό οφείλεται στη μεγάλη ποικιλία των deepfakes στο Deepwild, η οποία κάνει άλλες μεθόδους να αποτυγχάνουν να γενικευθούν καλά από τα deepfakes που έχουν δει.’
Οι μετρήσεις που χρησιμοποιήθηκαν για τις δοκιμές ήταν ο Δείκτης Ακρίβειας (ACC), η Επιφάνεια Υπό την Καμπύλη του Γραφήματος Λάθους (AUC) και ο Ισοrror Ρυθμός (EER).
Αντεπιθέσεις;
Αν και τα μέσα ενημέρωσης χαρακτηρίζουν την ένταση μεταξύ των δημιουργών deepfakes και των ερευνητών ανίχνευσης deepfakes σε όρους τεχνολογικού πολέμου, είναι πιθανό ότι οι πρώτοι απλά προσπαθούν να κάνουν πιο πειστική έξοδο, και ότι η αυξημένη δυσκολία ανίχνευσης deepfakes είναι ένα περιστασιακό προϊόν αυτών των προσπαθειών.
Εάν οι δημιουργοί θα προσπαθήσουν να αντιμετωπίσουν αυτό το nově-αποκαλυφθέν ελάττωμα, εξαρτάται vielleicht από το αν πιστεύουν ότι η διατάραξη της τακτοτητας μπορεί να ανιχνευθεί με γυμνό μάτι ως ένα σημάδι μη-αυθεντικότητας, και ότι επομένως αυτό το μέτρο αξίζει να αντιμετωπιστεί από μια καθαρά ποιοτική άποψη.
Αν και πέντε χρόνια έχουν περάσει από τότε που τα πρώτα deepfakes δημοσιεύθηκαν στο διαδίκτυο, η τεχνολογία των deepfakes είναι ακόμη μια σχετικά νέα τεχνολογία, και η κοινότητα είναι πιθανό ότι είναι πιο εστιασμένη στη λεπτομέρεια και την ανάλυση παρά στη σωστή контекστ και τη σύγκλιση με τα σήματα του συμπιεσμένου βίντεο, τα οποία απαιτούν μια ορισμένη “χαλάρωση” της έξοδου – ακριβώς αυτό που η κοινότητα των deepfakes παλεύει κατά του.
Εάν η γενική συναίνεση εκεί αποδειχθεί ότι η διατάραξη της τακτοτητας είναι ένα νέα σήμα που δεν επηρεάζει την ποιότητα, μπορεί να μην υπάρξει προσπάθεια να αντισταθμιστεί – ακόμη και αν μπορεί να “ακυρωθεί” από κάποιες μετα-επεξεργασίες ή διαδικασίες αρχιτεκτονικής, που είναι μακράν από το σαφές.
Πρώτη δημοσίευση 22ης Ιουλίου 2022.












