Η γωνία του Anderson
Η πληροφορία βάθους μπορεί να αποκαλύψει Deepfakes σε πραγματικό χρόνο

Νέα έρευνα από την Ιταλία έχει βρει ότι η πληροφορία βάθους που λαμβάνεται από εικόνες μπορεί να είναι ένα χρήσιμο εργαλείο για την ανίχνευση deepfakes – ακόμη και σε πραγματικό χρόνο.
Ενώ η πλειονότητα της έρευνας για την ανίχνευση deepfakes τα τελευταία πέντε χρόνια έχει επικεντρωθεί στην ταυτοποίηση τεχνικών (που μπορεί να μειωθεί με βελτιωμένες τεχνικές ή να συγχέεται με κακή συμπίεση βίντεο), περιβαλλοντική φωτισμός, βιομετρικά χαρακτηριστικά, χρονική διαταραχή, και ακόμη ανθρώπινη直觉, η νέα μελέτη είναι η πρώτη που προτείνει ότι η πληροφορία βάθους θα μπορούσε να είναι ένα πολύτιμο κλειδί για το περιεχόμενο deepfake.

Παραδείγματα παραγώγων χαρτών βάθους και της διαφοράς στη διαπερατότητα βάθους μεταξύ πραγματικών και ψευδών εικόνων. Πηγή: https://arxiv.org/pdf/2208.11074.pdf
Κριτικά, τα πλαίσια ανίχνευσης που αναπτύχθηκαν για τη νέα μελέτη λειτουργούν πολύ καλά σε ένα ελαφρύ δίκτυο όπως το Xception, και αποδεκτά καλά στο MobileNet, και η νέα εργασία αναγνωρίζει ότι η χαμηλή καθυστέρηση της εύρεσης που προσφέρεται μέσω τέτοιων δικτύων μπορεί να επιτρέψει την ανίχνευση deepfakes σε πραγματικό χρόνο ενάντια στη νέα τάση προς ζωντανούς deepfakes, όπως η πρόσφατη επίθεση στη Binance.
Μια μεγαλύτερη οικονομία στο χρόνο εύρεσης μπορεί να επιτευχθεί επειδή το σύστημα δεν χρειάζεται πλήρεις εικόνες σε χρώμα για να καθορίσει τη διαφορά μεταξύ ψευδών και πραγματικών χαρτών βάθους, αλλά μπορεί να λειτουργήσει εκπληκτικά αποτελεσματικά μόνο με εικόνες σε κλίμακα του γκρι του βάθους.
Οι συγγραφείς δηλώνουν: ‘Αυτό το αποτέλεσμα δείχνει ότι το βάθος σε αυτή την περίπτωση προσθέτει μια πιο σχετική συμβολή στην ταξινόμηση από τα χρωματικά τεχνικά.’
Τα ευρήματα αντιπροσωπεύουν μέρος μιας νέας κυμαίας έρευνας για την ανίχνευση deepfakes που κατευθύνεται ενάντια σε συστήματα σύνθεσης προσώπου σε πραγματικό χρόνο όπως το DeepFaceLive – ένα σημείο εστίασης που έχει επιταχύνει αξιοσημείωτα τα τελευταία 3-4 μήνες, μετά την προειδοποίηση του FBI τον Μάρτιο για τον κίνδυνο βίντεο και ήχου deepfakes σε πραγματικό χρόνο.
Η εργασία έχει τον τίτλο DepthFake: μια στρατηγική βάθους για την ανίχνευση βίντεο Deepfake, και προέρχεται από πέντε ερευνητές στο Πανεπιστήμιο Σάπιενζα της Ρώμης.
Περιπτώσεις άκρων
Κατά τη διάρκεια της εκπαίδευσης, τα αυτοκωδικοποιητικά μοντέλα deepfake δίνουν προτεραιότητα στις εσωτερικές περιοχές του προσώπου, όπως τα μάτια, η μύτη και το στόμα. Σε meisten περιπτώσεις, σε ανοιχτές πηγές όπως DeepFaceLab και FaceSwap (και τα δύο forked από τον αρχικό κώδικα Reddit πριν από τη διαγραφή του), οι εξωτερικές γραμμές του προσώπου δεν γίνονται καλά καθορισμένες μέχρι ένα πολύ晚ό στάδιο της εκπαίδευσης, και είναι απίθανο να ταιριάζουν με την ποιότητα της σύνθεσης στην εσωτερική περιοχή του προσώπου.

Από μια προηγούμενη μελέτη, βλέπουμε μια οπτικοποίηση των ‘χαρτών σαληνότητας’ του προσώπου. Πηγή: https://arxiv.org/pdf/2203.01318.pdf
Κανονικά, αυτό δεν είναι σημαντικό,既然 η τάση μας να επικεντρωθούμε πρώτα στα μάτια και να δώσουμε προτεραιότητα, ‘εξωτερικά’ με μειωμένα επίπεδα προσοχής σημαίνει ότι είναι απίθανο να μας ενοχλήσει η μείωση της περιφερειακής ποιότητας – ιδιαίτερα αν μιλάμε ζωντανούς με το άτομο που μιμείται μια άλλη ταυτότητα, το οποίο ενεργοποιεί κοινωνικές συμβάσεις και περιορισμούς επεξεργασίας που δεν υπάρχουν όταν αξιολογούμε ‘απευθείας’ βίντεο deepfake.
Ωστόσο, η έλλειψη λεπτομέρειας ή ακρίβειας στις επηρεαζόμενες περιφερειακές περιοχές ενός deepfaked προσώπου μπορεί να ανιχνευθεί αλγοριθμικά. Τον Μάρτιο, ένα σύστημα που βασίζεται στην περιφερειακή περιοχή του προσώπου ανακοινώθηκε. Ωστόσο, поскольку απαιτεί μια πάνω από το μέσο όρο ποσότητα δεδομένων εκπαίδευσης, είναι μόνο για διασημότητες που είναι πιθανό να εμφανιστούν σε δημοφιλείς συνόλους δεδομένων (όπως το ImageNet) που έχουν αποδεικτική αξία στις τρέχουσες τεχνικές όρασης και ανίχνευσης deepfakes.
Αντίθετα, το νέο σύστημα, που ονομάζεται DepthFake, μπορεί να λειτουργήσει γενικά ακόμη και σε άγνωστες ή άγνωστες ταυτότητες, διακρίνοντας την ποιότητα της εκτιμώμενης πληροφορίας βάθους σε πραγματικά και ψευδή βίντεο περιεχόμενο.
Βυθίζοντας βαθύτερα
Η πληροφορία βάθους γίνεται ολοένα και πιο ενσωματωμένη στα smartphones, συμπεριλαμβανομένων τεχνικών στερεοσκοπικής βάθους που είναι ιδιαίτερα χρήσιμες για μελέτες όρασης υπολογιστή. Στη νέα μελέτη, οι συγγραφείς έχουν χρησιμοποιήσει το μοντέλο FaceDepth του Εθνικού Πανεπιστημίου της Ιρλανδίας, ένα σύμπλεγμα κωδικοποιητή/αποκωδικοποιητή που μπορεί να εκτιμήσει αποτελεσματικά χάρτες βάθους από εικόνες μιας πηγής.
Επόμενο, η διαδικασία για το νέο πλαίσιο των Ιταλών ερευνητών εξάγει ένα τμήμα 224×224 pixel του προσώπου του υποκειμένου από την αρχική εικόνα RGB και τον παραγώγο χάρτη βάθους. Κριτικά, αυτό επιτρέπει στη διαδικασία να αντιγράψει το βασικό περιεχόμενο χωρίς να το μετεπιβάλλει· αυτό είναι σημαντικό,既然 οι αλγόριθμοι μετεπιβίβασης μεγέθους θα επηρεάσουν αρνητικά την ποιότητα των στοχευόμενων περιοχών.
Χρησιμοποιώντας αυτή την πληροφορία, και από πραγματικές και deepfaked πηγές, οι ερευνητές έπειτα εκπαίδευσαν ένα συνελικτικό νευρωνικό δίκτυο (CNN) ικανό να διακρίνει πραγματικά από ψευδή περιπτώσεις, με βάση τις διαφορές στη διαπερατότητα της αντίστοιχης πληροφορίας βάθους.
Το μοντέλο FaceDepth έχει εκπαιδευτεί σε πραγματικά και συνθετικά δεδομένα χρησιμοποιώντας μια υβριδική συνάρτηση που προσφέρει μεγαλύτερη λεπτομέρεια στις εξωτερικές περιφέρειες του προσώπου, καθιστώντας το κατάλληλο για το DepthFake. Χρησιμοποιεί μια περίπτωση MobileNet ως εξαγωγέα χαρακτηριστικών, και εκπαιδεύτηκε με είσοδο εικόνων 480×640 που εξόδευε χάρτες βάθους 240×320. Κάθε χάρτης βάθους αντιπροσωπεύει ένα τέταρτο των τεσσάρων καναλιών εισόδου που χρησιμοποιούνται στη νέα εργασία.
Ο χάρτης βάθους ενσωματώνεται αυτόματα στην αρχική εικόνα RGB για να παρέχει το είδος εικόνας RGBD, πλούσιο σε πληροφορία βάθους, που μπορούν να εξοδεύσουν οι σύγχρονες κάμερες smartphone.
Εκπαίδευση
Το μοντέλο εκπαιδεύτηκε σε ένα δίκτυο Xception που είχε ήδη προ-εκπαιδευτεί στο ImageNet, αν και η αρχιτεκτονική χρειαζόταν κάποια προσαρμογή για να φιλοξενήσει την πρόσθετη πληροφορία βάθους ενώ διατηρούσε τη σωστή αρχικοποίηση των βαρών.
Επιπλέον, μια ανισότητα στις τιμές μεταξύ της πληροφορίας βάθους και αυτής που περιμένει το δίκτυο απαιτούσε ότι οι ερευνητές να κανονικοποιήσουν τις τιμές σε 0-255.
Κατά τη διάρκεια της εκπαίδευσης, μόνο η αναστροφή και η περιστροφή εφαρμόστηκαν. Σε πολλές περιπτώσεις, διάφορες άλλες οπτικές παραλλαγές θα παρουσιάζονταν στο μοντέλο για να αναπτύξουν ρομποτική εύρεση, αλλά η αναγκαιότητα να διατηρηθεί η περιορισμένη και πολύ εύθραυστη πληροφορία βάθους στις φωτογραφίες πηγή ανάγκασε τους ερευνητές να υιοθετήσουν ένα κατεστραμμένο καθεστώς.
Το σύστημα εκπαιδεύτηκε επίσης σε απλές 2-κανάλι εικόνες σε κλίμακα του γκρι, για να καθορίσει πόσο σύνθετες χρειάζονταν να είναι οι εικόνες πηγή για να ληφθεί ένα λειτουργικό αλγόριθμο.
Η εκπαίδευση πραγματοποιήθηκε μέσω της API TensorFlow σε ένα NVIDIA GTX 1080 με 8GB VRAM, χρησιμοποιώντας τον βελτιστοποιητή ADAMAX, για 25 επωχές, με μέγεθος δείγματος 32. Η ανάλυση εισόδου ήταν σταθερή σε 224×224 κατά τη διάρκεια της περικοπής, και η ανίχνευση και εξαγωγή του προσώπου πραγματοποιήθηκε με τη βιβλιοθήκη C++ dlib.
Αποτελέσματα
Η ακρίβεια των αποτελεσμάτων ελέγχθηκε ενάντια στο Deepfake, Face2Face, FaceSwap, Neural Texture, και το πλήρες σύνολο δεδομένων με είσοδο RGB και RGBD, χρησιμοποιώντας το πλαίσιο FaceForensic++.

Αποτελέσματα στην ακρίβεια για τέσσερις μεθόδους deepfake, και ενάντια στο πλήρες μη διαχωρισμένο σύνολο δεδομένων. Τα αποτελέσματα χωρίζονται μεταξύ ανάλυσης εικόνων πηγή RGB, και των ίδιων εικόνων με ενσωματωμένο χάρτη βάθους. Τα καλύτερα αποτελέσματα είναι σε έντονα, με ποσοστά που δείχνουν το βαθμό στον οποίο η πληροφορία βάθους βελτιώνει το αποτέλεσμα.
Σε όλες τις περιπτώσεις, ο καναλίσκος βάθους βελτιώνει την απόδοση του μοντέλου σε όλες τις διαμορφώσεις. Το Xception λαμβάνει τα καλύτερα αποτελέσματα, με το MobileNet κοντά. Σε αυτό, οι συγγραφείς σχολιάζουν:
‘[Είναι] ενδιαφέρον να σημειωθεί ότι το MobileNet είναι ελαφρώς κατώτερο από το Xception και υπερέχει του ResNet50. Αυτό είναι ένα αξιοσημείωτο αποτέλεσμα όταν考虑είται ο στόχος της μείωσης του χρόνου εύρεσης για εφαρμογές σε πραγματικό χρόνο. Αν και αυτό δεν είναι η κύρια συνεισφορά αυτής της εργασίας, ακόμη θεωρούμε το ως một ενθαρρυντικό αποτέλεσμα για μελλοντικές αναπτύξεις.’
Οι ερευνητές επίσης σημειώνουν μια συνεχή υπεροχή της εισόδου RGBD και 2-κανάλι εικόνων σε κλίμακα του γκρι έναντι της εισόδου RGB και απλής εικόνας σε κλίμακα του γκρι, παρατηρώντας ότι οι μετατροπές σε κλίμακα του γκρι των εύρεσεων βάθους, οι οποίες είναι υπολογιστικά πολύ φθηνές, επιτρέπουν στο μοντέλο να λάβει βελτιωμένα αποτελέσματα με πολύ περιορισμένα τοπικά πόρους, διευκολύνοντας την μελλοντική ανάπτυξη ανίχνευσης deepfakes σε πραγματικό χρόνο με βάση την πληροφορία βάθους.
Πρώτη δημοσίευση 24ης Αυγούστου 2022.














