Η γωνία του Anderson

Αναίρεση Βίντεο-Συνεδριάσεων Με Την Λειτουργία “Δόνηση” Του Κινητού

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
An AI-generated illustration: 'a gorgeous panoramic picture of a man sitting in an office, looking into his smartphone, which he is holding; the man is wearing a Guy Fawkes mask; photorealistic, UHQ' - ChatGPT 3, Tuesday, 24 Σεπτεμβρίου 2024 13:27:31

Νέα έρευνα από τη Σιγκαπούρη έχει προτείνει einen νέο μέθοδο για την ανίχνευση εάν κάποιος στην άλλη πλευρά ενός εργαλείου τηλεδιάσκεψης κινητού τηλεφώνου χρησιμοποιεί μεθόδους όπως το DeepFaceLive για να υποδυθεί κάποιον άλλον.

Ο νέος προσεγγίσεις με τίτλο SFake, εγκαταλείπει τις παθητικές μεθόδους που χρησιμοποιούνται από τα περισσότερα συστήματα και προκαλεί το τηλέφωνο του χρήστη να δονείται (χρησιμοποιώντας τις ίδιες μηχανισμοί “δονησης” κοινές σε κινητά τηλέφωνα), και να θολώνει το πρόσωπό του.

Αν και τα συστήματα live deepfaking είναι ικανά να αναπαράγουν θόλωμα κίνησης, όσο το θολωμένο βίντεο περιλαμβανόταν στα δεδομένα εκπαίδευσης, ή τουλάχιστον στα δεδομένα προ-εκπαίδευσης, δεν μπορούν να ανταποκριθούν αρκετά γρήγορα στο απρόσμενο θόλωμα αυτού του είδους και συνεχίζουν να εξοδεύουν μη θολωμένα τμήματα προσώπου, αποκαλύπτοντας την ύπαρξη μιας τηλεδιάσκεψης deepfake.

Το DeepFaceLive δεν μπορεί να ανταποκριθεί αρκετά γρήγορα για να προσομοιώσει το θόλωμα που προκαλείται από τις δονήσεις της κάμερας. Πηγή: https://arxiv.org/pdf/2409.10889v1

Το DeepFaceLive δεν μπορεί να ανταποκριθεί αρκετά γρήγορα για να προσομοιώσει το θόλωμα που προκαλείται από τις δονήσεις της κάμερας. Πηγή: https://arxiv.org/pdf/2409.10889v1

Τα αποτελέσματα των δοκιμών στα δεδομένα που συλλέχθηκαν από τους ερευνητές (καθώς δεν υπάρχουν δεδομένα που να περιλαμβάνουν ενεργό δόνηση κάμερας) έδειξαν ότι το SFake υπερέβη τα ανταγωνιστικά μεθόδους ανίχνευσης βίντεο-deepfake, ακόμη και όταν αντιμετώπισε δύσκολες συνθήκες, όπως η φυσική κίνηση του χεριού που συμβαίνει όταν ο άλλος στην τηλεδιάσκεψη κρατάει την κάμερα με το χέρι του, αντί να χρησιμοποιεί στατική βάση τηλεφώνου.

Η Αυξανόμενη Ανάγκη για Ανίχνευση Βίντεο-Deepfake

Η έρευνα για την ανίχνευση βίντεο-deepfake έχει αυξηθεί πρόσφατα. Σε μια χρονική περίοδο που έχει δει πολλές επιτυχημένες ληστείες φωνής-deepfake, ένας εργαζόμενος της χρηματοοικονομικής το 2024 εξαπατήθηκε και μεταφέρθηκαν 25 εκατομμύρια δολάρια σε einen απάτη που χρησιμοποιούσε deepfake βίντεο-τηλεδιάσκεψης.

Αν και ένα σύστημα αυτού του είδους απαιτεί υψηλό επίπεδο πρόσβασης σε υλικό, πολλοί χρήστες κινητών τηλεφώνων έχουν ήδη συνηθίσει σε υπηρεσίες επαλήθευσης που ζητούν να καταγράψουν τα χαρακτηριστικά του προσώπου μας για επαλήθευση με βάση το πρόσωπο (αυτό είναι ακόμη και μέρος της διαδικασίας επαλήθευσης του LinkedIn).

Επομένως, φαίνεται πιθανό ότι τέτοιες μεθόδους θα εφαρμοστούν όλο και περισσότερο σε συστήματα τηλεδιάσκεψης, καθώς αυτό το είδος εγκλήματος συνεχίζει να κάνει τα νέα.

Οι περισσότερες λύσεις που αντιμετωπίζουν την ανίχνευση βίντεο-τηλεδιάσκεψης deepfake υποθέτουν μια πολύ στατική σκηνή, όπου ο επικοινωνούντος χρησιμοποιεί στατική webcam και δεν αναμένονται κινήσεις ή υπερβολικές αλλαγές περιβάλλοντος ή φωτισμού. Một κλήση κινητού τηλεφώνου δεν προσφέρει τέτοια «σταθερή» κατάσταση.

Αντίθετα, το SFake χρησιμοποιεί eine σειρά μεθόδων ανίχνευσης για να компενσάρει τον μεγάλο αριθμό οπτικών παραλλαγών σε μια τηλεδιάσκεψη κινητού τηλεφώνου με χέρι, και φαίνεται να είναι το πρώτο ερευνητικό πρόγραμμα που αντιμετωπίζει το ζήτημα με χρήση τυποποιημένου εξοπλισμού δονήσεων που είναι ενσωματωμένος στα κινητά τηλέφωνα.

Το έγγραφο έχει τίτλο Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes και προέρχεται από δύο ερευνητές από το Nanyang Technological University στη Σιγκαπούρη.

Μέθοδος

Το SFake έχει σχεδιαστεί ως μια υπηρεσία βασισμένη στο cloud, όπου μια τοπική εφαρμογή θα στείλει δεδομένα σε μια υπηρεσία API για επεξεργασία και τα αποτελέσματα θα σταλούν πίσω.

Ωστόσο, το μικρό του μέγεθος (450mb) και η βελτιστοποιημένη μεθοδολογία του επιτρέπουν να πραγματοποιήσει ανίχνευση deepfake完全 στο ίδιο το συσκευή, σε περιπτώσεις όπου η σύνδεση δικτύου θα μπορούσε να προκαλέσει υπερβολική συμπίεση των εικόνων, επηρεάζοντας τη διαγνωστική διαδικασία.

Η εκτέλεση “all local” σε αυτόν τον τρόπο σημαίνει ότι το σύστημα θα είχε άμεση πρόσβαση στο ρεύμα κάμερας του χρήστη, χωρίς την codec παρέμβαση που συχνά συνδέεται με τηλεδιάσκεψη.

Ο μέσος χρόνος ανάλυσης απαιτεί ένα δείγμα βίντεο 4 δευτερολέπτων, κατά τη διάρκεια του οποίου ο χρήστης ζητείται να παραμείνει ακίνητος, και κατά τη διάρκεια του οποίου το SFake στέλνει “προβές” για να προκαλέσει δονήσεις κάμερας σε επιλεκτικά τυχαία διαστήματα που τα συστήματα όπως το DeepFaceLive δεν μπορούν να ανταποκριθούν εγκαίρως.

(Πρέπει να τονιστεί ότι οποιοσδήποτε επιτιθέμενος που δεν έχει συμπεριλάβει περιεχόμενο θόλωμα στη βάση δεδομένων εκπαίδευσης είναι απίθανο να μπορεί να παράγει ένα μοντέλο που μπορεί να παράγει θόλωμα ακόμη και υπό πολύ πιο ευνοϊκές συνθήκες, και ότι το DeepFaceLive δεν μπορεί απλώς να “προσθέσει” αυτή τη λειτουργικότητα σε ένα μοντέλο που έχει εκπαιδευτεί σε μια υπο-επιμελημένη βάση δεδομένων)

Το σύστημα επιλέγει επιλεγμένες περιοχές του προσώπου ως περιοχές πιθανών περιεχομένων deepfake, εξαιρώντας τα μάτια και τα φρύδια (καθώς το βλέμμα και άλλες κινήσεις του προσώπου σε αυτή την περιοχή είναι εκτός του πεδίου της ανίχνευσης θόλωματος και δεν είναι ιδανικό δείκτη).

Σχέδιο SFake.

Σχέδιο SFake.

Όπως μπορούμε να δούμε στο σχεδιαστικό σχήμα παραπάνω, μετά την επιλογή κατάλληλων και μη προβλέψιμων μοτίβων δονήσεων, την επιλογή του καλύτερου εστιακού μήκους και την εκτέλεση αναγνώρισης προσώπου (συμπεριλαμβανομένης της ανίχνευσης ορόσημων μέσω ενός Dlib συστατικού που εκτιμά ένα τυπικό 68 ορόσημα προσώπου), το SFake εξάγει gradients από το είσοδο πρόσωπο και εστιάζει σε επιλεγμένες περιοχές αυτών των gradient.

Η ακολουθία διακύμανσης λαμβάνεται με τη σειριακή ανάλυση κάθε καρέ στην短 βίντεο που μελετάται, μέχρι να φθάσει η μέση ή “ιδεατή” ακολουθία, και το υπόλοιπο να αγνοηθεί.

Αυτό παρέχει εξαγόμενα χαρακτηριστικά που μπορούν να χρησιμοποιηθούν ως ποσοτικός δείκτης για την πιθανότητα περιεχομένου deepfake, με βάση τη βάση δεδομένων εκπαίδευσης (για την οποία, περισσότερα σε λίγο).

Το σύστημα απαιτεί ανάλυση εικόνας 1920×1080 pixel, καθώς και τουλάχιστον 2x απαίτηση zoom για το φακό. Το έγγραφο σημειώνει ότι τέτοιες ανάλυσεις (και ακόμη υψηλότερες ανάλυσεις) υποστηρίζονται στο Microsoft Teams, Skype, Zoom και Tencent Meeting.

Τα περισσότερα κινητά τηλέφωνα έχουν μια κάμερα μπροστά και μια κάμερα πίσω, και συχνά μόνο η μία από αυτές έχει τις δυνατότητες zoom που απαιτούνται από το SFake· η εφαρμογή θα απαιτούσε από τον επικοινωνούντα να χρησιμοποιήσει όποια από τις δύο κάμερες πληροί τις απαιτήσεις.

Ο στόχος εδώ είναι να ληφθεί η σωστή αναλογία του προσώπου του χρήστη στο ρεύμα βίντεο που θα αναλυθεί από το σύστημα. Το έγγραφο παρατηρεί ότι η μέση απόσταση που οι γυναίκες χρησιμοποιούν συσκευές κινητών τηλεφώνων είναι 34.7cm, και για τους άνδρες, 38.2cm (όπως αναφέρθηκε στο Journal of Optometry), και ότι το SFake λειτουργεί πολύ καλά σε αυτές τις αποστάσεις.

Καθώς η σταθεροποίηση είναι ένα ζήτημα με τα χειροκίνητα βίντεο, και καθώς το θόλωμα που προκαλείται από την κίνηση του χεριού είναι ένα εμπόδιο για τη λειτουργία του SFake, οι ερευνητές προσπάθησαν διάφορες μεθόδους για να компενσάρουν. Η πιο επιτυχημένη από αυτές ήταν η υπολογισμός του κεντρικού σημείου των εκτιμώμενων ορόσημων και η χρήση αυτού ως “αγκίστρου” – αποτελεσματικά, μια τεχνική σταθεροποίησης αλγορίθμου. Με αυτόν τον τρόπο, μια ακρίβεια 92% επιτεύχθηκε.

Δεδομένα και Δοκιμές

Καθώς δεν υπήρχαν κατάλληλα δεδομένα για τον σκοπό, οι ερευνητές ανέπτυξαν τα δικά τους:

‘[Χρησιμοποιούμε] 8 διαφορετικά είδη κινητών τηλεφώνων για να καταγράψουμε 15 συμμετέχοντες διαφόρων φύλων και ηλικιών για να δημιουργήσουμε τη δική μας βάση δεδομένων. Τοποθετούμε το κινητό τηλέφωνο σε μια βάση 20 cm μακριά από τον συμμετέχοντα και zoom σε δύο φορές, με στόχο το πρόσωπο του συμμετέχοντα για να περιλαμβάνει όλα τα χαρακτηριστικά του προσώπου ενώ δονείται το κινητό τηλέφωνο σε διάφορους μοτίβους.

‘Για κινητά τηλέφωνα των οποίων οι κάμερες μπροστά δεν μπορούν να zoom, χρησιμοποιούμε τις κάμερες πίσω ως υποκατάστατο. Καταγράφουμε 150 μεγάλες βίντεο, каждая 20 δευτερολέπτων διάρκειας. Από προεπιλογή,假设 ότι η διάρκεια ανίχνευσης διαρκεί 4 δευτερόλεπτα. Κόβουμε 10 κλιπ 4 δευτερολέπτων από ένα μεγάλο βίντεο με τυχαία εκκίνηση. Έτσι, λαμβάνουμε συνολικά 1500 πραγματικά κλιπ, κάθε ένα 4 δευτερολέπτων.

Хотя το DeepFaceLive (σύνδεσμος GitHub) ήταν ο κεντρικός στόχος της μελέτης, καθώς είναι目前 το πιο ευρέως χρησιμοποιούμενο ανοιχτό σύστημα live deepfaking, οι ερευνητές συμπεριέλαβαν τέσσερις άλλες μεθόδους για να εκπαιδεύσουν το βασικό μοντέλο ανίχνευσης: Hififace· FS-GANV2· RemakerAI· και MobileFaceSwap – το τελευταίο από αυτά είναι μια ιδιαίτερα κατάλληλη επιλογή, δεδομένου του στόχου περιβάλλοντος.

1500 ψευδείς βίντεο χρησιμοποιήθηκαν για την εκπαίδευση, μαζί με τον ίδιο αριθμό πραγματικών και αμεταβλητών βίντεο.

Το SFake δοκιμάστηκε ενάντια σε διάφορους ταξινομητές, συμπεριλαμβανομένων SBI· FaceAF· CnnDetect· LRNet· DefakeHop variants· και την δωρεάν διαδικτυακή υπηρεσία ανίχνευσης deepfake Deepaware. Για κάθε μια από αυτές τις μεθόδους deepfake, 1500 ψευδείς και 1500 πραγματικά βίντεο εκπαιδεύτηκαν.

Για τον βασικό ταξινομητή δοκιμής, χρησιμοποιήθηκε ένα απλό δίκτυο νευρώνων με δύο στρώματα και μια ReLU activation function. 1000 πραγματικά και 1000 ψευδείς βίντεο επιλέχθηκαν τυχαία (αν και τα ψευδείς βίντεο ήταν αποκλειστικά παραδείγματα DeepFaceLive).

Η περιοχή κάτω από την καμπύλη ROC (AUC/AUROC) και η ακρίβεια (ACC) χρησιμοποιήθηκαν ως μετρήσεις.

Για την εκπαίδευση και την inference, χρησιμοποιήθηκε ένα NVIDIA RTX 3060, και οι δοκιμές διεξήχθησαν σε Ubuntu. Τα βίντεο δοκιμής ηχογραφήθηκαν με ένα Xiaomi Redmi 10x, ένα Xiaomi Redmi K50, ένα OPPO Find x6, ένα Huawei Nova9, ένα Xiaomi 14 Ultra, ένα Honor 20, ένα Google Pixel 6a, και ένα Huawei P60.

Για να συμμορφωθεί με τις υπάρχουσες μεθόδους ανίχνευσης, οι δοκιμές υλοποιήθηκαν σε PyTorch. Τα κύρια αποτελέσματα δοκιμών εμφανίζονται στον πίνακα παρακάτω:

Αποτελέσματα για το SFake ενάντια σε άλλες μεθόδους.

Αποτελέσματα για το SFake ενάντια σε άλλες μεθόδους.

Εδώ οι συγγραφείς σχολιάζουν:

‘Σε όλες τις περιπτώσεις, η ακρίβεια ανίχνευσης του SFake υπερέβη το 95%. Από τις πέντε μεθόδους deepfake, εκτός από το Hififace, το SFake έχει καλύτερη απόδοση από τις άλλες έξι μεθόδους ανίχνευσης. Καθώς ο ταξινομητής μας εκπαιδεύτηκε χρησιμοποιώντας ψευδείς εικόνες που παράχθηκαν από το DeepFaceLive, έφτασε στο υψηλότερο ποσοστό ακρίβειας 98.8% όταν ανίχνευε το DeepFaceLive.

‘Όταν αντιμετωπίζουμε ψευδείς πρόσωπα που παράχθηκαν από το RemakerAI, οι άλλες μεθόδους ανίχνευσης έχουν κακή απόδοση. Υποθέτουμε ότι αυτό μπορεί να οφείλεται στην αυτόματη συμπίεση των βίντεο κατά τη λήψη από το διαδίκτυο, που οδηγεί στην απώλεια λεπτομερειών εικόνας και, επομένως, στην μείωση της ακρίβειας ανίχνευσης. Ωστόσο, αυτό δεν επηρεάζει την ανίχνευση από το SFake, το οποίο επιτυγχάνει ακρίβεια 96.8% στην ανίχνευση του RemakerAI.’

Οι συγγραφείς σημειώνουν επίσης ότι το SFake είναι το πιο αποτελεσματικό σύστημα στην περίπτωση που εφαρμόζεται ένα zoom 2x στο φακό, поскольку αυτό μεγεθύνει την κίνηση και είναι μια εξαιρετικά δύσκολη προοπτική. Ακόμη και σε αυτή την περίπτωση, το SFake ήταν σε θέση να επιτύχει ακρίβεια αναγνώρισης 84% και 83%, αντίστοιχα για παράγοντες μεγέθυνσης 2,5 και 3.

Συμπέρασμα

Ένα πρόγραμμα που χρησιμοποιεί τις αδυναμίες ενός συστήματος live deepfake εναντίον του ίδιου είναι μια αναζωογονητική προσφορά σε ένα έτος όπου η ανίχνευση deepfake έχει κυριαρχηθεί από έγγραφα που έχουν απλώς ανακαταμεικτήσει παλιές προσεγγίσεις γύρω από την ανάλυση συχνότητας (η οποία είναι μακράν ασφαλής από τις καινοτομίες στο χώρο deepfake).

Στο τέλος του 2022, ένα άλλο σύστημα χρησιμοποιούσε μεταβολές στη φωτεινότητα του монιτόρ ως ανιχνευτή. Και το ίδιο έτος, η δική μου επίδειξη της αδυναμίας του DeepFaceLive να χειριστεί σκληρές προβολές 90 μοιρών κέρδισε κάποιο ενδιαφέρον της κοινότητας.

Το DeepFaceLive είναι ο σωστός στόχος για ένα τέτοιο πρόγραμμα, καθώς είναι几乎 σίγουρα ο στόχος του εγκληματικού ενδιαφέροντος σχετικά με την απάτη τηλεδιάσκεψης.

Ωστόσο, έχω δει πρόσφατα κάποιες αναφορές ότι το LivePortrait σύστημα, το οποίο είναι πολύ δημοφιλές στη κοινότητα VFX, χειρίζεται προβολές προφίλ πολύ καλύτερα από το DeepFaceLive· θα ήταν ενδιαφέρον αν θα μπορούσε να συμπεριληφθεί σε αυτή τη μελέτη.

Πρώτη δημοσίευση την Τρίτη, 24 Σεπτεμβρίου 2024

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]