Η γωνία του Anderson

Η Ακρίβεια Ανίχνευσης Deepfake Πέφτει Κατά 49% σε Ένα Έτος Προόδου Βίντεο AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Montage of frame-grabs from AI-generated videos created for the new DF26 dataset. Source - https://huggingface.co/datasets/DF26/DF26/tree/main/fake

Παρατηρώ με ενδιαφέρον ένα νέο χαρτί υπό την ηγεσία της Ουκρανίας που υποδεικνύει ότι η παλαιότερη γενιά των deepfake βίντεο ανιχνευτών αποδίδει πολύ άσχημα στα τρέχοντα κορυφαία βίντεο genAI, είτε οι δημιουργοί είναι ανοιχτού κώδικα, τοπικές εγκαταστάσεις AI όπως το Wan 2.2 της Alibaba ή το Hunyuan Video, είτε μοντέλα μόνο API, κλειστού κώδικα όπως το Grok Imagine ή το Kling.

Κάντε κλικ για αναπαραγωγή (ΑΠΟΛΟΓΙΚΟ ΠΕΡΙΕΧΟΜΕΝΟ). Τρία παραδείγματα από την κατηγορία ‘Άμεση κάμερα χαλαρά’ στο σύνολο δεδομένων DF26. Πηγή 

Το 2024, ένα άλλο άρθρο είχε ήδη αποδείξει ότι η ανθρώπινη ικανότητα να ανιχνεύει βίντεο AI ήταν όχι τόσο πάνω από την τυχαία πιθανότητα, στο 57%. Αυτό που προσθέτει η νέα εργασία (με τίτλο DF26: Δεν Μπορούμε Πλέον να Ξεχωρίσουμε το Ψεύτικο από το Πραγματικό) είναι εμπειρική απόδειξη ότι οι αυτοματοποιημένοι ανιχνευτές deepfake έχουν μειωθεί δραματικά στην αποτελεσματικότητά τους από τότε – από 94% σε 48%, όταν αντιμετωπίζουν την πιο πρόσφατη έξοδο βίντεο genAI.

Από το νέο σύνολο δεδομένων που δημιουργήθηκε για την εργασία, παραδείγματα βίντεο που δημιουργήθηκαν από εικόνα-σε-βίντεο και κείμενο-σε-βίντεο (παρακάτω), συγκριμένα με πραγματικά βίντεο στα αριστερά. Το σώμα εστιάζει σε 'πειστικές' και αξιόπιστες διατάξεις κεφαλής-και-ώμων, που είναι μεταξύ των πιο ανησυχητικών τομέων genAI αυτή τη στιγμή. Πηγή -  https://arxiv.org/pdf/2609.07369

Από το νέο σύνολο δεδομένων που δημιουργήθηκε για την εργασία, παραδείγματα βίντεο που δημιουργήθηκαν από εικόνα-σε-βίντεο και κείμενο-σε-βίντεο (παρακάτω), συγκριμένα με πραγματικά βίντεο στα αριστερά. Το σώμα εστιάζει σε ‘πειστικές’ και αξιόπιστες διατάξεις κεφαλής-και-ώμων, που είναι μεταξύ των πιο ανησυχητικών τομέων genAI αυτή τη στιγμή. Πηγή

Η πιο απότομη πτώση στα τεστ που πραγματοποιήθηκαν για την εργασία αντιπροσωπεύει μια μείωση κατά 49%. Δεδομένου ότι το προηγούμενο σημείο αναφοράς χρονολογείται από το 2025, και η νέα εργασία δοκιμάζει μια σειρά από τα πιο πρόσφατα μοντέλα βίντεο γενιάς 2026, αυτό το ποσοστό αντιπροσωπεύει σχεδόν ένα χρόνο επιδείνωσης στην αποτελεσματικότητα ανίχνευσης βίντεο AI.

Λεπτομέρειες των μοντέλων που χρησιμοποιήθηκαν για τη δημιουργία των βίντεο κατά τα οποία δοκιμάστηκαν οι ανιχνευτές.

Λεπτομέρειες των μοντέλων που χρησιμοποιήθηκαν για τη δημιουργία των βίντεο κατά τα οποία δοκιμάστηκαν οι ανιχνευτές.

Τα κλειστού κώδικα, εμπορικά μοντέλα που χρησιμοποιήθηκαν για τη δημιουργία αυτού του αποτελέσματος που παρακάμπτει τους ανιχνευτές ήταν τα Grok 1.0· Kling 3.0· Veo 3.1· και Wan 2.6. Δημιουργήθηκαν μόνο παραδείγματα κειμένου-σε-βίντεο για αυτά, καθώς η προσπάθεια δημιουργίας εικόνας-σε-βίντεο (I2V) συχνά ενεργοποιούσε φίλτρα σχετικά με τη ‘δημιουργία deepfake’, ή θα παραβίαζε τους όρους χρήσης της πλατφόρμας.

Κοιτάξτε Στα Μάτια Μου

Αυτά τα ερεθίσματα πιθανώς συνέβησαν επειδή οι ερευνητές εστίασαν στην πιο ενδεχομένως ισχυρή, και ενδεχομένως διεφθαρμένη μορφή πειθούς μέσω βίντεο – διάφορες παραλλαγές βίντεο ‘κεφάλι και ώμος’ και ‘ομιλούν το κεφάλι’ με υποκείμενα που μιλούν στην κάμερα, όπως σε βίντεο influencer στο YouTube και TikTok, ή σε σενάριο ειδησεογραφικής αναφοράς (συμπεριλαμβανομένων συνεντεύξεων μέσω δορυφορικών συνδέσεων κ.λπ.).

Οι συγγραφείς υποστηρίζουν ότι αυτά τα σενάρια είναι κύριοι στόχοι για δραστηριότητα deepfake, όχι μόνο επειδή αντιπροσωπεύουν πλαίσια ‘influencer’ και διάφορα άλλα ‘πληροφοριακά’ – πλαίσια όπου υπάρχει υπόθεση προηγούμενης σχέσης εμπιστοσύνης, και όπου αυτή η σχέση έχει μεγάλο δυναμικό κατάχρησης (φυσικά αυτό ισχύει τουλάχιστον εξίσου για τις βιντεοκλήσεις deepfake, αν και οι ερευνητές δεν το εξετάζουν).

Από την κορυφή της εποχής των deepfake με autoencoder, η χειραγώγηση πραγματικού υλικού του Richard Nixon κατάφερε να προσομοιώσει την ανακοίνωσή του για το θάνατο των αστροναυτών του Apollo 9 το 1969 – ένα γεγονός που δεν συνέβη ποτέ, αλλά για το οποίο το πραγματικό σενάριο χρησιμοποιήθηκε για να επιβληθεί μια deepfake φωνή και κινήσεις χειλιών.

Εκτός από την εστίαση σε αυτό το σενάριο influencer, το νέο benchmark – και τα βίντεο που δημιουργήθηκαν γι’ αυτό – εστιάζουν στην αξιολόγηση του ολόκληρου καρέ του βίντεο, σε αντίθεση με τις ιστορικές στρατηγικές ανίχνευσης deepfake.

Αυτές οι παλαιότερες στρατηγικές εφάρμοζαν χειρισμό προσώπου ή χειρισμό έκφρασης, ή αντικατάσταση προσώπου (ή το καλύτερο, ολόκληρης κεφαλής) σε πραγματικά βίντεο – που ήταν πράγματι η μόνη λογική προσέγγιση, μέχρι τα μοντέλα βάσει διάχυσης να γίνουν αρκετά αποτελεσματικά ώστε να τα αντικαταστήσουν τα τελευταία 18-24 μήνες.

Απομακρύνετε το Πρόσωπο

Δεν γίνεται πια έτσι· η παλαιότερη μέθοδος βασισμένη σε autoencoder χρονολογείται από την αρχική εμφάνιση των deepfake στα τέλη του 2017· και αυτή η τεχνική, που αντικαθιστά μόνο την περιοχή εντός των εξωτερικών γραμμών του προσώπου, εξαντλήθηκε πλήρως μέχρι το 2022.

Η κύρια περιοχή για δραστηριότητα deepfake, 2017-2023 – αλλά για τη νέα γενιά πλατφορμών βίντεο genAI, δεν υπάρχει τέτοιο όριο για συγκέντρωση της προσοχής. Πηγή - https://arxiv.org/pdf/2203.01318.pdf

Η κύρια περιοχή για δραστηριότητα deepfake, 2017-2023 – αλλά για τη νέα γενιά πλατφορμών βίντεο genAI, δεν υπάρχει τέτοιο όριο για συγκέντρωση της προσοχής. Πηγή

Ωστόσο, επειδή ο τομέας της επιστημονικής έρευνας αγαπάει μια μακροπρόθεσμη σταθερά – όπου ο στόχος είναι σταθερός και όπου ένα εξελισσόμενο φάσμα προσεγγίσεων μπορεί να δοκιμαστεί ετησίως ή δεκαετίες – οι μέθοδοι ανίχνευσης deepfake που βασίζονται στην «εσωτερική αντικατάσταση/τροποποίηση προσώπου» έχουν παραμείνει στη βιβλιογραφία και στις εμπορικές προσφορές ανίχνευσης, πολύ πέρα από τη διάρκεια ισχύος της υποκείμενης τεχνολογίας που στοχεύουν.

Εκτός από τα τρία κλειστού κώδικα μοντέλα που δοκιμάστηκαν για τη νέα εργασία, δοκιμήθηκαν επίσης τρία πολύ ικανά μοντέλα ανοιχτού κώδικα κατάλληλα για καταναλωτές: Wan 2.2 A14B; HunyuanVideo 1.5; και LTX 2.3, το οποίο εντυπωσιάζει την κοινότητα FOSS genAI τελευταία. Η σειρά LTX είναι επίσης ικανή να παράγει ομιλία:

Κάντε κλικ για αναπαραγωγή: πειράματα με τη σειρά LTX στο r/stablediffusion, της οποίας η κοινότητα ασχολείται μόνο με μοντέλα FOSS. Πηγή 

Σχεδίαση Δεδομένων

Οι συγγραφείς προορίζουν το νέο τους σύνολο δεδομένων, DF26, ως σύνολο «hold‑out» για αξιολόγηση άγνωστου υλικού. Η συλλογή αποτελείται από 2.691 βίντεο σε τρία σενάρια δημόσιας ομιλίας: άμεση κάμερα ή ανεπίσημες ομιλίες· επίσημες δηλώσεις· και συνεντεύξεις στο στούντιο.

Όλα τα βίντεο AI δημιουργήθηκαν βάσει 271 πραγματικών κλιπ που επιλέχθηκαν από OpenVid· TalkingCelebs· και MAVOS‑DD.

Δείγμα από τη συλλογή OpenVid, από την οποία προήλθαν 271 πραγματικά βίντεο ως υλικό βάσης για τα AI‑δημιουργημένα βίντεο στη συλλογή DF26. Δύο άλλα σύνολα δεδομένων συνέβαλαν επίσης σε αυτό το μη ψεύτικο τμήμα του DF26. Πηγή - https://arxiv.org/pdf/2407.02371

Δείγμα από τη συλλογή OpenVid, από την οποία προήλθαν 271 πραγματικά βίντεο ως υλικό βάσης για τα AI‑δημιουργημένα βίντεο στη συλλογή DF26. Δύο άλλα σύνολα δεδομένων συνέβαλαν επίσης σε αυτό το μη ψεύτικο τμήμα του DF26. Πηγή

Τα 271 πραγματικά βίντεο χρησιμοποιήθηκαν για τη δημιουργία των AI βίντεο προεξάγοντας αντιστοιχίες σκηνών από τα καρέ τους, και στη συνέχεια τροφοδοτώντας αυτές τις προτροπές – καθώς και το πρώτο καρέ, όπου υποστηρίζεται – στα επτά μοντέλα δημιουργίας βίντεο, ώστε να παραχθούν συνολικά 2.420 συνθετικά κλιπ.

Οι συγγραφείς διασφάλισαν ότι κανένα πραγματικό καρέ με επικάλυψη κειμένου (όπως ανακοινώσεις για το ποιος μιλάει κ.λπ.) δεν επιτράπηκε στα ροές παραγωγής, καθώς αυτά θα μπορούσαν να ενθαρρύνουν συντομεύσεις και υποθέσεις. Τα υποψήφια κλιπ αξιολογήθηκαν από το Gemini 2.5.

Επιπλέον, τμήματα που περιείχαν περισσότερα από ένα πρόσωπα απορρίφθηκαν, ώστε να επιβληθεί ρύθμιση «ενός ομιλητή».

Κάντε κλικ για αναπαραγωγή [NO SOUND]. Από το σύνολο δεδομένων που σχετίζεται με το άρθρο, παραδείγματα κορυφαίων δημιουργιών βίντεο από επτά από τα πιο πρόσφατα και ικανά γενετικά μοντέλα, τόσο ανοιχτά όσο και κλειστά. Τα μοντέλα που χρησιμοποιήθηκαν για το σύνολο δεδομένων περιλαμβάνουν επίσης εκείνα που μπορούν να παράγουν ομιλία (δείτε παραδείγματα νωρίτερα σε αυτό το άρθρο). Πηγή

Οι ερευνητές χρησιμοποίησαν την δημοφιλή εμπορική πλατφόρμα Higgsfield AI, η οποία προσφέρει μια ευρεία ποικιλία κλειστών και ανοιχτών μοντέλων, με διαφορετικά επίπεδα ελέγχου και προστατευτικούς μηχανισμούς.

Με μια NVIDIA H200 (141 GB VRAM) ως βασική GPU για ένα εσωτερικό ερευνητικό σύμπλεγμα, χρειάστηκαν περίπου 440 ώρες GPU για τη δημιουργία 1.626 βίντεο για τη συλλογή.

Εκτός από τη διασφάλιση ότι δεν εμφανίζεται κείμενο στην έξοδο, ήταν επίσης απαραίτητο να αμβλυνθεί ή γενικά να αποφευχθεί η απεικόνιση υδατογραφήματος AI, καθώς αυτό θα μπορούσε επίσης να αποτελέσει μια πιθανή «συντόμευση» για έναν αξιολογητή ή σύστημα αξιολόγησης.

Δοκιμές

Το κύριο μέτρο που χρησιμοποιήθηκε για τον τελικό γύρο δοκιμών ήταν η Περιοχή Κάτω από την Καμπύλη Λειτουργίας Λήψης Παραληπτών (AUC / AUROC), με το Ποσοστό Ισοδυναμίας Σφάλματος (EER) ως συμπληρωματικό μέτρο.

Οι ανιχνευτές βάσει καρέ (που αξιολογούν ανεξάρτητα τα στατικά καρέ) δοκιμάστηκαν σε 32 ομοιόμορφα κατανεμημένα καρέ από κάθε βίντεο, με τις βαθμολογίες να μέσονται σε ένα ενιαίο αποτέλεσμα. Οι ανιχνευτές χρονικής φύσης (που μπορούν να χρησιμοποιήσουν πληροφορίες από διαδοχικά καρέ) αντέδρασαν αντίθετα, αναλύοντας την ίδια τη σειρά βίντεο.

Τα αποτελέσματα για τους χρονικούς ανιχνευτές DFD‑FCG και PwTF‑DVD φαίνονται παρακάτω, μαζί με τα αποτελέσματα για ForAda· Effort· FSFM· GenD‑CLIP και GenD‑DINO· και DFD‑HR. Όλα εκπαιδεύτηκαν στο αξιόλογο σύνολο δεδομένων FaceForensics++.

Αποτελέσματα δοκιμών που συγκρίνουν ανιχνευτές deepfake στο CelebDF++ και DF26. Όλοι οι ανιχνευτές εκπαιδεύτηκαν στο FaceForensics++, με υψηλότερο AUROC και χαμηλότερο EER να υποδεικνύουν καλύτερη απόδοση.

Αποτελέσματα δοκιμών που συγκρίνουν ανιχνευτές deepfake στο CelebDF++ και DF26. Όλοι οι ανιχνευτές εκπαιδεύτηκαν στο FaceForensics++, με υψηλότερο AUROC και χαμηλότερο EER να υποδεικνύουν καλύτερη απόδοση.

Οι συγγραφείς σημειώνουν ότι οι περισσότεροι ανιχνευτές αποδίδουν καλά στο Celeb‑DF++ (CDFv3), αλλά πέφτουν απότομα στην πιο απαιτητική νέα συλλογή DF26.

Οι «[Multiple] ανιχνευτές αιχμής επιτυγχάνουν ισχυρή απόδοση στο benchmark CelebDF++ [16] (CDFv3), με τις χρονικές μεθόδους να φθάνουν σε AUROC 94,3 και 92,3.

‘Ωστόσο, η απόδοσή τους μειώνεται σημαντικά στο DF26, σε 48.2 και 61.6 AUROC, αντίστοιχα.

‘Οι περισσότερες μέθοδοι υποβαθμίζονται σημαντικά, παραμένοντας κοντά στην τυχαία απόδοση· το υψηλότερο AUROC 69.7 επιτυγχάνεται από το GenD-PE.

‘Αυτό δείχνει ότι το DF26 αποτελεί ένα πιο απαιτητικό benchmark για τους κορυφαίους ανιχνευτές.’

Παρατηρούν ότι η εικόνα-προς-βίντεο αποδείχθηκε πιο δύσκολη στην ανίχνευση από το κείμενο-προς-βίντεο, τόσο για ανθρώπους όσο και για αυτοματοποιημένους ανιχνευτές, με το PwTF-DVD να αποδίδει καλύτερα στο υλικό I2V και το GenD-PE να ηγείται στο T2V.

Η απόδοση διέφερε δραματικά ανάλογα με το ποιος γεννήτορας παρήγαγε το ψεύτικο βίντεο, υποδεικνύοντας ότι οι ανιχνευτές συχνά μάθαιναν ίχνη ειδικά για τον γεννήτορα αντί για μια γενική υπογραφή συνθετικού βίντεο. Το PwTF-DVD, για παράδειγμα, έφτασε σε AUROC 92.9 στο κείμενο-προς-βίντεο του Wan 2.2, αλλά έπεσε σε σχεδόν τυχαία απόδοση στο HunyuanVideo 1.5 – παρόλο που και τα δύο ανήκαν στο ίδιο σύγχρονο τοπίο γεννητριών:

Απόδοση ανιχνευτών σε εμπορικούς και ανοιχτού κώδικα γεννήτορες βίντεο. Η μεγάλη διακύμανση μεταξύ των στηλών δείχνει ότι η αξιοπιστία της ανίχνευσης εξαρτάται έντονα από το ποιο μοντέλο παρήγαγε το βίντεο, με το GenD-PE να πετυχαίνει το υψηλότερο μέσο AUROC συνολικά.

Απόδοση ανιχνευτών σε εμπορικούς και ανοιχτού κώδικα γεννήτορες βίντεο. Η μεγάλη διακύμανση μεταξύ των στηλών δείχνει ότι η αξιοπιστία της ανίχνευσης εξαρτάται έντονα από το ποιο μοντέλο παρήγαγε το βίντεο, με το GenD-PE να πετυχαίνει το υψηλότερο μέσο AUROC συνολικά.

Παρακάτω βλέπουμε ότι η επανεκπαίδευση του GenD-PE σε νεότερο υλικό DF26 βελτίωσε σημαντικά την ικανότητά του να ανιχνεύει βίντεο από γεννήτορες που δεν είχε δει κατά την εκπαίδευση:

Αποτελέσματα επανεκπαίδευσης για το GenD-PE σε αόρατους γεννήτορες βίντεο. Η εκπαίδευση σε νεότερο υλικό DF26 βελτίωσε γενικά την απόδοση μεταξύ γεννητόρων σε σύγκριση με την αρχική εκπαίδευση FaceForensics++.

Αποτελέσματα επανεκπαίδευσης για το GenD-PE σε αόρατους γεννήτορες βίντεο. Η εκπαίδευση σε νεότερο υλικό DF26 βελτίωσε γενικά την απόδοση μεταξύ γεννητόρων σε σύγκριση με την αρχική εκπαίδευση FaceForensics++.

Η εκπαίδευση στο HunyuanVideo 1.5 ανέβασε το AUROC τουλάχιστον στο 93.1 για το Grok Imagine 1.0, το Veo 3.1 και το Wan 2.6, υποστηρίζοντας το επιχείρημα του άρθρου ότι οι ανιχνευτές που εκπαιδεύονται μόνο σε παλαιότερα σύνολα δεδομένων όπως το FaceForensics++ δεν ταιριάζουν καλά με τα τρέχοντα γεννητικά βίντεο.

Ίσως προβλέψιμα, οι δύο χρονικοί ανιχνευτές είχαν πολύ πιο εύκολη δουλειά με βίντεο ανοιχτού κώδικα παρά με κλιπ από εμπορικά μοντέλα. Το DFD-FCG έπεσε από AUROC 57.4 στο υλικό ανοιχτού κώδικα σε 34.5 στο κλειστού κώδικα βίντεο· ενώ το PwTF-DVD μειώθηκε από 70.5 σε 48.3:

Αποτελέσματα σύγκρισης δύο χρονικών ανιχνευτών ανά πηγή γεννήτορα και σενάριο ομιλίας. Και οι δύο αποδόθηκαν σημαντικά χειρότερα σε κλειστού κώδικα βίντεο, ενώ οι διαφορές μεταξύ τύπων σκηνών ήταν μικρότερες.

Αποτελέσματα σύγκρισης δύο χρονικών ανιχνευτών ανά πηγή γεννήτορα και σενάριο ομιλίας. Και οι δύο αποδόθηκαν σημαντικά χειρότερα σε κλειστού κώδικα βίντεο, ενώ οι διαφορές μεταξύ τύπων σκηνών ήταν μικρότερες.

Ωστόσο, το άρθρο δεν φτάνει στο συμπέρασμα ότι τα εμπορικά μοντέλα είναι απλώς πιο δύσκολα στην ανίχνευση, καθώς διαφορές στην οικογένεια μοντέλων, στην επεξεργασία μετά την παραγωγή και στην οπτική ποιότητα θα μπορούσαν επίσης να είναι παράγοντες.

Ο τύπος σκηνής είχε πολύ λιγότερη σημασία: το DFD-FCG παρέμεινε κοντά στην τυχαία απόδοση σε κλιπ άμεσης κάμερας, επίσημες δηλώσεις και συνεντεύξεις στο στούντιο, ενώ το PwTF-DVD έπαιξε καλύτερα σε επίσημες δηλώσεις. Σύμφωνα με το άρθρο, ο ίδιος ο γεννήτορας φαίνεται να έχει μεγαλύτερη σημασία από το στυλ παρουσίασης.

Διεξήχθη επίσης μια μελέτη ανθρώπων για να δούμε αν οι άνθρωποι αντιμετωπίζουν το DF26 με τον ίδιο τρόπο όπως οι αυτοματοποιημένοι ανιχνευτές. Σε 232 συνεδρίες σήμανσης, οι συμμετέχοντες αξιολόγησαν σύντομα κλιπ από DF26, CelebDF++ και DeepSpeak v2 ως πραγματικά ή ψεύτικα, χωρίς να τους λέγεται πόσα παραδείγματα κάθε κλάσης θα έβλεπαν.

Ανθρώπινη ακρίβεια σε DF26, CelebDF++ και DeepSpeak v2. Οι συμμετέχοντες αναγνώρισαν πραγματικά βίντεο με παρόμοιους ρυθμούς σε όλα τα τρία σύνολα δεδομένων, ενώ η ακρίβεια στα ψεύτικα βίντεο DF26 έπεσε κοντά στην τυχαία απόδοση.

Ανθρώπινη ακρίβεια σε DF26, CelebDF++ και DeepSpeak v2. Οι συμμετέχοντες αναγνώρισαν πραγματικά βίντεο με παρόμοιους ρυθμούς σε όλα τα τρία σύνολα δεδομένων, ενώ η ακρίβεια στα ψεύτικα βίντεο DF26 έπεσε κοντά στην τυχαία απόδοση.

Η απόδοση σε πραγματικά βίντεο ήταν παρόμοια σε όλα τα τρία σύνολα δεδομένων, με 76.0% για το DF26, 75.5% για το CelebDF++ και 72.8% για το DeepSpeak v2. Η διαφορά εμφανίστηκε στα ψεύτικα βίντεο, όπου η ακρίβεια έπεσε στο 52.6% για το DF26, σε σύγκριση με 74.5% και 69.8% στα δύο παλαιότερα σύνολα.

Ως εκ τούτου, σύμφωνα με το άρθρο, αν και οι συμμετέχοντες δεν ήταν γενικά μπερδεμένοι από το DF26, δυσκολεύονταν να βρουν συγκεκριμένη οπτική απόδειξη ότι τα συνθετικά του βίντεο ήταν ψεύτικα.

Συμπέρασμα

Παρά μια αναφερθείσα αύξηση 16 φορές στη συχνότητα των deepfake τα τελευταία δύο χρόνια, η πραγματική ύπαρξη των κακόβουλων deepfake λείπει σε μεγάλο βαθμό από την κοινή μας εμπειρία, εκτός εάν στοχευόμαστε εμείς οι ίδιοι.

Στην περίπτωση των θυμάτων σεξουαλικών deepfake, αυτό είναι απολύτως κατανοητό – αλλά επειδή τα deepfake πλέον έχουν μια αυξανόμενη επίδραση στο έγκλημα της απάτης, θα ήταν χρήσιμο αν περισσότερο υλικό αυτού του τύπου μπορούσε να κοινοποιηθεί στο κοινό, ώστε το πλαίσιο μας να ενημερωθεί από την «χρυσή εποχή» των autoencoder deepfake στην πολύ πιο επιθετική και παραπλανητική εποχή των diffusion‑based deepfake.

Φυσικά, το μεγαλύτερο μέρος του υλικού που σχετίζεται με τα αποτελέσματα των μοντέλων στη νέα μελέτη, καθώς και άλλα μοντέλα, εμφανίζεται χωρίς επαρκές πλαίσιο στις πλατφόρμες κοινωνικής δικτύωσης των οποίων οι επιτηρητές είτε δεν μπορούν να διακρίνουν την AI από το πραγματικό, είτε απλώς δεν τους ενδιαφέρει.

Ένα επιπλέον μέτρο που όλοι μπορούμε να εφαρμόσουμε σε βίντεο που αμφιβάλλουμε είναι η λογική ευπρέπεια – αλλά αυτή η ικανότητα διαφέρει τόσο πολύ μεταξύ ατόμων ώστε να είναι αναξιόπιστη. Συνεπώς, μπορεί να είναι για μια μεταβατική περίοδο, καθώς προσαρμοζόμαστε στην επίδραση αυτής της τεχνολογίας και στις συνεχώς αυξανόμενες δυνατότητές της, να πρέπει απλώς να αναβάλλουμε την κρίση.

 

Πρώτη δημοσίευση Δευτέρα, 14 Σεπτεμβρίου 2026

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai