Η γωνία του Anderson
Αναζητώντας Νέα Εδάφη: Λανθάνουσες Μοντέλα Διαχύσεως και GANs για την Ανίχνευση Deepfake

Γνώμη
Τον τελευταίο καιρό, η ερευνητική κοινότητα για την ανίχνευση deepfake, η οποία από το τέλος του 2017 ασχολήθηκε σχεδόν αποκλειστικά με το πλαίσιο που βασίζεται στον autoencoder, έχει αρχίσει να λαμβάνει ενδιαφέρον για λιγότερο στατικά αρχιτεκτονικά, συμπεριλαμβανομένων λανθανουσών μοντέλων διαχύσεως, όπως το DALL-E 2 και το Stable Diffusion, καθώς και την έξοδο των Γεννητικών Αντιπαλών Δικτύων (GANs). Για παράδειγμα, τον Ιούνιο, το Πανεπιστήμιο του Μπέρκλεϊ δημοσίευσε τα αποτελέσματα της έρευνάς του για την ανάπτυξη ενός ανιχνευτή για την έξοδο του DALL-E 2.
Τι φαίνεται να οδηγεί αυτό το αυξανόμενο ενδιαφέρον είναι ο απότομος εξελικτικός αλγόριθμος στις ικανότητες και τη διαθεσιμότητα των λανθανουσών μοντέλων διαχύσεως το 2022, με την κλειστή πηγή και την περιορισμένη πρόσβαση έκδοση του DALL-E 2 την άνοιξη, ακολουθούμενη το τέλος του καλοκαιριού από την αισθητή απελευθέρωση του Stable Diffusion από την stability.ai.
Τα GANs έχουν επίσης μελετηθεί σε αυτό το контέκστ, αν και λιγότερο εντατικά, επειδή είναι πολύ δύσκολο να τα χρησιμοποιήσουν για πειστικές και περίπλοκες βίντεο-αναπαραγωγές ανθρώπων. 至 少, σε σύγκριση με τα πλέον αξιόπιστα πακέτα autoencoder, όπως το FaceSwap και το DeepFaceLab, και το τελευταίο live-streaming ξάδελφό του, DeepFaceLive.
Κινηματογραφικές Εικόνες
Σε κάθε περίπτωση, το galvanizing παράγοντα φαίνεται να είναι η προοπτική μιας επόμενης αναπτυξιακής σπριντ για την σύνθεση βίντεο. Η αρχή του Οκτωβρίου – και η κύρια εποχή των συνεδρίων του 2022 – χαρακτηρίστηκε από μια ξαφνική και απροσδόκητη λύση σε διάφορα μακροχρόνια προβλήματα σύνθεσης βίντεο.
Εάν πιστεύετε ότι κάτι τέτοιο έρχεται σε τριάδες, σκεφτείτε επίσης την αινιγματική υπόσχεση της stability.ai ότι «το βίντεο έρχεται» στο Stable Diffusion, φαινομενικά αργότερα αυτό το έτος, ενώ οι συν-αναπτυξιακοί του Runway έχουν κάνει μια παρόμοια υπόσχεση, αν και δεν είναι σαφές εάν αναφέρονται στο ίδιο σύστημα.
Τι φαίνεται να οδηγεί αυτή την αυξανόμενη τάση είναι η προοπτική μιας νέας γενιάς τεχνολογιών deepfake, με βάση τη διάχυση, με τη δυνατότητα να φωτογραφίσουν όχι μόνο ολόκληρα σώματα, αλλά και ολόκληρες σκηνές.
Blade Runner
Η τελευταία εργασία που αντιμετωπίζει, αντίστοιχα, την ανίχνευση λανθανουσών μοντέλων διαχύσεως και GAN-βασισμένων deepfake, είναι η συνεργασία μεταξύ του CISPA Helmholtz Center for Information Security και της Salesforce, και η εργασία του Adam Dorian Wong στο MIT’s Lincoln Laboratory.
Η αρχιτεκτονική που προτείνεται στην καινούργια εργασία ονομάζεται Blade Runner, αναφερόμενη στο Voight-Kampff test που καθορίζει εάν οι ανταγωνιστές στη σειρά επιστημονικής φαντασίας είναι «ψεύτικοι» ή όχι.
Η Blade Runner είναι ένα σύστημα που μπορεί να ανιχνεύσει GAN-βασισμένα deepfake, και να προσφέρει μια μέθοδο για να καθορίσει ποιο GAN χρησιμοποιήθηκε για την δημιουργία της εικόνας.
DE-FAKE
Η αρχιτεκτονική DE-FAKE έχει ως στόχο να επιτύχει «παγκόσμια ανίχνευση» για εικόνες που παράγονται από μοντέλα διαχύσεως κειμένου-εικόνας, και να προσφέρει μια μέθοδο για να καθορίσει ποιο λανθανό μοντέλο διαχύσεως παρήγαγε την εικόνα.
Η DE-FAKE χρησιμοποιεί τη βιβλιοθήκη OpenAI’s Contrastive Language-Image Pretraining (CLIP) για να εξαγάγει εμβυθύνσεις από «ψεύτικες» εικόνες λανθανουσών μοντέλων διαχύσεως, και να εκπαιδεύσει einen ταξινομητή στις παρατηρημένες τάξεις και κατηγορίες.
Η ομάδα των ερευνητών χρησιμοποίησε τα μοντέλα Stable Diffusion, Latent Diffusion, GLIDE και DALL-E 2 για να δημιουργήσουν ένα σύνολο δεδομένων εκπαίδευσης και δοκιμής, χρησιμοποιώντας τα MSCOCO και Flickr30k.
Τα αποτελέσματα της ομάδας είναι εξαιρετικά θετικά για δύο λόγους: πρώτον, δεν υπάρχουν πολλές προηγούμενες εργασίες με τις οποίες να τις συγκρίνουμε, και δεύτερον, η ταχύτητα εξέλιξης του πεδίου της σύνθεσης εικόνας είναι così ταχεία, που τα αποτελέσματα της εργασίας είναι πιθανό να είναι πιο χρήσιμα ως μελλοντικός οδηγός για tương laiτικές εργασίες.
Δεδομένα τα γεγονότα των τελευταίων τριών μηνών, οποιαδήποτε εταιρική νάρκη από πλευράς της OpenAI και άλλων ανταγωνιστών στον χώρο της σύνθεσης εικόνας είναι πιθανό να έχει εξαφανιστεί, σημαίνοντας ότι μπορούμε να περιμένουμε μια παρόμοια ταχεία ταχύτητα πρόοδου και στον κλειστό χώρο σύνθεσης εικόνας.
Πρώτη δημοσίευση 14ης Οκτωβρίου 2022.












