Η γωνία του Anderson

Ένα Νέο και Απλούστερο Μέθοδο Deepfake που Ξεπερνά τις Προηγούμενες Προσεγγίσεις

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια συνεργασία μεταξύ μιας κινεζικής ομάδας ερευνών AI και ερευνητών στις Ηνωμένες Πολιτείες έχει αναπτύξει ό,τι μπορεί να είναι η πρώτη πραγματική καινοτομία στην τεχνολογία deepfakes από τότε που το φαινόμενο εμφανίστηκε πριν από τέσσερα χρόνια.

Η νέα μέθοδος μπορεί να εκτελέσει ανταλλαγές προσώπων που ξεπερνούν όλα τα άλλα υπάρχοντα πλαίσια στις τυπικές δοκιμές αντίληψης, χωρίς να χρειάζεται να συλλέξει και να επιμεληθεί εξαντλητικά μεγάλες αφιερωμένες συνόλους δεδομένων και να τις εκπαιδεύσει για έως και μια εβδομάδα για μόνο μια ταυτότητα. Για τα παραδείγματα που παρουσιάζονται στην nuova εργασία, τα μοντέλα εκπαιδεύτηκαν στο ολόκληρο δύο δημοφιλών συνόλων δεδομένων διασημοτήτων, σε ένα NVIDIA Tesla P40 GPU για περίπου τρεις ημέρες.

Πλήρης βίντεο ενσωματωμένο στο τέλος του άρθρου. Σε αυτό το δείγμα από ένα βίντεο στα συμπληρωματικά υλικά για την nuova εργασία, το πρόσωπο της Scarlett Johansson μεταφέρεται στο βίντεο πηγή. Το CihaNet αφαιρεί το πρόβλημα της μάσκας άκρων όταν εκτελεί μια ανταλλαγή, σχηματίζοντας και εφαρμόζοντας βαθύτερες σχέσεις μεταξύ της πηγή και της στόχου ταυτότητας, που σημαίνει το τέλος των 'πρόσφορων συνόρων' και άλλων σφαλμάτων υπέρθεσης που συμβαίνουν στις παραδοσιακές προσεγγίσεις deepfake. Πηγή: https://mitchellx.github.io/#video

Πλήρης βίντεο διαθέσιμο στο τέλος του άρθρου. Σε αυτό το δείγμα από ένα βίντεο στα συμπληρωματικά υλικά που παρέχονται από έναν από τους συγγραφείς της νέας εργασίας, το πρόσωπο της Scarlett Johansson μεταφέρεται στο βίντεο πηγή. Το CihaNet αφαιρεί το πρόβλημα της μάσκας άκρων όταν εκτελεί μια ανταλλαγή, σχηματίζοντας και εφαρμόζοντας βαθύτερες σχέσεις μεταξύ της πηγή και της στόχου ταυτότητας, που σημαίνει το τέλος των ‘πρόσφορων συνόρων’ και άλλων σφαλμάτων υπέρθεσης που συμβαίνουν στις παραδοσιακές προσεγγίσεις deepfake. Πηγή: https://mitchellx.github.io/#video

Η νέα προσέγγιση αφαιρεί την ανάγκη να ‘κολλήσει’ την μεταμοσχευμένη ταυτότητα грубо στο βίντεο στόχο, που συχνά οδηγεί σε προδίδοντας αρτεφάκτα που εμφανίζονται όπου το ψεύτικο πρόσωπο τελειώνει και το πραγματικό, υποκείμενο πρόσωπο αρχίζει. Αντίθετα, ‘χάρτες οπτικής φαντασίας’ χρησιμοποιούνται για να εκτελέσουν μια βαθύτερη ανάμιξη οπτικών πτυχών, επειδή το σύστημα χωρίζει την ταυτότητα από το контέκστ daleko πιο αποτελεσματικά από τις τρέχουσες μεθόδους, και因此 μπορεί να αναμιχθεί την ταυτότητα στόχου σε ένα πιο βαθύ επίπεδο.

Από την εργασία. Οι μετασχηματισμοί CihaNet διευκολύνονται μέσω χαρτών οπτικής φαντασίας (κατώτερο σειρά). Το σύστημα χρησιμοποιεί πληροφορίες контέκστ (π.χ. κατεύθυνση προσώπου, μαλλιά, γυαλιά και άλλα εμπόδια, κ.λπ.) εντελώς από την εικόνα στην οποία θα υπερθεθεί η νέα ταυτότητα, και πληροφορίες ταυτότητας προσώπου εντελώς από το άτομο που θα εισαχθεί στην εικόνα. Αυτή η ικανότητα να χωρίζει το πρόσωπο από το контέκστ είναι κρίσιμη για την επιτυχία του συστήματος. Πηγή: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Από την εργασία. Οι μετασχηματισμοί CihaNet διευκολύνονται μέσω χαρτών οπτικής φαντασίας (κατώτερο σειρά). Το σύστημα χρησιμοποιεί πληροφορίες контέκστ (π.χ. κατεύθυνση προσώπου, μαλλιά, γυαλιά και άλλα εμπόδια, κ.λπ.) εντελώς από την εικόνα στην οποία θα υπερθεθεί η νέα ταυτότητα, και πληροφορίες ταυτότητας προσώπου εντελώς από το άτομο που θα εισαχθεί στην εικόνα. Αυτή η ικανότητα να χωρίζει το πρόσωπο από το контέκστ είναι κρίσιμη για την επιτυχία του συστήματος. Πηγή: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Επιδράκως, ο νέος χάρτης οπτικής φαντασίας παρέχει einen πιο πλήρη контέκστ για την ανταλλαγή, σε αντίθεση με τις σκληρές μάσκες που συχνά απαιτούν εκτεταμένη επιμέλεια (και στην περίπτωση του DeepFaceLab, ξεχωριστή εκπαίδευση) ενώ παρέχουν περιορισμένη ευελιξία σε σχέση με την πραγματική ενσωμάτωση των δύο ταυτοτήτων.

Από τα δείγματα που παρέχονται στα συμπληρωματικά υλικά, χρησιμοποιώντας και τα συνόλου δεδομένων FFHQ και Celeb-A HQ, σε VGGFace και Forensics++. Οι δύο πρώτες στήλες δείχνουν τις τυχαία-επιλεγμένες (πραγματικές) εικόνες που θα ανταλλαχθούν. Οι επόμενες τέσσερις στήλες δείχνουν τα αποτελέσματα της ανταλλαγής χρησιμοποιώντας τις τέσσερις πιο αποτελεσματικές μεθόδους που είναι διαθέσιμες, ενώ η τελευταία στήλη δείχνει το αποτέλεσμα από το CihaNet. Το αποθετήριο FaceSwap έχει χρησιμοποιηθεί, αντί του πιο δημοφιλούς DeepFaceLab,既然 και τα δύο έργα είναι διακλαδώσεις του αρχικού κώδικα deepfakes του 2017 στο GitHub. Αν και κάθε έργο έχει προστεθεί μοντέλα, τεχνικές, ποικίλες διεπαφές και συμπληρωματικά εργαλεία, ο υποκείμενος κώδικας που κάνει τα deepfakes δυνατά δεν έχει αλλάξει και παραμένει κοινός και στα δύο. Πηγή: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

Η εργασία, με τίτλο Δίκτυο Hallucination Context και Identity, είναι γραμμένη από ερευνητές που συνδέονται με την JD AI Research και το Πανεπιστήμιο του Massachusetts Amherst, και υποστηρίχθηκε από το Εθνικό Πρόγραμμα Έρευνας και Ανάπτυξης της Κίνας με τον αριθμό 2020AAA0103800. Παρουσιάστηκε στη 29η Διεθνή Διάσκεψη του ACM για Πολυμέσα, στις 20-24 Οκτωβρίου, στο Τσενγκτού, Κίνα.

Χωρίς Ανάγκη για ‘Πρόσωπο-Στο-Πρόσωπο’ Ισότητα

Και το πιο δημοφιλές τρέχον λογισμικό deepfake, το DeepFaceLab, και η ανταγωνιστική διακλάδωση FaceSwap, εκτελούν πολύπλοκες και συχνά χειροκίνητες ροές εργασιών για να αναγνωρίσουν την κατεύθυνση ενός προσώπου, ποια εμπόδια υπάρχουν στο δρόμο που πρέπει να λογαριαστούν (ξανά, χειροκίνητα), και πρέπει να αντιμετωπίσουν πολλά άλλα ενοχλητικά εμπόδια (συμπεριλαμβανομένου του φωτισμού) που κάνουν τη χρήση τους μακράν από την ‘σημείο-και-κλικ’ εμπειρία που αναπαρασταθεί λανθασμένα στα μέσα ενημέρωσης από τότε που εμφανίστηκαν τα deepfakes.

Αντίθετα, το CihaNet δεν απαιτεί να είναι δύο εικόνες στραμμένες απευθείας στην κάμερα για να εξάγει και να εκμεταλλευτεί χρήσιμες πληροφορίες ταυτότητας από μια einzε εικόνα.

Σε αυτά τα παραδείγματα, μια σειρά από λογισμικά deepfake ανταγωνιστές έχουν την задачη να ανταλλάξουν πρόσωπα που δεν είναι μόνο διαφορετικά σε ταυτότητα, αλλά που δεν κοιτούν προς την ίδια κατεύθυνση. Λογισμικό που προέρχεται από το αποθετήριο deepfakes (όπως το πολύ δημοφιλές DeepFaceLab και FaceSwap, που απεικονίζονται παραπάνω) δεν μπορεί να χειριστεί την διαφορά γωνιών μεταξύ των δύο εικόνων που θα ανταλλαχθούν (βλέπε τρίτη στήλη). Εν τω μεταξύ, το CihaNet μπορεί να αφηρητίσει την ταυτότητα σωστά,既然 η 'στάση' του προσώπου δεν είναι εγγενώς μέρος της ταυτότητας πληροφοριών.

Σε αυτά τα παραδείγματα, μια σειρά από λογισμικά deepfake ανταγωνιστές έχουν την задачη να ανταλλάξουν πρόσωπα που δεν είναι μόνο διαφορετικά σε ταυτότητα, αλλά που δεν κοιτούν προς την ίδια κατεύθυνση. Λογισμικό που προέρχεται από το αποθετήριο deepfakes (όπως το πολύ δημοφιλές DeepFaceLab και FaceSwap, που απεικονίζονται παραπάνω) δεν μπορεί να χειριστεί την διαφορά γωνιών μεταξύ των δύο εικόνων που θα ανταλλαχθούν (βλέπε τρίτη στήλη). Εν τω μεταξύ, το CihaNet μπορεί να αφηρητίσει την ταυτότητα σωστά,既然 η ‘στάση’ του προσώπου δεν είναι εγγενώς μέρος της ταυτότητας πληροφοριών.

Αρχιτεκτονική

Το CihaNet, σύμφωνα με τους συγγραφείς, εμπνεύστηκε από τη συνεργασία του 2019 μεταξύ της Microsoft Research και του Πανεπιστημίου του Πεκίνου, που ονομάζεται FaceShifter, αν και κάνει κάποιες αξιοσημείωτες και κρίσιμες αλλαγές στην αρχιτεκτονική της παλαιότερης μεθόδου.

Το FaceShifter χρησιμοποιεί δύο δίκτυα Adaptive Instance Normalization (AdaIN) για να χειριστεί τις πληροφορίες ταυτότητας, οι οποίες μεταφέρονται στη στόχο εικόνα μέσω μιας μάσκας, με τρόπο παρόμοιο με το τρέχον δημοφιλές λογισμικό deepfake (και με όλα τα σχετικά περιορισμοί), χρησιμοποιώντας ένα επιπλέον HEAR-Net (που περιλαμβάνει ένα ξεχωριστό υπο-δίκτυο που έχει εκπαιδευτεί σε εμπόδια που καλύπτουν – μια επιπλέον στρώση πολυπλοκότητας).

Αντίθετα, η νέα αρχιτεκτονική χρησιμοποιεί απευθείας αυτές τις ‘περιβαλλοντικές’ πληροφορίες για τη μετασχηματιστική διαδικασία, μέσω μιας διπλής Cascade Adaptive Instance Normalization (C-AdaIN) λειτουργίας, η οποία παρέχει συνεκτικότητα του περιβάλλοντος (π.χ. δέρμα προσώπου και εμπόδια) των περιοχών που σχετίζονται με την ταυτότητα.

Το δεύτερο υπο-δίκτυο που είναι κρίσιμο για το σύστημα ονομάζεται Swapping Block (SwapBlk), το οποίο παράγει μια ολοκληρωμένη λειτουργία από το περιβάλλον της εικόνας αναφοράς και τις ενσωματωμένες ‘ταυτότητας’ πληροφορίες από την εικόνα πηγή, παρακάμπτοντας τα πολλαπλά στάδια που απαιτούνται για να επιτύχουν αυτό με τις συμβατικές τρέχουσες μεθόδους.

Για να βοηθήσει να διακρίνει μεταξύ περιβάλλοντος και ταυτότητας, ένας χάρτης οπτικής φαντασίας παράγεται για κάθε επίπεδο, που αντικαθιστά μια μαλακή-διαχωριστική μάσκα, και δρα σε ένα ευρύτερο φάσμα χαρακτηριστικών για αυτό το κρίσιμο μέρος της διαδικασίας deepfake.

Όσο μεγαλώνει η τιμή του χάρτη οπτικής φαντασίας (εικονιζόμενο δεξιά), μια πιο σαφής διαδρομή μεταξύ των ταυτοτήτων εμφανίζεται.

Όσο μεγαλώνει η τιμή του χάρτη οπτικής φαντασίας (εικονιζόμενο δεξιά), μια πιο σαφής διαδρομή μεταξύ των ταυτοτήτων εμφανίζεται.

Με αυτόν τον τρόπο, ολόκληρη η διαδικασία ανταλλαγής πραγματοποιείται σε ένα μόνο στάδιο και χωρίς μετα-επεξεργασία.

Δεδομένα και Δοκιμές

Για να δοκιμάσουν το σύστημα, οι ερευνητές εκπαίδευσαν τέσσερα μοντέλα σε δύο πολύ δημοφιλείς και ποικίλες ανοιχτές συνόλους εικόνων – CelebA-HQ και το σύνολο εικόνων Flickr-Faces-HQ της NVIDIA (FFHQ), κάθε一个 από τα οποία περιέχει 30.000 και 70.000 εικόνες, αντίστοιχα.

Δεν πραγματοποιήθηκε κανένα κλάδεμα ή φιλτράρισμα σε αυτά τα βασικά συνόλους δεδομένων. Σε κάθε περίπτωση, οι ερευνητές εκπαίδευσαν το σύνολο κάθε συνόλου δεδομένων στο seul Tesla GPU για τρεις ημέρες, με ρυθμό μάθησης 0,0002 στο Adam βελτιστοποίηση.

Στη συνέχεια, παρήγαγαν μια σειρά τυχαίων ανταλλαγών μεταξύ των χιλιάδων προσωπικοτήτων που εμφανίζονται στα συνόλους δεδομένων, χωρίς να λαμβάνουν υπόψη αν τα πρόσωπα ήταν παρόμοια ή ακόμη και αντίστοιχα φύλου, και σύγκριναν τα αποτελέσματα του CihaNet με τα αποτελέσματα από τέσσερις ηγετικές πλατφόρμες deepfake: FaceSwap (που αντικαθιστά το πιο δημοφιλές DeepFaceLab,既然 και τα δύο έργα μοιράζονται μια κοινή ρίζα κώδικα στο αρχικό αποθετήριο του 2017 που έφερε τα deepfakes στον κόσμο); το προαναφερθέν FaceShifter; FSGAN; και SimSwap.

Συγκρίνοντας τα αποτελέσματα μέσω VGG-Face, FFHQ, CelebA-HQ και FaceForensics++, οι συγγραφείς βρήκαν ότι το νέο μοντέλο τους ξεπέρασε όλα τα προηγούμενα μοντέλα, όπως υποδεικνύεται στον πίνακα παρακάτω.

Οι τρεις μετρήσεις που χρησιμοποιήθηκαν για την αξιολόγηση των αποτελεσμάτων ήταν η ομοιότητα δομής (SSIM), σφάλμα εκτίμησης στάσης και ακρίβεια ανάκτησης ταυτότητας, η οποία υπολογίζεται με βάση το ποσοστό των επιτυχώς ανακτημένων ζευγών.

Οι ερευνητές υποστηρίζουν ότι το CihaNet αντιπροσωπεύει μια υπεροχή προσέγγιση σε σχέση με τα ποιοτικά αποτελέσματα, και μια αξιοσημείωτη πρόοδο στην τρέχουσα κατάσταση της τέχνης στις τεχνολογίες deepfake, αφαιρώντας το βάρος των εκτεταμένων και εργατικών αρχιτεκτονικών μάσκων και μεθοδολογιών, και επιτυγχάνοντας μια πιο χρήσιμη και ενεργό διάκριση μεταξύ ταυτότητας και περιβάλλοντος.

Δείτε παρακάτω για να δείτε περαιτέρω βίντεο παραδείγματα της νέας τεχνικής. Μπορείτε να βρείτε το πλήρες βίντεο εδώ.

Από τα συμπληρωματικά υλικά για την nuova εργασία, το CihaNet εκτελεί ανταλλαγές προσώπων σε διάφορες ταυτότητες. Πηγή: https://mitchellx.github.io/#video

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai