Η γωνία του Anderson

Οι разработчики του TikTok διαγράφουν τα πρόσωπα για εφαρμογές εικονικής πραγματικότητας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η ByteDance, η κινεζική πολυεθνική εταιρεία διαδικτύου πίσω από το TikTok, έχει αναπτύξει eine νέα μέθοδο για τη διαγραφή προσώπων σε βίντεο, έτσι ώστε να μπορούν να επιβληθούν παραμορφώσεις ταυτοτήτων και άλλες περίεργες επιδράσεις σε άτομα σε εφαρμογές εικονικής πραγματικότητας. Η εταιρεία ισχυρίζεται ότι η τεχνική έχει ήδη ενσωματωθεί σε εμπορικά προϊόντα κινητών τηλεφώνων, αν και δεν αναφέρει ποια προϊόντα είναι αυτά.

Μόλις τα πρόσωπα σε βίντεο έχουν “μηδενιστεί”, υπάρχει αρκετός “κανβάς προσώπου” για να παραχθούν εκπληκτικές παραμορφώσεις, καθώς και για να επιβληθούν άλλες ταυτότητες. Τα παραδείγματα που παρέχονται σε μια νέα εργασία από ερευνητές της ByteDance εικονογραφούν τις δυνατότητες, συμπεριλαμβανομένης της αποκατάστασης των “διαγραμμένων” χαρακτηριστικών σε διάφορες κωμικές (και σίγουρα κάποιες άσχημες) διαμορφώσεις:

Μερικές από τις δυνατότητες για αναδιαμόρφωση προσώπου που περιλαμβάνονται στην εργασία της ByteDance. Πηγή: https://arxiv.org/pdf/2109.10760.pdf

Μερικές από τις δυνατότητες για αναδιαμόρφωση προσώπου που περιλαμβάνονται στην εργασία της ByteDance. Πηγή: https://arxiv.org/pdf/2109.10760.pdf

Στα τέλη Αυγούστου, αποκαλύφθηκε ότι το TikTok, η πρώτη εφαρμογή εκτός της Facebook που έφτασε τα τρία δισεκατομμύρια κατεβάσματα, είχε lançσει το TikTok Effect Studio (προς το παρόν σε κλειστή βета), μια πλατφόρμα για τους dévelopπεurs εικονικής πραγματικότητας να δημιουργούν εφέ εικονικής πραγματικότητας για τα ρεύματα περιεχομένου του TikTok.

Επιδραστικά, η εταιρεία προσπαθεί να φτάσει τις παρόμοιες κοινότητες dévelopπεurs στο Facebook’s AR Studio και στο Snap AR, με την Apple’s AR R&D community να πρόκειται να ενεργοποιηθεί σύντομα από νέα υλικό μέσα στο επόμενο έτος.

Κενά Εκφράσεις

Η εργασία, με τίτλο FaceEraser: Διαγραφή μερών προσώπου για εικονική πραγματικότητα, σημειώνει ότι οι υπάρχουσες αλγόριθμοι in-painting/infill, όπως ο NVIDIA’s SPADE, είναι περισσότερο προσανατολισμένες στην ολοκλήρωση εικόνων που έχουν κοπεί ή είναι ημι-σκοτεινές, παρά στην εκτέλεση αυτής της ασυνήθιστης “διαγραφής” διαδικασίας, και ότι το υπάρχον υλικό dataset είναι επομένως προβλέψιμα σπάνιο.

Καθώς δεν υπάρχουν διαθέσιμα dataset για άτομα που έχουν μια στερεή έκταση σαρκός όπου θα πρέπει να βρίσκεται το πρόσωπό τους, οι ερευνητές έχουν δημιουργήσει ένα νέο αρχιτεκτονικό δίκτυο που ονομάζεται pixel-clone, το οποίο μπορεί να επικαλυφθεί σε υπάρχοντα νευρωνικά μοντέλα in-painting, και το οποίο επιλύει προβλήματα που σχετίζονται με ασυνέπειες υφής και χρώματος που εμφανίζονται (η εργασία επιβεβαιώνει) από παλαιότερες μεθόδους όπως η StructureFlow και η EdgeConnect.

Γενική δομή του pixel-clone στη νέα πορεία.

Γενική δομή του pixel-clone στη νέα πορεία.

Για να εκπαιδεύσουν ένα μοντέλο σε “κενά” πρόσωπα, οι ερευνητές απέκλεισαν εικόνες με γυαλιά, ή όπου τα μαλλιά καλύπτουν το μέτωπο,既然 η περιοχή μεταξύ της γραμμής μαλλιών και των φρυδιών είναι συνήθως η μεγαλύτερη ομάδα pixel που μπορεί να προσφέρει “κόλλα” υλικό για τα κεντρικά χαρακτηριστικά του προσώπου.

Προετοιμασία εικόνων εκπαίδευσης. Η περιοχή του μετώπου αποκοπεί, με βάση κρίσιμους σημεία στην αναγνώριση συσχετισμού προσώπου, καταστρέφεται κάθετα και ραφεύεται.

Προετοιμασία εικόνων εκπαίδευσης.

Μια εικόνα 256×256 pixel λαμβάνεται, ένα αρκετά μικρό μέγεθος για να τροφοδοτηθεί στο.latent χώρο eines νευρωνικού δικτύου σε δόσεις που είναι αρκετά μεγάλες για να επιτύχουν γενίκευση. Αργότερα αλγοριθμική αύξηση θα αποκαταστήσει τις αναλύσεις που απαιτούνται για να εργαστούν στο χώρο εικονικής πραγματικότητας.

Αρχιτεκτονική

Το δίκτυο αποτελείται από τρία εσωτερικά δίκτυα, αποτελούμενα από Edge Completion, Pixel-Clone, και ένα δίκτυο επιμέλειας. Το δίκτυο ολοκλήρωσης ακμής χρησιμοποιεί την ίδια αρχιτεκτονική κωδικοποιητή-αποκωδικοποιητή που χρησιμοποιείται στο EdgeConnect (πάνω), καθώς και στις δύο πιο δημοφιλείς εφαρμογές deepfake. Οι κωδικοποιητές υποδείγνουν το περιεχόμενο εικόνας δύο φορές, και οι αποκωδικοποιητές αποκαθιστούν τις αρχικές διαστάσεις εικόνας.

Το Pixel-Clone χρησιμοποιεί μια τροποποιημένη μεθοδολογία κωδικοποιητή-αποκωδικοποιητή, ενώ το δίκτυο επιμέλειας χρησιμοποιεί αρχιτεκτονική U-Net, μια τεχνική που αναπτύχθηκε αρχικά για βιοϊατρική εικόνα, η οποία συχνά εμφανίζεται σε ερευνητικά προγράμματα σύνθεσης εικόνας.

Κατά τη διάρκεια της διαδικασίας εκπαίδευσης, είναι απαραίτητο να αξιολογηθεί η ακρίβεια των μετασχηματισμών, και, ανάλογα, να επαναληφθούν οι προσπάθειες επαναληπτικά μέχρι συνέργεια. Για το σκοπό αυτό, χρησιμοποιούνται δύο διακρίτες με βάση PatchGAN, κάθε一个 από τους οποίους αξιολογεί την τοπική πραγματικότητα 70×70 pixel patches, μείον την πραγματικότητα της ολόκληρης εικόνας.

Εκπαίδευση και Δεδομένα

Το δίκτυο ολοκλήρωσης ακμής εκπαιδεύεται αρχικά ανεξάρτητα, ενώ τα άλλα δύο δίκτυα εκπαιδεύονται μαζί, με βάση τα βάρη που έχουν προκύψει από την εκπαίδευση ολοκλήρωσης ακμής, τα οποία είναι σταθερά και παγωμένα κατά τη διάρκεια αυτής της διαδικασίας.

Αν και η εργασία δεν αναφέρει ρητά ότι τα παραδείγματα τελικής παραμόρφωσης χαρακτηριστικών είναι ο κεντρικός στόχος του μοντέλου, εφαρμόζει διάφορες κωμικές επιδράσεις για να δοκιμάσει την αντοχή του συστήματος, συμπεριλαμβανομένης της αφαίρεσης φρυδιών, μεγεθύνουσας στομάτων, συρρίκνωσης υπο-προσώπων και “toonized” επιδράσεων (όπως φαίνεται στην προηγούμενη εικόνα, πάνω).

Η εργασία ισχυρίζεται ότι “τα διαγραμμένα πρόσωπα επιτρέπουν διάφορες εφαρμογές εικονικής πραγματικότητας που απαιτούν τοποθέτηση οποιασδήποτε στοιχείων που έχουν προσαρμοστεί από τον χρήστη”, υποδεικνύοντας τη δυνατότητα προσαρμογής προσώπων με στοιχεία τρίτων, που έχουν συνεισφέρει οι χρήστες.

Το μοντέλο εκπαιδεύεται σε μάσκες από το dataset FFHQ της NVIDIA, το οποίο περιέχει μια επαρκή ποικιλία ηλικιών, εθνοτικών ομάδων, φωτισμού και στυλ προσώπου για να επιτύχει μια χρήσιμη γενίκευση. Το dataset περιέχει 35.000 εικόνες και 10.000 μάσκες εκπαίδευσης για να ορίσουν τις περιοχές μετασχηματισμού, με 4000 εικόνες και 1000 μάσκες να έχουν οριστεί για σκοπούς επαλήθευσης.

Δείγματα εκπαίδευσης.

Δείγματα εκπαίδευσης.

Το εκπαιδευμένο μοντέλο μπορεί να εκτελέσει συναγωγή σε δεδομένα από το dataset CelebA-HQ του 2017 και το VoxCeleb, άγνωστα πρόσωπα από το FFHQ, και οποιαδήποτε άλλα μη περιορισμένα, άγνωστα πρόσωπα που παρουσιάζονται σε αυτό. Οι εικόνες 256×256 pixel εκπαιδεύτηκαν στο δίκτυο σε δόσεις των 8 πάνω από einen Adam optimizer, που εφαρμόστηκε στο PyTorch, και εκτελέστηκε σε einen Tesla V100 GPU για “2000,000 επαναλήψεις”.

Αποτελέσματα συναγωγής που λαμβάνονται σε πραγματικά πρόσωπα.

Αποτελέσματα συναγωγής που λαμβάνονται σε πραγματικά πρόσωπα.

Όπως είναι σύνηθες στην έρευνα σύνθεσης εικόνας με βάση το πρόσωπο, το σύστημα πρέπει να αντιμετωπίσει περιστασιακές αποτυχίες που προκαλούνται από εμπόδια ή οκκλουσίες όπως τα μαλλιά, τα περιφερειακά, τα γυαλιά και τα γένια.

Η αναφορά ολοκληρώνεται:

‘Η προσέγγισή μας έχει εμπορευματοποιηθεί και λειτουργεί καλά σε προϊόντα για μη περιορισμένες εισόδους χρηστών.’

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai