Η γωνία του Anderson

Η LipSync3D της Google Προσφέρει Βελτιωμένη Συγχρονισμό Κίνησης Χειλιών ‘Deepfaked’

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια συνεργασία μεταξύ ερευνητών της Google AI και του Ινδικού Ινστιτούτου Τεχνολογίας Kharagpur προσφέρει ένα νέο πλαίσιο για τη σύνθεση talking heads από ήχο. Το έργο έχει ως στόχο την παραγωγή βελτιωμένων και εύλογων μεθόδων για τη δημιουργία περιεχομένου βίντεο από ήχο, για τους σκοπούς της συγχρονισμού των κινήσεων των χειλιών με ήχο που έχει υποβληθεί σε δублиάρισμα ή μηχανική μετάφραση, και για χρήση σε अवatars, σε διαδραστικές εφαρμογές και σε άλλες πραγματικές περιπτώσεις.

Πηγή: https://www.youtube.com/watch?v=L1StbX9OznY

Πηγή: https://www.youtube.com/watch?v=L1StbX9OznY

Τα μοντέλα μηχανικής μάθησης που εκπαιδεύονται στη διαδικασία – που ονομάζεται LipSync3D – απαιτούν μόνο ένα単ικό βίντεο της ταυτότητας του προσώπου ως δεδομένα εισόδου. Η διαδικασία προετοιμασίας των δεδομένων分離ζει την εξαγωγή της γεωμετρίας του προσώπου από την αξιολόγηση του φωτισμού και άλλων πτυχών του βίντεο εισόδου, επιτρέποντας μια πιο οικονομική και εστιασμένη εκπαίδευση.

Η διπλή ροή εργασίας του LipSync3D. Πάνω, η γεννήτρια ενός δυναμικά υφασμένου 3D προσώπου από τον 'στόχο' ήχο; κάτω, η εισαγωγή του γεννημένου πλέγματος σε ένα βίντεο στόχο.

Η διπλή ροή εργασίας του LipSync3D. Πάνω, η γεννήτρια ενός δυναμικά υφασμένου 3D προσώπου από τον ‘στόχο’ ήχο; κάτω, η εισαγωγή του γεννημένου πλέγματος σε ένα βίντεο στόχο.

Στην πραγματικότητα, η πιο αξιοσημείωτη συνεισφορά του LipSync3D στη συσσώρευση της έρευνας σε αυτό το πεδίο μπορεί να είναι ο αλγόριθμος κανονικοποίησης του φωτισμού, ο οποίος αποσπά την εκπαίδευση και την εύρεση του φωτισμού.

Η αποσύνδεση των δεδομένων φωτισμού από τη γενική γεωμετρία βοηθά το LipSync3D να παράγει πιο πραγματιστικές κινήσεις χειλιών σε απαιτητικές συνθήκες. Άλλες προσεγγίσεις των τελευταίων ετών έχουν περιοριστεί σε 'σταθερές' συνθήκες φωτισμού που δεν θα αποκαλύψουν την πιο περιορισμένη τους ικανότητα σε αυτό το σημείο.

Η αποσύνδεση των δεδομένων φωτισμού από τη γενική γεωμετρία βοηθά το LipSync3D να παράγει πιο πραγματιστικές κινήσεις χειλιών σε απαιτητικές συνθήκες. Άλλες προσεγγίσεις των τελευταίων ετών έχουν περιοριστεί σε ‘σταθερές’ συνθήκες φωτισμού που δεν θα αποκαλύψουν την πιο περιορισμένη τους ικανότητα σε αυτό το σημείο.

Κατά τη διάρκεια της προεπεξεργασίας των πλαισίων εισόδου, το σύστημα πρέπει να αναγνωρίσει και να αφαιρέσει τα σημεία του φωτισμού,既然 αυτά είναι συγκεκριμένα στις συνθήκες φωτισμού υπό τις οποίες ηχογραφήθηκε το βίντεο, και θα παρεμβαίνουν αλλιώς στη διαδικασία του φωτισμού.

Το LipSync3D, όπως υποδηλώνει το όνομά του, δεν εκτελεί απλή ανάλυση pixel στα πρόσωπα που αξιολογεί, αλλά χρησιμοποιεί ενεργά τα αναγνωρισμένα σημεία του προσώπου για τη γεννήτρια κινητών πλεγμάτων CGI-τύπου, μαζί με τα ‘ανοικτά’ υφάσματα που τυλίγονται γύρω τους σε μια παραδοσιακή διαδικασία CGI.

Κανονικοποίηση στάσης στο LipSync3D. Στα αριστερά είναι τα πλαισια εισόδου και τα ανιχνευμένα χαρακτηριστικά; στο κέντρο, οι κανονικοποιημένες κορυφές της γεννημένης αξιολόγησης του πλέγματος; και στα δεξιά, το αντίστοιχο υφάδι, το οποίο παρέχει την αλήθεια για την πρόβλεψη υφάσματος. Πηγή: https://arxiv.org/pdf/2106.04185.pdf

Κανονικοποίηση στάσης στο LipSync3D. Στα αριστερά είναι τα πλαισια εισόδου και τα ανιχνευμένα χαρακτηριστικά; στο κέντρο, οι κανονικοποιημένες κορυφές της γεννημένης αξιολόγησης του πλέγματος; και στα δεξιά, το αντίστοιχο υφάδι, το οποίο παρέχει την αλήθεια για την πρόβλεψη υφάσματος. Πηγή: https://arxiv.org/pdf/2106.04185.pdf

Εκτός από τη νέα μέθοδο φωτισμού, οι ερευνητές ισχυρίζονται ότι το LipSync3D προσφέρει τρεις κύριες καινοτομίες σε σχέση με προηγούμενη εργασία: την分離ση της γεωμετρίας, του φωτισμού, της στάσης και του υφάσματος σε διακριτά ρεύματα δεδομένων σε ένα κανονικοποιημένο χώρο; ένα εύκολα εκπαιδεύσιμο αυτο-αναδρομικό μοντέλο πρόβλεψης υφάσματος που παράγει χρονικά συνεπή σύνθεση βίντεο; και αυξημένη πραγματικότητα, όπως αξιολογείται από ανθρώπινες βαθμολογίες και αντικειμενικά μέτρα.

Η διαχωρισμός των διάφορων πτυχών της εικόνας του προσώπου επιτρέπει μεγαλύτερο έλεγχο στη σύνθεση βίντεο.

Η διαχωρισμός των διάφορων πτυχών της εικόνας του προσώπου επιτρέπει μεγαλύτερο έλεγχο στη σύνθεση βίντεο.

Το LipSync3D μπορεί να εξαγάγει την κατάλληλη γεωμετρία κίνησης των χειλιών απευθείας από τον ήχο, αναλύοντας τα φωνήματα και άλλα χαρακτηριστικά του λόγου, και μετατρέποντάς τα σε γνωστές αντίστοιχες στάσεις των μυών γύρω από την περιοχή του στόματος.

Αυτή η διαδικασία χρησιμοποιεί μια διαδικασία προβλέψεως, όπου η υποτιθέμενη γεωμετρία και το υφάδι έχουν αφορισμένους κωδικοποιητές σε μια αυτο-αναδρομική διάταξη, αλλά μοιράζονται έναν κωδικοποιητή ήχου με τον λόγο που προορίζεται να επιβληθεί στο μοντέλο:

Η σύνθεση κίνησης του LipSync3D προορίζεται επίσης να δώσει τη δυνατότητα σε στιλιζαρισμένα अवatars CGI, τα οποία στην πραγματικότητα είναι μόνο το ίδιο είδος πλέγματος και υφάσματος που χρησιμοποιείται σε πραγματικές εικόνες:

Ένα στιλιζαρισμένο 3D avatar έχει τις κινήσεις των χειλιών του ενεργοποιημένες σε πραγματικό χρόνο από ένα βίντεο πηγής. Σε ένα τέτοιο σενάριο, τα καλύτερα αποτελέσματα θα επιτευχθούν με προ-εκπαίδευση προσωποποιημένη.

Ένα στιλιζαρισμένο 3D avatar έχει τις κινήσεις των χειλιών του ενεργοποιημένες σε πραγματικό χρόνο από ένα βίντεο πηγής. Σε ένα τέτοιο σενάριο, τα καλύτερα αποτελέσματα θα επιτευχθούν με προ-εκπαίδευση προσωποποιημένη.

Οι ερευνητές προβλέπουν επίσης τη χρήση авatars με μια ελαφρώς πιο πραγματική αίσθηση:

Δείγματα χρόνων εκπαίδευσης για τα βίντεο κυμαίνονται από 3-5 ώρες για ένα βίντεο 2-5 λεπτών, σε μια διαδικασία που χρησιμοποιεί TensorFlow, Python και C++ σε ένα GeForce GTX 1080. Οι συνεδρίες εκπαίδευσης χρησιμοποιούσαν ένα μέγεθος δείγματος 128 πλαισίων πάνω από 500-1000 επαναλήψεις, με κάθε επανάληψη να αντιπροσωπεύει μια πλήρη αξιολόγηση του βίντεο.

Προς τη Δυναμική Επανεκσύνδεση της Κίνησης των Χειλιών

Το πεδίο της επανεκσύνδεσης των χειλιών για να ταιριάξει με einen νέο ήχο έχει λάβει πολλή προσοχή στην έρευνα της υπολογιστικής όρασης τα τελευταία χρόνια (βλέπε παρακάτω), όχι μόνο ως ένα παραπροϊόν της αμφιλεγόμενης τεχνολογίας deepfake.

Το 2017, το Πανεπιστήμιο του Washington παρουσίασε έρευνα που ήταν ικανή να μάθει τη συγχρονισμό των χειλιών από τον ήχο, χρησιμοποιώντας τον για να αλλάξει τις κινήσεις των χειλιών του προέδρου Obama. Το 2018, το Ινστιτούτο Max Planck για την Πληροφορική led μία άλλη ερευνητική πρωτοβουλία για να ενεργοποιήσει τη μεταφορά βίντεο από ταυτότητα σε ταυτότητα, με τη συγχρονισμό των χειλιών ως ένα παραπροϊόν της διαδικασίας; και τον Μάιο του 2021, η εταιρεία AI FlawlessAI αποκάλυψε την ιδιοκτησιακή της τεχνολογία συγχρονισμού χειλιών TrueSync, που έλαβε ευρεία 接受 από τον τύπο ως einen ενεργοποιητή βελτιωμένων τεχνολογιών δублиάρισματος για μεγάλες κυκλοφορίες ταινιών σε διάφορες γλώσσες.

Και, φυσικά, η συνεχής ανάπτυξη ανοιχτών πηγαίων αποθετηρίων deepfake παρέχει έναν άλλο κλάδο ενεργής έρευνας από τους χρήστες σε αυτό το πεδίο της σύνθεσης εικόνων προσώπου.

nc τεχνολογία TrueSync, που έλαβε ευρεία acceptation στον τύπο ως einen ενεργοποιητή βελτιωμένων τεχνολογιών δублиάρισματος για μεγάλες κυκλοφορίες ταινιών σε διάφορες γλώσσες. Και, φυσικά, η συνεχής ανάπτυξη ανοιχτών πηγαίων αποθετηρίων deepfake παρέχει έναν άλλο κλάδο ενεργής έρευνας από τους χρήστες σε αυτό το πεδίο της σύνθεσης εικόνων προσώπου.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai