Η γωνία του Anderson

Ανάγνωση Χειλιών με Visemes και Μηχανική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
HAL reads lips in 2001: A Space Odyssey (1968)

Νέα έρευνα από το Τμήμα Μηχανικής Υπολογιστών του Τεχρανού προσφέρει μια βελτιωμένη προσέγγιση στην πρόκληση της δημιουργίας συστημάτων μηχανικής μάθησης που μπορούν να διαβάζουν τα χείλια.

Το έγγραφο, με τίτλο Ανάγνωση Χειλιών με Αναγνώριση Viseme, αναφέρει ότι το νέο σύστημα επιτυγχάνει μια βελτίωση 4% στο ποσοστό λάθους λέξεων σε σύγκριση με τα καλύτερα προηγούμενα μοντέλα. Το σύστημα αντιμετωπίζει την γενική έλλειψη χρήσιμων δεδομένων εκπαίδευσης σε αυτόν τον τομέα με τη χαρτογράφηση viseme σε κείμενο που προέρχεται από τα έξι εκατομμύρια δείγματα στη βάση δεδομένων OpenSubtitles.

Ένα viseme είναι η οπτική ισοδύναμη ενός φωνήματος, αποτελώντας μια οπτική-ηχητική αντιστοίχηση που μπορεί να συνιστά μια «ιδιότητα» σε ένα μοντέλο μηχανικής μάθησης.

Visemes gif

Visemes σε λειτουργία. Πηγή: https://developer.oculus.com/documentation/unity/audio-ovrlipsync-viseme-reference/

Οι ερευνητές ξεκίνησαν με τη θέσπιση του χαμηλότερου ποσοστού λάθους στα διαθέσιμα δεδομένα και την ανάπτυξη ακολουθιών viseme από καθιερωμένες διαδικασίες χαρτογράφησης. Προοδευτικά, αυτή η διαδικασία αναπτύσσει einen οπτικό λεξικό λέξεων – αν και είναι απαραίτητο να οριστούν πιθανότητες ακρίβειας για διαφορετικές λέξεις που μοιράζονται ένα viseme (όπως «καρδιά» και «τέχνη»).

Visemes που έχουν αποκωδικοποιηθεί

Visemes που έχουν εξαχθεί από κείμενο. Πηγή: https://arxiv.org/pdf/2104.04784.pdf

Όταν δύο идентικές λέξεις οδηγούν στο ίδιο viseme, επιλέγεται η πιο συχνά εμφανιζόμενη λέξη.

Το μοντέλο βασίζεται στη συμβατική μάθηση ακολουθιών με την προσθήκη ενός υπο-επεξεργαστή σταδίου όπου τα visemes προβλέπονται από κείμενο και μοντελοποιούνται σε một αφιερωμένο pipeline:

Αρχιτεκτονική viseme για ανάγνωση χειλιών

Πάνω, παραδοσιακές μεθόδους ακολουθιών σε ένα μοντέλο χαρακτήρων. Κάτω, η προσθήκη μοντελοποίησης viseme στο μοντέλο του Τεχρανού. Πηγή: https://arxiv.org/pdf/2104.04784.pdf

Το μοντέλο εφαρμόστηκε χωρίς οπτικό контέxt ενάντια στη βάση δεδομένων LRS3-TED, η οποία κυκλοφόρησε από το Πανεπιστήμιο της Οξφόρδης το 2018, με το χειρότερο ποσοστό λάθους λέξεων (WER) που επιτεύχθηκε ένα σεβαστό 24,29%.

Η έρευνα του Τεχρανού ενσωματώνει επίσης τη χρήση ενός μετατροπέα grapheme-to-phoneme.

Σε ένα τεστ ενάντια στην έρευνα του 2017 Ανάγνωση Προτάσεων στο Άγριο (βλέπε παρακάτω), η μέθοδος Video-To-Viseme πέτυχε ένα ποσοστό λάθους λέξεων 62,3%, σε σύγκριση με 69,5% για τη μέθοδο της Οξφόρδης.

Οι ερευνητές καταλήγουν στο συμπέρασμα ότι η χρήση ενός μεγαλύτερου όγκου κειμένου, σε συνδυασμό με τη μετατροπή grapheme-to-phoneme και τη χαρτογράφηση viseme, υπόσχεται βελτιώσεις έναντι του υπάρχοντος状态 των αυτοματοποιημένων συστημάτων ανάγνωσης χειλιών, αναγνωρίζοντας ότι οι μεθόδους που χρησιμοποιούνται μπορεί να παράγουν ακόμη καλύτερα αποτελέσματα όταν ενσωματωθούν σε πιο εξελιγμένα τρέχοντα πλαίσια.

Η μηχανική ανάγνωση χειλιών έχει sido ένα ενεργό και συνεχιζόμενο πεδίο έρευνας στην υπολογιστική όραση και την επεξεργασία φυσικής γλώσσας τα τελευταία δύο δεκαετία. Μεταξύ πολλών άλλων παραδειγμάτων και έργων, το 2006 η χρήση αυτοματοποιημένου λογισμικού ανάγνωσης χειλιών κατέλαβε τα πρωτοσέλιδα όταν χρησιμοποιήθηκε για την ερμηνεία του τι έλεγε ο Αδόλφος Χίτλερ σε κάποιες από τις famoυσίες σιωπηλές ταινίες που γυρίστηκαν στην εξοχική του κατοικία, αν και η εφαρμογή φαίνεται να έχει εξαφανιστεί από την obscurity από τότε (δώδεκα χρόνια αργότερα, ο σερ Πίτερ Τζάκσον έστρεψε σε ανθρώπινους αναγνώστες χειλιών για να αποκαταστήσει τις συνομιλίες του βίντεο του Πρώτου Παγκοσμίου Πολέμου στο έργο Δεν Θα Μεγαλώσουν).

Το 2017, Ανάγνωση Προτάσεων στο Άγριο, μια συνεργασία μεταξύ του Πανεπιστημίου της Οξφόρδης και του τμήματος έρευνας της Google, παρήγαγε ένα λογισμικό ανάγνωσης χειλιών που ήταν ικανό να συναγάγει σωστά το 48% της ομιλίας σε βίντεο χωρίς ήχο, όπου ένας ανθρώπινος αναγνώστης χειλιών μπορούσε να φτάσει μόνο στο 12,4% ακρίβεια από το ίδιο υλικό. Το μοντέλο εκπαιδεύτηκε σε χιλιάδες ώρες βίντεο της BBC.

Αυτό το έργο ακολούθησε μια ξεχωριστή πρωτοβουλία της Οξφόρδης/Google από το προηγούμενο έτος, με τίτλο LipNet, μια αρχιτεκτονική νευρωνικού δικτύου που χαρτογράφησε ακολουθίες βίντεο με μεταβλητό μήκος σε ακολουθίες κειμένου χρησιμοποιώντας ένα Gated Recurrent Network (GRN), το οποίο προσθέτει λειτουργικότητα στη βασική αρχιτεκτονική ενός Recurrent Neural Network (RNN). Το μοντέλο πέτυχε μια 4,1 φορές βελτιωμένη απόδοση σε σύγκριση με ανθρώπινους αναγνώστες χειλιών.

Εκτός από το πρόβλημα της εξαγωγής ενός ακριβούς μεταγράμματος σε πραγματικό χρόνο, η πρόκληση της ερμηνείας ομιλίας από βίντεο εμβαθύνεται όταν αφαιρείτε χρήσιμο контέxt, όπως ήχο, «πρόσωπο-προς-πρόσωπο» βίντεο που είναι καλά φωτισμένο, και μια γλώσσα/πολιτισμό όπου τα φωνήματα/visemes είναι σχετικά διακριτά.

Αν και δεν υπάρχει τώρα εμπειρική κατανόηση ποίων γλωσσών είναι οι πιο δύσκολες να διαβαστούν τα χείλια στην πλήρη απουσία ήχου, η ιαπωνική είναι ένας πρωταρχικός υποψήφιος. Οι διαφορετικοί τρόποι με τους οποίους οι ιάπωνες (όπως και ορισμένοι άλλοι δυτικοί και ανατολικοί Ασιάτες) χρησιμοποιούν εκφράσεις προσώπου ενάντια στο περιεχόμενο της ομιλίας τους ήδη τους καθιστούν μια μεγαλύτερη πρόκληση για συστήματα αναγνώρισης συναισθήματος.

Ωστόσο, αξίζει να σημειωθεί ότι μεγάλο μέρος της επιστημονικής βιβλιογραφίας sobre το θέμα είναι γενικά περιφρονητικό, όχι τουλάχιστον επειδή ακόμη και η καλόπιστη αντικειμενική έρευνα σε αυτήν τη σφαίρα κινδυνεύει να διασχίσει τα σύνορα της φυλετικής προφίλ και της διάδοσης υφιστάμενων στερεοτύπων.

Γλώσσες με υψηλό ποσοστό guttural συνιστωσών, όπως η Τσετσενική και η Ολλανδική, είναι ιδιαίτερα προβληματικές για αυτοματοποιημένες τεχνικές εξαγωγής ομιλίας, ενώ οι πολιτισμοί όπου ο ομιλητής μπορεί να εκφράσει συναισθήματα ή σεβασμό κοιτάζοντας μακριά (ξανά, γενικά σε ασιατικές κουλτούρες) προσθέτουν μια άλλη διάσταση όπου οι ερευνητές ανάγνωσης χειλιών θα πρέπει να αναπτύξουν επιπλέον μεθόδους «πλήρωσης» από άλλες контέxtuelles ενδείξεις.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai