Η γωνία του Anderson

Ενοποίηση της Ομιλίας και της Χειρονομίας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Όταν επέστρεψα στη Βρετανία από μερικά χρόνια στη Νότια Ιταλία, πήρε κάποιο χρόνο να σταματήσω να χειρονομώ ενώ μιλούσα. Στο Ηνωμένο Βασίλειο, η υποστήριξη της ομιλίας σας με τολμηρές χειρονομίες σας κάνει να φαίνετε υπερενεργητικός· στην Ιταλία, ως κάποιος που μαθαίνει τη γλώσσα, αυτό μου βοήθησε πραγματικά να κατανοηθώ. Ακόμη και τώρα, στις λιγότερες περιπτώσεις που μιλάω ιταλικά, οι “άγριες χειρονομίες” επιστρέφουν στην υπηρεσία. Είναι σχεδόν αδύνατο να μιλήσετε ιταλικά χωρίς να κινείτε.

Τα τελευταία χρόνια, η επικοινωνία που υποστηρίζεται από χειρονομίες στην ιταλική και εβραϊκή κουλτούρα έχει έρθει στο προσκήνιο ως κάτι περισσότερο από ένα στερεότυπο από το έργο του Μάρτιν Σκορσέζε και τις πρώτες ταινίες του Γούντι Άλεν. Το 2013, οι New York Times συνέλεξαν ένα σύντομο βίντεο ιστορία των ιταλικών χειρονομιών· η ακαδημία αρχίζει να μελετά τις φυλετικές προκαταλήψεις για χειρονομίες, αντί να απορρίπτει το θέμα ως στερεότυπο· και новые emoji από το Consortium Unicode είναι κλείνοντας το χάσμα χειρονομίας που προέρχεται από την ψηφιακή, κειμενο 기반 επικοινωνία.

Ενοποιημένη Προσέγγιση για την Ομιλία και την Χειρονομία

Τώρα, νέα έρευνα από το Τμήμα Ομιλίας, Μουσικής και Ακρόασης του KTH Royal Institute of Technology στη Σουηδία επιδιώκει να συνδυάσει την αναγνώριση ομιλίας και χειρονομίας σε ένα ενοποιημένο, πολυμορφικό σύστημα που θα μπορούσε potencially να αυξήσει την κατανόησή μας για την επικοινωνία που βασίζεται στην ομιλία, χρησιμοποιώντας τη σώμα γλώσσα ως ενσωματωμένο βοήθημα στην ομιλία, αντί για ένα παράλληλο πεδίο μελέτης.

Εικονικά από τη σελίδα δοκιμής του σουηδικού έργου ομιλίας/χειρονομίας. Πηγή: https://swatsw.github.io/isg_icmi21/

Εικονικά από τη σελίδα δοκιμής του σουηδικού έργου ομιλίας/χειρονομίας. Πηγή: https://swatsw.github.io/isg_icmi21/

Η έρευνα προτείνει ένα νέο μοντέλο που ονομάζεται Ενοποιημένη Σύνθεση Ομιλίας και Χειρονομίας (ISG) και συνδυάζει μια σειρά από state-of-the-art νευρωνικά μοντέλα από την έρευνα ομιλίας και χειρονομίας.

Η νέα προσέγγιση εγκαταλείπει το γραμμικό μοντέλο pipeline (όπου η πληροφορία χειρονομίας εξάγεται sequentally από την ομιλία ως δευτερεύουσα φάση επεξεργασίας) για μια πιο ενοποιημένη προσέγγιση, η οποία αξιολογείται εξίσου με τα υπάρχοντα συστήματα από τους τελικούς χρήστες, και η οποία επιτυγχάνει ταχύτερο χρόνο σύνθεσης και μειωμένο αριθμό παραμέτρων.

Γραμμική vs ενοποιημένη προσέγγιση. Πηγή: https://arxiv.org/pdf/2108.11436.pdf

Γραμμική vs ενοποιημένη προσέγγιση. Πηγή: https://arxiv.org/pdf/2108.11436.pdf

Το νέο πολυμορφικό σύστημα ενσωματώνει einen αυθόρμητο συνθέτη ομιλίας και einen ηχητικά-οδηγούμενο γεννήτορα χειρονομίας, και τα δύο εκπαιδευμένα στο υπάρχον dataset Trinity Speech Gesture dataset. Το dataset περιέχει 244 λεπτά ήχου και σώματος από έναν άνδρα που μιλάει σε διάφορα θέματα και χειρονομεί ελεύθερα.

Το έργο είναι μια νέα και εναλλακτική εκδοχή του DurIAN project, το οποίο γεννάει εκφράσεις προσώπου και ομιλία, αντί για χειρονομία και ομιλία, και το οποίο ανήκει περισσότερο στο πεδίο της αναγνώρισης και σύνθεσης εκφράσεων.

Αρχιτεκτονικές

Τα στοιχεία ομιλίας και οπτικών (χειρονομίας) του έργου είναι ασύμμετρα σε όρους δεδομένων· ο κείμενος είναι σπαρός και η χειρονομία είναι πλούσια και δεδομένα-εντατική – μια πρόκληση σε όρους ορισμού στόχων και μετρικών. Για αυτόν τον λόγο, οι ερευνητές αξιολόγησαν το σύστημα κυρίως με βάση την ανθρώπινη ανταπόκριση στην έξοδο, αντί για πιο προφανείς μηχανιστικές προσεγγίσεις όπως η μέση τετραγωνική σφάλμα (MSE).

Τα δύο κύρια μοντέλα ISG αναπτύχθηκαν γύρω από την δεύτερη εκδοχή του Tacotron του Google το 2017, και το Glow-TTS initiative που δημοσιεύθηκε το 2020. Το Tacotron χρησιμοποιεί μια αυτο-αναδρομική LSTM αρχιτεκτονική, ενώ το Glow-TTS ενεργεί παράλληλα μέσω convolution operators, με ταχύτερη απόδοση GPU και χωρίς τα προβλήματα σταθερότητας που peuvent να συνοδεύουν τα αυτο-αναδρομικά μοντέλα.

Οι ερευνητές έtested τρία αποτελεσματικά συστήματα ομιλίας/χειρονομίας κατά τη διάρκεια του έργου: μια τροποποιημένη εκδοχή του multimodal speech-and-gesture-generation που δημοσιεύθηκε το 2021 από τους ίδιους ερευνητές στο νέο έργο· μια αφιερωμένη και τροποποιημένη εκδοχή του ανοικτού κώδικα Tacotron 2· και μια πολύ τροποποιημένη εκδοχή του Glow-TTS.

Για να αξιολογήσουν τα συστήματα, οι ερευνητές δημιούργησαν ένα περιβάλλον ανατροφοδότησης βασισμένο στο web με άρθρωτες 3D φιγούρες που μιλούσαν και κινούνταν σε προκαθορισμένα τμήματα κειμένου (η γενική εμφάνιση του περιβάλλοντος μπορεί να φανεί στη δημόσια σελίδα του έργου).

Το περιβάλλον ανατροφοδότησης.

Το περιβάλλον ανατροφοδότησης.

Οι δοκιμαστικοί χρήστες ζητήθηκαν να αξιολογήσουν την απόδοση του συστήματος με βάση την ομιλία και την χειρονομία, την ομιλία μόνο, και την χειρονομία μόνο. Τα αποτελέσματα έδειξαν μια ελαφριά βελτίωση του νέου μοντέλου ISG σε σύγκριση με το παλαιότερο μοντέλο pipeline, αν και το νεότερο σύστημα λειτουργεί ταχύτερα και με μειωμένες πόρους.

Ζητήθηκε 'Πόσο ανθρώπινη είναι η χειρονομία;', το πλήρως ενοποιημένο μοντέλο ISG τερματίζει ελαφρώς μπροστά από το αργότερο μοντέλο pipeline, με τα μοντέλα Tacotron και Glow-based να βρίσκονται πιο πίσω.

Ζητήθηκε ‘Πόσο ανθρώπινη είναι η χειρονομία;’, το πλήρως ενοποιημένο μοντέλο ISG τερματίζει ελαφρώς μπροστά από το αργότερο μοντέλο pipeline, με τα μοντέλα Tacotron και Glow-based να βρίσκονται πιο πίσω.

Ενσωματωμένη Χειρονομία

Το μοντέλο Tacotron2-ISG, το πιο επιτυχημένο από τις τρεις προσεγγίσεις, αποδεικνύει ένα επίπεδο ‘υποσυνείδητου’ μάθησης σχετικά με κάποιες από τις πιο κοινές φράσεις στο dataset, όπως ‘Δεν ξέρω’ – παρά την έλλειψη ρητής δεδομένων που θα προκαλούσαν την χειρονομία να συνοδεύει αυτή τη φράση, οι ερευνητές βρήκαν ότι ο γεννήτορας πραγματικά χειρονομεί.

Οι ερευνητές σημειώνουν ότι η πολύ συγκεκριμένη φύση αυτού του καινοτομικού έργου σημαίνει αναπόφευκτα μια έλλειψη γενικών πόρων, όπως αφιερωμένα datasets που ενσωματώνουν δεδομένα ομιλίας και χειρονομίας με τρόπο που είναι κατάλληλος για την εκπαίδευση ενός τέτοιου συστήματος. Παρόλα αυτά, και παρά την πρωτοποριακή φύση της έρευνας, θεωρούν ότι είναι μια υποσχόμενη και λίγο εξερευνημένη οδός στην ομιλία, τη γλωσσολογία και την αναγνώριση χειρονομιών.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai