Angle d’Anderson
Unifier la parole et le geste

Lorsque je suis revenu en Grande-Bretagne après plusieurs années passées dans le sud de l’Italie, il m’a fallu un certain temps pour cesser de gesticuler en parlant. Au Royaume-Uni, soutenir son discours avec des mouvements de mains audacieux fait simplement paraître quelqu’un surexcité; en Italie, en tant qu’apprenant de la langue, cela m’a réellement aidé à être compris. Même maintenant, lors des rares occasions où je parle italien, les « mains sauvages » reprennent du service. Il est presque impossible de parler italien sans bouger.
Ces dernières années, la communication soutenue par des gestes dans la culture italienne et juive est devenue publiquement connue comme plus qu’un stéréotype issu des œuvres de Martin Scorsese et des premiers films de Woody Allen. En 2013, le New York Times a compilé une brève histoire en vidéo des gestes de la main italienne; l’académie commence à étudier les tendances raciales à gesticuler, plutôt que de rejeter le sujet comme un stéréotype; et de nouveaux émojis de l’Unicode Consortium sont en train de combler le manque de gestes qui accompagne la communication purement numérique et basée sur le texte.
Une approche unifiée de la parole et du geste
Maintenant, une nouvelle recherche du Département de la parole, de la musique et de l’audition du KTH Royal Institute of Technology en Suède cherche à combiner la reconnaissance de la parole et du geste dans un système multimodal unifié qui pourrait potentiellement accroître notre compréhension de la communication basée sur la parole en utilisant le langage corporel comme un adjunct intégré à la parole, plutôt que comme un domaine d’étude parallèle.

Visuels de la page de test du projet suédois de parole et de geste. Source: https://swatsw.github.io/isg_icmi21/
La recherche propose un nouveau modèle appelé synthèse intégrée de la parole et du geste (ISG), et rassemble un certain nombre de modèles neuronaux de pointe issus de la recherche sur la parole et le geste.
La nouvelle approche abandonne le modèle de pipeline linéaire de traitement (où les informations de geste sont dérivées séquentiellement de la parole comme une étape de traitement secondaire) pour une approche plus intégrée, qui se classe également avec les systèmes existants selon les utilisateurs finals, et qui réalise un temps de synthèse plus rapide et une réduction du nombre de paramètres.

Approches linéaire et intégrée. Source: https://arxiv.org/pdf/2108.11436.pdf
Le nouveau système multimodal intègre un synthétiseur de parole spontanée et un générateur de geste audio-parole, tous deux formés sur l’ensemble de données Trinity Speech Gesture existant. L’ensemble de données contient 244 minutes d’audio et de capture de corps d’un homme parlant sur différents sujets et gesticulant librement.
Le travail est un équivalent novateur et tangentiel du projet DurIAN, qui génère des expressions faciales et de la parole, plutôt que des gestes et de la parole, et qui relève davantage du domaine de la reconnaissance et de la synthèse d’expressions.
Architectures
Les composants de parole et visuels (geste) du projet sont déséquilibrés en termes de données; le texte est rare et la gesticulation est riche et intensive en données – un défi en termes de définition d’objectifs et de métriques. Par conséquent, les chercheurs ont évalué le système principalement par la réponse humaine à la sortie, plutôt que par des approches mécanistes plus évidentes telles que l’erreur quadratique moyenne (MSE).
Les deux principaux modèles ISG ont été développés autour de la deuxième itération du projet de synthèse de parole Tacotron de Google en 2017, et de l’initiative Glow-TTS sud-coréenne publiée en 2020. Tacotron utilise une architecture LSTM autoregressive, tandis que Glow-TTS agit en parallèle via des opérateurs de convolution, avec des performances GPU plus rapides et sans les problèmes de stabilité qui peuvent accompagner les modèles autoregressifs.
Les chercheurs ont testé trois systèmes de parole et de geste efficaces au cours du projet: une version modifiée d’un modèle de génération de parole et de geste multimodale publié en 2021 par un certain nombre des mêmes chercheurs sur le nouveau projet; une version ISG dédiée et modifiée de Tacotron 2 open source; et une version ISG fortement modifiée de Glow-TTS.
Pour évaluer les systèmes, les chercheurs ont créé un environnement de rétroaction basé sur le Web avec des personnes 3D articulées parlant et se déplaçant sur des segments de texte prédéfinis (l’apparence générale de l’environnement peut être vue sur la page publique du projet).

L’environnement de test.
Les sujets de test ont été invités à évaluer les performances du système en fonction de la parole et du geste, de la parole uniquement et du geste uniquement. Les résultats ont montré une légère amélioration de la nouvelle version ISG par rapport à l’ancienne version de pipeline, bien que le système plus récent fonctionne plus rapidement et avec des ressources réduites.

Lorsqu’on leur a demandé « Quelle est l’humanité du geste? », le modèle ISG entièrement intégré termine légèrement en tête du modèle de pipeline plus lent, avec les modèles basés sur Tacotron et Glow encore plus loin.
Shrug intégré
Le modèle Tacotron2-ISG, l’approche la plus réussie des trois, démontre un certain niveau d’apprentissage « subliminal » lié à certaines des phrases les plus courantes de l’ensemble de données, telles que « Je ne sais pas » – malgré un manque de données explicites qui l’amèneraient à générer un haussement d’épaules pour accompagner cette phrase, les chercheurs ont constaté que le générateur fait effectivement un haussement d’épaules.
Les chercheurs notent que la nature très spécifique de ce projet novateur signifie inévitablement une pénurie de ressources générales, telles que des ensembles de données dédiés qui intègrent des données de parole et de geste d’une manière appropriée pour la formation d’un tel système. Néanmoins, et malgré la nature pionnière de la recherche, ils considèrent qu’il s’agit d’une voie prometteuse et peu explorée dans le domaine de la parole, de la linguistique et de la reconnaissance de gestes.












