Ángulo de Anderson

Unificar el habla y la gesticulación

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cuando regresé a Gran Bretaña después de varios años en el sur de Italia, me tomó un tiempo dejar de gesticular mientras hablaba. En el Reino Unido, apoyar tu discurso con movimientos de manos audaces solo te hace parecer sobre-caffeínico; en Italia, como alguien que aprende el idioma, en realidad me ayudó a ser entendido. Incluso ahora, en las ocasiones más raras en que hablo italiano, las ‘manos salvajes’ vuelven a funcionar. Es casi imposible hablar italiano sin moverse.

En los últimos años, la comunicación apoyada en gestos en la cultura italiana y judía ha llegado a la atención pública como más que solo un tropo de la obra de Martin Scorsese y las primeras películas de Woody Allen. En 2013, The New York Times compiló un breve video de la historia de los gestos de manos italianos; la academia está comenzando a estudiar las propensiones raciales para gesticular, en lugar de descartar el tema como un estereotipo; y nuevos emojis del Consorcio Unicode están cerrando la brecha de gestos que viene con la comunicación puramente digital y basada en texto.

Un enfoque unificado para el habla y la gesticulación

Ahora, nueva investigación del Departamento de Habla, Música y Audición del KTH Royal Institute of Technology de Suecia busca combinar el reconocimiento del habla y la gesticulación en un sistema multimodal unificado que podría potencialmente aumentar nuestra comprensión de la comunicación basada en el habla utilizando el lenguaje corporal como un complemento integrado al habla, en lugar de un campo de estudio paralelo.

Visualizaciones de la página de prueba del proyecto de habla y gestos sueco. Fuente: https://swatsw.github.io/isg_icmi21/

Visualizaciones de la página de prueba del proyecto de habla y gestos sueco. Fuente: https://swatsw.github.io/isg_icmi21/

La investigación propone un nuevo modelo llamado síntesis de habla y gestos integrados (ISG), y reúne una serie de modelos neuronales de vanguardia de la investigación sobre el habla y la gesticulación.

El nuevo enfoque abandona el modelo de tubería lineal (donde la información de gestos se deriva secuencialmente del habla como una etapa de procesamiento secundario) por un enfoque más integrado, que califica igual que los sistemas existentes según los usuarios finales, y que logra un tiempo de síntesis más rápido y una cuenta de parámetros reducida.

Enfoques lineales vs. integrados. Fuente: https://arxiv.org/pdf/2108.11436.pdf

Enfoques lineales vs. integrados. Fuente: https://arxiv.org/pdf/2108.11436.pdf

El nuevo sistema multimodal incorpora un sintetizador de texto a habla espontáneo y un generador de gestos impulsado por audio-habla, ambos entrenados en el conjunto de datos Trinity Speech Gesture existente. El conjunto de datos contiene 244 minutos de audio y captura de cuerpo de un hombre hablando sobre diferentes temas y gesticulando libremente.

El trabajo es un equivalente novedoso y tangencial al proyecto DurIAN, que genera expresiones faciales y habla, en lugar de gestos y habla, y que cae más en el ámbito del reconocimiento y síntesis de expresiones.

Arquitecturas

Los componentes de habla y visuales (gestos) del proyecto están desequilibrados en términos de datos; el texto es escaso y la gesticulación es rica y intensiva en datos – un desafío en términos de definir objetivos y métricas. Por lo tanto, los investigadores evaluaron el sistema principalmente por la respuesta humana a la salida, en lugar de enfoques más obvios mecanicistas como el error cuadrático medio (MSE).

Los dos principales modelos ISG se desarrollaron alrededor de la segunda iteración del proyecto de síntesis de habla de Google de 2017 Tacotron, y la iniciativa Glow-TTS de Corea del Sur publicada en 2020. Tacotron utiliza una arquitectura LSTM autoregresiva, mientras que Glow-TTS actúa en paralelo a través de operadores de convolución, con un rendimiento de GPU más rápido y sin los problemas de estabilidad que pueden surgir en los modelos autoregresivos.

Los investigadores probaron tres sistemas de habla y gestos efectivos durante el proyecto: una versión modificada de un generador multimodal de habla y gestos publicado en 2021 por varios de los mismos investigadores del nuevo proyecto; una versión ISG dedicada y modificada de la fuente abierta Tacotron 2; y una versión ISG muy alterada de Glow-TTS.

Para evaluar los sistemas, los investigadores crearon un entorno de retroalimentación basado en la web con personas articuladas 3D que hablan y se mueven a segmentos de texto predefinidos (el aspecto general del entorno se puede ver en la página del proyecto).

El entorno de prueba.

El entorno de prueba.

Se les pidió a los sujetos de prueba que evaluaran el rendimiento del sistema en función de la habla y los gestos, la habla solo y los gestos solo. Los resultados mostraron una ligera mejora en la nueva versión ISG sobre la versión de tubería más antigua, aunque el sistema más nuevo opera más rápido y con menos recursos.

Preguntados '¿Qué tan humano es el gesto?', el modelo ISG completamente integrado termina ligeramente por delante del modelo de tubería más lento, con los modelos basados en Tacotron y Glow más atrás.

Preguntados ‘¿Qué tan humano es el gesto?’, el modelo ISG completamente integrado termina ligeramente por delante del modelo de tubería más lento, con los modelos basados en Tacotron y Glow más atrás.

Encogimiento de hombros integrado

El modelo Tacotron2-ISG, el más exitoso de los tres enfoques, demuestra un nivel de ‘aprendizaje subliminal’ relacionado con algunas de las frases más comunes en el conjunto de datos, como ‘No lo sé’ – a pesar de la falta de datos explícitos que lo harían generar un encogimiento de hombros para acompañar esta frase, los investigadores encontraron que el generador sí se encoge de hombros.

Los investigadores señalan que la naturaleza muy específica de este proyecto novedoso inevitablemente significa una escasez de recursos generales, como conjuntos de datos dedicados que incorporen datos de habla y gestos de una manera adecuada para el entrenamiento de tal sistema. Sin embargo, y a pesar de la naturaleza vanguardista de la investigación, consideran que es una vía prometedora y poco explorada en el habla, la lingüística y el reconocimiento de gestos.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai