Ángulo de Anderson

Lectura de labios con visemas y aprendizaje automático

mm
Añade Unite.AI a tus fuentes preferidas en Google
HAL reads lips in 2001: A Space Odyssey (1968)

Nueva investigación de la Escuela de Ingeniería Informática de Teherán ofrece un enfoque mejorado para el desafío de crear sistemas de aprendizaje automático capaces de leer labios.

El artículo, titulado Lectura de labios utilizando decodificación de visemas, informa que el nuevo sistema logra una mejora del 4% en la tasa de error de palabras en comparación con los mejores modelos previos similares. El sistema aborda la falta general de datos de entrenamiento útiles en este sector al mapear visemas con contenido de texto derivado de las seis millones de muestras en el conjunto de datos OpenSubtitles de títulos de películas traducidas.

Un visema es el equivalente visual de un fonema, efectivamente un mapeo de audio a imagen que puede constituir una ‘característica’ en un modelo de aprendizaje automático.

Visemas gif

Visemas en acción. Fuente: https://developer.oculus.com/documentation/unity/audio-ovrlipsync-viseme-reference/

Los investigadores comenzaron estableciendo la tasa de error más baja en los conjuntos de datos disponibles y desarrollando secuencias de visemas a partir de procedimientos de mapeo establecidos. Gradualmente, este proceso desarrolla un léxico visual de palabras, aunque es necesario definir probabilidades de precisión para diferentes palabras que comparten un visema (como ‘corazón’ y ‘arte’).

Visemas decodificados

Visemas extraídos del texto. Fuente: https://arxiv.org/pdf/2104.04784.pdf

Cuando dos palabras idénticas resultan en el mismo visema, se selecciona la palabra que ocurre con más frecuencia.

El modelo se basa en el aprendizaje secuencial tradicional al agregar una etapa de subprocesamiento en la que se predicen visemas a partir del texto y se modelan en una canalización dedicada:

Arquitectura de visema para lectura de labios

Arriba, métodos secuenciales tradicionales en un modelo de caracteres; abajo, la adición de modelado de visemas en el modelo de investigación de Teherán. Fuente: https://arxiv.org/pdf/2104.04784.pdf

El modelo se aplicó sin contexto visual contra el conjunto de datos LRS3-TED, lanzado por la Universidad de Oxford en 2018, con la peor tasa de error de palabras (WER) obtenida un respetable 24,29%.

La investigación de Teherán también incorpora el uso de un conversor de grafema a fonema.

En una prueba contra la investigación de Oxford de 2017 Lectura de frases en el mundo real (ver abajo), el método de Video-a-Visema logró una tasa de error de palabras del 62,3%, en comparación con el 69,5% para el método de Oxford.

Los investigadores concluyen que el uso de una mayor cantidad de información de texto, combinada con mapeo de grafema a fonema y visema, promete mejoras sobre el estado actual de los sistemas de lectura de labios automatizados, mientras reconoce que los métodos utilizados pueden producir resultados aún mejores cuando se incorporen a marcos actuales más sofisticados.

La lectura de labios automatizada ha sido un área activa y en curso de investigación en visión por computadora y procesamiento de lenguaje natural durante las últimas dos décadas. Entre muchos otros ejemplos y proyectos, en 2006 el uso de software de lectura de labios automatizado capturó titulares cuando se utilizó para interpretar lo que Adolf Hitler estaba diciendo en algunas de las famosas películas mudas tomadas en su retiro bávaro, aunque la aplicación parece haber desaparecido en la oscuridad desde entonces (doce años después, Sir Peter Jackson recurrió a lectores de labios humanos para restaurar las conversaciones de las imágenes de la Primera Guerra Mundial en el proyecto de restauración They Shall Not Grow Old).

En 2017, Lectura de frases en el mundo real, una colaboración entre la Universidad de Oxford y la división de investigación de inteligencia artificial de Google, produjo un software de lectura de labios capaz de inferir correctamente el 48% del habla en video sin sonido, donde un lector de labios humano solo podría alcanzar una precisión del 12,4% con el mismo material. El modelo se entrenó con miles de horas de footage de la BBC.

Este trabajo siguió a una iniciativa separada de Oxford/Google del año anterior, titulado LipNet, una arquitectura de red neuronal que mapea secuencias de video de longitud variable a secuencias de texto utilizando una Red Recurrente Gated (GRN), que agrega funcionalidad a la arquitectura base de una Red Recurrente Neuronal (RNN). El modelo logró un rendimiento 4,1 veces mejor que el de los lectores de labios humanos.

Además del problema de obtener una transcripción precisa en tiempo real, el desafío de interpretar el habla a partir de video se profundiza a medida que se elimina el contexto útil, como el audio, las imágenes ‘de frente’ bien iluminadas y un lenguaje/cultura donde los fonemas/visemas son relativamente distintos.

Aunque actualmente no hay una comprensión empírica de qué lenguajes son los más difíciles de leer labios en la completa ausencia de audio, el japonés es un principale contendiente. Las diferentes formas en que los nativos japoneses (así como ciertos nativos asiáticos occidentales y orientales) utilizan expresiones faciales contra el contenido de su habla ya los convierten en un mayor desafío para los sistemas de análisis de sentimientos.

Sin embargo, es importante destacar que gran parte de la literatura científica sobre el tema es generalmente cautelosa, no solo porque incluso la investigación objetiva y bien intencionada en esta esfera riesgos de cruzar la línea hacia el perfil racial y la promoción de estereotipos existentes.

Los lenguajes con una alta proporción de componentes guturales, como el checheno y el holandés, son particularmente problemáticos para las técnicas de extracción de habla automatizada, mientras que las culturas donde el hablante puede expresar emoción o deferencia mirando hacia otro lado (de nuevo, generalmente en culturas asiáticas) agregan otra dimensión donde los investigadores de lectura de labios automatizados necesitarán desarrollar métodos adicionales de ‘relleno’ a partir de otras pistas contextuales.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai