Ángulo de Anderson

Enseñar a la IA a entender y utilizar imágenes en el diálogo

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de Corea del Sur han desarrollado un conjunto de datos diseñado para ayudar a la investigación sobre la comprensión de la IA de la forma en que los humanos utilizan imágenes en el diálogo, y para ayudar a los modelos de lenguaje natural a participar en este desarrollo reciente en la comunicación humana.

El artículo, de KAIST en Daedeok Innopolis, señala que la investigación sobre sistemas de diálogo multimodales en los últimos diez años ha sido obstaculizada por conjuntos de datos y metodologías centradas en disciplinas periféricas al tema, como preguntas visuales y subtítulos de imágenes.

En estos enfoques anteriores, las imágenes se evalúan fuera del contexto léxico de una conversación, sin comprender la forma en que el diálogo se mejora y desarrolla con respuestas de imágenes, y sin esquema de decodificación de contribuciones visuales a la discusión.

Imágenes como facetas de diálogo de primera clase

Muchos de los enfoques anteriores han sido iniciativas o desarrollos del brazo de investigación de IA de Microsoft, que en 2017 también examinó el tema de conversaciones multimodales que comienzan con una imagen, en lugar de utilizar libremente imágenes como componentes de diálogo.

Para abordar la falta de datos de investigación, los investigadores surcoreanos han desarrollado un conjunto de datos de 45.000 instancias de diálogo que involucran el uso ad hoc de imágenes, sin centrarse en imágenes de ‘meme’ virales; estas últimas, aunque son un área de interés en la investigación del lenguaje, son menos desafiantes, ya que el significado de los memes virales puede inferirse más fácilmente a través de miles de usos en contexto en plataformas de redes sociales.

Desarrollar ilustraciones como sustituto de texto

Para desarrollar una metodología para la transliteración bilateral de palabra/frase a imagen, los investigadores surcoreanos han entrenado un sistema de aprendizaje automático para sustituir partes de una conversación basada en texto por contenido de imagen semánticamente relevante.

Arquitectura del sistema coreano para generar un conjunto de datos para la investigación de diálogo multimodal. Fuente: https://arxiv.org/pdf/2107.08685.pdf

Arquitectura del sistema coreano para generar un conjunto de datos para la investigación de diálogo multimodal. Fuente: https://arxiv.org/pdf/2107.08685.pdf

El preprocesamiento de las frases objetivo involucró la eliminación de palabras de parada que podrían inhibir la predicción de la siguiente respuesta en la conversación, y la poda de intercambios de inferior calidad a través de filtros de similitud contextual.

Para probar la utilidad del conjunto de datos, los investigadores configuraron un módulo para predecir la próxima ‘turno’ en el diálogo mientras consideraba el contexto de la conversación y las imágenes involucradas.

La interfaz de usuario de evaluación humana utilizada en la investigación.

La interfaz de usuario de evaluación humana utilizada en la investigación.

Cinco conjuntos de datos externos se utilizaron como material base para el conjunto de datos de 45k (que está disponible en GitHub). Tres son elementos basados en texto: DailyDialog, un conjunto de texto basado en turnos múltiples anotado manualmente de 2017; y EmpatheticDialogues y PersonaChat, ambos de 2018. Los dos conjuntos de datos basados en imágenes utilizados fueron MS-COCO y Flicker30k.

Pares de imagen/texto – esquema JSON de frases en el conjunto de datos, asociadas con imágenes (en este ejemplo) de la base de datos de imágenes de Microsoft COCO.

Pares de imagen/texto – esquema JSON de frases en el conjunto de datos, asociadas con imágenes (en este ejemplo) de la base de datos de imágenes de Microsoft COCO.

La sustitución de texto a imagen para el sistema fue impulsada por la red preentrenada Visual Semantic Reasoning Network (VSRN), desarrollada en 2019 en la Universidad Northeastern de Boston. VSRN se configuró para operar en frases preseleccionadas manualmente de los conjuntos de datos de texto contribuyentes.

Establecer coherencia

La coherencia de los conjuntos de datos de origen se estableció desarrollando seis combinaciones de cada conjunto de datos de diálogo, correlacionadas con instancias en cada conjunto de datos de imágenes, y evaluadas durante varias rondas por humanos.

La puntuación humana se basó en tres criterios: consistencia con el contexto del intercambio; relevancia de la imagen para el concepto central que la imagen intentaba expresar; y la medida en que la imagen contenía objetos clave de la oración objetivo.

Considerando el último criterio, se podría argumentar que el esquema que los investigadores decidieron tiene en gran medida descontado la posibilidad de posibilidades humorísticas, sarcásticas, abstractas o metafísicas para el significado semántico de una imagen que podría inyectarse en una conversación de texto.

Sin embargo, este es un trabajo seminal, y tiene que comenzar en algún lugar, mientras que se realizan esfuerzos considerables en otro lugar en el sector de Procesamiento de Lenguaje Natural (NLP) para mapear instancias de sarcasmo, entre otros ejemplos menos tangibles de la relación imagen/texto.

Pruebas

Para probar el marco de generación de datos, los investigadores utilizaron un modelo de recuperación de tres partes basado en la investigación Image-Chat de Facebook de 2020. El módulo comprende Resnext-101 como codificador de imágenes; BERT de Google para el codificador de texto; y un módulo de fusión personalizado para estos.

El sistema logró 50,35 y 14,38 en la tarea de predicción de oración actual y siguiente, mejorando la línea de base para cada tarea.

Más tarde, dos investigadores fueron encargados de crear 100 diálogos multimodales insertando imágenes en conversaciones manualmente, y ejecutando el sistema contra estas conversaciones ‘orgánicas’ multimodales. El sistema pudo predecir intercambios de turno actual y siguiente con alta conciencia del contexto incluso para estos ejemplos ad hoc.

Resultados de las pruebas para el sistema de generación de conjunto de datos multimodal coreano, que revela una correlación alta y consistente entre la similitud de texto a imagen y las puntuaciones de preguntas basadas en humanos en los mismos datos.

Resultados de las pruebas para el sistema de generación de conjunto de datos multimodal coreano, que revela una correlación alta y consistente entre la similitud de texto a imagen y las puntuaciones de preguntas basadas en humanos en los mismos datos.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai