Ángulo de Anderson

Utilizar IA para resumir vídeos “cómo hacer” largos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Si eres el tipo de persona que acelera la velocidad de un vídeo tutorial de YouTube para obtener la información que realmente deseas; consulta la transcripción del vídeo para obtener la información esencial oculta en los tiempos de ejecución largos y a menudo llenos de anuncios; o esperas que WikiHow haya creado una versión menos tediosa de la información en el vídeo instructivo; entonces un nuevo proyecto de la Universidad de California en Berkeley, Google Research y la Universidad de Brown puede ser de interés para ti.

Titulado TL;DW? Resumiendo vídeos instructivos con relevancia de tarea y saliencia cruzada de modos, el nuevo artículo detalla la creación de un sistema de resumen de vídeo asistido por IA que puede identificar los pasos pertinentes del vídeo y descartar todo lo demás, lo que resulta en resúmenes breves que rápidamente llegan al punto.

La explotación de WikiHow de clips de vídeo largos existentes para texto y vídeo es utilizada por el proyecto IV-Sum para generar resúmenes falsos que proporcionan la verdad para entrenar el sistema. Fuente: https://arxiv.org/pdf/2208.06773.pdf

La explotación de WikiHow de clips de vídeo largos existentes para texto y vídeo es utilizada por el proyecto IV-Sum para generar resúmenes falsos que proporcionan la verdad para entrenar el sistema. Fuente: https://arxiv.org/pdf/2208.06773.pdf

Los resúmenes resultantes tienen una fracción del tiempo de ejecución original del vídeo, mientras que la información multi-modal (es decir, basada en texto) también se registra durante el proceso para que los sistemas futuros puedan potencialmente automatizar la creación de publicaciones de blog al estilo de WikiHow que puedan analizar automáticamente un vídeo “cómo hacer” prolífico en un artículo breve y buscable, completo con ilustraciones, lo que podría ahorrar tiempo y frustración.

El nuevo sistema se llama IV-Sum (‘Resumidor de Vídeos Instructivos’), y utiliza el algoritmo de reconocimiento de visión por computadora de código abierto ResNet-50, entre otras técnicas, para individuar los marcos y segmentos pertinentes de un vídeo fuente largo.

El flujo de trabajo conceptual para IV-Sum.

El flujo de trabajo conceptual para IV-Sum.

El sistema se entrena en pseudo-resúmenes generados a partir de la estructura de contenido del sitio web de WikiHow, donde las personas reales a menudo convierten vídeos instructivos populares en una forma multimedia plana y basada en texto, frecuentemente utilizando clips cortos y GIFs animados tomados de vídeos instructivos de origen.

Al discutir el uso del proyecto de los resúmenes de WikiHow como fuente de datos de verdad para el sistema, los autores afirman:

‘Cada artículo en el sitio web WikiHow Videos consiste en un vídeo instructivo principal que demuestra una tarea que a menudo incluye contenido promocional, clips del instructor hablando a la cámara sin información visual de la tarea, y pasos que no son cruciales para realizar la tarea.

‘Los espectadores que desean una visión general de la tarea preferirían un vídeo más corto sin toda la información irrelevante anterior. Los artículos de WikiHow (por ejemplo, véase Cómo hacer arroz para sushi) contienen exactamente esto: texto que contiene todos los pasos importantes en el vídeo enumerados con imágenes/clip que ilustran los varios pasos en la tarea.’

El resultado de esta extracción de datos de la web se llama Resúmenes de WikiHow. La base de datos consta de 2,106 vídeos de entrada y sus resúmenes relacionados. Esto es notablemente más grande que el tamaño de la base de datos comúnmente disponible para proyectos de resumen de vídeo, que normalmente requieren etiquetado y anotación manual costosos y laboriosos – un proceso que ha sido en gran medida automatizado en el nuevo trabajo, gracias al ámbito más restringido de resumir vídeos instructivos (en lugar de generales).

IV-Sum aprovecha las representaciones de redes neuronales convolucionales 3D temporales, en lugar de las representaciones basadas en marcos que caracterizan a los trabajos similares anteriores, y un estudio de ablation detallado en el artículo confirma que todos los componentes de este enfoque son esenciales para la funcionalidad del sistema.

IV-Sum se comparó favorablemente con varios marcos comparables, incluyendo CLIP-It (en el que varios de los autores del artículo también trabajaron).

IV-Sum obtiene buenos resultados en comparación con métodos comparables, posiblemente debido a su alcance de aplicación más restringido, en comparación con la iniciativa general de resumen de vídeo. Detalles de métricas y métodos de puntuación más abajo en este artículo.

IV-Sum obtiene buenos resultados en comparación con métodos comparables, posiblemente debido a su alcance de aplicación más restringido, en comparación con la iniciativa general de resumen de vídeo. Detalles de métricas y métodos de puntuación más abajo en este artículo.

Método

La primera etapa en el proceso de resumen implica utilizar un algoritmo débilmente supervisado de esfuerzo relativamente bajo para crear pseudo-resúmenes y puntuaciones de importancia de marco para una gran cantidad de vídeos instructivos extraídos de la web, con solo una etiqueta de tarea en cada vídeo.

A continuación, se entrena una red de resumen instructivo en estos datos. El sistema toma la transcripción automática de habla (por ejemplo, los subtítulos generados por IA de YouTube para el vídeo) y el vídeo de origen como entrada.

La red consta de un codificador de vídeo y un transformador de puntuación de segmento (SST), y el entrenamiento se guía por las puntuaciones de importancia asignadas en los pseudo-resúmenes. El resumen final se crea concatenando segmentos que lograron una puntuación de importancia alta.

Del artículo:

‘La principal intuición detrás de nuestra tubería de generación de resumen pseudo es que, dado muchos vídeos de una tarea, los pasos cruciales para la tarea probablemente aparezcan en múltiples vídeos (relevancia de tarea).

‘Además, si un paso es importante, es típico que el demostrador hable sobre este paso antes, durante o después de realizarlo. Por lo tanto, los subtítulos para el vídeo obtenidos mediante Reconocimiento Automático del Habla (ASR) probablemente harán referencia a estos pasos clave (saliencia cruzada de modos).’

Para generar el resumen pseudo, el vídeo se divide uniformemente en segmentos, y los segmentos se agrupan en función de su similitud visual en 'pasos' (diferentes colores en la imagen de arriba). Estos pasos se asignan puntuaciones de importancia en función de 'relevancia de tarea' y 'saliencia cruzada de modos' (es decir, la correlación entre el texto de ASR e imágenes). Los pasos con puntuaciones altas se eligen para representar etapas en el resumen pseudo.

Para generar el resumen pseudo, el vídeo se divide uniformemente en segmentos, y los segmentos se agrupan en función de su similitud visual en ‘pasos’ (diferentes colores en la imagen de arriba). Estos pasos se asignan puntuaciones de importancia en función de ‘relevancia de tarea’ y ‘saliencia cruzada de modos’ (es decir, la correlación entre el texto de ASR e imágenes). Los pasos con puntuaciones altas se eligen para representar etapas en el resumen pseudo.

El sistema utiliza Saliencia cruzada de modos para ayudar a establecer la relevancia de cada paso, comparando el habla interpretada con las imágenes y acciones en el vídeo. Esto se logra mediante el uso de un modelo de vídeo-texto preentrenado donde cada elemento se entrena conjuntamente bajo la pérdida de MIL-NCE, utilizando un codificador de vídeo 3D CNN desarrollado por, entre otros, DeepMind.

Una puntuación de importancia general se obtiene a partir de un promedio calculado de estas etapas de relevancia de tarea y análisis cruzado de modos.

Datos

Se generó un conjunto de datos de pseudo-resúmenes inicial para el proceso, que comprende la mayoría del contenido de dos conjuntos de datos anteriores – COIN, un conjunto de 2019 que contiene 11,000 vídeos relacionados con 180 tareas; y Cross-Task, que contiene 4,700 vídeos instructivos, de los cuales 3,675 se utilizaron en la investigación. Cross-Task cuenta con 83 tareas diferentes.

Arriba, ejemplos de COIN; abajo, de Cross-Task. Fuentes, respectivamente: https://arxiv.org/pdf/1903.02874.pdf y https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Arriba, ejemplos de COIN; abajo, de Cross-Task. Fuentes, respectivamente: https://arxiv.org/pdf/1903.02874.pdf y https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Utilizando vídeos que aparecían en ambos conjuntos de datos solo una vez, los investigadores pudieron obtener 12,160 vídeos que abarcan 263 tareas diferentes, y 628.53 horas de contenido para su conjunto de datos.

Para poblar el conjunto de datos basado en WikiHow, y para proporcionar la verdad para el sistema, los autores extrajeron vídeos instructivos largos de WikiHow Videos, junto con sus imágenes y clips de vídeo (es decir, GIFs) asociados con cada paso. Así, la estructura del contenido derivado de WikiHow serviría como plantilla para la individuación de pasos en el nuevo sistema.

Se utilizaron características extraídas a través de ResNet50 para hacer coincidir las secciones seleccionadas del vídeo en las imágenes de WikiHow y realizar la localización de los pasos. La imagen más similar obtenida dentro de una ventana de vídeo de 5 segundos se utilizó como punto de anclaje.

Estos clips más cortos se unieron luego en vídeos que constituirían la verdad para el entrenamiento del modelo.

Se asignaron etiquetas a cada marco en el vídeo de entrada, para declarar si pertenecían al resumen de entrada o no, con cada vídeo recibiendo de los investigadores una etiqueta binaria de nivel de marco, y una puntuación de resumen promedio obtenida a través de las puntuaciones de importancia para todos los marcos en el segmento.

En esta etapa, los ‘pasos’ en cada vídeo instructivo ahora estaban asociados con datos basados en texto, y etiquetados.

Entrenamiento, pruebas y métricas

El conjunto de datos final de WikiHow se dividió en 1,339 vídeos de prueba y 768 vídeos de validación – un aumento notable en el tamaño promedio de los conjuntos de datos no brutos dedicados al análisis de vídeo.

Los codificadores de vídeo y texto en la nueva red se entrenaron conjuntamente en una red S3D con pesos cargados desde un modelo HowTo100M preentrenado bajo la pérdida de MIL-NCE.

El modelo se entrenó con el optimizador Adam a una tasa de aprendizaje de 0.01 con un tamaño de lote de 24, con Distributed Data Parallel que vincula el entrenamiento en ocho GPU NVIDIA RTX 2080, para un total de 24GB de VRAM distribuido.

IV-Sum se comparó luego con varios escenarios para CLIP-It de acuerdo con trabajos anteriores similares, incluyendo un estudio sobre CLIP-It. Las métricas utilizadas fueron los valores de Precisión, Recuerdo y Puntuación F, en tres líneas base no supervisadas (ver artículo para detalles).

Los resultados se enumeran en la imagen anterior, pero los investigadores observan además que CLIP-It pierde una serie de pasos posibles en varias etapas de las pruebas que IV-Sum no. Atribuyen esto a que CLIP-It se ha entrenado y desarrollado utilizando conjuntos de datos notablemente más pequeños que el nuevo corpus de WikiHow.

Implicaciones

El valor a largo plazo de esta línea de investigación (que IV-Sum comparte con el desafío más amplio del análisis de vídeo) podría ser hacer que los clips de vídeo instructivos sean más accesibles para la indexación de motores de búsqueda convencionales, y permitir el tipo de resumen reductivo en resultados ‘fragmento’ para vídeos que Google a menudo extrae de un artículo convencional más largo.

Obviamente, el desarrollo de cualquier proceso asistido por IA que reduzca nuestra obligación de aplicar atención lineal y exclusiva al contenido de vídeo podría tener ramificaciones para el atractivo del medio para una generación de marketeros para quienes la opacidad del vídeo era quizás la única forma en que se sentían exclusivamente comprometidos.

Con la ubicación del contenido ‘valioso’ difícil de determinar, el vídeo contribuido por el usuario ha disfrutado de una amplia (aunque reluctante) indulgencia de los consumidores de medios en cuanto a la colocación de productos, ranuras de patrocinio y la auto-promoción general en la que la propuesta de valor del vídeo a menudo se expresa. Proyectos como IV-Sum ofrecen la promesa de que eventualmente los sub-facetes del contenido de vídeo se vuelvan granulares y separables de lo que muchos consideran el ‘lastre’ de la publicidad en el contenido y la extemporización no relacionada con el contenido.

 

Publicado por primera vez el 16 de agosto de 2022. Actualizado a las 2:52 pm del 16 de agosto, se eliminó la frase duplicada.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai