Ângulo de Anderson

Usando IA para Resumir Vídeos “Como Fazer” Longos

mm
Adicione Unite.AI às suas fontes preferidas no Google

Se você é do tipo que aumenta a velocidade de um vídeo tutorial do YouTube para chegar às informações que realmente deseja; consulta a transcrição do vídeo para obter as informações essenciais escondidas nos longos e frequentemente patrocinados tempos de execução; ou espera que o WikiHow crie uma versão menos demorada das informações no vídeo instrucional; então um novo projeto da UC Berkeley, Google Research e Brown University pode ser do seu interesse.

Intitulado TL;DW? Resumindo Vídeos Instrucionais com Relevância de Tarefa e Saliência Cross-Modal, o novo artigo detalha a criação de um sistema de resumo de vídeo auxiliado por IA que pode identificar etapas pertinentes do vídeo e descartar tudo o mais, resultando em resumos breves que rapidamente vão ao ponto.

A exploração do WikiHow de clipes de vídeo longos existentes para texto e informações de vídeo é usada pelo projeto IV-Sum para gerar resumos falsos que fornecem a verdade para treinar o sistema. Fonte: https://arxiv.org/pdf/2208.06773.pdf

A exploração do WikiHow de clipes de vídeo longos existentes para texto e informações de vídeo é usada pelo projeto IV-Sum para gerar resumos falsos que fornecem a verdade para treinar o sistema. Fonte: https://arxiv.org/pdf/2208.06773.pdf

Os resumos resultantes têm uma fração do tempo de execução do vídeo original, enquanto as informações multi-modais (ou seja, baseadas em texto) também são registradas durante o processo, para que futuros sistemas possam potencialmente automatizar a criação de posts de blog no estilo WikiHow que possam analisar automaticamente um vídeo tutorial prolixo em um artigo curto e pesquisável, completo com ilustrações, potencialmente economizando tempo e frustração.

O novo sistema é chamado de IV-Sum (‘Resumidor de Vídeo Instrucional’), e usa o algoritmo de reconhecimento de visão computacional de código aberto ResNet-50, entre outras técnicas, para individuar quadros e segmentos pertinentes de um vídeo de origem longo.

O fluxo de trabalho conceitual para IV-Sum.

O fluxo de trabalho conceitual para IV-Sum.

O sistema é treinado em pseudo-resumos gerados a partir da estrutura de conteúdo do site WikiHow, onde as pessoas reais frequentemente usam vídeos instrucionais populares para criar uma forma de multimídia plana e baseada em texto, frequentemente usando clipes curtos e GIFs animados tirados de vídeos instrucionais de origem.

Discutindo o uso do projeto de resumos do WikiHow como fonte de dados de verdade para o sistema, os autores afirmam:

‘Cada artigo no site WikiHow Vídeos consiste em um vídeo instrucional principal que demonstra uma tarefa que frequentemente inclui conteúdo promocional, clipes do instrutor falando para a câmera sem informações visuais da tarefa e etapas que não são cruciais para a execução da tarefa.

‘Os espectadores que desejam uma visão geral da tarefa prefeririam um vídeo mais curto sem todas as informações irrelevantes mencionadas anteriormente. Os artigos do WikiHow (por exemplo, veja Como Fazer Arroz para Sushi) contêm exatamente isso: texto que contém todas as etapas importantes do vídeo listadas com imagens/clipes ilustrando as várias etapas da tarefa.’

O banco de dados resultante dessa raspagem de dados é chamado de Resumos do WikiHow. O banco de dados consiste em 2.106 vídeos de entrada e seus resumos relacionados. Isso é um tamanho de conjunto de dados notavelmente maior do que o normalmente disponível para projetos de resumo de vídeo, que normalmente exigem rotulagem e anotação manuais caras e trabalhosas – um processo que foi amplamente automatizado no novo trabalho, graças ao âmbito mais restrito de resumir vídeos instrucionais (em vez de vídeos gerais).

O IV-Sum aproveita representações de redes neurais convolucionais 3D temporais, em vez das representações baseadas em quadros que caracterizam trabalhos anteriores semelhantes, e um estudo de ablação detalhado no artigo confirma que todos os componentes dessa abordagem são essenciais para a funcionalidade do sistema.

O IV-Sum testou favoravelmente contra vários frameworks comparáveis, incluindo CLIP-It (no qual vários dos autores do artigo também trabalharam).

O IV-Sum pontua bem contra métodos comparáveis, possivelmente devido ao seu escopo de aplicação mais restrito, em comparação com a iniciativa geral de resumo de vídeo. Detalhes de métricas e métodos de pontuação mais abaixo neste artigo.

O IV-Sum pontua bem contra métodos comparáveis, possivelmente devido ao seu escopo de aplicação mais restrito, em comparação com a iniciativa geral de resumo de vídeo. Detalhes de métricas e métodos de pontuação mais abaixo neste artigo.

Método

A primeira etapa no processo de resumo envolve usar um algoritmo relativamente de baixo esforço e fraco para criar pseudo-resumos e pontuações de importância de quadro para um grande número de vídeos instrucionais raspados da web, com apenas um rótulo de tarefa em cada vídeo.

Em seguida, uma rede de resumo instrucional é treinada nesses dados. O sistema usa a fala transcrita automaticamente (por exemplo, legendas geradas por IA do YouTube para o vídeo) e o vídeo de origem como entrada.

A rede compreende um codificador de vídeo e um transformador de pontuação de segmento (SST), e o treinamento é guiado pelas pontuações de importância atribuídas nos pseudo-resumos. O resumo final é criado concatenando segmentos que alcançaram uma pontuação de importância alta.

Do artigo:

‘A principal intuição por trás de nossa pipeline de geração de pseudo-resumo é que, dado muitos vídeos de uma tarefa, as etapas cruciais para a tarefa provavelmente aparecerão em vários vídeos (relevância de tarefa).

‘Além disso, se uma etapa é importante, é típico que o demonstrador fale sobre essa etapa antes, durante ou após executá-la. Portanto, as legendas do vídeo obtidas usando Reconhecimento de Fala Automático (ASR) provavelmente farão referência a essas etapas-chave (saliência cross-modal).’

Para gerar o pseudo-resumo, o vídeo é primeiro particionado uniformemente em segmentos, e os segmentos agrupados com base em sua similaridade visual em 'etapas' (cores diferentes na imagem acima). Essas etapas são então atribuídas pontuações de importância com base em 'relevância de tarefa' e 'saliência cross-modal' (ou seja, a correlação entre o texto ASR e as imagens). As etapas com alta pontuação são então escolhidas para representar estágios no pseudo-resumo.

Para gerar o pseudo-resumo, o vídeo é primeiro particionado uniformemente em segmentos, e os segmentos agrupados com base em sua similaridade visual em ‘etapas’ (cores diferentes na imagem acima). Essas etapas são então atribuídas pontuações de importância com base em ‘relevância de tarefa’ e ‘saliência cross-modal’ (ou seja, a correlação entre o texto ASR e as imagens). As etapas com alta pontuação são então escolhidas para representar estágios no pseudo-resumo.

O sistema usa Saliência Cross-Modal para ajudar a estabelecer a relevância de cada etapa, comparando a fala interpretada com as imagens e ações no vídeo. Isso é feito usando um modelo de vídeo-texto pré-treinado, onde cada elemento é treinado conjuntamente sob perda MIL-NCE, usando um codificador de vídeo 3D CNN desenvolvido por, entre outros, DeepMind.

Uma pontuação de importância geral é então obtida a partir de uma média calculada dessas etapas de relevância de tarefa e análise cross-modal.

Dados

Um conjunto de dados inicial de pseudo-resumos foi gerado para o processo, compreendendo a maior parte do conteúdo de dois conjuntos de dados anteriores – COIN, um conjunto de 2019 contendo 11.000 vídeos relacionados a 180 tarefas; e Cross-Task, que contém 4.700 vídeos instrucionais, dos quais 3.675 foram usados na pesquisa. O Cross-Task apresenta 83 tarefas diferentes.

Acima, exemplos do COIN; abaixo, do Cross-Task. Fontes, respectivamente: https://arxiv.org/pdf/1903.02874.pdf e https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Acima, exemplos do COIN; abaixo, do Cross-Task. Fontes, respectivamente: https://arxiv.org/pdf/1903.02874.pdf e https://openaccess.thecvf.com/content_CVPR_2019/papers/Zhukov_Cross-Task_Weakly_Supervised_Learning_From_Instructional_Videos_CVPR_2019_paper.pdf

Usando vídeos que aparecem em ambos os conjuntos de dados apenas uma vez, os pesquisadores foram capazes de obter 12.160 vídeos que abrangem 263 tarefas diferentes e 628,53 horas de conteúdo para o seu conjunto de dados.

Para popular o conjunto de dados baseado no WikiHow e fornecer a verdade para o sistema, os autores raspam o WikiHow Vídeos para todos os vídeos instrucionais longos, juntamente com as imagens e clipes de vídeo (ou seja, GIFs) associados a cada etapa. Assim, a estrutura do conteúdo derivado do WikiHow serviria como um modelo para a individuação de etapas no novo sistema.

Recursos extraídos via ResNet50 foram usados para fazer a correspondência entre as seções selecionadas do vídeo nas imagens do WikiHow e realizar a localização das etapas. A imagem mais semelhante obtida dentro de uma janela de vídeo de 5 segundos foi usada como o ponto de âncora.

Esses clipes mais curtos foram então costurados em vídeos que compreenderiam a verdade para o treinamento do modelo.

Rótulos foram atribuídos a cada quadro no vídeo de entrada, para declarar se pertenciam ao resumo de entrada ou não, com cada vídeo recebendo dos pesquisadores um rótulo binário de nível de quadro e uma pontuação de resumo média obtida por meio das pontuações de importância para todos os quadros no segmento.

Nessa etapa, as ‘etapas’ em cada vídeo instrucional agora estavam associadas a dados baseados em texto e rotulados.

Treinamento, Testes e Métricas

O conjunto de dados final do WikiHow foi dividido em 1.339 vídeos de teste e 768 vídeos de validação – um aumento notável no tamanho médio de conjuntos de dados não brutos dedicados à análise de vídeo.

Os codificadores de vídeo e texto na nova rede foram treinados conjuntamente em uma rede S3D com pesos carregados de um modelo HowTo100M pré-treinado sob perda MIL-NCE.

O modelo foi treinado com o otimizador Adam em uma taxa de aprendizado de 0,01 e um tamanho de lote de 24, com Distributed Data Parallel ligando o treinamento em oito GPUs NVIDIA RTX 2080, para um total de 24GB de VRAM distribuída.

O IV-Sum foi então comparado a vários cenários para CLIP-It, de acordo com trabalhos anteriores semelhantes, incluindo um estudo sobre CLIP-It. As métricas usadas foram valores de Precisão, Recuperação e F-Pontuação, em três linhas de base não supervisionadas (veja o artigo para detalhes).

Os resultados são listados na imagem anterior, mas os pesquisadores observam adicionalmente que o CLIP-It perde um número de etapas possíveis em várias etapas nos testes que o IV-Sum não perde. Eles atribuem isso ao fato de o CLIP-It ter sido treinado e desenvolvido usando conjuntos de dados notavelmente menores do que o novo corpus do WikiHow.

Implicações

O valor a longo prazo discutível dessa linha de pesquisa (que o IV-Sum compartilha com o desafio mais amplo da análise de vídeo) poderia ser tornar os clipes de vídeo instrucionais mais acessíveis ao índice de mecanismos de busca convencionais e permitir o tipo de resumo ‘snippet’ em resultados que o Google frequentemente extrai de um artigo convencional mais longo.

Obviamente, o desenvolvimento de qualquer processo auxiliado por IA que reduz nossa obrigação de aplicar atenção linear e exclusiva ao conteúdo de vídeo pode ter ramificações para o apelo do meio para uma geração de marketers para os quais a opacidade do vídeo era talvez a única maneira pela qual eles sentiam que podiam nos engajar exclusivamente.

Com a localização do ‘conteúdo valioso’ difícil de determinar, o vídeo contribuído pelo usuário desfrutou de uma ampla (embora relutante) indulgência dos consumidores de mídia em relação a posicionamento de produtos, slots de patrocinadores e ao auto-agrandecimento geral em que a proposta de valor de um vídeo é frequentemente couchado. Projetos como o IV-Sum seguram a promessa de que, eventualmente, sub-facetos do conteúdo de vídeo se tornarão granulares e separáveis do que muitos consideram ser o ‘lastro’ de publicidade no conteúdo e extemporização não de conteúdo.

 

Publicado pela primeira vez em 16 de agosto de 2022. Atualizado às 14h52 de 16 de agosto, removida frase duplicada.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai