Ângulo de Anderson

Ensinar AI a Entender e Usar Imagens no Diálogo

mm
Adicione Unite.AI às suas fontes preferidas no Google

Pesquisadores da Coreia do Sul desenvolveram um conjunto de dados projetado para auxiliar a pesquisa sobre a compreensão da AI sobre a forma como os humanos usam imagens no diálogo e para ajudar os modelos de linguagem natural a participar desse desenvolvimento recente nas comunicações humanas.

O artigo, da KAIST em Daedeok Innopolis, observa que a pesquisa sobre tais sistemas de diálogo multimodal nos últimos dez anos foi prejudicada por conjuntos de dados e metodologias centradas em disciplinas periféricas ao tema, como resposta a perguntas visuais e legendas de imagens.

Nessas abordagens mais antigas, as imagens são avaliadas fora do contexto lexical de uma conversa, sem compreender a forma como o diálogo é aprimorado e desenvolvido pelas respostas de imagens, e sem esquema transversal para decodificar as contribuições das contribuições visuais para o discurso.

Imagens como Facetas de Primeira Classe do Diálogo

Muitas das abordagens mencionadas até agora foram iniciativas ou desenvolvimentos do braço de pesquisa de IA da Microsoft, que em 2017 também examinou o tema de conversas multimodais que são iniciadas por uma imagem, em vez de usar imagens livremente como componentes do diálogo.

Para abordar a falta de dados de pesquisa, os pesquisadores sul-coreanos desenvolveram um conjunto de dados de 45.000 instâncias de diálogo envolvendo o uso ad hoc de imagens, sem se concentrar em imagens ‘meme’ virais; essas últimas, embora sejam uma área de interesse na pesquisa de linguagem, são arguivelmente menos desafiadoras, pois o significado de memes virais pode ser inferido mais facilmente por meio de milhares de usos em contexto em plataformas de mídia social.

Desenvolvendo Ilustrações como Substituto para o Texto

Para desenvolver uma metodologia para a transliteração bilateral palavra/frase>imagem, os pesquisadores sul-coreanos treinaram um sistema de aprendizado de máquina para substituir partes de uma conversa baseada em texto por conteúdo de imagem semanticamente relevante.

Arquitetura do sistema coreano para gerar um conjunto de dados para pesquisa de diálogo multimodal. Fonte: https://arxiv.org/pdf/2107.08685.pdf

Arquitetura do sistema coreano para gerar um conjunto de dados para pesquisa de diálogo multimodal. Fonte: https://arxiv.org/pdf/2107.08685.pdf

Pré-processar as frases alvo envolveu a exclusão de palavras de parada que poderiam inibir a previsão da próxima resposta na conversa, e a poda de trocas de baixa qualidade por meio de filtros de semelhança contextual.

Para testar a utilidade do conjunto de dados, os pesquisadores configuraram um módulo para prever a próxima ‘rodada’ no diálogo, considerando o contexto da conversa e as imagens envolvidas.

O sistema de avaliação humana usado na pesquisa.

O sistema de avaliação humana usado na pesquisa.

Cinco conjuntos de dados externos foram usados como material base para o conjunto de dados de 45k (que está disponível no GitHub). Três são elementos baseados em texto: DailyDialog, um conjunto de diálogo multi-turno baseado em texto anotado manualmente de 2017; e EmpatheticDialogues e PersonaChat, ambos de 2018. Os dois conjuntos de dados baseados em imagens usados foram MS-COCO e Flicker30k.

Pares de imagem/texto – esquema JSON de frases no conjunto de dados, associadas a imagens (neste exemplo) do banco de dados de imagens da Microsoft COCO.

Pares de imagem/texto – esquema JSON de frases no conjunto de dados, associadas a imagens (neste exemplo) do banco de dados de imagens da Microsoft COCO.

A substituição de texto por imagem para o sistema foi alimentada pela rede pré-treinada Visual Semantic Reasoning Network (VSRN), desenvolvida em 2019 na Northeastern University em Boston. O VSRN foi configurado para operar em frases pré-selecionadas manualmente dos conjuntos de dados de texto contribuintes.

Estabelecendo Coerência

A coerência dos conjuntos de dados de origem foi estabelecida desenvolvendo seis combinações de cada conjunto de dados de diálogo, correlacionadas a instâncias em cada conjunto de dados de imagem, e avaliadas ao longo de várias rodadas por humanos.

A avaliação humana foi baseada em três critérios: consistência com o contexto da troca; relevância da imagem para o conceito central que a imagem estava tentando expressar; e a extensão com que a imagem continha objetos-chave da frase alvo.

Considerando o último critério, pode-se argumentar que o esquema que os pesquisadores decidiram usar desconsiderou em grande parte a possibilidade de possibilidades humorísticas, sarcásticas, abstratas ou metafísicas para o significado semântico de uma imagem que poderia ser injetada em uma conversa de texto.

No entanto, este é um trabalho seminal, e ele tem que começar em algum lugar, enquanto esforços consideráveis estão sendo feitos em outras partes do setor de Processamento de Linguagem Natural (NLP) para mapear instâncias de sarcasmo, entre outros exemplos menos tangíveis da relação imagem/texto.

Testando

Para testar a estrutura de geração de dados, os pesquisadores usaram um modelo de recuperação em três partes baseado na pesquisa Image-Chat da Facebook de 2020. O módulo compreende Resnext-101 como codificador de imagem; o BERT da Google para o codificador de texto; e um módulo de fusão personalizado para esses.

O sistema alcançou 50,35 e 14,38 na tarefa de previsão de sentenças atuais e subsequentes, melhorando a linha de base para cada tarefa.

Posteriormente, dois pesquisadores foram encarregados de criar 100 diálogos multimodais inserindo imagens em conversas manualmente e executando o sistema contra essas ‘conversas multimodais orgânicas’. O sistema foi capaz de prever trocas atuais e subsequentes com alta consciência do contexto, mesmo para esses exemplos ad hoc.

Resultados do teste do sistema de geração de conjunto de dados multimodal coreano, revelando correlação consistentemente alta entre a semelhança texto-imagem e as pontuações de perguntas baseadas em humanos nos mesmos dados.

Resultados do teste do sistema de geração de conjunto de dados multimodal coreano, revelando correlação consistentemente alta entre a semelhança texto-imagem e as pontuações de perguntas baseadas em humanos nos mesmos dados.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai