Ângulo de Anderson

Obter NLP para Desafiar Perguntas Mal Informadas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Algumas perguntas são inrespondíveis porque contêm informações incorretas – pressuposições que a pessoa que ouve a pergunta deve filtrar e renunciar. Isso assume, claro, que o ouvinte tenha informações corretas suficientes para desafiar a pergunta, em vez de usar a pergunta em si como fonte de (errada) informação.

É um desafio para os sistemas de Processamento de Linguagem Natural (NLP) como o GPT-3, que têm uma tendência a ‘alucinar’ informações para manter o diálogo.

Atualmente, perguntar ao GPT-3 ‘Quando Marie Curie inventou o Urânio?’ provavelmente obterá a resposta ‘Marie Curie inventou o Urânio em 1898’.

Fonte: https://beta.openai.com/playground (Da Vinci instruct beta).

Fonte: https://beta.openai.com/playground (Da Vinci instruct beta).

Na verdade, o Urânio foi descoberto em 1789 pelo químico alemão Martin Heinrich Klaproth, enquanto a revelação dos Curies em 1898 foi a isolamento do rádio.

O problema dos sistemas de NLP ignorando pressuposições incorretas tem sido focado em uma série de publicidades este ano, incluindo a forma como os resultados de busca assistidos por IA do Google ignoram informações incorretas na pergunta ‘Quando Neil Armstrong pisou em Marte?’ – um erro que ainda aparece no momento da escrita deste artigo, e igualmente se aplica ao Toy Story‘s Buzz Lightyear, que aparentemente aterrissou na Lua em 21 de julho de 1969.

Tom Hanks, outro Toy Story ex-aluno, também é creditado pelo Google por ter aterrissado na Lua em 1970, apesar do fato de que seu personagem Apollo 13, astronauta Jim Lovell, é mais famoso por não ter alcançado isso.

Abordando Problemas de Pressuposição em Trocas de NLP

Agora, a Google Research, juntamente com pesquisadores da Universidade Johns Hopkins e da Universidade Brown, está investigando novos métodos de aprendizado de máquina para que os sistemas de NLP possam eventualmente ser feitos para desafiar perguntas factualmente incorretas da mesma forma que é essencial para os professores humanos fazerem durante conversas com alunos.

O recente artigo Qual Linguista Inventou a Lâmpada? Verificação de Pressuposição para Perguntas e Respostas descreve um esforço concertado para desenvolver um sistema novo para identificar pressuposições e considerar sua veracidade antes de continuar a troca

O novo algoritmo efetivamente pré-processa perguntas antes de retornar à conversa, quebrando a ‘autenticação’ da pergunta em um processo de três partes.

Não computa! À esquerda, o 'bloqueio' que ocorre mesmo quando um sistema de NLP avançado é capaz de identificar que a pergunta não faz sentido. À direita, uma quebra de um algoritmo proposto que tenta retificar o erro de origem. Fonte: https://arxiv.org/pdf/2101.00391.pdf

Não computa! À esquerda, o ‘bloqueio’ que ocorre mesmo quando um sistema de NLP avançado é capaz de identificar que a pergunta não faz sentido. À direita, uma quebra de um algoritmo proposto que tenta retificar o erro de origem. Fonte: https://arxiv.org/pdf/2101.00391.pdf

Embora pareça uma rotina de verificação simples que deveria ter sido incorporada nos sistemas de conhecimento desde o início, a maioria dos treinamentos de NLP aprende informações com um nível indevido de confiança para os dados de origem, incluindo discurso (como notícias falsas) que podem ter sido publicados em canais anteriormente ‘confiáveis’.

Portanto, uma questão-chave é identificar por consenso uma fonte confiável de fatos em um clima em que a proliferação de informações incorretas ‘notícias’ por meio das mídias sociais concederia, por padrão, autoridade sob a lógica da generalização do aprendizado de máquina. Esta última tem tendido a usar a quantidade ou repetição de dados como um proxy para a precisão, pelo menos até que os fenômenos de notícias falsas se tornassem uma área crítica de interesse no campo nos últimos anos.

Determinando a Melhor Abordagem para Perguntas Inrespondíveis

Para determinar uma abordagem adequada para resolver uma pergunta que contém informações incorretas, os pesquisadores executaram 100 dessas perguntas em quatro diferentes modelos de Perguntas e Respostas e pediram a sujeitos humanos para escolher a melhor ou menos problemática solução que os modelos geraram.

Os quatro resultados arquitetônicos possíveis para a ‘má’ pergunta foram: ‘Inrespondível’ – onde um sistema de Perguntas e Respostas de livro fechado efetivamente fecha a investigação sem mais elaboração; ‘Explicação baseada em falha de pressuposição’ – onde o sistema falha em verificar a suposição incorreta, efetivamente uma resposta ‘inrespondível’, com uma explicação adicionada; ‘Explicação extrativa’ – onde o sistema recupera uma citação relacionada do Wikipedia e a anexa à frase introdutória ‘Esta pergunta é inrespondível porque…’; e ‘Reescrita de domínio aberto’ – onde um sistema competitivo busca fontes adicionais do Wikipedia.

Este exemplo de quatro possíveis respostas a uma pergunta aparentemente 'inrespondível' ilustra a complexidade de tentar uma solução competitiva baseada em domínio para o problema.

Este exemplo de quatro possíveis respostas a uma pergunta aparentemente ‘inrespondível’ ilustra a complexidade de tentar uma solução competitiva baseada em domínio para o problema.

Ao longo dos testes, os cinco participantes (recrutados em uma plataforma de crowdsourcing interna do Google) preferiram as respostas baseadas em pressuposição, o que levou os pesquisadores a desenvolver um novo quadro para decompor e verificar perguntas.

No novo sistema, gatilhos linguísticos são obtidos da pergunta por um gerador baseado em regras que deconstrói a sentença em afirmações de fato putativas. Se múltiplas suposições são derivadas da pergunta, cada uma é investigada e contribuirá para a resposta final se abordarem pressuposições erradas da pergunta original.

Conjuntos de Dados

As pressuposições geradas na etapa inicial foram manualmente emendadas para criar um conjunto de dados de verificação com pressuposições ‘ouro’. Qualquer pressuposição que emergiu do ramo da investigação, mas que não estava presente nas perguntas originais, foi removida.

Dois dos autores do artigo então anotaram manualmente 462 pressuposições em termos de sim/não verificabilidade, com base em uma página relevante do Wikipedia associada a cada pergunta. Casos de discordância foram resolvidos em discussão pós-fato antes de serem comprometidos com o conjunto de dados.

Os pesquisadores usaram zero-shot NLI, uma tarefa de classificação de premissa/hipótese que exigia a deconstrução de artigos do Wikipedia relacionados às perguntas. Como esse processo resulta em muitos mais pares do que a pergunta pode implicar ou o modelo suportar, os resultados filtrados foram então agregados e rotulados.

Resultados e Formulação de Respostas

Os resultados mais eficazes foram obtidos pela solução mais laboriosa: um híbrido de regra/NLI fino, gerado a partir de ALBERT QNLI com frases do Wikipedia e pressuposições.

O desempenho dos modelos de verificação, onde 'frases do Wikipedia' usa frases obtidas de artigos do Wikipedia relacionados às perguntas, e 'pressuposições do Wikipedia' são pressuposições geradas a partir dessas frases.

O desempenho dos modelos de verificação, onde ‘frases do Wikipedia’ usa frases obtidas de artigos do Wikipedia relacionados às perguntas, e ‘pressuposições do Wikipedia’ são pressuposições geradas a partir dessas frases.

Usando essa formulação, os pesquisadores desenvolveram um sistema de modelo onde um fato negador do Wikipedia era anexado a ‘Esta pergunta é inrespondível porque…’ e frases semelhantes. Embora não seja uma solução ideal, os autores sugerem que respostas baseadas em não verificabilidade são prováveis de reduzir a incidência de falsos negativos.

O sistema foi finalmente implementado em um modelo de Construção de Transformador Estendido (ETC).

Implicações

Dependendo de seu desempenho final no mundo real, pode-se argumentar que essa abordagem pode levar à mera substituição de ‘não verificável’ por ‘inrespondível’, nos casos em que o sistema de pesquisa de apoio não pode avaliar uma correção útil para a pressuposição errada da pergunta. Efetivamente, parece estar construindo a infraestrutura para futuros e melhores sistemas de verificação.

Os pesquisadores já admitem que o custo de solicitações de API baseadas em token é um fator limitante ao formular respostas mais longas que esse sistema gerará, e é de se supor que o overhead adicional de ‘pesquisa ao vivo’ em uma pergunta parece provável de adicionar latência, mesmo a sistemas de grande escala, como o GPT-3, desde que a responsividade de tais sistemas dependeu até agora da incorporação generalizada de conhecimento no momento do treinamento, em vez de rotinas de verificação extensivas baseadas em rede.

Além disso, os pesquisadores observam que o sistema atual tem limitações relacionadas à análise de aspectos semânticos do texto:

Por exemplo, quem pip acredita que é a mãe de Estela tem uma possessiva embutida em um verbo não fáctico acreditar, mas nosso gerador geraria ‘Estela tem ‘mãe.

No entanto, a equipe prevê novos e mais flexíveis sistemas de perguntas e respostas que serão desenvolvidos com base nessa pesquisa:

No futuro, planejamos construir sobre esse trabalho propondo sistemas de perguntas e respostas que sejam mais robustos e cooperativos. Por exemplo, diferentes tipos de falhas de pressuposição podem ser abordados por estratégias de resposta mais fluidas – por exemplo, a violação de pressuposições de unicidade pode ser melhor tratada fornecendo todas as respostas possíveis, em vez de afirmar que a pressuposição de unicidade foi violada.

Escritor sobre aprendizado de máquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]