Ângulo de Anderson
Modelos de NLP têm dificuldade em entender frases nominais recursivas
Pesquisadores dos EUA e da China descobriram que nenhum dos principais modelos de Processamento de Linguagem Natural (NLP) parece ser capaz, por padrão, de desvendar frases em inglês que apresentam frases nominais recursivas (NPs) e “lutam” para individuar o significado central em exemplos relacionados, como Meu filme favorito novo e Meu filme favorito (cada um com um significado diferente).

Em um exemplo de manchete do artigo, aqui está um pequeno quebra-cabeça que as crianças frequentemente não conseguem desvendar: a segunda bola é verde, mas a quinta bola é a ‘segunda bola verde’. Fonte: https://arxiv.org/pdf/2112.08326.pdf
Os pesquisadores estabeleceram um Desafio de Frase Nominal Recursiva (RNPC) para vários modelos de linguagem de código aberto instalados localmente: OpenAI’s GPT-3*, Google’s BERT, e Facebook’s RoBERTa e BART, descobrindo que esses modelos de ponta só alcançaram desempenho “aleatório”. Eles concluem†:
‘Os resultados mostram que os modelos de linguagem de ponta (SOTA) ajustados para benchmarks padrão do mesmo formato todos lutam em nosso conjunto de dados, sugerindo que o conhecimento alvo não está prontamente disponível.’

Exemplos de pares mínimos no desafio RNPC onde os modelos SOTA cometeram erros.
Nos exemplos acima, os modelos falharam, por exemplo, em distinguir a disparidade semântica entre um animal perigoso morto (ou seja, um predador que não oferece ameaça porque está morto) e um animal morto perigoso (como um esquilo morto, que pode conter um vírus prejudicial e é uma ameaça ativa).
(Além disso, embora o artigo não aborde isso, ‘morto’ também é frequentemente usado como um advérbio, que não se aplica a nenhum dos casos)
No entanto, os pesquisadores também descobriram que treinamento adicional ou suplementar que inclui material RNPC pode resolver a questão:
‘Modelos de linguagem pré-treinados com desempenho SOTA em benchmarks de NLU têm um domínio pobre desse conhecimento, mas ainda podem aprender quando expostos a pequenas quantidades de dados do RNPC.’
Os pesquisadores argumentam que a capacidade de um modelo de linguagem de navegar estruturas recursivas desse tipo é essencial para tarefas downstream, como análise de linguagem, tradução e fazem um caso especial para sua importância em rotinas de detecção de danos:
‘[Nós] consideramos o cenário em que um usuário interage com um agente orientado a tarefas, como Siri ou Alexa, e o agente precisa determinar se a atividade envolvida na consulta do usuário é potencialmente prejudicial [ou seja, para menores]. Escolhemos essa tarefa porque muitos falsos positivos vêm de frases nominais recursivas.
‘Por exemplo, como fazer uma bomba caseira é obviamente prejudicial, enquanto como fazer uma bomba de banho caseira é inofensiva.’
O artigo é intitulado ‘Meu filme favorito novo é meu filme favorito? Investigando a compreensão de frases nominais recursivas’ e vem de cinco pesquisadores da Universidade da Pensilvânia e um da Universidade de Pequim.
Dados e Método
Embora trabalhos anteriores tenham estudado a estrutura sintática de frases nominais recursivas e a categorização semântica de modificadores, nenhuma dessas abordagens é suficiente, de acordo com os pesquisadores, para abordar o desafio.
Portanto, com base no uso de frases nominais recursivas com dois modificadores, os pesquisadores buscaram estabelecer se o conhecimento pré-requisito existe em sistemas NLP de ponta (não existe); se pode ser ensinado a eles (pode); o que os sistemas NLP podem aprender com frases nominais recursivas; e de que maneiras esse conhecimento pode beneficiar aplicações downstream.
O conjunto de dados que os pesquisadores usaram foi criado em quatro etapas. Primeiro foi a construção de um léxico de modificadores contendo 689 exemplos extraídos de literatura anterior e trabalho novo.
Em seguida, os pesquisadores reuniram frases nominais recursivas da literatura, corpora existentes e acréscimos de sua própria invenção. Recursos textuais incluíram o Penn Treebank e o Annotated Gigaword corpus.
Então, a equipe contratou estudantes universitários pré-selecionados para criar exemplos para as três tarefas que os modelos de linguagem enfrentariam, validando-os posteriormente em 8.260 instâncias válidas.
Finalmente, mais estudantes universitários pré-selecionados foram contratados, desta vez via Amazon Mechanical Turk, para anotar cada instância como uma Tarefa de Inteligência Humana (HIT), decidindo disputas com base na maioria. Isso reduziu as instâncias para 4.567 exemplos, que foram posteriormente filtrados para 3.790 instâncias mais equilibradas.
Os pesquisadores adaptaram vários conjuntos de dados existentes para formular as três seções de suas hipóteses de teste, incluindo MNLI, SNLI, MPE e ADEPT, treinando todos os modelos SOTA por conta própria, com a exceção do modelo HuggingFace, onde um checkpoint foi usado.
Resultados
Os pesquisadores descobriram que todos os modelos “lutam” nas tarefas RNPC, versus uma pontuação de precisão confiável de 90%+ para humanos, com os modelos SOTA apresentando desempenho em níveis “aleatórios” (ou seja, sem evidência de habilidade inata versus chance aleatória em resposta).

Resultados dos testes dos pesquisadores. Aqui, os modelos de linguagem são testados contra sua precisão em um benchmark existente, com a linha central representando o desempenho humano equivalente nas tarefas.
Linhas secundárias de investigação indicam que essas deficiências podem ser compensadas na fase de treinamento ou ajuste fino da pipeline de um modelo NLP, incluindo especificamente conhecimento de frases nominais recursivas. Uma vez que esse treinamento suplementar foi realizado, os modelos alcançaram ‘forte desempenho zero-shot em tarefas de detecção de danos [extrínsecas]’.
Os pesquisadores prometem lançar o código para esse trabalho em https://github.com/veronica320/Recursive-NPs.
Publicado originalmente em 16 de dezembro de 2021 – 17 de dezembro de 2021, 6:55 da manhã GMT+2: Corrigido hiperlink quebrado.
* GPT-3 Ada, que é o mais rápido, mas não o melhor da série. No entanto, o modelo Davinci maior não está disponível para o ajuste fino que compõe a fase posterior dos experimentos dos pesquisadores.
† Minha conversão de citações inline para hiperlinks.












