Ângulo de Anderson
Os Perigos de Usar Citações para Autenticar Conteúdo de Geração de Linguagem Natural

Opinião Modelos de Geração de Linguagem Natural, como o GPT-3, são propensos a ‘hallucinar’ material que apresentam no contexto de informações factuais. Em uma era que está extraordinariamente preocupada com o crescimento de notícias falsas baseadas em texto, essas ‘voo de fantasia’ representam um obstáculo existencial para o desenvolvimento de sistemas de escrita e resumo automatizados, e para o futuro do jornalismo impulsionado por IA, entre vários outros sub-setores de Processamento de Linguagem Natural (NLP).
O problema central é que os modelos de linguagem do estilo GPT derivam recursos e classes importantes de grandes corpora de textos de treinamento, e aprendem a usar esses recursos como blocos de construção da linguagem de forma ágil e autêntica, independentemente da precisão ou da aceitabilidade do conteúdo gerado.
Os sistemas de Geração de Linguagem Natural, portanto, atualmente dependem da verificação humana de fatos em uma de duas abordagens: ou os modelos são usados como geradores de texto-inicial que são imediatamente passados para os usuários humanos, seja para verificação ou alguma outra forma de edição ou adaptação; ou os humanos são usados como filtros caros para melhorar a qualidade dos conjuntos de dados destinados a informar modelos menos abstratos e ‘criativos’ (que, por si só, são inevitavelmente difíceis de confiar em termos de precisão factual, e que exigirão camadas adicionais de supervisão humana).
Notícias Velhas e Fatos Falsos
Modelos de Geração de Linguagem Natural (NLG) são capazes de produzir saídas convincentes e plausíveis porque aprenderam a arquitetura semântica, em vez de assimilar mais abstratamente a história real, a ciência, a economia ou qualquer outro tópico sobre o qual possam ser solicitados a opinar, que são efetivamente entrelaçados como ‘passageiros’ nos dados de origem.
A precisão factual das informações que os modelos de Geração de Linguagem Natural geram supõe que a entrada na qual são treinados é confiável e atualizada, o que apresenta uma carga extraordinária em termos de pré-processamento e verificação humana adicional – um obstáculo caro que o setor de pesquisa de NLP está atualmente abordando em muitas frentes.
Sistemas de escala GPT-3 exigem uma quantidade extraordinária de tempo e dinheiro para treinar, e, uma vez treinados, são difíceis de atualizar no que pode ser considerado o ‘nível do kernel’. Embora modificações locais baseadas em sessão e usuário possam aumentar a utilidade e a precisão dos modelos implementados, esses benefícios úteis são difíceis, às vezes impossíveis de serem repassados para o modelo central sem necessitar de treinamento completo ou parcial.
Por esse motivo, é difícil criar modelos de linguagem treinados que possam utilizar as informações mais recentes.

Treinado antes mesmo do advento da COVID, o text-davinci-002 – a iteração do GPT-3 considerada ‘mais capaz’ por seu criador OpenAI – pode processar 4000 tokens por solicitação, mas não sabe nada sobre a COVID-19 ou a invasão ucraniana de 2022 (essas prompts e respostas são de 5 de abril de 2022). Interessantemente, ‘desconhecido’ é, na verdade, uma resposta aceitável em ambos os casos de falha, mas prompts adicionais estabelecem facilmente que o GPT-3 é ignorante sobre esses eventos. Fonte: https://beta.openai.com/playground
Um modelo treinado só pode acessar ‘verdades’ que internalizou no momento do treinamento, e é difícil obter uma citação precisa e pertinente por padrão, quando se tenta fazer com que o modelo verifique suas alegações. O perigo real de obter citações do GPT-3 padrão (por exemplo) é que ele às vezes produz citações corretas, levando a uma falsa confiança nesse aspecto de suas capacidades:

Topo, três citações precisas obtidas pelo davinci-instruct-text GPT-3 de 2021. Centro, o GPT-3 falha em citar uma das citações mais famosas de Einstein (“Deus não joga dados com o universo”), apesar de um prompt não críptico. Fundo, o GPT-3 atribui uma citação escandalosa e fictícia a Albert Einstein, aparentemente um transbordo de perguntas anteriores sobre Winston Churchill na mesma sessão. Fonte: O artigo do autor de 2021 em https://www.width.ai/post/business-applications-for-gpt-3
GopherCite
Na tentativa de abordar essa falha geral nos modelos de Geração de Linguagem Natural, a DeepMind da Google propôs recentemente o GopherCite, um modelo de 280 bilhões de parâmetros capaz de citar evidências específicas e precisas em apoio às suas respostas geradas a prompts.



Três exemplos do GopherCite apoiando suas alegações com citações reais. Fonte: https://arxiv.org/pdf/2203.11147.pdf
O GopherCite aproveita o aprendizado de reforço a partir de preferências humanas (RLHP) para treinar modelos de consulta capazes de citar citações reais como evidência de apoio. As citações são extraídas ao vivo de várias fontes de documentos obtidas de mecanismos de busca ou de um documento específico fornecido pelo usuário.
O desempenho do GopherCite foi medido por meio da avaliação humana das respostas do modelo, que foram consideradas de ‘alta qualidade’ 80% do tempo no conjunto de dados NaturalQuestions da Google, e 67% do tempo no conjunto de dados ELI5.
Citando Falsidades
No entanto, quando testado contra o benchmark TruthfulQA da Universidade de Oxford, as respostas do GopherCite raramente foram pontuadas como verazes, em comparação com as respostas ‘corretas’ curadas por humanos.
Os autores sugerem que isso ocorre porque o conceito de ‘respostas apoiadas’ não define de forma objetiva a verdade em si, já que a utilidade das citações de fonte pode ser comprometida por outros fatores, como a possibilidade de que o autor da citação esteja ele mesmo ‘hallucinando’ (ou seja, escrevendo sobre mundos fictícios, produzindo conteúdo publicitário ou fantasticando material inautêntico).



Casos do GopherCite em que a plausibilidade não necessariamente se iguala à ‘verdade’.
Em essência, torna-se necessário distinguir entre ‘apoiado’ e ‘verdadeiro’ nesses casos. A cultura humana está atualmente muito à frente da aprendizagem de máquina no uso de metodologias e estruturas projetadas para obter definições objetivas de verdade, e mesmo lá, o estado nativo de ‘verdade importante’ parece ser contenção e negação marginal.
O problema é recursivo nas arquiteturas de Geração de Linguagem Natural que buscam mecanismos de ‘corroboração’ definitivos: o consenso humano é pressionado a servir como um padrão de verdade por meio de modelos de estilo AMT, onde os avaliadores humanos (e os outros humanos que medeiam disputas entre eles) são parciais e tendenciosos.
Por exemplo, os experimentos iniciais do GopherCite usam um modelo ‘super avaliador’ para escolher os melhores sujeitos humanos para avaliar a saída do modelo, selecionando apenas os avaliadores que pontuaram pelo menos 85% em comparação com um conjunto de garantia de qualidade. Finalmente, 113 super-avaliadores foram selecionados para a tarefa.
Argumenta-se que isso é um quadro perfeito de uma perseguição fractal inviável: o conjunto de garantia de qualidade usado para avaliar os avaliadores é, por si só, outra métrica de verdade ‘definida por humanos’, assim como o conjunto TruthfulQA da Oxford, contra o qual o GopherCite foi encontrado deficiente.
Em termos de conteúdo ‘apoiado’ e ‘autenticado’, tudo o que os sistemas de Geração de Linguagem Natural podem esperar sintetizar a partir do treinamento em dados humanos é a disparidade e diversidade humana, em si um problema mal definido e não resolvido. Temos uma tendência inata a citar fontes que apoiam nossos pontos de vista e a falar com autoridade e convicção em casos em que nossa informação de fonte pode estar desatualizada, completamente imprecisa ou de outra forma deliberadamente distorcida de várias maneiras; e uma disposição para difundir esses pontos de vista diretamente no mundo, em uma escala e eficácia inigualadas na história humana, diretamente no caminho dos quadros de raspagem de conhecimento que alimentam novos quadros de Geração de Linguagem Natural.
Portanto, o perigo envolvido no desenvolvimento de sistemas de Geração de Linguagem Natural suportados por citações parece estar ligado à natureza imprevisível do material de origem. Qualquer mecanismo (como citação direta e citações) que aumenta a confiança do usuário na saída de Geração de Linguagem Natural é, no estado atual da arte, adicionando perigosamente à autenticidade, mas não à veracidade da saída.
Tais técnicas são provavelmente úteis o suficiente quando a NLP finalmente recria os ‘caleidoscópios’ de escrita de ficção de Nineteen Eighty-Four de Orwell; mas representam uma perseguição perigosa para a análise de documentos objetivos, o jornalismo centrado em IA e outras possíveis aplicações ‘não fictícias’ de resumo de máquina e geração de texto espontânea ou guiada.
Publicado pela primeira vez em 5 de abril de 2022. Atualizado às 15h29min EET para corrigir o termo.













