Ângulo de Anderson

Criação de um Modelo de Linguagem de Estilo GPT para uma Única Pergunta

mm
Adicione Unite.AI às suas fontes preferidas no Google

Pesquisadores da China desenvolveram um método econômico para criar sistemas de Processamento de Linguagem Natural (NLP) de estilo GPT-3, evitando o custo cada vez mais proibitivo de tempo e dinheiro envolvido no treinamento de grandes conjuntos de dados – uma tendência em crescimento que, de outra forma, ameaça relegar esse setor de IA a jogadores como FAANG e investidores de alto nível.

O quadro proposto é chamado de Modelagem de Linguagem Orientada por Tarefa (TLM). Em vez de treinar um modelo enorme e complexo em um vasto corpus de bilhões de palavras e milhares de rótulos e classes, a TLM treina um modelo muito menor que incorpora uma consulta diretamente dentro do modelo.

À esquerda, uma abordagem típica de hipercala para modelos de linguagem de grande volume; à direita, o método slimline da TLM para explorar um grande corpus de linguagem por tópico ou por pergunta. Fonte: https://arxiv.org/pdf/2111.04130.pdf

À esquerda, uma abordagem típica de hipercala para modelos de linguagem de grande volume; à direita, o método slimline da TLM para explorar um grande corpus de linguagem por tópico ou por pergunta. Fonte: https://arxiv.org/pdf/2111.04130.pdf

Em essência, um algoritmo ou modelo de NLP único é produzido para responder a uma única pergunta, em vez de criar um modelo de linguagem geral enorme e desajeitado que possa responder a uma variedade mais ampla de perguntas.

Em testes da TLM, os pesquisadores descobriram que a nova abordagem alcança resultados semelhantes ou melhores do que os Modelos de Linguagem Pré-treinados, como RoBERTa-Large, e sistemas de NLP de hipercala, como o GPT-3 da OpenAI, o Modelo de Switch Transformer de Trilhão de Parâmetros da Google, o HyperClover da Coreia, o Jurassic 1 da AI21 Labs e o Megatron-Turing NLG 530B da Microsoft.

Nos testes da TLM em oito conjuntos de dados de classificação em quatro domínios, os autores também descobriram que o sistema reduz as operações de ponto flutuante por segundo (FLOPs) necessárias para o treinamento em duas ordens de magnitude. Os pesquisadores esperam que a TLM possa “democratizar” um setor que está se tornando cada vez mais elitizado, com modelos de NLP tão grandes que não podem ser instalados localmente e, em vez disso, ficam atrás das APIs caras e de acesso limitado da OpenAI e, agora, da Microsoft Azure.

Os autores afirmam que a redução do tempo de treinamento em duas ordens de magnitude reduz o custo de treinamento de 1.000 GPUs por um dia para apenas 8 GPUs em 48 horas.

O novo relatório é intitulado NLP Do Zero Sem Pré-treinamento em Grande Escala: Um Quadro Simples e Eficiente e vem de três pesquisadores da Universidade Tsinghua, em Pequim, e um pesquisador da empresa de desenvolvimento de IA Recurrent AI, Inc.

Respostas Inacessíveis

O custo de treinar modelos de linguagem eficazes e de propósito geral está se tornando cada vez mais caracterizado como um potencial “limite térmico” para a extensão com que o NLP performático e preciso pode realmente se difundir na cultura.

Estatísticas sobre o crescimento de facetas em arquiteturas de modelos de NLP, de um relatório de 2020 da A121 Labs. Fonte: https://arxiv.org/pdf/2004.08900.pdf

Estatísticas sobre o crescimento de facetas em arquiteturas de modelos de NLP, de um relatório de 2020 da A121 Labs. Fonte: https://arxiv.org/pdf/2004.08900.pdf

Em 2019, um pesquisador calculou que o custo para treinar o modelo XLNet (relatado na época como superior ao BERT em tarefas de NLP) em 2,5 dias em 512 núcleos em 64 dispositivos era de $61.440 USD, enquanto o GPT-3 é estimado ter custado $12 milhões para treinar – 200 vezes o custo de treinar seu antecessor, o GPT-2 (embora reestimativas recentes afirmem que ele poderia ser treinado agora por apenas $4.600.000 nos GPUs de nuvem de menor preço).

Subconjuntos de Dados com Base em Necessidades de Consulta

Em vez disso, a nova arquitetura proposta busca derivar classificações precisas, rótulos e generalização usando uma consulta como um tipo de filtro para definir um subconjunto de informações de um grande banco de dados de linguagem que será treinado, juntamente com a consulta, para fornecer respostas sobre um tópico limitado.

Os autores afirmam:

‘A TLM é motivada por duas ideias principais. Primeiro, os humanos dominam uma tarefa usando apenas uma pequena parte do conhecimento do mundo (por exemplo, os estudantes só precisam revisar alguns capítulos, entre todos os livros do mundo, para se preparar para um exame).

‘Nós hipotetizamos que há muita redundância no grande corpus para uma tarefa específica. Em segundo lugar, o treinamento em dados rotulados supervisionados é muito mais eficiente em termos de desempenho downstream do que a otimização do objetivo de modelagem de linguagem em dados não rotulados. Com base nesses motivos, a TLM usa os dados da tarefa como consultas para recuperar um subconjunto minúsculo do corpus geral. Isso é seguido pela otimização conjunta de um objetivo de tarefa supervisionada e um objetivo de modelagem de linguagem usando os dados recuperados e os dados da tarefa.’

Além de tornar o treinamento de modelos de NLP eficazes acessível, os autores veem uma série de vantagens no uso de modelos de NLP orientados por tarefas. Por exemplo, os pesquisadores podem desfrutar de maior flexibilidade, com estratégias personalizadas para comprimento de sequência, tokenização, ajuste de hiperparâmetros e representações de dados.

Os pesquisadores também preveem o desenvolvimento de sistemas híbridos futuros que trocam o pré-treinamento limitado de um PLM (que não é previsto na implementação atual) por maior versatilidade e generalização contra tempos de treinamento. Eles consideram o sistema um passo à frente para o avanço dos métodos de generalização zero-shot em domínio.

Testes e Resultados

A TLM foi testada em desafios de classificação em oito tarefas em quatro domínios – ciência biomédica, notícias, revisões e ciência da computação. As tarefas foram divididas em categorias de alto recurso e baixo recurso. As tarefas de alto recurso incluíam mais de 5.000 dados de tarefa, como AGNews e RCT, entre outros; as tarefas de baixo recurso incluíam ChemProt e ACL-ARC, bem como o conjunto de dados de detecção de notícias hiperpartidárias HyperPartisan.

Os pesquisadores desenvolveram dois conjuntos de treinamento intitulados Corpus-BERT e Corpus-RoBERTa, sendo o último dez vezes o tamanho do primeiro. Os experimentos compararam os Modelos de Linguagem Pré-treinados gerais BERT (da Google) e RoBERTA (da Facebook ) à nova arquitetura.

O artigo observa que, embora a TLM seja um método geral, e deva ser mais limitada em escopo e aplicabilidade do que os modelos de estado da arte mais amplos e de maior volume, ela é capaz de realizar tarefas próximas àqueles métodos de ajuste fino de domínio.

Resultados da comparação do desempenho da TLM contra conjuntos baseados em BERT e RoBERTa. Os resultados listam uma pontuação F1 média em três escalas de treinamento diferentes e listam o número de parâmetros, computação total de treinamento (FLOPs) e tamanho do corpus de treinamento.

Resultados da comparação do desempenho da TLM contra conjuntos baseados em BERT e RoBERTa. Os resultados listam uma pontuação F1 média em três escalas de treinamento diferentes e listam o número de parâmetros, computação total de treinamento (FLOPs) e tamanho do corpus de treinamento.

Os autores concluem que a TLM é capaz de alcançar resultados comparáveis ou melhores do que os PLMs, com uma redução substancial nas FLOPs necessárias, e requer apenas 1/16 do tamanho do corpus de treinamento. Em escalas médias e grandes, a TLM aparentemente pode melhorar o desempenho em 0,59 e 0,24 pontos em média, enquanto reduz o tamanho dos dados de treinamento em duas ordens de magnitude.

‘Esses resultados confirmam que a TLM é altamente precisa e muito mais eficiente do que os PLMs. Além disso, a TLM ganha mais vantagens em eficiência em uma escala maior. Isso indica que os PLMs de maior escala podem ter sido treinados para armazenar mais conhecimento geral que não é útil para uma tarefa específica.’

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai