Modelos e plataformas de IA
É Possível Construir Modelos de Linguagem Grande como o ChatGPT com Metade do Custo?
Modelos de Linguagem Grande (LLMs) como o GPT-3 e o ChatGPT revolucionaram a inteligência artificial ao oferecer capacidades de compreensão de linguagem natural e geração de conteúdo. No entanto, o desenvolvimento desses modelos vem com um alto preço, limitando a acessibilidade e a pesquisa adicional. Pesquisadores estimam que o treinamento do GPT-3 custou à OpenAI cerca de $5 milhões. Apesar disso, a Microsoft (MSFT ) reconheceu o potencial e investiu $1 bilhão em 2019 e $10 bilhões em 2023 na ventura do GPT-3 e do ChatGPT da OpenAI.
Os LLMs são modelos de aprendizado de máquina treinados em dados textuais extensivos para aplicações de processamento de linguagem natural. Eles são baseados na arquitetura de transformador e utilizam mecanismos de atenção para tarefas de processamento de linguagem natural, como resposta a perguntas, tradução de máquina, análise de sentimento, etc.
A pergunta surge: é possível aumentar a eficiência desses modelos grandes enquanto reduz o custo computacional e o tempo de treinamento?
Várias abordagens, como Redes Neurais Progressivas, Morfismo de Rede, paralelismo de modelo intra-camada, herança de conhecimento, etc., foram desenvolvidas para reduzir o custo computacional do treinamento de redes neurais. A nova abordagem LiGO (Operador de Crescimento Linear) que discutiremos está estabelecendo um novo padrão. Ela reduz o custo computacional do treinamento de LLMs em 50%.
Antes de discutir essa técnica, é essencial examinar os fatores que contribuem para o alto preço de criar LLMs.
Custo de Construir Modelos de Linguagem Grande
Três principais despesas para desenvolver LLMs são as seguintes:
1. Recursos Computacionais
Construir LLMs requer recursos computacionais massivos para treinar em grandes conjuntos de dados. Eles devem processar bilhões de parâmetros e aprender padrões complexos a partir de dados textuais massivos.
Investimento em hardware especializado, como Unidades de Processamento Gráfico (GPUs) e Unidades de Processamento de Tensor (TPUs), é necessário para construir e treinar LLMs para alcançar o desempenho de ponta.
Por exemplo, o GPT-3 foi treinado em um supercomputador com 10.000 GPUs de nível empresarial (H100 e A100) e 285.000 núcleos de CPU.
2. Consumo de Energia
Os recursos computacionais intensivos necessários para construir LLMs resultam em um consumo significativo de energia. Por exemplo, o treinamento de 175 bilhões de parâmetros do GPT-3 levou 14,8 dias usando 10.000 GPUs V100, equivalente a 3,55 milhões de horas de GPU. Um nível tão alto de consumo de energia tem efeitos ambientais significativos.
3. Armazenamento e Gerenciamento de Dados
Os LLMs são treinados em grandes conjuntos de dados. Por exemplo, o GPT-3 foi treinado em um vasto corpus de dados textuais dados, incluindo Common Crawl, WebText2, Books1, Books2 e Wikipedia, entre outras fontes. Um investimento significativo em infraestrutura é necessário para coletar, curar e armazenar esses conjuntos de dados.
Além disso, armazenamento em nuvem é necessário para armazenamento de dados e expertise humana para pré-processamento de dados e controle de versão. Além disso, garantir que sua estratégia de dados esteja em conformidade com regulamentações como o GDPR também adiciona ao custo.
Técnica LiGO: Reduzir o Custo de Construir Modelos de Linguagem Grande para Metade
LiGO (Operador de Crescimento Linear) é uma técnica nova desenvolvida por pesquisadores do MIT para reduzir o custo computacional do treinamento de LLMs em 50%. O método envolve inicializar os pesos de modelos maiores a partir de modelos menores pré-treinados, permitindo a escalabilidade eficiente de redes neurais.

Imagem do artigo: Aprendendo a Crescer Modelos Pré-Treinados para Treinamento Eficiente de Transformadores
Yoon Kim, o autor sênior do artigo, diz:
“Estima-se que treinar modelos na escala do que o ChatGPT é hipotetizado para executar pode levar milhões de dólares apenas para uma única execução de treinamento. Podemos melhorar a eficiência desses métodos de treinamento, para que ainda possamos obter bons modelos em menos tempo e por menos dinheiro? Propomos fazer isso aproveitando modelos de linguagem menores que foram previamente treinados.”
Esse método mantém os benefícios de desempenho dos modelos maiores com custo computacional reduzido e tempo de treinamento em comparação com o treinamento de um modelo grande do zero. LiGO utiliza um operador de crescimento linear baseado em dados que combina operadores de profundidade e largura para desempenho ótimo.
O artigo utilizou vários conjuntos de dados para realizar experimentos baseados em texto, incluindo o corpus do Wikipedia em inglês para treinar modelos BERT e RoBERTa e o conjunto de dados C4 para treinar o modelo GPT2.
A experimentação com a técnica LiGO incluiu o crescimento do BERT-Pequeno para BERT-Base, BERT-Base para BERT-Grande, RoBERTa-Pequeno para RoBERTa-Base, GPT2-Base para GPT2-Médio e CaiT-XS para CaiT-S.
Os pesquisadores compararam sua abordagem com várias outras linhas de base, incluindo treinamento do zero, treinamento progressivo, bert2BERT e KI.
A técnica LiGO ofereceu 44,7% de economia em operações de ponto flutuante por segundo (FLOPs) e 40,7% de economia em tempo de parede em comparação com o treinamento do BERT-Base do zero, reutilizando o modelo BERT-Pequeno. O operador de crescimento LiGO supera o StackBERT, MSLT, bert2BERT e KI no treinamento eficiente.
Benefícios de Usar uma Técnica de Otimização de Treinamento como LiGO
LiGO é um método de treinamento de rede neural eficiente que tem vários benefícios listados a seguir:
1. Treinamento Mais Rápido
Como mencionado anteriormente, o treinamento mais rápido é a principal vantagem da técnica LiGO. Ela treina LLMs em metade do tempo, aumentando a produtividade e reduzindo os custos.
2. Eficiência de Recursos
LiGO é eficiente em termos de recursos, pois minimiza o tempo de parede e as operações de ponto flutuante por segundo (FLOPs), levando a uma abordagem mais custo-efetiva e ecológica para o treinamento de grandes modelos de transformador.
3. Generalização
A técnica LiGO melhorou o desempenho de transformadores de linguagem e visão, sugerindo que é uma técnica generalizável que pode ser aplicada a várias tarefas.
Construir produtos de IA comerciais é apenas um aspecto dos custos gerais associados a sistemas de IA. Outro componente significativo de custos vem das operações diárias. Por exemplo, custa à OpenAI cerca de $700.000 por dia para responder a consultas usando o ChatGPT. Pesquisadores devem continuar explorando abordagens que tornem os LLMs custo-efetivos durante o treinamento e mais acessíveis em tempo de execução.
Para mais conteúdo relacionado à IA, visite unite.ai.












