Modelos e plataformas de IA

MPT-30B: MosaicML Supera o GPT-3 Com um Novo LLM para Empurrar os Limites do NLP

mm
Adicione Unite.AI às suas fontes preferidas no Google

MosaicML é uma empresa de IA gerativa que fornece soluções de implantação e escalabilidade de IA. Seu último modelo de linguagem grande (LLM) MPT-30B está fazendo ondas na comunidade de IA.

A jornada de LLM da MosaicML começou com o lançamento de MPT-7B (Mosaic Pretrained Transformer) em maio de 2023, que veio com três variantes:

  1. MPT-7B-StoryWriter-65k+ (para geração de histórias de longo prazo)
  2. MPT-7B-Instruct (para seguir instruções de curto prazo)
  3. MPT-7B-Chat (para geração de diálogos)

Os modelos testemunharam um sucesso maciço na comunidade de ML devido à sua natureza de código aberto, usabilidade comercial e capacidade excepcional de lidar com janelas de contexto estendidas.

Mais importante ainda, o modelo estava no mesmo nível e, em alguns casos, superou os outros modelos comparáveis (LLaMA-7B, StableLM 7B, etc.). Em junho, a série MPT-7B havia sido baixada mais de 3 milhões de vezes. Em 22 de junho, a MosaicML lançou MPT-30B, que elevou a barra ainda mais para os modelos de fundação de código aberto.

O MPT-30B: Um LLM Poderoso que Supera o GPT-3

MPT-30B é um LLM de código aberto e licenciado comercialmente baseado em decodificador que é mais poderoso do que o GPT-3-175B com apenas 17% dos parâmetros do GPT-3, ou seja, 30B. Ele supera o GPT-3 em várias tarefas. Aqui está uma comparação entre MPT-30B e GPT-3.

O MPT-30B se baseia no modelo MPT-7B anterior. Ele é computacionalmente eficiente para treinar em comparação com modelos de tamanhos semelhantes. Por exemplo, o LLaMA-30B usou aproximadamente 1,44 vezes mais orçamento de FLOPs do que o MPT-30B, enquanto o Falcon-40B teve um orçamento de FLOPs 1,27 vezes maior do que o MPT-30B. Aqui está uma ilustração da melhoria do MPT-30B em várias tarefas sobre seu predecessor.

Algumas características especiais do MPT-30B são as seguintes:

Janela de Contexto de 8k Tokens

A janela de contexto em LLMs se refere ao alcance de tokens que o modelo pode considerar antes de gerar a saída. O MPT-30B tinha uma janela de contexto de 8000 tokens no momento do treinamento. Ele foi treinado primeiro em 1T token usando sequências de 2k tokens e, em seguida, em 50B tokens de sequências de 8k tokens (aproximadamente 6000 palavras).

Suporte ALiBi

Para explicar essa característica, considere uma pergunta:

Como o MPT-30B pode entender e fazer previsões para sequências mais longas do que as que foram treinadas?

O MPT-30B usa uma técnica de Atenção com Vieses Lineares (ALiBi) para entender sequências mais longas e estender a janela de contexto além de 8k tokens durante o ajuste fino ou inferência.

Em vez de calcular embeddings posicionais, nos quais atribuímos um vetor a cada palavra na sequência, o ALiBi calcula pontuações de atenção entre tokens de chave e consulta. Quando os tokens de chave e consulta estão próximos, a penalidade é baixa, mas maior caso contrário. Como resultado, a arquitetura de transformador subjacente pode extrapolar para entradas de longo prazo.

Infência e Treinamento Eficientes via FlashAttention

A atenção, ou seja, focar nas partes relevantes da sequência de entrada, é um componente crítico dos transformadores, mas pode ser lento e intensivo em memória, especialmente ao processar sequências de texto longas.

O FlashAttention é uma abordagem proposta por pesquisadores da Universidade de Cornell que aborda esse problema para o MPT-30B. Usando uma técnica chamada tiling, o FlashAttention reduz o número de vezes que o modelo precisa ler ou gravar na memória, acelerando o processamento. Portanto, o modelo emprega a técnica de ponta FlashAttention e a biblioteca de otimização FasterTransformer da NVIDIA (NVDA ) para treinamento e inferência eficientes.

Facilidade de Treinamento e Implantação

Os desenvolvedores podem treinar o MPT-30B do zero ou usar os checkpoints da MosaicML para implantações mais rápidas. Além disso, ele pode ser ajustado para casos de uso específicos de domínio em um conjunto de dados específico.

O tamanho do modelo foi escolhido para permitir uma implantação sem esforço em uma única GPU, especificamente 1xA100-80GB em precisão de 16 bits ou 1xA100-40GB em precisão de 8 bits. Isso significa que o modelo foi projetado para caber dentro das limitações de memória dessas GPUs.

Capacidades de Codificação

O MPT-30B fornece capacidades de codificação excepcionais também. O HumanEval é um conjunto de dados lançado pela OpenAI que contém 164 problemas de programação feitos à mão. No conjunto de dados HumanEval, o modelo supera modelos de LLM construídos com propósito, como a série StarCoder.

Variants Ajustados: MPT-30B-Instruct e MPT-30B-Chat

MPT-30B-Instruct

Os LLMs são usados principalmente para instruções, como responder a perguntas, resumir textos, traduzir idiomas, etc. O MPT-30B-Instruct é uma variante comercialmente usável (mantém a licença CC-By-SA-3.0) do MPT-30B ajustado especificamente para tarefas de seguir instruções. Para o ajuste, os seguintes conjuntos de dados foram usados:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

O conjunto de dados Dolly foi ainda aumentado com o conjunto de dados Helpful and Harmless da Anthropic para ajuste de instruções. Além disso, uma gama diversa de conjuntos de dados foi usada para aumento de dados, que são os seguintes:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

O MPT-30B-Chat é uma versão ajustada do MPT-30B para geração de diálogos. Ele é um artefato de pesquisa lançado sob a licença CC-By-NC-SA-4.0, permitindo apenas uso não comercial. O modelo foi ajustado usando vários conjuntos de dados de linguagem, incluindo:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

Os LLMs compartilham uma grande parcela do mercado de IA gerativa de vários bilhões de dólares, que experimentou um crescimento tremendo em pouco tempo após o ChatGPT revolucionar o cenário no ano passado. A família MPT é uma parte fundamental dessa revolução. No futuro próximo, podemos esperar ver modelos de código aberto comercialmente disponíveis que sejam muito mais poderosos e eficientes do que a família MPT.

Para as últimas notícias de IA, visite unite.ai.

Haziqa é uma Cientista de Dados com ampla experiência em escrever conteúdo técnico para empresas de IA e SaaS.