Modelos e plataformas de IA

O Modelo MoE 8x7B Mais Recente da Mistral AI

mm
Adicione Unite.AI às suas fontes preferidas no Google

Mistral AI

que é uma startup de modelo de código aberto com sede em Paris, desafiou as normas ao lançar seu mais recente modelo de linguagem grande (LLM), MoE 8x7B, por meio de um simples link de torrent. Isso contrasta com a abordagem tradicional do Google com o lançamento do Gemini, gerando conversas e entusiasmo na comunidade de IA.

A abordagem da Mistral AI para lançamentos sempre foi não convencional. Muitas vezes, dispensando os accompanamentos usuais de artigos, blogs ou releases de imprensa, sua estratégia tem sido singularmente eficaz em capturar a atenção da comunidade de IA.

Recentemente, a empresa alcançou uma valorização notável de $2 bilhões após uma rodada de financiamento liderada pela Andreessen Horowitz. Essa rodada de financiamento foi histórica, estabelecendo um recorde com uma rodada de sementes de $118 milhões, a maior da história europeia. Além dos sucessos de financiamento, a Mistral AI está ativamente envolvida em discussões em torno do Ato de IA da UE, defendendo uma regulação reduzida na IA de código aberto.

Por Que o MoE 8x7B Está Atraindo Atenção

Descrito como um “GPT-4 reduzido”, o Mixtral 8x7B utiliza uma estrutura de Mixture of Experts (MoE) com oito especialistas. Cada especialista tem 111B parâmetros, acoplados com 55B parâmetros de atenção compartilhados, para dar um total de 166B parâmetros por modelo. Essa escolha de design é significativa, pois permite que apenas dois especialistas estejam envolvidos na inferência de cada token, destacando uma mudança em direção a um processamento de IA mais eficiente e focado.

Um dos principais destaques do Mixtral é sua capacidade de gerenciar um contexto extenso de 32.000 tokens, fornecendo um amplo escopo para lidar com tarefas complexas. As capacidades multilíngues do modelo incluem suporte robusto para inglês, francês, italiano, alemão e espanhol, atendendo a uma comunidade de desenvolvedores globais.

O pré-treinamento do Mixtral envolve dados provenientes da Web aberta, com uma abordagem de treinamento simultâneo para especialistas e roteadores. Esse método garante que o modelo não seja apenas vasto em seu espaço de parâmetros, mas também finamente ajustado às nuances dos vastos dados aos quais foi exposto.

Mixtral 8x7B alcança uma pontuação impressionante

Mixtral 8x7B alcança uma pontuação impressionante

Mixtral 8x7B supera o LLaMA 2 70B e rivaliza com o GPT-3.5, especialmente notável na tarefa MBPP com uma taxa de sucesso de 60,7%, significativamente maior do que seus congêneres. Mesmo na rigorosa tarefa MT-Bench, projetada para modelos de seguimento de instruções, o Mixtral 8x7B alcança uma pontuação impressionante, quase igualando o GPT-3.5

Entendendo a Estrutura de Mixture of Experts (MoE)

O modelo Mixture of Experts (MoE), embora tenha ganhado atenção recente devido à sua incorporação em modelos de linguagem de ponta como o MoE 8x7B da Mistral AI, tem raízes em conceitos fundamentais que remontam a vários anos. Vamos revisitar as origens dessa ideia por meio de artigos de pesquisa seminais.

O Conceito de MoE

Mixture of Experts (MoE) representa uma mudança de paradigma na arquitetura de redes neurais. Ao contrário dos modelos tradicionais que usam uma rede homogênea para processar todos os tipos de dados, o MoE adota uma abordagem mais especializada e modular. Ele consiste em várias redes “especialistas”, cada uma projetada para lidar com tipos específicos de dados ou tarefas, supervisionadas por uma rede “gating” que direciona dinamicamente os dados de entrada para o especialista mais apropriado.

Uma camada de Mixture of Experts (MoE) incorporada em um modelo de linguagem recorrente

Uma camada de Mixture of Experts (MoE) incorporada em um modelo de linguagem recorrente (Fonte)

 

A imagem acima apresenta uma visão geral de uma camada de MoE incorporada em um modelo de linguagem. Em sua essência, a camada de MoE compreende várias sub-redes feed-forward, denominadas “especialistas”, cada uma com o potencial de se especializar no processamento de diferentes aspectos dos dados. Uma rede “gating” determina qual combinação desses especialistas é engajada para uma entrada dada. Essa ativação condicional permite que a rede aumente significativamente sua capacidade sem um aumento correspondente na demanda computacional.

Funcionalidade da Camada de MoE

Na prática, a rede “gating” avalia a entrada (denotada como G(x) no diagrama) e seleciona um conjunto esparsamente populado de especialistas para processá-la. Essa seleção é modulada pelas saídas da rede “gating”, determinando efetivamente a “votação” ou contribuição de cada especialista para a saída final. Por exemplo, como mostrado no diagrama, apenas dois especialistas podem ser escolhidos para calcular a saída para cada token de entrada específico, tornando o processo eficiente ao concentrar recursos computacionais onde são mais necessários.

 

Encoder de Transformer com Camadas de MoE (Fonte)

A segunda ilustração acima contrasta um encoder de Transformer tradicional com um encoder de Transformer aumentado com uma camada de MoE. A arquitetura de Transformer, amplamente conhecida por sua eficácia em tarefas relacionadas à linguagem, tradicionalmente consiste em camadas de auto-atenção e feed-forward empilhadas em sequência. A introdução de camadas de MoE substitui algumas dessas camadas feed-forward, permitindo que o modelo seja escalado em termos de capacidade de forma mais eficaz.

No modelo aumentado, as camadas de MoE são distribuídas em vários dispositivos, mostrando uma abordagem de paralelismo de modelo. Isso é crítico ao escalar para modelos muito grandes, pois permite a distribuição da carga computacional e dos requisitos de memória em um cluster de dispositivos, como GPUs ou TPUs. Essa distribuição é essencial para treinar e implantar modelos com bilhões de parâmetros de forma eficiente, como evidenciado pelo treinamento de modelos com centenas de bilhões a mais de um trilhão de parâmetros em clusters de computação de grande escala.

A Abordagem de MoE Esparsa com Ajuste de Instrução em LLM

O artigo intitulado “Mixture of Experts (MoE) Esparsa para Modelagem de Linguagem Escalável” discute uma abordagem inovadora para melhorar os Modelos de Linguagem Grande (LLM) integrando a arquitetura de Mixture of Experts com técnicas de ajuste de instrução.

Ele destaca um desafio comum em que os modelos de MoE subperformam em comparação com modelos densos de capacidade computacional igual quando ajustados para tarefas específicas devido a discrepâncias entre o pré-treinamento geral e o ajuste fino específico da tarefa.

O ajuste de instrução é uma metodologia de treinamento em que os modelos são refinados para seguir melhor as instruções de linguagem natural, efetivamente melhorando seu desempenho em tarefas. O artigo sugere que os modelos de MoE exibem uma melhoria notável quando combinados com ajuste de instrução, mais do que seus congêneres densos. Essa técnica alinha as representações pré-treinadas do modelo para seguir instruções de forma mais eficaz, levando a aumentos significativos de desempenho.

Os pesquisadores conduziram estudos em três configurações experimentais, revelando que os modelos de MoE inicialmente subperformam no ajuste fino específico da tarefa. No entanto, quando o ajuste de instrução é aplicado, os modelos de MoE se destacam, particularmente quando suplementados com ajuste fino específico da tarefa. Isso sugere que o ajuste de instrução é um passo vital para que os modelos de MoE superem os modelos densos em tarefas downstream.

O efeito do ajuste de instrução no MOE

O efeito do ajuste de instrução no MOE

Ele também apresenta o FLAN-MOE32B, um modelo que demonstra a aplicação bem-sucedida desses conceitos. Notavelmente, ele supera o FLAN-PALM62B, um modelo denso, em tarefas de benchmark, enquanto usa apenas um terço dos recursos computacionais. Isso mostra o potencial para que os modelos de MoE esparsos combinados com ajuste de instrução estabeleçam novos padrões para a eficiência e desempenho dos LLM.

Implementando Mixture of Experts em Cenários do Mundo Real

A versatilidade dos modelos de MoE os torna ideais para uma variedade de aplicações:

  • Processamento de Linguagem Natural (NLP): Os modelos de MoE podem lidar com as nuances e complexidades da linguagem humana de forma mais eficaz, tornando-os ideais para tarefas avançadas de NLP.
  • Processamento de Imagens e Vídeos: Em tarefas que exigem processamento de alta resolução, o MoE pode gerenciar diferentes aspectos de imagens ou frames de vídeo, melhorando tanto a qualidade quanto a velocidade de processamento.
  • Soluções de IA Personalizadas: Empresas e pesquisadores podem adaptar os modelos de MoE para tarefas específicas, levando a soluções de IA mais direcionadas e eficazes.

Desafios e Considerações

Embora os modelos de MoE ofereçam numerous benefícios, eles também apresentam desafios únicos:

  • Complexidade no Treinamento e Ajuste: A natureza distribuída dos modelos de MoE pode complicar o processo de treinamento, exigindo um equilíbrio e ajuste cuidadosos dos especialistas e da rede “gating”.
  • Gerenciamento de Recursos: Gerenciar eficientemente os recursos computacionais em vários especialistas é crucial para maximizar os benefícios dos modelos de MoE.

Incorporar camadas de MoE em redes neurais, especialmente no domínio de modelos de linguagem, oferece um caminho para escalar modelos para tamanhos anteriormente inatingíveis devido a restrições computacionais. O cálculo condicional habilitado pelas camadas de MoE permite uma distribuição mais eficiente de recursos computacionais, tornando possível treinar modelos maiores e mais capazes. À medida que continuamos a exigir mais de nossos sistemas de IA, arquiteturas como a do Transformer equipado com MoE provavelmente se tornarão o padrão para lidar com tarefas complexas e em grande escala em vários domínios.

Eu passei os últimos cinco anos me imergindo no fascinante mundo de Aprendizado de Máquina e Aprendizado Profundo. Minha paixão e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua também me levou em direção ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.