Modelos e plataformas de IA
Mistral AI: Estabelecendo Novos PadrÃĩes AlÃĐm do Llama2 no Espaço de CÃģdigo Aberto
Os Modelos de Linguagem Grande (LLMs) recentemente ocuparam o centro das atençÃĩes, graças a destacados desempenhos como o ChatGPT. Quando a Meta introduziu seus modelos Llama, isso despertou um renovado interesse em LLMs de cÃģdigo aberto. O objetivo? Criar LLMs de cÃģdigo aberto acessÃveis e eficientes que sejam tÃĢo bons quanto os modelos de nÃvel superior, como o GPT-4, mas sem a alta taxa ou complexidade.
Essa combinaçÃĢo de acessibilidade e eficiÊncia nÃĢo apenas abriu novas oportunidades para pesquisadores e desenvolvedores, mas tambÃĐm estabeleceu o palco para uma nova era de avanços tecnolÃģgicos no processamento de linguagem natural.
Recentemente, startups de IA gerativa tÊm sido bem-sucedidas em financiamento. Juntas, arrecadaram $20 milhÃĩes, visando moldar a IA de cÃģdigo aberto. A Anthropic tambÃĐm arrecadou uma impressionante $450 milhÃĩes, e a Cohere, em parceria com a Google Cloud, garantiu $270 milhÃĩes em junho deste ano.
IntroduçÃĢo ao Mistral 7B: Tamanho e Disponibilidade
A Mistral AI, sediada em Paris e co-fundada por ex-funcionÃĄrios do Googleâs DeepMind e Meta, anunciou seu primeiro modelo de linguagem grande: Mistral 7B. Esse modelo pode ser facilmente baixado por qualquer pessoa no GitHub e atÃĐ mesmo por meio de um torrent de 13,4 gigabytes.
Essa startup conseguiu garantir um financiamento de semente recorde mesmo antes de ter um produto lançado. O primeiro modelo da Mistral AI, com 7 bilhÃĩes de parÃĒmetros, supera o desempenho do Llama 2 13B em todos os testes e supera o Llama 1 34B em muitas mÃĐtricas.
Em comparaçÃĢo com outros modelos, como o Llama 2, o Mistral 7B fornece capacidades semelhantes ou melhores, mas com menos sobrecarga computacional. Embora os modelos fundamentais, como o GPT-4, possam alcançar mais, eles vÊm com um custo mais alto e nÃĢo sÃĢo tÃĢo amigÃĄveis ao usuÃĄrio, pois sÃĢo principalmente acessÃveis por meio de APIs.
Quando se trata de tarefas de codificaçÃĢo, o Mistral 7B dÃĄ ao CodeLlama 7B uma corrida pelo dinheiro. AlÃĐm disso, ÃĐ compacto o suficiente, com 13,4 GB, para rodar em mÃĄquinas padrÃĢo.
AlÃĐm disso, o Mistral 7B Instruct, ajustado especificamente para conjuntos de dados instrutivos no Hugging Face, mostrou um grande desempenho. Ele supera outros modelos de 7B no MT-Bench e fica de igual para igual com modelos de chat de 13B.

Hugging Face Mistral 7B Exemplo
AvaliaçÃĢo de Desempenho
Em uma anÃĄlise detalhada de desempenho, o Mistral 7B foi medido contra os modelos da famÃlia Llama 2. Os resultados foram claros: o Mistral 7B superou significativamente o Llama 2 13B em todos os benchmarks. Na verdade, ele igualou o desempenho do Llama 34B, especialmente se destacando em benchmarks de codificaçÃĢo e raciocÃnio.
Os benchmarks foram organizados em vÃĄrias categorias, como RaciocÃnio Comum, Conhecimento Mundial, CompreensÃĢo de Leitura, MatemÃĄtica e CÃģdigo, entre outros. Uma observaçÃĢo particularmente notÃĄvel foi a mÃĐtrica de custo-desempenho do Mistral 7B, denominada âtamanhos de modelo equivalentesâ. Em ÃĄreas como raciocÃnio e compreensÃĢo, o Mistral 7B demonstrou um desempenho semelhante a um modelo Llama 2 trÊs vezes maior, indicando potenciais economias de memÃģria e um aumento na taxa de transferÊncia. No entanto, em benchmarks de conhecimento, o Mistral 7B se alinhou estreitamente com o Llama 2 13B, o que provavelmente ÃĐ atribuÃdo à s limitaçÃĩes de parÃĒmetros que afetam a compressÃĢo de conhecimento.
O que realmente torna o modelo Mistral 7B melhor do que a maioria dos outros Modelos de Linguagem?
Mecanismos de AtençÃĢo Simplificados
Embora as sutilezas dos mecanismos de atençÃĢo sejam tÃĐcnicas, sua ideia fundamental ÃĐ relativamente simples. Imagine ler um livro e destacar frases importantes; isso ÃĐ anÃĄlogo à forma como os mecanismos de atençÃĢo âdestacamâ ou dÃĢo importÃĒncia a pontos de dados especÃficos em uma sequÊncia.
No contexto dos modelos de linguagem, esses mecanismos permitem que o modelo se concentre nas partes mais relevantes dos dados de entrada, garantindo que a saÃda seja coerente e precisamente contextual.
Nos transformadores padrÃĢo, as pontuaçÃĩes de atençÃĢo sÃĢo calculadas com a fÃģrmula:
A fÃģrmula para essas pontuaçÃĩes envolve um passo crucial â a multiplicaçÃĢo de matrizes de Q e K. O desafio aqui ÃĐ que, à medida que o comprimento da sequÊncia cresce, ambas as matrizes se expandem de acordo, levando a um processo computacionalmente intensivo. Essa preocupaçÃĢo com escalabilidade ÃĐ uma das principais razÃĩes pelas quais os transformadores padrÃĢo podem ser lentos, especialmente ao lidar com sequÊncias longas.

A atençÃĢo multi-consulta (MQA) acelera as coisas usando um conjunto de âcabeças de chave-valorâ, mas à s vezes sacrifica a qualidade. Agora, vocÊ pode se perguntar, por que nÃĢo combinar a velocidade da MQA com a qualidade da atençÃĢo multi-cabeça? à aà que entra a atençÃĢo de consulta agrupada (GQA).
AtençÃĢo de Consulta Agrupada (GQA)
A GQA ÃĐ uma soluçÃĢo intermediÃĄria. Em vez de usar apenas uma ou mÚltiplas âcabeças de chave-valorâ, ela as agrupa. Dessa forma, a GQA alcança um desempenho prÃģximo à atençÃĢo multi-cabeça detalhada, mas com a velocidade da MQA. Para modelos como o Mistral, isso significa desempenho eficiente sem comprometer muito a qualidade.
AtençÃĢo de Janela Deslizante (SWA)
O mÃĐtodo da janela deslizante ÃĐ outro mÃĐtodo usado no processamento de sequÊncias de atençÃĢo. Esse mÃĐtodo usa uma janela de atençÃĢo de tamanho fixo ao redor de cada token na sequÊncia. Com mÚltiplas camadas empilhando essa atençÃĢo em janela, as camadas superiores eventualmente ganham uma perspectiva mais ampla, abrangendo informaçÃĩes de toda a entrada. Esse mecanismo ÃĐ anÃĄlogo aos campos receptivos vistos nas Redes Neurais Convolucionais (CNNs).
Por outro lado, a âjanela deslizante dilatadaâ do modelo Longformer, que ÃĐ conceitualmente semelhante ao mÃĐtodo da janela deslizante, calcula apenas algumas diagonais da matriz . Essa mudança resulta em um uso de memÃģria que aumenta linearmente, em vez de quadrÃĄtica, tornando-o um mÃĐtodo mais eficiente para sequÊncias mais longas.
TransparÊncia da Mistral AI versus PreocupaçÃĩes de Segurança na DescentralizaçÃĢo
Na sua declaraçÃĢo, a Mistral AI tambÃĐm enfatizou a transparÊncia com a afirmaçÃĢo: âSem truques, sem dados proprietÃĄrios.â Mas, ao mesmo tempo, seu Único modelo disponÃvel no momento, o âMistral-7B-v0.1â, ÃĐ um modelo base prÃĐ-treinado; portanto, ele pode gerar uma resposta a qualquer consulta sem moderaçÃĢo, o que levanta preocupaçÃĩes potenciais de segurança. Embora modelos como o GPT e o Llama tenham mecanismos para discernir quando responder, a natureza totalmente descentralizada da Mistral pode ser explorada por atores mal-intencionados.
No entanto, a descentralizaçÃĢo dos Modelos de Linguagem Grande tem seus mÃĐritos. Embora alguns possam mal utilizÃĄ-la, as pessoas podem aproveitar seu poder para o bem social e tornar a inteligÊncia acessÃvel a todos.
Flexibilidade de ImplantaçÃĢo
Um dos destaques ÃĐ que o Mistral 7B estÃĄ disponÃvel sob a licença Apache 2.0. Isso significa que nÃĢo hÃĄ barreiras reais para usÃĄ-lo â seja para fins pessoais, uma grande corporaçÃĢo ou atÃĐ mesmo uma entidade governamental. VocÊ sÃģ precisa do sistema certo para executÃĄ-lo, ou talvez precise investir em recursos de nuvem.
Embora haja outras licenças, como a licença MIT mais simples e a licença CC BY-SA-4.0 cooperativa, que exige crÃĐdito e licenciamento semelhante para derivados, a licença Apache 2.0 fornece uma base sÃģlida para empreendimentos em grande escala.
Pensamentos Finais
A ascensÃĢo de Modelos de Linguagem Grande de cÃģdigo aberto, como o Mistral 7B, sinaliza uma mudança significativa na indÚstria de IA, tornando modelos de linguagem de alta qualidade acessÃveis a uma audiÊncia mais ampla. As abordagens inovadoras da Mistral AI, como a atençÃĢo de consulta agrupada e a atençÃĢo de janela deslizante, prometem desempenho eficiente sem comprometer a qualidade.
Embora a natureza descentralizada da Mistral apresente certos desafios, sua flexibilidade e licença de cÃģdigo aberto sublinham o potencial para democratizar a IA. à medida que o cenÃĄrio evolui, o foco inevitavelmente estarÃĄ em equilibrar o poder desses modelos com consideraçÃĩes ÃĐticas e mecanismos de segurança.
O que vem a seguir para a Mistral? O modelo 7B foi apenas o começo. A equipe pretende lançar modelos ainda maiores em breve. Se esses novos modelos igualam o desempenho do 7B, a Mistral pode rapidamente se tornar um dos principais jogadores da indÚstria, tudo dentro de seu primeiro ano.

















