Modelos e plataformas de IA

Dentro do Phi-3 Mini da Microsoft: Um Modelo de IA Leve que Supera suas Limitações

mm
Adicione Unite.AI às suas fontes preferidas no Google

A Microsoft (MSFT ) recentemente lançou seu mais recente modelo de linguagem leve, chamado Phi-3 Mini, iniciando uma trilogia de modelos de IA compactos projetados para oferecer desempenho de ponta enquanto são pequenos o suficiente para ser executados de forma eficiente em dispositivos com recursos computacionais limitados. Com apenas 3,8 bilhões de parâmetros, o Phi-3 Mini é uma fração do tamanho de gigantes de IA como o GPT-4, mas promete igualar suas capacidades em muitas áreas-chave.

O desenvolvimento do Phi-3 Mini representa um marco significativo na busca por democratizar as capacidades avançadas de IA, tornando-as acessíveis em uma gama mais ampla de hardware. Seu pequeno tamanho permite que ele seja implantado localmente em smartphones, tablets e outros dispositivos de borda, superando a latência e as preocupações de privacidade associadas a modelos baseados em nuvem. Isso abre novas possibilidades para experiências inteligentes no dispositivo em vários domínios, desde assistentes virtuais e IA conversacional até assistentes de codificação e tarefas de compreensão de linguagem.

4-bit quantized phi-3-mini executado nativamente em um iPhone
4-bit quantized phi-3-mini executado nativamente em um iPhone

Por Baixo dos Panos: Arquitetura e Treinamento

Em seu núcleo, o Phi-3 Mini é um modelo decodificador de transformador construído sobre uma arquitetura semelhante ao modelo Llama-2 de código aberto. Ele apresenta 32 camadas, 3072 dimensões ocultas e 32 cabeças de atenção, com um comprimento de contexto padrão de 4.000 tokens. A Microsoft também introduziu uma versão de contexto longo chamada Phi-3 Mini-128K, que estende o comprimento do contexto para impressionantes 128.000 tokens usando técnicas como LongRope.

O que diferencia o Phi-3 Mini, no entanto, é sua metodologia de treinamento. Em vez de confiar apenas na força bruta de conjuntos de dados massivos e poder de processamento, a Microsoft se concentrou em curar um conjunto de dados de treinamento de alta qualidade e densamente razoável. Esses dados são compostos por dados da web fortemente filtrados, bem como dados sintéticos gerados por modelos de linguagem maiores.

O processo de treinamento segue uma abordagem de duas fases. Na primeira fase, o modelo é exposto a uma variedade de fontes da web destinadas a ensinar-lhe conhecimento geral e compreensão de linguagem. A segunda fase combina ainda mais dados da web fortemente filtrados com dados sintéticos projetados para impartir habilidades de raciocínio lógico e especialização em nichos.

A Microsoft se refere a essa abordagem como o “regime de dados ótimos”, uma divergência do tradicional “regime de computação ótimos” ou “regime de treinamento excessivo” empregado por muitos modelos de linguagem grandes. O objetivo é calibrar os dados de treinamento para corresponder à escala do modelo, fornecendo o nível certo de conhecimento e capacidade de raciocínio, enquanto deixa capacidade suficiente para outras capacidades.

Qualidade dos novos modelos Phi-3, medida pelo desempenho no benchmark Massive Multitask Language Understanding (MMLU)
Qualidade dos novos modelos Phi-3, medida pelo desempenho no benchmark Massive Multitask Language Understanding (MMLU)

Essa abordagem centrada nos dados pagou dividendos, pois o Phi-3 Mini alcança um desempenho notável em uma ampla gama de benchmarks acadêmicos, frequentemente rivalizando ou superando modelos muito maiores. Por exemplo, ele pontua 69% no benchmark MMLU para aprendizado e compreensão multitarefa e 8,38 no MT-bench para raciocínio matemático – resultados que estão à altura de modelos como Mixtral 8x7B e GPT-3.5.

Segurança e Robustez

Além de seu desempenho impressionante, a Microsoft colocou um forte ênfase na segurança e robustez no desenvolvimento do Phi-3 Mini. O modelo passou por um rigoroso processo de treinamento pós-treinamento envolvendo ajuste fino supervisionado (SFT) e otimização de preferência direta (DPO).

A etapa SFT aproveita dados altamente curados em domínios diversos, incluindo matemática, codificação, raciocínio, conversação, identidade do modelo e segurança. Isso ajuda a reforçar as capacidades do modelo nessas áreas, enquanto instila uma forte noção de identidade e comportamento ético.

A etapa DPO, por outro lado, se concentra em direcionar o modelo para longe de comportamentos indesejados, usando respostas rejeitadas como exemplos negativos. Esse processo abrange dados de formato de conversa, tarefas de raciocínio e esforços de IA responsável (RAI), garantindo que o Phi-3 Mini adira aos princípios de IA ética e confiável da Microsoft.

Para ainda mais melhorar seu perfil de segurança, o Phi-3 Mini foi submetido a testes extensivos de red team e automação em dezenas de categorias de dano RAI. Uma equipe de red team independente da Microsoft examinou iterativamente o modelo, identificando áreas para melhoria, que foram então abordadas por meio de conjuntos de dados curados adicionais e re-treinamento.

Essa abordagem multifacetada reduziu significativamente a incidência de respostas prejudiciais, imprecisões factuais e vieses, como demonstrado pelos benchmarks internos de RAI da Microsoft. Por exemplo, o modelo exibe taxas de defeito baixas para conteúdo prejudicial (0,75%) e resumo (10%), bem como uma taxa baixa de desfundamentação (0,603), indicando que suas respostas estão firmemente enraizadas no contexto fornecido.

Aplicações e Casos de Uso

Com seu desempenho impressionante e medidas de segurança robustas, o Phi-3 Mini é bem adaptado para uma ampla gama de aplicações, particularmente em ambientes com recursos computacionais limitados e cenários limitados por latência.

Uma das perspectivas mais emocionais é o deploy de assistentes virtuais inteligentes e IA conversacional diretamente em dispositivos móveis. Ao ser executado localmente, esses assistentes podem fornecer respostas instantâneas sem a necessidade de uma conexão de rede, enquanto também garantem que dados sensíveis permaneçam no dispositivo, abordando preocupações de privacidade.

As fortes habilidades de raciocínio do Phi-3 Mini também o tornam um ativo valioso para assistência de codificação e resolução de problemas matemáticos. Desenvolvedores e estudantes podem se beneficiar da conclusão de código no dispositivo, detecção de bugs e explicações, simplificando os processos de desenvolvimento e aprendizado.

Além dessas aplicações, a versatilidade do modelo abre oportunidades em áreas como compreensão de linguagem, resumo de texto e resposta a perguntas. Seu pequeno tamanho e eficiência o tornam uma escolha atraente para incorporar capacidades de IA em uma ampla gama de dispositivos e sistemas, desde eletrodomésticos inteligentes até sistemas de automação industrial.

Olhando para o Futuro: Phi-3 Pequeno e Phi-3 Médio

Enquanto o Phi-3 Mini é um feito notável por si só, a Microsoft tem planos ainda maiores para a família Phi-3. A empresa já previu dois modelos maiores, Phi-3 Pequeno (7 bilhões de parâmetros) e Phi-3 Médio (14 bilhões de parâmetros), ambos dos quais devem impulsionar os limites do desempenho para modelos de linguagem compactos.

O Phi-3 Pequeno, por exemplo, aproveita um tokenizador mais avançado (tiktoken) e um mecanismo de atenção de consulta agrupada, junto com uma camada de atenção blocksparse, para otimizar sua pegada de memória enquanto mantém o desempenho de recuperação de contexto longo. Ele também incorpora 10% adicionais de dados multilíngues, melhorando suas capacidades em compreensão e geração de linguagem em vários idiomas.

O Phi-3 Médio, por outro lado, representa um aumento significativo em escala, com 40 camadas, 40 cabeças de atenção e uma dimensão de incorporação de 5.120. Embora a Microsoft observe que alguns benchmarks possam exigir um refinamento adicional da mistura de dados de treinamento para aproveitar totalmente essa capacidade aumentada, os resultados iniciais são promissores, com melhorias substanciais sobre o Phi-3 Pequeno em tarefas como MMLU, TriviaQA e HumanEval.

Limitações e Direções Futuras

Apesar de suas capacidades impressionantes, o Phi-3 Mini, como todos os modelos de linguagem, não está sem limitações. Uma das fraquezas mais notáveis é sua capacidade relativamente limitada para armazenar conhecimento factual, como evidenciado por seu desempenho mais baixo em benchmarks como TriviaQA.

No entanto, a Microsoft acredita que essa limitação pode ser mitigada ao aumentar o modelo com capacidades de busca, permitindo que ele recupere e raciocine sobre informações relevantes sob demanda. Essa abordagem é demonstrada na Hugging Face Chat-UI, onde o Phi-3 Mini pode aproveitar a busca para melhorar suas respostas.

Outra área para melhoria é a capacidade multilíngue do modelo. Embora o Phi-3 Pequeno tenha dado os primeiros passos ao incorporar dados multilíngues adicionais, mais trabalho é necessário para desbloquear completamente o potencial desses modelos compactos para aplicações cross-linguais.

Olhando para o futuro, a Microsoft está comprometida em continuar avançando a família de modelos Phi, abordando suas limitações e expandindo suas capacidades. Isso pode envolver refinamentos adicionais nos dados de treinamento e na metodologia, bem como a exploração de novas arquiteturas e técnicas específicamente adaptadas para modelos de linguagem compactos e de alto desempenho.

Conclusão

O Phi-3 Mini da Microsoft representa um grande salto para a democratização de capacidades de IA avançadas. Ao oferecer desempenho de ponta em um pacote compacto e eficiente em recursos, ele abre novas possibilidades para experiências inteligentes no dispositivo em uma ampla gama de aplicações.

A abordagem inovadora de treinamento do modelo, que enfatiza dados de alta qualidade e densamente razoáveis sobre a mera força computacional, provou ser um divisor de águas, permitindo que o Phi-3 Mini supere suas limitações de tamanho. Combinado com suas medidas de segurança robustas e esforços de desenvolvimento contínuos, a família de modelos Phi está bem posicionada para desempenhar um papel crucial em moldar o futuro dos sistemas inteligentes, tornando a IA mais acessível, eficiente e confiável do que nunca.

À medida que a indústria de tecnologia continua a empurrar os limites do que é possível com a IA, o compromisso da Microsoft com modelos leves e de alto desempenho, como o Phi-3 Mini, representa uma saída refrescante da sabedoria convencional de que “maior é melhor”. Ao demonstrar que o tamanho não é tudo, o Phi-3 Mini tem o potencial de inspirar uma nova onda de inovação focada em maximizar o valor e o impacto da IA por meio de curadoria de dados inteligente, design de modelo pensado e práticas de desenvolvimento responsáveis.

Eu passei os últimos cinco anos me imergindo no fascinante mundo de Aprendizado de Máquina e Aprendizado Profundo. Minha paixão e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua também me levou em direção ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.