Modelos e plataformas de IA

Gemma: Google traz capacidades avançadas de IA por meio de cÃģdigo aberto

mm
Adicione Unite.AI às suas fontes preferidas no Google

O campo da inteligÊncia artificial (IA) tem visto um grande progresso nos Últimos anos, impulsionado principalmente pelos avanços no aprendizado profundo e no processamento de linguagem natural (NLP). À frente desses avanços estÃĢo modelos de linguagem grande (LLMs) – sistemas de IA treinados em grandes quantidades de dados de texto que podem gerar texto semelhante ao humano e participar de tarefas conversacionais.

LLMs como o PaLM da Google (GOOGL ), o Claude da Anthropic e o Gopher da DeepMind demonstraram capacidades notÃĄveis, desde codificaçÃĢo atÃĐ raciocínio de senso comum. No entanto, a maioria desses modelos nÃĢo foi liberada abertamente, limitando seu acesso para pesquisa, desenvolvimento e aplicaçÃĩes benÃĐficas.

Isso mudou com a recente liberaçÃĢo de cÃģdigo aberto da Gemma – uma família de LLMs da DeepMind baseada em seus poderosos modelos proprietÃĄrios Gemini. Neste post, mergulhamos na Gemma, analisando sua arquitetura, processo de treinamento, desempenho e liberaçÃĢo responsÃĄvel.

VisÃĢo geral da Gemma

Em fevereiro de 2023, a DeepMind liberou o cÃģdigo aberto de dois tamanhos de modelos Gemma – uma versÃĢo de 2 bilhÃĩes de parÃĒmetros otimizada para implantaçÃĢo em dispositivos e uma versÃĢo maior de 7 bilhÃĩes de parÃĒmetros projetada para uso em GPU/TPU.

A Gemma aproveita uma arquitetura baseada em transformadores e uma metodologia de treinamento semelhante aos modelos Gemini líderes da DeepMind. Ela foi treinada em atÃĐ 6 trilhÃĩes de tokens de texto de documentos da web, matemÃĄtica e cÃģdigo.

A DeepMind liberou os pontos de verificaçÃĢo prÃĐ-treinados brutos da Gemma, bem como versÃĩes ajustadas com aprendizado supervisionado e feedback humano para capacidades melhoradas em ÃĄreas como diÃĄlogo, seguimento de instruçÃĩes e codificaçÃĢo.

IntroduçÃĢo à Gemma

A liberaçÃĢo aberta da Gemma torna suas capacidades avançadas de IA acessíveis a desenvolvedores, pesquisadores e entusiastas. Aqui estÃĄ um guia rÃĄpido para começar:

ImplantaçÃĢo agnÃģstica de plataforma

Uma força chave da Gemma ÃĐ sua flexibilidade – vocÊ pode executÃĄ-la em CPUs, GPUs ou TPUs. Para CPU, utilize o TensorFlow Lite ou os Transformadores do HuggingFace. Para desempenho acelerado em GPU/TPU, use o TensorFlow. Serviços de nuvem como o Vertex AI da Google tambÃĐm oferecem escalabilidade sem esforço.

Acesso a modelos prÃĐ-treinados

A Gemma vem em diferentes variantes prÃĐ-treinadas, dependendo de suas necessidades. Os modelos de 2B e 7B oferecem fortes capacidades gerativas fora da caixa. Para ajuste fino personalizado, os modelos 2B-FT e 7B-FT sÃĢo pontos de partida ideais.

Construir aplicaçÃĩes excitantes

VocÊ pode construir uma ampla gama de aplicaçÃĩes com a Gemma, como geraçÃĢo de histÃģrias, traduçÃĢo de linguagem, resposta a perguntas e produçÃĢo de conteÚdo criativo. A chave ÃĐ aproveitar as forças da Gemma por meio do ajuste fino em seus prÃģprios conjuntos de dados.

Arquitetura

A Gemma utiliza uma arquitetura de transformador apenas decodificador, construída sobre avanços como atençÃĢo multi-consulta e embeddings posicionais rotativos:

  • Transformadores: Introduzidos em 2017, a arquitetura de transformador baseada apenas em mecanismos de atençÃĢo se tornou onipresente no NLP. A Gemma herda a capacidade do transformador de modelar dependÊncias de longo alcance em texto.
  • Apenas decodificador: A Gemma usa apenas uma pilha de decodificadores de transformadores, ao contrÃĄrio de modelos codificador-decodificador como o BART ou o T5. Isso fornece fortes capacidades gerativas para tarefas como geraçÃĢo de texto.
  • AtençÃĢo multi-consulta: A Gemma emprega atençÃĢo multi-consulta em seu modelo maior, permitindo que cada cabeça de atençÃĢo processe vÃĄrias consultas em paralelo para inferÊncia mais rÃĄpida.
  • Embeddings posicionais rotativos: A Gemma representa informaçÃĩes posicionais usando embeddings rotativos em vez de codificaçÃĩes de posiçÃĢo absolutas. Essa tÃĐcnica reduz o tamanho do modelo enquanto retÃĐm informaçÃĩes de posiçÃĢo.

O uso de tÃĐcnicas como atençÃĢo multi-consulta e embeddings posicionais rotativos permite que os modelos Gemma atinjam um equilíbrio Ãģtimo entre desempenho, velocidade de inferÊncia e tamanho do modelo.

Dados e processo de treinamento

A Gemma foi treinada em atÃĐ 6 trilhÃĩes de tokens de dados de texto, principalmente em inglÊs. Isso incluiu documentos da web, texto matemÃĄtico e cÃģdigo. A DeepMind investiu esforços significativos na filtragem de dados, removendo conteÚdo tÃģxico ou prejudicial usando classificadores e heurísticas.

O treinamento foi realizado usando a infraestrutura TPUv5 da Google, com atÃĐ 4096 TPUs usadas para treinar o Gemma-7B. TÃĐcnicas de paralelismo de modelo e dados eficientes permitiram o treinamento de modelos massivos com hardware comum.

O treinamento foi realizado em etapas, ajustando continuamente a distribuiçÃĢo de dados para se concentrar em texto de alta qualidade e relevante. As etapas finais de ajuste fino usaram uma mistura de exemplos de instruçÃĢo seguimento humanos e sintÃĐticos para melhorar as capacidades.

Desempenho do modelo

A DeepMind avaliou rigorosamente os modelos Gemma em um amplo conjunto de mais de 25 benchmarks que abrangem perguntas e respostas, raciocínio, matemÃĄtica, codificaçÃĢo, senso comum e capacidades de diÃĄlogo.

A Gemma alcança resultados de ponta em comparaçÃĢo com modelos de cÃģdigo aberto de tamanho semelhante em grande parte dos benchmarks. Alguns destaques:

  • MatemÃĄtica: A Gemma se destaca em testes de raciocínio matemÃĄtico como o GSM8K e o MATH, superando modelos como o Codex e o Claude da Anthropic por mais de 10 pontos.
  • CodificaçÃĢo: A Gemma iguala ou supera o desempenho do Codex em benchmarks de programaçÃĢo como o MBPP, apesar de nÃĢo ter sido treinada especificamente em cÃģdigo.
  • DiÃĄlogo: A Gemma demonstra forte capacidade conversacional com uma taxa de vitÃģria de 51,7% sobre o Mistral-7B da Anthropic em testes de preferÊncia humana.
  • Raciocínio: Em tarefas que exigem inferÊncia como o ARC e o Winogrande, a Gemma supera outros modelos de 7B por 5-10 pontos.

A versatilidade da Gemma em vÃĄrias disciplinas demonstra suas fortes capacidades de inteligÊncia geral. Embora ainda haja lacunas em relaçÃĢo ao desempenho humano, a Gemma representa um grande salto em modelos de NLP de cÃģdigo aberto.

Segurança e responsabilidade

Liberar pesos de modelos grandes de cÃģdigo aberto introduz desafios em torno de uso indevido intencional e vieses inerentes ao modelo. A DeepMind tomou medidas para mitigar os riscos:

  • Filtragem de dados: Texto potencialmente tÃģxico, ilegal ou tendencioso foi removido dos dados de treinamento usando classificadores e heurísticas.
  • AvaliaçÃĩes: A Gemma foi testada em mais de 30 benchmarks projetados para avaliar segurança, justiça e robustez. Ela igualou ou superou outros modelos.
  • Ajuste fino: O ajuste fino do modelo se concentrou em melhorar as capacidades de segurança, como filtragem de informaçÃĩes e comportamentos de recusa/hedging apropriados.
  • Termos de uso: Os termos de uso proíbem aplicaçÃĩes ofensivas, ilegais ou antiÃĐticas dos modelos Gemma. No entanto, a aplicaçÃĢo permanece um desafio.
  • CartÃĩes de modelo: CartÃĩes detalhando as capacidades, limitaçÃĩes e vieses do modelo foram liberados para promover a transparÊncia.

Embora existam riscos com a liberaçÃĢo de cÃģdigo aberto, a DeepMind determinou que a liberaçÃĢo da Gemma traz benefícios líquidos para a sociedade com base em seu perfil de segurança e capacidade de impulsionar a pesquisa. No entanto, o monitoramento vigilante de possíveis danos permanecerÃĄ crítico.

Impulsionando a prÃģxima onda de inovaçÃĢo em IA

Liberar a Gemma como uma família de modelos de cÃģdigo aberto tem o potencial de desbloquear o progresso em toda a comunidade de IA:

  • Acessibilidade: A Gemma reduz as barreiras para que organizaçÃĩes construam com NLP de ponta, que anteriormente enfrentavam altos custos de computaçÃĢo e dados para treinar seus prÃģprios LLMs.
  • Novas aplicaçÃĩes: Ao liberar pontos de verificaçÃĢo prÃĐ-treinados e ajustados, a DeepMind permite o desenvolvimento mais fÃĄcil de aplicaçÃĩes benÃĐficas em ÃĄreas como educaçÃĢo, ciÊncia e acessibilidade.
  • PersonalizaçÃĢo: Os desenvolvedores podem personalizar ainda mais a Gemma para aplicaçÃĩes específicas de indÚstria ou domínio por meio do treinamento contínuo em dados proprietÃĄrios.
  • Pesquisa: Modelos abertos como a Gemma promovem uma maior transparÊncia e auditoria dos sistemas de NLP atuais, iluminando direçÃĩes de pesquisa futuras.
  • InovaçÃĢo: A disponibilidade de modelos de linha de base fortes como a Gemma acelerarÃĄ o progresso em ÃĄreas como mitigaçÃĢo de vieses, factualidade e segurança de IA.

Ao fornecer as capacidades da Gemma a todos por meio da liberaçÃĢo de cÃģdigo aberto, a DeepMind espera impulsionar o desenvolvimento responsÃĄvel de IA para o bem social.

O caminho à frente

À medida que avançamos em cada salto em IA, nos aproximamos de modelos que rivalizam ou superam a inteligÊncia humana em todos os domínios. Sistemas como a Gemma destacam como os avanços rÃĄpidos em modelos auto-supervisionados estÃĢo desbloqueando capacidades cognitivas cada vez mais avançadas.

No entanto, ainda hÃĄ trabalho a ser feito para melhorar a confiabilidade, interpretabilidade e controllabilidade da IA – ÃĄreas onde a inteligÊncia humana ainda reina suprema. Domínios como a matemÃĄtica destacam essas lacunas persistentes, com a Gemma marcando 64% no MMLU em comparaçÃĢo com o desempenho humano estimado em 89%.

Fechar essas lacunas enquanto garante a segurança e a ÃĐtica de sistemas de IA cada vez mais capazes serÃĄ o desafio central nos anos que se seguem. Encontrar o equilíbrio certo entre abertura e cautela serÃĄ crítico, à medida que a DeepMind busca democratizar o acesso aos benefícios da IA enquanto gerencia os riscos emergentes.

Iniciativas para promover a segurança da IA – como o ANC de Dario Amodei, a equipe de Ética e Sociedade da DeepMind e a IA Constitucional da Anthropic – sinalizam um reconhecimento crescente dessa necessidade de nuances. O progresso significativo exigirÃĄ um diÃĄlogo aberto e baseado em evidÊncias entre pesquisadores, desenvolvedores, formuladores de políticas e o pÚblico.

Se navegada de forma responsÃĄvel, a Gemma representa nÃĢo o pico da IA, mas um acampamento base para a prÃģxima geraçÃĢo de pesquisadores de IA seguindo os passos da DeepMind em direçÃĢo à inteligÊncia artificial geral benÃĐfica.

ConclusÃĢo

A liberaçÃĢo da Gemma pela DeepMind sinaliza uma nova era para a IA de cÃģdigo aberto – uma que transcende benchmarks estreitos para capacidades de inteligÊncia geral. Testada extensivamente para segurança e amplamente acessível, a Gemma estabelece um novo padrÃĢo para a liberaçÃĢo responsÃĄvel de cÃģdigo aberto em IA.

Impulsionada por um espírito competitivo temperado com valores cooperativos, compartilhar avanços como a Gemma eleva todos os barcos na ecossistema de IA. A comunidade inteira agora tem acesso a uma família de LLM versÃĄtil para impulsionar ou apoiar suas iniciativas.

Embora riscos permaneçam, a diligÊncia tÃĐcnica e ÃĐtica da DeepMind proporciona confiança de que os benefícios da Gemma superam seus possíveis danos. À medida que as capacidades de IA crescem cada vez mais avançadas, manter essa nuances entre abertura e cautela serÃĄ crítico.

A Gemma nos leva um passo mais perto de uma IA que beneficia a humanidade como um todo. Mas muitos desafios grandiosos ainda aguardam no caminho para a inteligÊncia artificial geral benÃĐfica. Se os pesquisadores de IA, desenvolvedores e a sociedade em geral puderem manter o progresso colaborativo, a Gemma pode um dia ser vista como um acampamento base histÃģrico, e nÃĢo como o pico final.

Eu passei os Últimos cinco anos me imergindo no fascinante mundo de Aprendizado de MÃĄquina e Aprendizado Profundo. Minha paixÃĢo e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua tambÃĐm me levou em direçÃĢo ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.