Modelos e plataformas de IA
Gemma: Google traz capacidades avançadas de IA por meio de cÃģdigo aberto
O campo da inteligÊncia artificial (IA) tem visto um grande progresso nos Últimos anos, impulsionado principalmente pelos avanços no aprendizado profundo e no processamento de linguagem natural (NLP). à frente desses avanços estÃĢo modelos de linguagem grande (LLMs) â sistemas de IA treinados em grandes quantidades de dados de texto que podem gerar texto semelhante ao humano e participar de tarefas conversacionais.
LLMs como o PaLM da Google (GOOGL ), o Claude da Anthropic e o Gopher da DeepMind demonstraram capacidades notÃĄveis, desde codificaçÃĢo atÃĐ raciocÃnio de senso comum. No entanto, a maioria desses modelos nÃĢo foi liberada abertamente, limitando seu acesso para pesquisa, desenvolvimento e aplicaçÃĩes benÃĐficas.
Isso mudou com a recente liberaçÃĢo de cÃģdigo aberto da Gemma â uma famÃlia de LLMs da DeepMind baseada em seus poderosos modelos proprietÃĄrios Gemini. Neste post, mergulhamos na Gemma, analisando sua arquitetura, processo de treinamento, desempenho e liberaçÃĢo responsÃĄvel.
VisÃĢo geral da Gemma
Em fevereiro de 2023, a DeepMind liberou o cÃģdigo aberto de dois tamanhos de modelos Gemma â uma versÃĢo de 2 bilhÃĩes de parÃĒmetros otimizada para implantaçÃĢo em dispositivos e uma versÃĢo maior de 7 bilhÃĩes de parÃĒmetros projetada para uso em GPU/TPU.
A Gemma aproveita uma arquitetura baseada em transformadores e uma metodologia de treinamento semelhante aos modelos Gemini lÃderes da DeepMind. Ela foi treinada em atÃĐ 6 trilhÃĩes de tokens de texto de documentos da web, matemÃĄtica e cÃģdigo.
A DeepMind liberou os pontos de verificaçÃĢo prÃĐ-treinados brutos da Gemma, bem como versÃĩes ajustadas com aprendizado supervisionado e feedback humano para capacidades melhoradas em ÃĄreas como diÃĄlogo, seguimento de instruçÃĩes e codificaçÃĢo.
IntroduçÃĢo à Gemma
A liberaçÃĢo aberta da Gemma torna suas capacidades avançadas de IA acessÃveis a desenvolvedores, pesquisadores e entusiastas. Aqui estÃĄ um guia rÃĄpido para começar:
ImplantaçÃĢo agnÃģstica de plataforma
Uma força chave da Gemma ÃĐ sua flexibilidade â vocÊ pode executÃĄ-la em CPUs, GPUs ou TPUs. Para CPU, utilize o TensorFlow Lite ou os Transformadores do HuggingFace. Para desempenho acelerado em GPU/TPU, use o TensorFlow. Serviços de nuvem como o Vertex AI da Google tambÃĐm oferecem escalabilidade sem esforço.
Acesso a modelos prÃĐ-treinados
A Gemma vem em diferentes variantes prÃĐ-treinadas, dependendo de suas necessidades. Os modelos de 2B e 7B oferecem fortes capacidades gerativas fora da caixa. Para ajuste fino personalizado, os modelos 2B-FT e 7B-FT sÃĢo pontos de partida ideais.
Construir aplicaçÃĩes excitantes
VocÊ pode construir uma ampla gama de aplicaçÃĩes com a Gemma, como geraçÃĢo de histÃģrias, traduçÃĢo de linguagem, resposta a perguntas e produçÃĢo de conteÚdo criativo. A chave ÃĐ aproveitar as forças da Gemma por meio do ajuste fino em seus prÃģprios conjuntos de dados.
Arquitetura
A Gemma utiliza uma arquitetura de transformador apenas decodificador, construÃda sobre avanços como atençÃĢo multi-consulta e embeddings posicionais rotativos:
- Transformadores: Introduzidos em 2017, a arquitetura de transformador baseada apenas em mecanismos de atençÃĢo se tornou onipresente no NLP. A Gemma herda a capacidade do transformador de modelar dependÊncias de longo alcance em texto.
- Apenas decodificador: A Gemma usa apenas uma pilha de decodificadores de transformadores, ao contrÃĄrio de modelos codificador-decodificador como o BART ou o T5. Isso fornece fortes capacidades gerativas para tarefas como geraçÃĢo de texto.
- AtençÃĢo multi-consulta: A Gemma emprega atençÃĢo multi-consulta em seu modelo maior, permitindo que cada cabeça de atençÃĢo processe vÃĄrias consultas em paralelo para inferÊncia mais rÃĄpida.
- Embeddings posicionais rotativos: A Gemma representa informaçÃĩes posicionais usando embeddings rotativos em vez de codificaçÃĩes de posiçÃĢo absolutas. Essa tÃĐcnica reduz o tamanho do modelo enquanto retÃĐm informaçÃĩes de posiçÃĢo.
O uso de tÃĐcnicas como atençÃĢo multi-consulta e embeddings posicionais rotativos permite que os modelos Gemma atinjam um equilÃbrio Ãģtimo entre desempenho, velocidade de inferÊncia e tamanho do modelo.
Dados e processo de treinamento
A Gemma foi treinada em atÃĐ 6 trilhÃĩes de tokens de dados de texto, principalmente em inglÊs. Isso incluiu documentos da web, texto matemÃĄtico e cÃģdigo. A DeepMind investiu esforços significativos na filtragem de dados, removendo conteÚdo tÃģxico ou prejudicial usando classificadores e heurÃsticas.
O treinamento foi realizado usando a infraestrutura TPUv5 da Google, com atÃĐ 4096 TPUs usadas para treinar o Gemma-7B. TÃĐcnicas de paralelismo de modelo e dados eficientes permitiram o treinamento de modelos massivos com hardware comum.
O treinamento foi realizado em etapas, ajustando continuamente a distribuiçÃĢo de dados para se concentrar em texto de alta qualidade e relevante. As etapas finais de ajuste fino usaram uma mistura de exemplos de instruçÃĢo seguimento humanos e sintÃĐticos para melhorar as capacidades.
Desempenho do modelo
A DeepMind avaliou rigorosamente os modelos Gemma em um amplo conjunto de mais de 25 benchmarks que abrangem perguntas e respostas, raciocÃnio, matemÃĄtica, codificaçÃĢo, senso comum e capacidades de diÃĄlogo.
A Gemma alcança resultados de ponta em comparaçÃĢo com modelos de cÃģdigo aberto de tamanho semelhante em grande parte dos benchmarks. Alguns destaques:
- MatemÃĄtica: A Gemma se destaca em testes de raciocÃnio matemÃĄtico como o GSM8K e o MATH, superando modelos como o Codex e o Claude da Anthropic por mais de 10 pontos.
- CodificaçÃĢo: A Gemma iguala ou supera o desempenho do Codex em benchmarks de programaçÃĢo como o MBPP, apesar de nÃĢo ter sido treinada especificamente em cÃģdigo.
- DiÃĄlogo: A Gemma demonstra forte capacidade conversacional com uma taxa de vitÃģria de 51,7% sobre o Mistral-7B da Anthropic em testes de preferÊncia humana.
- RaciocÃnio: Em tarefas que exigem inferÊncia como o ARC e o Winogrande, a Gemma supera outros modelos de 7B por 5-10 pontos.
A versatilidade da Gemma em vÃĄrias disciplinas demonstra suas fortes capacidades de inteligÊncia geral. Embora ainda haja lacunas em relaçÃĢo ao desempenho humano, a Gemma representa um grande salto em modelos de NLP de cÃģdigo aberto.
Segurança e responsabilidade
Liberar pesos de modelos grandes de cÃģdigo aberto introduz desafios em torno de uso indevido intencional e vieses inerentes ao modelo. A DeepMind tomou medidas para mitigar os riscos:
- Filtragem de dados: Texto potencialmente tÃģxico, ilegal ou tendencioso foi removido dos dados de treinamento usando classificadores e heurÃsticas.
- AvaliaçÃĩes: A Gemma foi testada em mais de 30 benchmarks projetados para avaliar segurança, justiça e robustez. Ela igualou ou superou outros modelos.
- Ajuste fino: O ajuste fino do modelo se concentrou em melhorar as capacidades de segurança, como filtragem de informaçÃĩes e comportamentos de recusa/hedging apropriados.
- Termos de uso: Os termos de uso proÃbem aplicaçÃĩes ofensivas, ilegais ou antiÃĐticas dos modelos Gemma. No entanto, a aplicaçÃĢo permanece um desafio.
- CartÃĩes de modelo: CartÃĩes detalhando as capacidades, limitaçÃĩes e vieses do modelo foram liberados para promover a transparÊncia.
Embora existam riscos com a liberaçÃĢo de cÃģdigo aberto, a DeepMind determinou que a liberaçÃĢo da Gemma traz benefÃcios lÃquidos para a sociedade com base em seu perfil de segurança e capacidade de impulsionar a pesquisa. No entanto, o monitoramento vigilante de possÃveis danos permanecerÃĄ crÃtico.
Impulsionando a prÃģxima onda de inovaçÃĢo em IA
Liberar a Gemma como uma famÃlia de modelos de cÃģdigo aberto tem o potencial de desbloquear o progresso em toda a comunidade de IA:
- Acessibilidade: A Gemma reduz as barreiras para que organizaçÃĩes construam com NLP de ponta, que anteriormente enfrentavam altos custos de computaçÃĢo e dados para treinar seus prÃģprios LLMs.
- Novas aplicaçÃĩes: Ao liberar pontos de verificaçÃĢo prÃĐ-treinados e ajustados, a DeepMind permite o desenvolvimento mais fÃĄcil de aplicaçÃĩes benÃĐficas em ÃĄreas como educaçÃĢo, ciÊncia e acessibilidade.
- PersonalizaçÃĢo: Os desenvolvedores podem personalizar ainda mais a Gemma para aplicaçÃĩes especÃficas de indÚstria ou domÃnio por meio do treinamento contÃnuo em dados proprietÃĄrios.
- Pesquisa: Modelos abertos como a Gemma promovem uma maior transparÊncia e auditoria dos sistemas de NLP atuais, iluminando direçÃĩes de pesquisa futuras.
- InovaçÃĢo: A disponibilidade de modelos de linha de base fortes como a Gemma acelerarÃĄ o progresso em ÃĄreas como mitigaçÃĢo de vieses, factualidade e segurança de IA.
Ao fornecer as capacidades da Gemma a todos por meio da liberaçÃĢo de cÃģdigo aberto, a DeepMind espera impulsionar o desenvolvimento responsÃĄvel de IA para o bem social.
O caminho à frente
à medida que avançamos em cada salto em IA, nos aproximamos de modelos que rivalizam ou superam a inteligÊncia humana em todos os domÃnios. Sistemas como a Gemma destacam como os avanços rÃĄpidos em modelos auto-supervisionados estÃĢo desbloqueando capacidades cognitivas cada vez mais avançadas.
No entanto, ainda hÃĄ trabalho a ser feito para melhorar a confiabilidade, interpretabilidade e controllabilidade da IA â ÃĄreas onde a inteligÊncia humana ainda reina suprema. DomÃnios como a matemÃĄtica destacam essas lacunas persistentes, com a Gemma marcando 64% no MMLU em comparaçÃĢo com o desempenho humano estimado em 89%.
Fechar essas lacunas enquanto garante a segurança e a ÃĐtica de sistemas de IA cada vez mais capazes serÃĄ o desafio central nos anos que se seguem. Encontrar o equilÃbrio certo entre abertura e cautela serÃĄ crÃtico, à medida que a DeepMind busca democratizar o acesso aos benefÃcios da IA enquanto gerencia os riscos emergentes.
Iniciativas para promover a segurança da IA â como o ANC de Dario Amodei, a equipe de Ãtica e Sociedade da DeepMind e a IA Constitucional da Anthropic â sinalizam um reconhecimento crescente dessa necessidade de nuances. O progresso significativo exigirÃĄ um diÃĄlogo aberto e baseado em evidÊncias entre pesquisadores, desenvolvedores, formuladores de polÃticas e o pÚblico.
Se navegada de forma responsÃĄvel, a Gemma representa nÃĢo o pico da IA, mas um acampamento base para a prÃģxima geraçÃĢo de pesquisadores de IA seguindo os passos da DeepMind em direçÃĢo à inteligÊncia artificial geral benÃĐfica.
ConclusÃĢo
A liberaçÃĢo da Gemma pela DeepMind sinaliza uma nova era para a IA de cÃģdigo aberto â uma que transcende benchmarks estreitos para capacidades de inteligÊncia geral. Testada extensivamente para segurança e amplamente acessÃvel, a Gemma estabelece um novo padrÃĢo para a liberaçÃĢo responsÃĄvel de cÃģdigo aberto em IA.
Impulsionada por um espÃrito competitivo temperado com valores cooperativos, compartilhar avanços como a Gemma eleva todos os barcos na ecossistema de IA. A comunidade inteira agora tem acesso a uma famÃlia de LLM versÃĄtil para impulsionar ou apoiar suas iniciativas.
Embora riscos permaneçam, a diligÊncia tÃĐcnica e ÃĐtica da DeepMind proporciona confiança de que os benefÃcios da Gemma superam seus possÃveis danos. à medida que as capacidades de IA crescem cada vez mais avançadas, manter essa nuances entre abertura e cautela serÃĄ crÃtico.
A Gemma nos leva um passo mais perto de uma IA que beneficia a humanidade como um todo. Mas muitos desafios grandiosos ainda aguardam no caminho para a inteligÊncia artificial geral benÃĐfica. Se os pesquisadores de IA, desenvolvedores e a sociedade em geral puderem manter o progresso colaborativo, a Gemma pode um dia ser vista como um acampamento base histÃģrico, e nÃĢo como o pico final.












