Modelos e plataformas de IA
A DeepMind Introduz o Algoritmo JEST: Tornando o Treinamento de Modelos de IA Mais Rápido, Mais Barato e Mais Ecológico
A inteligência artificial gerativa está fazendo progressos incríveis, transformando áreas como medicina, educação, finanças, arte, esportes, etc. Esse progresso vem principalmente da capacidade melhorada da IA de aprender com conjuntos de dados maiores e construir modelos mais complexos com bilhões de parâmetros. Embora esses avanços tenham impulsionado descobertas científicas significativas, criado novas oportunidades de negócios e levado ao crescimento industrial, eles vêm com um alto custo, especialmente considerando os impactos financeiros e ambientais do treinamento desses modelos de grande escala. Os algoritmos de aprendizado precisam de poder computacional significativo para treinar modelos de IA gerativa com conjuntos de dados grandes, o que leva a um alto consumo de energia e a uma pegada de carbono notável.
Enquanto esforços anteriores para tornar a IA gerativa sustentável se concentraram em melhorar a eficiência do hardware para treinamento de IA e desenvolver modelos menores com menos parâmetros, a Google DeepMind adotou uma abordagem inovadora, visando melhorar a eficiência do algoritmo de treinamento de IA gerativa. Eles pioneiramente desenvolveram um novo algoritmo, JEST (Seleção Conjunta de Exemplos), que opera 13 vezes mais rápido e é dez vezes mais eficiente em termos de energia do que as técnicas atuais.
Neste artigo, exploramos os desafios do treinamento de IA e como o JEST aborda essas questões. Além disso, consideramos as implicações mais amplas e direções de pesquisa futuras para o algoritmo JEST, imaginando seu impacto potencial além de melhorar a velocidade, a eficiência de custo e a amigabilidade ambiental no treinamento de IA.
Desafios do Treinamento de IA: Altos Custos e Impacto Ambiental
O treinamento de modelos de IA gerativa apresenta desafios significativos devido aos altos custos e ao impacto ambiental substancial.
- Custos Financeiros: Treinar modelos de IA gerativa é uma empreitada cara. Estimativas recentes indicam que treinar um único modelo grande, como o GPT-3 da OpenAI com 175 bilhões de parâmetros, pode custar cerca de $4,6 milhões. Treinar o ChatGPT-4 é estimado ter custado à OpenAI aproximadamente $100 milhões. Esses gastos são atribuídos principalmente aos recursos computacionais maciços, ao processamento de dados extensivo e aos tempos de treinamento prolongados necessários.
- Consumo de Energia: Os processos de treinamento de IA gerativa são extremamente intensivos em energia. Treinar esses modelos envolve milhares de GPUs e consome múltiplos gigawatt-horas de energia, tornando o processo extremamente intensivo em energia. Os data centers, que abrigam a infraestrutura de computação para treinamento de IA, consomem cerca de 200 terawatt-horas (TWh) de eletricidade anualmente, aproximadamente 1% da demanda global de eletricidade. Um relatório da McKinsey prevê que o consumo de energia dos data centers nos EUA pode aumentar de 17 gigawatts (GW) em 2017 para 35 GW até 2030, necessitando a produção equivalente a nove usinas hidrelétricas de Hoover para atender a essa demanda adicional.
- Pegada de Carbono: O alto consumo de energia do treinamento de modelos de IA gerativa contribui significativamente para as emissões de gases de efeito estufa, exacerbando as mudanças climáticas. Um estudo da Universidade de Massachusetts Amherst descobriu que treinar um modelo de IA grande pode emitir tanto dióxido de carbono quanto cinco carros durante toda a vida. Especificamente, treinar um único modelo de IA pode emitir mais de 626.000 libras de CO2, equivalente à pegada de carbono de 315 voos transamericanos.
Esses desafios provêm principalmente de duas fontes principais: a dependência de hardware computacional de alto consumo de energia e a ineficiência dos algoritmos de treinamento atuais. Embora a comunidade de IA tenha feito progressos no desenvolvimento de hardware eficiente em termos de energia, é necessário mais ênfase na criação de algoritmos mais inteligentes que possam otimizar o uso de dados e reduzir os tempos de treinamento. O algoritmo JEST, recentemente introduzido pela Google, é uma pesquisa inovadora que visa tornar os algoritmos de treinamento mais inteligentes. Ao selecionar inteligentemente os dados que importam, o JEST melhora significativamente a eficiência do treinamento de IA, abrindo caminho para um treinamento mais sustentável e economicamente viável de modelos de IA gerativa.
Entendendo o Algoritmo JEST
O JEST é um algoritmo de aprendizado projetado para treinar modelos de IA gerativa multimodal de forma mais eficiente. Para entender como o JEST funciona, pense no treinamento de IA como resolver um quebra-cabeça complexo, onde cada peça (ponto de dados) ajuda a construir a imagem completa (modelo de IA). O JEST age como um solucionador de quebra-cabeças experiente, tornando o processo mais eficiente. Assim como um solucionador de quebra-cabeças seleciona as peças mais importantes e distintas, o JEST identifica e seleciona os lotes de dados mais valiosos do conjunto de dados, garantindo que cada lote desempenhe um papel crucial no desenvolvimento de IA.
O JEST emprega um modelo de IA menor para avaliar a qualidade dos lotes de dados. Esses lotes são então classificados com base em sua eficácia no treinamento do modelo. Com esses lotes cuidadosamente selecionados, o JEST os monta estrategicamente para treinar o modelo. Assim como um solucionador de quebra-cabeças organiza as peças do quebra-cabeça para maximizar a eficiência e a coerência, o JEST acelera significativamente o processo de treinamento, priorizando e selecionando os lotes mais informativos.
Uma parte fundamental da abordagem do JEST é o aprendizado contrastivo multimodal. Essa técnica se concentra em aprender a correspondência entre diferentes tipos de dados, como texto e imagens. O JEST emprega um método baseado em aprendizado contrastivo multimodal para avaliar a eficácia de uma amostra de dados multimodal no treinamento do modelo. Além da eficácia de amostras de dados individuais, o JEST também avalia a aprendizagem coletiva de amostras de dados para selecionar um lote pequeno de dados de um “super lote” maior. Esse processo ajuda o JEST a selecionar e priorizar lotes que oferecem desafios e oportunidades de aprendizado rico.
Olhando para o Futuro: JEST Além do Treinamento de IA Mais Rápido, Mais Barato e Mais Ecológico
À medida que exploramos as implicações futuras do JEST (Seleção Conjunta de Exemplos), fica evidente que suas contribuições vão além de apenas acelerar o treinamento de IA, reduzir custos e promover a sustentabilidade ambiental. Aqui, mergulhamos em como o JEST pode continuar a melhorar e transformar o campo da IA gerativa:
- Desempenho e Precisão do Modelo Aprimorados: A abordagem inovadora do JEST para a seleção e priorização de dados leva a tempos de treinamento mais rápidos e a um desempenho do modelo aprimorado. Ao se concentrar nos lotes de dados mais informativos, o JEST garante que os modelos de IA sejam treinados com entradas de alta qualidade, melhorando sua precisão e robustez. Essa vantagem é crucial em aplicações onde a precisão e a confiabilidade são fundamentais, como diagnósticos médicos, previsões financeiras e sistemas autônomos.
- Identificação e Mitigação de Vieses nos Dados: A IA é propensa a conjuntos de dados viesados, onde certos grupos ou perspectivas estão subrepresentados ou mal representados. A abordagem de seleção de dados do JEST envolve avaliar a qualidade e a informatividade dos lotes de dados. Ao priorizar amostras de dados diversificadas e representativas, o JEST pode ajudar os sistemas de IA a aprender com um conjunto de dados mais equilibrado, reduzindo assim os vieses nos dados de treinamento. Por exemplo, em aplicações de IA em saúde, o JEST pode selecionar lotes de dados que abrangem vários fatores demográficos, garantindo que os modelos de diagnóstico médico sejam treinados em populações de pacientes diversificadas. Essa seleção reduz o risco de vieses que poderiam afetar desproporcionalmente certos grupos com base em raça, gênero ou status socioeconômico.
- Fomentando Inovação e Pesquisa: Ao reduzir significativamente os recursos computacionais e o tempo necessários para o treinamento de modelos de IA, o JEST reduz as barreiras de entrada para pesquisadores e inovadores. Essa acessibilidade fomenta um ecossistema mais vibrante de desenvolvimento de IA, onde equipes menores e organizações podem experimentar e implantar soluções de IA avançadas. Além disso, os ganhos de eficiência oferecidos pelo JEST liberam recursos que podem ser redirecionados para explorar novas fronteiras em IA, como arquiteturas novas, algoritmos avançados e estruturas de IA éticas.
- Promovendo o Desenvolvimento de IA Inclusivo: O desenvolvimento de IA deve envolver perspectivas e contribuições diversificadas para mitigar efetivamente vieses e preocupações éticas. A capacidade do JEST de selecionar dados com base em seu valor informativo e representatividade encoraja práticas inclusivas na curação de conjuntos de dados. Os desenvolvedores de IA podem garantir que o JEST aborde efetivamente vieses e considerações éticas, envolvendo equipes multidisciplinares na definição de critérios de seleção de dados, incluindo especialistas em ética, ciências sociais e campos específicos. Essa abordagem colaborativa fomenta um desenvolvimento mais inclusivo e responsável de tecnologias de IA.
A Linha de Fundo
A introdução do algoritmo JEST pela DeepMind representa um salto significativo no treinamento de IA gerativa. Ao acelerar significativamente os processos de treinamento e reduzir o consumo de energia, o JEST oferece economias de custo substanciais e aborda preocupações ambientais ligadas ao desenvolvimento de IA. Além dessas vantagens, o JEST tem o potencial de melhorar a precisão do modelo, mitigar vieses nos dados, fomentar a inovação e promover o desenvolvimento de IA inclusivo. O aprimoramento contínuo e a aplicação do JEST estão prestes a redefinir o futuro da IA, avançando em direção a soluções de IA mais eficientes, sustentáveis e eticamente responsáveis.












