Modelos e plataformas de IA

O Google está tornando o treinamento de IA 28% mais rápido usando SLMs como professores

mm
Adicione Unite.AI às suas fontes preferidas no Google

Treinar grandes modelos de linguagem (LLMs) tornou-se inacessível para a maioria das organizações. Com custos que chegam a milhões e requisitos de computação que fariam um supercomputador suar, o desenvolvimento de IA permaneceu trancado atrás das portas dos gigantes da tecnologia. Mas o Google (GOOGL ) acabou de virar essa história de cabeça para baixo com uma abordagem tão simples que faz você se perguntar por que ninguém pensou nisso antes: usando modelos de IA menores como professores.

Como funciona o SALT: Uma nova abordagem para treinar modelos de IA

Em um artigo de pesquisa recente intitulado “Um pouco de ajuda vai longe: Treinamento eficiente de LLMs usando pequenos modelos,” a equipe de pesquisa do Google e a DeepMind introduziram o SALT (Treinamento de Modelo Grande com Ajuda de Modelo Pequeno). Esta é a nova metodologia que desafia nossa abordagem tradicional para treinar LLMs.

Por que essa pesquisa é significativa? Atualmente, treinar grandes modelos de IA é como tentar ensinar alguém tudo o que ele precisa saber sobre um assunto de uma vez – é ineficiente, caro e muitas vezes restrito a organizações com recursos computacionais massivos. O SALT segue um caminho diferente, introduzindo um processo de treinamento em duas etapas que é tanto inovador quanto prático.

Desmembrando como o SALT realmente funciona:

Etapa 1: Destilação de Conhecimento

  • Um modelo de linguagem menor (SLM) atua como professor, compartilhando seu entendimento com o modelo maior
  • O modelo menor se concentra em transferir seu “conhecimento aprendido” por meio do que os pesquisadores chamam de “rótulos macios”
  • Pense nisso como um assistente de ensino lidando com conceitos fundamentais antes que um estudante passe para tópicos avançados
  • Essa etapa é particularmente eficaz em “regiões fáceis” de aprendizado – áreas onde o modelo menor tem confiança preditiva forte

Etapa 2: Aprendizado Auto-Supervisionado

  • O modelo grande transita para o aprendizado independente
  • Ele se concentra em dominar padrões complexos e tarefas desafiadoras
  • É aqui que o modelo desenvolve capacidades além do que seu “professor” menor poderia fornecer
  • A transição entre as etapas usa estratégias cuidadosamente projetadas, incluindo decadência linear e decadência de razão linear do peso de perda de destilação

Em termos não técnicos, imagine que o modelo de IA menor é como um tutor útil que guia o modelo maior nas etapas iniciais de treinamento. Esse tutor fornece informações extras juntamente com suas respostas, indicando quão confiante ele está sobre cada resposta. Essas informações extras, conhecidas como “rótulos macios”, ajudam o modelo maior a aprender mais rapidamente e de forma mais eficaz.

Agora, à medida que o modelo de IA maior se torna mais capaz, ele precisa transitar de confiar no tutor para aprender de forma independente. É aqui que a “decadência linear” e a “decadência de razão linear” entram em jogo.
Pense nisso como reduzir gradualmente a influência do tutor com o tempo:
  • Decadência Linear: É como diminuir gradualmente o volume da voz do tutor. A orientação do tutor se torna menos proeminente a cada passo, permitindo que o modelo maior se concentre mais em aprender a partir dos dados brutos em si.
  • Decadência de Razão Linear: É como ajustar o equilíbrio entre o conselho do tutor e a tarefa em si. À medida que o treinamento avança, o foco muda mais para a tarefa original, enquanto a entrada do tutor se torna menos dominante.
O objetivo de ambas as técnicas é garantir uma transição suave para o modelo de IA maior, evitando quaisquer mudanças abruptas em seu comportamento de aprendizado.

Os resultados são convincentes. Quando os pesquisadores do Google testaram o SALT usando um modelo de linguagem menor de 1,5 bilhão de parâmetros para treinar um modelo de linguagem maior de 2,8 bilhões de parâmetros no conjunto de dados Pile, eles viram:

  • Uma redução de 28% no tempo de treinamento em comparação com métodos tradicionais
  • Melhorias significativas no desempenho após ajuste fino:
    • A precisão dos problemas matemáticos saltou para 34,87% (em comparação com 31,84% da linha de base)
    • A compreensão da leitura atingiu 67% de precisão (em comparação com 63,7%)

Mas o que torna o SALT verdadeiramente inovador é sua estrutura teórica. Os pesquisadores descobriram que mesmo um modelo de professor “mais fraco” pode melhorar o desempenho do aluno, alcançando o que eles chamam de “comércio favorável entre viés e variância”. Em termos mais simples, o modelo menor ajuda o maior a aprender padrões fundamentais de forma mais eficiente, criando uma base mais forte para o aprendizado avançado.

Por que o SALT pode redefinir o campo de desenvolvimento de IA

Lembre-se de quando a computação em nuvem transformou quem podia iniciar uma empresa de tecnologia? O SALT pode fazer o mesmo para o desenvolvimento de IA.

Tenho acompanhado as inovações no treinamento de IA por anos, e a maioria dos avanços beneficiou principalmente os gigantes da tecnologia. Mas o SALT é diferente.

Aqui está o que isso pode significar para o futuro:

Para organizações com recursos limitados:

  • Você pode não precisar mais de infraestrutura de computação massiva para desenvolver modelos de IA capazes
  • Laboratórios de pesquisa menores e empresas podem experimentar o desenvolvimento de modelos personalizados
  • A redução de 28% no tempo de treinamento se traduz diretamente em menores custos de computação
  • Mais importante ainda, você pode começar com recursos computacionais modestos e ainda alcançar resultados profissionais

Para o cenário de desenvolvimento de IA:

  • Mais jogadores podem entrar no campo, levando a soluções de IA mais diversificadas e especializadas
  • Universidades e instituições de pesquisa podem realizar mais experimentos com seus recursos existentes
  • A barreira de entrada para a pesquisa de IA cai significativamente
  • Podemos ver novas aplicações em campos que anteriormente não podiam arcar com o desenvolvimento de IA

O que isso significa para o futuro

Ao usar modelos menores como professores, não estamos apenas tornando o treinamento de IA mais eficiente – também estamos mudando fundamentalmente quem pode participar do desenvolvimento de IA. As implicações vão muito além de melhorias técnicas.

Pontos principais a lembrar:

  • A redução de 28% no tempo de treinamento é a diferença entre iniciar um projeto de IA ou considerá-lo inacessível
  • As melhorias no desempenho (34,87% em problemas matemáticos, 67% em tarefas de leitura) mostram que a acessibilidade não significa necessariamente comprometer a qualidade
  • A abordagem do SALT prova que às vezes as melhores soluções vêm de repensar os fundamentos, em vez de apenas adicionar mais poder computacional

O que observar:

  1. Fique de olho em organizações menores iniciando o desenvolvimento de modelos de IA personalizados
  2. Observe novas aplicações em campos que anteriormente não podiam arcar com o desenvolvimento de IA
  3. Procure inovações em como os modelos menores são usados para tarefas especializadas

Lembre-se: O verdadeiro valor do SALT está em como ele pode redefinir quem pode inovar em IA. Seja você um diretor de laboratório de pesquisa, gerenciando uma equipe de tecnologia ou apenas interessado no desenvolvimento de IA, essa é a tipo de avanço que pode tornar sua próxima grande ideia possível. Talvez comece a pensar naquele projeto de IA que você achava inacessível. Ele pode ser mais possível do que você imaginava.

O SALT pode ser o catalisador para uma nova era no desenvolvimento de IA, permitindo que mais pessoas e organizações contribuam para o avanço da inteligência artificial.

Alex McFarland é um jornalista e escritor de IA que explora os últimos desenvolvimentos em inteligência artificial. Ele colaborou com inúmeras startups de IA e publicações em todo o mundo.