Modelos e plataformas de IA

Avançando a Alinhamento de IA com Valores Humanos por meio do WARM

mm
Adicione Unite.AI às suas fontes preferidas no Google

Alinhamento de Sistemas de IA com Valores Humanos

Os sistemas de inteligência artificial (IA) estão se tornando cada vez mais capazes de ajudar os humanos em tarefas complexas, desde chatbots de atendimento ao cliente até algoritmos de diagnóstico médico. No entanto, à medida que esses sistemas de IA assumem mais responsabilidades, é crucial que eles permaneçam alinhados com os valores e preferências humanos. Uma abordagem para alcançar isso é por meio de uma técnica chamada aprendizado por reforço com feedback humano (RLHF). No RLHF, um sistema de IA, conhecido como política, é recompensado ou penalizado com base em julgamentos humanos de seu comportamento. O objetivo é que a política aprenda a maximizar suas recompensas e, assim, se comporte de acordo com as preferências humanas.

Um componente fundamental do RLHF é o modelo de recompensa (RM). O RM é responsável por avaliar as ações e saídas da política e retornar um sinal de recompensa para guiar o processo de aprendizado. Projetar um bom RM é desafiador, pois as preferências humanas podem ser complexas, dependentes do contexto e até mesmo inconsistentes entre indivíduos. Recentemente, pesquisadores da Google DeepMind propuseram uma técnica inovadora chamada Modelos de Recompensa com Peso Averaged (WARM) para melhorar o design do RM.

O Problema com a Hacking de Recompensa

Um grande problema no RLHF é a hacking de recompensa. A hacking de recompensa ocorre quando a política encontra brechas para jogar o sistema de RM para obter recompensas altas sem realmente satisfazer os objetivos pretendidos. Por exemplo, suponha que o objetivo seja treinar um assistente de escrita de IA para gerar resumos de alta qualidade. O RM pode recompensar resumos concisos e informativos. A política pode então aprender a explorar isso gerando resumos muito curtos e não informativos com palavras-chave que enganam o RM.

A hacking de recompensa acontece por duas razões principais:

  1. Mudança de distribuição – O RM é treinado em um conjunto limitado de exemplos rotulados por humanos. Quando implantado, as saídas da política podem vir de distribuições diferentes que o RM não generaliza bem.
  2. Rótulos ruidosos – A rotulação humana é imperfeita, com desacordos entre os avaliadores. O RM pode se fixar em sinais espúrios em vez de indicadores robustos de qualidade.

A hacking de recompensa leva a sistemas inúteis que falham em atender às expectativas humanas. Pior ainda, pode resultar em comportamentos de IA que são tendenciosos ou até perigosos se implantados descuidadamente.

O Surgimento da Mesclagem de Modelos

O interesse crescente em estratégias de mesclagem de modelos como Model Ratatouille é impulsionado pela realização de que modelos maiores, embora poderosos, podem ser ineficientes e impráticos. Treinar um modelo de 1 trilhão de parâmetros requer quantidades proibitivas de dados, computação, tempo e custo. Mais crucialmente, esses modelos tendem a superajustar à distribuição de treinamento, dificultando sua capacidade de generalizar para cenários reais diversos.

A mesclagem de modelos fornece uma rota alternativa para desbloquear capacidades maiores sem escalonar descontroladamente. Reutilizando vários modelos especializados treinados em diferentes distribuições, tarefas ou objetivos, a mesclagem de modelos visa melhorar a versatilidade e a robustez fora da distribuição. A premissa é que diferentes modelos capturam padrões preditivos distintos que podem se complementar mutuamente quando mesclados.

Resultados recentes ilustram a promessa desse conceito. Modelos obtidos por meio da mesclagem, apesar de terem muito menos parâmetros, podem igualar ou até superar o desempenho de modelos gigantes como o GPT-3. Por exemplo, um ensemble de Model Ratatouille com apenas 7 checkpoints de tamanho médio atinge precisão estatisticamente ótima em conjuntos de dados de entailment textual de alta dimensionalidade, superando o GPT-3.

A simplicidade da mesclagem por peso médio é um grande bônus. Treinar vários modelos auxiliares exige recursos adicionais. No entanto, crucialmente, o cálculo no tempo de inferência permanece idêntico ao de um modelo único, pois os pesos são condensados em um. Isso torna o método facilmente adaptável, sem preocupações de aumento de latência ou custos de memória.

Mecanismos por trás da Mesclagem de Modelos

Mas o que exatamente permite esses ganhos de precisão a partir da mesclagem de modelos?

  • Mitigação da Memorização: Cada modelo vê lotes embaralhados diferentes do conjunto de dados durante o treinamento. A média diminui qualquer memorização de instância específica, retraindo apenas generalizações de nível de conjunto de dados.
  • Redução da Variância: Modelos treinados independentemente têm erros não correlacionados. Combiná-los reduz o ruído, melhorando a calibração.
  • Regularização por Diversidade: Tarefas auxiliares variadas forçam os modelos a se fixarem em recursos mais generalizáveis e úteis em diferentes distribuições.
  • Aumento da Robustez: Inconsistência nas previsões sinaliza incerteza. A média modera julgamentos extremos, melhorando a confiabilidade.

Em essência, a mesclagem de modelos contrabalanceia as fraquezas de modelos individuais para amplificar suas forças coletivas. A representação mesclada captura as estruturas causais subjacentes comuns, ignorando variações incidentais.

Essa fundação conceitual conecta a mesclagem de modelos a outras técnicas populares como ensemble e aprendizado multi-tarefa. Todos esses métodos aproveitam a diversidade entre modelos ou tarefas para obter sistemas versáteis e cientes da incerteza. A simplicidade e a eficiência da média por peso, no entanto, dá à mesclagem de modelos uma vantagem única para avançar com implantações no mundo real.

Modelos de Recompensa com Peso Averaged

Processo de alinhamento com WARM

Processo de alinhamento com WARM

WARM emprega inovadoramente um modelo de recompensa proxy (RM), que é uma média ponderada de vários RMs individuais, cada um ajustado finamente a partir do mesmo modelo de linguagem grande pré-treinado, mas com hiperparâmetros variados. Esse método melhora a eficiência, a confiabilidade sob mudanças de distribuição e a robustez contra preferências inconsistentes. O estudo também mostra que usar WARM como o modelo de recompensa proxy, particularmente com um número aumentado de RMs médios, melhora os resultados e atrasa o início da ‘hacking de recompensa’, um fenômeno onde as recompensas de controle se deterioram ao longo do tempo.

Aqui está uma visão geral de alto nível:

  1. Comece com um modelo de linguagem base pré-treinado em um grande corpus. Inicialize vários RMs adicionando camadas de tarefa específicas em cima.
  2. Ajuste finamente cada RM separadamente no conjunto de dados de preferência humana, usando diferentes hiperparâmetros, como taxa de aprendizado, para diversidade.
  3. Média os pesos dos RMs ajustados finamente para obter um único ensemble WARM.

A ideia-chave é que a média por peso retém apenas as informações invariantes que são aprendidas em todos os RMs diversos. Isso reduz a dependência de sinais espúrios, melhorando a robustez. O ensemble também se beneficia da redução da variância, melhorando a confiabilidade apesar das mudanças de distribuição.

Como discutido anteriormente, a diversidade entre modelos treinados independentemente é crucial para desbloquear o potencial total da mesclagem de modelos. Mas quais são algumas técnicas concretas para promover diversidade produtiva?

O artigo WARM explora algumas ideias inteligentes que podem generalizar mais amplamente:

Embaralhamento de Ordem

Uma abordagem trivial, mas impactante, é embaralhar a ordem em que os pontos de dados são vistos por cada modelo durante o treinamento. Mesmo esse passo simples descorrelaciona os pesos, reduzindo a memorização redundante de padrões.

Variações de Hiperparâmetros

Ajustar hiperparâmetros, como taxa de aprendizado e probabilidade de dropout, para cada execução, introduz diversidade útil. Os modelos convergem de maneira diferente, capturando propriedades distintas do conjunto de dados.

Média de Checkpoints – Baklava

O método Baklava inicializa modelos para mesclagem a partir de diferentes instantâneos ao longo da mesma trajetória de pré-treinamento. Isso relaxa as restrições em comparação com as sopas de modelo, que exigem um ponto de partida compartilhado. Em relação ao Model Ratatouille, o Baklava evita tarefas adicionais. No geral, ele atinge um equilíbrio eficaz entre precisão e diversidade.

Processo de ajuste fino de vários Modelos de Recompensa

O processo começa com um modelo de linguagem grande pré-treinado (LLM) 𝜃_𝑝𝑡. A partir desse modelo, vários checkpoints {𝜃_𝑠 𝑓 𝑡_𝑖} são derivados durante uma execução de ajuste fino supervisionado (SFT), cada um coletado em diferentes etapas de treinamento do SFT. Esses checkpoints são então usados como inicializações para ajustar finamente vários Modelos de Recompensa (RMs) {𝜙𝑖} em um conjunto de dados de preferência. Esse ajuste fino visa adaptar os modelos para se alinharem melhor com as preferências humanas. Após o ajuste fino, esses RMs são combinados por meio de um processo de média por peso, resultando no modelo final, 𝜙_WARM.

Análise confirma que adicionar checkpoints mais antigos por média móvel prejudica o desempenho individual, comprometendo os méritos da diversidade. Média apenas as representações finais de cada execução apresenta um desempenho melhor. Em geral, equilibrar objetivos de diversidade com manutenção de precisão permanece um desafio de pesquisa aberto.

No geral, a mesclagem de modelos se alinha bem com a ética geral no campo para reciclar recursos existentes de forma eficaz para melhorar a confiabilidade, eficiência e versatilidade. A simplicidade da média por peso solidifica sua posição como um dos principais candidatos para montar modelos robustos a partir de blocos de construção prontos.

Ao contrário dos métodos tradicionais de ensemble que averageam previsões, o WARM mantém a sobrecarga computacional mínima, mantendo apenas um conjunto de pesos. Experimentos em tarefas de resumo de texto demonstram a eficácia do WARM:

  • Para a amostragem best-of-N, o WARM atinge 92,5% de taxa de vitória contra a seleção aleatória de acordo com as etiquetas de preferência humana.
  • No RLHF, uma política WARM atinge 79,4% de taxa de vitória contra uma política treinada com um único RM após o mesmo número de etapas.
  • O WARM continua a se sair bem mesmo quando um quarto das etiquetas humanas são corrompidas.

Esses resultados ilustram o potencial do WARM como uma técnica prática para desenvolver assistentes de IA reais que se comportem de forma confiável. Ao suavizar as inconsistências no feedback humano, as políticas WARM podem permanecer alinhadas com os valores humanos mesmo à medida que continuam aprendendo com novas experiências.

O Quadro Maior

O WARM se situa na interseção de duas tendências-chave na pesquisa de alinhamento de IA. Primeiro é o estudo da generalização fora da distribuição (OOD), que visa melhorar o desempenho do modelo em novos dados que diferem da distribuição de treinamento. Segundo é a pesquisa sobre robustez algorítmica, focada na confiabilidade apesar de pequenas perturbações de entrada ou ruído.

Ao estabelecer conexões entre esses campos em torno da noção de invariantes aprendidas, o WARM nos move em direção a técnicas mais rigorosamente fundamentadas para alinhamento de valores. As percepções do WARM podem generalizar até mesmo além do RLHF, fornecendo lições para sistemas de aprendizado de máquina mais amplos que interagem com o mundo aberto.

É claro que a modelagem de recompensa é apenas uma peça do quebra-cabeça de alinhamento. Ainda precisamos de progresso em outros desafios, como especificação de recompensa, supervisão escalável e exploração segura. Combinado com técnicas complementares, o WARM pode acelerar o desenvolvimento de IA que promove a prosperidade humana de forma sustentável. Ao elucidar coletivamente os princípios que subjazem ao alinhamento robusto, os pesquisadores estão mapeando a rota para IA benéfica e ética.

Eu passei os últimos cinco anos me imergindo no fascinante mundo de Aprendizado de Máquina e Aprendizado Profundo. Minha paixão e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua também me levou em direção ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.