Modelos e plataformas de IA

Reflection 70B: LLM com Cognição de Autocorreção e Desempenho Líder

mm
Adicione Unite.AI às suas fontes preferidas no Google
Reflection 70B, large language models, AI self-correction, Reflection-Tuning, open-source AI, HyperWrite

Reflection 70B é um modelo de linguagem grande (LLM) de código aberto desenvolvido pela HyperWrite. Este novo modelo introduz uma abordagem para a cognição da IA que pode redefinir como interagimos e nos apoiamos em sistemas de IA em diversas áreas, desde processamento de linguagem até resolução de problemas avançados.

Ao utilizar Reflection-Tuning, uma técnica inovadora que permite que o modelo se autoavalie e corrija seus próprios erros em tempo real, o Reflection 70B rapidamente alcançou o topo, superando modelos proprietários como GPT-4 e Claude 3.5 Sonnet em várias benchmarks, incluindo MMLU, MATH e HumanEval.

O Reflection 70B é construído sobre a robusta arquitetura Llama 3.1-70B, mas seu mecanismo de auto-aperfeiçoamento o distingue. Através de ciclos iterativos de reflexão, detecção de erros e refinamento de saída, o modelo imita a cognição humana de uma maneira sem precedentes, empurrando os limites do que a IA pode alcançar. Como resultado, o Reflection 70B oferece não apenas precisão inigualável, mas também insights mais profundos sobre seu processo de tomada de decisões, uma característica crítica para aplicações onde transparência e precisão são fundamentais.

O que é Reflection 70B

Em seu núcleo, o Reflection 70B é construído sobre o modelo Instruct Llama 3.1-70B de código aberto da Meta. No entanto, o que realmente o distingue é sua capacidade única de engajar-se em um processo semelhante à reflexão humana — daí seu nome. Essa capacidade decorre de uma técnica chamada “Reflection-Tuning“, que permite que o modelo identifique e corrija seus próprios erros em tempo real, melhorando assim sua precisão e confiabilidade.

Matt Shumer, CEO da HyperWrite, apresentou o Reflection 70B com a declaração ousada de que é “o modelo de IA de código aberto mais poderoso do mundo.” Mas o que exatamente torna este modelo tão especial, e como ele se compara a gigantes da indústria como GPT-4 e Claude 3.5 Sonnet? Vamos explorar.

Entendendo o Reflection-Tuning Seletivo: Uma Mudança de Paradigma no Treinamento de IA

O Reflection-Tuning seletivo introduz uma abordagem para o ajuste de instruções, onde o objetivo é melhorar tanto a qualidade dos dados de instrução quanto sua compatibilidade com o modelo de estudante que está sendo ajustado. Métodos tradicionais frequentemente se concentram em melhorar os dados em si, mas ignoram como os pares de dados aprimorados se alinham com os objetivos de aprendizado do modelo. O Reflection-Tuning seletivo preenche essa lacuna, promovendo uma colaboração entre professor e estudante, onde um modelo de professor reflete sobre os dados e fornece pares de instrução-resposta refinados, enquanto o modelo de estudante avalia e seleciona apenas as melhorias que atendem melhor às suas necessidades de treinamento.

Método de Reflection-Tuning seletivo, mostrando a colaboração entre um modelo de professor e um modelo de estudante

O processo consiste em duas fases principais:

  1. Reflexão Seletiva de Instrução: O modelo de professor reflete sobre a instrução de uma amostra dada e gera um par de instrução-resposta refinado. O modelo de estudante avalia se essa nova instrução é benéfica com base em uma métrica chamada Dificuldade de Seguir Instrução (IFD). A pontuação IFD avalia a dificuldade da amostra para o modelo de estudante, garantindo que apenas os dados que desafiam o modelo de forma apropriada sejam retidos.
  2. Reflexão Seletiva de Resposta: Nesta fase, o modelo de professor reflete sobre as respostas geradas na primeira fase. O modelo de estudante avalia essas respostas usando Dificuldade de Seguir Instrução Reversa (r-IFD), uma métrica que mede quão factível é para o estudante deduzir a instrução com base na resposta. Isso garante que a resposta não apenas melhore a capacidade de raciocínio do modelo, mas também se alinhe bem com o conhecimento existente do estudante.

Ao aplicar tanto IFD quanto r-IFD, o Reflection-Tuning seletivo produz pares de dados que são desafiadores, mas factíveis, melhorando o processo de ajuste de instruções sem a necessidade de conjuntos de dados adicionais. O resultado é um LLM mais eficiente em termos de amostras e de alto desempenho que supera muitos modelos maiores.

A Arquitetura do Pensamento: Como o Reflection 70B “Pensa”

A arquitetura subjacente do Reflection 70B leva o raciocínio da IA a um novo nível, dividindo o processo de pensamento em várias etapas. Cada etapa permite que o modelo melhore iterativamente através da auto-reflexão, muito como a cognição humana:

  1. Dados Iniciais e Resposta: O modelo começa gerando uma resposta à instrução dada. Essa saída inicial é semelhante às saídas padrão de LLM.
  2. Reflexão Seletiva de Instrução: Após gerar a resposta inicial, o modelo entra na fase de reflexão da instrução. O modelo de professor reflete sobre a instrução original e sugere melhorias. Essas sugestões são então avaliadas pelo modelo de estudante usando a pontuação IFD para determinar se o novo par de instrução-resposta é mais adequado para ajuste adicional.
  3. Reflexão Seletiva de Resposta: Seguindo a reflexão sobre a instrução, o modelo passa a refinar a resposta em si. Aqui, o modelo de professor gera uma nova resposta com base na instrução atualizada. O modelo de estudante, usando a pontuação r-IFD, avalia se a nova resposta ajuda a deduzir a instrução de forma mais eficiente.
  4. Ajuste Final de Instrução: Uma vez que o melhor par de instrução-resposta é escolhido, ele é adicionado ao conjunto de dados final usado para ajustar o modelo. Esse processo de múltiplas etapas garante que apenas os pares de instrução-resposta mais eficazes e coerentes sejam incluídos nos dados de ajuste.

Esse processo de reflexão estruturado permite que os usuários vejam como o modelo itera através de seu processo de pensamento, criando transparência e melhorando significativamente a precisão e a consistência em tarefas complexas.

Avaliação do Desempenho: Reflection 70B em Ação

O uso do Reflection-Tuning seletivo pelo Reflection 70B não apenas oferece um processo de treinamento mais sofisticado, mas também alcança desempenho de liderança em várias benchmarks. Através de seu mecanismo de auto-avaliação, o modelo supera modelos proprietários que são significativamente maiores em tamanho.

  1. MMLU (Massive Multitask Language Understanding): O Reflection 70B marcou um impressionante 72,2%, superando outros grandes modelos de código aberto como LLaMA 2.
  2. Benchmark de Matemática: Em tarefas de raciocínio matemático, o modelo superou o GPT-4 e o Claude 3.5 por uma margem considerável, demonstrando sua força em lidar com cenários de resolução de problemas complexos.
  3. IFEval e GSM8K: O Reflection 70B também se destacou no IFEval, onde sua coerência entre instrução e resposta foi avaliada, e no GSM8K, um benchmark de resolução de problemas matemáticos. O ajuste de reflexão permitiu que o modelo lidasse com problemas intricados e nuances de forma mais eficaz do que seus concorrentes maiores.

Ao utilizar o Reflection-Tuning seletivo, o Reflection 70B demonstrou que tamanho não é o único fator para alcançar alto desempenho. A capacidade de se autocorrigir e refletir sobre suas saídas levou a raciocínio mais forte e coerente, permitindo que ele supere modelos com mais parâmetros.

Gráfico comparando o desempenho do sRecycled WizardLM 7B contra outros modelos como Zephyr 7B Beta, Vicuna 13B v1.3 e LLaMA2 Chat 7B. O gráfico destaca o forte desempenho do sRecycled WizardLM 7B, com uma quebra detalhada de vitórias, empates e derrotas em diferentes modelos

Comparação de Desempenho do sRecycled WizardLM 7B contra Outros Modelos

Aplicações no Mundo Real: Aproveitando o Potencial do Reflection 70B

A correção de erros em tempo real e a tomada de decisões transparente do Reflection 70B abrem novas portas em várias áreas. Aqui estão alguns casos de uso no mundo real:

Resolução de Problemas Complexos

A força do Reflection 70B reside em lidar com problemas complexos. Considere uma consulta matemática desafiadora:


<p>Usuário: &quot;Resolva a equação: 2x^2 + 5x - 3 = 0&quot;
Reflection 70B:</p>

<p>&lt;pensando&gt; Aplicando a fórmula quadrática...&lt;/pensando&gt;
&lt;reflexão&gt; Uma correção no cálculo...&lt;/reflexão&gt;
&lt;saída&gt; As soluções são x = 1/2 e x = -3.&lt;/saída&gt;

Tradução de Linguagem com Sensibilidade Cultural

Ao contrário dos modelos de tradução típicos, o Reflection 70B adapta as traduções de linguagem aos contextos culturais:

Usuário: &quot;Traduzir &#039;Está chovendo gatos e cães&#039; para francês, considerando o contexto cultural.&quot;
Reflection 70B:

<p>pensando: A tradução literal seria &quot;Il pleut des chats et des chiens&quot;...pensando;
reflexão: Uma tradução culturalmente apropriada seria &quot;Il pleut des cordes.&quot;reflexão;
saída: Tradução fornecida.

Melhorando a Depuração e Otimização de Código

As capacidades de correção de erros do Reflection 70B o tornam ideal para depuração e otimização de código:

Usuário: &quot;Depurar este código Python...&quot;
Reflection 70B: &lt;pensando&gt; Analisando passo a passo...&lt;/pensando&gt;
&lt;reflexão&gt; Identificada recursividade infinita.&lt;/reflexão&gt;
&lt;saída&gt; Versão corrigida do código com recursividade apropriada.&lt;/saída&gt;

Expansão do Paisagem Competitiva de Modelos 70B

Enquanto o Reflection 70B está fazendo ondas, ele é parte de um ecossistema mais amplo de modelos com 70 bilhões de parâmetros. Aqui está como ele se compara a outros:

  • Llama 3.1-70B da Meta: Modelo de base forte conhecido por aplicações de propósito geral.
  • Claude 2 70B (Anthropic): Focado em IA ética, habilidoso em raciocínio e geração de conteúdo de longa forma.
  • GPT-3.5 70B (OpenAI): Uma versão mais leve do GPT-4, se destacando no equilíbrio entre desempenho e eficiência.
  • BLOOM 70B: Multilíngue, treinado em linguagens naturais e de programação.
  • Falcon 70B: Notado por sua eficiência de treinamento e inferência.

Executando Modelos 70B de Forma Eficiente: Técnicas Mais Recentes

Executar modelos desse tamanho de forma eficiente não é uma tarefa fácil. Para maximizar o desempenho, aqui estão as estratégias mais recentes:

1. Quantização

Reduzir a precisão do peso do modelo ajuda a reduzir o uso de memória e os tempos de inferência. Técnicas de quantização de 4 bits usando BitsAndBytes permitem que o Reflection 70B execute de forma eficiente em GPUs menores.

Exemplo:

from transformers import AutoModelForCausalLM
model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-2-70b-hf", load_in_4bit=True)

2. Fragmentação de Modelo

Dividir o modelo em múltiplos GPUs (por exemplo, usando DeepSpeed Zero) permite lidar com modelos maiores sem exceder a memória da GPU.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

3. Precisão Mista e Atenção Eficiente

FlashAttention e xformers reduzem a sobrecarga de atenção, melhorando os tempos de processamento para sequências de entrada grandes.

from xformers.ops import memory_efficient_attention
model.attention = memory_efficient_attention

4. Descarga para CPU e Poda

A descarga para CPU e a poda de pesos menos críticos ajudam a executar modelos em hardware mais modesto, mantendo o desempenho.

from accelerate import cpu_offload
model = cpu_offload(model)

Olhando para o Futuro: O Futuro com Reflection 405B

A próxima fronteira para a HyperWrite é o desenvolvimento do Reflection 405B, um modelo que deve superar o Reflection 70B em escala e desempenho. Este modelo visa empurrar os limites da IA de código aberto, posicionando-se para desafiar até mesmo os modelos proprietários mais avançados, como o GPT-5.

Conclusão

Através do Reflection-Tuning, o Reflection 70B alcançou desempenho de liderança em benchmarks-chave, mantendo um nível de transparência e precisão raramente visto em IA de código aberto. Sua capacidade de autocorreção lhe dá uma vantagem distinta, especialmente em campos que exigem altos níveis de precisão, como codificação, tradução de linguagem e resolução de problemas complexos.

Eu passei os últimos cinco anos me imergindo no fascinante mundo de Aprendizado de Máquina e Aprendizado Profundo. Minha paixão e expertise me levaram a contribuir para mais de 50 projetos de engenharia de software diversificados, com um foco particular em IA/ML. Minha curiosidade contínua também me levou em direção ao Processamento de Linguagem Natural, um campo que estou ansioso para explorar mais.