Modelos e plataformas de IA
Supercharging Large Language Models com Previsão de Múltiplos Tokens
Modelos de linguagem grande (LLMs) como GPT, LLaMA e outros conquistaram o mundo com sua notável capacidade de entender e gerar texto semelhante ao humano. No entanto, apesar de suas impressionantes capacidades, o método padrão de treinamento desses modelos, conhecido como “previsão de próximo token”, tem algumas limitações inerentes.
Na previsão de próximo token, o modelo é treinado para prever a próxima palavra em uma sequência, dado as palavras precedentes. Embora essa abordagem tenha se provado bem-sucedida, pode levar a modelos que lutam com dependências de longo alcance e tarefas de raciocínio complexas. Além disso, a discordância entre o regime de treinamento (forçamento do professor) e o processo de geração autoregressiva durante a inferência pode resultar em desempenho subótimo.
Um artigo de pesquisa recente por Gloeckle et al. (2024) da Meta AI apresenta um novo paradigma de treinamento chamado “previsão de múltiplos tokens” que visa abordar essas limitações e impulsionar os modelos de linguagem grande. Neste post, mergulharemos profundamente nos conceitos fundamentais, detalhes técnicos e implicações potenciais dessa pesquisa inovadora.
Previsão de Token Único: A Abordagem Convencional
Antes de mergulhar nos detalhes da previsão de múltiplos tokens, é essencial entender a abordagem convencional que tem sido a base do treinamento de modelos de linguagem grande por anos – previsão de token único, também conhecida como previsão de próximo token.
O Paradigma de Previsão de Próximo Token
No paradigma de previsão de próximo token, os modelos de linguagem são treinados para prever a próxima palavra em uma sequência, dado o contexto precedente. Mais formalmente, o modelo é encarregado de maximizar a probabilidade do próximo token xt+1, dado os tokens anteriores x1, x2, …, xt. Isso é feito minimizando a perda de entropia cruzada:
L = -Σt log P(xt+1 | x1, x2, …, xt)
Esse objetivo de treinamento simples, mas poderoso, tem sido a base de muitos modelos de linguagem grande bem-sucedidos, como GPT (Radford et al., 2018), BERT (Devlin et al., 2019) e suas variantes.
Forçamento do Professor e Geração Autoregressiva
A previsão de próximo token depende de uma técnica de treinamento chamada “forçamento do professor“, onde o modelo é fornecido com a verdade fundamental para cada token futuro durante o treinamento. Isso permite que o modelo aprenda com o contexto e sequências de destino corretos, facilitando um treinamento mais estável e eficiente.
No entanto, durante a inferência ou geração, o modelo opera de maneira autoregressiva, prevendo um token de cada vez com base nos tokens gerados anteriormente. Essa discordância entre o regime de treinamento (forçamento do professor) e o regime de inferência (geração autoregressiva) pode levar a discrepâncias potenciais e desempenho subótimo, especialmente para sequências mais longas ou tarefas de raciocínio complexas.
Limitações da Previsão de Próximo Token
Embora a previsão de próximo token tenha sido notavelmente bem-sucedida, também tem algumas limitações inerentes:
- Foco de Curto Prazo: Ao prever apenas o próximo token, o modelo pode lutar para capturar dependências de longo alcance e a estrutura e coerência gerais do texto, potencialmente levando a inconsistências ou gerações incoerentes.
- Fixação em Padrões Locais: Os modelos de previsão de próximo token podem se fixar em padrões locais nos dados de treinamento, tornando difícil generalizar para cenários fora da distribuição ou tarefas que exigem raciocínio mais abstrato.
- Capacidades de Raciocínio: Para tarefas que envolvem raciocínio multietapas, pensamento algorítmico ou operações lógicas complexas, a previsão de próximo token pode não fornecer viés inductivo ou representações suficientes para apoiar essas capacidades de forma eficaz.
- Ineficiência de Amostra: Devido à natureza local da previsão de próximo token, os modelos podem exigir conjuntos de dados de treinamento maiores para adquirir o conhecimento e as habilidades de raciocínio necessários, levando a potenciais ineficiências de amostra.
Essas limitações motivaram os pesquisadores a explorar paradigmas de treinamento alternativos, como a previsão de múltiplos tokens, que visa abordar algumas dessas limitações e desbloquear novas capacidades para os modelos de linguagem grande.
Ao contrastar a abordagem convencional de previsão de próximo token com a técnica nova de previsão de múltiplos tokens, os leitores podem apreciar melhor a motivação e os benefícios potenciais da última, preparando o terreno para uma exploração mais profunda dessa pesquisa inovadora.
O que é Previsão de Múltiplos Tokens?
A ideia-chave por trás da previsão de múltiplos tokens é treinar os modelos de linguagem para prever vários tokens futuros simultaneamente, em vez de apenas o próximo token. Especificamente, durante o treinamento, o modelo é encarregado de prever os próximos n tokens em cada posição no corpus de treinamento, usando n cabeçotes de saída independentes que operam sobre um tronco de modelo compartilhado.
Por exemplo, com uma configuração de previsão de 4 tokens, o modelo seria treinado para prever os próximos 4 tokens de uma vez, dado o contexto precedente. Essa abordagem encoraja o modelo a capturar dependências de longo alcance e a desenvolver uma melhor compreensão da estrutura e coerência gerais do texto.
Um Exemplo Simples
Para entender melhor o conceito de previsão de múltiplos tokens, consideremos um exemplo simples. Suponha que tenhamos a seguinte frase:
“O rápido raposo marrom salta sobre o cão preguiçoso.”
Na abordagem padrão de previsão de próximo token, o modelo seria treinado para prever a próxima palavra, dado o contexto. Por exemplo, dado o contexto “O rápido raposo marrom salta sobre o”, o modelo seria encarregado de prever a próxima palavra, “cão”.
Com a previsão de múltiplos tokens, no entanto, o modelo seria treinado para prever vários tokens futuros simultaneamente. Por exemplo, se definirmos n=4, o modelo seria treinado para prever os próximos 4 tokens de uma vez. Dado o mesmo contexto “O rápido raposo marrom salta sobre o”, o modelo seria encarregado de prever a sequência “cão preguiçoso “. (Observe o espaço após “cão” para indicar o fim da frase).
Ao treinar o modelo para prever vários tokens futuros simultaneamente, ele é encorajado a capturar dependências de longo alcance e a desenvolver uma melhor compreensão da estrutura e coerência gerais do texto.
Detalhes Técnicos
Os autores propõem uma arquitetura simples, mas eficaz, para implementar a previsão de múltiplos tokens. O modelo consiste em um tronco de transformador compartilhado que produz uma representação latente do contexto de entrada, seguido por n camadas de transformador independentes (cabeçotes de saída) que preveem os tokens futuros.
Durante o treinamento, as etapas de avanço e retrocesso são cuidadosamente orquestradas para minimizar a utilização de memória da GPU. O tronco compartilhado computa a representação latente, e então cada cabeçote de saída realiza sua etapa de avanço e retrocesso sequencialmente, acumulando gradientes no nível do tronco. Essa abordagem evita a materialização de todos os vetores de logit e seus gradientes simultaneamente, reduzindo a utilização de memória da GPU de O(nV + d) para O(V + d), onde V é o tamanho do vocabulário e d é a dimensão da representação latente.
A Implementação Eficiente em Termos de Memória
Um dos desafios no treinamento de previsores de múltiplos tokens é reduzir a utilização de memória da GPU. Como o tamanho do vocabulário (V) é normalmente muito maior do que a dimensão da representação latente (d), os vetores de logit se tornam o gargalo de utilização de memória da GPU.
Para abordar esse desafio, os autores propõem uma implementação eficiente em termos de memória que adapta cuidadosamente a sequência de operações de avanço e retrocesso. Em vez de materializar todos os logit e seus gradientes simultaneamente, a implementação computa as etapas de avanço e retrocesso para cada cabeçote de saída independente sequencialmente, acumulando gradientes no nível do tronco.
Essa abordagem evita armazenar todos os vetores de logit e seus gradientes em memória simultaneamente, reduzindo a utilização de memória da GPU de O(nV + d) para O(V + d), onde n é o número de tokens futuros sendo previstos.
Vantagens da Previsão de Múltiplos Tokens
O artigo de pesquisa apresenta várias vantagens convincentes do uso da previsão de múltiplos tokens para treinar modelos de linguagem grande:
- Melhoria da Eficiência de Amostra: Ao encorajar o modelo a prever vários tokens futuros simultaneamente, a previsão de múltiplos tokens impulsiona o modelo em direção a uma melhor eficiência de amostra. Os autores demonstram melhorias significativas no desempenho em tarefas de compreensão e geração de código, com modelos de até 13B parâmetros resolvendo cerca de 15% mais problemas em média.
- Inferência Mais Rápida: As cabeçotes de saída adicionais treinadas com a previsão de múltiplos tokens podem ser aproveitadas para a decodificação especulativa autoespeculativa, uma variante da decodificação especulativa que permite a previsão paralela de tokens. Isso resulta em tempos de inferência até 3x mais rápidos em uma ampla gama de tamanhos de lote, mesmo para modelos grandes.
- Promovendo Dependências de Longo Alcance: A previsão de múltiplos tokens encoraja o modelo a capturar dependências mais longas e padrões nos dados, o que é particularmente benéfico para tarefas que exigem compreensão e raciocínio sobre contextos mais amplos.
- Raciocínio Algorítmico: Os autores apresentam experimentos em tarefas sintéticas que demonstram a superioridade dos modelos de previsão de múltiplos tokens no desenvolvimento de cabeçotes de indução e capacidades de raciocínio algorítmico, especialmente para tamanhos de modelo menores.
- Coerência e Consistência: Ao treinar o modelo para prever vários tokens futuros simultaneamente, a previsão de múltiplos tokens encoraja o desenvolvimento de representações coerentes e consistentes. Isso é particularmente benéfico para tarefas que exigem a geração de texto mais longo e coerente, como histórias, artigos ou manuais instrutivos.
- Melhoria da Generalização: Os experimentos dos autores em tarefas sintéticas sugerem que os modelos de previsão de múltiplos tokens exibem melhores capacidades de generalização, especialmente em configurações fora da distribuição. Isso pode ser devido à capacidade do modelo de capturar padrões e dependências de longo alcance, o que pode ajudá-lo a extrapolar mais eficazmente para cenários não vistos.

Exemplos e Intuições
Para fornecer mais intuição sobre por que a previsão de múltiplos tokens funciona tão bem, consideremos alguns exemplos:
- Geração de Código: No contexto da geração de código, prever vários tokens simultaneamente pode ajudar o modelo a entender e gerar estruturas de código mais complexas. Por exemplo, ao gerar uma definição de função, prever apenas o próximo token pode não fornecer contexto suficiente para o modelo gerar a assinatura da função corretamente. No entanto, ao prever vários tokens simultaneamente, o modelo pode capturar melhor as dependências entre o nome da função, parâmetros e tipo de retorno, levando a uma geração de código mais precisa e coerente.
- Raciocínio de Linguagem Natural: Considere um cenário em que um modelo de linguagem é encarregado de responder a uma pergunta que exige raciocínio sobre várias etapas ou peças de informação. Ao prever vários tokens simultaneamente, o modelo pode capturar melhor as dependências entre os diferentes componentes do processo de raciocínio, levando a respostas mais coerentes e precisas.
- Geração de Texto de Longo Prazo: Ao gerar texto de longo prazo, como histórias, artigos ou relatórios, manter a coerência e a consistência ao longo de um período prolongado pode ser desafiador para os modelos de linguagem treinados com a previsão de próximo token. A previsão de múltiplos tokens encoraja o modelo a desenvolver representações que capturem a estrutura e o fluxo gerais do texto, potencialmente levando a gerações de longo prazo mais coerentes e consistentes.
Limitações e Direções Futuras
Embora os resultados apresentados no artigo sejam impressionantes, há algumas limitações e questões abertas que merecem investigação adicional:
- Número Ótimo de Tokens: O artigo explora diferentes valores de n (o número de tokens futuros a prever) e encontra que n=4 funciona bem para muitas tarefas. No entanto, o valor ótimo de n pode depender da tarefa específica, conjunto de dados e tamanho do modelo. Desenvolver métodos principais para determinar o n ótimo pode levar a melhorias adicionais de desempenho.
- Tamanho do Vocabulário e Tokenização: Os autores observam que o tamanho ótimo do vocabulário e a estratégia de tokenização para os modelos de previsão de múltiplos tokens podem ser diferentes daqueles usados para os modelos de previsão de próximo token. Explorar esse aspecto pode levar a melhores compromissos entre a compressão do comprimento da sequência e a eficiência computacional.
- Perdas de Previsão Auxiliares: Os autores sugerem que seu trabalho pode despertar interesse no desenvolvimento de perdas de previsão auxiliares novas para os modelos de linguagem grande, além da previsão de próximo token padrão. Investigar perdas auxiliares alternativas e suas combinações com a previsão de múltiplos tokens é uma direção de pesquisa emocionante.
- Entendimento Teórico: Embora o artigo forneça algumas intuições e evidências empíricas para a eficácia da previsão de múltiplos tokens, um entendimento teórico mais profundo de por que e como essa abordagem funciona tão bem seria valioso.
Conclusão
O artigo de pesquisa “Melhorando e Acelerando Modelos de Linguagem Grande via Previsão de Múltiplos Tokens” de Gloeckle et al. apresenta um novo paradigma de treinamento que tem o potencial de melhorar significativamente o desempenho e as capacidades dos modelos de linguagem grande. Ao treinar os modelos para prever vários tokens futuros simultaneamente, a previsão de múltiplos tokens encoraja o desenvolvimento de dependências de longo alcance, capacidades de raciocínio algorítmico e melhor eficiência de amostra.
A implementação técnica proposta pelos autores é elegante e computacionalmente eficiente, tornando-a viável para aplicar essa abordagem ao treinamento de modelos de linguagem grande em larga escala. Além disso, a capacidade de aproveitar a decodificação especulativa autoespeculativa para inferência mais rápida é uma vantagem prática significativa.
Embora ainda haja questões abertas e áreas para exploração adicional, essa pesquisa representa um passo emocionante para a frente no campo dos modelos de linguagem grande. À medida que a demanda por modelos de linguagem mais capazes e eficientes continua a crescer, a previsão de múltiplos tokens pode se tornar um componente-chave nos próximos sistemas de IA poderosos.















