Engenharia de prompts
Treinamento de Embeddings de Texto Aprimorado com Modelos de Linguagem Grande

As embeddings de texto são representações vetoriais de palavras, frases, parágrafos ou documentos que capturam seu significado semântico. Elas servem como um bloco de construção fundamental em muitas aplicações de processamento de linguagem natural (NLP) hoje, incluindo recuperação de informações, resposta a perguntas, busca semântica e mais.
Os avanços recentes em modelos de linguagem grande (LLMs) como o GPT-3 mostraram capacidades impressionantes em aprendizado de poucos exemplos e geração de linguagem natural. Podemos aproveitar os LLMs para também avançar o estado das embeddings de texto? No artigo “Melhorando as Embeddings de Texto com Modelos de Linguagem Grande“, pesquisadores da Microsoft (MSFT ) propõem um método novo que alcança resultados superiores gerando dados de treinamento sintéticos com LLMs e ajustando-os.
Desafios com Métodos Existentes
As técnicas tradicionais de embeddings de texto, como médias ponderadas de vetores de palavras ou TF-IDF, falham em capturar adequadamente a rica informação contextual no texto. Métodos mais recentes baseados em modelos de linguagem pré-treinados, como o BERT, obtêm embeddings mais conscientes do contexto.
No entanto, eles exigem pipelines de treinamento complexos e multietapas:
- Pré-treinamento em bilhões de pares de texto fracamente rotulados ou artificiais
- Ajuste em conjuntos de dados limitados e curados manualmente
Isso exige recursos computacionais massivos e esforço humano para coleta de dados. Os dados de treinamento também são limitados em diversidade e cobertura linguística. Por exemplo, o benchmark BEIR compreende conjuntos de dados para apenas 15 tarefas de recuperação em inglês.
Os métodos existentes usam principalmente arquiteturas menores do tipo BERT como modelo de base. Eles não conseguem aproveitar LLMs mais avançados e técnicas relacionadas.
Metodologia: Geração de Dados Sintéticos com LLMs
Para superar essas limitações, os pesquisadores propõem uma abordagem de treinamento de uma única etapa que aproveita LLMs como o GPT-3 e o GPT-4 para gerar dados de treinamento sintéticos diversificados.
As etapas principais são:
- Taxonomia de Tarefas: Definir uma taxonomia que categorize as tarefas de embeddings de texto em:
- Tarefas assimétricas (consulta e documento não são paráfrases, por exemplo, busca)
- Tarefas simétricas (consulta e documento são paráfrases, por exemplo, semelhança semântica)
- Projeto de Prompt: Criar modelos de prompt personalizados para cada tipo de tarefa que orientem o LLM a gerar exemplos de treinamento relevantes.
- Geração de Dados Sintéticos: Usar o LLM com os prompts projetados para gerar centenas de milhares de pares de (consulta, documento) que cubram uma ampla variedade de tarefas semânticas em 93 idiomas.
- Treinamento do Modelo: Ajustar um modelo LLM de código aberto poderoso, como o Mistral, nos dados sintéticos usando perda contrastiva.
Essa metodologia permite criar dados de treinamento amplos para tarefas diversificadas em vários idiomas sem qualquer esforço de rotulagem humana. Aproveitando o conhecimento já incorporado nos LLMs por meio do pré-treinamento em corpora de escala web, podemos sintetizar dados de alta qualidade precisamente adaptados para embeddings de texto.
Os pesquisadores demonstram isso com uma estratégia de prompt de 2 etapas:
- Promptar o GPT-4 para sugerir tarefas de recuperação potenciais
- Promptar novamente para gerar pares de (consulta, documento) com base nas tarefas sugeridas
Alguns aspectos importantes do projeto de prompt:
- Prompts de linguagem natural para instruções intuitivas e humanas
- Placeholders para encorajar diversidade (por exemplo, comprimento da consulta, clareza, comprimento do documento)
- Combinação de dados de múltiplos modelos para o mesmo tipo de tarefa
- Ponderação de idiomas com base na disponibilidade de recursos
No total, eles conseguiram gerar 500 mil exemplos de embeddings de texto a um custo computacional de 180 milhões de tokens. O idioma dominante foi o inglês (43%), seguido pelo polonês, japonês, italiano e outros.
Para o treinamento do modelo, eles optaram por ajustar o modelo Mistral de 7 bilhões de parâmetros de código aberto em vez de arquiteturas menores do tipo BERT. Como o Mistral já foi pré-treinado em corpora de texto em escala web, não foi necessário pré-treinamento contrastivo adicional. Adicionar isso proporcionou melhorias negligenciáveis.
O ajuste completo levou menos de 1.000 etapas, usando uma combinação de dados sintéticos e humanos rotulados. Isso demonstra a eficiência da amostra da abordagem proposta.
Resultados
Os pesquisadores avaliaram seu modelo no benchmark MTEB, que cobre tarefas diversificadas em classificação, agrupamento, semelhança semântica, resumo e recuperação de informações.
Seu modelo superou o estado da arte anterior em 2,4 pontos na pontuação média, estabelecendo novos recordes para quase todas as categorias:
| Modelo | Antigo Estado da Arte | Modelo Proposto |
|---|---|---|
| Classificação | 76,0 | 78,5 |
| Agrupamento | 46,1 | 50,3 |
| Classificação de Pares | 87,1 | 88,3 |
| Reclassificação | 60,0 | 60,2 |
| Recuperação | 54,3 | 56,9 |
| STS | 83,1 | 84,6 |
| Resumo | 31,6 | 31,4 |
| Média | 64,2 | 66,6 |
Notavelmente, mesmo sem usar dados rotulados e treinando apenas em dados sintéticos, alcançou precisão competitiva – apenas 3,5 pontos atrás do modelo totalmente supervisionado. Isso demonstra a viabilidade de gerar embeddings de texto apenas usando LLMs, sem esforço de rotulagem humana.
Os pesquisadores também avaliaram no benchmark multilíngue MIRACL, que cobre 18 idiomas. Seu modelo superou o melhor anterior em idiomas de alta recursos, mas foi mais fraco em idiomas de baixa recursos. Eles hipotetizam que isso poderia ser mitigado pré-treinando LLMs mais extensivamente em idiomas de baixa recursos.
Em resumo, as embeddings de texto treinadas em dados sintéticos gerados por LLMs estabelecem novos resultados de estado da arte, enquanto usam treinamento mais simples e eficiente em comparação com as abordagens multietapas anteriores. Com mais pesquisas em engenharia de prompts e qualidade de dados sintéticos, essa metodologia poderia avançar significativamente as embeddings de texto multilíngues.
Análise
Esse trabalho oferece várias conclusões valiosas:
- Os LLMs como o GPT-3 e o GPT-4 têm uma capacidade impressionante de gerar dados de treinamento sintéticos de alta qualidade para tarefas de NLP diversificadas quando promptados adequadamente. Isso pode reduzir a dependência de dados rotulados humanos.
- Para as embeddings de texto, o pré-treinamento contrastivo fornece ganhos negligenciáveis sobre o ajuste de modelos como o Mistral que já têm pré-treinamento em escala de trilhões. Isso é uma percepção importante sobre a eficiência do treinamento.
- Os métodos de geração aumentada por recuperação permitem que os LLMs acessem dinamicamente conhecimento externo. Melhorar as embeddings de texto é valioso para melhorar esses LLMs.
- Há um espaço significativo para melhoria em idiomas de baixa recursos. LLMs multilíngues pré-treinados em dados mais representativos poderiam ajudar a fechar essa lacuna.
- Conceitualmente, modelagem de linguagem e embeddings de texto são dois lados da mesma moeda – compreender a semântica da linguagem. Com prompts de dados sintéticos, os LLMs podem ser ajustados organicamente em embedders sem pipelines complexas.
Algumas direções promissoras para trabalhos futuros incluem:
- Aproveitar LLMs de código aberto como o GPT-NeoX para gerar dados sintéticos
- Explorar ajustes leves pós-treinamento para adaptar embedders a contextos mais longos
- Desenvolvimento de técnicas de engenharia de prompts para controlar a qualidade e a cobertura de tarefas
- Métodos para melhorar a latência de inferência e os custos de armazenamento para uso industrial
Além de superar os benchmarks, empregar LLMs para melhorar as embeddings de texto abre possibilidades intrigantes para o futuro. À medida que os LLMs continuam a avançar em sua compreensão da linguagem natural, sua capacidade de gerar dados sintéticos de alta fidelidade provavelmente melhorará também.
No entanto, direções críticas de pesquisa permanecem para traduzir esse potencial em impacto real.
Customização e Controle
Um benefício-chave dos dados sintéticos é a capacidade de gerar exemplos personalizados para necessidades específicas. Como o artigo demonstrou, a engenharia de prompts permite criar dados de treinamento para centenas de milhares de tarefas de embeddings.
No entanto, as práticas atuais de design de prompts ainda são mais arte do que ciência. Desenvolver métodos sistemáticos e reprodutíveis para controlar as propriedades dos dados gerados expandiria a aplicabilidade dessa técnica.
Por exemplo, técnicas para modular fatores como complexidade, ambiguidade e novidade de exemplos poderiam ajudar a resolver questões de robustez em tarefas downstream. A geração dinâmica de prompts para corresponder a distribuições reais em evolução é outro desafio aberto.
Treinamento em Escala
Embora os LLMs pré-treinados já codifiquem conhecimento linguístico substancial, suas habilidades de geração de dados provavelmente melhorarão com mais escala. Modelos como o GPT-4, treinados em trilhões de tokens de texto da internet, exibem aprendizado de poucos exemplos forte, mas não foram otimizados especificamente para sintetizar dados de treinamento.
Arquiteturas e objetivos personalizados para inicializar a geração de dados auto-supervisionada em escala web poderiam avançar significativamente a qualidade e a eficiência dessa metodologia. A integração eficiente do conhecimento recuperado para complementar o conhecimento aprendido é outra direção promissora.
Multitarefa e Multilíngue
Como o artigo notou, melhorar o desempenho em idiomas de baixa recursos permanece um problema. Em vez de pré-treinar um único LLM massive, uma alternativa é treinar uma frota de modelos especializados menores que se especializam em modalidades de dados ou domínios linguísticos específicos.
Uma abordagem de ensemble poderia ajudar a melhorar a cobertura sobre tarefas e idiomas raros compartilhando representações aprendidas entre especialistas. O aprendizado contínuo para expandir a expertise linguística e de tarefa ao longo do tempo também é uma perspectiva emocionante.
Em conclusão, este artigo introduz um conceito inovador de sintetizar dados de treinamento a partir de LLMs para criar embeddings de texto performáticos. Os resultados demonstram a eficácia dessa metodologia, superando benchmarks anteriores. À medida que os LLMs e as técnicas de dados sintéticos progredirem, aproveitar seu conhecimento para treinar embedders poderia se tornar uma direção altamente promissora.















