Prompt engineering

Formation améliorée d’embeddings de texte à l’aide de grands modèles de langage

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les embeddings de texte sont des représentations vectorielles de mots, de phrases, de paragraphes ou de documents qui capturent leur signification sémantique. Ils servent de bloc de construction de base dans de nombreuses applications de traitement automatique des langues (TAL) aujourd’hui, notamment la recherche d’information, la réponse à des questions, la recherche sémantique et bien plus encore.

vector embedding

vector embedding

Les progrès récents dans les grands modèles de langage (LLM) comme GPT-3 ont montré des capacités impressionnantes dans l’apprentissage en quelques exemples et la génération de langage naturel. Pouvez-vous exploiter les LLM pour améliorer également l’état des embeddings de texte ? Dans leur article “Amélioration des embeddings de texte avec les grands modèles de langage“, les chercheurs de Microsoft (MSFT ) proposent une méthode novatrice qui obtient des résultats supérieurs en générant des données de formation synthétiques avec les LLM et en les affinant.

Les défis des méthodes existantes

Les techniques traditionnelles d’embedding de texte comme les moyennes pondérées des vecteurs de mots ou TF-IDF ne parviennent pas à capturer adéquatement les informations contextuelles riches du texte. Les méthodes plus récentes basées sur des modèles de langage pré-entraînés comme BERT obtiennent de bien meilleurs embeddings sensibles au contexte.

Cependant, elles nécessitent des pipelines de formation complexes en plusieurs étapes:

  • Pré-entraînement sur des milliards de paires de texte faiblement étiquetées ou artificielles
  • Affinement sur des ensembles de données limités et soigneusement sélectionnés

Cela exige des ressources de calcul massives et un effort humain important pour la collecte de données. Les données de formation sont également limitées en diversité et en couverture linguistique. Par exemple, le référentiel BEIR comprend des ensembles de données pour seulement 15 tâches de récupération en anglais.

Les méthodes existantes utilisent principalement des architectures de type BERT plus petites comme modèle de base. Elles ne sont pas en mesure de tirer parti des LLM plus avancés et des techniques connexes.

Méthodologie: Génération de données synthétiques avec les LLM

Pour surmonter ces limites, les chercheurs proposent une approche de formation en une seule étape qui utilise les LLM comme GPT-3 et GPT-4 pour générer des données de formation synthétiques diversifiées.

Les étapes clés sont:

  1. Taxonomie des tâches: Définir une taxonomie qui catégorise les tâches d’embedding de texte en:
    • Tâches asymétriques (requête et document non paraphrasés, par exemple la recherche)
    • Tâches symétriques (requête et document paraphrasés, par exemple la similarité sémantique)
  2. Conception de prompt: Créer des modèles de prompt adaptés à chaque type de tâche qui guident le LLM pour générer des exemples de formation pertinents.
  3. Génération de données synthétiques: Faire appel au LLM avec les prompts conçus pour générer des centaines de milliers de paires (requête, document) couvrant une grande variété de tâches sémantiques dans 93 langues.
  4. Formation du modèle: Affiner un LLM ouvert et puissant comme Mistral sur les données synthétiques en utilisant la perte contrastive.

Cette méthodologie permet de créer des données de formation abondantes pour des tâches diverses dans plusieurs langues sans aucun effort d’étiquetage humain. En exploitant les connaissances déjà intégrées dans les LLM grâce à un pré-entraînement sur des corpus à grande échelle, nous pouvons synthétiser des données de haute qualité précisément adaptées pour les embeddings de texte.

Les chercheurs démontrent cela avec une stratégie de prompt en deux étapes:

  • Faire appel à GPT-4 pour suggérer des tâches de récupération potentielles

Prompt for generating high-level retrieval tasks

    Prompt for generating high-level retrieval tasks
  • Faire appel à nouveau pour générer des (requête, document) échantillons basés sur les tâches suggérées

n generate (query, positive, hard negative) triplets

    n generate (query, positive, hard negative) triplets

Certains aspects clés de la conception de prompt:

  • Prompts en langage naturel pour des instructions intuitives et humaines
  • Espaces réservés pour encourager la diversité (par exemple, longueur de requête, clarté, longueur de document)
  • Combinaison de données de plusieurs modèles pour le même type de tâche
  • Pondération des langues en fonction de la disponibilité des ressources

Au total, ils ont pu générer 500 000 exemples d’embeddings de texte à un coût de calcul de 180 millions de jetons. La langue dominante était l’anglais (43 %), suivie du polonais, du japonais, de l’italien et d’autres.

Pour la formation du modèle, ils ont opté pour l’affinement du modèle ouvert Mistral de 7 milliards de paramètres au lieu d’architectures de type BERT plus petites. Puisque Mistral avait déjà été pré-entraîné sur des corpus de texte à grande échelle, aucun pré-entraînement contrastif supplémentaire n’était nécessaire. L’ajout de celui-ci a apporté des améliorations négligeables.

L’ensemble de l’affinement a pris moins de 1 000 étapes, en utilisant un mélange de données synthétiques et étiquetées par l’homme. Cela démontre l’efficacité de l’approche proposée.

Résultats

Les chercheurs ont évalué leur modèle sur le référentiel MTEB, qui couvre des tâches diverses dans la classification, le regroupement, la similarité sémantique, la synthèse et la recherche d’information.

Leur modèle a surpassé l’état de l’art précédent de 2,4 points en score moyen, établissant de nouveaux records pour presque chaque catégorie:

Modèle Précédent SOTA Modèle proposé
Classification 76,0 78,5
Regroupement 46,1 50,3
Classification par paires 87,1 88,3
Réorganisation 60,0 60,2
Récupération 54,3 56,9
STS 83,1 84,6
Synthèse 31,6 31,4
Moyenne 64,2 66,6

Remarquablement, même sans utiliser de données étiquetées et en s’entraînant uniquement sur des données synthétiques, il a atteint une précision concurrentielle – seulement 3,5 points derrière le modèle entièrement supervisé. Cela démontre la viabilité de la génération d’embeddings de texte en utilisant uniquement les LLM, sans effort d’étiquetage humain.

Les chercheurs ont également évalué sur le référentiel multilingue MIRACL couvrant 18 langues. Leur modèle a surpassé le meilleur précédent sur les langues à ressources élevées mais était plus faible sur les langues à faibles ressources. Ils hypothèsent que cela pourrait être atténué en pré-entraînant les LLM plus en profondeur sur les langues à faibles ressources.

En résumé, les embeddings de texte formés sur des données synthétiques générées par les LLM établissent de nouveaux résultats de l’état de l’art, tout en utilisant une formation plus simple et plus efficace par rapport aux approches multi-étapes précédentes. Avec des recherches plus approfondies sur l’ingénierie de prompt et la qualité des données synthétiques, cette méthodologie pourrait grandement améliorer les embeddings de texte multilingues.

Analyse

Ce travail offre plusieurs enseignements précieux:

  • Les LLM comme GPT-3 et GPT-4 ont une capacité impressionnante à générer des données de formation synthétiques de haute qualité pour diverses tâches TAL lorsqu’ils sont sollicités de manière appropriée. Cela peut réduire la dépendance aux données étiquetées par l’homme.
  • Pour les embeddings de texte, le pré-entraînement contrastif offre des gains négligeables par rapport à un simple affinement de modèles comme Mistral qui ont déjà un pré-entraînement à grande échelle. C’est une insight importante sur l’efficacité de la formation.
  • Les méthodes de génération assistée par récupération permettent aux LLM d’accéder dynamiquement à des connaissances externes. L’amélioration des embeddings de texte est donc précieuse pour améliorer ces LLM.
  • Il existe un espace important pour l’amélioration dans les langues à faibles ressources. Les LLM multilingues pré-entraînés sur des données plus représentatives pourraient aider à combler cet écart.
  • Conceptuellement, la modélisation de langage et les embeddings de texte sont les deux côtés de la même médaille – la compréhension de la sémantique du langage. Avec la génération de données synthétiques par prompt, les LLM peuvent être affinés organiquement en embeddeurs sans pipelines complexes.

Certaines directions prometteuses pour les travaux futurs incluent:

  • Exploiter les LLM ouverts comme GPT-NeoX pour générer des données synthétiques
  • Explorer les formations légères post-entraînement pour adapter les embeddeurs à des contextes plus longs
  • Développer des techniques d’ingénierie de prompt pour contrôler la qualité et la couverture des tâches
  • Méthodes pour améliorer la latence d’inférence et les coûts de stockage pour une utilisation industrielle

Au-delà de la concurrence aux référentiels, l’utilisation de grands modèles de langage pour améliorer les embeddings de texte ouvre des possibilités intrigantes pour l’avenir. À mesure que les LLM continuent de progresser dans leur maîtrise du langage naturel, leur aptitude à générer des données synthétiques de haute fidélité devrait également s’améliorer.

Cependant, des directions de recherche critiques restent pour traduire ce potentiel en impact réel dans le monde.

Personnalisation et contrôle

Un avantage clé des données synthétiques est la capacité de générer des exemples programmablement adaptés à des besoins spécifiques. Comme le démontre l’article, l’ingénierie de prompt permet de créer des données de formation pour des centaines de milliers de tâches d’embedding.

Cependant, les pratiques actuelles de conception de prompt restent plus un art qu’une science. Développer des méthodes systématiques et reproductibles pour contrôler avec précision les propriétés des données générées élargirait l’applicabilité de cette technique.

Par exemple, des techniques pour moduler des facteurs comme la complexité, l’ambiguïté et la nouveauté des exemples pourraient aider à résoudre les problèmes de robustesse dans les tâches en aval. La génération dynamique de prompt pour correspondre aux distributions du monde réel en évolution est un autre défi ouvert.

Formation à grande échelle

Alors que les LLM pré-entraînés encodent déjà des connaissances linguistiques substantielles, leurs capacités de génération de données sont susceptibles de s’améliorer encore avec une échelle supplémentaire. Des modèles comme GPT-4, formés sur des trillions de jetons de texte Internet, montrent un apprentissage en quelques exemples fort, mais n’ont pas été optimisés spécifiquement pour la synthèse de données de formation.

Des architectures et des objectifs adaptés pour amorcer la génération de données auto-supervisées à grande échelle pourraient avancer considérablement la qualité et l’efficacité de cette méthodologie. L’intégration efficace de connaissances récupérées pour compléter les connaissances apprises est une autre direction prometteuse.

Multitâche et multilingue

Comme noté dans l’article, améliorer les performances sur les langues à faibles ressources reste un problème. Au lieu de pré-entraîner un seul LLM massif, une alternative est de former une flotte de modèles experts plus petits qui se spécialisent dans des modalités de données ou des domaines linguistiques particuliers.

Une telle approche d’ensemble pourrait aider à améliorer la couverture sur des tâches et des langues rares en partageant les représentations apprises entre experts. L’apprentissage continu pour étendre l’expertise linguistique et des tâches au fil du temps est également une perspective excitante.

En conclusion, cet article introduit un concept innovant de synthèse de données de formation à partir de LLM pour créer des embeddings de texte performants. Les résultats démontrent l’efficacité de cette méthodologie, surpassant les référentiels précédents. À mesure que les LLM et les techniques de données synthétiques progressent, puiser dans leurs connaissances pour former les embeddeurs pourrait devenir une direction très prometteuse.

J'ai passé les cinq dernières années à plonger dans le monde fascinant de l'apprentissage automatique et du deep learning. Ma passion et mon expertise m'ont conduit à contribuer à plus de 50 projets de génie logiciel divers, avec un focus particulier sur l'IA/ML. Ma curiosité continue m'a également attiré vers le traitement automatique des langues, un domaine que je suis impatient d'explorer plus en profondeur.