Modèles et plateformes d’IA

LoReFT : Affiner les Représentations pour les Modèles de Langage

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les méthodes de fine-tuning efficaces en termes de paramètres, ou PeFT, visent à adapter les grands modèles de langage via des mises à jour d’un petit nombre de poids. Cependant, la majorité des travaux d’interprétabilité existants ont démontré que les représentations encodent des informations sémantiques riches, suggérant qu’il pourrait s’agir d’une alternative plus puissante pour éditer ces représentations. Les modèles pré-entraînés sont souvent fine-tunés pour être utilisés pour de nouveaux domaines ou tâches, et pendant le processus de fine-tuning, un modèle de base unique peut être adapté à une large gamme de tâches même avec seulement de petites quantités de données de domaine disponibles au modèle. Cependant, le processus de fine-tuning d’un modèle entier est coûteux en ressources et coûteux, en particulier pour les modèles de langage avec un nombre significativement plus élevé de paramètres.

Les méthodes de fine-tuning efficaces en termes de paramètres, ou PeFT, proposent de résoudre les coûts élevés associés au fine-tuning du modèle entier en mettant à jour seulement une petite fraction des poids totaux disponibles, un processus qui aide à réduire le temps de formation ainsi que l’utilisation de la mémoire. Ce qui est plus important, les méthodes de fine-tuning efficaces en termes de paramètres, ou PeFT, ont démontré des performances similaires à celles du fine-tuning dans plusieurs contextes pratiques. Les adapteurs, une famille courante de méthodes de fine-tuning efficaces en termes de paramètres, ou PeFT, apprennent une édition qui peut être ajoutée à un ensemble supplémentaire de poids qui fonctionnent aux côtés du modèle de base à poids figés, avec des adapteurs récents comme LoRA qui réduisent le nombre de paramètres formables dans les mises à jour de poids apprises en utilisant des approximations de faible rang au lieu de matrices de poids complètes lors de la formation des adapteurs.

Avec des travaux précédents démontrant que l’édition des représentations pourrait être une alternative plus puissante aux méthodes de fine-tuning efficaces en termes de paramètres, ou PeFT, dans cet article, nous allons discuter des méthodes de fine-tuning de représentation, ou ReFT, qui fonctionnent sur un modèle figé et apprennent des interventions spécifiques à la tâche sur les représentations cachées. Cet article vise à couvrir le cadre de fine-tuning de représentation, ou ReFT, en profondeur, et nous explorons le mécanisme, la méthodologie, l’architecture du cadre ainsi que sa comparaison avec les cadres d’état de l’art. Alors, commençons.

ReFT : Affiner les Représentations pour les Modèles de Langage

Dans une tentative d’adopter des modèles de langage pré-entraînés à de nouveaux domaines et tâches, les cadres actuels fine-tunent ces modèles de langage pré-entraînés fréquemment, car avec le processus de fine-tuning mis en œuvre, un modèle de base unique peut être adapté à une variété de tâches même lorsqu’il travaille avec une petite quantité de données de domaine. Bien que le processus de fine-tuning améliore les performances globales, il s’agit d’un processus coûteux, en particulier si le modèle de langage a un nombre significativement élevé de paramètres. Pour résoudre ce problème et réduire les coûts associés, les cadres de fine-tuning efficaces en termes de paramètres, ou PeFT, mettent à jour seulement une petite fraction des poids totaux, un processus qui réduit non seulement le temps de formation mais également l’utilisation de la mémoire, permettant aux cadres de fine-tuning efficaces en termes de paramètres, ou PeFT, d’atteindre des performances similaires à celles des approches de fine-tuning complet dans des scénarios pratiques. Les adapteurs, une famille courante de PeFT, fonctionnent en apprenant une édition qui peut être ajoutée à un ensemble supplémentaire de poids qui fonctionnent aux côtés du modèle de base à poids figés. Les adapteurs récents comme LoRA et QLoRA ont démontré qu’il est possible de former des adapteurs à précision complète sur des modèles à précision réduite sans affecter les performances. Les adapteurs sont généralement plus efficaces et plus efficaces que les autres méthodes qui introduisent de nouveaux composants de modèle.

Un point fort important des cadres de fine-tuning efficaces en termes de paramètres actuels est qu’au lieu de modifier les représentations, ils modifient les poids. Cependant, les cadres qui traitent de l’interprétabilité ont démontré que les représentations encodent des informations sémantiques riches, suggérant que l’édition des représentations pourrait être une approche plus puissante que les mises à jour de poids. Cette hypothèse selon laquelle l’édition des représentations est une meilleure approche est ce qui constitue la base du cadre de fine-tuning de représentation, ou ReFT, qui forme des interventions au lieu d’adapter les poids du modèle, permettant au modèle de manipuler une petite fraction de toutes les représentations pour orienter les comportements du modèle pour résoudre les tâches en aval pendant l’inférence. Les méthodes de fine-tuning de représentation, ou ReFT, sont des remplacements directs pour les cadres de fine-tuning efficaces en termes de paramètres basés sur les poids. L’approche ReFT s’inspire des modèles récents qui travaillent avec l’interprétabilité de grands modèles et interviennent sur les représentations pour trouver des mécanismes causaux fidèles, et oriente le comportement du modèle pendant l’inférence, et peut donc être considérée comme une généralisation des modèles d’édition de représentation. En s’appuyant sur cela, LoReFT, ou ReFT de sous-espace de faible rang, est une instance forte et efficace de ReFT, et est une paramétrisation de ReFT qui intervient sur les représentations cachées dans l’espace linéaire engendré par une matrice de projection de faible rang, et s’appuie directement sur le cadre de recherche d’alignement distribué, ou DAS.

En continuant, contrairement au fine-tuning complet, le cadre de fine-tuning efficace en termes de paramètres, ou PeFT, forme seulement une petite fraction des paramètres du modèle et parvient à adapter le modèle aux tâches en aval. Le cadre de fine-tuning efficace en termes de paramètres, ou PeFT, peut être classé en trois catégories principales :

  • Méthodes basées sur les adapteurs : Les méthodes basées sur les adapteurs forment des modules supplémentaires comme des couches fully-connected sur le modèle pré-entraîné à poids figés. Les adapteurs en série insèrent des composants entre les couches de perceptron multilayer, ou MLP, et les couches d’attention du modèle de langage, ou LM, tandis que les adapteurs parallèles ajoutent des modules aux côtés des composants existants. Puisque les adapteurs ajoutent de nouveaux composants qui ne peuvent pas être facilement intégrés dans les poids du modèle existant, ils posent une charge supplémentaire pendant l’inférence.
  • LoRA : LoRA, ainsi que ses variantes récentes, approximent les poids additifs pendant la formation en utilisant des matrices de faible rang, et ils n’exigent pas de surcoûts supplémentaires pendant l’inférence, car les mises à jour de poids peuvent être fusionnées dans le modèle, et c’est pourquoi ils sont considérés comme les cadres de fine-tuning efficaces en termes de paramètres les plus forts actuellement.
  • Méthodes basées sur les invites : Les méthodes basées sur les invites ajoutent des jetons doux initialisés aléatoirement dans l’entrée et forment leurs embeddings tout en gardant les poids du modèle de langage figés. Les performances offertes par ces méthodes sont souvent insatisfaisantes par rapport aux autres approches de fine-tuning efficaces en termes de paramètres, et elles comportent également un coût de surcharge d’inférence significatif.

Au lieu de mettre à jour les poids, le cadre de fine-tuning de représentation, ou ReFT, apprend des interventions pour modifier une petite fraction des représentations totales. De plus, des travaux récents sur l’ingénierie de représentation et l’orientation d’activation ont démontré qu’ajouter des vecteurs de direction fixes au flux résiduel peut faciliter un certain contrôle sur les générations de modèles de langage pré-entraînés sans nécessiter un fine-tuning coûteux en ressources. D’autres cadres ont démontré qu’éditer les représentations avec une opération d’échelle et de traduction apprise peut essayer de correspondre, mais pas de surpasser, les performances offertes par les adapteurs LoRA sur une large gamme de tâches avec moins de paramètres appris. De plus, le succès de ces cadres sur une gamme de tâches a démontré que les représentations introduites par les modèles de langage pré-entraînés comportent des sémantiques riches, bien que les performances de ces modèles soient sous-optimales, ce qui entraîne les PeFT pour continuer à être l’approche d’état de l’art avec aucune charge d’inférence supplémentaire.

ReFT : Méthodologie et Architecture

Pour garder le processus de préservation de style simple, le cadre de fine-tuning de représentation, ou ReFT, suppose un modèle de langage basé sur un transformateur comme modèle cible capable de produire des représentations contextualisées d’une séquence de jetons. Pour une séquence donnée avec n jetons d’entrée, le cadre de fine-tuning de représentation, ou ReFT, intègre d’abord ces jetons d’entrée dans une liste de représentations, puis les m couches calculent la liste de représentations cachées successivement en fonction de la liste de représentations cachées précédente. Chaque représentation cachée est un vecteur, et le modèle de langage utilise les représentations cachées finales pour produire les prédictions. Le cadre de fine-tuning de représentation, ou ReFT, prend en compte à la fois les modèles de langage masqués et les modèles de langage autorégressifs. Maintenant, selon l’hypothèse de représentation linéaire, dans les réseaux de neurones, les concepts sont encodés dans les sous-espaces linéaires des représentations. Des modèles récents ont trouvé cette affirmation vraie dans les modèles de réseau de neurones formés sur le langage naturel ainsi que sur d’autres distributions d’entrée.

De plus, dans les études d’interprétabilité, le cadre d’abstraction causal utilise des interventions d’échange pour établir le rôle des composants de réseau de neurones de manière causale lors de la mise en œuvre de comportements particuliers. La logique derrière l’intervention d’échange est que si l’on fixe une représentation à ce qu’elle aurait été pour une entrée contrefactuelle, et que cette intervention affecte la sortie du modèle de manière cohérente avec les affirmations faites par le cadre de fine-tuning de représentation, ou ReFT, sur le composant responsable de la production de cette représentation, alors le composant joue un rôle causal dans le comportement. Bien qu’il existe quelques méthodes, l’intervention d’échange distribué est l’approche idéale pour tester si un concept est encodé dans un sous-espace linéaire d’une représentation, comme le prétend l’hypothèse de représentation linéaire. De plus, la méthode DAS a été utilisée précédemment pour trouver des représentations linéaires dans les modèles de langage d’attributs d’entité, de sentiments, de caractéristiques linguistiques et de raisonnement mathématique. Cependant, plusieurs expériences ont indiqué que la méthode DAS est très expressive et qu’elle possède la capacité de trouver des sous-espaces efficaces même lorsque le modèle de langage transformateur a été initialisé aléatoirement, et qu’il n’a donc pas encore appris de représentations spécifiques à la tâche, ce qui entraîne le débat sur la question de savoir si DAS est efficace et responsable pour les tâches d’interprétabilité.

L’expressivité offerte par DAS suggère que l’approche pourrait être un outil idéal pour contrôler le comportement du modèle de langage ainsi que son travail sur la génération contrôlable et l’édition responsable. Par conséquent, pour adapter les modèles de langage aux tâches en aval, le cadre de fine-tuning de représentation, ou ReFT, utilise l’opération d’intervention d’échange distribué pour créer une nouvelle méthode efficace en termes de paramètres. De plus, la méthode ReFT est un ensemble d’interventions, et le cadre impose que pour deux interventions qui opèrent sur la même couche, les positions d’intervention doivent être disjointes, avec les paramètres de toutes les fonctions d’intervention restant indépendants. Par conséquent, ReFT est un cadre générique qui englobe les interventions sur les représentations cachées pendant le passage avant du modèle.

ReFT : Expériences et Résultats

Pour évaluer ses performances par rapport aux cadres de fine-tuning efficaces en termes de paramètres existants, le cadre de fine-tuning de représentation, ou ReFT, effectue des expériences sur quatre benchmarks de traitement du langage naturel divers, et couvre plus de 20 ensembles de données, avec l’objectif principal étant de fournir une image riche de la façon dont le cadre LoReFT se comporte dans différents scénarios. De plus, lorsque le cadre LoReFT est mis en œuvre dans la vie réelle, les développeurs doivent décider du nombre d’interventions à apprendre ainsi que des positions d’entrée et des couches sur lesquelles appliquer chacune. Pour accomplir cette tâche, le cadre de fine-tuning de représentation, ou ReFT, affine quatre hyperparamètres.

  1. Le nombre de positions de préfixe à intervenir.
  2. Le nombre de positions de suffixe à intervenir.
  3. L’ensemble de couches à intervenir.
  4. S’il faut lier les paramètres d’intervention entre différentes positions dans la même couche.

En faisant cela, le cadre de fine-tuning de représentation, ou ReFT, simplifie l’espace de recherche des hyperparamètres et garantit une charge d’inférence supplémentaire fixe qui ne dépend pas de la longueur de l’invite.

Le tableau ci-dessus compare la précision du cadre LLaMA-7B et LLaMA-13B par rapport aux modèles PeFT existants sur 8 ensembles de données de raisonnement basé sur le bon sens. Comme on peut l’observer, le modèle LoReFT surpasse les approches PeFT existantes d’une marge convenable, malgré avoir beaucoup moins de paramètres, avec la performance moyenne de trois exécutions étant signalée avec des graines de paramètres distinctes pour le modèle LoReFT. Le param(%) est calculé en divisant le nombre de paramètres formables par le nombre total de paramètres du modèle de langage de base.

Le tableau ci-dessus résume la comparaison de précision du cadre LLaMA-7B et LLaMA-13B par rapport aux modèles PeFT existants sur 4 ensembles de données de raisonnement arithmétique différents, avec le cadre signalant la performance moyenne de trois exécutions avec des graines aléatoires distinctes. Comme on peut l’observer, malgré avoir beaucoup moins de paramètres(%), le cadre LoReFT surpasse les cadres PeFT existants d’une marge considérable.

Le tableau ci-dessus résume la comparaison de précision du cadre RoBERTa-base et RoBERTa-large par rapport aux modèles PeFT existants sur le benchmark GLUE, avec le cadre signalant la performance moyenne de cinq exécutions avec des graines aléatoires distinctes. Comme on peut l’observer, malgré avoir beaucoup moins de paramètres(%), le cadre LoReFT surpasse les cadres PeFT existants d’une marge considérable.

Pensées Finales

Dans cet article, nous avons discuté de LoReFT, une alternative puissante aux cadres PeFT existants qui atteint de fortes performances sur des benchmarks de quatre domaines différents tout en offrant jusqu’à 50 fois l’efficacité offerte par les modèles PeFT d’état de l’art précédents. Les modèles pré-entraînés sont souvent fine-tunés pour être utilisés pour de nouveaux domaines ou tâches, et pendant le processus de fine-tuning, un modèle de base unique peut être adapté à une large gamme de tâches même avec seulement de petites quantités de données de domaine disponibles au modèle. Cependant, le processus de fine-tuning d’un modèle entier est coûteux en ressources et coûteux, en particulier pour les modèles de langage avec un nombre significativement plus élevé de paramètres. Les méthodes de fine-tuning efficaces en termes de paramètres, ou PeFT, proposent de résoudre les coûts élevés associés au fine-tuning du modèle entier en mettant à jour seulement une petite fraction des poids totaux disponibles, un processus qui aide à réduire le temps de formation ainsi que l’utilisation de la mémoire. Notamment, LoReFT établit de nouvelles performances d’état de l’art sur le raisonnement basé sur le bon sens, le suivi des instructions et la compréhension du langage naturel contre les PeFT les plus forts.

Un ingénieur de profession, un écrivain de cœur. Kunal est un rédacteur technique avec une profonde affection et une compréhension de l'IA et du ML, dédié à simplifier les concepts complexes dans ces domaines grâce à sa documentation engageante et informative.