Modèles et plateformes d’IA
Améliorer l’alignement de l’IA avec les valeurs humaines grâce à WARM
Alignement des systèmes d’IA avec les valeurs humaines
Les systèmes d’intelligence artificielle (IA) sont de plus en plus capables d’assister les humains dans des tâches complexes, allant des chatbots de service client à des algorithmes de diagnostic médical. Cependant, à mesure que ces systèmes d’IA prennent plus de responsabilités, il est crucial qu’ils restent alignés avec les valeurs et les préférences humaines. Une approche pour atteindre cet objectif est une technique appelée apprentissage par renforcement à partir de la rétroaction humaine (RLHF). Dans le RLHF, un système d’IA, appelé politique, est récompensé ou pénalisé en fonction des jugements humains de son comportement. L’objectif est que la politique apprenne à maximiser ses récompenses et se comporte ainsi selon les préférences humaines.
Un composant essentiel du RLHF est le modèle de récompense (RM). Le RM est responsable de l’évaluation des actions et des sorties de la politique, et de la restitution d’un signal de récompense pour guider le processus d’apprentissage. Concevoir un bon RM est difficile, car les préférences humaines peuvent être complexes, dépendantes du contexte et même incohérentes entre les individus. Récemment, des chercheurs de Google DeepMind ont proposé une technique innovante appelée Weight Averaged Reward Models (WARM) pour améliorer la conception du RM.
Le problème du piratage de récompense
Un problème majeur dans le RLHF est le piratage de récompense. Le piratage de récompense se produit lorsque la politique trouve des failles pour contourner le système de RM et obtenir des récompenses élevées sans réellement satisfaire les objectifs visés. Par exemple, supposons que l’objectif soit de former un assistant d’écriture IA pour générer des résumés de haute qualité. Le RM pourrait récompenser les résumés concis et informatifs. La politique pourrait alors apprendre à exploiter cela en générant des résumés très courts et non informatifs parsemés de mots clés qui trompent le RM.
Le piratage de récompense se produit pour deux raisons principales:
- Changement de distribution – Le RM est formé sur un ensemble limité d’exemples étiquetés par des humains. Lorsqu’il est déployé, les sorties de la politique peuvent provenir de distributions différentes que le RM ne généralise pas bien.
- Étiquettes bruyantes – L’étiquetage humain est imparfait, avec des désaccords entre les évaluateurs. Le RM peut se concentrer sur des signaux erronés plutôt que sur des indicateurs robustes de qualité.
Le piratage de récompense conduit à des systèmes inutiles qui ne répondent pas aux attentes humaines. Pire encore, il peut entraîner des comportements d’IA biaisés ou même dangereux s’ils sont déployés sans précaution.
L’essor du regroupement de modèles
L’intérêt croissant pour les stratégies de regroupement de modèles comme Model Ratatouille est motivé par la réalisation que les modèles plus grands, bien que puissants, peuvent être inefficaces et impraticables. La formation d’un modèle de 1 trillion de paramètres nécessite des quantités prohibitives de données, de calcul, de temps et de coûts. Plus crucial encore, de tels modèles ont tendance à surestimer la distribution d’entraînement, entravant leur capacité à généraliser à des scénarios réels divers.
Le regroupement de modèles offre une voie alternative pour débloquer de plus grandes capacités sans mise à l’échelle incontrôlée. En réutilisant plusieurs modèles spécialisés formés sur différentes distributions, tâches ou objectifs, le regroupement de modèles vise à améliorer la polyvalence et la robustesse en dehors de la distribution. Le principe est que les différents modèles capturent des modèles prédictifs distincts qui peuvent se compléter lorsqu’ils sont regroupés.
Les résultats récents illustrent la promesse de ce concept. Les modèles obtenus par regroupement, malgré avoir beaucoup moins de paramètres, peuvent égaler ou même dépasser les performances de géants de modèles comme GPT-3. Par exemple, un ensemble Model Ratatouille de seulement 7 points de contrôle de taille moyenne atteint une précision de pointe sur des ensembles de données de conséquence textuelle à haute dimension, surpassant GPT-3.
La simplicité du regroupement par moyenne pondérée est un énorme avantage. La formation de plusieurs modèles auxiliaires nécessite des ressources supplémentaires. Mais, cruciallement, le calcul à l’exécution reste identique à celui d’un seul modèle, puisque les poids sont condensés en un seul. Cela rend la méthode facilement adaptable, sans inquiétude d’augmentation de la latence ou des coûts de mémoire.
Mécanismes derrière le regroupement de modèles
Mais qu’est-ce qui permet exactement ces gains de précision à partir du regroupement de modèles ? Une analyse récente offre quelques indices:
- Atténuation de la mémorisation: Chaque modèle voit des lots mélangés de l’ensemble de données pendant l’entraînement. La moyenne pondérée diminue toute mémorisation spécifique à une instance, ne retenant que les généralisations au niveau de l’ensemble de données.
- Réduction de la variance: Les modèles formés de manière indépendante ont des erreurs non corrélées. Les combiner moyenne les bruits, améliorant la calibration.
- Régularisation via diversité: Les tâches auxiliaires variées obligent les modèles à se concentrer sur des caractéristiques plus généralisables et utiles à travers les distributions.
- Augmentation de la robustesse: L’incohérence dans les prédictions signale l’incertitude. La moyenne pondérée modère les jugements extrêmes, améliorant la fiabilité.
En essence, le regroupement de modèles contrebalance les faiblesses des modèles individuels pour amplifier leurs forces collectives. La représentation regroupée capture les structures causales sous-jacentes communes, ignorant les variations incidentes.
Cette fondation conceptuelle relie le regroupement de modèles à d’autres techniques populaires comme l’ensemblage et l’apprentissage multi-tâches. Toutes ces méthodes exploitent la diversité entre les modèles ou les tâches pour obtenir des systèmes polyvalents et conscients de l’incertitude. La simplicité et l’efficacité de la moyenne pondérée donnent au regroupement de modèles un avantage unique pour faire progresser les déploiements dans le monde réel.
Modèles de récompense moyennés par poids
WARM emploie de manière innovante un modèle de récompense proxy (RM), qui est une moyenne pondérée de plusieurs RM individuels, chacun affiné à partir du même modèle de langage pré-entraîné mais avec des hyperparamètres différents. Cette méthode améliore l’efficacité, la fiabilité sous les changements de distribution, et la robustesse contre les préférences incohérentes. L’étude montre également que l’utilisation de WARM comme modèle de récompense proxy, en particulier avec un nombre accru de RM moyennés, améliore les résultats et retarde l’apparition du ‘piratage de récompense’, un phénomène où les récompenses de contrôle se dégradent avec le temps.
Voici une vue d’ensemble de haut niveau:
- Commencez avec un modèle de langage de base pré-entraîné sur un grand corpus. Initialisez plusieurs RM en ajoutant de petites couches spécifiques à la tâche sur le dessus.
- Affinez chaque RM séparément sur l’ensemble de données de préférences humaines, en utilisant différents hyperparamètres comme le taux d’apprentissage pour la diversité.
- Moyennez les poids des RM affinés pour obtenir un seul ensemble WARM.
L’insight clé est que la moyenne pondérée ne retient que les informations invariantes apprises à travers tous les RM divers. Cela réduit la dépendance aux signaux erronés, améliorant la robustesse. L’ensemble bénéficie également de la réduction de la variance, améliorant la fiabilité malgré les changements de distribution.
Comme discuté précédemment, la diversité entre les modèles formés de manière indépendante est cruciale pour débloquer le plein potentiel du regroupement de modèles. Mais quels sont quelques techniques concrètes pour promouvoir une diversité productive ?
Le document WARM explore quelques idées ingénieuses qui pourraient se généraliser plus largement:
Mélange d’ordre
Une approche simple mais efficace est de mélanger l’ordre dans lequel les points de données sont vus par chaque modèle pendant l’entraînement. Même cette étape simple décorrèle les poids, réduisant la mémorisation redondante de modèles.
Variations d’hyperparamètres
La modification d’hyperparamètres comme le taux d’apprentissage et la probabilité de dropout pour chaque exécution introduit une diversité utile. Les modèles convergent différemment, capturant des propriétés distinctes de l’ensemble de données.
Moyenne de points de contrôle – Baklava
La méthode Baklava initialise les modèles pour le regroupement à partir de différents instantanés le long de la même trajectoire de pré-entraînement. Cela relâche les contraintes par rapport aux soupes de modèles qui exigent un point de départ partagé. Par rapport au model ratatouille, Baklava évite les tâches supplémentaires. Dans l’ensemble, il trouve un équilibre efficace entre précision et diversité.

Le processus commence avec un modèle de langage pré-entraîné (LLM) 𝜃_𝑝𝑡. À partir de ce modèle, divers points de contrôle {𝜃_𝑠 𝑓 𝑡_𝑖} sont dérivés pendant une exécution d’apprentissage supervisé (SFT), chacun collecté à des étapes d’entraînement SFT différentes. Ces points de contrôle sont ensuite utilisés comme initialisations pour l’affinage de plusieurs modèles de récompense (RM) {𝜙𝑖} sur un ensemble de données de préférences. Cet affinage vise à adapter les modèles pour mieux correspondre aux préférences humaines. Après l’affinage, ces RM sont combinés par un processus de moyenne pondérée, aboutissant au modèle final, 𝜙_WARM.
L’analyse confirme qu’ajouter des points de contrôle plus anciens par moyenne mobile nuit à la performance individuelle, compromettant les mérites de la diversité. La moyenne pondérée des seules représentations finales de chaque exécution fonctionne mieux. En général, équilibrer les objectifs de diversité avec le maintien de l’exactitude reste un défi de recherche ouvert.
Dans l’ensemble, le regroupement de modèles s’aligne bien sur l’éthos général dans le domaine pour recycler efficacement les ressources existantes pour une fiabilité, une efficacité et une polyvalence accrues. La simplicité de la moyenne pondérée solidifie sa position en tant que principal candidat pour l’assemblage de modèles robustes à partir de blocs de construction prêts à l’emploi.
Contrairement aux méthodes d’ensemblage traditionnelles qui moyennent les prédictions, WARM maintient la charge de calcul minimale en conservant un seul ensemble de poids. Les expériences sur les tâches de résumé de texte démontrent l’efficacité de WARM:
- Pour l’échantillonnage du meilleur des N, WARM atteint un taux de gain de 92,5% contre la sélection aléatoire selon les étiquettes de préférence humaine.
- Dans le RLHF, une politique WARM atteint un taux de gain de 79,4% contre une politique formée avec un seul RM après le même nombre d’étapes.
- WARM continue de performer bien même lorsque un quart des étiquettes humaines sont corrompues.
Ces résultats illustrent le potentiel de WARM en tant que technique pratique pour développer des assistants d’IA réels qui se comportent de manière fiable. En lissant les incohérences dans la rétroaction humaine, les politiques WARM peuvent rester robustement alignées avec les valeurs humaines même lorsqu’elles continuent d’apprendre à partir de nouvelles expériences.
Le tableau d’ensemble
WARM se situe à l’intersection de deux tendances clés dans la recherche d’alignement de l’IA. Premièrement, l’étude de la généralisation en dehors de la distribution (OOD), qui vise à améliorer les performances des modèles sur de nouvelles données qui diffèrent de la distribution d’entraînement. Deuxièmement, la recherche sur la robustesse algorithmique, qui se concentre sur la fiabilité malgré de petites perturbations d’entrée ou de bruit.
En établissant des liens entre ces domaines autour de la notion d’invariants appris, WARM nous rapproche de techniques plus solidement fondées pour l’alignement des valeurs. Les insights de WARM pourraient se généraliser même au-delà du RLHF, fournissant des leçons pour des systèmes d’apprentissage automatique plus larges qui interagissent avec le monde ouvert.
Bien sûr, la modélisation de récompense n’est qu’une pièce du puzzle d’alignement. Nous avons encore besoin de progrès sur d’autres défis comme la spécification de récompense, la surveillance à grande échelle, et l’exploration sûre. Combiné avec des techniques complémentaires, WARM pourrait accélérer le développement d’IA qui favorise durablement la prospérité humaine. En éclaircissant collectivement les principes qui sous-tendent un alignement robuste, les chercheurs cartographient la route vers une IA bénéfique et éthique.













