Modèles et plateformes d’IA

DeepMind et Google Brain visent à créer des méthodes pour améliorer l’efficacité de l’apprentissage par renforcement

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les systèmes d’apprentissage par renforcement peuvent être puissants et robustes, capables de réaliser des tâches extrêmement complexes grâce à des milliers d’itérations d’entraînement. Bien que les algorithmes d’apprentissage par renforcement soient capables de permettre des comportements sophistiqués et parfois surprenants, ils nécessitent beaucoup de temps pour s’entraîner et exigent de vastes quantités de données. Ces facteurs rendent les techniques d’apprentissage par renforcement plutôt inefficaces, et récemment, des équipes de recherche de DeepMind et de Google (GOOGL ) Brain ont cherché à trouver des méthodes plus efficaces pour créer des systèmes d’apprentissage par renforcement.

Selon VentureBeat, le groupe de recherche combiné a récemment proposé des méthodes pour rendre l’entraînement par renforcement plus efficace. L’une des améliorations proposées était un algorithme appelé Partage de politique de comportement adaptatif (ABPS), tandis que l’autre était un cadre appelé Approximateurs de fonction de valeur universelle (UVFA). L’ABPS permet aux pools d’agents d’intelligence artificielle de partager leurs expériences de politique de comportement sélectionnées de manière adaptative, tandis que l’UVFA permet à ces agents d’intelligence artificielle d’enquêter simultanément sur des politiques d’exploration dirigée.

L’ABPS est destiné à accélérer la personnalisation des hyperparamètres lors de l’entraînement d’un modèle. L’ABPS permet de trouver les hyperparamètres optimaux plus rapidement en permettant à plusieurs agents différents avec des hyperparamètres différents de partager leurs expériences de politique de comportement. Plus précisément, l’ABPS permet aux agents d’apprentissage par renforcement de sélectionner des actions parmi celles que une politique a jugées acceptables, puis leur accorde une récompense et une observation en fonction de l’état suivant.

Les agents de renforcement d’intelligence artificielle sont formés avec diverses combinaisons de hyperparamètres possibles, tels que le taux de déclin et le taux d’apprentissage. Lors de l’entraînement d’un modèle, l’objectif est que le modèle converge vers la combinaison d’hyperparamètres qui lui donne les meilleures performances, et dans ce cas, celles qui améliorent également l’efficacité des données. L’efficacité est accrue en formant de nombreux agents en même temps et en choisissant le comportement d’un seul agent à déployer pendant l’étape de temps suivante. La politique que l’agent cible a est utilisée pour échantillonner des actions. Les transitions sont ensuite enregistrées dans un espace partagé, et cet espace est constamment évalué afin que la sélection de la politique n’ait pas à se produire aussi souvent. À la fin de l’entraînement, un ensemble d’agents est choisi et les agents les mieux performants sont sélectionnés pour subir un déploiement final.

En ce qui concerne l’UVFA, il tente de résoudre l’un des problèmes courants de l’apprentissage par renforcement, à savoir que les agents faiblement renforcés n’apprennent souvent pas les tâches. L’UVFA tente de résoudre ce problème en faisant apprendre à l’agent un ensemble distinct de politiques d’exploitation et d’exploration en même temps. La séparation des tâches crée un cadre qui permet aux politiques d’exploration de continuer à explorer l’environnement tandis que les politiques d’exploitation continuent d’essayer de maximiser la récompense pour la tâche actuelle. Les politiques d’exploration de l’UVFA servent de base architecturale qui continuera à s’améliorer même s’il n’y a pas de récompenses naturelles trouvées. Dans une telle condition, une fonction qui correspond à des récompenses intrinsèques est approximée, ce qui pousse les agents à explorer tous les états dans un environnement, même s’ils retournent souvent à des états familiers.

Comme l’a expliqué VentureBeat, lorsque le cadre UVFA est en jeu, les récompenses intrinsèques du système sont données directement à l’agent en tant qu’entrées. L’agent conserve ensuite une représentation de toutes les entrées (telles que les récompenses, les actions et les états) pendant un épisode donné. Le résultat est que la récompense est préservée dans le temps et que la politique de l’agent est au moins partiellement informée par elle à tout moment.

Ceci est réalisé à l’aide d’un module de « nouveauté épisodique » et d’un module de « nouveauté à vie ». La fonction du premier module est de conserver la mémoire épisodique actuelle et de cartographier les découvertes actuelles sur la représentation mentionnée précédemment, permettant à l’agent de déterminer une récompense épisodique intrinsèque pour chaque étape de formation. Par la suite, l’état lié à l’observation actuelle est ajouté à la mémoire. Pendant ce temps, le module de nouveauté à vie est responsable de l’influence sur la fréquence à laquelle l’agent explore au fil de nombreux épisodes.

Selon les équipes d’Alphabet/Google, les nouvelles techniques d’entraînement ont déjà démontré leur potentiel pour améliorer considérablement l’entraînement d’un système d’apprentissage par renforcement. L’UVFA a pu doubler les performances de certains des agents de base qui ont joué à divers jeux Atari. Pendant ce temps, l’ABPS a pu améliorer les performances sur certains des mêmes jeux Atari, en diminuant la variance parmi les agents les mieux performants d’environ 25 %. L’algorithme formé par l’UVFA a pu atteindre un score élevé dans Pitfall par lui-même, sans aucune fonctionnalité conçue par des démos humaines.

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.