Modèles et plateformes d’IA
DeepMind présente une nouvelle méthode d’entraînement de l’apprentissage par renforcement de l’IA en toute sécurité
L’apprentissage par renforcement est une voie prometteuse de développement de l’IA, produisant des IA capables de gérer des tâches extrêmement complexes. Les algorithmes d’apprentissage par renforcement sont utilisés dans la création de systèmes de robotique mobile et de voitures autonomes, entre autres applications. Cependant, en raison de la façon dont l’apprentissage par renforcement est formé, ils peuvent occasionnellement présenter des comportements étranges et inattendus. Ces comportements peuvent être dangereux, et les chercheurs en IA les appellent le problème de “l’exploration sûre”, où l’IA se retrouve coincée dans l’exploration d’états non sûrs.
Récemment, le laboratoire de recherche en IA de Google (GOOGL ), DeepMind, a publié un article qui propose de nouvelles méthodes pour résoudre le problème de l’exploration sûre et former l’apprentissage par renforcement de l’IA de manière plus sûre. La méthode suggérée par DeepMind corrige également les failles dans les critères de récompense ou les “loopholes” de récompense.
La nouvelle méthode de DeepMind comporte deux systèmes distincts destinés à guider le comportement de l’IA dans les situations où des comportements non sûrs pourraient survenir. Les deux systèmes utilisés par la technique de formation de DeepMind sont un modèle génératif et un modèle de dynamique avant. Ces deux modèles sont formés sur une variété de données, telles que des démonstrations d’experts en sécurité et des trajectoires de véhicules complètement aléatoires. Les données sont étiquetées par un superviseur avec des valeurs de récompense spécifiques, et l’agent IA va identifier les modèles de comportement qui lui permettront de collecter la plus grande récompense. Les états non sûrs ont également été étiquetés, et une fois que le modèle a réussi à prédire avec succès les récompenses et les états non sûrs, il est déployé pour effectuer les actions ciblées.
L’équipe de recherche explique dans l’article que l’idée est de créer des comportements possibles à partir de zéro, de suggérer les comportements souhaités et de faire en sorte que ces scénarios hypothétiques soient aussi informatifs que possible tout en évitant toute interférence directe avec l’environnement d’apprentissage. L’équipe de DeepMind appelle cette approche ReQueST, ou synthèse de requêtes de récompense via l’optimisation de trajectoire.
ReQueST est capable de conduire à quatre types de comportement différents. Le premier type de comportement tente de maximiser l’incertitude concernant les modèles de récompense d’ensemble. En revanche, les comportements deux et trois tentent de minimiser et de maximiser les récompenses prédites. Les récompenses prédites sont minimisées afin de conduire à la découverte de comportements que le modèle peut prédire incorrectement. D’un autre côté, la récompense prédite est maximisée afin de conduire à des étiquettes de comportement possédant la plus haute valeur d’information. Enfin, le quatrième type de comportement tente de maximiser la nouveauté des trajectoires, afin que le modèle continue à explorer indépendamment des récompenses projetées.
Une fois que le modèle a atteint le niveau de collecte de récompense souhaité, un agent de planification est utilisé pour prendre des décisions basées sur les récompenses apprises. Ce schéma de contrôle prédictif permet aux agents d’apprendre à éviter les états non sûrs en utilisant le modèle dynamique et en prédissant les conséquences possibles, contrairement aux comportements des algorithmes qui apprennent par essais et erreurs.
Selon VentureBeat, les chercheurs de DeepMind estiment que leur projet est le premier système d’apprentissage par renforcement capable d’apprendre de manière contrôlée et sûre:
« À notre connaissance, ReQueST est le premier algorithme de modélisation de récompense qui apprend de manière sûre sur les états non sûrs et s’étend à la formation de modèles de récompense de réseau neuronal dans des environnements avec des états continus à haute dimension. Jusqu’à présent, nous n’avons démontré l’efficacité de ReQueST que dans des domaines simulés avec des dynamiques relativement simples. Une direction pour les travaux futurs est de tester ReQueST dans des domaines 3D avec des physiques plus réalistes et d’autres agents agissant dans l’environnement. »












