Modèles et plateformes d’IA
Le nouvel IA de DeepMind est capable d’apprendre les règles d’un jeu pendant qu’il joue

La filiale d’Alphabet (GOOGL ), DeepMind, a récemment développé un système d’IA capable d’apprendre les règles d’un jeu pendant qu’il joue. Alors que DeepMind a créé des modèles d’IA impressionnants qui peuvent maîtriser des jeux comme les échecs, le shogi, le go et les jeux vidéo auparavant, ces modèles doivent être fournis avec les règles du jeu au préalable. Ainsi, le nouvel IA de DeepMind représente une amélioration notable par rapport aux algorithmes d’IA précédents qui apprennent à jouer aux jeux via l’apprentissage par renforcement.
Système d’IA – MuZero
Dans un article publié récemment dans la revue Nature, DeepMind a détaillé comment son nouveau système d’IA fonctionne. Le nouvel IA, baptisé MuZero, est capable d’apprendre les règles d’un jeu pendant qu’il joue grâce à un principe appelé « recherche anticipée ». Comme rapporté par Engadget, MuZero utilise la recherche anticipée pour déterminer quels mouvements doivent être exécutés en fonction des réponses les plus probables des adversaires.
Lorsqu’il considère tous les mouvements possibles qui pourraient être faits dans des jeux comme les échecs, MuZero est capable de donner la priorité, en réduisant les mouvements à seulement les mouvements les plus probables et les plus pertinents. MuZero apprendra alors à la fois des manœuvres réussies et des manœuvres non réussies. Plutôt que de modéliser tous les facteurs possibles, il ne considère que les facteurs les plus pertinents pour la décision en cours. MuZero prend essentiellement la myriade de variables potentielles qui peuvent être considérées et les distille en fonction des caractéristiques les plus saillantes et les plus impactantes. Ces caractéristiques sont représentées dans un algorithme de recherche basé sur un arbre. Les possibilités dans l’arbre sont ensuite combinées avec un modèle appris basé sur les caractéristiques de l’environnement de test. La recherche anticipée est effectuée après que les aspects les plus pertinents d’un environnement aient été identifiés.
Afin de prendre une décision finale, trois facteurs sont considérés.
MuZero considère le résultat du choix précédent, la position actuelle qu’il occupe et les actions potentielles qu’il peut prendre ensuite. Cette approche surpasse les approches précédemment utilisées par DeepMind, notamment la recherche anticipée de base et les modèles basés sur les arbres. MuZero s’est avéré être au moins aussi bon aux échecs, au shogi et au go qu’AlphaZero, et lorsqu’il a joué au jeu Ms. Pac-Man, MuZero n’a pu considérer qu’environ six ou sept mouvements à la fois. Malgré cette limite, l’IA a encore performé quite bien. DeepMind a également expérimenté les capacités de MuZero en limitant le nombre de simulations qu’il pouvait effectuer avant de devoir s’engager dans un mouvement. En général, plus le programme avait de temps pour considérer les mouvements possibles, mieux il performait.
Le scientifique principal de la recherche à DeepMind, David Silver, a expliqué via TechXplore que MuZero est le premier modèle d’IA capable de générer sa propre représentation des règles d’un environnement, en utilisant cette représentation pour planifier des actions.
“Pour la première fois, nous avons réellement un système capable de construire sa propre compréhension de la façon dont le monde fonctionne et d’utiliser cette compréhension pour faire ce type de planification anticipée sophistiquée que vous avez vu précédemment pour des jeux comme les échecs”, a déclaré Silver. “(MuZero) peut commencer à partir de rien et, simplement par essais et erreurs, découvrir les règles du monde et utiliser ces règles pour atteindre une performance surhumaine.”
Applications possibles
Un IA qui est réellement capable d’apprendre les contraintes d’une tâche et d’opérer dans ces contraintes a une grande variété d’applications possibles. MuZero pourrait être utilisé pour des tâches comme la compression de vidéos, qui a historiquement été difficile à automatiser à l’aide de l’IA, en raison des nombreux formats de vidéos et de modes de compression différents. MuZero a pu atteindre une amélioration de la compression d’environ 5 %. Cela pourrait avoir des implications pour le grand nombre de vidéos hébergées par Google et YouTube. Au-delà des vidéos, DeepMind étudie également l’utilisation des mêmes techniques MuZero pour la conception d’architecture de protéines et la programmation de robots.
Selon Wendy Hall, professeur de sciences informatiques à l’Université de Southampton, MuZero représente « un pas significatif en avant » pour les algorithmes d’apprentissage par renforcement. Cependant, Hall s’inquiète que les algorithmes pourraient être mal utilisés. Par exemple, la force aérienne américaine a déjà référencé des articles de recherche précoces couvrant MuZero pour créer un système d’IA qui pourrait lancer des missiles depuis des avions-espions U-2. Cela malgré le fait que les chercheurs de DeepMind ont exprimé leur opposition à l’utilisation de leurs algorithmes pour tout arme mortelle, en signant l’Engagement pour les armes autonomes mortelles pour plaider que toute technologie mortelle devrait rester sous contrôle humain.
Silver a expliqué que DeepMind regarde vers l’avenir, visant à développer des algorithmes aussi puissants et polyvalents que le cerveau. Le premier pas pour créer des algorithmes polyvalents et flexibles est de comprendre ce que signifie qu’un système soit intelligent, et l’intelligence est liée à la capacité de discerner les modèles et les règles d’un environnement complexe. En regardant vers l’avenir, en visant à développer des algorithmes aussi puissants et polyvalents que le cerveau. Le premier pas pour créer des algorithmes polyvalents et flexibles est de comprendre ce que signifie qu’un système soit intelligent, et l’intelligence est liée à la capacité de discerner les modèles et les règles d’un environnement complexe.












