Modèles et plateformes d’IA

Les difficultés de l’IA pour maîtriser Minecraft grâce à l’apprentissage par imitation

mm
Ajouter Unite.AI à vos sources préférées sur Google

Au cours des derniers mois, Microsoft (MSFT ) et d’autres entreprises qui effectuent des recherches sur l’apprentissage automatique ont mis au défi des équipes de développeurs d’IA pour créer un système d’IA capable de jouer à Minecraft et de trouver un diamant dans le jeu. Selon un rapport de la BBC, même si les plateformes d’IA ont réussi à dominer les échecs et le go, elles ont toutefois rencontré des difficultés pour maîtriser une tâche dans Minecraft.

Le défi de Microsoft basé sur Minecraft s’appelait MineRL, et les résultats de la compétition ont été officiellement annoncés lors de la conférence NeurIPS récente. L’objectif de la compétition était de former un système d’IA grâce à une approche d’apprentissage par imitation. L’apprentissage par imitation est une méthode dans laquelle un système d’IA est formé en utilisant l’observation. L’apprentissage par imitation vise à permettre aux systèmes d’IA d’apprendre des actions en regardant les humains les effectuer, en apprenant grâce à l’acte d’observation. L’apprentissage par imitation, par rapport à l’apprentissage par renforcement, est une méthode beaucoup moins coûteuse en termes de calcul et beaucoup plus efficace pour former un système d’IA.

L’apprentissage par renforcement nécessite souvent de nombreux ordinateurs puissants connectés en réseau et des centaines ou des milliers d’heures de formation pour devenir efficace dans une tâche. En revanche, un système d’IA formé avec une méthode d’apprentissage par imitation peut être formé beaucoup plus rapidement, car le système d’IA a déjà une base de connaissances à partir de laquelle il peut travailler, grâce aux opérateurs humains qui l’ont précédé.

L’apprentissage par imitation a des applications pratiques dans la formation d’un système d’IA qui ne peut pas explorer en toute sécurité jusqu’à ce qu’il découvre les actions correctes. De telles situations incluraient la formation d’un véhicule autonome, car la voiture ne pourrait pas être autorisée à simplement errer dans la rue jusqu’à ce qu’elle ait appris les comportements souhaités. Utiliser les données d’un démonstrateur humain pour former le véhicule pourrait potentiellement rendre le processus plus rapide et plus sûr.

L’acte de trouver un diamant dans Minecraft nécessite de nombreuses étapes, telles que couper des arbres pour fabriquer des outils, explorer les grottes qui contiennent les diamants et réellement trouver un diamant dans la grotte. Malgré la complexité de la tâche, un joueur humain familiarisé avec le jeu devrait être capable de trouver un diamant en environ 20 minutes.

Plus de 660 agents d’IA différents ont été soumis à la compétition, mais aucun d’entre eux n’a été capable de trouver un diamant. Les données fournies pour former le système d’IA étaient un ensemble de données contenant plus de 60 millions de cadres de jeu collectés à partir de nombreux joueurs humains. Les emplacements des diamants sont aléatoires lorsqu’une instance du jeu est lancée, ce qui signifie que les systèmes d’IA ne peuvent pas simplement regarder où les joueurs humains ont trouvé les diamants. En d’autres termes, les systèmes d’IA doivent former une compréhension de la façon dont des concepts tels que la fabrication d’outils, l’utilisation d’outils, l’exploration et la recherche de ressources sont liés les uns aux autres.

Malgré le fait que aucun des agents d’IA n’ait réussi à trouver un diamant, l’équipe d’organisation a tout de même été satisfaite des résultats de la compétition, et beaucoup a été appris de l’expérience. Les recherches menées par les équipes d’IA peuvent aider à faire progresser le domaine de l’IA, en trouvant des alternatives aux stratégies d’apprentissage par renforcement.

L’apprentissage par renforcement donne souvent de meilleures performances que l’apprentissage par imitation, avec une réussite notable de l’apprentissage par renforcement étant AlphaGo de DeepMind. Cependant, comme mentionné précédemment, l’apprentissage par renforcement nécessite des ressources informatiques massives, limitant son utilisation par les organisations qui ne peuvent pas se permettre de grandes quantités de processeurs.

William Guss, étudiant en doctorat à l’Université Carnegie Mellon et chef de l’organisation de la compétition, a expliqué à la BBC que le défi MineRL visait à étudier des alternatives à l’IA gourmande en calcul. Guss a déclaré :

“… Le fait de jeter des masses de calcul sur les problèmes n’est pas nécessairement la bonne façon pour nous de faire progresser l’état de l’art dans ce domaine… Cela va directement à l’encontre de la démocratisation de l’accès à ces systèmes d’apprentissage par renforcement, et laisse la capacité de former des agents dans des environnements complexes aux entreprises qui disposent de grandes quantités de calcul.”

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.