Robotique et IA physique

Modèle d’apprentissage automatique qui comprend les relations entre les objets

mm
Ajouter Unite.AI à vos sources préférées sur Google

Les chercheurs du Massachusetts Institute of Technology (MIT) ont développé un nouveau modèle d’apprentissage automatique (ML) qui comprend les relations sous-jacentes entre les objets dans une scène. Le modèle représente les relations individuelles une à une avant de combiner les représentations pour décrire la scène globale.

Grâce à cette nouvelle approche, le modèle ML peut générer des images plus précises à partir de descriptions textuelles, et il peut le faire même lorsque la scène comporte plusieurs projets disposés dans différentes relations les uns avec les autres.

Ce nouveau développement est important, car de nombreux modèles d’apprentissage profond ne sont pas en mesure de comprendre les relations entrelacées entre les objets individuels.

Le modèle de l’équipe pourrait être utilisé dans des cas où des robots industriels doivent effectuer des tâches de manipulation multi-étapes, telles que le empilage d’objets ou l’assemblage d’appareils. Il aide également à ce que les machines soient finalement capables d’apprendre et d’interagir avec leur environnement, comme les humains.

Yilun Du est un étudiant en doctorat au Laboratoire d’informatique et d’intelligence artificielle (CSAIL) et co-auteur principal de l’article. Du a co-dirigé la recherche avec Shuang Li, un étudiant en doctorat au CSAIL, et Nan Liu, un étudiant diplômé de l’Université de l’Illinois à Urbana-Champaign. L’équipe comprenait également Joshua B. Tenenbaum, professeur de sciences cognitives et de computation au département de sciences du cerveau et de la cognition, et l’auteur principal Antonio Torralba, professeur d’électrotechnique et d’informatique. Les deux, Tenenbaum et Torralba, sont membres du CSAIL.

Le nouveau cadre

“Lorsque je regarde une table, je ne peux pas dire qu’il y a un objet à l’emplacement XYZ. Notre esprit ne fonctionne pas de cette façon. Lorsque nous comprenons une scène, nous la comprenons vraiment en fonction des relations entre les objets. Nous pensons qu’en construisant un système capable de comprendre les relations entre les objets, nous pourrions utiliser ce système pour manipuler et modifier notre environnement de manière plus efficace”, déclare Du.

Le nouveau cadre peut générer une image d’une scène en fonction d’une description textuelle des objets et de leurs relations.

Le système peut alors décomposer ces phrases en parties plus petites qui décrivent chaque relation individuelle. Chaque partie est ensuite modélisée séparément, et les pièces sont combinées à travers un processus d’optimisation qui génère une image de la scène.

Avec les phrases décomposées en parties plus courtes, le système peut alors les recombiner de différentes manières, ce qui lui permet de s’adapter à des descriptions de scènes qu’il n’a jamais rencontrées.

“D’autres systèmes prendraient toutes les relations de manière holistique et généreraient l’image en une seule étape à partir de la description. Cependant, de telles approches échouent lorsque nous avons des descriptions hors de la distribution, telles que des descriptions avec plus de relations, car ces modèles ne peuvent pas vraiment s’adapter en une seule étape pour générer des images contenant plus de relations. Cependant, comme nous composons ces modèles plus petits et séparés, nous pouvons modéliser un plus grand nombre de relations et nous adapter à des combinaisons nouvelles”, déclare Du.

Le système peut également effectuer ce processus à l’envers. S’il est alimenté par une image, il peut trouver des descriptions textuelles qui correspondent aux relations entre les objets de la scène.

Évaluation du modèle

Les chercheurs ont demandé à des humains d’évaluer si les images générées correspondaient à la description originale de la scène. Lorsque les descriptions contenaient trois relations, ce qui était le type le plus complexe, 91 % des participants ont déclaré que le nouveau modèle fonctionnait mieux que d’autres méthodes d’apprentissage profond.

“Une chose intéressante que nous avons constatée est que pour notre modèle, nous pouvons augmenter notre phrase de une relation à deux, ou trois, ou même quatre descriptions, et notre approche continue de pouvoir générer des images qui sont correctement décrites par ces descriptions, tandis que d’autres méthodes échouent”, déclare Du.

Le modèle a également démontré une capacité impressionnante à fonctionner avec des descriptions qu’il n’avait pas rencontrées précédemment.

“C’est très prometteur, car c’est plus proche de la façon dont les humains fonctionnent. Les humains peuvent ne voir que quelques exemples, mais nous pouvons extraire des informations utiles de ces quelques exemples et les combiner pour créer des combinaisons infinies. Et notre modèle a une propriété qui lui permet d’apprendre à partir de moins de données mais de généraliser à des scènes ou des générations d’images plus complexes”, déclare Li.

L’équipe va maintenant essayer de tester le modèle sur des images du monde réel plus complexes et explorer comment incorporer finalement le modèle dans des systèmes de robotique.

Alex dirige les opérations d'information propulsées par l'IA de Unite.AI, en combinant le journalisme, la recherche et l'automatisation pour soutenir une couverture opportune et évolutive de l'intelligence artificielle. Son travail aide à garantir que les développements émergents de l'IA sont mis en avant efficacement tout en maintenant les normes éditoriales de la publication.