Robotique et IA physique
Les robots capables d’apprendre des tâches compliquées à partir de quelques démonstrations
Dans l’un des derniers développements dans le domaine de la robotique, des chercheurs de l’Université de Californie du Sud (USC) ont développé un système où les robots peuvent apprendre des tâches compliquées avec quelques démonstrations. Plus impressionnant encore, certaines de ces démonstrations peuvent être imparfaites.
La recherche a été présentée à la Conférence sur l’apprentissage des robots (CoRL) le 18 novembre, intitulée “Apprentissage à partir de démonstrations en utilisant la logique temporelle des signaux.”
Le Système
La qualité de chaque démonstration est mesurée afin que le système puisse apprendre de ses succès et de ses échecs. Contrairement aux méthodes actuelles, qui nécessitent au moins 100 démonstrations pour enseigner une tâche spécifique, le nouveau système n’en nécessite que quelques-unes. De manière intuitive, la façon dont ces robots apprennent est similaire à la façon dont les humains apprennent les uns des autres. Par exemple, les humains regardent et apprennent des autres qui complètent des tâches avec succès ou de manière imparfaite.
Aniruddh Puranic est l’auteur principal de la recherche et un étudiant en doctorat en informatique à l’USC Viterbi School of Engineering.
“De nombreux systèmes d’apprentissage automatique et de renforcement nécessitent de grandes quantités de données et des centaines de démonstrations – vous avez besoin qu’un humain démontre à plusieurs reprises, ce qui n’est pas réalisable”, a déclaré Puranic.
“De plus, la plupart des gens n’ont pas de connaissances en programmation pour explicitement indiquer ce que le robot doit faire, et un humain ne peut pas démontrer tout ce que le robot doit savoir”, a-t-il continué. “Que se passe-t-il si le robot rencontre quelque chose qu’il n’a jamais vu auparavant ? C’est un défi clé.”
Les chercheurs ont utilisé la “logique temporelle des signaux” ou STL pour déterminer la qualité des démonstrations, les classant en conséquence et créant des récompenses inhérentes.
Il y a deux raisons principales pour lesquelles les chercheurs ont choisi la STL :
- En apprenant à partir de démonstrations, les robots peuvent adopter des imperfections ou même des comportements dangereux et des actions indésirables.
- Les démonstrations peuvent différer en qualité en fonction de l’utilisateur qui les fournit, et certaines démonstrations sont de meilleurs indicateurs de comportement souhaité que d’autres.
En développant le système de cette manière, le robot peut encore apprendre à partir de démonstrations imparfaites, même si elles ne répondent pas aux exigences logiques. En d’autres termes, il tire ses propres conclusions sur la précision ou la réussite.
Stefanos Nikolaidis est un co-auteur et un professeur adjoint en informatique à l’USC Viterbi.
“Disons que les robots apprennent à partir de différents types de démonstrations – cela peut être une démonstration pratique, des vidéos ou des simulations – si je fais quelque chose qui est très dangereux, les approches standard feront l’une des deux choses : soit elles l’ignoreront complètement, soit, pire encore, le robot apprendra la mauvaise chose”, déclare Nikolaidis.
“En revanche, de manière très intelligente, ce travail utilise un peu de bon sens sous forme de logique pour comprendre lesquelles des parties de la démonstration sont bonnes et lesquelles ne le sont pas”, poursuit-il. “En essence, c’est exactement ce que les humains font également.”
Logique temporelle des signaux
Les robots peuvent raisonner sur les résultats actuels et futurs grâce à la STL, qui est un langage symbolique mathématique expressif. Auparavant, la recherche reposait sur la “logique temporelle linéaire”.
Jyo Deshmukh est un ancien ingénieur Toyota et professeur adjoint en informatique à l’USC.
“Lorsque nous entrons dans le monde des systèmes cyberphysiques, comme les robots et les voitures autonomes, où le temps est crucial, la logique temporelle linéaire devient un peu encombrante, car elle raisonne sur des séquences de valeurs vraies/fausses pour les variables, tandis que la STL permet de raisonner sur les signaux physiques”, déclare Deshmukh.
L’équipe de chercheurs a été surprise par le niveau de réussite du système.
“Par rapport à un algorithme de pointe, largement utilisé dans les applications de robotique, on constate une différence d’un ordre de grandeur dans le nombre de démonstrations nécessaires”, déclare Nikolaidis.
Selon les chercheurs, les systèmes pourraient apprendre à partir de simulateurs de conduite et éventuellement de vidéos. L’étape suivante consiste à les tester sur des robots réels, car les tests initiaux ont été effectués sur un simulateur de jeu. Le système sera utile pour des applications telles que celles dans les environnements ménagers, les entrepôts et les véhicules d’exploration spatiale.
“Si nous voulons que les robots soient de bons coéquipiers et aident les gens, ils doivent d’abord apprendre et s’adapter aux préférences humaines de manière très efficace”, déclare Nikolaidis. “Notre méthode fournit cela.”












