Leaders d’opinion

Nous avons appris aux robots à se déplacer. Maintenant, nous leur enseignons à vivre

mm
Ajouter Unite.AI à vos sources préférées sur Google

La robotique moderne a atteint un point où le mouvement n’est plus le principal défi – les machines peuvent déjà naviguer, saisir et opérer dans l’espace avec une précision impressionnante. Cependant, les rendre capables de véritablement « vivre » et fonctionner dans le monde réel reste un problème non résolu.

Dans ce processus, le rôle clé est joué par ce que l’on pourrait appeler la « moelle épinière » : le système responsable des réactions de base, du comportement et de l’interaction avec l’environnement.

Lorsque l’on regarde l’évolution des robots sous cet angle, il devient clair que cette séquence d’étapes – où le système apprend quelque chose de nouveau à chaque étape, du simple mouvement à des actions complexes et conscientes du contexte – ressemble étroitement au développement humain.

Et c’est précisément dans cette évolution – de « l’hardware » vide à un comportement significatif – que le principal changement dans l’intelligence artificielle physique est en train de se produire aujourd’hui. Il est intéressant d’en apprendre davantage sur ce sujet.

Les fondements de la robotique : une étape rarement discutée

Qu’est-ce qu’un robot dans les faits ? C’est un dispositif physique initialement créé comme une plate-forme universelle. En essence, c’est un « blanc » qui doit ensuite être adapté à des tâches spécifiques, entraîné pour opérer dans un environnement donné et enseigné à effectuer les actions requises.

Si nous allons au-delà des scénarios de la vie quotidienne et que nous considérons des applications plus réalistes dans un avenir proche, il devient clair que l’adoption complète des robots se produira principalement dans des environnements industriels et potentiellement dangereux. Cela implique, à son tour, des exigences significativement plus élevées pour leur comportement, leur robustesse et la qualité de leur formation.

Le processus commence avec l’étape la plus basique – la construction du dispositif lui-même. Un robot est assemblé à partir de multiples composants, y compris des actionneurs, des moteurs, des capteurs, des caméras, des LiDARs. Il peut être humanoïde, sur roues, bipède ou quadrupède – le facteur de forme est secondaire. Ce qui compte, c’est que, à ce stade, nous nous retrouvons avec un dispositif fonctionnel mais encore « vide ».

L’étape suivante consiste à installer un modèle de base qui sert de fondement à son comportement. Dans un sens large, le « modèle » est l’ensemble de la couche fonctionnelle de contrôle. Il est responsable des capacités de base : maintenir l’équilibre, se tenir debout et se déplacer, naviguer d’un point A à un point B, éviter les obstacles, ne pas endommager l’environnement et interagir en toute sécurité avec les humains.

C’est à ce stade que l’apprentissage par renforcement entre en jeu. Dans de tels systèmes, des milliards de simulations sont exécutés. Nous voyons souvent des vidéos de robots « apprenant » dans des environnements complexes : la plupart d’entre eux tombent, perdent l’équilibre ou ne parviennent pas à terminer la tâche. Mais ceux qui parviennent à rester debout et à continuer à bouger sont ceux qui progressent.

C’est l’essence de l’apprentissage par renforcement : sélectionner un comportement réussi. Les algorithmes de ceux qui « survivent » deviennent la base des prochaines itérations. Au bout d’un nombre énorme de runs, un modèle émerge qui peut confiantement gérer les obstacles. Cet algorithme est ensuite transféré au dispositif physique.

Il s’agit d’une étape ancrée mais critique – impliquant souvent peu ou pas de vision par ordinateur, qui n’est pas requise à ce stade. Ce avec quoi nous avons affaire ici, c’est la physique et la mécanique fondamentales qui doivent être intégrées dans le système dès le début.

Comment les robots commencent à « ressentir » le monde

Nous avons donc déjà le « matériel » – un robot avec un modèle de base installé : il peut se tenir debout, marcher et maintenir l’équilibre. Mais est-ce suffisant pour les tâches du monde réel, par exemple, dans des environnements industriels ? Évidemment non.

L’étape suivante commence ici. Nous intégrons des capteurs et entraînons le modèle pour agir en fonction des entrées sensorielles. Un nouveau niveau de compétences de base émerge – déjà beaucoup plus complexe que le simple mouvement.

Une analogie avec le développement humain est utile ici. À la première étape, nous avons amené le système à un niveau approximatif d’un enfant d’un an : il peut se tenir debout, faire ses premiers pas et maintenir l’équilibre sans tomber. L’étape suivante est plus en ligne avec le niveau d’un enfant de huit ans.

À cet âge, un enfant utilise activement ses « capteurs » : il peut percevoir le risque et évaluer les conséquences de ses actes. Il comprend de ne pas toucher quelque chose de chaud ou de mettre quelque chose de très froid dans sa bouche. Il peut grimper sur une table, faire du vélo et interagir avec des objets. Il est capable de saisir, de transporter et de manipuler des objets et d’effectuer des actions de soins personnels de base.

Nous appelons cela l’étape de pré-entraînement. Et à ce stade, les simulations seules ne sont plus suffisantes.

Oui, certains scénarios peuvent encore être modélisés avec efficacité : comment prendre un verre, ou remplacer une batterie, par exemple, en retirant un composant, en le plaçant sur charge, en prenant un autre et en le réinstallant.

Mais dans l’ensemble, l’équilibre bascule : environ 80 % de la formation peut encore se dérouler en simulation, tandis que environ 20 % des données doivent provenir du monde réel. Et c’est là que nous commençons à discuter des données égocentriques.

Les données égocentriques comme fondement de la compréhension de l’environnement

Aujourd’hui, les données égocentriques sont collectées à une échelle massive dans le monde entier – car sans elles, il est impossible de passer des mécaniques de base à une interaction significative avec le monde réel. Un collègue à moi, qui dirige un réseau de magasins de réparation auto, a des employés qui utilisent des caméras montées sur la tête pour enregistrer l’ensemble du processus de réparation de voiture. Un propriétaire de bâtiment à New York a mis en œuvre une approche similaire : le personnel de nettoyage porte des caméras fixées au front qui capturent la façon dont ils nettoient les espaces et maintiennent les zones sanitaires.

Au fil du temps, ces enregistrements deviennent un produit autonome – ils sont conditionnés et vendus. Leur valeur clé réside dans leur adaptabilité à l’étape de pré-entraînement, aidant à construire une compréhension fondamentale des environnements et des séquences d’actions.

Par exemple, un tel service existait à Keymakr, où l’équipe a indépendamment créé des collections entières de données égocentriques à partir de scénarios simples comme laver la vaisselle à des scénarios plus complexes.

Pourquoi est-ce si important ? Parce que de telles données fournissent quelque chose que la simulation pure ne peut pas – la diversité des environnements du monde réel. Les bureaux, les ateliers de réparation auto, les chantiers de construction, les restaurants et les hôtels – chacun de ces ajoute son propre contexte, scénarios et nuances. Ensemble, ils forment un ensemble de données qui permettent à un système de ne pas seulement « voir », mais de commencer à comprendre progressivement la dynamique du monde réel.

À ce stade, l’objectif n’est plus d’enseigner à un robot à exécuter parfaitement une action spécifique. Ce qui compte plus, c’est de lui permettre de s’orienter dans son environnement en premier lieu.

Aujourd’hui, presque toutes les entreprises travaillant dans la robotique – de Tesla (TSLA ) à Unitree Robotics et Figure AI – se concentrent sur cette étape exacte. Leur objectif est de construire un modèle de base dont les capacités ressemblent d’abord à celles d’un « enfant de huit ans », puis progressent vers celles d’un « enfant de douze ans ». C’est également ce sur quoi nous nous concentrons chez Introspector – en préparant les données nécessaires à la pré-formation, la phase la plus critique dans « l’âge de raison » de la robotique moderne.

Le dernier kilomètre de la formation : où l’universalité se termine et la spécialisation commence

Imaginons qu’un robot a déjà terminé la pré-formation et est fabriqué dès le départ avec une compréhension de base du monde et un ensemble de compétences comparable à celui d’un adolescent. Mais même cela ne suffit pas pour les cas d’utilisation réels dans les entreprises. Les entreprises n’ont pas besoin seulement d’un robot « polyvalent » – elles ont besoin d’un spécialiste.

Prenons l’exemple de la fabrication automobile. Certaines tâches sont encore effectuées par des humains car elles nécessitent de la sensibilité, de la précision et un contrôle visuel continu. L’automatisation traditionnelle peine ici. Les manipulateurs industriels excellent dans les tâches répétitives et rigides – « prendre, déplacer, placer ». Mais les tâches qui nécessitent de l’adaptabilité, la détection de la pression et des ajustements en temps réel restent dans le domaine humain.

C’est là qu’une nouvelle demande émerge : former un robot pour effectuer une opération spécifique exactement comme un travailleur qualifié le fait sur une ligne de production. En d’autres termes, après la formation de base vient le niveau suivant : la formation pour une profession et un scénario spécifiques.

À ce stade, une question pratique se pose : qu’est-ce qui est exactement requis pour ce niveau de formation ? Si nous voulons qu’un robot reproduise les performances humaines, nous devons capturer ce comportement humain avec la plus grande précision possible. Par exemple, le spécialiste sur le plan de production devrait porter une caméra et, sur une période prolongée, des mois ou même une année, enregistrer la façon dont il effectue la tâche.

Ce qu’il faut pour que les robots « vivent » dans le monde humain

Une caméra seule ne suffit pas. Il est nécessaire de capturer non seulement la perspective visuelle mais également la physique du mouvement. Cela se fait à l’aide de gants spécialisés avec des capteurs tactiles qui mesurent la pression, la force appliquée et la nature de l’interaction avec les objets. C’est particulièrement important parce que les objets eux-mêmes peuvent varier considérablement. Par exemple, les bandes de jointure peuvent différer en rigidité d’un modèle de voiture à l’autre, ce qui affecte directement la façon dont la tâche est effectuée.

Ensuite vient la traçage cinématique. Des marqueurs – visuels ou basés sur des capteurs – sont placés sur les poignets, les coudes et parfois les épaules. Ceux-ci peuvent inclure, par exemple, des bracelets avec des marqueurs identifiables (semblables à des codes QR) qui permettent au système de suivre la position de la main dans l’espace à partir de la vidéo. Des capteurs supplémentaires, tels que des gyroscopes, sont utilisés pour capturer les mouvements des articulations.

L’objectif final est de reconstruire complètement la mécanique du mouvement : comment l’épaule bouge, comment le coude se plie, comment le poignet tourne. Tout cela devient essentiel pour la prochaine étape – la post-formation.

Si, pendant la pré-formation, nous pouvions encore nous appuyer partiellement sur la simulation, à ce stade, cela ne fonctionne plus. Ce « dernier kilomètre » est presque impossible à modéliser avec précision. Vous ne pouvez pas simuler complètement, par exemple, comment un chef étale la pâte – la force appliquée, comment la pression est distribuée, comment la matière est ressentie.

C’est pourquoi, pendant la post-formation, presque toutes les données doivent provenir du monde réel. Et c’est là que cela devient clair : le principal défi se déplace dans le domaine pratique – comment obtenir de telles données dans la réalité. La collecte de données égocentriques à ce niveau est un processus complexe et multétape qui implique l’accès aux environnements, des équipements spécialisés, la participation de travailleurs qualifiés et la préparation ultérieure des données.

Au-delà de la théorie, c’est là que les robots commencent véritablement à « vivre » – après que nous soyons parvenus à organiser ce processus, à surmonter les contraintes que les équipes rencontrent dans les différentes industries et à annoter de telles ensembles de données à grande échelle. Cela sera abordé dans la prochaine partie, où nous examinerons de plus près tous les défis qui surgissent pendant l’étiquetage et la préparation de ces données.

Michael Abramov est le fondateur & PDG de Scryon, apportant plus de 15 ans d'expérience en ingénierie logicielle et en systèmes d'IA de vision par ordinateur à la création d'outils d'étiquetage de niveau entreprise.

Michael a commencé sa carrière en tant qu'ingénieur logiciel et responsable R&D, construisant des systèmes de données évolutifs et dirigeant des équipes d'ingénierie transversales. Jusqu'en 2025, il a été le PDG de Keymakr, une société de services d'étiquetage de données, où il a été pionnier des flux de travail humain dans la boucle, des systèmes d'assurance qualité avancés et des outils sur mesure pour soutenir les besoins en données de vision par ordinateur et d'autonomie à grande échelle.

Il est titulaire d'un B.Sc. en informatique et possède une formation en ingénierie et en arts créatifs, apportant une perspective multidisciplinaire à la résolution de problèmes complexes. Michael évolue à l'intersection de l'innovation technologique, du leadership stratégique de produit et de l'impact réel, faisant progresser la prochaine frontière des systèmes autonomes et de l'automatisation intelligente.