Leaders dâopinion
Nous avons appris aux robots à se dÃĐplacer. Maintenant, nous leur enseignons à vivre

La robotique moderne a atteint un point oÃđ le mouvement nâest plus le principal dÃĐfi â les machines peuvent dÃĐjà naviguer, saisir et opÃĐrer dans lâespace avec une prÃĐcision impressionnante. Cependant, les rendre capables de vÃĐritablement ÂŦ vivre Âŧ et fonctionner dans le monde rÃĐel reste un problÃĻme non rÃĐsolu.
Dans ce processus, le rÃīle clÃĐ est jouÃĐ par ce que lâon pourrait appeler la ÂŦ moelle ÃĐpiniÃĻre Âŧ : le systÃĻme responsable des rÃĐactions de base, du comportement et de lâinteraction avec lâenvironnement.
Lorsque lâon regarde lâÃĐvolution des robots sous cet angle, il devient clair que cette sÃĐquence dâÃĐtapes â oÃđ le systÃĻme apprend quelque chose de nouveau à chaque ÃĐtape, du simple mouvement à des actions complexes et conscientes du contexte â ressemble ÃĐtroitement au dÃĐveloppement humain.
Et câest prÃĐcisÃĐment dans cette ÃĐvolution â de ÂŦ lâhardware Âŧ vide à un comportement significatif â que le principal changement dans lâintelligence artificielle physique est en train de se produire aujourdâhui. Il est intÃĐressant dâen apprendre davantage sur ce sujet.
Les fondements de la robotique : une ÃĐtape rarement discutÃĐe
Quâest-ce quâun robot dans les faits ? Câest un dispositif physique initialement crÃĐÃĐ comme une plate-forme universelle. En essence, câest un ÂŦ blanc Âŧ qui doit ensuite Être adaptÃĐ Ã des tÃĒches spÃĐcifiques, entraÃŪnÃĐ pour opÃĐrer dans un environnement donnÃĐ et enseignÃĐ Ã effectuer les actions requises.
Si nous allons au-delà des scÃĐnarios de la vie quotidienne et que nous considÃĐrons des applications plus rÃĐalistes dans un avenir proche, il devient clair que lâadoption complÃĻte des robots se produira principalement dans des environnements industriels et potentiellement dangereux. Cela implique, à son tour, des exigences significativement plus ÃĐlevÃĐes pour leur comportement, leur robustesse et la qualitÃĐ de leur formation.
Le processus commence avec lâÃĐtape la plus basique â la construction du dispositif lui-mÊme. Un robot est assemblÃĐ Ã partir de multiples composants, y compris des actionneurs, des moteurs, des capteurs, des camÃĐras, des LiDARs. Il peut Être humanoÃŊde, sur roues, bipÃĻde ou quadrupÃĻde â le facteur de forme est secondaire. Ce qui compte, câest que, à ce stade, nous nous retrouvons avec un dispositif fonctionnel mais encore ÂŦ vide Âŧ.
LâÃĐtape suivante consiste à installer un modÃĻle de base qui sert de fondement à son comportement. Dans un sens large, le ÂŦ modÃĻle Âŧ est lâensemble de la couche fonctionnelle de contrÃīle. Il est responsable des capacitÃĐs de base : maintenir lâÃĐquilibre, se tenir debout et se dÃĐplacer, naviguer dâun point A à un point B, ÃĐviter les obstacles, ne pas endommager lâenvironnement et interagir en toute sÃĐcuritÃĐ avec les humains.
Câest à ce stade que lâapprentissage par renforcement entre en jeu. Dans de tels systÃĻmes, des milliards de simulations sont exÃĐcutÃĐs. Nous voyons souvent des vidÃĐos de robots ÂŦ apprenant Âŧ dans des environnements complexes : la plupart dâentre eux tombent, perdent lâÃĐquilibre ou ne parviennent pas à terminer la tÃĒche. Mais ceux qui parviennent à rester debout et à continuer à bouger sont ceux qui progressent.
Câest lâessence de lâapprentissage par renforcement : sÃĐlectionner un comportement rÃĐussi. Les algorithmes de ceux qui ÂŦ survivent Âŧ deviennent la base des prochaines itÃĐrations. Au bout dâun nombre ÃĐnorme de runs, un modÃĻle ÃĐmerge qui peut confiantement gÃĐrer les obstacles. Cet algorithme est ensuite transfÃĐrÃĐ au dispositif physique.
Il sâagit dâune ÃĐtape ancrÃĐe mais critique â impliquant souvent peu ou pas de vision par ordinateur, qui nâest pas requise à ce stade. Ce avec quoi nous avons affaire ici, câest la physique et la mÃĐcanique fondamentales qui doivent Être intÃĐgrÃĐes dans le systÃĻme dÃĻs le dÃĐbut.
Comment les robots commencent à ÂŦ ressentir Âŧ le monde
Nous avons donc dÃĐjà le ÂŦ matÃĐriel Âŧ â un robot avec un modÃĻle de base installÃĐ : il peut se tenir debout, marcher et maintenir lâÃĐquilibre. Mais est-ce suffisant pour les tÃĒches du monde rÃĐel, par exemple, dans des environnements industriels ? Ãvidemment non.
LâÃĐtape suivante commence ici. Nous intÃĐgrons des capteurs et entraÃŪnons le modÃĻle pour agir en fonction des entrÃĐes sensorielles. Un nouveau niveau de compÃĐtences de base ÃĐmerge â dÃĐjà beaucoup plus complexe que le simple mouvement.
Une analogie avec le dÃĐveloppement humain est utile ici. à la premiÃĻre ÃĐtape, nous avons amenÃĐ le systÃĻme à un niveau approximatif dâun enfant dâun an : il peut se tenir debout, faire ses premiers pas et maintenir lâÃĐquilibre sans tomber. LâÃĐtape suivante est plus en ligne avec le niveau dâun enfant de huit ans.
à cet ÃĒge, un enfant utilise activement ses ÂŦ capteurs Âŧ : il peut percevoir le risque et ÃĐvaluer les consÃĐquences de ses actes. Il comprend de ne pas toucher quelque chose de chaud ou de mettre quelque chose de trÃĻs froid dans sa bouche. Il peut grimper sur une table, faire du vÃĐlo et interagir avec des objets. Il est capable de saisir, de transporter et de manipuler des objets et dâeffectuer des actions de soins personnels de base.
Nous appelons cela lâÃĐtape de prÃĐ-entraÃŪnement. Et à ce stade, les simulations seules ne sont plus suffisantes.
Oui, certains scÃĐnarios peuvent encore Être modÃĐlisÃĐs avec efficacitÃĐ : comment prendre un verre, ou remplacer une batterie, par exemple, en retirant un composant, en le plaçant sur charge, en prenant un autre et en le rÃĐinstallant.
Mais dans lâensemble, lâÃĐquilibre bascule : environ 80 % de la formation peut encore se dÃĐrouler en simulation, tandis que environ 20 % des donnÃĐes doivent provenir du monde rÃĐel. Et câest là que nous commençons à discuter des donnÃĐes ÃĐgocentriques.
Les donnÃĐes ÃĐgocentriques comme fondement de la comprÃĐhension de lâenvironnement
Aujourdâhui, les donnÃĐes ÃĐgocentriques sont collectÃĐes à une ÃĐchelle massive dans le monde entier â car sans elles, il est impossible de passer des mÃĐcaniques de base à une interaction significative avec le monde rÃĐel. Un collÃĻgue à moi, qui dirige un rÃĐseau de magasins de rÃĐparation auto, a des employÃĐs qui utilisent des camÃĐras montÃĐes sur la tÊte pour enregistrer lâensemble du processus de rÃĐparation de voiture. Un propriÃĐtaire de bÃĒtiment à New York a mis en Åuvre une approche similaire : le personnel de nettoyage porte des camÃĐras fixÃĐes au front qui capturent la façon dont ils nettoient les espaces et maintiennent les zones sanitaires.
Au fil du temps, ces enregistrements deviennent un produit autonome â ils sont conditionnÃĐs et vendus. Leur valeur clÃĐ rÃĐside dans leur adaptabilitÃĐ Ã lâÃĐtape de prÃĐ-entraÃŪnement, aidant à construire une comprÃĐhension fondamentale des environnements et des sÃĐquences dâactions.
Par exemple, un tel service existait à Keymakr, oÃđ lâÃĐquipe a indÃĐpendamment crÃĐÃĐ des collections entiÃĻres de donnÃĐes ÃĐgocentriques à partir de scÃĐnarios simples comme laver la vaisselle à des scÃĐnarios plus complexes.
Pourquoi est-ce si important ? Parce que de telles donnÃĐes fournissent quelque chose que la simulation pure ne peut pas â la diversitÃĐ des environnements du monde rÃĐel. Les bureaux, les ateliers de rÃĐparation auto, les chantiers de construction, les restaurants et les hÃītels â chacun de ces ajoute son propre contexte, scÃĐnarios et nuances. Ensemble, ils forment un ensemble de donnÃĐes qui permettent à un systÃĻme de ne pas seulement ÂŦ voir Âŧ, mais de commencer à comprendre progressivement la dynamique du monde rÃĐel.
à ce stade, lâobjectif nâest plus dâenseigner à un robot à exÃĐcuter parfaitement une action spÃĐcifique. Ce qui compte plus, câest de lui permettre de sâorienter dans son environnement en premier lieu.
Aujourdâhui, presque toutes les entreprises travaillant dans la robotique â de Tesla à Unitree Robotics et Figure AI â se concentrent sur cette ÃĐtape exacte. Leur objectif est de construire un modÃĻle de base dont les capacitÃĐs ressemblent dâabord à celles dâun ÂŦ enfant de huit ans Âŧ, puis progressent vers celles dâun ÂŦ enfant de douze ans Âŧ. Câest ÃĐgalement ce sur quoi nous nous concentrons chez Introspector â en prÃĐparant les donnÃĐes nÃĐcessaires à la prÃĐ-formation, la phase la plus critique dans ÂŦ lâÃĒge de raison Âŧ de la robotique moderne.
Le dernier kilomÃĻtre de la formation : oÃđ lâuniversalitÃĐ se termine et la spÃĐcialisation commence
Imaginons quâun robot a dÃĐjà terminÃĐ la prÃĐ-formation et est fabriquÃĐ dÃĻs le dÃĐpart avec une comprÃĐhension de base du monde et un ensemble de compÃĐtences comparable à celui dâun adolescent. Mais mÊme cela ne suffit pas pour les cas dâutilisation rÃĐels dans les entreprises. Les entreprises nâont pas besoin seulement dâun robot ÂŦ polyvalent Âŧ â elles ont besoin dâun spÃĐcialiste.
Prenons lâexemple de la fabrication automobile. Certaines tÃĒches sont encore effectuÃĐes par des humains car elles nÃĐcessitent de la sensibilitÃĐ, de la prÃĐcision et un contrÃīle visuel continu. Lâautomatisation traditionnelle peine ici. Les manipulateurs industriels excellent dans les tÃĒches rÃĐpÃĐtitives et rigides â ÂŦ prendre, dÃĐplacer, placer Âŧ. Mais les tÃĒches qui nÃĐcessitent de lâadaptabilitÃĐ, la dÃĐtection de la pression et des ajustements en temps rÃĐel restent dans le domaine humain.
Câest là quâune nouvelle demande ÃĐmerge : former un robot pour effectuer une opÃĐration spÃĐcifique exactement comme un travailleur qualifiÃĐ le fait sur une ligne de production. En dâautres termes, aprÃĻs la formation de base vient le niveau suivant : la formation pour une profession et un scÃĐnario spÃĐcifiques.
à ce stade, une question pratique se pose : quâest-ce qui est exactement requis pour ce niveau de formation ? Si nous voulons quâun robot reproduise les performances humaines, nous devons capturer ce comportement humain avec la plus grande prÃĐcision possible. Par exemple, le spÃĐcialiste sur le plan de production devrait porter une camÃĐra et, sur une pÃĐriode prolongÃĐe, des mois ou mÊme une annÃĐe, enregistrer la façon dont il effectue la tÃĒche.
Ce quâil faut pour que les robots ÂŦ vivent Âŧ dans le monde humain
Une camÃĐra seule ne suffit pas. Il est nÃĐcessaire de capturer non seulement la perspective visuelle mais ÃĐgalement la physique du mouvement. Cela se fait à lâaide de gants spÃĐcialisÃĐs avec des capteurs tactiles qui mesurent la pression, la force appliquÃĐe et la nature de lâinteraction avec les objets. Câest particuliÃĻrement important parce que les objets eux-mÊmes peuvent varier considÃĐrablement. Par exemple, les bandes de jointure peuvent diffÃĐrer en rigiditÃĐ dâun modÃĻle de voiture à lâautre, ce qui affecte directement la façon dont la tÃĒche est effectuÃĐe.
Ensuite vient la traçage cinÃĐmatique. Des marqueurs â visuels ou basÃĐs sur des capteurs â sont placÃĐs sur les poignets, les coudes et parfois les ÃĐpaules. Ceux-ci peuvent inclure, par exemple, des bracelets avec des marqueurs identifiables (semblables à des codes QR) qui permettent au systÃĻme de suivre la position de la main dans lâespace à partir de la vidÃĐo. Des capteurs supplÃĐmentaires, tels que des gyroscopes, sont utilisÃĐs pour capturer les mouvements des articulations.
Lâobjectif final est de reconstruire complÃĻtement la mÃĐcanique du mouvement : comment lâÃĐpaule bouge, comment le coude se plie, comment le poignet tourne. Tout cela devient essentiel pour la prochaine ÃĐtape â la post-formation.
Si, pendant la prÃĐ-formation, nous pouvions encore nous appuyer partiellement sur la simulation, à ce stade, cela ne fonctionne plus. Ce ÂŦ dernier kilomÃĻtre Âŧ est presque impossible à modÃĐliser avec prÃĐcision. Vous ne pouvez pas simuler complÃĻtement, par exemple, comment un chef ÃĐtale la pÃĒte â la force appliquÃĐe, comment la pression est distribuÃĐe, comment la matiÃĻre est ressentie.
Câest pourquoi, pendant la post-formation, presque toutes les donnÃĐes doivent provenir du monde rÃĐel. Et câest là que cela devient clair : le principal dÃĐfi se dÃĐplace dans le domaine pratique â comment obtenir de telles donnÃĐes dans la rÃĐalitÃĐ. La collecte de donnÃĐes ÃĐgocentriques à ce niveau est un processus complexe et multÃĐtape qui implique lâaccÃĻs aux environnements, des ÃĐquipements spÃĐcialisÃĐs, la participation de travailleurs qualifiÃĐs et la prÃĐparation ultÃĐrieure des donnÃĐes.
Au-delà de la thÃĐorie, câest là que les robots commencent vÃĐritablement à ÂŦ vivre Âŧ â aprÃĻs que nous soyons parvenus à organiser ce processus, à surmonter les contraintes que les ÃĐquipes rencontrent dans les diffÃĐrentes industries et à annoter de telles ensembles de donnÃĐes à grande ÃĐchelle. Cela sera abordÃĐ dans la prochaine partie, oÃđ nous examinerons de plus prÃĻs tous les dÃĐfis qui surgissent pendant lâÃĐtiquetage et la prÃĐparation de ces donnÃĐes.












