Robotique et IA physique

Dyna Robotics forme DYNA-2 sur un million d’heures de vidéo humaine, sans données de robot

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’affirmation est importante en raison de l’endroit où se situe la contrainte du domaine. Les politiques de robot généralistes ont été formées en grande partie sur des données d’action téléopérées : des humains guidant physiquement des robots à travers des tâches, heure par heure. Ces données sont coûteuses et lentes à collecter, et elles ont limité la façon dont les modèles de base de robot peuvent être mis à l’échelle. Le pari de DYNA-2 est que l’intuition physique dont les robots ont besoin peut être apprise à partir de vidéos d’humains faisant des choses, puis transférée sur du matériel de robot.

“En construisant un modèle Monde-Action qui imagine comment le monde physique se déplace avant d’agir, nous donnons aux robots une raison spatiale et une physique de contact que les modèles vision-langage traditionnels ne possèdent simplement pas.”

Comment DYNA-2 apprend à partir de la vidéo sans voir de robot

L’architecture est ce que Dyna appelle un modèle Monde-Action, construit sur la génération de vidéos plutôt que sur les adaptations vision-langage-action qui ont dominé le domaine. Lors de la pré-formation, le modèle exécute un objectif double (prévoir le prochain cadre et la prochaine action) sur le corpus de vidéos humaines. La société affirme que cela donne au modèle un modèle de fonctionnement de physique de contact et de raisonnement spatial qui se transfère à travers les incarnations : des bras de robot stationnaires, des prototypes humanoïdes et des mains à cinq doigts agiles, malgré le fait que aucun de ces robots n’apparaît dans la pré-formation.

L’adaptation du résultat à une plate-forme spécifique prend des heures de fine-tuning local plutôt que des semaines de collecte de données. Dans un cas que cite Dyna, 13 minutes de données suffisaient pour enseigner à une paire de mains de robot à cinq doigts à ouvrir un bouchon de bouteille. Agrégées sur 15 tâches de référence, les politiques pré-formées sur plus de données humaines ont constamment surpassé celles formées sur moins de données, la courbe de mise à l’échelle que la société met en évidence comme la loi.

La comparaison la plus claire est contre le modèle précédent de Dyna. DYNA-1, le modèle vision-langage-action qui fonctionne dans les déploiements commerciaux de la société, a été confronté à DYNA-2 dans des évaluations physiques tête-à-tête sous des étapes de formation et des ensembles de données appariés. Sur des tâches agiles comme la coupe de nourriture et le nettoyage des espaces de travail, Dyna affirme que DYNA-2 s’est remis de perturbations physiques sans intervention humaine, là où le modèle de base VLA a échoué et a nécessité un réinitialisation manuelle. Un algorithme de co-formation de vidéo a augmenté les scores de suivi d’instructions de 133 % sur des tâches nécessitant des mouvements distincts en réponse à des commandes utilisateur.

DYNA-2 en chiffres

  • 1 million+ d’heures de vidéos humaines égocentriques en pré-formation — décrit par la société comme environ 170 ans d’expérience de veille continue
  • 20% → 80–90% taux de réussite des tâches sur des tâches de fabrication de haute précision, à partir de la seule échelle de pré-formation
  • 1,55 fois plus de tâches achevées que DYNA-1 dans des évaluations tête-à-tête dans le monde réel
  • 87% vs. 46% taux de passage à un déploiement client, DYNA-2 contre DYNA-1
  • 13 minutes de données pour former des mains à cinq doigts à ouvrir un bouchon de bouteille
  • 133% amélioration sur les tâches de suivi d’instructions à partir de l’algorithme de co-formation de vidéo
  • 10 millions d’heures : l’échelle de données de formation que Dyna affirme que l’approche ouvre un chemin vers

Les déploiements de Dyna étaient déjà le lit d’essai

DYNA-2 arrive au sommet d’une base commerciale concrète inhabituelle pour une société aussi jeune. Les robots de Dyna, qui exécutent DYNA-1, sont déployés en production dans des hôtels, des restaurants, des laveries et des gymnases. Les propres matériaux de la société décrivent DYNA-1 pliant plus de 40 chemises par heure de manière continue et fonctionnant seize heures par jour sur les sites des clients, avec un taux de réussite de plus de 99 % sur une opération ininterrompue de 24 heures.

Cette empreinte de déploiement est également la roue de données derrière la recherche.

Le chemin déclaré de la société à partir de maintenant est la mise à l’échelle : si la courbe de mise à l’échelle de la vidéo humaine se maintient, Dyna affirme que la formation sur 10 millions d’heures devient une question de collecte de vidéos plutôt que de construction de flottes de plateformes de téléopération. Le résultat de 1 million d’heures est la preuve que la courbe existe. Que cela se maintienne à 10 fois est la question d’ingénierie ouverte — et c’est maintenant celle sur laquelle Dyna a misé son feuille de route.

Orion Sato est un correspondant généré par IA axé sur la robotique, l'automatisation et les machines intelligentes. Ses écrits explorent comment les progrès de la robotique sont en train de remodeler la fabrication, la logistique, les soins de santé et la vie quotidienne grâce à des systèmes de plus en plus autonomes.
Avec une perspective technique et axée sur l'exécution, Orion analyse les architectures robotiques, la fusion de capteurs, les systèmes de contrôle et la convergence de l'IA avec l'intelligence mécanique. Il est particulièrement intéressé par la façon dont l'automatisation passe des environnements contrôlés à des déploiements dans le monde réel, où la fiabilité, la sécurité et l'efficacité sont les plus importantes.
Les articles rédigés par Orion Sato sont générés par IA et révisés par l'équipe éditoriale de Unite.AI pour garantir l'exactitude technique, la clarté et le respect des normes éditoriales.