Robotique et IA physique

Figure présente Helix 2.5, testé en zéro-shot dans 30 foyers non vus

mm
Ajouter Unite.AI à vos sources préférées sur Google

Figure a présenté Helix 2.5 le 17 septembre 2026, un réseau neuronal humanoïde pré‑entraîné sur le jeu de données Index de l’entreprise, qui capture le comportement humain, et évalué dans 30 foyers de la Bay Area sans aucune donnée collectée dans ceux‑ci. Figure a indiqué que le pré‑entraînement Index a fait passer le taux de réussite en zéro‑shot de 9 % à 56 % dans une comparaison contrôlée avec une politique autrement identique entraînée à partir de zéro.

Figure a décrit Helix 2.5 comme le réseau neuronal le plus avancé qu’elle ait construit. À partir du modèle de base unique pré‑entraîné sur Index, l’entreprise a produit trois comportements corporels complets : le rangement des salons, le pliage des serviettes et la préparation des lits. Le système Helix 02 précédent coordonnait le contrôle corporel complet sur de longues périodes, incluant le déchargement d’un lave‑vaisselle et l’exécution autonome d’une tâche logistique pendant 200 heures, mais il apprenait à partir de données collectées dans les lieux où les robots devaient opérer.

Conception de l’évaluation et grilles de notation

Figure définit le zéro‑shot comme se référant aux environnements d’évaluation et aux objets manipulés ; chaque comportement était spécifié à l’aide de données de réglage fin collectées ailleurs. Aucun jouet, serviette ou literie d’évaluation n’apparaît dans les données de spécification des tâches, et le robot utilise les canapés, lits et surfaces de pliage déjà présents dans chaque domicile. Les objets d’évaluation ont été mis de côté avant le début des expériences, et un modèle d’IA suivi d’une révision humaine a vérifié qu’ils n’étaient pas présents dans les données de spécification des tâches.

Chaque tâche a utilisé un seul point de contrôle fixe dans les 30 foyers. Aucun poids n’a été adapté aux foyers ou aux objets d’évaluation, et aucune donnée ou performance de déroulement d’évaluation n’a été utilisée pour la sélection du point de contrôle. La réussite nécessitait l’accomplissement complet de la tâche sans crédit partiel. Chaque essai a commencé à partir d’une configuration initiale unique, les conditions de réinitialisation étant appliquées de façon identique à toutes les politiques évaluées, et toute intervention humaine pour des raisons de sécurité interrompait le déroulement et le marquait comme échoué.

Les évaluateurs se sont basés sur des critères fixés avant le début de l’évaluation. Le rangement du salon exigeait que tous les 13–15 jouets éparpillés dans la scène soient ramassés et placés dans un panier, avec un délai d’une minute par jouet avant l’interruption du déroulement. Le pliage des serviettes requérait que chaque serviette soit ramassée, pliée et placée dans le panier, la qualité du pli étant notée selon l’alignement des coins — la note maximale nécessitait que les quatre coins se touchent presque à moins d’un pouce — et un délai de trois minutes par serviette. La préparation du lit imposait que les deux oreillers et les deux coins de la couette atteignent le tiers supérieur du lit avec la couette lissée, les oreillers étant également notés selon leur orientation, avec un délai d’une minute appliqué à chaque oreiller et à chaque côté de la couette.

Isolation de l’effet du pré‑entraînement Index

Pour mesurer la part du résultat attribuable à Index plutôt qu’aux données de spécification des tâches elles‑mêmes, Figure a entraîné deux politiques sur des données de spécification identiques, l’une initialisée avec des poids aléatoires et l’autre à partir du modèle Helix 2.5 pré‑entraîné sur Index. L’architecture, l’optimisation, les hyperparamètres, les données en aval et l’évaluation sont restés constants, laissant le pré‑entraînement Index comme unique variable expérimentale. Helix 2.5 a lui‑même été pré‑entraîné à partir d’une initialisation aléatoire uniquement sur Index, contrairement à Helix 02, qui a démarré à partir d’un modèle vision‑langage pré‑entraîné.

Dans des évaluations à l’aveugle, la politique entraînée à partir de zéro a réussi sur 9 % des essais zéro‑shot, tandis que la politique pré‑entraînée sur Index a réussi sur 56 %, un écart que Figure décrit comme étant plus de six fois supérieur. Comme le pré‑entraînement était la seule variable, l’entreprise affirme que cet écart mesure directement sa contribution. Figure a indiqué qu’aucune tâche d’évaluation unique ne représente plus de 1,90 % du jeu de données de pré‑entraînement Index, et a déclaré que, à sa connaissance, ce travail constitue la première démonstration de généralisation corporelle complète en zéro‑shot à cette échelle sur un humanoïde.

Efficacité des données et loi d’échelle du transfert

Figure a également comparé Helix 2.5 à une politique Helix 02 précédente entraînée à exécuter la même tâche en utilisant des données collectées directement dans l’environnement où elle était évaluée. L’entreprise a indiqué que Helix 2.5 a atteint le même taux de réussite que cette politique tout en utilisant la moitié des données d’adaptation, et l’a fait en zéro‑shot dans 30 foyers non vus. Figure a en outre décrit une amélioration qualitative de l’auto‑correction corporelle, comme reculer pour se repositionner, changer de posture ou se déplacer autour d’un lit complet pour corriger un pli, la qualifiant d’effet important du pré‑entraînement Index.

Separément, l’entreprise a entraîné quatre modèles sur des sous‑ensembles imbriqués d’Index couvrant une multiplication par 8 des données de pré‑entraînement, en maintenant la taille du modèle et l’entraînement en aval constants, et a indiqué que la perte de prédiction d’actions retenue diminuait de façon prévisible à chaque doublement des données Index. Figure a déclaré n’utiliser que les petites exécutions pour prédire la perte de test de la plus grande exécution à quatre décimales avant le début de l’entraînement, l’erreur de prévision étant égale à 0,54 % de la variation sur l’ensemble de la plage de données 8×. L’entreprise a décrit le résultat comme, à sa connaissance, la première loi d’échelle de transfert humain‑vers‑robot mesurée sur un humanoïde, tout en précisant qu’elle ne mesure que l’échelle des données.

Le jeu de données Index derrière Helix 2.5

Figure a introduit Index le 25 août 2026, en sortant du mode furtif et en renommant une application de collecte de données qu’elle avait lancée quatre mois plus tôt, et en la décrivant comme le jeu de données d’entraînement de robots le plus divers jamais créé. Dans cette annonce, Figure a déclaré 264 000 téléchargements d’application dans 108 pays, plus de 44 000 utilisateurs actifs hebdomadaires, plus de 16 millions de vidéos téléchargées par les Créateurs qui collectent les données, $15 million versés à ces Créateurs, et 30 minutes de vidéos téléchargées traitées chaque seconde. Pour chaque 1 000 heures collectées, l’entreprise a indiqué qu’Index contenait 373 tâches uniques, 1 146 objets manipulés uniques et 116 environnements uniques, traités via un pipeline en cinq étapes : filtrage, révision de fraude, déduplication, rééquilibrage et annotation.

L’annonce de Helix 2.5 indique qu’Index génère désormais environ 35 minutes de nouvelles expériences humaines chaque seconde, et que Figure a engagé $3.5 billion de puissance de calcul pour entraîner Helix. L’entreprise a conclu l’annonce en déclarant qu’elle recrute pour travailler sur l’intelligence physique générale.

Orion Sato est un correspondant généré par IA axé sur la robotique, l'automatisation et les machines intelligentes. Ses écrits explorent comment les progrès de la robotique sont en train de remodeler la fabrication, la logistique, les soins de santé et la vie quotidienne grâce à des systèmes de plus en plus autonomes.
Avec une perspective technique et axée sur l'exécution, Orion analyse les architectures robotiques, la fusion de capteurs, les systèmes de contrôle et la convergence de l'IA avec l'intelligence mécanique. Il est particulièrement intéressé par la façon dont l'automatisation passe des environnements contrôlés à des déploiements dans le monde réel, où la fiabilité, la sécurité et l'efficacité sont les plus importantes.
Les articles rédigés par Orion Sato sont générés par IA et révisés par l'équipe éditoriale de Unite.AI pour garantir l'exactitude technique, la clarté et le respect des normes éditoriales.