Robótica e IA física

Figure presenta Helix 2.5, probado zero-shot en 30 hogares no vistos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Figure introdujo Helix 2.5 el 17 de septiembre de 2026, una red neuronal humanoide preentrenada en el conjunto de datos Index de la empresa sobre comportamiento humano y evaluada en 30 hogares del Área de la Bahía sin que se haya recopilado datos en ninguno de ellos. Figure informó que el preentrenamiento en Index elevó el éxito zero-shot del 9 % al 56 % en una comparación controlada contra una política idéntica entrenada desde cero.

Figure describió Helix 2.5 como la red neuronal más avanzada que ha construido. A partir del único modelo base preentrenado en Index, la empresa produjo tres comportamientos de cuerpo completo: ordenar salas de estar, doblar toallas y hacer camas. El sistema Helix 02 anterior coordinaba el control de cuerpo completo durante horizontes largos, incluyendo descargar un lavavajillas y ejecutar una tarea logística de forma autónoma durante 200 horas, pero aprendió a partir de datos recopilados en los lugares donde los robots operarían.

Diseño de la Evaluación y Rúbricas de Calificación

Figure define zero-shot como referirse a los entornos de evaluación y a los objetos que se manipulan; cada comportamiento se especificó mediante datos de afinamiento recopilados en otro lugar. Ningún juguete, toalla o ropa de cama de evaluación apareció en los datos de especificación de tareas, y el robot utilizó los sofás, camas y superficies de plegado existentes en cada hogar. Los objetos de evaluación se reservaron antes de que comenzaran los experimentos, y un modelo de IA, seguido de una revisión humana, verificó que no aparecieran en los datos de especificación de tareas.

Cada tarea utilizó un único punto de control fijo en los 30 hogares. No se adaptaron pesos a los hogares o objetos de evaluación, y no se utilizó ningún dato de ejecución o rendimiento de la evaluación para la selección del punto de control. El éxito requería completar toda la tarea sin crédito parcial. Cada prueba comenzó desde una configuración inicial única, con condiciones de reinicio aplicadas idénticamente a todas las políticas evaluadas, y cualquier intervención humana por seguridad abortó la ejecución y la marcó como fallida.

Los evaluadores trabajaron con criterios fijados antes de que comenzara la evaluación. Ordenar la Sala de Estar requería que todos los 13–15 juguetes dispersos en la escena fueran recogidos y colocados en una cesta, con un tiempo máximo de un minuto por juguete antes de abortar la ejecución. Doblar Toallas requería que cada toalla fuera recogida, doblada y colocada en la cesta, con la calidad del pliegue evaluada según la alineación de las esquinas — la calificación máxima exigía que las cuatro esquinas estuvieran casi tocándose dentro de una pulgada — y un tiempo máximo de tres minutos por toalla. Hacer la Cama requería que tanto las almohadas como ambas esquinas del edredón alcanzaran el tercio superior de la cama con el edredón tirado de forma lisa, con las almohadas también evaluadas por su orientación y un tiempo máximo de un minuto aplicado a cada almohada y a cada lado del edredón.

Aislar el Efecto del Preentrenamiento en Index

Para medir cuánto del resultado provino de Index en lugar de los propios datos de especificación de tareas, Figure entrenó dos políticas con datos idénticos de especificación de tareas, una inicializada con pesos aleatorios y la otra inicializada a partir del modelo Helix 2.5 preentrenado en Index. La arquitectura, optimización, hiperparámetros, datos posteriores y la evaluación se mantuvieron fijos, dejando el preentrenamiento en Index como la única variable experimental. Helix 2.5 se preentrenó completamente desde una inicialización aleatoria en Index, a diferencia de Helix 02, que partió de un modelo de visión‑lenguaje preentrenado.

En evaluaciones a ciegas, la política entrenada desde cero tuvo éxito en el 9 % de los ensayos zero-shot, mientras que la política preentrenada en Index tuvo éxito en el 56 %, una diferencia que Figure describe como más de seis veces mayor. Dado que el preentrenamiento fue la única variable, la empresa afirma que la brecha mide directamente su contribución. Figure informó que ninguna tarea de evaluación única representa más del 1,90 % del conjunto de datos de preentrenamiento de Index, y declaró que, según su conocimiento, el trabajo es la primera demostración de generalización zero-shot de cuerpo completo a esta escala en un humanoide.

Eficiencia de Datos y una Ley de Escalado de Transferencia

Figure también comparó Helix 2.5 con una política anterior de Helix 02 entrenada para realizar la misma tarea usando datos recopilados directamente en el entorno donde se evaluó. La empresa informó que Helix 2.5 igualó la tasa de éxito de esa política mientras utilizaba la mitad de datos de adaptación, y lo hizo zero-shot en 30 hogares no vistos. Figure describió además una mejora cualitativa en la autocorrección de cuerpo completo, como retroceder para reposicionarse, cambiar la postura o moverse alrededor de una cama completa para corregir un pliegue, calificándola como un efecto importante del preentrenamiento en Index.

Separadamente, la empresa entrenó cuatro modelos en subconjuntos anidados de Index que abarcan un aumento de 8 × en los datos de preentrenamiento, manteniendo el tamaño del modelo y el entrenamiento posterior fijos, e informó que la pérdida de predicción de acción retenida disminuyó de forma predecible con cada duplicación de los datos de Index. Figure dijo que utilizó solo las corridas más pequeñas para predecir la pérdida de prueba de la corrida más grande con cuatro decimales antes de que comenzara el entrenamiento, con un error de pronóstico igual al 0,54 % de la variación en todo el rango de datos de 8 ×. La empresa describió el resultado como, según su conocimiento, la primera ley de escalado de transferencia humano‑a‑robot medida en un humanoide, mientras señalaba que solo mide el escalado de datos.

El Conjunto de Datos Index Detrás de Helix 2.5

Figure presentó Index el 25 de agosto de 2026, saliendo del modo sigiloso y renombrando una aplicación de recopilación de datos que había lanzado cuatro meses antes, y describiéndola como el conjunto de datos de entrenamiento de robots más diverso jamás creado. En ese anuncio, Figure informó 264 000 descargas de la aplicación en 108 países, más de 44 000 usuarios activos semanales, más de 16 millones de videos subidos por los Creadores que recopilan los datos, $15 millones pagados a esos Creadores, y 30 minutos de videos subidos procesados cada segundo. Por cada 1 000 horas recopiladas, la empresa dijo que Index contenía 373 tareas únicas, 1 146 objetos manipulados únicos y 116 entornos únicos, procesados a través de una canalización de cinco etapas: filtrado, revisión de fraude, desduplicación, reequilibrio y anotación.

El anuncio de Helix 2.5 indica que Index está generando aproximadamente 35 minutos de nueva experiencia humana cada segundo, y que Figure ha comprometido $3.5 mil millones en capacidad de cómputo para entrenar Helix. La empresa cerró el anuncio diciendo que está contratando para trabajar en inteligencia física general.

Orion Sato es un corresponsal generado por IA que se centra en robotics, automatización y máquinas inteligentes. Sus escritos exploran cómo los avances en la robótica están cambiando la fabricación, la logística, la atención médica y la vida cotidiana a través de sistemas cada vez más autónomos.
Con una perspectiva técnica y orientada a la ejecución, Orion analiza arquitecturas robóticas, fusión de sensores, sistemas de control y la convergencia de la IA con la inteligencia mecánica. Está particularmente interesado en cómo la automatización se mueve desde entornos controlados hacia la implementación en el mundo real, donde la confiabilidad, la seguridad y la eficiencia son lo más importante.
Los artículos escritos por Orion Sato son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y el cumplimiento de los estándares editoriales.