Robótica e IA física
Dyna Robotics entrena a DYNA-2 con un millón de horas de video humano, sin datos de robot

La afirmación es importante debido a dónde se encuentra la restricción del campo. Las políticas de robot generalistas se han entrenado en gran medida con datos de acción teleoperada: humanos guiando físicamente a los robots a través de tareas, hora tras hora. Esos datos son caros y lentos de recopilar, y han limitado la escalabilidad de los modelos de robot de base. La apuesta de DYNA-2 es que la intuición física que necesitan los robots se puede aprender de videos de humanos haciendo cosas y luego transferir a hardware de robot.
“Al construir un Modelo de Acción Mundial que imagina cómo se mueve el mundo físico antes de tomar acción, les damos a los robots razonamiento espacial y física de contacto que los modelos de visión-lenguaje tradicionales simplemente carecen.”
Cómo DYNA-2 aprende de video sin ver un robot
La arquitectura es lo que Dyna llama un Modelo de Acción Mundial, construido sobre generación de video en lugar de las adaptaciones de visión-lenguaje-acción que han dominado el campo. Durante el preentrenamiento, el modelo ejecuta un objetivo dual (prediciendo el siguiente cuadro y la siguiente acción) sobre el corpus de video humano. La empresa dice que esto le da al modelo un modelo de trabajo de física de contacto y razonamiento espacial que se transfiere a través de encarnaciones: brazos de robot estacionarios, prototipos humanoides y manos de cinco dedos diestras, a pesar de que ninguno de esos robots aparece en el preentrenamiento.
Adaptar el resultado a una plataforma específica lleva horas de ajuste fino local en lugar de semanas de recopilación de datos. En un caso que cita Dyna, 13 minutos de datos fueron suficientes para enseñar a un par de manos de robot de cinco dedos a girar la tapa de una botella. Agregados sobre 15 tareas de referencia, las políticas preentrenadas con más datos humanos superaron consistentemente a las entrenadas con menos, la curva de escalado que la empresa está señalando como la ley.
La comparación más clara es contra el propio modelo anterior de Dyna. DYNA-1, el modelo de visión-lenguaje-acción que se ejecuta en los despliegues comerciales de la empresa, se enfrentó a DYNA-2 en evaluaciones físicas cara a cara bajo pasos de entrenamiento y conjuntos de datos coincidentes. En tareas diestras como cortar alimentos y limpiar espacios de trabajo, Dyna dice que DYNA-2 se recuperó de perturbaciones físicas sin intervención humana, donde la línea de base VLA falló y necesitó un restablecimiento manual. Un algoritmo de coentrenamiento de video elevó las puntuaciones de seguimiento de instrucciones en un 133% en tareas que requieren movimientos distintos en respuesta a comandos de usuario.
DYNA-2 en números
- 1 millón+ de horas de video humano egocéntrico en preentrenamiento — descrito por la empresa como aproximadamente 170 años de experiencia continua de vigilia
- 20% → 80–90% tasas de éxito de tarea en tareas de fabricación de alta precisión, solo desde la escala de preentrenamiento
- 1.55 veces más tareas completadas que DYNA-1 en evaluaciones cara a cara en el mundo real
- 87% vs. 46% tasas de aprobación en un despliegue de cliente, DYNA-2 contra DYNA-1
- 13 minutos de datos para entrenar manos de cinco dedos para abrir una tapa de botella
- 133% mejora en tareas de seguimiento de instrucciones del algoritmo de coentrenamiento de video
- 10 millones de horas: la escala de datos de entrenamiento que Dyna dice que el enfoque abre un camino hacia
Los despliegues de Dyna ya eran la base de pruebas
DYNA-2 llega sobre una base comercial concreta inusualmente para una empresa tan joven. Los robots de Dyna, que ejecutan DYNA-1, se despliegan en producción en hoteles, restaurantes, lavanderías y gimnasios. Los materiales de la propia empresa describen a DYNA-1 doblando más de 40 camisas por hora de forma continua y ejecutándose durante dieciséis horas al día en los sitios de los clientes, con una tasa de éxito del 99% más en operación ininterrumpida de 24 horas.
Esta huella de despliegue también es la rueda de datos detrás de la investigación.
El camino declarado de la empresa desde aquí es escalar: si la curva de escalado de video humano se mantiene, Dyna dice que entrenar con 10 millones de horas se convierte en cuestión de recopilar video en lugar de construir flotas de equipos de teleoperación. El resultado de 1 millón de horas es la evidencia de que la curva existe. Si se mantiene en 10 veces es la pregunta de ingeniería abierta — y ahora es la que Dyna ha apostado su hoja de ruta.












