Alianzas
NVIDIA Detalla la Colaboración con Skild AI Detrás del Modelo de Fundación de Robots S1

NVIDIA, el 10 de septiembre de 2026, detalló cómo Skild AI construyó su modelo de fundación de robots S1 sobre la infraestructura de IA de NVIDIA, y afirmó que la empresa de robótica alcanzó una facturación anual de 100 millones de dólares diez meses después de su primer despliegue comercial.
En la publicación del blog de NVIDIA, la compañía dijo que Skild construyó S1 y realizó la investigación subyacente en su infraestructura como parte de una colaboración más amplia que abarca la generación de datos sintéticos, el entrenamiento de modelos, la simulación y el despliegue de IA física en el mundo real. “Aprender por experiencia, y no mediante preprogramación, es el cambio de paradigma que ha ocurrido en la robótica”, afirmó Deepak Pathak, cofundador y CEO de Skild AI, añadiendo que NVIDIA Isaac Lab y NVIDIA Cosmos ayudan a Skild a crear la experiencia escalable y diversa que sus robots necesitan para aprender en numerosos escenarios y configuraciones. Las empresas declararon que están trabajando para trasladar la inteligencia robótica adaptable del laboratorio a fábricas y otros entornos operativos dinámicos.
Aprendizaje de Tareas No Vistas a partir de un Solo Video
Skild presentó S1 en una publicación de investigación del 18 de agosto de 2026, describiéndolo como un modelo de fundación robótica construido desde cero como un aprendiz en contexto. El modelo recibe como entrada una demostración en video de una tarea y la ejecuta sin actualizar sus pesos ni someterse a un entrenamiento posterior específico de la tarea. Skild describe a S1 como el primer modelo de fundación para robótica que muestra aprendizaje en contexto en tareas de largo horizonte, con una duración de hasta 10 minutos, que nunca se habían visto durante el preentrenamiento.
Un operador graba un video de la tarea deseada y lo proporciona al modelo como una solicitud. El modelo interpreta la intención demostrada, los objetos y la secuencia, y luego los traduce en acciones para el robot que tiene frente a él, sin necesidad de reentrenamiento, y a menudo para una tarea no cubierta por su conjunto de datos de preentrenamiento. Según ambas compañías, S1 puede ejecutar tareas desconocidas, como plantar macetas, preparar panqueques, elaborar café de filtrado y ensamblar kits, trabajos que abarcan decenas de pasos de manipulación y requieren componer habilidades en secuencias que el modelo no había ejecutado previamente.
En una prueba de plantado de macetas registrada en la publicación de investigación de Skild, la tierra, una maceta, una regadera y una planta llegaron a la oficina a las 8:54 p. m., la grabación comenzó a las 9:16 p. m., se registró una demostración en video egocéntrica humana a las 9:22 p. m., y S1 empezó a ejecutar la tarea de forma autónoma en el hardware a las 9:27 p. m. Skild indica que el tiempo desde la demostración hasta la ejecución autónoma fue de 11 minutos.
Skild informa que S1 puede ajustarse cuando los objetos se mueven a mitad de la tarea, recuperarse de errores y sustituir objetos con la misma capacidad de uso; en un caso, utilizó una taza de agua cuando la demostración mostraba una regadera. La empresa también señala que el modelo a veces mejora demostraciones defectuosas, considerando la demostración como una especificación del objetivo en lugar de una trayectoria a reproducir.
Resultados Reportados frente a Políticas Impulsadas por Lenguaje
La publicación de NVIDIA informa que, en las pruebas de Skild sobre tareas nuevas y multietapa, S1 tuvo éxito aproximadamente el 66 % de las veces en cada paso, frente al 9 % de un sistema de IA similar, una diferencia que NVIDIA describió como una mejora de más de siete veces. La publicación de investigación de Skild describe la comparación como un estudio controlado contra una política VLA impulsada por lenguaje, que recibe la especificación de la tarea en lenguaje en lugar de mediante demostración. Ambas políticas fueron entrenadas con los mismos datos, arquitecturas y capacidad de cómputo en conjuntos de datos de preentrenamiento que van de 1 000 a 100 000 horas, y los valores del 66 % y 9 % se registraron a las 100 000 horas en tareas de largo horizonte no vistas, según Skild.
En tareas vistas durante el preentrenamiento, Skild informa que el aprendizaje en contexto alcanzó un 96 % de éxito a la mayor escala, mientras que a 1 000 horas la política condicionada por lenguaje obtuvo un 53 % frente al 43 % del aprendizaje en contexto. Skild también evaluó la robustez en cinco niveles de cambio de distribución, informando que bajo la condición más severa, donde la mitad de las acciones del robot deben ejecutarse con el brazo opuesto, la política impulsada por lenguaje se degradó hasta tres veces más que la política en contexto.
En cuanto a la eficiencia de la demostración, Skild estima que un solo video en contexto equivale aproximadamente a 380 episodios de entrenamiento posterior, una cifra que, según indica, se interpoló entre puntos medidos, y reporta que recopilar 380 demostraciones de largo horizonte requirió de 50 a 100 horas de teleoperación. La línea base entrenada posteriormente alcanzó finalmente un 86 % de éxito con 2 000 demostraciones, según Skild.
Tracción Comercial y el Despliegue en Foxconn
La publicación de NVIDIA indica que Skild ha establecido más de 60 alianzas de despliegue, con trabajos que abarcan la fabricación, la logística, la inspección, la seguridad, la preparación de alimentos y otras aplicaciones.
En la planta de producción, Skild, NVIDIA y Foxconn están desplegando el Skild Brain en manipuladores de doble brazo para el ensamblaje de alta precisión de los sistemas NVIDIA Blackwell. En un flujo de trabajo demostrado, un robot instala una barra colectora y un bloque limitador, aprieta 16 tornillos y se adapta a perturbaciones a lo largo de la tarea multietapa. La publicación de NVIDIA señala que el trabajo requiere movimiento preciso, control sensible al contacto, seguimiento de secuencias y recuperación cuando la escena difiere del plan.
Skild anunció por primera vez el plan de línea de producción Blackwell en una publicación del 19 de marzo de 2026 que también reveló alianzas con ABB Robotics, Universal Robots y Mobile Industrial Robots. En ese anuncio, Skild describió la secuencia de ensamblaje como una tarea real realizada por humanos en una línea de Foxconn, finalizando con la extracción del bloque limitador, y afirmó que su cerebro fue afinado con una pequeña cantidad de datos de robot para el flujo de trabajo.
La Plataforma NVIDIA Detrás de S1
Según NVIDIA, sus modelos de fundación de mundo abierto Cosmos ayudan a Skild a diversificar los datos de entrenamiento y a convertir video en descripciones estructuradas, mientras que Cosmos Curator ayuda a anotar, filtrar y organizar datos a gran escala. Las bibliotecas de NVIDIA Omniverse y el marco Isaac Sim proporcionan entornos virtuales basados en la física para generar datos, probar casos límite y validar comportamientos antes del despliegue en el mundo real.
Skild utiliza aprendizaje por refuerzo en Isaac Lab, un marco de aprendizaje robótico modular y abierto impulsado por el motor de física Newton, para modelar parámetros físicos como fuerzas, contactos, colisiones y presión y reducir la brecha entre simulación y realidad. A medida que los modelos se acercan a la producción, las herramientas NVIDIA Nsight ayudan a los ingenieros a identificar cuellos de botella de rendimiento durante el entrenamiento, y el kit de desarrollo de software TensorRT optimiza la inferencia para que los robots puedan responder rápidamente en el mundo físico.
Skild y NVIDIA también están desarrollando conjuntamente solucionadores de simulación acelerados por GPU que modelan cómo los robots tocan, agarran y manipulan objetos sólidos de forma física. Las compañías declararon que los solucionadores pronto estarán disponibles para todos los desarrolladores como parte de Newton.












