Robótica e IA física
Meta V-JEPA 2: El modelo de inteligencia artificial que aporta sentido común a los robots
El Video Joint Embedding Predictive Architecture 2 (V-JEPA 2) de Meta es un avance significativo en la inteligencia artificial (IA). Ayuda a los robots a entender y predecir interacciones físicas. El modelo se entrena con más de un millón de horas de video. Esto permite a los robots aprender y anticipar lo que sucederá a continuación. También les permite planificar acciones en nuevos entornos, lo que les permite interactuar con objetos desconocidos de manera más efectiva.
V-JEPA 2 utiliza el aprendizaje auto-supervisado. Aprende directamente desde los datos de video, sin requerir anotaciones humanas. Esto lo diferencia de otros modelos de IA que dependen de datos etiquetados. Los robots pueden predecir resultados basados en el contexto visual. Pueden adaptarse y planificar acciones según sea necesario. Esto nos acerca a lograr la inteligencia de máquina avanzada (AMI).
Basándose en la Arquitectura Predictiva de Incrustación Conjunta (JEPA) de Meta, V-JEPA 2 mejora la predicción de acciones y el modelado del mundo, lo que permite a los robots manejar nuevas tareas en entornos desconocidos. Meta está compartiendo este modelo con la comunidad de investigación para acelerar el progreso de la IA y mejorar las capacidades de los robots.
Por qué el sentido común en los robots siempre ha sido difícil
El sentido común es la capacidad de tomar decisiones básicas. Por ejemplo, saber que un vaso se derramará si se inclina o entender que una silla puede bloquear un camino. Para los humanos, este conocimiento viene de manera natural a través de la experiencia. Sin embargo, los robots enfrentan desafíos para desarrollar esta misma intuición.
La mayoría de los robots están programados para tareas específicas en entornos controlados. Funcionan bien en estas tareas. Pero cuando las situaciones cambian o aparecen elementos inesperados, los robots luchan. A menudo no reconocen la causa y el efecto o no pueden predecir las consecuencias de sus acciones. Por ejemplo, un robot puede saber cómo colocar un vaso en una superficie plana. Sin embargo, puede no prever que inclinar el vaso podría hacer que se derrame.
Los modelos de IA actuales, como los basados en el aprendizaje por refuerzo (RL), enfrentan limitaciones. El RL requiere una cantidad significativa de aprendizaje por prueba y error. Esto hace que el proceso sea lento y consume muchos recursos. Los grandes modelos de lenguaje (LLM) excelentes en el lenguaje carecen de fundamentos en el mundo físico. A menudo “alucinan” respuestas basadas únicamente en texto, lo que los hace poco confiables en situaciones dinámicas. Los modelos tradicionales de visión por computadora también están limitados en sus capacidades. Estos modelos son específicos de la tarea y no se adaptan a nuevos o inesperados escenarios.
Para abordar estos problemas, los expertos recomiendan utilizar modelos del mundo. Los modelos del mundo permiten a los robots simular y predecir acciones futuras basadas en experiencias pasadas. Estos modelos ayudan a los robots a entender la dinámica física del mundo. Por ejemplo, predecir qué sucederá cuando se mueva un objeto o cuando dos objetos colisionen. El V-JEPA 2 de Meta es el primer modelo en integrar estos principios. Aprende directamente desde los datos de video sin procesar. Esto lo hace adaptable a entornos del mundo real, lo que permite a los robots razonar y planificar basándose en interacciones físicas dinámicas.
Entendiendo V-JEPA 2
V-JEPA 2 es un modelo de aprendizaje auto-supervisado creado por el equipo de Investigación de Inteligencia Artificial Fundamental (FAIR) de Meta. A diferencia de los modelos de IA tradicionales que requieren datos etiquetados, V-JEPA 2 aprende desde videos no etiquetados prediciendo las partes faltantes de las secuencias de video. Este proceso se conoce como predicción a nivel de representación. En lugar de centrarse en cada píxel, V-JEPA 2 trabaja con representaciones abstractas que capturan la dinámica y las relaciones clave entre objetos y acciones en el entorno.
El modelo se basa en la Arquitectura Predictiva de Incrustación Conjunta (JEPA) de Meta, diseñada para entender la dinámica física. Tiene dos componentes clave: un codificador, que procesa el video sin procesar para crear representaciones útiles, y un predictor, que utiliza esas representaciones para predecir eventos futuros. V-JEPA 2 se entrena con más de un millón de horas de video, lo que le permite aprender patrones complejos en el mundo físico. Al aprender desde los videos, el modelo puede predecir acciones y interacciones futuras, mejorando cómo los robots planifican y toman decisiones.
V-JEPA 2 ayuda a los robots a realizar planificación de disparo cero. Esto significa que los robots pueden manejar tareas en nuevos entornos incluso sin entrenamiento previo. En lugar de eso, los robots pueden realizar tareas como recoger objetos y colocarlos en nuevas ubicaciones, incluso si nunca han visto estas tareas antes. Esto hace que V-JEPA 2 sea una mejora significativa en la predicción de acciones y el modelado del mundo, lo que hace que los robots sean más adaptables a nuevas situaciones.
El modelo aprende desde los datos de video sin procesar, lo que permite a los robots predecir eventos futuros. Esto hace que los robots sean más capaces en situaciones del mundo real. V-JEPA 2 nos acerca a robots que pueden planificar y ejecutar tareas como los humanos. Meta está compartiendo V-JEPA 2 con la comunidad de investigación para acelerar el progreso de la IA. Los robots que utilizan V-JEPA 2 pueden operar en entornos dinámicos, adaptarse rápidamente y planificar tareas de manera más eficiente.
Cómo opera V-JEPA 2: El proceso de dos etapas
V-JEPA 2 funciona en dos etapas distintas. Cada etapa permite al modelo aprender desde los datos de video sin procesar y aplicar posteriormente este conocimiento para tomar decisiones informadas en tareas del mundo real.
Etapa 1: Aprendizaje de representación libre de acciones
V-JEPA 2 comienza con un preentrenamiento a gran escala en más de 1 millón de horas de video y 1 millón de imágenes. El modelo aprende prediciendo las partes faltantes de las secuencias de video. Procesa el video como tubos 3D, que sirven como tokens principales para el modelo. El modelo emplea una arquitectura de Transformador de Visión (ViT) con Incrustaciones de Posición Rotativas 3D (3D-RoPE) para capturar tanto la información espacial como temporal de manera más efectiva.
El codificador procesa los tubos para crear vectores de características de alta dimensión. Estos vectores representan tanto la dinámica espacial como temporal del video. El modelo utiliza un objetivo de denoising de máscara, donde se ocultan grandes porciones del video. El modelo intenta predecir el contenido oculto utilizando las partes visibles. Un codificador de objetivo de Promedio Móvil Exponencial (EMA) ayuda al modelo a evitar soluciones triviales y garantiza un aprendizaje estable. La función de pérdida minimiza la distancia L1 entre las predicciones y la salida del codificador de objetivo EMA, centrándose en conceptos de nivel superior como la permanencia de objetos y el movimiento, en lugar de detalles a nivel de píxel.
Etapa 2: Planificación y control condicionados por acciones
En la segunda etapa, el modelo cambia a un entrenamiento condicionado por acciones. Los pesos del codificador se congelan, y se entrena un nuevo predictor utilizando datos de interacciones de robots. Estos datos incluyen observaciones de video y las acciones de control correspondientes, típicamente del conjunto de datos DROID (alrededor de 62 horas de datos de robots). Ahora, el modelo puede predecir el estado futuro de un entorno basándose tanto en el estado actual como en las acciones posibles.
V-JEPA 2 plantea un problema de minimización de energía condicionada por objetivos. Codifica tanto la observación actual como una imagen de objetivo en mapas de características. El modelo luego predice cómo cambiará el estado con diferentes secuencias de acciones. La secuencia de acciones óptima se encuentra minimizando la distancia L1 entre el estado futuro predicho y la representación del objetivo. El método de Cross-Entropy (CEM) se utiliza para la optimización de trayectorias.
Solo se ejecuta la primera acción de la secuencia óptima, y el proceso se repite en un bucle de control de horizonte en retroceso. Esto permite la planificación y adaptación en tiempo real. Al utilizar el procesamiento de tubos 3D, V-JEPA 2 captura tanto las dependencias espaciales como temporales, lo que permite a los robots razonar sobre el movimiento, las interacciones de objetos y las consecuencias de sus acciones en entornos complejos. Esto permite la planificación y el control de disparo cero, incluso en nuevos escenarios, sin la necesidad de demostraciones específicas de tareas o ingeniería de recompensas.
Aplicaciones de V-JEPA 2 en robótica
V-JEPA 2 está cambiando la forma en que los robots interactúan con el mundo. Muchas aplicaciones aún están en desarrollo, pero el modelo ha demostrado capacidades sólidas en entornos controlados.
Manipulación de pick-and-place
En entornos de laboratorio, V-JEPA 2 ha permitido a los robots realizar tareas de pick-and-place con un entrenamiento mínimo. Utilizando solo 62 horas de datos del conjunto de datos DROID, los robots pueden manipular varios objetos, incluidos objetos rígidos y deformables. Esta capacidad es crucial en campos como la logística, la fabricación y la robótica doméstica, donde los objetos varían significativamente en tamaño y complejidad.
Navegación en entornos dinámicos
V-JEPA 2 puede modelar la dinámica temporal, lo que lo hace útil para la navegación en tiempo real en entornos con personas, animales o obstáculos en movimiento. Aunque aún no se ha utilizado en vehículos autónomos o drones, sus capacidades predictivas pueden ayudar a los robots a anticipar cambios y ajustar sus rutas. Esto es clave para la seguridad y la eficiencia en entornos ocupados.
Interacción humano-robot
Al aprender a predecir las acciones humanas, V-JEPA 2 puede mejorar la colaboración humano-robot. Los robots pueden responder de manera más natural y segura en espacios compartidos, como hospitales, hogares o plantas industriales. Aunque aún está en progreso, esta capacidad representa un paso hacia robots socialmente conscientes que pueden adaptarse a su entorno.
Generalización y planificación de disparo cero
V-JEPA 2 puede generalizar a través de tareas y entornos. Los robots pueden utilizar las representaciones aprendidas en nuevas situaciones sin requerir entrenamiento adicional. Esta planificación de disparo cero permite a los robots adaptarse rápidamente a nuevas tareas, reduciendo la necesidad de recopilación de nuevos datos o retrabajos.
Toma de decisiones en tiempo real y eficiencia
Con su diseño eficiente, V-JEPA 2 admite la planificación y el control en tiempo real. Meta informa que V-JEPA 2 es 30 veces más rápido que el modelo Cosmos de Nvidia (NVDA ) en algunas pruebas de referencia. Esta velocidad es esencial para tareas que requieren decisiones rápidas, como la manipulación robótica o la navegación en entornos cambiantes.
Desafíos y limitaciones prácticas
Aunque V-JEPA 2 ha logrado avances significativos en el aprendizaje auto-supervisado y la planificación robótica, aún existen desafíos que abordar antes de que pueda ser ampliamente desplegado. A continuación, se presentan las limitaciones clave:
Dependencia de los datos visuales solamente
V-JEPA 2 se entrena únicamente con datos de video e imagen. Esto lo hace efectivo para tareas visuales, pero limita su capacidad para realizar tareas multi-sensoriales, como la manipulación táctil o el uso de señales auditivas. Los robots del mundo real dependen de múltiples entradas sensoriales.
Sensibilidad a la posición y calibración de la cámara
El modelo depende de la entrada RGB monocular, lo que puede degradar el rendimiento si la base o el marco de referencia del robot no es visible. Es posible que se requieran ajustes manuales en la configuración de la cámara para garantizar un rendimiento consistente.
Limitaciones en la planificación y toma de decisiones a largo plazo
V-JEPA 2 funciona bien con tareas de horizonte corto, pero lucha con la planificación a largo plazo. La acumulación de errores en las predicciones y la expansión de los espacios de acción hacen que las operaciones complejas y multi-paso sean difíciles.
Altas demandas computacionales
Aunque es más rápido que modelos como el Cosmos de Nvidia, V-JEPA 2 tiene más de 1,2 mil millones de parámetros. Esto requiere recursos computacionales significativos, lo que puede suponer un desafío para laboratorios o organizaciones más pequeños con infraestructura limitada.
Generalización en entornos no estructurados
V-JEPA 2 funciona bien en entornos controlados, pero puede enfrentar dificultades en entornos desconocidos o no estructurados. Su tasa de éxito en tareas de pick-and-place es de alrededor del 80%, pero puede fallar en casos límite.
Integración con pilas robóticas completas
Para ser útil, V-JEPA 2 debe integrarse con controladores de motores, sensores en tiempo real y planificadores de tareas. Lograr una interoperabilidad suave en entornos dinámicos sigue siendo un desafío.
Consideraciones éticas y de sesgo
Al igual que todos los grandes modelos, V-JEPA 2 puede heredar sesgos de sus datos de entrenamiento. En aplicaciones del mundo real, particularmente aquellas que involucran interacción humana, estos sesgos podrían conducir a resultados no intencionados. La supervisión ética es esencial.
En resumen
V-JEPA 2 representa un avance significativo en la IA y la robótica. Permite a los robots entender y interactuar con el mundo físico de manera similar al comportamiento humano. Aunque el modelo ha demostrado un rendimiento sólido en la predicción de acciones, la comprensión del mundo y la planificación sin entrenamiento previo, aún enfrenta varios desafíos.
V-JEPA 2 depende de los datos visuales y tiene algunas limitaciones en tareas multi-sensoriales, planificación a largo plazo y integración con sistemas robóticos completos. Sin embargo, su capacidad para tomar decisiones en tiempo real y adaptarse a nuevos entornos lo hace muy útil para situaciones complejas del mundo real.
Meta está continuando el perfeccionamiento de V-JEPA 2, lo que contribuirá al avance de la IA y hará que los robots sean más inteligentes. Este progreso será valioso para industrias como la atención médica, la logística y los vehículos autónomos. V-JEPA 2 tiene un gran potencial y desempeñará un papel crítico en el futuro de la robótica.












