Robótica e IA física

Google lanza Gemini Robotics ER 2 con trabajo en equipo de múltiples robots

mm
Añade Unite.AI a tus fuentes preferidas en Google

Google ha lanzado Gemini Robotics ER 2, un modelo de razonamiento incorporado diseñado para servir como planificador de alto nivel para un robot, mientras que un modelo separado maneja los motores. Está disponible para los desarrolladores a través de la API de Gemini y Google AI Studio, con acceso a la vista previa privada en la plataforma de agente empresarial de Gemini.

ER 2 acepta video, imágenes, audio y texto, razona sobre la escena, planea una tarea que dura varios minutos y luego llama a algo más para mover el hardware: un modelo de visión-lenguaje-acción, una API de navegación o una función del desarrollador declarada al modelo como una herramienta. También puede llamar a Google Search en medio de la tarea. La tarjeta del modelo lo describe como un modelo de visión-lenguaje basado en Gemini 3.5 Flash, con una ventana de contexto de 128.000 tokens y hasta 64.000 tokens de salida.

Es el sucesor de Gemini Robotics-ER 1.6, lanzado el 14 de abril de 2026, que agregó la lectura de instrumentos (interpretación de un manómetro de presión o un visor de vidrio de química), una capacidad que Google desarrolló con Boston Dynamics para rondas de inspección de instalaciones. ER 2 extiende esto a pantallas digitales, escalas lineales, reglas y termómetros de líquido, probados en 10 tipos de instrumentos.

Qué agrega el video continuo

El cambio sustantivo es que ER 2 razona sobre una fuente de video en vivo en lugar de fotogramas fijos, lo que le permite juzgar algo que ha limitado silenciosamente la autonomía de los robots: si un paso está terminado.

De esto surgen dos capacidades. La clasificación de progreso pide al modelo que ordene cada fotograma de una fuente en una de cinco bandas de finalización, desde 0-20% hasta 80-100%; Google informa una precisión del 57,4%. La búsqueda de momentos le pide que fije el fotograma exacto en el que ocurre un evento crítico, como el punto en el que una taza está lo suficientemente llena como para detener el vertido. La empresa informa una precisión del 91,3% en esta tarea con un error medio de 0,96 segundos y dice que el modelo lo entrega a una velocidad de ejecución aproximadamente cuatro veces mayor que la de modelos mucho más grandes por una fracción de la computación.

La temporización de subsegundos es la parte que importa en una máquina real. Un robot que puede decir que un paso está al 60% de completarse o ha fallado directamente puede reintenta ese paso en lugar de reiniciar el flujo de trabajo o esperar a un operador. ER 2 transmite a través del punto de conexión bidireccional de la API de Gemini Live, que es cómo Google mantiene el bucle de razonamiento desde insertar pausas de detener y pensar entre acciones. Obtener la latencia de inferencia lo suficientemente baja para el control físico es la misma restricción que impulsa a los proveedores de robótica hacia silicio dedicado en el robot y modelos de tiempo real de una sola GPU.

Dos robots, un trabajo

La otra nueva capacidad es la colaboración entre múltiples robots: diferentes máquinas que comparten una comprensión semántica de una tarea y pasan el trabajo entre ellas, con el razonamiento de que una base con ruedas y un par de piernas están adaptados a diferentes partes del mismo trabajo. La demostración de DeepMind empareja Apptronik’s Apollo 2 humanoid con una plataforma bi-brazo Franka Duo. Una segunda demostración tiene ER 2 conduciendo las API de navegación y manipulador en Spot de Boston Dynamics para recuperar un objeto con un comando hablado.

Todo esto se ejecuta en hardware que Google no construye, que es cómo funciona la mayoría de este mercado ahora: el modelo proviene de un laboratorio de frontera y los brazos, piernas y garras provienen de socios, la misma división detrás de fabricantes de cobots que cortejan a desarrolladores de modelos de fundación y pilas de inteligencia incorporada a nivel de plataforma.

ER 2 llegó como parte de una familia de tres modelos. La publicación de investigación companion del equipo de Gemini Robotics cubre Gemini Robotics 2, un modelo de acción que controla humanoides completos desde los pies hasta las yemas de los dedos, y Gemini Robotics On-Device 2, que se ejecuta localmente y se adapta a un nuevo robot bi-brazo en unas pocas horas a partir de menos de 200 ejemplos. Ambos van a socios de acceso temprano en lugar de la API abierta.

El equipo también publicó las tasas de éxito detrás de ese modelo de acción, que condujo tres cuerpos de robot diferentes desde un solo punto de control. Apollo 2 equipado con manos Inspire recogió objetos de una estantería el 76,3% de las veces, de una mesa el 68,4% y del suelo el 45,7%. El trabajo de cinco dedos con la mano SharpaWave de 22 grados de libertad está más atrasado: 92% para desenroscar una bombilla, 36% para apretar una, 44% para atar una bolsa de basura. DeepMind describe la manipulación dexterous de múltiples dedos como aún desafiante, lo que establece un marcador útil para cualquiera que esté evaluando las afirmaciones de capacidad humanoides.

Límites de seguridad y primeras implementaciones

Google informa ganancias en los benchmarks de seguimiento de instrucciones de seguridad y proximidad humana, y dice que ER 2 detiene a un humanoide cuando una persona se acerca, y luego reanuda por sí solo una vez que el área esté despejada. DeepMind llama a detenerse por un humano cercano un requisito clave en los estándares de seguridad colaborativa, y es un requisito que normalmente se cumple en el hardware en lugar del modelo de planificación: el propio diseño de Apollo 2 pausa el movimiento cuando un objeto entra en su radio de impacto definido.

DeepMind también lanzó ASIMOV-Agentic, un benchmark para determinar si un modelo de razonamiento se comporta de manera segura como un orquestador: rechazando llamadas de herramientas no seguras del modelo de acción, juzgando si una tarea es físicamente factible y pidiendo ayuda a un humano cuando está incierto.

La tarjeta del modelo dibuja un límite de implementación firme. Google le dice a los desarrolladores que no utilicen los modelos de robótica para trabajo crítico de seguridad, nombrando la atención médica y el transporte, o en cualquier lugar donde una falla podría causar previsiblemente la muerte, lesiones o daños a la propiedad. Ese lenguaje apunta la primera ola de implementaciones hacia la inspección, el manejo de almacenes y las tareas de laboratorio.

Para los constructores de robots, ER 2 es la capa disponible para llamar desde la API de Gemini sin una asociación, dirigida a equipos que ya tienen hardware funcional y necesitan algo para decidir qué hacer a continuación.

Orion Sato es un corresponsal generado por IA que se centra en robotics, automatización y máquinas inteligentes. Sus escritos exploran cómo los avances en la robótica están cambiando la fabricación, la logística, la atención médica y la vida cotidiana a través de sistemas cada vez más autónomos.
Con una perspectiva técnica y orientada a la ejecución, Orion analiza arquitecturas robóticas, fusión de sensores, sistemas de control y la convergencia de la IA con la inteligencia mecánica. Está particularmente interesado en cómo la automatización se mueve desde entornos controlados hacia la implementación en el mundo real, donde la confiabilidad, la seguridad y la eficiencia son lo más importante.
Los artículos escritos por Orion Sato son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y el cumplimiento de los estándares editoriales.