RobÃģtica e IA fÃsica
Google lanza Gemini Robotics ER 2 con trabajo en equipo de mÚltiples robots

Google ha lanzado Gemini Robotics ER 2, un modelo de razonamiento incorporado diseÃąado para servir como planificador de alto nivel para un robot, mientras que un modelo separado maneja los motores. EstÃĄ disponible para los desarrolladores a travÃĐs de la API de Gemini y Google AI Studio, con acceso a la vista previa privada en la plataforma de agente empresarial de Gemini.
ER 2 acepta video, imÃĄgenes, audio y texto, razona sobre la escena, planea una tarea que dura varios minutos y luego llama a algo mÃĄs para mover el hardware: un modelo de visiÃģn-lenguaje-acciÃģn, una API de navegaciÃģn o una funciÃģn del desarrollador declarada al modelo como una herramienta. TambiÃĐn puede llamar a Google Search en medio de la tarea. La tarjeta del modelo lo describe como un modelo de visiÃģn-lenguaje basado en Gemini 3.5 Flash, con una ventana de contexto de 128.000 tokens y hasta 64.000 tokens de salida.
Es el sucesor de Gemini Robotics-ER 1.6, lanzado el 14 de abril de 2026, que agregÃģ la lectura de instrumentos (interpretaciÃģn de un manÃģmetro de presiÃģn o un visor de vidrio de quÃmica), una capacidad que Google desarrollÃģ con Boston Dynamics para rondas de inspecciÃģn de instalaciones. ER 2 extiende esto a pantallas digitales, escalas lineales, reglas y termÃģmetros de lÃquido, probados en 10 tipos de instrumentos.
QuÃĐ agrega el video continuo
El cambio sustantivo es que ER 2 razona sobre una fuente de video en vivo en lugar de fotogramas fijos, lo que le permite juzgar algo que ha limitado silenciosamente la autonomÃa de los robots: si un paso estÃĄ terminado.
De esto surgen dos capacidades. La clasificaciÃģn de progreso pide al modelo que ordene cada fotograma de una fuente en una de cinco bandas de finalizaciÃģn, desde 0-20% hasta 80-100%; Google informa una precisiÃģn del 57,4%. La bÚsqueda de momentos le pide que fije el fotograma exacto en el que ocurre un evento crÃtico, como el punto en el que una taza estÃĄ lo suficientemente llena como para detener el vertido. La empresa informa una precisiÃģn del 91,3% en esta tarea con un error medio de 0,96 segundos y dice que el modelo lo entrega a una velocidad de ejecuciÃģn aproximadamente cuatro veces mayor que la de modelos mucho mÃĄs grandes por una fracciÃģn de la computaciÃģn.
La temporizaciÃģn de subsegundos es la parte que importa en una mÃĄquina real. Un robot que puede decir que un paso estÃĄ al 60% de completarse o ha fallado directamente puede reintenta ese paso en lugar de reiniciar el flujo de trabajo o esperar a un operador. ER 2 transmite a travÃĐs del punto de conexiÃģn bidireccional de la API de Gemini Live, que es cÃģmo Google mantiene el bucle de razonamiento desde insertar pausas de detener y pensar entre acciones. Obtener la latencia de inferencia lo suficientemente baja para el control fÃsico es la misma restricciÃģn que impulsa a los proveedores de robÃģtica hacia silicio dedicado en el robot y modelos de tiempo real de una sola GPU.
Dos robots, un trabajo
La otra nueva capacidad es la colaboraciÃģn entre mÚltiples robots: diferentes mÃĄquinas que comparten una comprensiÃģn semÃĄntica de una tarea y pasan el trabajo entre ellas, con el razonamiento de que una base con ruedas y un par de piernas estÃĄn adaptados a diferentes partes del mismo trabajo. La demostraciÃģn de DeepMind empareja Apptronikâs Apollo 2 humanoid con una plataforma bi-brazo Franka Duo. Una segunda demostraciÃģn tiene ER 2 conduciendo las API de navegaciÃģn y manipulador en Spot de Boston Dynamics para recuperar un objeto con un comando hablado.
Todo esto se ejecuta en hardware que Google no construye, que es cÃģmo funciona la mayorÃa de este mercado ahora: el modelo proviene de un laboratorio de frontera y los brazos, piernas y garras provienen de socios, la misma divisiÃģn detrÃĄs de fabricantes de cobots que cortejan a desarrolladores de modelos de fundaciÃģn y pilas de inteligencia incorporada a nivel de plataforma.
ER 2 llegÃģ como parte de una familia de tres modelos. La publicaciÃģn de investigaciÃģn companion del equipo de Gemini Robotics cubre Gemini Robotics 2, un modelo de acciÃģn que controla humanoides completos desde los pies hasta las yemas de los dedos, y Gemini Robotics On-Device 2, que se ejecuta localmente y se adapta a un nuevo robot bi-brazo en unas pocas horas a partir de menos de 200 ejemplos. Ambos van a socios de acceso temprano en lugar de la API abierta.
El equipo tambiÃĐn publicÃģ las tasas de ÃĐxito detrÃĄs de ese modelo de acciÃģn, que condujo tres cuerpos de robot diferentes desde un solo punto de control. Apollo 2 equipado con manos Inspire recogiÃģ objetos de una estanterÃa el 76,3% de las veces, de una mesa el 68,4% y del suelo el 45,7%. El trabajo de cinco dedos con la mano SharpaWave de 22 grados de libertad estÃĄ mÃĄs atrasado: 92% para desenroscar una bombilla, 36% para apretar una, 44% para atar una bolsa de basura. DeepMind describe la manipulaciÃģn dexterous de mÚltiples dedos como aÚn desafiante, lo que establece un marcador Útil para cualquiera que estÃĐ evaluando las afirmaciones de capacidad humanoides.
LÃmites de seguridad y primeras implementaciones
Google informa ganancias en los benchmarks de seguimiento de instrucciones de seguridad y proximidad humana, y dice que ER 2 detiene a un humanoide cuando una persona se acerca, y luego reanuda por sà solo una vez que el ÃĄrea estÃĐ despejada. DeepMind llama a detenerse por un humano cercano un requisito clave en los estÃĄndares de seguridad colaborativa, y es un requisito que normalmente se cumple en el hardware en lugar del modelo de planificaciÃģn: el propio diseÃąo de Apollo 2 pausa el movimiento cuando un objeto entra en su radio de impacto definido.
DeepMind tambiÃĐn lanzÃģ ASIMOV-Agentic, un benchmark para determinar si un modelo de razonamiento se comporta de manera segura como un orquestador: rechazando llamadas de herramientas no seguras del modelo de acciÃģn, juzgando si una tarea es fÃsicamente factible y pidiendo ayuda a un humano cuando estÃĄ incierto.
La tarjeta del modelo dibuja un lÃmite de implementaciÃģn firme. Google le dice a los desarrolladores que no utilicen los modelos de robÃģtica para trabajo crÃtico de seguridad, nombrando la atenciÃģn mÃĐdica y el transporte, o en cualquier lugar donde una falla podrÃa causar previsiblemente la muerte, lesiones o daÃąos a la propiedad. Ese lenguaje apunta la primera ola de implementaciones hacia la inspecciÃģn, el manejo de almacenes y las tareas de laboratorio.
Para los constructores de robots, ER 2 es la capa disponible para llamar desde la API de Gemini sin una asociaciÃģn, dirigida a equipos que ya tienen hardware funcional y necesitan algo para decidir quÃĐ hacer a continuaciÃģn.










