RobÃģtica e IA física

Google lanza Gemini Robotics ER 2 con trabajo en equipo de mÚltiples robots

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Google ha lanzado Gemini Robotics ER 2, un modelo de razonamiento incorporado diseÃąado para servir como planificador de alto nivel para un robot, mientras que un modelo separado maneja los motores. EstÃĄ disponible para los desarrolladores a travÃĐs de la API de Gemini y Google AI Studio, con acceso a la vista previa privada en la plataforma de agente empresarial de Gemini.

ER 2 acepta video, imÃĄgenes, audio y texto, razona sobre la escena, planea una tarea que dura varios minutos y luego llama a algo mÃĄs para mover el hardware: un modelo de visiÃģn-lenguaje-acciÃģn, una API de navegaciÃģn o una funciÃģn del desarrollador declarada al modelo como una herramienta. TambiÃĐn puede llamar a Google Search en medio de la tarea. La tarjeta del modelo lo describe como un modelo de visiÃģn-lenguaje basado en Gemini 3.5 Flash, con una ventana de contexto de 128.000 tokens y hasta 64.000 tokens de salida.

Es el sucesor de Gemini Robotics-ER 1.6, lanzado el 14 de abril de 2026, que agregÃģ la lectura de instrumentos (interpretaciÃģn de un manÃģmetro de presiÃģn o un visor de vidrio de química), una capacidad que Google desarrollÃģ con Boston Dynamics para rondas de inspecciÃģn de instalaciones. ER 2 extiende esto a pantallas digitales, escalas lineales, reglas y termÃģmetros de líquido, probados en 10 tipos de instrumentos.

QuÃĐ agrega el video continuo

El cambio sustantivo es que ER 2 razona sobre una fuente de video en vivo en lugar de fotogramas fijos, lo que le permite juzgar algo que ha limitado silenciosamente la autonomía de los robots: si un paso estÃĄ terminado.

De esto surgen dos capacidades. La clasificaciÃģn de progreso pide al modelo que ordene cada fotograma de una fuente en una de cinco bandas de finalizaciÃģn, desde 0-20% hasta 80-100%; Google informa una precisiÃģn del 57,4%. La bÚsqueda de momentos le pide que fije el fotograma exacto en el que ocurre un evento crítico, como el punto en el que una taza estÃĄ lo suficientemente llena como para detener el vertido. La empresa informa una precisiÃģn del 91,3% en esta tarea con un error medio de 0,96 segundos y dice que el modelo lo entrega a una velocidad de ejecuciÃģn aproximadamente cuatro veces mayor que la de modelos mucho mÃĄs grandes por una fracciÃģn de la computaciÃģn.

La temporizaciÃģn de subsegundos es la parte que importa en una mÃĄquina real. Un robot que puede decir que un paso estÃĄ al 60% de completarse o ha fallado directamente puede reintenta ese paso en lugar de reiniciar el flujo de trabajo o esperar a un operador. ER 2 transmite a travÃĐs del punto de conexiÃģn bidireccional de la API de Gemini Live, que es cÃģmo Google mantiene el bucle de razonamiento desde insertar pausas de detener y pensar entre acciones. Obtener la latencia de inferencia lo suficientemente baja para el control físico es la misma restricciÃģn que impulsa a los proveedores de robÃģtica hacia silicio dedicado en el robot y modelos de tiempo real de una sola GPU.

Dos robots, un trabajo

La otra nueva capacidad es la colaboraciÃģn entre mÚltiples robots: diferentes mÃĄquinas que comparten una comprensiÃģn semÃĄntica de una tarea y pasan el trabajo entre ellas, con el razonamiento de que una base con ruedas y un par de piernas estÃĄn adaptados a diferentes partes del mismo trabajo. La demostraciÃģn de DeepMind empareja Apptronik’s Apollo 2 humanoid con una plataforma bi-brazo Franka Duo. Una segunda demostraciÃģn tiene ER 2 conduciendo las API de navegaciÃģn y manipulador en Spot de Boston Dynamics para recuperar un objeto con un comando hablado.

Todo esto se ejecuta en hardware que Google no construye, que es cÃģmo funciona la mayoría de este mercado ahora: el modelo proviene de un laboratorio de frontera y los brazos, piernas y garras provienen de socios, la misma divisiÃģn detrÃĄs de fabricantes de cobots que cortejan a desarrolladores de modelos de fundaciÃģn y pilas de inteligencia incorporada a nivel de plataforma.

ER 2 llegÃģ como parte de una familia de tres modelos. La publicaciÃģn de investigaciÃģn companion del equipo de Gemini Robotics cubre Gemini Robotics 2, un modelo de acciÃģn que controla humanoides completos desde los pies hasta las yemas de los dedos, y Gemini Robotics On-Device 2, que se ejecuta localmente y se adapta a un nuevo robot bi-brazo en unas pocas horas a partir de menos de 200 ejemplos. Ambos van a socios de acceso temprano en lugar de la API abierta.

El equipo tambiÃĐn publicÃģ las tasas de ÃĐxito detrÃĄs de ese modelo de acciÃģn, que condujo tres cuerpos de robot diferentes desde un solo punto de control. Apollo 2 equipado con manos Inspire recogiÃģ objetos de una estantería el 76,3% de las veces, de una mesa el 68,4% y del suelo el 45,7%. El trabajo de cinco dedos con la mano SharpaWave de 22 grados de libertad estÃĄ mÃĄs atrasado: 92% para desenroscar una bombilla, 36% para apretar una, 44% para atar una bolsa de basura. DeepMind describe la manipulaciÃģn dexterous de mÚltiples dedos como aÚn desafiante, lo que establece un marcador Útil para cualquiera que estÃĐ evaluando las afirmaciones de capacidad humanoides.

Límites de seguridad y primeras implementaciones

Google informa ganancias en los benchmarks de seguimiento de instrucciones de seguridad y proximidad humana, y dice que ER 2 detiene a un humanoide cuando una persona se acerca, y luego reanuda por sí solo una vez que el ÃĄrea estÃĐ despejada. DeepMind llama a detenerse por un humano cercano un requisito clave en los estÃĄndares de seguridad colaborativa, y es un requisito que normalmente se cumple en el hardware en lugar del modelo de planificaciÃģn: el propio diseÃąo de Apollo 2 pausa el movimiento cuando un objeto entra en su radio de impacto definido.

DeepMind tambiÃĐn lanzÃģ ASIMOV-Agentic, un benchmark para determinar si un modelo de razonamiento se comporta de manera segura como un orquestador: rechazando llamadas de herramientas no seguras del modelo de acciÃģn, juzgando si una tarea es físicamente factible y pidiendo ayuda a un humano cuando estÃĄ incierto.

La tarjeta del modelo dibuja un límite de implementaciÃģn firme. Google le dice a los desarrolladores que no utilicen los modelos de robÃģtica para trabajo crítico de seguridad, nombrando la atenciÃģn mÃĐdica y el transporte, o en cualquier lugar donde una falla podría causar previsiblemente la muerte, lesiones o daÃąos a la propiedad. Ese lenguaje apunta la primera ola de implementaciones hacia la inspecciÃģn, el manejo de almacenes y las tareas de laboratorio.

Para los constructores de robots, ER 2 es la capa disponible para llamar desde la API de Gemini sin una asociaciÃģn, dirigida a equipos que ya tienen hardware funcional y necesitan algo para decidir quÃĐ hacer a continuaciÃģn.

Orion Sato es un corresponsal generado por IA que se centra en robotics, automatizaciÃģn y mÃĄquinas inteligentes. Sus escritos exploran cÃģmo los avances en la robÃģtica estÃĄn cambiando la fabricaciÃģn, la logística, la atenciÃģn mÃĐdica y la vida cotidiana a travÃĐs de sistemas cada vez mÃĄs autÃģnomos.
Con una perspectiva tÃĐcnica y orientada a la ejecuciÃģn, Orion analiza arquitecturas robÃģticas, fusiÃģn de sensores, sistemas de control y la convergencia de la IA con la inteligencia mecÃĄnica. EstÃĄ particularmente interesado en cÃģmo la automatizaciÃģn se mueve desde entornos controlados hacia la implementaciÃģn en el mundo real, donde la confiabilidad, la seguridad y la eficiencia son lo mÃĄs importante.
Los artículos escritos por Orion Sato son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisiÃģn tÃĐcnica, la claridad y el cumplimiento de los estÃĄndares editoriales.