机器人与物理 AI
谷歌发布Gemini Robotics ER 2,支持多机器人协作

谷歌推出了Gemini Robotics ER 2,这是一种嵌入式推理模型,旨在作为机器人的高级规划器,而另一个模型则处理电机。它通过Gemini API和Google AI Studio提供给开发者,并在Gemini Enterprise Agent Platform上提供私人预览访问。
ER 2可以处理视频、图像、音频和文本,推理场景,规划一个运行几分钟的任务,然后调用其他内容来移动硬件:一个视觉语言操作模型、导航API或开发人员自己的函数,宣布给模型作为工具。它还可以在任务中调用Google搜索。 模型卡 将其描述为基于Gemini 3.5 Flash的视觉语言模型,具有128,000个令牌的上下文窗口和最多64,000个令牌的输出。
它继承了Gemini Robotics-ER 1.6,该模型于2026年4月14日发布,增加了仪表读取(解释压力表或化学视觉)功能,这是谷歌与波士顿动力公司共同开发的设施检查功能。 ER 2将其扩展到数字显示、线性尺度、尺子和液体温度计,在10种仪表类型中进行了测试。
连续视频的作用
实质性的变化是ER 2在直播视频流中进行推理,而不是静态帧,这使它能够判断一个步骤是否完成,这一直是限制机器人自主性的一个关键因素。
这带来了两个功能。进度分类要求模型将视频流中的每一帧分为五个完成类别,从0-20%到80-100%;谷歌报告了57.4%的准确率。关键帧检测要求模型找到发生关键事件的确切帧,例如倒入足够的液体停止倒入的时刻。该公司报告了91.3%的准确率,并表示该模型以大型模型的四倍执行速度和一小部分计算资源提供了这一功能。
亚秒级的计时是实际机器上重要的部分。一个可以判断步骤完成60%或完全失败的机器人可以重试该步骤,而不是重新启动工作流程或等待操作员。 ER 2通过Gemini Live API的双向端点流式传输,这是谷歌保持推理循环不在操作之间插入停止和思考暂停的方式。将推理延迟降低到足以进行物理控制的水平是推动机器人供应商使用专用机器人芯片和单GPU实时模型的相同约束。
两个机器人,一份工作
另一个新功能是多机器人协作:不同机器共享对任务的语义理解,并在它们之间交换工作,基于这样的推理:带轮子的底座和一对腿更适合同一份工作的不同部分。DeepMind的演示将Apptronik的Apollo 2人形机器人与Franka Duo双臂平台配对。第二个演示有ER 2驱动波士顿动力公司的Spot的导航和操作API,以口头命令检索一个对象。
所有这些都在谷歌不制造的硬件上运行,这是当前市场的运作方式:模型来自前沿实验室,臂、腿和夹持器来自合作伙伴,这是协作机器人制造商和平台级嵌入式AI堆栈背后的相同分裂。
ER 2作为三个模型家族的一部分发布。Gemini Robotics团队的伴侣研究帖子介绍了Gemini Robotics 2,一个控制全身人形机器人的操作模型,以及Gemini Robotics On-Device 2,运行在本地设备上,能够在不到200个示例中适应新的双臂机器人。两者都提供给早期访问合作伙伴,而不是开放API。
该团队还发布了该操作模型背后的成功率,该模型从单个检查点驱动了三个不同的机器人身体。配备Inspire手的Apollo 2从货架上拾取物体的成功率为76.3%,从桌子上为68.4%,从地板上为45.7%。具有22个自由度的SharpaWave手的五指灵巧操作还需要更多工作:拧松灯泡的成功率为92%,拧紧灯泡的成功率为36%,系紧垃圾袋的成功率为44%。DeepMind将多指灵巧操作描述为仍然具有挑战性,这为评估人形机器人能力提供了一个有用的基准。
安全限制和首次部署
谷歌报告了安全指令遵循和人体接近的基准,并表示ER 2在有人靠近时停止人形机器人,然后在区域清除后自动恢复。DeepMind将停止附近的人称为协作安全标准中的一个关键要求,这通常是通过硬件而不是规划模型来满足的:Apollo 2自己的设计在对象进入其定义的影响半径时会暂停运动。
DeepMind还发布了ASIMOV-Agentic基准,用于评估推理模型作为编排器的安全行为:拒绝操作模型的不安全工具调用,判断任务是否在物理上可行,并在不确定时请求人类帮助。
模型卡绘制了一个坚定的部署边界。谷歌告知开发者不要将机器人模型用于安全关键工作,例如医疗保健和运输,或者可能由于故障而造成死亡、伤害或财产损害的地方。这种语言将首次部署的第一波指向检查、仓库处理和实验室任务。
对于机器人制造商来说,ER 2是可以从Gemini API调用而无需合作伙伴关系的层,面向已经拥有工作硬件的团队,并需要决定下一步该做什么。












