AI 模型与平台

阿里巴巴的高德升级其机器人栈以实现体现式 AI

mm
将 Unite.AI 添加到您在 Google 上的首选来源

高德是阿里巴巴的映射和位置服务部门,已经发布了一个全栈升级,用于 ABot,这是它正在构建的体现式 AI 系统,用于引导机器人,而不是驾驶员。该升级于 2026 年 7 月 22 日宣布,包括五个新的模型,涵盖导航、操作、推理、长期记忆和运动控制,高德表示,综合栈在 17 个基准测试中获得了最高分。

该公司发布的不是一个带有价格标签或客户的机器人,而是一个模型和研究论文的集合。这种区别很重要。发布的内容描述了在基准测试中衡量的功能,而不是在某个地方运行的机器的日志记录的干预。该栈的设计是与身体无关的,可以通过可更换的技能插入人形、四足和轮式机器人,这样一个“大脑”可以在原则上驱动不同的硬件——这与更广泛的机器人竞赛中运行的相同的跨身体志向是一致的。

升级添加了什么

导航是最接近高德日常工作的部分,其模型 ABot-N1 反映了这一点。它将一个用于路线规划的慢速模块与一个用于发出移动命令的快速模块配对,并添加了一个所谓的“像素级链式思维”,将摄像头看到的内容与书面推理链接起来,以便可以追踪决策。高德表示,ABot-N1 可以仅使用普通导航地图跨越城市,室外成功率为 92.9%;论文报告室内复杂场景为 95.4%,到达兴趣点的增益为 35%,达到 77.3%。

操作更加困难,这是 ABot-M0.5 的目标:移动到一个物体并处理它,例如从房间对面的分配器中取水。它不是将移动和抓取作为一个序列运行,而是将它们分成两个操作流,并添加了一种高德称为“梦幻自愈”的训练方法,这允许模型从嘈杂的视觉预测中继续运行,而不是在小错误上停滞。高德报告称,在 RoboCasa-365 测试套件中,ABot-M0.5 比以前的最佳系统在复杂任务上提高了 20.4%,在基本任务上提高了 10.6%。

另外两个模型形成了决策层。ABot-ER 专门设计用于推理对象、空间和任务之间的关系,而不仅仅是识别帧中的内容;高德表示,截至公告时,ABot-ER 在空间问题回答基准测试 Embodied Arena 2D-EQA 中排名第一。 ABot-AgentOS 位于控制器上方,处理规划、工具使用、执行和验证,并具有可以从失败尝试中学习的终身记忆。第五个模型 ABot-C0 将这些决策转化为四足机器人的运动。推理层和代理层共同针对大多数体现式 AI 系统遇到的问题:不是单个抓取,而是将多个步骤连接成一个长任务而不失去线索。

基准测试,而不是部署

高德提供的内容比大多数机器人发布的内容更多。它在 arXiv 上发布了导航、操作、代理和运动控制模型的论文,并发布了代码和测试集,这比剪辑和加速的亮点集更可核实。外部研究人员可以在原则上重新运行工作。

这些数字仍然带有通常的星号。它们是团队自己的结果,其中几个基准测试是高德在发布模型的同时引入的:ABot-N1 随附新的点目标和点兴趣测试,而代理系统的评分基于同一篇论文定义的基准测试。没有独立实验室复制了这些数字,也没有任何模型附带实际部署——没有机队大小,没有正常运行时间,没有干预率,显示一个人有多常需要接管。这种差距将基准测试结果与竞争对手(如 AgiBot)开始声称的“部署年”区分开来。

唯一的物理锚点是高德在 2026 年 4 月表示将向北京 E-Town 半程马拉松发送的四足导航机器人。然而,这是一个演示,而不是部署:在一个设置好的环境中运行的单个机器人并不能说明该栈在真正环境的长尾中如何保持。

为什么地图公司要构建机器人大脑

高德运营着中国最大的导航平台之一,其赌注是其服务背后的映射和兴趣点数据对于机器人在物理世界中移动所需的空间推理是一个起点。该公司 在 2026 年 1 月建立了一个体现式智能部门,并在几周内发布了其第一批导航和操作基础模型,ABot-N0 和 ABot-M0;7 月份的升级是这项工作的第二代。

它落在了一个拥挤的领域中。中国开发者、新的人形进入者协作机器人制造商 都在追求相同的跨身体基础模型层,而中国正在向体现式智能和其下的模型中投入公共和私人资金。他们面临的测试是高德尚未回答的:是否可以将一个在基准测试中领先的栈运行在一个机器人上,使其在无人事先安排的楼层上无人值守地执行有用工作。高德已经展示了第一部分,第二部分仍然是一个声明。

奥里恩·佐藤 是一名专注于 机器人、自动化和智能机器 的 AI 生成记者。他的写作探讨了机器人技术如何通过日益自治的系统重塑制造业、物流、医疗保健和日常生活。