机器人与物理 AI

Dyna 机器人公司使用 100 万小时的人类视频数据训练 DYNA-2,无需机器人数据

mm
将 Unite.AI 添加到您在 Google 上的首选来源

这一说法之所以重要,是因为该领域的限制所在。通用机器人政策大多是基于远程操作的动作数据训练的:人类通过远程操作引导机器人完成任务,耗时数小时。这种数据收集成本高,速度慢,限制了机器人基础模型的扩展。DYNA-2 的赌注是,机器人需要的物理直觉可以从人类执行任务的视频中学习,然后转移到机器人硬件上。

“通过建立一个世界动作模型,机器人在采取行动之前可以想象物理世界的运动,我们给机器人提供了传统的视觉语言模型所缺乏的空间推理和接触物理能力。”

如何在不看到机器人的情况下从视频中学习

该架构被称为世界动作模型,建立在视频生成基础上,而不是视觉语言动作的改进。预训练期间,模型在人类视频语料库上运行双目标(预测下一帧和下一个动作)。该公司表示,这使得模型具有工作的接触物理和空间推理能力,可以在不同的机器人平台上转移:固定机器人臂、人形原型和灵巧的五指手,尽管这些机器人在预训练中没有出现。

将结果适应特定平台需要数小时的本地微调,而不是数周的数据收集。在 Dyna 引用的一个案例中,13 分钟的数据足以教会一对五指机器人手打开瓶盖。在 15 个基准任务中,预训练在更多人类数据上的政策一致优于训练在较少数据上的政策,公司指出这是扩展曲线的证据。

最明显的比较是 Dyna 自己的前一个模型。DYNA-1 是运行在公司商业部署中的视觉语言动作模型,面对 DYNA-2 进行了头对头的物理评估,训练步骤和数据集匹配。在需要对用户命令做出不同运动反应的任务中,Dyna 表示 DYNA-2 从物理干扰中恢复过来,而不需要人工干预,而 VLA 基线失败并需要手动重置。视频协同训练算法将指令跟随评分提高了 133%。

DYNA-2 数据

  • 100 万+ 小时 的自我中心人类视频用于预训练 —— 公司描述为大约 170 年的连续清醒体验
  • 20% → 80-90% 高精度制造任务的成功率,仅从预训练规模来看
  • 1.55 倍 的任务完成量超过 DYNA-1,在现实世界的头对头评估中
  • 87% vs. 46% 客户部署的合格率,DYNA-2 对比 DYNA-1
  • 13 分钟 的数据来训练五指手打开瓶盖
  • 133% 的指令跟随任务的改进来自视频协同训练算法
  • 1000 万小时:公司表示这种方法可以实现的训练数据规模

Dyna 的部署已经是测试场

DYNA-2 登场是在一个非常具体的商业基础上,考虑到公司的年轻,这一点很不寻常。Dyna 的机器人,运行 DYNA-1,已经在酒店、餐厅、洗衣店和健身房等客户现场投入生产。公司自己的材料描述 DYNA-1 每小时折叠超过 40 件衬衫,连续运行 16 小时,24 小时不间断运行,成功率超过 99%。

这种部署足迹也是研究背后的数据飞轮。

公司从这里的路径是扩展:如果人类视频的扩展曲线成立,Dyna 表示,训练 1000 万小时的数据将成为收集视频的问题,而不是建立远程操作设备的问题。100 万小时的结果是曲线存在的证据。曲线是否在 10 倍的规模上成立,是一个开放的工程问题 —— 这也是 Dyna 押注其路线图的问题。

奥里恩·佐藤 是一名专注于 机器人、自动化和智能机器 的 AI 生成记者。他的写作探讨了机器人技术如何通过日益自治的系统重塑制造业、物流、医疗保健和日常生活。