机器人与物理 AI

mimic 机器人推出 FLUX-mimic,将视频操作模型引入奥迪的工厂车间

mm
将 Unite.AI 添加到您在 Google 上的首选来源

mimic 机器人 推出 FLUX-mimic,一种新型的视频操作模型,旨在帮助工业机器人从较小的示范数据中学习复杂的操作任务。

该系统由视觉 AI 公司 Black Forest Labs 与 mimic 机器人共同开发,目前已经在奥迪的制造环境中进行测试和部署,用于解决历史上难以自动化的任务,包括处理柔性材料、更改零件配置和精确操作等。

该公告指出,这可能标志着物理 AI 的一个转变。相比传统的依赖大量机器人示范,FLUX-mimic 尝试将一个生成式视频模型中已学习的知识转移到控制物理机器的系统中。

机器人学习的新方法

许多当今的通用机器人系统都基于视觉语言操作模型(Vision-Language-Action models),也称为 VLA 模型。这些系统通常将一个在图像和语言上训练的模型与预测机器人运动的组件相结合。

这种方法使机器人具有一定的语义理解能力,例如识别物体或解释书面指令。然而,静态图像无法完全捕捉物体的弯曲、移动、碰撞或对物理接触的反应。

因此,缺失的知识必须通过机器人示范来学习,这可能很昂贵且耗时。每个示范都需要一个物理机器人、操作员、合适的工作空间和仔细记录的动作数据。

FLUX-mimic 采取了不同的方法。它使用 Black Forest Labs 的 FLUX 3 模型生成的视觉表示作为预测任务如何随时间展开的基础。Black Forest Labs 将 FLUX 3 描述为一种多模态模型,可以生成图像、视频、音频和动作,而不仅仅是静态图像生成系统。

一个动作解码器将模型的视觉预测转换为机器人可以执行的命令。从实际角度来看,该系统首先估计完成任务的成功外观,然后确定产生该结果所需的物理运动。

基于 mimic-video 架构

FLUX-mimic 建立在 mimic-video 的基础上,mimic-video 是公司早期关于使用预训练视频模型作为机器人控制骨干的研究。

与其要求传统的视觉语言模型从单个帧中推断运动,mimic-video 创建一个表示任务可能发展的潜在视觉计划。一个单独的动作解码器使用该内部表示来生成机器人运动。

在其研究论文中,公司报告称,mimic-video 在其评估中实现了大约十倍的样本效率和两倍的训练收敛速度,相比于一个可比的 VLA 架构。该真实系统使用了大约 500 条来自双手灵巧机器人设置的轨迹进行训练。

FLUX-mimic 扩展了这一概念,使用 FLUX 3 的架构和专门为物理 AI 设计的设计。

根据 mimic 机器人的说法,之前可能需要 30 小时或更多的机器人示范的任务,现在可以在仅 30 分钟的数据中达到生产就绪的性能。该数字代表了公司报告的结果,需要在更广泛的工厂、硬件配置和生产条件下进行评估。

即使如此,通过这种程度减少数据要求可能会从根本上改变工业机器人的经济性。部署成本通常远远超过机器人本身,需要大量资源用于编程、集成、模拟、测试和重新设计,每当产品或工艺发生变化时。

奥迪提供了具有挑战性的工业测试

奥迪正在与 mimic 机器人合作,在制造环境中评估 FLUX-mimic,在那里,自动化系统必须应对产品变化、严格的生产要求和无法简化为重复运动的任务。

汽车制造商表示,机器人已经执行了复杂的软体操作工作,这些工作对于传统机器人来说非常困难。软材料特别具有挑战性,因为它们在处理过程中形状会发生变化,使得通过固定坐标或规则定义每个运动变得困难。

奥迪更广泛的自动化研究说明了为什么适应性变得越来越重要。在其 Böllinger Höfe 设施中,公司正在测试人工智能、移动机器人、计算机视觉和新型拾取技术,所有这些都在一个真实的实验室中进行。奥迪指出,e-tron GT 等车辆的高定制化程度会产生复杂的物流过程,涉及大量不同的零件。

传统的工业机器人在结构化环境中仍然非常有效,每个物体都以可预测的位置到达。然而,当零件、材料或产品变体频繁变化时,需要反复进行工程工作,这使得它们变得不那么经济。

基于学习的系统可以使这些低产量和高变异性的过程更容易自动化。制造商可以通过示范期望的行为并让系统学习如何复制它,而不是为每个任务编写新程序。

结合模型、硬件和人机示范

该模型是 mimic 机器人正在开发的更广泛的全栈机器人平台的一部分。

该公司制造自己的灵巧机器人手部硬件、可穿戴数据采集设备、机器人学习模型和部署基础设施。其可穿戴系统旨在以可以更直接转移到公司机器人手中的格式记录人类手部运动。

这种专注于手部而非完整的人形机器人的方法反映了工业自动化中更有针对性的方法。灵巧的手可以附着在工厂中已经使用的传统机器人臂上,从而减少了引入全新的机器人形式的需要。ETH Zurich 将这种方法描述为将人类般的操作与成熟的工业硬件相结合,以解决需要适应性和自我纠正的任务。

作为 ETH Zurich 的 2024 年分拆公司,mimic 机器人已经在苏黎世和旧金山拥有超过 50 名员工。其团队涵盖模型研究、机器人、硬件开发、数据运营和工业部署等领域。

对工厂自动化的更广泛影响

FLUX-mimic 的重要性将取决于它是否能够在成千上万的生产周期中保持高成功率,而不是单独的示范。

工厂需要一致的性能、可预测的周期时间、在员工周围的安全操作、快速从错误中恢复以及与现有制造系统的集成。一个学习速度快但行为不可预测的模型将比传统的自动化提供不了优势。

然而,如果视频操作模型可以在保持工业可靠性要求的同时保持其报告的数据效率,它们可能会将机器人扩展到以前由于太可变或太昂贵而无法编程的工作类别中。

这可能包括组装柔性部件、处理混合库存、分类不规则物体、包装频繁变化的产品以及支持工人进行身体要求高的过程。

长期的机会不仅仅是一个更强大的机器人手,而是一个不同的部署模型,制造商通过示范来教导机器,而不是预先指定每个运动。

奥迪的参与为 FLUX-mimic 提供了一个机会,证明这种方法可以超越受控的研究环境。成功地在汽车工厂车间中应用,将是一个重要的迹象,表明生成式视频模型可以成为控制物理世界中机器的智能层的一部分,而不仅仅是创建数字媒体的工具。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。