机器人与物理 AI

计算机科学家使用积极强化来教导机器人

mm
将 Unite.AI 添加到您在 Google 上的首选来源

约翰霍普金斯大学的计算机科学家采用了长期以来用于训练动物(如狗)的积极强化训练方法,使机器人能够教自己新技能。这些新技能包括堆叠积木的能力。

机器人被称为Spot,研究人员称,它可以在几天内学习传统上需要一个月的技能。

积极强化

研究团队使用积极强化来增加机器人的技能。他们能够以如此快的速度做到这一点,使得这类机器人更容易被部署在现实世界中。

这项工作发表在《IEEE机器人和自动化信札》上,题为“好机器人!多步骤视觉任务的高效强化学习,具有模拟到现实的转换。”

安德鲁·亨特是约翰霍普金斯大学的博士生,也是该研究的首席作者。

“问题在于如何让机器人学习一项技能?”他说。“我曾经养过狗,所以我知道奖励是有效的,这也是我设计学习算法的灵感来源。”

计算机之所以能够使用积极强化,是因为它们没有直觉性的大脑,基本上是一个空白的画布,可以投射任何东西。换句话说,它们必须从零开始学习一切。计算机学习最有效的方法之一是试错,这也是机器人领域研究人员今天仍在研究的东西。

这正是研究人员创建机器人奖励系统时所做的,类似于训练狗时给予奖励的过程。不同之处在于,机器人在正确完成任务时会获得数字积分。

https://www.youtube.com/watch?v=dvxqjJBWFD4

所学技能

当机器人学习如何堆叠积木时,它必须学习专注于构造性行为。在这种方法中,机器人Spot在堆叠积木的过程中获得了更高的积分,当它完成正确的行为时。相反,当它表现出不正确的行为时,它什么也没有得到。它通过完成四个积木的堆叠并将最后一个积木放在顶部获得了最高的积分。

研究人员在这种方法中取得了巨大的成功,机器人在几天内就能学习到过去需要几周的技能。通过训练模拟机器人,团队减少了在Spot机器人上练习的时间。

“机器人想要更高的分数,”亨特说。“它很快就学会了正确的行为来获得最好的奖励。事实上,过去机器人需要一个月的练习才能达到100%的准确率,我们只用了两天。”

除了学习如何堆叠积木,机器人还使用积极强化来学习其他任务,例如如何玩模拟导航游戏。

“一开始,机器人不知道自己在做什么,但它会变得越来越好,练习越多就越好。它永远不会放弃,继续尝试堆叠,并且能够100%地完成任务,”亨特说。

这种方法的一些可能应用包括训练家用机器人完成特定任务,以及改进自动驾驶汽车。

“我们的目标是最终开发出能够在现实世界中完成复杂任务的机器人——比如产品组装、老年人护理和手术,”哈格说。“我们目前还不知道如何编程这些任务——世界太复杂。但是这样的工作表明,机器人可以学习如何以安全高效的方式完成这样的现实世界任务,这是一个有前途的想法。

Alex 负责 Unite.AI 的 AI 驱动新闻业务,融合新闻、研究和自动化,以支持对人工智能的及时且可扩展的报道。他的工作帮助确保新兴 AI 发展能够高效呈现,同时保持出版物的编辑标准。