机器人与物理 AI

机器人能够从少量示范中学习复杂任务

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在机器人领域的最新发展中,南加州大学(USC)的研究人员开发了一种系统,机器人可以通过少量示范学习复杂任务。更令人印象深刻的是,其中一些示范可以是不完美的。

该研究于11月18日在机器人学习会议(CoRL)上发表,题为“使用信号时序逻辑从示范中学习”。

系统

每个示范的质量都会被衡量,这样系统就可以从其成功和失败中学习。与当前需要至少100个示范来教授特定任务的方法不同,该新系统只需要几个示范。以一种直观的方式,机器人学习的方式与人类相似,人类通过观察和学习他人完成任务或不完美的任务。

安尼鲁德·普拉尼克(Aniruddh Puranic)是该研究的第一作者,也是南加州大学维特比工程学院(USC Viterbi School of Engineering)的计算机科学博士生。

“许多机器学习和强化学习系统需要大量数据和数百个示范——你需要人类一次又一次地示范,这是不现实的,”普拉尼克说。

“而且,大多数人没有编程知识来明确说明机器人需要做什么,人类也不能可能示范机器人需要知道的所有事情,”他继续说。“如果机器人遇到它以前没有见过的事情怎么办?这是一个关键挑战。”

研究人员使用“信号时序逻辑”或STL来确定示范的质量,根据质量对其进行排名,并创建内在的奖励。

研究人员决定使用STL的两个主要原因是:

  1. 通过示范,机器人可以学习不完美或不安全的行为和不想要的行为。
  2. 示范的质量可能会根据提供它们的用户而有所不同,一些示范比其他示范更能表明所需的行为。

通过以这种方式开发系统,机器人即使示范不完美,也可以从中学习。换句话说,它会根据逻辑要求对准确性或成功做出自己的结论。

斯特凡诺斯·尼科拉伊迪斯(Stefanos Nikolaidis)是共同作者,也是南加州大学维特比计算机科学助理教授。

“假设机器人从不同类型的示范中学习——它可以是实践示范、视频或模拟——如果我做了一些非常不安全的事情,标准方法会做两件事之一:要么完全忽略它,要么更糟糕的是,机器人会学习错误的东西,”尼科拉伊迪斯说。

“相比之下,这项工作以逻辑的形式使用了一些常识推理,来理解示范的哪些部分是好的,哪些部分是不好的,”他继续说。“本质上,这正是人类所做的。”

信号时序逻辑

机器人可以通过STL推理当前和未来的结果,STL是一种富有表现力的数学符号语言。以前,研究依赖于“线性时序逻辑”。

乔·德什穆克(Jyo Deshmukh)是前丰田工程师,也是南加州大学计算机科学助理教授。

“当我们进入网络物理系统的世界,比如机器人和自动驾驶汽车,时间至关重要,线性时序逻辑变得有点笨拙,因为它推理变量的真/假值序列,而STL允许推理物理信号,”德什穆克说。

研究人员对系统的成功程度感到惊讶。

“与广泛应用于机器人应用的最先进算法相比,您可以看到所需示范数量的数量级差异,”尼科拉伊迪斯说。

根据研究人员的说法,该系统可以从驾驶模拟器和最终视频中学习。下一步是将其测试在真实机器人上,因为最初的测试是在游戏模拟器上进行的。该系统将对家庭环境、仓库和太空探索漫游车等应用程序有用。

“如果我们希望机器人成为好的队友并帮助人们,首先他们需要高效地学习和适应人类的偏好,”尼科拉伊迪斯说。“我们的方法提供了这一点。”

Alex 负责 Unite.AI 的 AI 驱动新闻业务,融合新闻、研究和自动化,以支持对人工智能的及时且可扩展的报道。他的工作帮助确保新兴 AI 发展能够高效呈现,同时保持出版物的编辑标准。