机器人与物理 AI
机器人能够从少量示范中学习复杂任务
在机器人领域的最新发展中,南加州大学(USC)的研究人员开发了一种系统,机器人可以通过少量示范学习复杂任务。更令人印象深刻的是,其中一些示范可以是不完美的。
该研究于11月18日在机器人学习会议(CoRL)上发表,题为“使用信号时序逻辑从示范中学习”。
系统
每个示范的质量都会被衡量,这样系统就可以从其成功和失败中学习。与当前需要至少100个示范来教授特定任务的方法不同,该新系统只需要几个示范。以一种直观的方式,机器人学习的方式与人类相似,人类通过观察和学习他人完成任务或不完美的任务。
安尼鲁德·普拉尼克(Aniruddh Puranic)是该研究的第一作者,也是南加州大学维特比工程学院(USC Viterbi School of Engineering)的计算机科学博士生。
“许多机器学习和强化学习系统需要大量数据和数百个示范——你需要人类一次又一次地示范,这是不现实的,”普拉尼克说。
“而且,大多数人没有编程知识来明确说明机器人需要做什么,人类也不能可能示范机器人需要知道的所有事情,”他继续说。“如果机器人遇到它以前没有见过的事情怎么办?这是一个关键挑战。”
研究人员使用“信号时序逻辑”或STL来确定示范的质量,根据质量对其进行排名,并创建内在的奖励。
研究人员决定使用STL的两个主要原因是:
- 通过示范,机器人可以学习不完美或不安全的行为和不想要的行为。
- 示范的质量可能会根据提供它们的用户而有所不同,一些示范比其他示范更能表明所需的行为。
通过以这种方式开发系统,机器人即使示范不完美,也可以从中学习。换句话说,它会根据逻辑要求对准确性或成功做出自己的结论。
斯特凡诺斯·尼科拉伊迪斯(Stefanos Nikolaidis)是共同作者,也是南加州大学维特比计算机科学助理教授。
“假设机器人从不同类型的示范中学习——它可以是实践示范、视频或模拟——如果我做了一些非常不安全的事情,标准方法会做两件事之一:要么完全忽略它,要么更糟糕的是,机器人会学习错误的东西,”尼科拉伊迪斯说。
“相比之下,这项工作以逻辑的形式使用了一些常识推理,来理解示范的哪些部分是好的,哪些部分是不好的,”他继续说。“本质上,这正是人类所做的。”
信号时序逻辑
机器人可以通过STL推理当前和未来的结果,STL是一种富有表现力的数学符号语言。以前,研究依赖于“线性时序逻辑”。
乔·德什穆克(Jyo Deshmukh)是前丰田工程师,也是南加州大学计算机科学助理教授。
“当我们进入网络物理系统的世界,比如机器人和自动驾驶汽车,时间至关重要,线性时序逻辑变得有点笨拙,因为它推理变量的真/假值序列,而STL允许推理物理信号,”德什穆克说。
研究人员对系统的成功程度感到惊讶。
“与广泛应用于机器人应用的最先进算法相比,您可以看到所需示范数量的数量级差异,”尼科拉伊迪斯说。
根据研究人员的说法,该系统可以从驾驶模拟器和最终视频中学习。下一步是将其测试在真实机器人上,因为最初的测试是在游戏模拟器上进行的。该系统将对家庭环境、仓库和太空探索漫游车等应用程序有用。
“如果我们希望机器人成为好的队友并帮助人们,首先他们需要高效地学习和适应人类的偏好,”尼科拉伊迪斯说。“我们的方法提供了这一点。”












