Робототехника и физический ИИ

Роботы, способные учиться сложным задачам по нескольким демонстрациям

mm
Добавьте Unite.AI в избранные источники в Google

В одном из последних разработок в области робототехники исследователи Университета Южной Калифорнии (USC) создали систему, в которой роботы могут учиться сложным задачам по нескольким демонстрациям. Более того, некоторые из этих демонстраций могут быть несовершенными.

Исследование было представлено на Конференции по обучению роботов (CoRL) 18 ноября, под названием “Обучение с помощью демонстраций, используя сигнальную временную логику.”

Система

Качество каждой демонстрации измеряется, чтобы система могла учиться на своих успехах и неудачах. В отличие от текущих методов, которые требуют не менее 100 демонстраций для обучения конкретной задаче, новая система требует только несколько. Интуитивно, способ, которым эти роботы учатся, похож на то, как люди учатся друг у друга. Например, люди смотрят и учатся у других, выполняя задачи успешно или несовершенно.

Анируддх Пураник – ведущий автор исследования и аспирант кафедры информатики в USC Viterbi School of Engineering.

“Многие системы машинного обучения и обучения с подкреплением требуют больших объемов данных и сотен демонстраций – вам нужно, чтобы человек демонстрировал снова и снова, что неосуществимо”, – сказал Пураник.

“Кроме того, большинство людей не имеют знаний программирования, чтобы явно указать, что должен делать робот, и человек не может продемонстрировать все, что должен знать робот”, – продолжил он. “Что, если робот столкнется с чем-то, чего он не видел раньше? Это ключевой вызов”.

Исследователи использовали “сигнальную временную логику” или STL, чтобы определить качество демонстраций, ранжируя их соответственно и создавая внутренние награды.

Существует две основные причины, по которым исследователи выбрали STL:

  1. Обучаясь через демонстрации, роботы могут подхватить несовершенства или даже опасные поведения и нежелательные действия.
  2. Демонстрации могут различаться по качеству в зависимости от пользователя, предоставляющего их, и некоторые демонстрации являются лучшими индикаторами желаемого поведения, чем другие.

Разработав систему таким образом, робот может все равно учиться на несовершенных демонстрациях, даже если они не соответствуют логическим требованиям. Другими словами, он делает свои собственные выводы об точности или успехе.

Стефанос Николаидис – соавтор и помощник профессора кафедры информатики в USC Viterbi.

“Допустим, роботы учатся на разных типах демонстраций – это может быть практическая демонстрация, видео или симуляции – если я делаю что-то очень опасное, стандартные подходы будут делать одно из двух: либо они полностью игнорируют это, либо, что еще хуже, робот научится неправильному”, – говорит Николаидис.

“Напротив, в очень умной форме эта работа использует некоторую общую смысловую логику в форме логики, чтобы понять, какие части демонстрации хороши, а какие нет”, – продолжает он. “По сути, это именно то, что также делают люди”.

Сигнальная временная логика

Роботы могут рассуждать о текущих и будущих результатах через STL, которая является выразительным математическим символическим языком. Ранее до STL исследования полагались на “линейную временную логику”.

Джьо Дешмукх – бывший инженер Toyota и помощник профессора кафедры информатики в USC.

“Когда мы переходим в мир киберфизических систем, таких как роботы и самоходные автомобили, где время имеет решающее значение, линейная временная логика становится немного неуклюжей, поскольку она рассуждает о последовательностях истинных/ложных значений переменных, в то время как STL позволяет рассуждать о физических сигналах”, – говорит Дешмукх.

Команда исследователей была удивлена уровнем успеха системы.

“По сравнению с алгоритмом, который сейчас используется в робототехнических приложениях, вы видите разницу в порядке величины в том, сколько демонстраций требуется”, – говорит Николаидис.

По мнению исследователей, системы могут учиться на симуляторах вождения и в конечном итоге на видео. Следующий шаг – протестировать это на реальных роботах, поскольку первоначальное тестирование проводилось на игровом симуляторе. Система будет полезна для применения в таких областях, как домашние среды, склады и космические исследовательские роверы.

“Если мы хотим, чтобы роботы были хорошими партнерами и помогали людям, сначала им нужно учиться и адаптироваться к человеческим предпочтениям очень эффективно”, – говорит Николаидис. “Наш метод обеспечивает это”.

Алекс возглавляет новостные операции Unite.AI, основанные на ИИ, сочетая журналистику, исследования и автоматизацию, чтобы обеспечить своевременное и масштабируемое освещение искусственного интеллекта. Его работа способствует эффективному выявлению новых разработок в области искусственного интеллекта, при этом поддерживая редакционные стандарты издания.