Робототехника и физический ИИ

Компьютерные ученые используют положительное подкрепление, чтобы научить роботов

mm
Добавьте Unite.AI в избранные источники в Google

Компьютерные ученые из Университета Джонса Хопкинса применили давно используемый метод обучения – положительное подкрепление, который часто используется для обучения животных, таких как собаки, к роботу, чтобы он мог научиться новым навыкам. Среди этих новых навыков было умение складывать блоки.

Робот называется Spot, и, по словам исследователей, он может выучить навыки за несколько дней, которые традиционно занимают около месяца.

Положительное подкрепление

Положительное подкрепление было использовано командой для увеличения набора навыков робота. Скорость, с которой команда смогла сделать это, делает его проще для таких роботов быть развернутыми в реальном мире.

Работа была опубликована в IEEE Robotics and Automation Letters, под названием “Хороший робот! Эффективное обучение с подкреплением для многоступенчатых визуальных задач с передачей из симуляции в реальность.

Эндрю Хандт – аспирант, работающий в Университете Джонса Хопкинса и ведущий автор исследования.

“Вопрос здесь был, как мы можем научить робота новому навыку?” – сказал он. “У меня были собаки, поэтому я знаю, что награды работают, и это было вдохновением для того, как я разработал алгоритм обучения.”

Одной из причин, почему положительное подкрепление работает на компьютерах, является то, что у них нет интуитивных мозгов, то есть они являются чистой страницей, на которую можно проецировать все, что угодно. Другими словами, им приходится учиться всему с нуля. Одним из наиболее эффективных методов обучения для компьютеров является проб и ошибка, над которым робототехники до сих пор работают сегодня.

Именно это сделали исследователи, когда они создали систему наград для робота, аналогично процессу обучения собаки с помощью угощений. Разница заключается в том, что робот получает числовые баллы, когда он выполняет задание правильно.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Навыки, выученные

Когда речь шла об обучении складыванию блоков, роботу пришлось научиться сосредотачиваться на конструктивных действиях. В методе робот Spot получал более высокие баллы, когда он выполнял правильное поведение во время складывания блоков. С другой стороны, он не получал ничего за неправильное поведение. Он получал наибольшее количество баллов, выполнив четырехблочную стопку с последним блоком сверху.

Исследователи увидели большой успех в этом методе, с роботом, который выучил за несколько дней то, что ранее занимало недели. Обучая симулированного робота, команда сократила время практики перед переходом к роботу Spot.

“Робот хочет более высокий балл”, – сказал Хандт. “Он быстро учится правильному поведению, чтобы получить лучшую награду. На самом деле, ранее на это ушло около месяца практики, чтобы робот достиг 100% точности. Мы смогли сделать это за два дня.”

Помимо обучения складыванию блоков, робот также использовал положительное подкрепление, чтобы выучить другие задачи, такие как игра в симулированную навигационную игру.

“В начале робот не имеет представления о том, что он делает, но он становится лучше и лучше с каждой практикой. Он никогда не сдается и продолжает пытаться складывать и может выполнить задание 100% времени”, – сказал Хандт.

Некоторые из возможных применений этого метода включают обучение домашних роботов выполнению определенных задач, а также улучшение автономных транспортных средств.

“Наша цель – в конечном итоге разработать роботов, которые могут выполнять сложные задачи в реальном мире – такие как сборка продукции, уход за пожилыми людьми и хирургия”, – сказал Хагер. “Мы пока не знаем, как запрограммировать задачи такого типа – мир слишком сложен. Но такая работа показывает нам, что есть обещание идее, что роботы могут научиться выполнять такие реальные задачи безопасным и эффективным способом.”

Алекс возглавляет новостные операции Unite.AI, основанные на ИИ, сочетая журналистику, исследования и автоматизацию, чтобы обеспечить своевременное и масштабируемое освещение искусственного интеллекта. Его работа способствует эффективному выявлению новых разработок в области искусственного интеллекта, при этом поддерживая редакционные стандарты издания.