Робототехніка та фізичний ШІ
Комп’ютерні вчені використовують позитивне підкріплення для навчання роботів
Комп’ютерні вчені університету Джонса Гопкінса застосували давній метод навчання – позитивне підкріплення, який часто використовується для навчання тварин, таких як собаки, до робота, щоб він міг навчитися новим трюкам. Серед цих нових навичок була можливість складати блоки.
Робот називається Spot, і згідно з дослідниками, він може навчитися новим навичкам за декілька днів, що традиційно займає близько місяця.
Позитивне підкріплення
Позитивне підкріплення було використано командою для збільшення набору навичок робота. Швидкість, з якою команда змогла зробити це, робить його легшим для таких роботів бути розгорнутими в реальному світі.
Робота було опубліковано в IEEE Robotics and Automation Letters, під назвою “Хороший робот! Ефективне навчання з підкріпленням для багатокрокових візуальних завдань з симуляцією та передачею в реальність.”
Ендрю Хант – аспірант університету Джонса Гопкінса і головний автор дослідження.
“Питання полягає в тому, як ми можемо навчити робота новій навичці?” – сказав він. “У мене були собаки, тому я знаю, що нагороди працюють, і це було джерелом натхнення для розробки алгоритму навчання.”
Одна з причин, чому позитивне підкріплення працює на комп’ютерах, полягає в тому, що вони не мають інтуїтивних мозків, тобто вони є повністю чистим листом, на який можна проєктувати все. Інакше кажучи, їм потрібно все вивчити з нуля. Одним з найбільш ефективних методів навчання для комп’ютерів є метод проб і помилок, над яким робототехніки все ще працюють сьогодні.
Саме це зробили дослідники, коли створили систему нагород для робота, подібну до процесу навчання собаки за допомогою нагород. Різниця полягає в тому, що робот отримує числові бали, коли він правильно виконує завдання.
https://www.youtube.com/watch?v=dvxqjJBWFD4
Навички, вивчені
Коли мова йшла про навчання складанню блоків, робот мав навчитися концентруватися на конструктивних діях. У методі робот Spot отримував вищі бали, коли він правильно виконував дії під час складання блоків. Навпаки, він нічого не отримував за неправильні дії. Він отримував найбільшу кількість балів, коли складав чотири блоки з останнім блоком зверху.
Дослідники побачили великий успіх цього методу, оскільки робот навчився за декілька днів тому, чого раніше потребувалося тижнів. Навчаючи симульованого робота, команда зменшила час практики перед переходом до робота Spot.
“Робот хоче вищого балу”, – сказав Хант. “Він швидко вчиться правильній поведінці, щоб отримати найкращу нагороду. Насправді, раніше це займало місяць практики, щоб робот досяг 100% точності. Ми змогли зробити це за два дні.”
Крім навчання складанню блоків, робот також використовував позитивне підкріплення для вивчення інших завдань, таких як гра в симульовану навігаційну гру.
“На початку робот нічого не знає, але він стане краще і краще з кожною практикою. Він ніколи не здається і продовжує спроби складати блоки, і може закінчити завдання 100% часу”, – сказав Хант.
Деякі з можливих застосувань цього методу включають навчання домашніх роботів виконання певних завдань, а також покращення автономних транспортних засобів.
“Наша мета полягає в тому, щоб в кінцевому підсумку розробити роботів, які можуть виконувати складні завдання в реальному світі – наприклад, збірку продукції, догляд за літніми людьми та хірургію”, – сказав Хагер. “Ми зараз не знаємо, як програмувати завдання такого типу – світ занадто складний. Але робота, подібна до цієї, показує нам, що є обіцянка ідеї, що роботів можна навчити виконувати такі реальні завдання в безпечній і ефективній формі.”












