Робототехніка та фізичний ШІ
Роботи 能够 вивчати складні завдання з декільох демонстрацій
Одним з останніх розробок у сфері робототехніки є система, розроблена дослідниками Університету Південної Каліфорнії (USC), яка дозволяє роботам вивчати складні завдання за допомогою декільох демонстрацій. Навіть більш вражаюче, що деякі з цих демонстрацій можуть бути неідеальними.
Дослідження було представлено на Конференції з навчання роботів (CoRL) 18 листопада під назвою “Вивчення з демонстрацій за допомогою сигнальної тимчасової логіки.”
Система
Якість кожної демонстрації вимірюється, щоб система могла вивчати з успіхів і невдач. На відміну від поточних методів, які вимагають щонайменше 100 демонстрацій для навчання конкретному завдання, нова система вимагає лише декілька. У直forward спосіб, робототехніки вивчають подібно до того, як люди вивчають один одного. Наприклад, люди спостерігають і вивчають один одного під час виконання завдань успішно або неідеально.
Аніріддх Пуранік є головним автором дослідження і аспірантом кафедри комп’ютерних наук Університету Південної Каліфорнії.
“Багато систем машинного навчання і навчання з підкріпленням вимагають великої кількості даних і сотень демонстрацій – вам потрібно, щоб людина демонструвала знову і знову, що не є можливим”, – сказав Пуранік.
“Крім того, більшість людей не мають знань про програмування, щоб явно вказати, що потрібно зробити роботам, і людина не може демонструвати все, що потрібно роботам”, – продовжив він. “Що, якщо робот зустріне щось, чого він не бачив раніше? Це ключовий виклик”.
Дослідники використали “сигнальну тимчасову логіку” або STL для визначення якості демонстрацій, ранжуючи їх відповідно і створюючи внутрішні нагороди.
Є дві основні причини, чому дослідники вирішили використовувати STL:
- Вивчаючи за допомогою демонстрацій, робототехніки можуть вивчити недоліки або навіть небезпечні дії і нежадані дії.
- Демонстрації можуть відрізнятися за якістю залежно від користувача, який їх надає, і деякі демонстрації є кращими індикаторами бажаної поведінки, ніж інші.
Розробивши систему в цьому вигляді, робототехніки можуть вивчити з неідеальних демонстрацій, навіть якщо вони не відповідають логічним вимогам. Інакше кажучи, вони роблять свій висновок про точність або успіх.
Стефанос Ніколайдіс є співавтором і помічником професора кафедри комп’ютерних наук Університету Південної Каліфорнії.
“Наприклад, якщо робототехніки вивчають з різних типів демонстрацій – це може бути демонстрація вручну, відео або симуляції – якщо я роблю щось дуже небезпечне, стандартні підходи роблять одну з двох речей: або вони повністю ігнорують це, або навіть гірше, робототехніки вивчають неправильну річ”, – говорить Ніколайдіс.
“Натомість, у дуже розумній спосіб, ця робота використовує деякі загальні речі у вигляді логіки для розуміння, які частини демонстрації є добрими, а які частини не є”, – продовжує він. “У сутності, це саме те, що роблять люди”.
Сигнальна тимчасова логіка
Робототехніки можуть вивчати поточні і майбутні результати за допомогою STL, яка є виразною математичною символічною мовою. Раніше до STL дослідження використовували “лінійну тимчасову логіку”.
Джьо Дешмукх є колишнім інженером Toyota і помічником професора кафедри комп’ютерних наук Університету Південної Каліфорнії.
“Коли ми йдемо у світ кіберфізичних систем, таких як робототехніки і самоходні автомобілі, де час є важливим, лінійна тимчасова логіка стає трохи незручною, оскільки вона розглядає послідовності істинних/хибних значень для змінних, тоді як STL дозволяє розглядати фізичні сигнали”, – говорить Дешмукх.
Команда дослідників була здивована рівнем успіху системи.
“У порівнянні з алгоритмом державного рівня, який широко використовується у робототехнічних застосуваннях, ви бачите різницю порядку величини у тому, скільки демонстрацій потрібно”, – говорить Ніколайдіс.
За словами дослідників, система могла б вивчити з симуляторів водіння і, врешті-решт, з відео. Наступним кроком є тестування на реальних роботах, оскільки перші тести проводилися на ігровому симуляторі. Система буде корисною для застосувань, таких як ті, що використовуються у домашніх середовищах, складах і роверах для дослідження космосу.
“Якщо ми хочемо, щоб робототехніки були хорошими партнерами і допомагали людям, спочатку їм потрібно вивчити і адаптуватися до людських уподобань дуже ефективно”, – говорить Ніколайдіс. “Наш метод забезпечує це”.












