Моделі та платформи ШІ
DeepMind повідомляє про новий метод навчання штучного інтелекту з підкріпленням безпечно
Штучне навчання з підкріпленням є перспективним напрямком розвитку штучного інтелекту, який дозволяє створювати штучний інтелект, здатний виконувати надзвичайно складні завдання. Алгоритми навчання з підкріпленням використовуються при створенні мобільних робототехнічних систем і самохідних автомобілів, серед інших застосувань. Однак через те, як відбувається навчання штучного інтелекту з підкріпленням, іноді можуть виникати дивні та непередбачувані поведінки. Ці поведінки можуть бути небезпечними, і дослідники штучного інтелекту називають цю проблему “безпечним дослідженням”, тобто ситуацією, коли штучний інтелект застряє в дослідженні небезпечних станів.
Нещодавно дослідницька лабораторія штучного інтелекту Google DeepMind опублікувала статтю, в якій запропонувала нові методи боротьби з проблемою безпечного дослідження та навчання штучного інтелекту з підкріпленням у безпечнішому вигляді. Метод, запропонований DeepMind, також коригує нагородження або лазівки в критеріях нагородження.
Новий метод DeepMind складається з двох різних систем, призначених для керування поведінкою штучного інтелекту в ситуаціях, коли може виникнути небезпечна поведінка. Дві системи, використовувані в техніці навчання DeepMind, – це генеративна модель та модель прямої динаміки. Обидві ці моделі навчаються на різноманітних даних, таких як демонстрації експертами безпеки та повністю випадкові траєкторії руху транспортних засобів. Дані позначаються нагородою, і штучний інтелект буде вивчати закономірності поведінки, які дозволять йому зібрати найбільшу нагороду. Небезпечні стани також позначаються, і після того, як модель успішно передбачила нагороди та небезпечні стани, вона розгортається для виконання цілевих дій.
Команда дослідників у статті пояснює, що ідея полягає в тому, щоб створити можливі поведінки з нуля, запропонувати бажані поведінки та зробити ці гіпотетичні сценарії якомога інформативнішими, одночасно уникając прямого втручання в середовище навчання. Команда DeepMind називає цей підхід ReQueST, або синтез нагород через оптимізацію траєкторії.
ReQueST здатний привести до чотирьох різних типів поведінки. Перший тип поведінки намагається максимізувати невизначеність щодо моделей ансамблю нагород. Тоді як поведінка два та три намагаються одночасно мінімізувати та максимізувати передбачені нагороди. Передбачені нагороди мінімізуються для відкриття поведінки, яку модель може неправильно передбачати. З іншого боку, передбачена нагорода максимізується для відкриття поведінки, яка має найбільшу інформаційну цінність. Нарешті, четвертий тип поведінки намагається максимізувати новизну траєкторій, щоб модель продовжувала досліджувати незалежно від проектованих нагород.
Після того, як модель досягла бажаного рівня збору нагород, використовується агент планування для прийняття рішень на основі вивчених нагород. Ця схема контролю передбачення моделі дозволяє агентам вивчити уникання небезпечних станів, використовуючи динамічну модель та передбачаючи можливі наслідки, на відміну від поведінки алгоритмів, які вивчають через чисту спробу та помилку.
За повідомленням VentureBeat, дослідники DeepMind вважають, що їхній проєкт є першою системою навчання з підкріпленням, яка здатна вивчити в контрольованому, безпечному вигляді:
«На нашу думку, ReQueST є першим алгоритмом моделювання нагород, який безпечно вивчає про небезпечні стани та масштабується до навчання моделей нагород нейронних мереж у середовищах з високими розмірностями, безперервними станами. На даний момент ми продемонстрували ефективність ReQueST лише у симульованих середовищах з відносно простою динамікою. Одним з напрямків майбутньої роботи є тестування ReQueST у 3D-середовищах з більш реалістичною фізикою та іншими агентами, що діють у середовищі»












