Моделі та платформи ШІ

DeepMind і Google Brain мета створити методи для покращення ефективності навчання з підкріпленням

mm
Додайте Unite.AI до бажаних джерел у Google

Системи навчання з підкріпленням можуть бути потужними та надійними, здатними виконувати дуже складні завдання через тисячі ітерацій навчання. Хоча алгоритми навчання з підкріпленням здатні забезпечувати складну та іноді дивовижну поведінку, вони потребують тривалого часу для навчання та великих обсягів даних. Ці фактори роблять техніки навчання з підкріпленням досить неефективними, і недавно дослідницькі команди з Alphabet (GOOG ) (GOOGL ) DeepMind та Google Brain намагалися знайти більш ефективні методи створення систем навчання з підкріпленням.

Як повідомляє VentureBeat, об’єднана дослідницька група недавно запропонувала методи підвищення ефективності навчання з підкріпленням. Одним із запропонованих покращень був алгоритм, названий Адаптивним розподілом поведінки політики (ABPS), а іншим був каркас, названий Універсальними апроксиматорами функції цінності (UVFA). ABPS дозволяє басейнам штучного інтелекту ділитися своїми адаптивно вибраними досвідами, а UVFA дозволяє тим же штучним інтелектам одночасно досліджувати спрямовані політики дослідження.

ABPS призначений для прискорення налаштування гіперпараметрів під час навчання моделі. ABPS робить пошук оптимальних гіперпараметрів швидшим, дозволяючи кільком різним агентам з різними гіперпараметрами ділитися своїми поведінковими політиками досвіду. Точніше, ABPS дозволяє агентам навчання з підкріпленням вибирати дії з тих дій, які політика визнала прийнятними, а потім агенту надається нагорода та спостереження на основі наступного стану.

Агенти штучного інтелекту навчання з підкріпленням тренуються з різними комбінаціями можливих гіперпараметрів, таких як коефіцієнт衰лення та швидкість навчання. Під час навчання моделі мета полягає в тому, щоб модель збіглася на комбінації гіперпараметрів, яка забезпечує їй найкращу продуктивність, а в цьому випадку також покращує ефективність даних. Ефективність збільшується шляхом навчання багатьох агентів одночасно та вибору поведінки лише одного агента для розгортання під час наступного кроку часу. Політика, яку має цільовий агент, використовується для вибірки дій. Переходи реєструються в спільному просторі, і цей простір постійно оцінюється, щоб вибір політики не мав відбуватися так часто. У кінці навчання вибирається ансамбль агентів, а найкращі агенти вибираються для остаточного розгортання.

Що стосується UVFA, вона намагається вирішити одну з поширених проблем навчання з підкріпленням, а саме те, що агенти з слабким підкріпленням часто не навчаються завданням. UVFA намагається вирішити цю проблему, навчаючи агента окремому набору політик експлуатації та дослідження одночасно. Відокремлення завдань створює каркас, який дозволяє політикам дослідження продовжувати дослідження середовища, тоді як політики експлуатації продовжують намагатися максимізувати нагороду для поточного завдання. Політики дослідження UVFA служать базовою архітектурою, яка продовжить покращуватися, навіть якщо немає природних нагород, що знаходяться. У такому випадку апроксимується функція, яка відповідає внутрішнім нагородам, яка спонукає агентів досліджувати всі стани в середовищі, навіть якщо вони часто повертаються до знайомих станів.

Як пояснює VentureBeat, коли каркас UVFA діє, внутрішні нагороди системи надаються агенту безпосередньо у вигляді вхідних даних. Агент продовжує відстежувати представлення всіх вхідних даних (таких як нагороди, дії та стан) протягом заданого епізоду. Результатом є те, що нагорода зберігається протягом часу, а політика агента至少 частково інформується нею в усіх випадках.

Це досягається за допомогою використання модуля “епізодичної новизни” та модуля “життєвої новизни”. Функція першого модуля полягає в тому, щоб утримувати поточну епізодичну пам’ять та відображати поточні знахідки на згадану вище репрезентацію, дозволяючи агенту визначити внутрішню епізодичну нагороду для кожного кроку навчання. Після цього стан, пов’язаний з поточним спостереженням, додається до пам’яті. Тоді як модуль життєвої новизни відповідає за вплив на те, як часто агент досліджує протягом багатьох епізодів.

За словами команд Alphabet/Google, нові методи навчання вже продемонстрували потенціал для суттєвого покращення під час навчання системи навчання з підкріпленням. UVFA змогла подвоїти продуктивність деяких базових агентів, які грали різні ігри Atari. Тоді як ABPS змогла підвищити продуктивність деяких тих самих ігор Atari, зменшивши дисперсію серед найкращих агентів приблизно на 25%. Алгоритм, навчений UVFA, зміг досягти високого рахунку в Pitfall самостійно, не маючи жодних інженерних особливостей людських демонстрацій.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.