Моделі та платформи ШІ

DeepMind створює штучний інтелект, який повторює спогади, як гіпокамп

mm
Додайте Unite.AI до бажаних джерел у Google

Людський мозок часто згадує минулі спогади (здається) без жодної причини. Під час нашого дня ми маємо спонтанні спалахи пам’яті з нашого життя. Хоча ці спонтанні спогади давно цікавили нейробіологів, компанія з дослідження штучного інтелекту DeepMind недавно опублікувала статтю про те, як їхній штучний інтелект повторює цю дивну закономірність спогадів.

Спогади в мозку, нейронна репетиція, тісно пов’язані з гіпокампом. Гіпокамп – це морська кінська формація в мозку, яка належить до лімбічної системи, і вона пов’язана з утворенням нових спогадів, а також емоціями, які викликають спогади. Поточні теорії про роль гіпокампа (їх два в кожній півкулі мозку) свідчать, що різні області гіпокампа відповідають за обробку різних типів спогадів. Наприклад, спогади про просторову пам’ять вважаються обробленими в задній частині гіпокампа.

Як повідомляє Хесус Родрігес, доктор Джон О’Кіф зробив багато внесків у наше розуміння гіпокампа, включаючи гіпокампальні “місцеві” клітини. Місцеві клітини в гіпокампі спрацьовують під впливом стимулів у певному середовищі. Наприклад, експерименти на щурах показали, що певні нейрони спрацьовували, коли щури бігали певними частинами треку. Дослідники продовжували спостерігати за щурами, навіть коли вони відпочивали, і вони виявили, що ті самі шаблони нейронів, які позначали частину лабіринту, спрацьовували знову, хоча з прискореною швидкістю. Щури, здавалося, повторювали спогади про лабіринт у своїх думках.

У людей спогади про минуле є важливою частиною процесу навчання, але коли намагатися надати штучному інтелекту можливість навчатися, важко відтворити цей феномен.

Команда DeepMind намагалася відтворити явище спогадів за допомогою алгоритмів навчання з підкріпленням. Алгоритми навчання з підкріпленням працюють шляхом отримання зворотного зв’язку від взаємодії зі середовищем навколо них, отримуючи нагороди, коли вони виконують дії, які зближують їх з бажаною метою. У цьому контексті агент навчання з підкріпленням записує події, а потім відтворює їх пізніше, з системою, яка підкріплює поліпшення того, як ефективно він спогади про минулі досвіди.

DeepMind додала повторення досвіду до алгоритму навчання з підкріпленням за допомогою буфера повторення, який відтворював спогади/записані досвіди системі в певні часи. Деякі версії системи мали досвід, відтворений у випадковому порядку, тоді як інші моделі мали попередньо вибраний порядок відтворення. Хоча дослідники експериментували з порядком відтворення для агентів навчання, вони також експериментували з різними методами відтворення досвіду самому.

Існують два основних методи, які використовуються для надання алгоритмам навчання спогадами про минулі досвіди. Ці методи – це метод повторення уявою та метод повторення фільму. Стаття DeepMind використовує аналогію, щоб описати обидві стратегії:

“Припустимо, ви повертаєтеся додому і, до вашого здивування та розчарування, виявляєте воду, що накопичується на ваших красивих дерев’яних підлогах. Входячи до їдальні, ви знаходить розбитий вазон. Потім ви чуєте шепіт, і ви глядаєте через двері патіо, щоб побачити вашу собаку, яка виглядає дуже винною”.

Як повідомляє Родрігес, метод повторення уявою не записує події в порядку, в якому вони були пережиті. Натомість, ймовірна причина між подіями припускається. Події припускаються на основі розуміння агентом світу. Тоді як метод повторення фільму зберігає спогади в порядку, в якому події відбулися, і відтворює послідовність стимулів – “розлитої води, розбитого вазону, собаки”. Хронологічний порядок подій зберігається.

Дослідження з галузі нейробіології свідчать, що метод повторення фільму є важливим для створення асоціацій між поняттями та з’єднанням нейронів між подіями. Однак метод повторення уявою міг би допомогти агенту створити нові послідовності, коли він розуміє за аналогією. Наприклад, агент міг би розуміти, що якщо бочка до масла так само, як вазон до води, бочку можна розлити фабричним роботом замість собаки. Дійсно, коли DeepMind глибше вивчив можливості методу повторення уявою, вони виявили, що їхній агент навчання міг створити вражаючі, інноваційні послідовності, враховуючи попередній досвід.

Більшість поточного прогресу в галузі пам’яті навчання з підкріпленням робиться за допомогою стратегії фільму, хоча дослідники нещодавно почали робити прогрес за допомогою стратегії уявою. Дослідження обидвох методів штучної пам’яті можуть не тільки забезпечити кращу продуктивність агентів навчання з підкріпленням, але також допомогти нам отримати нові знання про те, як може функціонувати людський мозок.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.