Модели и платформы ИИ

DeepMind Создал ИИ, который Повторяет Воспоминания Как Гиппокамп

mm
Добавьте Unite.AI в избранные источники в Google

Человеческий мозг часто вспоминает прошлые воспоминания (кажется) без всякой причины. Когда мы проходим через наш день, у нас появляются спонтанные вспышки памяти из нашей жизни. Хотя эта спонтанная вызывание воспоминаний давно интересует нейробиологов, компания по исследованию ИИ DeepMind недавно опубликовала статью, в которой подробно описано, как их ИИ повторил эту странную закономерность воспоминаний.

Вызывание воспоминаний в мозге, нейронная репетиция, тесно связано с гиппокампом. Гиппокамп – это морской конекобразная формация в мозге, которая принадлежит лимбической системе, и она ассоциируется с образованием новых воспоминаний, а также с эмоциями, которые воспоминания вызывают. Текущие теории о роли гиппокампа (их один в каждом полушарии мозга) утверждают, что разные области гиппокампа отвечают за обработку разных типов воспоминаний. Например, пространственная память, как считается, обрабатывается в задней области гиппокампа.

Как сообщил Иисус Родригез, доктор Джон О’Киф внес значительный вклад в наше понимание гиппокампа, включая гиппокампальные “местные” клетки. Местные клетки в гиппокампе запускаются стимулами в конкретной среде. Например, эксперименты на крысах показали, что определенные нейроны будут срабатывать, когда крысы бегут через определенные участки трассы. Исследователи продолжали отслеживать крыс даже когда они отдыхали и обнаружили, что те же закономерности нейронов, обозначающих участок лабиринта, будут срабатывать, хотя они срабатывали с ускоренной скоростью. Крысы, казалось, повторяли воспоминания о лабиринте в своих умах.

У людей воспоминание воспоминаний является важной частью процесса обучения, но когда мы пытаемся позволить ИИ учиться, трудно воспроизвести это явление.

Команда DeepMind попыталась воспроизвести явление воспоминаний с помощью методов обучения с подкреплением. Алгоритмы обучения с подкреплением работают, получая обратную связь от взаимодействия с окружающей средой, получая награды всякий раз, когда они совершают действия, которые приближают их к желаемой цели. В этом контексте агент обучения с подкреплением записывает события, а затем воспроизводит их позже, при этом система подкрепляется для улучшения того, насколько эффективно она в конечном итоге вспоминает прошлый опыт.

DeepMind добавил повтор воспоминаний к алгоритму обучения с подкреплением, используя буфер повторения, который бы воспроизводил воспоминания/записанные переживания для системы в определенные моменты времени. Некоторые версии системы имели переживания, воспроизводимые в случайном порядке, в то время как другие модели имели предварительно выбранные порядок воспроизведения. Хотя исследователи экспериментировали с порядком воспроизведения для агентов обучения с подкреплением, они также экспериментировали с разными методами воспроизведения самих переживаний.

Существует два основных метода, используемых для предоставления алгоритмам обучения с подкреплением воспоминаний. Эти методы – метод повторения воображения и метод повторения фильма. Статья DeepMind использует аналогию, чтобы описать обе стратегии:

“Предположим, вы приходите домой и, к вашему удивлению и разочарованию, обнаруживаете воду, собирающуюся на ваших красивых деревянных полах. Входя в столовую, вы обнаруживаете разбитую вазу. Затем вы слышите вздох, и вы взглядываете в дверь на террасу, чтобы увидеть вашу собаку, выглядящую очень виноватой”.

Как сообщил Родригез, метод повторения воображения не записывает события в том порядке, в котором они были испытаны. Скорее, вероятная причина между событиями выводится. События выводятся на основе понимания агентом мира. Тем временем метод повторения фильма хранит воспоминания в порядке, в котором события произошли, и воспроизводит последовательность стимулов – “разлитая вода, разбитая ваза, собака”. Хронологический порядок событий сохраняется.

Исследования в области нейробиологии предполагают, что метод повторения фильма имеет важное значение для создания ассоциаций между понятиями и соединения нейронов между событиями. Однако метод повторения воображения может помочь агенту создать новые последовательности, когда он рассуждает по аналогии. Например, агент может рассуждать, что если бочка предназначена для масла, как ваза предназначена для воды, бочка может быть опрокинута фабричным роботом вместо собаки. Действительно, когда DeepMind глубже изучил возможности метода повторения воображения, они обнаружили, что их агент обучения смог создать впечатляющие, инновационные последовательности, принимая во внимание предыдущий опыт.

Большинство текущих достижений в области памяти обучения с подкреплением достигается с помощью стратегии фильма, хотя исследователи最近 начали делать прогресс с помощью стратегии воображения. Исследования обоих методов памяти ИИ не только могут обеспечить лучшую производительность агентов обучения с подкреплением, но также могут помочь нам получить новые представления о том, как функционирует человеческий разум.

Блогер и программист с специализацией в Machine Learning и Deep Learning темах. Daniel надеется помочь другим использовать силу ИИ для социального блага.