Модели и платформы ИИ
DeepMind открыл метод обучения ИИ, который может работать и в нашем мозге
DeepMind недавно опубликовал статью, в которой подробно описано, как новый тип обучения с подкреплением может потенциально объяснить, как работают пути вознаграждения в человеческом мозге. По сообщению NewScientist, метод обучения с подкреплением называется распределенным обучением с подкреплением, и механизмы, лежащие в его основе,似乎 вполне правдоподобно объясняют, как дофамин выделяется нейронами в мозге.
Нейробиология и компьютерные науки имеют долгую историю вместе. Already в 1951 году Марвин Минский использовал систему вознаграждений и наказаний для создания компьютерной программы, способной решать лабиринт. Минский был вдохновлен работой Ивана Павлова, физиолога, который продемонстрировал, что собаки могут учиться через серию вознаграждений и наказаний. Новая статья DeepMind добавляет к переплетению истории нейробиологии и компьютерных наук, применяя тип обучения с подкреплением для получения представления о том, как могут функционировать дофаминовые нейроны.
Когда человек или животное собирается совершить действие, коллекция нейронов в их мозге, ответственных за выделение дофамина, делает прогноз о том, насколько вознаграждением будет действие. После совершения действия и получения вознаграждения (или наказания) мозг выделяет дофамин. Однако выделение дофамина масштабируется в соответствии с величиной ошибки прогноза. Если вознаграждение больше/лучше, чем ожидалось, происходит более сильный выброс дофамина. Напротив, худшее вознаграждение приводит к меньшему выделению дофамина. Дофамин служит корректирующей функцией, которая заставляет нейроны настроить свои прогнозы до тех пор, пока они не сходятся с фактическими вознаграждениями. Это очень похоже на то, как алгоритмы обучения с подкреплением работают.
В 2017 году исследователи DeepMind выпустили улучшенную версию часто используемого алгоритма обучения с подкреплением, и этот лучший метод обучения смог повысить производительность во многих задачах обучения с подкреплением. Команда DeepMind подумала, что механизмы, лежащие в основе нового алгоритма, могут быть использованы для лучшего объяснения того, как дофаминовые нейроны работают в человеческом мозге.
В отличие от старых алгоритмов обучения с подкреплением, новый алгоритм DeepMind представляет вознаграждения как распределение. Старые подходы к обучению с подкреплением представляли оцененные вознаграждения как одно число, обозначающее средний ожидаемый результат. Это изменение позволило модели более точно представлять возможные вознаграждения и лучше работать в результате. Лучшая производительность нового метода обучения побудила исследователей DeepMind изучить, работают ли дофаминовые нейроны в человеческом мозге подобным образом.
Чтобы изучить работу дофаминовых нейронов, DeepMind работал вместе с Гарвардом, чтобы исследовать активность дофаминовых нейронов у мышей. Исследователи заставили мышей выполнять различные задачи и давали им вознаграждения на основе броска кубика, записывая, как их дофаминовые нейроны срабатывали. Разные нейроны, казалось, прогнозировали разные потенциальные результаты, выделяя разные количества дофамина. Некоторые нейроны прогнозировали ниже фактического вознаграждения, в то время как некоторые прогнозировали вознаграждения выше фактического вознаграждения. После построения распределения прогнозов вознаграждения исследователи обнаружили, что распределение прогнозов было довольно близко к фактическому распределению вознаграждения. Это говорит о том, что мозг действительно использует распределенную систему при прогнозировании и корректировке прогнозов для лучшего соответствия реальности.
Исследование может информировать как нейробиологию, так и компьютерные науки. Исследование поддерживает использование распределенного обучения с подкреплением как метода создания более продвинутых моделей ИИ. Кроме того, оно может иметь последствия для наших теорий о том, как работает мозг в отношении систем вознаграждения. Если дофаминовые нейроны распределены и некоторые из них более пессимистичны или оптимистичны, чем другие, понимание этих распределений может изменить наш подход к аспектам психологии, таким как психическое здоровье и мотивация.
По сообщению MIT Technology Review, Мэтт Ботвиник, директор исследований нейробиологии в DeepMind, объяснил важность результатов на пресс-конференции. Ботвиник сказал:
“Если мозг использует это, это, вероятно, хорошая идея. Это говорит нам, что это вычислительный метод, который может масштабироваться в реальных ситуациях. Он будет хорошо сочетаться с другими вычислительными процессами. Это дает нам новую перспективу на то, что происходит в нашем мозге во время повседневной жизни”












