Моделі та платформи ШІ
DeepMind відкриває техніку навчання штучного інтелекту, яка також може працювати в нашому мозку
DeepMind нещодавно опублікувала статтю, в якій описано, як новий тип підкріпленого навчання може потенційно пояснити, як працюють системи винагород в людському мозку. За повідомленням NewScientist, метод навчання штучного інтелекту називається розподільченим підкріпленним навчанням, а механізми, що лежать в його основі, здаються досить правдоподібними для пояснення того, як нейрони мозку виділяють дофамін.
Нейробіологія і комп’ютерні науки мають довгу спільну історію. Ще в 1951 році Марвін Мінський використовував систему винагород і покарань для створення комп’ютерної програми, яка могла б вирішити лабіринт. Мінський був натхненний роботами Івана Павлова, фізіолога, який продемонстрував, що собаки можуть навчатися за допомогою серії винагород і покарань. Нова стаття DeepMind додає до цієї спільної історії, застосовуючи тип підкріпленого навчання для отримання уявлення про те, як можуть функціонувати нейрони дофаміну.
Коли людина або тварина готується до виконання дії, колекція нейронів у їхньому мозку, відповідальних за виділення дофаміну, робить передбачення про те, наскільки винагородною буде ця дія. Після виконання дії і отримання винагороди (або покарання) мозок виділяє дофамін. Однак виділення дофаміну залежить від розміру помилки в передбаченні. Якщо винагорода більша/краща, ніж очікувалося, відбувається сильніший сплеск дофаміну. Навпаки, гірша винагорода призводить до виділення меншої кількості дофаміну. Дофамін служить корективною функцією, яка допомагає нейронам налаштувати свої передбачення, поки вони не збігаються з реальними винагородами. Це дуже схоже на те, як працюють алгоритми підкріпленого навчання.
У 2017 році дослідники DeepMind випустили покращену версію широко використовуваного алгоритму підкріпленого навчання, і цей покращений метод навчання зміг підвищити результати багатьох завдань підкріпленого навчання. Команда DeepMind подумала, що механізми, які лежать в основі нового алгоритму, можуть бути використані для кращого пояснення того, як працюють нейрони дофаміну в людському мозку.
На відміну від старих алгоритмів підкріпленого навчання, новий алгоритм DeepMind представляє винагороди як розподіл. Старіші підходи до підкріпленого навчання представляли оцінені винагороди як один число, яке відповідає середньому очікуваному результату. Ця зміна дозволила моделі більш точно представляти можливі винагороди і краще виконувати завдання. Краща результативність нового методу навчання спонукала дослідників DeepMind до дослідження того, чи працюють нейрони дофаміну в людському мозку подібним чином.
Для дослідження роботи нейронів дофаміну DeepMind співпрацювала з Гарвардом для вивчення діяльності нейронів дофаміну у мишей. Дослідники мали мишей виконувати різні завдання і давали їм винагороди на основі випадкового результату, реєструючи, як їхні нейрони дофаміну виділяли дофамін. Різні нейрони, здавалося, передбачали різні потенційні результати, виділяючи різні кількості дофаміну. Деякі нейрони передбачали нижчі результати, ніж реальна винагорода, тоді як інші передбачали вищі результати, ніж реальна винагорода. Після побудови розподілу передбачених винагород дослідники виявили, що розподіл передбачень був досить близьким до справжнього розподілу винагород. Це свідчить про те, що мозок дійсно використовує розподільчу систему при передбаченні і корекції передбачень для кращого збігання з реальністю.
Дослідження може інформувати як нейробіологію, так і комп’ютерні науки. Стаття підтримує використання розподільчого підкріпленого навчання як методу створення більш просунутих моделей штучного інтелекту. Окрім того, воно може мати наслідки для наших теорій про те, як працює мозок щодо систем винагород. Якщо нейрони дофаміну розподілені і деякі з них більш песимістичні або оптимістичні, ніж інші, розуміння цих розподілів може змінити наш підхід до аспектів психології, таких як психічне здоров’я і мотивація.
За повідомленням MIT Technology Review, Метт Ботвінік, директор досліджень нейробіології в DeepMind, пояснив значення результатів на прес-брифінгу. Ботвінік сказав:
“Якщо мозок використовує це, то це, ймовірно, хороша ідея. Це говорить нам про те, що це обчислювальна техніка, яка може бути застосована в реальних ситуаціях. Це добре поєднується з іншими обчислювальними процесами. Це дає нам новий погляд на те, що відбувається в нашому мозку під час повсякденного життя”












