Моделі та платформи ШІ
Дослідники штучного інтелекту створили модель гри у відеоігри, яка може пам’ятати минулі події

Команда дослідників лабораторії штучного інтелекту компанії Uber недавно розробили систему алгоритмів штучного інтелекту, яка перевершує як людей-гравців, так і інші системи штучного інтелекту у класичних відеоіграх Atari. Система штучного інтелекту, розроблена дослідниками, здатна пам’ятати раніше успішні стратегії та створювати нові стратегії на основі того, що спрацювало в минулому. Команда дослідників вважає, що алгоритми, які вони розробили, мають потенційні застосування в інших технічних галузях, таких як обробка мови та робототехніка.
Типовий метод створення систем штучного інтелекту, здатних грати у відеоігри, полягає у використанні алгоритму навчання з підкріпленням. Алгоритми навчання з підкріпленням вчаться виконувати завдання, досліджуючи ряд можливих дій, а після кожної дії вони отримують певне підкріплення (нагороду або покарання). З часом модель штучного інтелекту вчиться, які дії призводять до більших нагород, і стає більш ймовірною для виконання цих дій. Нажаль, моделі навчання з підкріпленням зазнають труднощів, коли вони зустрічають дані, які не узгоджуються з іншими даними у наборі даних.
За словами команди дослідників, причина, по якій їхній підхід не був розглянутий іншими дослідниками штучного інтелекту, полягає в тому, що стратегія відрізняється від підходу “внутрішньої мотивації”, який зазвичай використовується у навчання з підкріпленням. Проблема з підходом внутрішньої мотивації полягає в тому, що модель може бути схильною до “забування” потенційно вигідних областей, які все ще заслуговують на дослідження. Це явище називається “від’єднанням”. Як наслідок, коли модель зустрічає несподівані дані, вона може забути про області, які все ще повинні бути досліджені.
За даними TechXplore, команда дослідників поставила за мету створити модель навчання, яка була б більш гнучкою та能够 реагувати на несподівані дані. Дослідники подолали цю проблему, введши алгоритм, який能够 пам’ятати всі дії попередньої версії моделі, коли вона намагалася вирішити проблему. Коли модель штучного інтелекту зустрічає дані, які не узгоджуються з тим, що вона вивчила раніше, модель перевіряє свою карту пам’яті. Потім модель ідентифікує, які стратегії були успішними та які не були, і вибирає стратегії відповідно.
Під час гри у відеоігру модель збирає знімки екрана гри, роблячи журнал своїх дій. Зображення групуються разом на основі схожості, утворюючи чіткі точки часу, до яких модель може звернутися. Алгоритм може використовувати зареєстровані зображення, щоб повернутися до цікавої точки часу та продовжити дослідження з цього місця. Коли модель виявляє, що вона програє, вона звертається до знімків екрана, які були зроблені раніше, та намагається застосувати іншу стратегію.
Як пояснює BBC, існує також проблема обробки небезпечних сценаріїв для агента штучного інтелекту, який грає у гру. Якщо агент зустрічає небезпеку, яка може вбити його, це завадить йому повернутися до областей, які заслуговують на подальше дослідження, проблема, яку називають “збоїм”. Модель штучного інтелекту обробляє проблеми збою через окремий процес від того, який використовується для заохочення дослідження старих областей.
Команда дослідників змусила модель грати у 55 ігор Atari. Ці ігри зазвичай використовуються для оцінки продуктивності моделей штучного інтелекту, але дослідники додали новий поворот до своєї моделі. Дослідники ввели додаткові правила до ігор, наказуючи моделі не тільки досягати найвищого балу, але й намагатися досягти ще вищого балу кожен раз. Коли результати продуктивності моделі були проаналізовані, дослідники виявили, що їхня система штучного інтелекту перевершує інші системи штучного інтелекту у іграх близько 85% часу. Система штучного інтелекту працювала особливо добре у грі Montezuma’s Revenge, платформерній грі, у якій гравець уникає небезпек та збирає скарби. Гра побила рекорд для людини-гравця та також набрала вищий бал, ніж будь-яка інша система штучного інтелекту.
За словами дослідників штучного інтелекту компанії Uber, стратегії, розроблені командою дослідників, мають застосування в галузях, таких як робототехніка. Роботи користуються можливістю пам’ятати, які дії були успішними, які не спрацювали, та які ще не були спробовані.












