Моделі та платформи ШІ

Боротьба штучного інтелекту за освоєння Minecraft через імітаційне навчання

mm
Додайте Unite.AI до бажаних джерел у Google

За останні кілька місяців компанії Microsoft (MSFT ) та інші організації, що займаються дослідженнями машинного навчання, поставили перед командами розробників штучного інтелекту завдання створити систему штучного інтелекту, яка могла б грати в Minecraft і знайти діамант у грі. Як повідомляє BBC, хоча платформи штучного інтелекту змогли домінувати в шахах і го, проте їм не вдалося освоєння завдання в Minecraft.

Виклик Microsoft, заснований на Minecraft, назився MineRL, а результати змагання були офіційно оголошені на недавній конференції NeurIPS. Мета змагання полягала в тому, щоб навчити штучний інтелект за допомогою підходу “імітаційного навчання”. Імітаційне навчання – це метод, який полягає в навчанні штучного інтелекту за допомогою спостереження. Імітаційне навчання дозволяє системам штучного інтелекту вивчати дії, спостерігаючи за діями людей, і вивчати через акт спостереження. Імітаційне навчання, на відміну від підкріплювального навчання, є значно менш обчислювально дорогим і ефективнішим способом навчання штучного інтелекту.

Підкріплювальне навчання часто вимагає багатьох потужних комп’ютерів, з’єднаних у мережу, і сотень або тисяч годин навчання, щоб стати ефективним у виконанні завдання. Натомість штучний інтелект, навчений за допомогою імітаційного методу, може бути навчений значно швидше, оскільки штучний інтелект вже має певний рівень знань, наданий людьми, які його попередили.

Імітаційне навчання має практичні застосування при навчанні штучного інтелекту, коли штучний інтелект не може безпечно досліджувати, поки не вивчить правильні дії. Такі сценарії включають навчання автономного транспортного засобу, оскільки автомобіль не міг би просто блукати по вулицях, поки не вивчить бажані поведінки. Використання даних людського демонстратора для навчання автомобіля могло б потенційно зробити процес швидшим і безпечнішим.

Дія пошуку діаманту в Minecraft вимагає виконання багатьох кроків послідовно, таких як вирубування дерев для створення інструментів, дослідження печер, що містять діаманти, і фактичний пошук діаманту в печері. Незважаючи на складність завдання, людина, знайома з грою, повинна бути в змозі знайти діамант за близько 20 хвилин.

Було подано понад 660 різних агентів штучного інтелекту, проте жоден з них не зміг знайти діамант. Дані, надані для навчання штучного інтелекту, складалися з набору даних, що містить понад 60 мільйонів кадрів гри, зібраних з багатьох людських гравців. Розташування діамантів випадкове при запуску гри, тому це означає, що штучний інтелект не може просто шукати там, де люди знайшли діаманти. Інакше кажучи, штучний інтелект повинен сформувати розуміння того, як пов’язані між собою концепції, такі як створення інструментів, використання інструментів, дослідження та пошук ресурсів.

Незважаючи на те, що жоден з агентів штучного інтелекту не зміг успішно знайти діамант, організація була задоволена результатами змагання і тим, що багато чого було вивчено під час цього експерименту. Дослідження, проведене командами штучного інтелекту, може допомогти просунути розвиток штучного інтелекту і знайти альтернативи стратегіям підкріплювального навчання.

Підкріплювальне навчання часто забезпечує кращу продуктивність, ніж імітаційне навчання, одним з яких є успіх DeepMind’s AlphaGo. Однак, як вже зазначалося раніше, підкріплювальне навчання вимагає великих обчислювальних ресурсів, що обмежує його використання організаціями, які не можуть дозволити собі великомасштабне обладнання.

Вільям Гасс, аспірант університету Карнегі-Меллона і керівник змагання, розказав BBC, що змагання MineRL було призначено для дослідження альтернатив обчислювально дорогому штучному інтелекту. Гасс сказав:

“…Кидання величезних обчислювальних ресурсів на проблеми не завжди є правильним способом просування стану мистецтва в галузі… Це працює прямо проти демократизації доступу до цих систем підкріплювального навчання і залишає можливість навчання агентів у складних середовищах корпораціям з великими обчислювальними ресурсами.”

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.