Моделі та платформи ШІ

Інтелектуальні агенти демонструють властивості емерджентної інтелектуальності у віртуальній грі в хованки

mm
Додайте Unite.AI до бажаних джерел у Google

Одним із цікавих фактів про дослідження штучного інтелекту є те, що він може часто виконувати дії та переслідувати стратегії, які дивують самих дослідників, які їх проектують. Це трапилося під час недавньої віртуальної гри в хованки, де кілька інтелектуальних агентів були поставлені один проти одного. Дослідники з OpenAI, компанії штучного інтелекту зі Сан-Франциско, були здивовані, коли їхні інтелектуальні агенти почали використовувати стратегії у грі, про які дослідники навіть не знали.

OpenAI тренувала групу інтелектуальних агентів, щоб вони грали в хованки один з одним. Програми штучного інтелекту тренуються за допомогою підкріплення, техніки, при якій бажана поведінка викликається у алгоритмів штучного інтелекту шляхом надання їм зворотного зв’язку. Штучний інтелект починає з випадкових дій, і кожного разу, коли він виконує дію, яка наближається до його мети, агент отримує нагороду. Штучний інтелект хоче отримати максимально можливу нагороду, тому він експериментує, щоб побачити, які дії принесуть йому найбільшу нагороду. Через спроби і помилки штучний інтелект здатний відрізняти стратегії, які приведуть його до перемоги, ті, які принесуть йому найбільшу нагороду.

Підкріплення вже продемонструвало вражаючий успіх у вивченні правил ігор. OpenAI недавно тренувала команду штучного інтелекту, щоб грати в MMORPG DOTA 2, і штучний інтелект переміг команду чемпіонів-людей минулого року. Подібна ситуація сталася з грою StarCraft, коли штучний інтелект був тренований на грі компанією DeepMind. Підкріплення також використовувалося для навчання програм штучного інтелекту грати в Pictionary з людьми, вивчаючи інтерпретацію картинок і використання базових розумових дій.

У віртуальній грі в хованки, створеній дослідниками, кілька інтелектуальних агентів були поставлені один проти одного. Результатом стала певна форма гонки озброєння, де кожен агент хоче перевершити іншого і отримати найбільшу кількість нагородних очок. Нова стратегія, прийнята одним агентом, призведе до того, що його суперник буде шукати нову стратегію, щоб контратакувати, і навпаки. Ігор Мордач, дослідник з OpenAI, пояснив IEEE Spectrum, що цей експеримент демонструє, що цей процес проб і помилок між агентами “достатньо, щоб агенти вивчили несподівані поведінки самостійно – це як діти, які грають один з одним”.

Якими були ці несподівані поведінки? Дослідники мали чотири основні стратегії, які вони очікували, що інтелектуальні агенти вивчать, і вони вивчили їх досить швидко, ставши компетентними в них вже після 25 мільйонів симульованих ігор. Гра проходила в 3D-оточенні, повному рамп, блоків і стін. Інтелектуальні агенти вивчили переслідувати один одного, рухати блоки, щоб побудувати фортеці, в яких вони могли ховатися, і рухати рампи. Інтелектуальні агенти-шукачі вивчили тягнути рампи, щоб потрапити всередину фортець ховальників, тоді як ховальники вивчили намагатися взяти рампи всередину своїх фортець, щоб шукачі не могли використовувати їх.

Однак, близько 380 мільйонів ігор трапилося щось несподіване. Інтелектуальні агенти вивчили використовувати дві стратегії, про які дослідники навіть не знали. Шукачі-агенти вивчили, що стрибаючи на коробку і нахиляючи/катячи коробку до найближчої фортеці, вони могли стрибнути всередину фортеці і знайти ховальника. Дослідники навіть не знали, що це можливо у фізиці гри. Ховальники вивчили справлятися з цією проблемою, тягнучи коробки всередину своїх фортець.

Хоча несподівана поведінка інтелектуальних агентів, тренованих на підкріпленні, у цьому випадку безпечна, це викликає деякі потенційні побоювання щодо того, як підкріплення застосовується в інших ситуаціях. Член команди дослідників OpenAI, Боуен Бейкер, пояснив IEEE Spectrum, що ці несподівані поведінки можуть бути потенційно небезпечними. Що якщо роботизовані агенти почнуть вести себе несподіваним чином?

“Створення цих середовищ важке”, – пояснив Бейкер. “Агенти будуть винаходити ці несподівані поведінки, які стануть проблемою безпеки в майбутньому, коли їх поставлять у більш складні середовища”.

Однак Бейкер також пояснив, що стратегії підкріплення можуть привести до інноваційних рішень поточних проблем. Системи, треновані на підкріпленні, можуть вирішити широкий спектр проблем з рішеннями, які ми навіть не можемо уявити.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.