Моделі та платформи ШІ

Техніка дозволяє штучному інтелекту думати далеко в майбутнє

mm
Додайте Unite.AI до бажаних джерел у Google

Команда дослідників з Массачусетського технологічного інституту, лабораторії Массачусетського технологічного інституту та IBM Watson AI, а також інших установ розробила новий підхід, який дозволяє штучним інтелектом (ШІ) досягти далекої перспективи. Інакше кажучи, ШІ може думати далеко в майбутнє, коли розглядає, як їх поведінка може включати поведінку інших агентів ШІ при виконанні завдання.

Дослідження дослідження має бути представлено на Конференції з обробки нейронної інформації.

ШІ, що розглядає майбутні дії інших агентів

Створена командою машинно-навчальна структура дозволяє кооперативним або конкуруючим агентам ШІ розглядіть, що інші агенти будуть робити. Це не тільки над наступними кроками, а й тим, як час наближається до нескінченності. Агенти адаптують свою поведінку відповідно, щоб впливати на майбутню поведінку інших агентів, що допомагає їм досягти оптимальних довгострокових рішень.

За словами команди, ця структура могла б бути використана, наприклад, групою автономних безпілотників, які працюють разом, щоб знайти загубленого туриста. Вона також могла б бути використана самоходними транспортними засобами, щоб передбачити майбутні рухи інших транспортних засобів для поліпшення безпеки пасажирів.

Донг-Кі Кім – аспірант лабораторії інформаційних та рішень системи Массачусетського технологічного інституту (LIDS) та головний автор дослідження.

“Коли агенти ШІ співпрацюють або конкурують, найважливіше те, коли їх поведінка збігається в якійсь точці майбутнього”, – говорить Кім. “Є багато транзитних поведінок по дорозі, які не мають великого значення в довгій перспективі. Досягнення цієї збіжної поведінки – це те, про що нам справді потрібно, і тепер у нас є математичний спосіб зробити це можливим.”

Проблема, яку дослідники вирішили, називається багатоцільовим навчання з підкріпленням, а навчання з підкріпленням – це форма машинного навчання, при якій агенти ШІ вчаться методом проб і помилок.

Коли є кілька кооперативних або конкуруючих агентів, які одночасно вчаться, процес може стати значно складнішим. Коли агенти розглядають майбутні кроки інших агентів, а також свою власну поведінку та її вплив на інших, проблема вимагає надто багато обчислювальної потужності.

ШІ, що думає про нескінченність

“ШІ справді хочуть думати про кінець гри, але вони не знають, коли гра закінчиться”, – говорить Кім. “Вони повинні думати про те, як продовжувати адаптувати свою поведінку до нескінченності, щоб виграти в якійсь далекій точці майбутнього. Наше дослідження пропонує нову мету, яка дозволяє ШІ думати про нескінченність.”

Неможливо інтегрувати нескінченність в алгоритм, тому команда спроєктувала систему так, щоб агенти зосередилися на майбутній точці, де їх поведінка збіжиться з поведінкою інших агентів. Це називається рівновагою, а точка рівноваги визначає довгострокову продуктивність агентів.

Можливо, що в багатоцільовій ситуації існує кілька рівноваг, і коли ефективний агент активно впливає на майбутню поведінку інших агентів, вони можуть досягти бажаної рівноваги з точки зору агента. Коли всі агенти впливають один на одного, вони сходяться до загальної концепції, яку називають “активною рівновагою”.

Фреймворк FURTHER

Машинно-навчальна структура команди називається FURTHER, і вона дозволяє агентам вивчити, як коригувати свою поведінку на основі взаємодії з іншими агентами для досягнення активної рівноваги.

Фреймворк спирається на два модулі машинного навчання. Перший – це модуль висновку, який дозволяє агенту здогадуватися про майбутню поведінку інших агентів та алгоритми навчання, які вони використовують, на основі попередніх дій. Потім ця інформація подається в модуль навчання з підкріпленням, на який агент спирається для адаптації своєї поведінки та впливу на інших агентів.

“Виклик полягав у тому, щоб думати про нескінченність. Нам довелося використовувати багато різних математичних інструментів, щоб зробити це можливим, і зробити деякі припущення, щоб зробити це працюючим на практиці”, – говорить Кім.

Команда протестувала свій метод проти інших багатоцільових фреймворків навчання з підкріпленням у різних сценаріях, де агенти ШІ, які використовували FURTHER, вийшли вперед.

Підхід є децентралізованим, тому агенти вчаться вигравати самостійно. Крім того, він краще спроєктований для масштабування порівняно з іншими методами, які вимагають центрального комп’ютера для контролю агентів.

За словами команди, FURTHER могла б бути використана у широкому діапазоні багатоцільових проблем. Кім особливо сподівається на її застосування в економіці, де вона могла б бути застосована для розробки ефективної політики в ситуаціях, що涉ють багато взаємодіючих сутностей з поведінкою та інтересами, які змінюються з часом.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.