Моделі та платформи ШІ
Нова система штучного інтелекту DeepMind здатна вивчати правила гри під час гри

Підрозділ компанії Alphabet (GOOG ) (GOOGL ) DeepMind розробив систему штучного інтелекту, яка здатна вивчати правила гри під час гри. Хоча DeepMind раніше створила вражаючі моделі штучного інтелекту, які можуть освоїти такі ігри, як шахи, сьоґі, ґо та відеоігри, ці моделі повинні були отримувати правила гри заздалегідь. Таким чином, нова система штучного інтелекту DeepMind представляє собою суттєве покращення попередніх алгоритмів штучного інтелекту, які вивчають ігри за допомогою підкріплення.
Система штучного інтелекту – MuZero
У статті, опублікованій у журналі Nature, DeepMind описала, як працює їхня нова система штучного інтелекту. Нова система штучного інтелекту, названа MuZero, здатна вивчати правила гри під час гри завдяки принципу “пошуку вперед”. Як повідомляє Engadget, MuZero використовує пошук вперед, щоб визначити, які ходи повинні бути виконані на основі найбільш ймовірних відповідей суперників.
Розглядаючи всі можливі ходи, які можуть бути зроблені в іграх, таких як шахи, MuZero здатна пріоритизувати ходи, звужуючи їх до найбільш ймовірних і актуальних. MuZero потім вивчає як з успішними, так і з невдалими маневрами. Замість того, щоб моделювати всі можливі фактори, вона розглядає лише ті фактори, які найбільш актуальні для прийняття рішення. MuZero фактично бере безліч потенційних змінних, які можуть бути розглянуті, і концентрує їх у найбільш важливі, суттєві особливості. Ці особливості представлені у вигляді деревоподібного алгоритму пошуку. Можливості всередині дерева потім поєднуються з навченою моделлю на основі особливостей тестового середовища. Пошук вперед здійснюється після того, як найбільш актуальні аспекти середовища були визначені.
Для прийняття остаточного рішення розглядаються три фактори.
MuZero розглядає результат попереднього вибору, поточну позицію, яку вона займає, і потенційні дії, які вона може виконати далі. Цей підхід перевершує попередні підходи, які використовувалися DeepMind, включаючи базовий пошук вперед і деревоподібні моделі. MuZero довела, що вона є принаймні так само хорошою в шахах, сьоґі та ґо, як і AlphaZero, а коли вона грала в гру Ms. Pac-Man, MuZero могла розглянути лише близько шести чи семи ходів одночасно. Незважаючи на це обмеження, штучний інтелект все одно зміг показати досить хорошу гру. DeepMind також експериментувала з можливостями MuZero, обмежуючи кількість симуляцій, які вона могла виконати перед тим, як мала зробити хід. Загалом, чим більше часу програма мала на розгляд можливих ходів, тим краще вона виконувала свою роботу.
Головний науковий співробітник DeepMind, Девід Сільвер, роз’яснив через TechXplore, що MuZero є першою моделлю штучного інтелекту, яка здатна генерувати власне представлення правил середовища і використовувати це представлення для планування дій.
“Вперше у нас є система, яка здатна побудувати власне розуміння того, як працює світ, і використовувати це розуміння для такого складного планування вперед, яке раніше бачили у іграх, таких як шахи”, – сказав Сільвер. “(MuZero) може почати з нічого і, просто через спроби і помилки, відкрити правила світу і використовувати ці правила для досягнення надлюдських результатів”.
Можливі застосування
Штучний інтелект, який здатний вивчати обмеження завдання і працювати в цих обмеженнях, має широкий спектр можливих застосувань. MuZero могла бути використана для завдань, таких як стиснення відео, яке історично було важко автоматизувати за допомогою штучного інтелекту через велику кількість можливих форматів відео і режимів стиснення. MuZero змогла досягти близько 5% покращення стиснення. Це могло б мати наслідки для великої кількості відео, розміщених на Google і YouTube. Окрім відео, DeepMind також досліджує можливість використання тих самих технік MuZero для проектування архітектури білків і програмування робототехніки.
За словами Венді Голл, професора комп’ютерних наук Університету Саутгемптона, MuZero представляє собою “суттєвий крок вперед” для алгоритмів навчання з підкріпленням. Однак Голл стурбована тим, що ці алгоритми можуть бути використані неправильно. Наприклад, ВПС США вже посилалися на ранні дослідження MuZero для створення системи штучного інтелекту, яка могла б запускати ракети з розвідувальних літаків U-2. Це відбувається попри те, що дослідники DeepMind висловили свою опозицію щодо використання своїх алгоритмів для будь-якої смертоносної зброї, підписавши Літальний автономний збройовий пакт, щоб стверджувати, що будь-яка смертоносна технологія повинна залишатися під контролем людини.
Сільвер пояснив, що DeepMind дивиться вперед у майбутнє, маючи на меті розробити алгоритми, які були б такими ж потужними і універсальними, як і мозок. Перший крок до створення універсальних, гнучких алгоритмів полягає у тому, щоб зрозуміти, що означає для системи бути інтелектуальною, і інтелект пов’язаний із здатністю розрізняти закономірності і правила складного середовища.












