Моделі та платформи ШІ

Команда дослідників з MIT розробила мережу штучного інтелекту для захисту від зловмисних прикладів

mm
Додайте Unite.AI до бажаних джерел у Google

Команда дослідників з MIT розробила глибинний алгоритм навчання, призначений для того, щоб допомогти штучному інтелекту справлятися з “зловмисними” прикладами, які можуть змусити штучний інтелект робити неправильні передбачення та виконувати неправильні дії. Алгоритм, розроблений командою MIT, може допомогти системам штучного інтелекту зберегти свою точність та уникнути помилок при обробці плутаних даних.

Системи штучного інтелекту аналізують вхідні ознаки події, щоб вирішити, як реагувати на цю подію. Штучний інтелект,负责ний за маневрування автономним транспортним засобом, повинен прийняти дані з камер транспортного засобу та вирішити, що робити на основі цих даних. Однак існує можливість того, що дані зображення, які аналізуються штучним інтелектом, не є точним відображенням реального світу. Помилка в системі камер може змінити деякі пікселі, що призведе до того, що штучний інтелект зробить неправильні висновки про курс дії.

“Зловмисні входи” – це щось на кшталт оптичних ілюзій для системи штучного інтелекту. Це входи, які плутають штучний інтелект якимсь чином. Зловмисні входи можна створити з метою змусити штучний інтелект зробити помилки, представляючи дані у вигляді, який заставляє штучний інтелект вважати, що вміст прикладу є одним, а не іншим. Наприклад, можна створити зловмисний приклад для системи комп’ютерного зору, зробивши незначні зміни в зображеннях котів, що змусить штучний інтелект неправильно класифікувати зображення як комп’ютерні монітори. Команда дослідників з MIT розробила алгоритм, який допомагає захистити від зловмисних прикладів, дозволяючи моделі зберегти певний рівень “скептицизму” щодо вхідних даних.

Дослідники з MIT назвали свій підхід “Сертифікована зловмисна стійкість для глибинного навчання з підкріпленням”, або CARRL. CARRL складається з мережі навчання з підкріпленням та традиційної глибинної нейронної мережі, об’єднаних разом. Навчання з підкріпленням використовує концепцію “нагород” для навчання моделі, надаючи моделі пропорційно більше нагороди, чим ближче вона підходить до мети. Модель навчання з підкріпленням використовується для навчання глибинної мережі Q-Netowrkk, або DQN. DQN функціонує як традиційна нейронна мережа, але також асоціює вхідні значення з рівнем нагороди, подібно до систем навчання з підкріпленням.

CARRL працює шляхом моделювання діапазону різних можливих значень для вхідних даних.

Припустимо, що штучний інтелект намагається відстежувати положення точки всередині великого зображення, штучний інтелект вважає, що положення точки може бути результатом зловмисного впливу, та розглядає області, де точка могла б бути замість цього. Мережа потім приймає рішення на основі найгіршого сценарію для положення точки, зупиняючись на дії, яка б принесла найбільшу нагороду в цьому найгіршому сценарії.

Типовий метод захисту від зловмисних прикладів полягає в тому, що трохи змінені версії вхідного зображення проходять через мережу штучного інтелекту, щоб побачити, чи завжди приймається одне й те саме рішення. Якщо зміни в зображенні не суттєво впливають на результат, існує велика ймовірність того, що мережа стійка до зловмисних прикладів. Однак це не є життєздатною стратегією для сценаріїв, в яких потрібно приймати швидкі рішення, оскільки ці методи є часу та обчислювально дорогими. Через це команда з MIT вирішила створити нейронну мережу, яка могла б приймати рішення на основі найгірших припущень, здатну працювати в сценаріях, в яких безпека є критичною.

Дослідники з MIT протестували свій алгоритм, змусивши штучний інтелект грати в гру Pong. Вони включили зловмисні приклади, надавши штучному інтелекту приклади, в яких м’яч був відображений трохи нижче на екрані, ніж він був насправді. При зростанні впливу зловмисних прикладів стандартні корективні техніки почали відмовляти, тоді як CARRL був能够 виграти більше ігор порівняно. CARRL також був протестований на задачі уникнення зіткнень. Задача розгорталася в віртуальному середовищі, де два різних агенти намагалися помінятися місцями без зіткнення один з одним. Команда дослідників змінила сприйняття першого агента щодо другого агента, та CARRL був能够 успішно керувати першим агентом навколо іншого агента, навіть у умовах високої невизначеності, хоча прийшов момент, коли CARRL став надто обережним та уникнув свого місця призначення зовсім.

Незважаючи на це, постдокторант кафедри аеронавтики та астронавтики MIT Майкл Еверетт, який очолював дослідження, пояснив, що дослідження можуть мати наслідки для здатності роботів справлятися з непередбачуваними ситуаціями. Як пояснив Еверетт через MIT News:

“Люди можуть бути зловмисними, як наприклад, встати перед роботом, щоб заблокувати його сенсори, або взаємодіяти з ними, не обов’язково з найкращими намірами”, – говорить Еверетт. “Як може робот подумати про всі речі, які люди можуть спробувати зробити, та спробувати уникнути їх? Який тип зловмисних моделей ми хочемо захистити? Це щось, про що ми думаємо, як зробити.”

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.