Інтерв’ю
Вахід Бехзадан, директор Secured and Assured Intelligent Learning (SAIL) Lab – Інтерв’ю Серія

Вахід – асистент професора комп’ютерних наук і науки про дані в Університеті Нью-Гейвена. Він також директор лабораторії Secured and Assured Intelligent Learning (SAIL)
Його дослідницькі інтереси включають безпеку та безпеку інтелектуальних систем, психологічне моделювання проблем безпеки штучного інтелекту, безпеку складних адаптивних систем, теорію ігор, багатокритеріальні системи та кібербезпеку.
У вас великий досвід у сфері кібербезпеки та безпеки штучного інтелекту. Чи можете ви розповісти про свій шлях та те, як ви стали цікавитися цими сферами?
Мій дослідницький шлях був підтриманий двома основними інтересами: вивченням того, як речі ламаються, та вивченням механіки людського розуму. Я активно займаюсь кібербезпекою з ранньої юності та побудував свою ранніу дослідницьку програму навколо класичних проблем цієї сфери. Через кілька років після вступу до аспірантури я натрапив на рідкісну можливість змінити сферу своїх досліджень. Тоді я тільки що познайомився з ранніми роботами Сзегеди та Гудфеллоу про атаки на зразки та виявив ідею атаки на машинне навчання дуже цікавою. Коли я глибше вивчив цю проблему, я дізнався про більш загальну сферу безпеки та безпеки штучного інтелекту та виявив, що вона охоплює багато моїх основних інтересів, таких як кібербезпека, когнітивні науки, економіка та філософія. Я також вважав, що дослідження в цій сфері не тільки цікаве, але й важливе для забезпечення довгострокових вигод та безпеки революції штучного інтелекту.
Ви директор лабораторії Secured and Assured Intelligent Learning (SAIL), яка працює над створенням основ для безпеки та безпеки інтелектуальних машин. Чи можете ви розповісти про роботу, яку виконує SAIL?
У SAIL мої студенти та я працюємо над проблемами, які лежать на перетині безпеки, штучного інтелекту та складних систем. Основна увага нашої роботи зосереджена на вивченні безпеки та безпеки інтелектуальних систем, як з теоретичної, так і з прикладної точки зору. Теоретично ми зараз вивчаємо проблему вирівнювання цінностей у багатокритеріальних середовищах та розробляємо математичні інструменти для оцінки та оптимізації цілей агентів штучного інтелекту щодо стабільності та надійності. Практично деякі з наших проєктів вивчають уразливості безпеки передових технологій штучного інтелекту, таких як автономні транспортні засоби та алгоритмічна торгівля, та мають на меті розробити методи для оцінки та поліпшення стійкості таких технологій до атак.
Ми також працюємо над застосуванням машинного навчання у сфері кібербезпеки, наприклад, автоматизованого тестування на проникнення, раннього виявлення спроб проникнення та автоматизованого збору та аналізу інформації про загрози з відкритих джерел даних, таких як соціальні мережі.
Ви недавно очолили роботу з пропозиції моделі безпеки штучного інтелекту як психопатологічних розладів. Чи можете ви розповісти про це?
Цей проєкт стосується швидко зростаючої складності агентів та систем штучного інтелекту: вже зараз дуже складно діагностувати, передбачати та контролювати небезпечну поведінку агентів навчання з підкріпленням у не тривіальних умовах просто розглядаючи їх низькорівневу конфігурацію. У цій роботі ми підкреслюємо необхідність вищого рівня абстракції при вивченні таких проблем. Під впливом наукових підходів до поведінкових проблем у людей, ми пропонуємо психопатологію як корисну вищу абстракцію для моделювання та аналізу шкідливих поведінок у штучному інтелекті та загальному штучному інтелекті. Як доказ концепції, ми вивчаємо проблему безпеки штучного інтелекту щодо хакінгу винагород у агенті навчання з підкріпленням, який навчається грати у класичну гру Змія. Ми показуємо, що якщо ми додамо “наркотик” до середовища, агент вивчає субоптимальну поведінку, яку можна описати за допомогою нейронаукових моделей залежності. Ця робота також пропонує методи контролю на основі підходів, використовуваних у психіатрії. Наприклад, ми пропонуємо використання штучно створених сигналів винагороди як аналогів медикаментозної терапії для зміни шкідливої поведінки агентів.
Чи маєте ви якісь побоювання щодо безпеки штучного інтелекту у сфері автономних транспортних засобів?
Автономні транспортні засоби стають все більш популярними прикладами застосування штучного інтелекту у кіберфізичних системах. Враховуючи фундаментальну схильність сучасних технологій машинного навчання до помилок та атак, я глибоко стурбований безпекою та безпекою навіть напівавтономних транспортних засобів. Також, галузь автономного водіння страждає від серйозної нестачі стандартів безпеки та протоколів оцінки. Однак я залишаюсь оптимістом. Подібно до природного інтелекту, штучний інтелект також буде схильний до помилок. Але мета самоходних автомобілів все ж таки може бути задоволена, якщо кількість та вплив таких помилок будуть нижчими, ніж у людських водіїв. Ми спостерігаємо зростаючі зусилля з вирішення цих проблем у промисловості та академічних колах, а також урядів.
Хакінг дорожніх знаків за допомогою наклейок або інших засобів може заплутати модуль комп’ютерного зору автономного транспортного засобу. Наскільки великою проблемою ви вважаєте це?
Ці наклейки та атаки на зразки загалом дають початок фундаментальним викликам у надійності моделей машинного навчання. Як сказав Джордж Е. П. Бокс, “всі моделі неправильні, але деякі з них корисні”. Атаки на зразки використовують цю “неправильність” моделей, яка викликана їх абстрактною природою, а також обмеженнями вибіркових даних, на яких вони тренуються. Останні зусилля в галузі машинного навчання з атаками на зразки призвели до значних кроків у підвищенні стійкості глибоких моделей навчання до таких атак. З точки зору безпеки, завжди буде спосіб обманути моделі машинного навчання. Однак практична мета захисту моделей машинного навчання полягає у підвищенні вартості реалізації таких атак до рівня економічної недоцільності.
Ваш焦окусується на безпеці та безпеці глибокого навчання та глибокого навчання з підкріпленням. Чому це так важливо?
Навчання з підкріпленням є основним методом застосування машинного навчання до задач контролю, які за своєю суттю включають маніпуляцію з їх середовищем. Тому я вважаю, що системи, які базуються на навчанні з підкріпленням, мають значно вищі ризики спричинення великої шкоди у реальному світі порівняно з іншими методами машинного навчання, такими як класифікація. Ця проблема ще більше загострюється при інтеграції глибокого навчання у навчання з підкріпленням, яке дозволяє采用 навчання з підкріпленням у висококомплексних умовах. Крім того, я вважаю, що рамки навчання з підкріпленням тісно пов’язані з основними механізмами когнітивних процесів у людському інтелекті, і вивчення їх безпеки та уразливості може привести до кращого розуміння обмежень прийняття рішень у наших мізках.
Чи вважаєте ви, що ми близько до досягнення штучного загального інтелекту (AGI)?
Це дуже складне питання для відповіді. Я вважаю, що ми зараз маємо будівельні блоки деяких архітектур, які можуть сприяти появі AGI. Однак це може зайняти кілька років або десятиліть, щоб покращити ці архітектури та підвищити ефективність їх навчання та підтримки. У найближчі роки наші агенти будуть ставати все більш інтелектуальними з швидше зростаючою швидкістю. Я не думаю, що появу AGI буде оголошено у вигляді науково обґрунтованого заголовку, а як результат поступового прогресу. Крім того, я вважаю, що у нас ще немає широко прийнятої методології для тестування та виявлення існування AGI, і це може затримати наше усвідомлення перших випадків AGI.
Як ми можемо підтримувати безпеку у системі AGI, яка здатна думати самостійно та, ймовірно, буде експоненціально більш інтелектуальною, ніж люди?
Я вважаю, що єдина теорія інтелектуальної поведінки – це економіка та вивчення того, як агенти діють та взаємодіють для досягнення своїх цілей. Рішення та дії людей визначаються їхніми цілями, інформацією та наявними ресурсами. Суспільства та спільні зусилля виникають з вигод для окремих членів таких груп. Інший приклад – це кримінальний кодекс, який стримує певні рішення, прикріплюючи високу вартість до дій, які можуть нашкодити суспільству. У тому ж самому ключі я вважаю, що контроль над стимулами та ресурсами може дозволити появу стану рівноваги між людьми та екземплярами AGI. Наразі спільнота безпеки штучного інтелекту вивчає цю тезу під егідою проблем вирівнювання цінностей.
Одна з областей, яку ви близько стежите, – це протидія тероризму. Чи маєте ви побоювання щодо того, що терористи можуть захопити системи штучного інтелекту чи AGI?
Є багато побоювання щодо неправильного використання технологій штучного інтелекту. У випадку з терористичними операціями основною проблемою є легкість, з якою терористи можуть розробити та здійснити автономні атаки. Багато моїх колег активно попереджають про ризики створення автономних зброї (див. https://autonomousweapons.org/ ). Одна з основних проблем з озброєнням штучним інтелектом полягає у складності контролю основної технології: штучний інтелект знаходиться на передньому краї відкритих досліджень, і будь-хто з доступом до інтернету та споживчої апаратури може розробити шкідливі системи штучного інтелекту. Я підозрюю, що появу автономної зброї неможливо уникнути, і вважаю, що скоро з’явиться потреба у нових технологічних рішеннях для протидії таким зброям. Це може привести до циклу “кішка-мышка”, який підживлює розвиток зброї, що використовує штучний інтелект, що може привести до серйозних екзистенційних ризиків у довгостроковій перспективі.
Що ми можемо зробити, щоб зберегти системи штучного інтелекту у безпеці від цих ворогів?
Перший і найголовніший крок – це освіта: всі інженери та практики штучного інтелекту повинні вивчити про уразливості технологій штучного інтелекту та враховувати відповідні ризики при розробці та реалізації своїх систем. Що стосується більш технічних рекомендацій, є різні пропозиції та концепції рішень, які можна застосувати. Наприклад, навчання агентів машинного навчання у середовищі атак може підвищити їх стійкість та надійність проти атак на уникнення та маніпуляцію політикою (наприклад, див. мою статтю під назвою “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Іншим рішенням є безпосереднє врахування ризику атак у архітектурі агента (наприклад, баєсівські підходи до моделювання ризику). Однак існує велика прогалина в цій сфері, і це потреба універсальних метрик та методологій для оцінки стійкості агентів штучного інтелекту проти атак. Поточні рішення в основному ад hoc і не забезпечують загальних заходів стійкості проти всіх типів атак.
Чи є щось інше, про що ви хотіли б розповісти щодо цих тем?
У 2014 році Скаллі та ін. опублікували статтю на конференції NeurIPS з дуже освітнім темою: “Машинне навчання: високопроцентна кредитна карта технічного боргу“. Навіть з урахуванням усіх досягнень галузі за останні роки, ця теза ще не втратила свою актуальність. Поточний стан штучного інтелекту та машинного навчання нічого не говорить про те, що ми ще не заповнили велику кількість основних пробілів у фундаментальній та інженерній сферах штучного інтелекту. Це факт, на мою думку, є найважливішим висновком нашої розмови. Я, звичайно, не маю на меті засмутити комерційне застосування технологій штучного інтелекту, але тільки хочу дозволити інженерному співтовариству враховувати ризики та обмеження сучасних технологій штучного інтелекту у своїх рішеннях.
Я справді насолодився вивченням проблем безпеки та безпеки різних типів систем штучного інтелекту. Це щось, про що повинні бути поінформовані окремі особи, корпорації та уряди. Читачам, які бажають дізнатися більше, рекомендуємо відвідати лабораторію Secured and Assured Intelligent Learning (SAIL).












