Интервью
Вахид Бехзадан, директор лаборатории SAIL – Интервью

Вахид – ассистент профессора компьютерных наук и науки о данных в Университете Нью-Хейвена. Он также является директором лаборатории Secure and Assured Intelligent Learning (SAIL) Lab
Его исследовательские интересы включают безопасность и безопасность интеллектуальных систем, психологическое моделирование проблем безопасности ИИ, безопасность сложных адаптивных систем, теорию игр, многоагентные системы и кибербезопасность.
У вас обширный опыт в области кибербезопасности и безопасности ИИ. Расскажите о своем пути и о том, как вы стали привлечены к этим областям?
Моя исследовательская траектория была обусловлена двумя основными интересами: выяснить, как вещи ломаются, и узнать о механизмах человеческого разума. Я активно занимаюсь кибербезопасностью с раннего подросткового возраста и, следовательно, построил свою раннюю исследовательскую программу вокруг классических проблем этой области. Через несколько лет после поступления в аспирантуру я наткнулся на редкую возможность изменить направление своих исследований. В то время я только что познакомился с ранними работами Сзегеди и Гудфеллоу об атаках на примеры и нашел идею атаки на машинное обучение очень интересной. Когда я глубже изучил эту проблему, я узнал о более общем поле безопасности и безопасности ИИ и обнаружил, что оно охватывает многие из моих основных интересов, таких как кибербезопасность, когнитивные науки, экономика и философия. Я также пришел к выводу, что исследования в этой области не только fasciniruyuschie, но и жизненно важны для обеспечения долгосрочных выгод и безопасности революции ИИ.
Вы являетесь директором лаборатории SAIL, которая работает над созданием прочных основ для безопасности и безопасности интеллектуальных машин. Расскажите о деталях работы лаборатории.
В SAIL мои студенты и я работаем над проблемами, которые лежат на пересечении безопасности, ИИ и сложных систем. Основной фокус наших исследований – изучение безопасности и безопасности интеллектуальных систем, как с теоретической, так и с прикладной точки зрения. С теоретической стороны мы в настоящее время исследуем проблему согласования ценностей в многоагентных средах и разрабатываем математические инструменты для оценки и оптимизации целей агентов ИИ с точки зрения стабильности и прочных согласований. С практической стороны некоторые из наших проектов исследуют уязвимости безопасности передовых технологий ИИ, таких как автономные транспортные средства и алгоритмическая торговля, и направлены на разработку методов для оценки и повышения устойчивости таких технологий к атакам.
Мы также работаем над применением машинного обучения в кибербезопасности, такой как автоматизированное тестирование на проникновение, раннее обнаружение попыток вторжения и автоматизированная сборка и анализ угроз из открытых источников данных, таких как социальные сети.
Вы недавно возглавили усилия по предложению моделирования проблем безопасности ИИ как психопатологических расстройств. Расскажите об этом.
Этот проект решает проблему быстро растущей сложности агентов и систем ИИ: уже очень сложно диагностировать, предсказать и контролировать небезопасное поведение агентов обучения с подкреплением в не тривиальных условиях, просто глядя на их низкоуровневые конфигурации. В этой работе мы подчеркиваем необходимость более высокого уровня абстракции при изучении таких проблем. Вдохновленные научными подходами к поведенческим проблемам у людей, мы предлагаем психопатологию как полезную высокоуровневую абстракцию для моделирования и анализа возникающих вредных поведений в ИИ и СИ. Как доказательство концепции, мы изучаем проблему безопасности ИИ – взлома вознаграждения в агенте ИИ, обучающемся играть в классическую игру Змея. Мы показываем, что если мы добавим “семя” в окружающую среду, агент учится субоптимальному поведению, которое можно описать с помощью нейронаучных моделей зависимости. Эта работа также предлагает методы контроля на основе подходов, используемых в психиатрии. Например, мы предлагаем использование искусственно сгенерированных сигналов вознаграждения как аналогов медикаментозной терапии для модификации вредного поведения агентов.
У вас есть какие-либо опасения по поводу безопасности ИИ при использовании автономных транспортных средств?
Автономные транспортные средства становятся заметными примерами развертывания ИИ в киберфизических системах. Учитывая фундаментальную уязвимость текущих технологий машинного обучения к ошибкам и атакам, я глубоко обеспокоен безопасностью и безопасностью даже полуавтономных транспортных средств. Кроме того, область автономного вождения страдает от серьезного отсутствия стандартов безопасности и протоколов оценки. Однако я остаюсь оптимистом. Как и естественный интеллект, ИИ также будет склонен к ошибкам. Тем не менее, цель самоходных автомобилей может быть выполнена, если частота и влияние таких ошибок будут ниже, чем у человеческих водителей. Мы наблюдаем растущие усилия по решению этих проблем в промышленности и академии, а также в правительствах.
Взлом дорожных знаков с помощью наклеек или других средств может запутать модуль компьютерного зрения автономного транспортного средства. Насколько велика эта проблема?
Эти наклейки, и примеры, противостоящие атакам в целом, создают фундаментальные проблемы с точки зрения прочности моделей машинного обучения. Чтобы процитировать Джорджа Э. П. Бокса, “все модели неверны, но некоторые из них полезны”. Примеры, противостоящие атакам, используют эту “неправильность” моделей, которая обусловлена их абстрактной природой, а также ограничениями выборочных данных, на которых они обучаются. Недавние усилия в области машинного обучения с противостоящими атаками привели к значительным успехам в повышении устойчивости глубоких моделей обучения к таким атакам. С точки зрения безопасности основной целью является повышение стоимости реализации таких атак до точки экономической нецелесообразности.
Ваш фокус – на функциях безопасности и безопасности глубокого обучения и глубокого обучения с подкреплением. Почему это так важно?
Обучение с подкреплением – это основной метод применения машинного обучения к задачам управления, которые по определению предполагают манипулирование окружающей средой. Поэтому я считаю, что системы, основанные на обучении с подкреплением, имеют значительно более высокие риски причинения значительных повреждений в реальном мире по сравнению с другими методами машинного обучения, такими как классификация. Эта проблема еще больше усугубляется с помощью интеграции глубокого обучения в обучение с подкреплением, что позволяет采用 обучения с подкреплением в высоко сложных условиях. Кроме того, я считаю, что основа обучения с подкреплением тесно связана с основными механизмами когнитивных процессов в человеческом интеллекте, и изучение его безопасности и уязвимостей может привести к лучшему пониманию пределов принятия решений в нашем уме.
Считаете ли вы, что мы близки к достижению искусственного общего интеллекта (ИОИ)?
Это очень трудный вопрос, на который можно ответить. Я считаю, что у нас в настоящее время есть строительные блоки некоторых архитектур, которые могут способствовать возникновению ИОИ. Однако может потребоваться несколько лет или десятилетий, чтобы улучшить эти архитектуры и повысить эффективность их обучения и поддержки. В ближайшие годы наши агенты будут становиться все более интеллектуальными с быстро растущей скоростью. Я не думаю, что возникновение ИОИ будет объявлено в форме научно обоснованного заголовка, а скорее в результате постепенного прогресса. Кроме того, я считаю, что у нас еще нет широко принятой методологии для тестирования и обнаружения существования ИОИ, и это может задержать наше осознание первых экземпляров ИОИ.
Как мы можем поддерживать безопасность в системе ИОИ, способной самостоятельно мыслить и, скорее всего, намного более интеллектуальной, чем люди?
Я считаю, что единая теория интеллектуального поведения – это экономика и изучение того, как агенты действуют и взаимодействуют, чтобы достичь того, чего они хотят. Решения и действия людей определяются их целями, информацией и доступными ресурсами. Общества и совместные усилия возникают из выгод для отдельных членов таких групп. Другой пример – уголовный кодекс, который сдерживает определенные решения, прикрепляя высокую стоимость к действиям, которые могут нанести вред обществу. Аналогично, я считаю, что контроль над стимулами и ресурсами может позволить возникновение состояния равновесия между людьми и экземплярами ИОИ. В настоящее время сообщество безопасности ИИ исследует эту тезу под эгидой проблем согласования ценностей.
Одна из областей, которую вы внимательно следите, – это контртерроризм. У вас есть опасения по поводу того, что террористы могут захватить системы ИИ или ИОИ?
Существует много опасений по поводу злоупотребления технологиями ИИ. В случае террористических операций основной проблемой является легкость, с которой террористы могут разработать и осуществить автономные атаки. Растущее число моих коллег активно предупреждает о рисках разработки автономных военных систем (см. https://autonomousweapons.org/ ). Одна из основных проблем с ИИ-вооружением заключается в трудности контроля надlying технологией: ИИ находится на переднем крае открытых исследований, и любой, кто имеет доступ к интернету и потребительскому оборудованию, может разработать вредоносные системы ИИ. Я подозреваю, что возникновение автономных военных систем неизбежно, и считаю, что скоро возникнет необходимость в новых технологических решениях для противодействия таким системам. Это может привести к циклу “кошки и мышки”, который будет стимулировать эволюцию ИИ-вооружения, что может привести к серьезным экзистенциальным рискам в долгосрочной перспективе.
Что мы можем сделать, чтобы защитить системы ИИ от этих враждебных агентов?
Первым и основным шагом является образование: все инженеры и практики ИИ должны узнать о уязвимостях технологий ИИ и учитывать соответствующие риски при проектировании и реализации своих систем. Что касается более технических рекомендаций, существует ряд предложений и концепций решений, которые можно использовать. Например, обучение агентов машинного обучения в враждебных условиях может повысить их устойчивость и прочность против атак на избежание и манипулирование политикой (например, см. мою статью под названием “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Другим решением является прямое учет риска враждебных атак в архитектуре агента (например, байесовские подходы к моделированию риска). Однако существует значущая лакуна в этой области, и это необходимость в универсальных метриках и методологиях для оценки прочности агентов ИИ против враждебных атак. Текущие решения в основном ад hoc и не обеспечивают общих мер устойчивости против всех типов атак.
Есть ли что-то еще, что вы хотели бы поделиться по любой из этих тем?
В 2014 году Скалли и др. опубликовали статью на конференции NeurIPS с очень просвещающей темой: “Машинное обучение: высокопроцентная кредитная карта технического долга“. Даже с учетом всех достижений в этой области за последние годы это утверждение еще не потеряло свою актуальность. Текущее состояние ИИ и машинного обучения не является чем-то удивительным, но мы еще не заполнили значительное количество основных пробелов как в фундаментальной, так и в инженерной составляющих ИИ. Этот факт, на мой взгляд, является наиболее важным выводом из нашего разговора. Я, конечно, не хочу отговаривать от коммерческого внедрения технологий ИИ, но только хочу позволить инженерному сообществу учитывать риски и ограничения текущих технологий ИИ при принятии решений.
Мне действительно понравилось узнать о проблемах безопасности и безопасности различных типов систем ИИ. Это действительно то, о чем должны знать отдельные лица, корпорации и правительства. Читателям, которые хотят узнать больше, рекомендуется посетить лабораторию SAIL.












