Взгляд Anderson

Почему атака на изображения не является шуткой

mm
Добавьте Unite.AI в избранные источники в Google

Атака на системы распознавания изображений с помощью тщательно созданных изображений-ловушек считалась забавной, но тривиальной демонстрацией концепции в течение последних пяти лет. Однако новые исследования из Австралии предполагают, что беззаботное использование очень популярных наборов изображений для коммерческих проектов ИИ может создать новую долгосрочную проблему безопасности.

 

В течение последних двух лет группа ученых из Университета Аделаиды пытается объяснить что-то очень важное о будущем систем распознавания изображений на основе ИИ.

Это что-то, что было бы трудно (и очень дорого) исправить сейчас, и что было бы непомерно дорого исправить, когда текущие тенденции в исследованиях распознавания изображений будут полностью разработаны в коммерческие и индустриализированные развертывания в течение 5-10 лет.

Прежде чем мы углубимся в это, давайте посмотрим на цветок, классифицированный как президент Барак Обама, из одного из шести видеороликов, которые команда опубликовала на странице проекта:

Источник: https://www.youtube.com/watch?v=Klepca1Ny3c

Источник: https://www.youtube.com/watch?v=Klepca1Ny3c

На изображении выше система распознавания лиц, которая явно знает, как распознавать Барака Обаму, обманывается с 80% уверенностью, что анонимный человек, держащий созданное, напечатанное изображение-ловушку цветка, также является Бараком Обамой. Система даже не заботится о том, что “ложное лицо” находится на груди субъекта, а не на его плечах.

Хотя впечатляет, что исследователи смогли добиться такого рода захвата идентификации, генерируя связное изображение (цветок) вместо просто случайного шума, кажется, что такие глупые эксплойты появляются довольно регулярно в исследованиях безопасности компьютерного зрения. Например, те странные очки, которые смогли обмануть распознавание лиц в 2016 году, или специально созданные изображения-ловушки, которые пытаются переписать дорожные знаки.

Если вы заинтересованы, модель свёрточной нейронной сети (CNN), которая атакуется в примере выше, является VGGFace (VGG-16), обученной на наборе данных PubFig Колумбийского университета. Другие образцы атак, разработанные исследователями, использовали разные ресурсы в различных комбинациях.

Клавиатура переклассифицируется как раковина, в модели WideResNet50 на ImageNet. Исследователи также обеспечили, чтобы модель не имела предвзятости к раковинам. Посмотрите полное видео для расширенных и дополнительных демонстраций на https://www.youtube.com/watch?v=dhTTjjrxIcU

Клавиатура переклассифицируется как раковина, в модели WideResNet50 на ImageNet. Исследователи также обеспечили, чтобы модель не имела предвзятости к раковинам. Посмотрите полное видео для расширенных и дополнительных демонстраций на https://www.youtube.com/watch?v=dhTTjjrxIcU

Распознавание изображений как новый вектор атаки

Многие впечатляющие атаки, которые исследователи описывают и иллюстрируют, не являются критикой отдельных наборов данных или конкретных архитектур машинного обучения, которые используют их. Ни то, ни другое не может быть легко защищено путем переключения наборов данных или моделей, повторной тренировки моделей или любых других “простых” средств, которые заставляют практиков машинного обучения относиться к таким демонстрациям как к пустяку.

Скорее, эксплойты команды Аделаиды демонстрируют центральную слабость всей текущей архитектуры разработки ИИ для распознавания изображений; слабость, которая может быть готова подвергнуть многие будущие системы распознавания изображений легкой манипуляции атакующими и поставить любые последующие оборонительные меры на задний план.

Представьте себе последние изображения-ловушки (например, цветок выше) как “zero-day exploits”, добавленные в системы безопасности будущего, как и текущие противовирусные и антивирусные системы обновляют свои определения вирусов каждый день.

Потенциал новых атак на изображения-ловушки будет бесконечным, поскольку основная архитектура системы не предусматривала проблемы, которые могут возникнуть в будущем, как это произошло с интернетом, миллениум-багом и наклонной башней Пизы.

В каком смысле, тогда, мы создаем сцену для этого?

Получение данных для атаки

Изображения-ловушки, такие как пример “цветка” выше, генерируются путем доступа к наборам данных, которые обучали компьютерные модели. Вам не нужно “привилегированный” доступ к данным или архитектурам моделей, поскольку наиболее популярные наборы данных (и многие обученные модели) широко доступны в сильной и постоянно обновляемой сцене торрентов.

Например, знаменитый гигант компьютерного зрения, ImageNet, доступен для скачивания через торрент во всех своих многочисленных итерациях, обходя обычные ограничения, и делая доступными важные второстепенные элементы, такие как наборы валидации.

Источник: https://academictorrents.com

Источник: https://academictorrents.com

Если у вас есть данные, вы можете (как отмечают исследователи Аделаиды) эффективно “обратить инженерию” любой популярный набор данных, такой как CityScapes, или CIFAR.

В случае PubFig, набора данных, который позволил создать “цветок Обамы” в предыдущем примере, Колумбийский университет решил проблему растущей тенденции проблем с авторскими правами вокруг перераспределения наборов изображений, дав researchers указание о том, как воспроизвести набор данных через отобранные ссылки, а не сделать компиляцию напрямую доступной, отметив ‘Это кажется способом, которым другие большие веб-ориентированные базы данных эволюционируют’.

В большинстве случаев это не необходимо: Kaggle оценивает, что десять наиболее популярных наборов изображений в компьютерном зрении являются: CIFAR-10 и CIFAR-100 (оба непосредственно загружаемые); CALTECH-101 и 256 (оба доступны и в настоящее время доступны как торренты); MNIST (официально доступен, также на торрентах); ImageNet (см. выше); Pascal VOC (доступен, также на торрентах); MS COCO (доступен, и на торрентах); Sports-1M (доступен); и YouTube-8M (доступен).

Эта доступность также представительна для более широкого диапазона доступных наборов данных компьютерного зрения, поскольку неясность является смертью в культуре открытого развития “опубликуй или умри”.

В любом случае, нехватка управляемых новых наборов данных, высокая стоимость разработки наборов изображений, зависимость от “старых любимцев” и тенденция просто адаптировать старые наборы данных все усугубляют проблему, изложенную в новой статье Аделаиды.

Типичные критические замечания по методам атак на изображения-ловушки

Наиболее частым и постоянным критическим замечанием машинных обучающих инженеров против эффективности последней методики атаки на изображения-ловушки является то, что атака специфична для конкретного набора данных, конкретной модели или обоих; что она не “общая” для других систем; и, следовательно, представляет только тривиальную угрозу.

Вторым наиболее частым критическим замечанием является то, что атака на изображения-ловушки ‘белая коробка’, то есть вам нужен прямой доступ к среде обучения или данным. Это действительно маловероятный сценарий в большинстве случаев – например, если вы хотите использовать процесс обучения для систем распознавания лиц лондонской полиции, вам придется взломать NEC, либо с помощью консоли, либо с помощью топора.

Долгосрочная “ДНК” популярных наборов данных компьютерного зрения

Что касается первого критического замечания, мы должны учитывать не только то, что горстка наборов данных компьютерного зрения доминирует в отрасли по секторам год за годом (т.е. ImageNet для нескольких типов объектов, CityScapes для сцен вождения и FFHQ для распознавания лиц); но также то, что, как простые аннотированные данные изображений, они “платформо-агностичны” и высоко передаваемы.

В зависимости от его возможностей, любая архитектура компьютерного зрения найдет некоторые особенности объектов и классов в наборе данных ImageNet. Некоторые архитектуры могут найти больше особенностей, чем другие, или сделать более полезные связи, чем другие, но все должны найти хотя бы самые высокие особенности:

Данные ImageNet с минимально жизнеспособным количеством правильных идентификаций – 'высокие' особенности.

Данные ImageNet с минимально жизнеспособным количеством правильных идентификаций – ‘высокие’ особенности.

Это “высокие” особенности отличают и “отпечатывают” набор данных и являются надежными “крючками” для долгосрочной методики атаки на изображения-ловушки, которая может охватывать разные системы и расти вместе с “старым” набором данных, когда последний продолжает использоваться в новых исследованиях и продуктах.

Более сложная архитектура произведет более точные и детальные идентификации, особенности и классы:

Однако, чем больше атака на изображения-ловушки полагается на эти нижние особенности (т.е. “Молодой кавказский мужчина” вместо “Лицо”), тем менее эффективной она будет в переходе или в более поздних архитектурах, которые используют различные версии исходного набора данных – такие как подмножество или отфильтрованный набор, где многие исходных изображений из полного набора данных не присутствуют:

Атаки на “обнуленные” предварительно обученные модели

Что касается случаев, когда вы просто скачиваете предварительно обученную модель, которая была первоначально обучена на очень популярном наборе данных, и даете ей совершенно новые данные?

Модель уже была обучена на (например) ImageNet, и все, что осталось, это веса, которые могли занять недели или месяцы для обучения, и теперь готовы помочь вам идентифицировать подобные объекты тем, которые существовали в исходных (теперь отсутствующих) данных.

С удалением исходных данных из архитектуры обучения, остается 'предрасположенность' модели классифицировать объекты так, как она изначально научилась, что по сути заставит многие исходные 'подписи' реформироваться и стать уязвимыми снова для тех же старых методов атаки на изображения-ловушки.

С удалением исходных данных из архитектуры обучения, остается ‘предрасположенность’ модели классифицировать объекты так, как она изначально научилась, что по сути заставит многие исходные ‘подписи’ реформироваться и стать уязвимыми снова для тех же старых методов атаки на изображения-ловушки.

Эти веса ценны. Без данных или весов у вас по сути есть пустая архитектура без данных. Вам придется обучить ее с нуля, с большими затратами времени и вычислительных ресурсов, как и оригинальные авторы (вероятно, на более мощном оборудовании и с более высоким бюджетом, чем у вас).

Проблема заключается в том, что веса уже довольно хорошо сформированы и устойчивы. Хотя они будут адаптироваться немного во время обучения, они будут вести себя подобно тому, как они вели себя на исходных данных, производя особенности, которые система атаки на изображения-ловушки может использовать.

В долгосрочной перспективе это также сохраняет “ДНК” наборов данных компьютерного зрения, которые двенадцать или более лет, и могут пройти через заметную эволюцию от открытых источников через коммерциализированные развертывания – даже когда исходные данные были полностью удалены в начале проекта. Некоторые из этих коммерческих развертываний могут не произойти в течение многих лет.

Нет необходимости в белой коробке

Что касается второго распространенного критического замечания по системам атаки на изображения-ловушки, авторы новой статьи обнаружили, что их способность обмануть системы распознавания с помощью созданных изображений-ловушек высоко передаваема на несколько архитектур.

Хотя они отмечают, что их метод “Universal NaTuralistic adversarial paTches” (TnT) является первым, который использует узнаваемые изображения (а не случайный шум) для обмана систем распознавания изображений, авторы также заявляют:

‘[TnTs] эффективны против нескольких современных классификаторов, начиная от широко используемого WideResNet50 в задаче крупномасштабного визуального распознавания набора данных ImageNet и заканчивая моделями VGG-face в задаче распознавания лиц набора данных PubFig как в целевых, так и в нецелевых атаках.

‘TnTs могут обладать: i) естественностью, достижимой [с помощью] триггеров, используемых в методах атак на троянских конях; и ii) обобщаемостью и передаваемостью примеров атаки на другие сети.

‘Это вызывает проблемы с безопасностью и безопасностью уже развернутых ДНН, а также будущих развертываний ДНН, где атакующие могут использовать незаметные естественные объекты-ловушки, чтобы ввести в заблуждение системы нейронных сетей без изменения модели и риска обнаружения.’

Авторы предлагают, что традиционные меры противодействия, такие как снижение точности классификации сети, могут теоретически обеспечить некоторую защиту от методов TnT, но что ‘TnTs все равно могут успешно обойти эту защиту с большинством систем, защищающих от атак, достигающих 0% устойчивости’.

Возможными другими решениями являются федеративное обучение, где происхождение вкладываемых изображений защищено, и новые подходы, которые могли бы напрямую “зашифровать” данные во время обучения, такие как один недавно предложенный Нанкинским университетом аэронавтики и астронавтики.

Даже в этих случаях было бы важно обучать на действительно новых изображениях – сейчас изображения и связанные с ними аннотации в небольшой группе наиболее популярных наборов данных компьютерного зрения так глубоко укоренились в циклах разработки по всему миру, что они больше похожи на программное обеспечение, чем на данные; программное обеспечение, которое часто не было заметно обновлено за годы.

Заключение

Атаки на изображения-ловушки становятся возможными не только благодаря практикам открытого машинного обучения, но и благодаря корпоративной культуре разработки ИИ, которая мотивируется к повторному использованию хорошо известных наборов данных компьютерного зрения по нескольким причинам: они уже доказали свою эффективность; они намного дешевле, чем “начало с нуля”; и они поддерживаются и обновляются передовыми умами и организациями в академии и отрасли, на уровнях финансирования и персонала, которые были бы трудны для повторения одной компанией.

Кроме того, во многих случаях, когда данные не являются оригинальными (в отличие от CityScapes), изображения были собраны до недавних скандалов вокруг конфиденциальности и практики сбора данных, оставив эти старые наборы данных в некотором роде полуправовом лимбе, который может показаться компании “безопасной гаванью”.

 

TnT Attacks! Universal Naturalistic Adversarial Patches Against Deep Neural Network Systems написана Бао Гиа Доаном, Минхуи Сюэ, Эхсаном Аббаснежадом, Дамитом Ранасингхе из Университета Аделаиды, вместе с Шикингом Ма из Департамента компьютерных наук в Университете Рутгерса.

 

 

Обновлено 1 декабря 2021 года, 7:06 утра GMT+2 – исправлена опечатка.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai