Взгляд Anderson

Объяснимый ИИ может сдавать конфиденциальные данные более легко

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Национального университета Сингапура пришли к выводу, что чем более объяснимым становится ИИ, тем легче становится обходить важные функции конфиденциальности в системах машинного обучения. Они также обнаружили, что даже когда модель не объяснима, возможно использовать объяснения подобных моделей для “расшифровки” конфиденциальных данных в не объяснимой модели.

Исследование, озаглавленное Использование объяснений для атак на модели, подчеркивает риски использования “случайной” непрозрачности работы нейронных сетей как если бы это была встроенная функция безопасности – не в последнюю очередь потому, что новая волна глобальных инициатив, включая проект европейских правил ИИ, характеризует объяснимый ИИ (XAI) как предварительное условие для нормализации машинного обучения в обществе.

В исследовании фактическая личность успешно восстановлена из якобы анонимных данных, связанных с выражениями лица, посредством использования нескольких объяснений системы машинного обучения. Источник: https://arxiv.org/pdf/2108.10800.pdf

В исследовании фактическая личность успешно восстановлена из якобы анонимных данных, связанных с выражениями лица, посредством использования нескольких объяснений системы машинного обучения. Источник: https://arxiv.org/pdf/2108.10800.pdf

Исследователи комментируют:

‘Объяснимый искусственный интеллект (XAI) предоставляет больше информации, чтобы помочь пользователям понять решения модели, но эта дополнительная информация создает дополнительные риски для атак на конфиденциальность. Следовательно, предоставление объяснений наносит вред конфиденциальности.’

Переопределение частных данных

Участники наборов данных машинного обучения могут согласиться быть включенными в набор данных, предполагая анонимность; в случае с личной идентифицируемой информацией (PII), которая попадает в системы ИИ через случайную сбор данных (например, через социальные сети), участие может быть технически законным, но напрягает понятие “согласия”.

Несколько методов были разработаны в последние годы, которые оказались способными деанонимизировать PII из, казалось бы, непрозрачных потоков данных машинного обучения. Извлечение модели использует доступ к API (т.е. “черный ящик” доступ, без специального доступа к исходному коду или данным), чтобы извлечь PII даже из крупномасштабных поставщиков MLaaS, включая Amazon Web Services, в то время как атаки на определение членства (MIAs), действующие под подобными ограничениями, потенциально могут получить конфиденциальную медицинскую информацию; кроме того, атаки на определение атрибутов (AIAs) могут восстановить конфиденциальные данные из выходных данных API.

Раскрытие лиц

Для новой статьи исследователи сосредоточились на атаке на модель, предназначенной для получения идентификации из подмножества данных о выражениях лица, которые не должны быть способны раскрыть эту информацию.

Целью системы было связать изображения, найденные в Интернете (либо опубликованные случайно, либо в потенциальной утечке данных), с их включением в наборы данных, лежащие в основе алгоритма машинного обучения.

Исследователи обучили модель атаки, способную восстановить исходное изображение из анонимного выходного данных API, без специального доступа к исходной архитектуре. Предыдущая работа в этой области была сосредоточена на системах, где идентификация (защита или раскрытие) была целью как целевой системы, так и атакующей системы; в этом случае框架 был разработан для использования выходных данных одной области и применения его к другой области.

Была использована транспонированная сверточная нейронная сеть (CNN) для предсказания “исходного” источника лица на основе вектора прогнозирования целевой задачи (карта салиентности) для системы распознавания эмоций, используя архитектуру U-Net для улучшения производительности восстановления лица.

Система переопределения работает и информируется объяснимым ИИ (XAI), где знание активации нейронов, среди многих других публичных аспектов XAI, используется для восстановления внутренних механизмов архитектуры только из ее выходных данных, что позволяет переопределить изображения набора данных.

Система переопределения работает и информируется объяснимым ИИ (XAI), где знание активации нейронов, среди многих других публичных аспектов XAI, используется для восстановления внутренних механизмов архитектуры только из ее выходных данных, что позволяет переопределить изображения набора данных.

Тестирование

При тестировании системы исследователи применили ее к трем наборам данных: iCV-MEFED выражения лица; CelebA; и MNIST рукописные цифры. Чтобы приспособиться к размеру модели, используемой исследователями, три набора данных были изменены до 128×128, 265×256 и 32×32 пикселей. 50% каждого набора было использовано в качестве обучающих данных, а другая половина использовалась в качестве набора данных для атаки для обучения моделей-антагонистов.

Каждый набор данных имел разные целевые модели, и каждая атакующая сеть была масштабирована до ограничений объяснений, лежащих в основе процесса, а не использовала более глубокие нейронные модели, чья сложность превышала бы обобщение объяснений.

Типы объяснений XAI, использованные для питания попыток, включали объяснение градиента, объяснение входных данных градиента, Grad-CAM и слой-за-слоем пропагация релевантности (LRP). Исследователи также оценили несколько объяснений в экспериментах.

Восстановление изображения, облегченное атакой на модель, осведомленной о XAI, на трех наборах данных, с идентичными целевыми и атакующими задачами.

Восстановление изображения, облегченное атакой на модель, осведомленной о XAI, на трех наборах данных, с идентичными целевыми и атакующими задачами.

Метрики для теста были оценены по средней квадратической ошибке (MSE); подобие изображения (SSIM), основанный на восприятии показатель подобия; точность атаки, определенная возможностью классификатора успешно переименовать восстановленное изображение; и подобие вложения атаки, которое сравнивает вложения функций известных исходных данных с восстановленными данными.

Переопределение было достигнуто, с разными уровнями в зависимости от задачи и наборов данных, во всех наборах. Кроме того, исследователи обнаружили, что, создав модель-мишень (которой они естественно имели полный контроль), все еще было возможно достичь переопределения данных из внешних, “закрытых” моделей, на основе известных принципов XAI.

Исследователи обнаружили, что наиболее точные результаты были получены с помощью объяснений, основанных на активации (карта салиентности), которые утечали больше PII, чем подходы, основанные на чувствительности (градиент).

В будущей работе команда намерена включить разные типы объяснений XAI в новые атаки, такие как визуализация функций и векторы активации концепций.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]