Взгляд Anderson

Синтетические данные не обеспечивают надежную защиту конфиденциальности, утверждают исследователи

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследовательское сотрудничество между Францией и Великобританией вызывает сомнения в растущей уверенности отрасли в том, что синтетические данные могут решить проблемы конфиденциальности, качества и доступности (среди других проблем), которые угрожают прогрессу в секторе машинного обучения.

Среди нескольких ключевых моментов, рассмотренных авторами, они утверждают, что синтетические данные, смоделированные из реальных данных, сохраняют достаточно подлинной информации, чтобы не обеспечивать надежную защиту от вывода и атак на членство, которые стремятся deanonymize данные и重新 связать их с реальными людьми.

Более того, люди, которые наиболее подвержены таким атакам, включая тех, у кого есть критические медицинские условия или высокие больничные счета (в случае анонимизации медицинских записей), через “аутсайдерский” характер своего состояния, наиболее вероятно будут переидентифицированы этими методами.

В статье отмечается:

‘Учитывая доступ к синтетическому набору данных, стратегический противник может сделать вывод, с высокой уверенностью, о присутствии целевой записи в исходных данных.’

Статья также отмечает, что дифференциально-приватные синтетические данные, которые скрывают сигнатуру отдельных записей, действительно защищают конфиденциальность людей, но только за счет значительного ухудшения полезности систем извлечения информации, которые используют их.

Если что-то, исследователи отмечают, дифференциально-приватные подходы – которые используют “реальную” информацию ‘на расстоянии’ через синтетические данные – делают сценарий безопасности хуже, чем он был бы в противном случае:

‘[Синтетические] наборы данных не дают никакой прозрачности об этом компромиссе. Невозможно предсказать, какие характеристики данных будут сохранены и какие закономерности будут подавлены.’

Новая статья, озаглавленная Синтетические данные – День сурка анонимизации, исходит от двух исследователей из École Polytechnique Fédérale de Lausanne (EPFL) в Париже и исследователя из University College London (UCL).

Исследователи провели тесты существующих алгоритмов обучения приватных генеративных моделей и обнаружили, что определенные решения по реализации нарушают формальные гарантии конфиденциальности, предоставленные в рамках, оставляя разнообразные записи уязвимыми для атак на вывод.

Авторы предлагают пересмотренную версию каждого алгоритма, который потенциально смягчает эти уязвимости, и делают код доступным в виде открытой библиотеки. Они утверждают, что это поможет исследователям оценить выгоды от конфиденциальности синтетических данных и полезно сравнить популярные методы анонимизации. Новый каркас включает два соответствующих метода атак на конфиденциальность, которые можно применить к любому алгоритму обучения генеративной модели.

Синтетические данные

Синтетические данные используются для обучения моделей машинного обучения в различных сценариях, включая случаи, когда отсутствие полной информации может быть потенциально заполнено эрзац-данными. Одним из примеров этого является возможность использования CGI-генерируемых лиц для предоставления “сложных” или “редких” фотографий лиц для синтеза изображений, где профильные изображения, острые углы или необычные выражения часто редко встречаются в исходном материале.

Другие типы CGI-изображений были использованы для заполнения наборов данных, которые в конечном итоге будут запущены на несинтетических данных, таких как наборы данных, в которых представлены руки и мебель.

В плане защиты конфиденциальности синтетические данные могут быть сгенерированы из реальных данных системами Generative Adversarial Network (GAN), которые извлекают функции из реальных данных и создают подобные, вымышленные записи, которые, вероятно, будут обобщаться хорошо для более поздних (не видимых, реальных) данных, но предназначены для сокрытия деталей реальных людей, представленных в исходных данных.

Методология

Для целей нового исследования авторы оценили выгоды от конфиденциальности в пяти алгоритмах обучения генеративных моделей. Три из этих моделей не предлагают явной защиты конфиденциальности, в то время как две другие имеют гарантии дифференциальной конфиденциальности. Эти табличные модели были выбраны для представления широкого спектра архитектур.

Атакованные модели были BayNet, PrivBay (производная от PrivBayes/BayNet), CTGAN, PATEGAN и IndHist.

Фреймворк оценки для моделей был реализован как библиотека Python с двумя основными классами – GenerativeModels и PrivacyAttacks. Последний включает два аспекта – противника вывода членства и атаки на членство. Фреймворк также способен оценивать выгоды от конфиденциальности “санитизированных” (т. е. анонимизированных) данных и синтетических данных.

Два набора данных, использованных в тестах, были Adult Data Set из репозитория машинного обучения UCI и Hospital Discharge Data Public Use Data File из департамента государственных услуг здравоохранения Техаса. Версия набора данных Техаса, использованная исследователями, содержит 50 000 записей, отобранных из записей пациентов за 2013 год.

Атаки и результаты

Общая цель исследования – установить “связываемость” (пересоединение реальных данных с синтетическими данными, которые были вдохновлены ими). Модели атак, использованные в исследовании, включают логистическую регрессию, случайные леса и классификаторы K-Nearest Neighbors.

Авторы выбрали две целевые группы, состоящие из пяти случайно выбранных записей для “меньшинственных” категорий населения, поскольку эти записи наиболее вероятно будут подвержены атаке на связь. Они также выбрали записи с “редкими категориальными атрибутами” вне 95-го процентиля этого атрибута. Примерами являются записи, связанные с высоким риском смертности, высокими общими больничными счетами и тяжестью заболевания.

Хотя статья не подробно останавливается на этом аспекте, с точки зрения вероятных реальных атакующих, это именно те “дорогие” или “высокорисковые” пациенты, которые наиболее вероятно будут нацелены атаками на вывод и другими видами подходов к patient записям.

Множество моделей атак было обучено на публичной справочной информации, чтобы разработать “тень” моделей над десятью целевыми объектами. Результаты по ряду экспериментов (как описано ранее) показывают, что ряд записей был “высоко уязвим” для атак на связь, направленных на них исследователями. Результаты также показали, что 20% всех целевых объектов в испытаниях получили выгоду от конфиденциальности ноль от синтетических данных, произведенных методами GAN.

Исследователи отмечают, что результаты варьировались в зависимости от метода, использованного для генерации синтетических данных, вектора атаки и характеристик целевого набора данных. Отчет показывает, что во многих случаях эффективное подавление идентичности через подходы к синтетическим данным снижает полезность полученных систем. По сути, полезность и точность таких систем могут во многих случаях быть прямым индексом того, насколько они уязвимы для атак на переидентификацию.

Исследователи заключили:

‘Если синтетический набор данных сохраняет характеристики исходных данных с высокой точностью и, следовательно, сохраняет полезность данных для случаев, для которых он рекламируется, он одновременно позволяет противникам извлекать конфиденциальную информацию о людях.

‘Высокая выгода от конфиденциальности через любой из механизмов анонимизации, которые мы оценили, может быть достигнута только в том случае, если опубликованная синтетическая или санитизированная версия исходных данных не несет сигнал отдельных записей в исходных данных и фактически подавляет их запись.’

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai