Взгляд Anderson
Переидентификация исходных данных для генераторов GAN

Новые исследования, проведенные во Франции, предложили метод «переидентификации» исходных идентификаторов, которые внесли свой вклад в синтетически сгенерированные данные, такие как лица, сгенерированные с помощью GAN, в проектах, таких как This Person Does Not Exist.
Метод, описанный в статье, озаглавленной Этот человек (вероятно) существует. Атаки на членство в идентификации против лиц, сгенерированных с помощью GAN, не требует (маловероятного) доступа к архитектуре обучения или данным модели и может быть применен к различным приложениям, в которых использование генеративных противостоящих сетей (GAN) в настоящее время исследуется как метод анонимизации личной идентифицирующей информации (PII) или как средство генерации синтетических данных при защите исходного материала.
Исследователи разработали метод, называемый Атака на членство в идентификации, который оценивает вероятность появления единой идентификатора часто в наборе данных, а не попытку сосредоточиться на определенных характеристиках идентификатора (т. е. на группах пикселей исходного изображения, использованного для обучения генеративной модели).
На изображении выше, из исследования, каждая строка начинается с изображения, сгенерированного с помощью StyleGAN. Левый блок изображений был создан из базы данных 40 000 изображений, средний блок из 80 000 и правый блок из 46 000 изображений. Все изображения взяты из набора данных VGG2Face2.
Некоторые образцы имеют мимолетное сходство, в то время как другие сильно коррелируют с данными обучения. Лица были успешно идентифицированы исследователями с помощью сети идентификации лиц.
Больше, чем лицо
Подходы к переидентификации этого типа имеют множество последствий в различных областях исследований; исследователи, базирующиеся в Университете Кана в Нормандии, подчеркивают, что их метод не ограничивается наборами лиц и генераторами GAN, но также применим к медицинским наборам изображений и биометрическим данным, среди других возможных поверхностей атаки в рамках синтеза изображений.
‘Мы считаем, что если такая атака будет успешной, она откроет серьезное препятствие для безопасного обмена GAN в чувствительных контекстах. Например, в контексте картин или других произведений искусства распространение неприватного генератора может быть исключено из-за очевидных проблем с авторскими правами. Более того, рассмотрим биометрическую компанию А, выпускающую генератор, который раскрывает идентификатор потребителя. Другая компания Б может потенциально обнаружить, какие из своих потребителей также являются клиентами компании А. Аналогичные ситуации могут создать серьезные проблемы для медицинских данных, где раскрытие GAN может нарушить личную информацию о заболевании пациента.’
Переидентификация незаконно полученных или частных данных
Хотя статья только слегка затрагивает эту тему, возможность идентификации исходных данных из абстрактного вывода (такого как лица, сгенерированные с помощью GAN, хотя это также применимо к системам кодирования/декодирования и другим архитектурам) имеет заметные последствия для реализации защиты авторских прав в течение следующих 5-10 лет.
В настоящее время большинство стран применяют лэзе-фэр подход к соскрапингу публично доступных веб-данных, чтобы не отстать на стадии развития экономики машинного обучения. Когда эта среда коммерциализируется и консолидируется, существует значительный потенциал для нового поколения «троллей данных», чтобы представить претензии на авторские права на изображения, подтвержденные как использованные исторически в наборах данных, которые внесли свой вклад в алгоритмы машинного обучения.
Когда разрабатываемые алгоритмы созревают и становятся более ценными с течением времени, любые непозволенные изображения, использованные в их раннем развитии, и которые можно вывести из их вывода методами, аналогичными тем, которые предложены в новой французской статье, представляют собой потенциальную юридическую ответственность в масштабе SCO Vs IBM (легендарного долгосрочного технологического судебного процесса, который продолжает угрожать операционной системе Linux).
Эксплуатация мексиканского тупика разнообразия и частоты
Основная техника, используемая французскими исследователями, эксплуатирует частоту исходных изображений в наборе данных как ключ к переидентификации. Чем чаще определенная идентификатор встречается в наборе данных, тем более вероятно, что можно будет сделать идентификацию исходной идентификатора, коррелируя результаты атаки с публично или приватно доступными наборами данных.
Исследователи отмечают, что это можно смягчить, включив в исходный набор данных гораздо большее разнообразие данных (например, лиц) и не обучая набор данных так долго, чтобы переобучение произошло. Проблема заключается в том, что модель должна тогда достичь хорошей абстракции в гораздо более высоком измерении и с гораздо большим количеством данных, чем это строго необходимо для получения правдоподобных синтетических результатов.
Чтобы достичь оптимальной обобщаемости этого типа, это дорого и требует времени: пространство潜 (формульная часть модели машинного обучения, в которую вводятся данные) будет требовать больше ресурсов; набор данных будет требовать больше кураторской обработки; и поскольку количество данных должно быть значительным, размеры пакетов и планирование скорости будут должны быть оптимизированы для качества и высокого уровня обобщаемости, а не для скорости обучения и экономии, что приведет к более высоким затратам на разработку и более длительным срокам разработки.
Кроме того, переобученные генеративные алгоритмы могут достичь высокореалистичных синтетических данных, даже если выводные данные (т. е. лица, карты, биомедицинские изображения и т. д.) не полностью абстрактны, но имеют более крупные отличительные черты от исходных данных, чем было бы идеально – заманчивая возможность сокращения.
Статья также отмечает, что разнообразие исходных данных (таких как лица) само по себе не достаточно, чтобы предотвратить переидентификацию с помощью этих и подобных методов, поскольку раннее прекращение обучения может оставить исходные идентификаторы недостаточно абстрактными.













