Погляд Anderson
Реідентифікація джерельних даних для генераторів GAN

Нові дослідження з Франції пропонують техніку “реідентифікації” джерельних ідентифікаторів, які внесли свій внесок у синтетичні дані, такі як GAN-генеровані “неіснуючі люди” у проектах генерації облич, таких як This Person Does Not Exist.
Метод, описаний у документі, під назвою Ця людина (ймовірно) існує. Атаки на членство в ідентифікаторах проти GAN-генерованих облич, не вимагає (неможливого) доступу до архітектури навчання або даних моделі, і може бути застосований до різних застосунків, для яких використання Генеративних протидійних мереж (GAN) зараз досліджується як метод анонімізації особистої ідентифікаційної інформації (PII), або як засіб генерації синтетичних даних при захисті джерельного матеріалу.
Дослідники розробили метод, названий Атака на членство в ідентифікаторах, який оцінює ймовірність появи однієї ідентифікатори часто у вносячому наборі даних, а не намагається визначити особливі характеристики ідентифікатори (тобто групи пікселів оригінального зображення, яке було використано для навчання генеративної моделі).
На зображенні вище, з дослідження, кожен рядок починається з GAN-генерованого зображення, створеного за допомогою StyleGAN. Лівий блок зображень був створений з бази даних 40 000 зображень, середній блок – з 80 000, а правий блок – з 46 000 зображень. Усі зображення походять з набору даних VGG2Face2.
Деякі зразки мають мимовільну схожість, тоді як інші сильно корелюють з навчальними даними. Обличчя були успішно ідентифіковані дослідниками за допомогою мережі ідентифікації облич.
Більше, ніж зовнішній вигляд
Підходи до реідентифікації цього типу мають численні наслідки у багатьох галузях досліджень; дослідники, які базуються в Університеті Кана в Нормандії, підкреслюють, що їхній метод не обмежується наборами облич і рамками генерації облич GAN, а також застосовується до медичних наборів даних і біометричних даних, серед інших можливих поверхонь атаки у рамках генерації зображень.
‘Ми вважаємо, що якщо така атака буде успішною, вона відкриє серйозну перешкоду для безпечного обміну GAN у чутливих контекстах. Наприклад, у контексті картин або інших художніх творів поширення не приватного генератора може бути виключено через очевидні питання авторського права. Що більш важно, розгляньте біометричну компанію А, яка випускає генератор, який розкриває ідентифікатори її клієнтів. Інша компанія Б потенційно може виявити, які з її клієнтів також є клієнтами компанії А. Подібні ситуації можуть створити серйозні проблеми для медичних даних, де розкриття GAN може порушити особисту інформацію про захворювання пацієнта.’
Реідентифікація незаконно зібраних або приватних даних
Хоча документ тільки легенько торкається цієї теми, можливість ідентифікації джерельних даних з абстрактного виходу (такого як GAN-генеровані обличчя, хоча це також застосовується до систем кодувача/декодувача та інших архітектур) має відповідні наслідки для реалізації захисту авторського права протягом наступних 5-10 років.
Наразі більшість країн застосовують лезе-фер підхід до збору публічних даних у мережі, щоб не відставати на етапі розвитку економіки машинного навчання. Коли ця атмосфера комерціалізується та консолідується, існує значний потенціал для появи нового покоління “Тролів даних”, які можуть подати претензії щодо авторського права на зображення, підтверджені історично у наборах даних, які внесли свій внесок у алгоритми машинного навчання.
Як розвинені алгоритми дозрівають і стають більш цінними з часом, будь-які незаконні зображення, які були використані на ранніх етапах їхнього розвитку, і які можна вивести з їхнього виходу методами, подібними до тих, які запропоновані у французькій роботі, можуть стати потенційною юридичною відповідальністю у масштабі SCO проти IBM (легендарного тривалого технічного судового процесу, який продовжує загрожувати операційній системі Linux).
Використання мексиканського стsndoff між різноманітністю та частотою
Основна техніка, використана французькими дослідниками, використовує частоту оригінальних зображень у наборі даних як ключ до реідентифікації. Чим частіше певна ідентифікатори зустрічається у наборі даних, тим більш ймовірно, що можна буде ідентифікувати цю оригінальну ідентифікатори, корелюючи результати атаки з публічно чи приватно доступними наборами даних.
Дослідники відзначають, що це можна пом’якшити, включаючи більшу різноманітність даних (наприклад, облич) у джерельному наборі даних, і не тренуючи набір даних так довго, щоб перетренування відбулося. Проблема полягає в тому, що модель повинна тоді досягти хорошої абстракції у набагато вищому вимірному просторі, і з набагато більшим обсягом даних, ніж це строго необхідно для отримання плausible синтетичних результатів.
Досягнення оптимальної узагальненості цього типу є дорогим і тривалим:.latent простір (формульна частина аналізу моделі машинного навчання, у яку вводяться дані) буде потребувати більше ресурсів; набір даних буде потребувати більше кураторства; і оскільки обсяг даних повинен бути значним, розміри пакетів і планування швидкості повинні бути оптимізовані для якості та високого рівня узагальнення, а не швидкості навчання та економії, що робить розробку більш дорогою та тривалою.
Крім того, переобучені генеративні алгоритми можуть досягти високореалістичних синтетичних даних, навіть якщо вихідні дані (тобто обличчя, карти, біомедичні зображення тощо) не зовсім абстрактні, але мають більші відмінні ознаки від джерельних даних, ніж це було б ідеально – це спокуса скоротити шлях. У поточній “дикій” атмосфері сектора машинного навчання, де менші ініціативи намагаються викликати лідерство FAANG з меншими ресурсами (або ж отримати увагу для викупу), це питання, чи завжди піднімаються стандарти до такого рівня.
Документ також відзначає, що різноманітність джерельних даних (таких як обличчя) сама по собі недостатня, щоб запобігти реідентифікації через ці та подібні методи, оскільки раннє зупинення навчання може залишити джерельні ідентифікатори недостатньо абстрактними.













