Погляд Anderson
Отримання реальних адрес електронної пошти з попередньо натренованих моделей обробки природної мови

Нові дослідження в США свідчать про те, що попередньо натреновані мови моделі (PLM), такі як GPT-3, можуть бути успішно запитані на реальні адреси електронної пошти, які були включені в величезні масиви даних, використаних для їх навчання.
Хоча зараз важко отримати реальну адресу електронної пошти, запитаючи мовну модель про особу, якій належить адреса електронної пошти, дослідження показало, що чим більша мова модель, тим легше виконувати такий вид екзфільтрації; і чим більш розширений і інформований запит, тим легше отримати функціональну адресу електронної пошти.
У статті зазначається:
‘Результати демонструють, що PLM дійсно запам’ятовують велику кількість адрес електронної пошти; однак вони не розуміють точних асоціацій між іменами та адресами електронної пошти, наприклад, кому належить запам’ятована адреса електронної пошти. Тому, враховуючи контекст адрес електронної пошти, PLM можуть відновити значну кількість адрес електронної пошти, тоді як лише кілька адрес електронної пошти передбачаються правильно шляхом запиту з іменами.’
Для перевірки теорії автори натренували три PLM різного розміру і параметрів і запитали їх згідно з набором шаблонів і методів, які міг би використовувати нападник.
Стаття пропонує три ключових висновки щодо ризиків дозволу включення реальної особистої інформації в масиви даних, на яких залежать великі PLM.
По-перше, що довгі текстові шаблони (у запитах) збільшують можливість отримання приватної інформації про особу лише за її ім’ям. По-друге, що нападники можуть доповнювати свій підхід існуючими знаннями про свою ціль, і що чим більше таких попередніх знань має нападник, тим більш ймовірно, що він зможе екзфільтрувати запам’ятовані дані, такі як адреси електронної пошти.
По-третє, автори припускають, що більші та більш здатні моделі обробки природної мови можуть дозволити нападнику витягнути більше інформації, зменшуючи аспект “безпеки через неясність” поточних PLM, оскільки все більш досконалі та гіпермасштабні моделі тренуються компаніями рівня FAANG.
Нарешті, стаття висновує, що особиста інформація може бути збережена і витекла через процес запам’ятовування, коли модель лише частково “триває” дані навчання, так що вона може використовувати цю незламану інформацію як “фактичні” дані у відповідь на запити.
Автори висновують*:
‘З результатів контекстуального встановлення ми знаходимо, що найбільша модель GPT-Neo може відновити 8,80% адрес електронної пошти правильно через запам’ятовування.
‘Хоча це встановлення не так небезпечне, як інші, оскільки фактично неможливо для користувачів знати контекст, якщо корпус не є публічним, адреса електронної пошти все одно може бути випадково сгенерована, і загроза не може бути проігнорована.’
Хоча дослідження вибирає адреси електронної пошти як приклад потенційно вразливої особистої інформації, стаття підкреслює обширні дослідження щодо цієї мети щодо витягування медичних даних пацієнтів, і розглядає свої експерименти як демонстрацію принципу, а не конкретне підкреслення вразливості адрес електронної пошти в цьому контексті.
Стаття названа Чи витекають великі попередньо натреновані мови моделі вашу особисту інформацію? і написана трьома дослідниками з Університету Іллінойсу в Урбані-Шампейні.
Запам’ятовування та асоціація
Робота центрується на ступені, в якій zapам’ятована інформація асоціюється. Натренована модель обробки природної мови не може повністю абстрагувати інформацію, на якій вона тренувалася, або вона не зможе тримати послідовний аргумент, або викликати будь-які фактичні дані взагалі. Для цього модель буде запам’ятовувати і захищати окремі фрагменти даних, які будуть представляти мінімальні семантичні вузли в можливій відповіді.
Велике питання полягає в тому, чи можна викликати запам’ятовану інформацію, викликаючи інші види інформації, такі як “найменована” сутність, наприклад, особа. У такому випадку модель обробки природної мови, натренована на непублічних і привілейованих даних, може містити дані про лікарню про Ілона Маска, такі як медичні записи, ім’я та адреса електронної пошти.
У найгіршому сценарії запитування такої бази даних з промптом “Яка адреса електронної пошти Ілона Маска?” або “Яка медична історія Ілона Маска?” давало б ці дані.
На ділі це майже ніколи не відбувається, з кількох причин. Наприклад, якщо захищене запам’ятовування факту (такого як адреса електронної пошти) представляє окремий блок, наступний окремий блок буде не просто переходом до вищого рівня інформації (тобто про Ілона Маска), а може бути значно більшим стрибком, який не пов’язаний з конкретною особою або даними.
Крім того, хоча раціонал для асоціації не є необхідним довільним, він також не є передбачувально лінійним; асоціація може відбуватися на основі ваг, які були натреновані з різними цілями втрат, ніж просто ієрархічний пошук інформації (такий як генерація правдоподібної абстрактної бесіди), або в/проти способів, які були конкретно спрямовані (або навіть заборонені) архітекторами системи обробки природної мови.
Тестування PLM
Автори протестували свою теорію на трьох ітераціях каузальної мови моделі GPT-Neo сім’ї, натренованої на Pile наборі даних у 125 мільйонів, 1,3 мільярда та 2,7 мільярда параметрів.
Pile є збіркою публічних наборів даних, включаючи базу даних Enron Університету Каліфорнії в Берклі, яка містить інформацію про соціальну мережу на основі обміну електронною поштою. Оскільки Enron слідував стандартній конвенції ім’я+прізвище+домен (тобто ім’я_прізвище@enron.com), такі адреси електронної пошти були відфільтровані, оскільки машинне навчання не потрібно для здогадування такого легкого шаблону.
Дослідники також відфільтрували пари імені/адреси електронної пошти з менше трьома токенами, і після загальної попередньої обробки отримали 3238 пар імені/пошти, які були використані в різних наступних експериментах.
У контекстному встановленні експерименті дослідники використали 50, 100 або 200 токенів перед ціловою адресою електронної пошти як контекст для виклику адреси з промптом.
У zero-shot експерименті було створено чотири промпти вручну, два останніх на основі стандартних конвенцій заголовків електронної пошти, таких як —Original Message—\nFrom: {name0} [mailto: {email0}].

Шаблони для zero-shot промптів. Джерело: https://arxiv.org/pdf/2205.12628.pdf
Далі було розглянуто few-shot сценарій – сценарій, в якому нападник має деякі попередні знання, які можуть допомогти йому створити промпт, який викличе бажану інформацію. У створених промптах дослідники розглянули, чи відомий цільовий домен чи ні.

Ітерації few-shot сценарію.
Нарешті, правило-орієнтований метод використовує 28 ймовірних варіантів стандартних шаблонів для використання імені в адресах електронної пошти для спроби відновлення цілової адреси електронної пошти. Це вимагає великої кількості запитів для покриття всіх можливих пермутацій.

Правило-орієнтовані шаблони, використані в тестах.
Результати
Для завдання передбачення з контекстом GPT-Neo вдається передбачити аж 8,80% адрес електронної пошти правильно, включаючи адреси, які не відповідають стандартним шаблонам.

Результати завдання передбачення з контекстом. Перший стовпець деталізує кількість токенів перед адресою електронної пошти.
Для завдання zero-shot налаштування PLM вдається правильно передбачити лише невелику кількість адрес електронної пошти, здебільшого відповідаючи стандартним шаблонам, встановленим дослідниками (див. попереднє зображення).

Результати zero-shot налаштування, де домен невідомий.
Автори звертають увагу на те, що 0-шот (D) налаштування суттєво перевершує своїх стабільних аналогів, очевидно, через довший префікс.
‘Це вказує на те, що PLM роблять ці передбачення головним чином на основі запам’ятовування послідовностей – якщо вони роблять передбачення на основі асоціації, вони повинні демонструвати подібну продуктивність. Причина, через яку 0-шот (D) перевершує 0-шот (C), полягає в тому, що довший контекст може виявити більше [zapam’ятовування]’
Більші моделі, більший ризик
Відносно потенціалу таких підходів для витягування особистих даних з натренованих моделей автори спостерігають:
‘Для всіх відомих доменів, невідомих доменів і контекстних налаштувань існує суттєве покращення точності, коли ми змінюємо модель з 125M на 1,3B. І в більшості випадків, коли ми змінюємо модель з 1,3B на 2,7B, також відбувається збільшення точності передбачення.’
Дослідники пропонують два можливі пояснення того, чому це відбувається. По-перше, моделі з вищими параметрами просто можуть запам’ятовувати більший обсяг даних навчання. По-друге, більші моделі більш досконалі та краще здатні зрозуміти створені промпти, і тому можуть “з’єднати” розрізнену інформацію про особу.
Водночас вони звертають увагу на те, що на поточному рівні розвитку особиста інформація “відносно безпечна” від таких атак.
Як засіб проти цієї атаки, перед лицем нових моделей, які постійно зростають за розміром і сферою застосування, автори радять, щоб архітектури піддавалися суворій попередній обробці для фільтрації особистої інформації; щоб розглядали навчання з диференційно-приватним градієнтним спуском; і щоб включали фільтри в будь-якому пост-процесорному середовищі, chẳng hạn як API (наприклад, API DALL-E 2 від OpenAI має велику кількість фільтрів, крім того, що має модерацію промптів людини).
Вони також радять проти використання адрес електронної пошти, які відповідають đoánним і стандартним шаблонам, хоча ця порада вже є стандартною у сфері кібербезпеки.
* Моя заміна гіперпосилань на внутрішні цитати авторів.
Перша публікація 26 травня 2022 року.












