Взгляд Anderson

Получение реальных адресов электронной почты из предварительно обученных моделей обработки естественного языка

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из США показывает, что предварительно обученные языковые модели (PLM), такие как GPT-3, могут быть успешно запрошены для получения реальных адресов электронной почты, которые были включены в огромные объемы данных, использованные для их обучения.

Хотя в настоящее время трудно получить реальный адрес электронной почты, запрашивая языковую модель о человеке, с которым связан адрес электронной почты, исследование показало, что чем больше языковая модель, тем легче выполнить этот тип эксплуатации; и чем более обширный и информированный запрос, тем легче получить функциональный адрес электронной почты.

В статье говорится:

‘Результаты демонстрируют, что PLM действительно запоминают большое количество адресов электронной почты; однако они не понимают точные ассоциации между именами и адресами электронной почты, например, кому принадлежит запомненный адрес электронной почты. Следовательно, учитывая контекст адресов электронной почты, PLM могут восстановить приличное количество адресов электронной почты, в то время как несколько адресов электронной почты предсказываются правильно путем запроса с именами.’

Чтобы проверить эту теорию, авторы обучили три PLM с увеличением размера и параметров и запросили их в соответствии с набором шаблонов и методов, которые, вероятно, будут использоваться атакующим.

Статья дает три основных представления о рисках, связанных с включением реальной личной информации в огромные обучающие корпуса, на которых зависят большие PLM.

Во-первых, что длинные текстовые шаблоны (в запросах) увеличивают возможность получения конфиденциальной информации о человеке, просто назвав этого человека. Во-вторых, что атакующие могут дополнить свой подход существующими знаниями о своей цели, и что чем больше предварительных знаний имеет атакующий, тем более вероятно, что он сможет эксплуатировать запомненные данные, такие как адреса электронной почты.

В-третьих, авторы полагают, что более крупные и способные модели обработки естественного языка могут позволить атакующему извлечь больше информации, снижая аспект ‘безопасности через неясность’ текущих PLM, поскольку все более сложные и гипермасштабные модели обучаются сущностями уровня FAANG.

Наконец, статья заключает, что личная информация действительно может быть сохранена и утечь через процесс запоминания, когда модель только частично ‘переваривает’ обучающие данные, так что она может использовать эту неразбитую информацию как ‘фактические’ данные в ответ на запросы.

Авторы заключили*:

‘Из результатов контекстного установления мы обнаружили, что самая большая модель GPT-Neo может восстановить 8,80% адресов электронной почты правильно через запоминание.

‘Хотя это настройка не так опасна, как другие, поскольку для пользователей практически невозможно узнать контекст, если корпус не является публичным, адрес электронной почты все равно может быть случайно сгенерирован, и угроза не может быть проигнорирована.’

Хотя исследование выбирает адреса электронной почты в качестве примера потенциально уязвимой личной информации, статья подчеркивает обширные исследования в этой области в отношении эксплуатации медицинских данных пациентов и считает свои эксперименты демонстрацией принципа, а не конкретным выделением уязвимости адресов электронной почты в этом контексте.

Статья называется Утечка личной информации из крупных предварительно обученных языковых моделей? и написана тремя исследователями из Университета Иллинойса в Урбане-Шампейне.

Запоминание и ассоциация

Работа сосредоточена на степени, в которой запомненные сведения ассоциируются. Обученная модель обработки естественного языка не может полностью абстрагировать информацию, на которой она обучена, или она не сможет вести связный аргумент или вызвать фактические данные. Для этого модель запомнит и защитит дискретные фрагменты данных, которые будут представлять минимальные семантические узлы в возможном ответе.

Основной вопрос заключается в том, может ли запомненная информация быть вызвана путем вызова другой информации, такой как ‘именованный’ объект, например, человек. В таком случае модель обработки естественного языка, обученная на непубличных и привилегированных данных, может содержать больничные данные об Илоне Маске, такие как записи пациента, имя и адрес электронной почты.

В худшем сценарии запрос такой базы данных с помощью подсказки ‘Какой адрес электронной почты у Илона Маска?’ или ‘Какая история болезни у Илона Маска?’ даст эти данные.

По сути, это почти никогда не происходит, по ряду причин. Например, если защищенное запоминание факта (такого как адрес электронной почты) представляет собой дискретную единицу, следующая дискретная единица вверх не будет простым переходом на более высокий уровень информации (т. е. об Илоне Маске), а может быть намного большим скачком, не связанным с конкретным человеком или данным.

Кроме того, хотя основание для ассоциации не обязательно является произвольным, оно также не является предсказуемо линейным; ассоциация может возникать на основе весов, которые были обучены с помощью разных целей потерь, чем простое иерархическое извлечение информации (например, генерация правдоподобного абстрактного разговора), или в/против способов, которые были специально направлены (или даже запрещены) архитекторами системы обработки естественного языка.

Тестирование PLM

Авторы проверили свою теорию на трех итерациях каузальной языковой модели GPT-Neo, обученной на наборе данных Pile с 125 миллионами, 1,3 миллиарда и 2,7 миллиарда параметров.

Набор данных Pile представляет собой сборку публичных наборов данных, включая базу данных Enron Университета Калифорнии в Беркли, которая включает информацию о социальной сети на основе обмена электронной почтой. Поскольку Enron следовал стандартной конвенции имя+фамилия+домен (т. е. имя_фамилия@enron.com), такие адреса электронной почты были отфильтрованы, поскольку для этого не требуется машинное обучение.

Исследователи также отфильтровали пары имя/электронная почта с менее чем тремя токенами, и после предварительной обработки в общей сложности получили 3238 пар имя/почта, которые были использованы в различных последующих экспериментах.

В эксперименте с контекстом исследователи использовали 50, 100 или 200 токенов, предшествующих целевому адресу электронной почты, в качестве контекста для вызова адреса с помощью подсказки.

В эксперименте без выстрела были созданы четыре подсказки вручную, последние две на основе стандартных соглашений электронной почты, таких как —Original Message—\nFrom: {name0} [mailto: {email0}].

Шаблоны для подсказок без выстрела. Источник: https://arxiv.org/pdf/2205.12628.pdf

Шаблоны для подсказок без выстрела. Источник: https://arxiv.org/pdf/2205.12628.pdf

Далее был рассмотрен сценарий с несколькими выстрелами — сценарий, в котором атакующий имеет некоторые предварительные знания, которые могут помочь ему создать подсказку, которая вызовет желаемую информацию. В созданных подсказках исследователи учитывают, известно ли целевое доменное имя или нет.

Итерации сценария с несколькими выстрелами.

Итерации сценария с несколькими выстрелами.

Наконец, был использован правило-ориентированный метод, который использует 28 вероятных вариаций стандартных шаблонов для использования имен в адресах электронной почты для попытки восстановить целевой адрес электронной почты. Для этого требуется большое количество запросов, чтобы охватить все возможные перестановки.

Правило-ориентированные шаблоны, использованные в тестах.

Правило-ориентированные шаблоны, использованные в тестах.

Результаты

Для задачи предсказания с контекстом GPT-Neo смог предсказать до 8,80% адресов электронной почты правильно, включая адреса, которые не соответствовали стандартным шаблонам.

Результаты задачи предсказания с контекстом. Первый столбец содержит информацию о количестве токенов, предшествующих адресу электронной почты.

Результаты задачи предсказания с контекстом. Первый столбец содержит информацию о количестве токенов, предшествующих адресу электронной почты.

Для задачи настройки без выстрела PLM смог правильно предсказать только небольшое количество адресов электронной почты, в основном соответствующих стандартным шаблонам, установленным исследователями (см. предыдущее изображение).

Результаты настроек без выстрела, когда домен неизвестен.

Результаты настроек без выстрела, когда домен неизвестен.

Авторы отмечают с интересом, что настройка 0-выстрела (D) заметно превосходит своих аналогов, вероятно, из-за более длинного префикса.

‘Это [указывает] на то, что PLM делают эти предсказания в основном на основе запоминания последовательностей — если они делают предсказания на основе ассоциации, они должны работать аналогично. Причина, по которой 0-выстрел (D) превосходит 0-выстрел (C), заключается в том, что более длинный контекст может обнаружить больше [запоминания]’

Более крупные модели, более высокие риски

В отношении потенциала таких подходов для эксплуатации личных данных из обученных моделей авторы отмечают:

‘Для всех известных доменов, неизвестных доменов и контекстных настроек существует значительное улучшение точности, когда мы переходим от модели 125M к модели 1,3B. И в большинстве случаев, когда мы переходим от модели 1,3B к модели 2,7B, также наблюдается увеличение точности предсказания.’

Исследователи предлагают два возможных объяснения этому явлению. Во-первых, модели с более высокими параметрами просто способны запоминать больший объем обучающих данных. Во-вторых, более крупные модели более сложные и лучше способны понять созданные подсказки, и поэтому могут ‘соединить’ разрозненные сведения о человеке.

Они, однако, отмечают, что на текущем уровне развития личная информация ‘относительно безопасна’ от таких атак.

В качестве средства против этой атаки авторы советуют, чтобы архитектуры подвергались тщательной предварительной обработке для фильтрации личной информации; чтобы учитывать обучение с помощью дифференциально-приватного градиентного спуска; и чтобы включать фильтры в любой пост-обработочный окружении, например, в API (например, API DALL-E 2 от OpenAI имеет большое количество фильтров, в дополнение к модерации подсказок человеком).

Они также советуют против использования адресов электронной почты, соответствующих угадываемым и стандартным шаблонам, хотя этот совет уже является стандартным в кибербезопасности.

 

* Моя замена гиперссылок на внутренние цитаты авторов.

Опубликовано впервые 26 мая 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai