Взгляд Anderson
Защита Промптов от Утечки Данных LLM

Мнение Интересная работа IBM NeurIPS 2024 подача из конца 2024 переиздан на Arxiv на прошлой неделе. Она предлагает систему, которая может автоматически вмешаться, чтобы защитить пользователей от отправки личной или конфиденциальной информации в сообщении, когда они ведут разговор с Большой Языковой Моделью (LLM), такой как ChatGPT.

Макетные примеры, использованные в исследовании пользователя, чтобы определить способы, которыми люди хотели бы взаимодействовать с сервисом вмешательства в промпты. Источник: https://arxiv.org/pdf/2502.18509
Макеты, показанные выше, были использованы исследователями IBM в исследовании, чтобы проверить потенциальную пользовательскую фрикцию для такого рода “вмешательства”.
Хотя подробностей о реализации GUI нет, мы можем предположить, что такая функциональность могла бы быть включена в браузерный плагин связывающийся с локальной “брандмауэр” LLM-рамкой; или что приложение могло быть создано, которое могло бы подключиться напрямую к (например) OpenAI API, эффективно воссоздавая собственное скачиваемое самостоятельное программное обеспечение для ChatGPT, но с дополнительными мерами безопасности.
Тем не менее, ChatGPT само по себе автоматически самоцензурирует ответы на промпты, которые он воспринимает как содержащие критическую информацию, такую как банковские детали:

ChatGPT отказывается взаимодействовать с промптами, содержащими воспринимаемую критическую информацию безопасности, такую как банковские детали (детали в промпте выше являются вымышленными и нефункциональными). Источник: https://chatgpt.com/
Однако ChatGPT намного более терпим в отношении различных типов личной информации – даже если распространение такой информации любым способом может не быть в интересах пользователя (в данном случае, возможно, по различным причинам, связанным с работой и раскрытием):

Пример выше является вымышленным, но ChatGPT не колеблется, чтобы вступить в разговор с пользователем на чувствительную тему, которая представляет потенциальный репутационный или заработный риск (пример выше является полностью вымышленным).
В вышеуказанном случае было бы лучше написать: ‘Каково значение диагноза лейкемии на способность человека писать и на его подвижность?’
Проект IBM выявляет и переинтерпретирует такие запросы с ‘личной’ на ‘общую’ позицию.

Схема для системы IBM, которая использует локальные LLM или NLP-основанные эвристики, чтобы выявить чувствительную информацию в потенциальных промптах.
Это предполагает, что материал, собранный онлайн-LLM, на этом начальном этапе энтузиастического принятия AI-чата, никогда не будет передан либо в последующие модели, либо в более поздние рекламные рамки, которые могли бы использовать пользовательские поисковые запросы, чтобы предоставить потенциальную целевую рекламу.
Хотя такая система или договоренность не известна сейчас, подобная функциональность не была доступна на заре принятия интернета в начале 1990-х годов; с тех пор перекрестное обмен информацией для подачи персонализированной рекламы привел к разнообразным скандалам, а также паранойей.
Следовательно, история говорит о том, что было бы лучше санитизировать входные промпты LLM сейчас, прежде чем такие данные накопятся в объеме, и прежде чем наши подачи LLM окажутся в постоянных циклических базах данных и/или моделях, или других информационных структурах и схемах.
Помните Меня?
Один фактор, который говорит против использования ‘общих’ или санитизированных промптов LLM, заключается в том, что, честно говоря, возможность настроить дорогой API-only LLM, такой как ChatGPT, довольно привлекательна, по крайней мере на текущем уровне развития – но это может включать долгосрочное раскрытие конфиденциальной информации.
Я часто прошу ChatGPT помочь мне составить скрипты Windows PowerShell и BAT-файлы, чтобы автоматизировать процессы, а также на другие технические вопросы. Для этого я нахожу полезным, что система постоянно запоминает детали о имеющемся у меня оборудовании; моих существующих технических навыках (или их отсутствии); и различных других факторов окружения и пользовательских правил:

ChatGPT позволяет пользователю развивать ‘кэш’ воспоминаний, которые будут применены, когда система рассматривает ответы на будущие промпты.
Неизбежно, это сохраняет информацию обо мне на внешних серверах, подчиняясь условиям и положениям, которые могут измениться со временем, без каких-либо гарантий, что OpenAI (хотя это может быть любой другой крупный поставщик LLM) уважит условия, которые они установили.
В целом, однако, способность создать кэш воспоминаний в ChatGPT наиболее полезна из-за ограниченного окна внимания LLM в целом; без долгосрочных (персонализированных) вложений пользователь чувствует, что он разговаривает с сущностью, страдающей от антероградной амнезии.
Трудно сказать, будут ли более новые модели в конечном итоге достаточно эффективными, чтобы предоставить полезные ответы без необходимости кэширования воспоминаний или создания пользовательских GPT, которые хранятся онлайн.
Временная Амнезия
Хотя можно сделать разговоры ChatGPT ‘временными’, полезно иметь историю чата в качестве справочного материала, который можно упростить, когда время позволяет, в более связный локальный запись, возможно, на платформе для заметок; но в любом случае мы не можем знать точно, что происходит с этими ‘брошенными’ чатами (хотя OpenAI заявляет, что они не будут использоваться для обучения, это не заявляет, что они будут уничтожены), на основе инфраструктуры ChatGPT. Все, что мы знаем, это то, что чаты больше не появляются в нашей истории, когда ‘Временные чаты’ включены в ChatGPT.
Различные недавние скандалы указывают на то, что поставщики API, такие как OpenAI, не должны обязательно оставаться ответственными за защиту конфиденциальности пользователя, включая открытие эмерджентной меморизации, указывающей на то, что более крупные LLM более вероятно запомнят некоторые примеры обучения полностью, и увеличивающей риск раскрытия пользовательских данных – среди других публичных инцидентов, которые убедили множество известных компаний, таких как Samsung, запретить LLM для внутреннего использования компании.
Думайте По-Другому
Это напряжение между чрезвычайной полезностью и явным потенциальным риском LLM потребует некоторых изобретательных решений – и предложение IBM, кажется, является интересным базовым шаблоном в этом направлении.

Три реформулировки IBM, которые балансируют полезность против конфиденциальности данных. В нижней (розовой) полосе мы видим промпт, который находится за пределами способности системы санитизировать его осмысленным образом.
Подход IBM перехватывает исходящие пакеты в LLM на уровне сети и переписывает их при необходимости до того, как оригинал может быть отправлен. Сlightly более сложные интеграции GUI, показанные в начале статьи, являются лишь иллюстрацией того, куда такой подход мог бы привести, если бы он был разработан.
Конечно, без достаточной агентности пользователь может не понять, что он получает ответ на слегка измененную реформулировку своего исходного запроса. Этот недостаток прозрачности эквивалентен тому, как брандмауэр операционной системы блокирует доступ к веб-сайту или службе без информирования пользователя, который может затем ошибочно искать другие причины проблемы.
Промпты как Угрозы Безопасности
Перспектива ‘вмешательства в промпты’ аналогична безопасности Windows OS, которая эволюционировала от набора (необязательно устанавливаемых) коммерческих продуктов в 1990-х годах до неопционального и жестко-вынужденного набора инструментов сетевой защиты, которые поставляются в комплекте с установкой Windows, и которые требуют некоторых усилий, чтобы их отключить или ослабить.
Если санитизация промптов эволюционирует, как сетевые брандмауэры за последние 30 лет, предложение статьи IBM может служить планом для будущего: развертывание полностью локального LLM на машине пользователя для фильтрации исходящих промптов, направленных на известные LLM API. Эта система естественно потребует интеграции GUI-рамок и уведомлений, предоставляя пользователям контроль – если только административные политики не переопределяют их, как часто происходит в деловой среде.
Исследователи провели анализ открытой версии ShareGPT набора данных, чтобы понять, как часто нарушается контекстная конфиденциальность в реальных сценариях.
Llama-3.1-405B-Instruct был использован в качестве ‘судейской’ модели для обнаружения нарушений контекстной целостности. Из большого набора разговоров подмножество одноповоротных разговоров было проанализировано на основе длины. Судейская модель затем оценила контекст, чувствительную информацию и необходимость для выполнения задачи, что привело к выявлению разговоров, содержащих потенциальные нарушения контекстной целостности.
Меньшее подмножество этих разговоров, которые продемонстрировали явные нарушения контекстной конфиденциальности, были проанализированы дальше.
Сама рамка была реализована с использованием моделей, которые меньше, чем типичные чат-агенты, такие как ChatGPT, чтобы ermögнить локальное развертывание через Ollama.

Схема для системы вмешательства в промпты.
Три LLM, которые были оценены, были Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; и DeepSeek-R1-Distill-Llama-8B.
Промпты пользователей обрабатываются рамкой в три этапа: идентификация контекста; классификация чувствительной информации; и реформулирование.
Два подхода были реализованы для классификации чувствительной информации: динамическая и структурированная классификация: динамическая классификация определяет основные детали на основе их использования в конкретном разговоре; структурированная классификация позволяет указать предварительно определенный список чувствительных атрибутов, которые всегда считаются неэссенциальными. Модель реформулирует промпт, если она обнаруживает неэссенциальные чувствительные детали, удаляя или перефразируя их, чтобы минимизировать риски конфиденциальности, сохраняя при этом полезность.
Домашние Правила
Хотя структурированная классификация как концепция не хорошо проиллюстрирована в статье IBM, она наиболее подобна методу ‘Частных определений данных’ в инициативе Private Prompts, которая предоставляет скачиваемую самостоятельную программу, которая может переписать промпты – хотя без возможности直接 вмешаться на уровне сети, как это делает подход IBM (вместо этого пользователь должен скопировать и вставить измененные промпты).

Программа Private Prompts позволяет указать список альтернативных замен для ввода пользователя.
На изображении выше мы видим, что пользователь Private Prompts может запрограммировать автоматические замены для экземпляров чувствительной информации. В обоих случаях, для Private Prompts и метода IBM, кажется маловероятным, что пользователь с достаточным присутствием и личным опытом, чтобы курировать такой список, фактически нуждался бы в этом продукте – хотя его можно было бы построить со временем, когда инциденты накапливаются.
В административной роли структурированная классификация могла бы работать как навязанный брандмауэр или цензор для сотрудников; и в домашней сети она могла бы, с некоторыми трудными корректировками, стать домашним сетевым фильтром для всех пользователей сети; но в конечном итоге, этот метод является, по сути, избыточным, поскольку пользователь, который мог бы настроить это правильно, также мог бы эффективно самоцензурироваться с самого начала.
Мнение ChatGPT
Поскольку ChatGPT недавно запустил свой глубокий исследовательский инструмент для платных пользователей, я использовал эту функцию, чтобы попросить ChatGPT просмотреть связанную литературу и дать мне ‘циничный’ взгляд на статью IBM. Я получил самый защитный и пренебрежительный ответ, который система когда-либо давала, когда ее просили оценить или проанализировать новую публикацию:

ChatGPT-4o имеет низкое мнение о проекте IBM.
‘Если пользователи не доверяют OpenAI, Google или Anthropic, чтобы ответственно обращаться с их данными,’ ChatGPT утверждает. ‘почему они доверят третьему ПО, расположенному между ними и AI? Посредник сам становится новой точкой отказа – потенциально регистрируя, неправильно обрабатывая или даже утечку данных, прежде чем они когда-либо достигнут LLM. Это решает ничего, если оно просто создает новую сущность для эксплуатации пользовательских данных.’
Этот возражение кажется корыстным и неуместным, учитывая богатую историю открытых проектов, которые действительно приносят пользу конечным пользователям через совместные долгосрочные усилия сообщества разработчиков и участников; и учитывая растущий потенциал мобильных устройств для запуска – и даже обучения – легких LLM. Конечно, в этом случае случай использования не особенно требователен.
Далее, ChatGPT уверенно упускает из виду смысл наличия легкого LLM, обеспечивающего надзор за вводом в коммерческий LLM, который не может быть запущен на локальной машине (потому что LLM слишком большой, и предоставление локального доступа слишком рискованно для компании, которая его производит):
‘Эффективная фильтрация конфиденциальности требует понимания ввода перед решением, что следует удалить. Если посредник достаточно умён, чтобы распознать чувствительную информацию (имена, адреса, финансовые детали), то он уже обрабатывает и анализирует эту информацию – то есть он должен хранить или изучать именно то, что он должен удалить.
‘Это вводит парадокс: а) Глупый фильтр (базовая замена с помощью regex) будет неэффективным и пропустит тонкие риски конфиденциальности. б) Умный фильтр (LLM-основанный переписыватель) должен обработать полный ввод, что делает его таким же опасным, как исходный LLM.
‘Если вы доверяете посреднику достаточно, чтобы прочитать и переписать ваши входные данные, почему бы не доверять самому LLM?’
Ответ на последний вопрос заключается в том, что локальный LLM предназначен для того, чтобы быть полностью на стороне пользователя, и неизбежно открытого исходного кода, с минимальной или нулевой необходимостью сетевого доступа. Эквивалентная коммерческая версия, однако хорошо намеренная в начале, в конечном итоге будет уязвима для корпоративных сдвигов и изменений в условиях обслуживания, тогда как подходящая открытая лицензия предотвратит этот тип ‘неизбежной коррупции’.
ChatGPT далее утверждал, что предложение IBM ‘нарушает намерение пользователя’, поскольку оно могло бы переинтерпретировать промпт в альтернативу, которая влияет на его полезность. Однако, это гораздо более широкая проблема в санитизации промптов, и не специфичная для этого конкретного случая.
В заключении (игнорируя его предложение использовать локальные LLM ‘вместо’, что является именно тем, что фактически предлагает статья IBM), ChatGPT высказал мнение, что метод IBM представляет собой барьер для принятия из-за ‘пользовательской фрикции’ реализации предупреждений и методов редактирования в чате.
Здесь ChatGPT может быть прав; но если значительное давление будет оказано из-за дальнейших публичных инцидентов, или если прибыль в одном географическом районе находится под угрозой из-за растущей регуляции (и компания отказывается просто бросить затронутый регион совсем), история потребительской техники говорит о том, что меры безопасности в конечном итоге больше не будут необязательными в любом случае.
Заключение
Мы не можем реалистично ожидать, что OpenAI когда-либо реализует меры безопасности такого типа, как предложенные в статье IBM, и в центральной концепции, лежащей в ее основе; по крайней мере, не эффективно.
И, конечно, не глобально; как Apple блокирует определенные функции iPhone в Европе, и LinkedIn имеет разные правила для эксплуатации данных пользователей в разных странах, разумно предположить, что любая AI-компания будет использовать наиболее прибыльные условия и положения, которые терпимы для любой конкретной нации, в которой она работает – в каждом случае, за счет права пользователя на конфиденциальность данных, если необходимо.
Опубликовано в четверг, 27 февраля 2025 года
Обновлено в четверг, 27 февраля 2025 года 15:47:11 из-за неправильной ссылки, связанной с Apple – MA












