Погляд Anderson
Захист промптів від витоків даних LLM

Опінія Цікаве подання IBM NeurIPS 2024 подання з кінця 2024 року переопубліковане на Arxiv минулого тижня. Воно пропонує систему, яка може автоматично втрутитися, щоб захистити користувачів від передачі особистої або конфіденційної інформації у повідомленні під час розмови з великими мовними моделями (LLM), такими як ChatGPT.

Макетні приклади, використані в дослідженні користувачів для визначення способів взаємодії з сервісом втручання у промпти. Джерело: https://arxiv.org/pdf/2502.18509
Макетні приклади, показані вище, були використані дослідниками IBM у дослідженні для перевірки потенційної фрикції користувачів щодо такого “втручання”.
Хоча про реалізацію GUI надаються лише нечисленні деталі, ми можемо припустити, що така функціональність могла б бути інтегрована у браузерний плагін комунікації з локальним “брандмауером” LLM-фреймворком; або створено застосунок, який може безпосередньо підключитися (наприклад) до OpenAI API, фактично відтворюючи власний завантажуваний програму для ChatGPT, але з додатковими засобами захисту.
Тим часом ChatGPT сам автоматично цензурує відповіді на промпти, які він сприймає як такі, що містять критичну інформацію, таку як банківські дані:

ChatGPT відмовляється взаємодіяти з промптами, які містять сприйняту критичну інформацію безпеки, таку як банківські дані (деталі у промпті вище є вигаданими та нефункціональними). Джерело: https://chatgpt.com/
Однак, ChatGPT значно терпиміший щодо різних типів особистої інформації – навіть якщо поширення такої інформації якимось чином не може бути у найкращих інтересах користувача (у цьому випадку, можливо, через різні причини, пов’язані з роботою та розкриттям):

Приклад вище є вигаданим, але ChatGPT не вагається вступати у розмову з користувачем на чутливу тему, яка становить потенційний ризик для репутації або доходу (приклад вище є цілком вигаданим).
У вищезазначеному випадку було б краще написати: ‘Яке значення діагнозу лейкемії для можливості людини писати та на її рухливість?’
Проект IBM ідентифікує та переінтерпретує такі запити з “особистої” на “загальну” позицію.

Схема системи IBM, яка використовує локальні LLM або NLP-орієнтовані евристики для визначення чутливої інформації у потенційних промптах.
Це припускає, що матеріал, зібраний онлайн-LLM, на цій ранній стадії ентузіастичного прийняття AI-чату, ніколи не буде переданий до наступних моделей або пізніших рекламних фреймворків, які можуть використовувати запит користувача для надання цільової реклами.
Хоча жодна така система чи домовленість не відома зараз, жодна така функціональність не була доступна на початку прийняття інтернету у 1990-х роках; з тих пір спільне використання інформації для персоналізації реклами призвело до різних скандалів, а також парадоксів.
Отже, історія свідчить про те, що було б краще санітарно обробляти входи LLM зараз, до того, як така інформація накопичиться у великій кількості, і до того, як наші LLM-підписи потраплять у постійні циклічні бази даних та/або моделі, або інші інформаційні структури та схеми.
Пам’ятайте мене?
Одним із чинників, які говорять проти використання “загальних” або санітарних промптів LLM, є те, що можливість налаштування дорогої API-LLM, такої як ChatGPT, досить приваблива, принаймні на поточному рівні розвитку технологій – але це може включати довгострокове розкриття приватної інформації.
Я часто прошу ChatGPT допомогти мені сформулювати скрипти Windows PowerShell і файли BAT для автоматизації процесів, а також щодо інших технічних питань. Для цього мені корисно, що система постійно пам’ятатиме деталі про апаратне забезпечення, яке у мене доступне; мої технічні навички (або їх відсутність); і різні інші фактори середовища та налаштувань:

ChatGPT дозволяє користувачеві розвивати «кеш» спогадів, які будуть застосовані, коли система розглядає відповіді на майбутні промпти.
Невідворотно, це зберігає інформацію про мене на зовнішніх серверах, підлягаючи умовам і положенням, які можуть змінюватися з часом, без жодної гарантії, що OpenAI (хоча це могла б бути будь-яка інша велика постачальниця LLM) відповідає умовам, які вони встановили.
Загалом, проте, можливість побудови кешу спогадів у ChatGPT найбільш корисна через обмежену увагу LLM загалом; без довгострокових (персоналізованих) вкладень користувач відчуває, що розмовляє з сутністю, яка страждає антérograde амнезією.
Невідомо, чи новіші моделі колись стануть досить продуктивними, щоб надавати корисні відповіді без потреби у кешуванні спогадів або створенні налаштованих GPT, які зберігаються онлайн.
Тимчасова амнезія
Хоча можна зробити розмови з ChatGPT “тимчасовими”, корисно мати історію чату як посилання, яке можна відфільтрувати, коли час дозволить, у більш узгоджену місцеву записку, можливо, на платформі для записок; але в будь-якому випадку ми не можемо знати точно, що відбувається з цими “відкинутими” чатами (хоча OpenAI зазначає, що вони не будуть використані для навчання, але не заявляє, що їх знищать), засновані на інфраструктурі ChatGPT.
Різні останні скандали свідчать про те, що постачальники API, такі як OpenAI, не повинні обов’язково залишатися відповідальними за захист приватності користувача, включаючи відкриття емерджентної пам’яті, що свідчить про те, що більші LLM більш схильні до повного запам’ятовування деяких прикладів навчання, і збільшення ризику розкриття даних користувача – серед інших публічних інцидентів, які переконали багато великих компаній, таких як Samsung, заборонити LLM для внутрішнього використання компанії.
Думайте інакше
Цей конфлікт між надзвичайною корисністю та явним потенційним ризиком LLM буде потребувати деяких винахідливих рішень – і пропозиція IBM здається цікавим базовим шаблоном у цьому напрямку.

Три реформулювання IBM, які балансують корисність проти захисту даних. У нижній (рóżовій) смузі ми бачимо промпт, який виходить за межі можливостей системи для санітарної обробки у значимий спосіб.
Підхід IBM перехоплює вихідні пакети до LLM на рівні мережі та переписує їх за необхідності до їхньої передачі. Більш складні інтеграції GUI, показані на початку статті, є лише ілюстрацією того, куди такий підхід міг би розвинутися, якщо його розвиватимуть.
Очевидно, що без достатньої агентності користувач може не зрозуміти, що отримує відповідь на трохи змінену версію свого початкового запиту. Ця відсутність прозорості еквівалентна брандмауеру операційної системи, який блокує доступ до веб-сайту або служби без інформування користувача, який потім може помилково шукати інші причини проблеми.
Промпти як ризики безпеки
Перспектива “втручання у промпти” аналогічна безпеці Windows OS, яка еволюціонувала від латки з (опціонально встановлених) комерційних продуктів у 1990-х роках до необов’язкової та жорстко примусової суїти мережевих інструментів захисту, які постачаються разом з установкою Windows, і які потребують певних зусиль для вимкнення або послаблення.
Якщо санітарна обробка промптів розвиватиметься так, як мережеві брандмауери за останні 30 років, пропозиція паперу IBM могла б послужити планом для майбутнього: розгортання повністю локальної LLM на машині користувача для фільтрації вихідних промптів, спрямованих на відомі LLM API. Ця система природно потребуватиме інтеграції з GUI-фреймворками та сповіщеннями, надавши користувачам контроль – якщо тільки адміністративні політики не перевершують її, як часто трапляється у бізнес-середовищах.
Дослідники провели аналіз відкритої версії набору даних ShareGPT, щоб зрозуміти, як часто порушується контекстна приватність у реальних сценаріях.
Llama-3.1-405B-Instruct був використаний як “суддівський” модель для виявлення порушень контекстної цілісності. З великого набору розмов була проаналізована підмножина однозначних розмов на основі довжини. Суддівська модель потім оцінила контекст, чутливу інформацію та необхідність виконання завдання, що призвело до виявлення розмов, які містять потенційні порушення контекстної цілісності.
Менша підмножина цих розмов, які продемонстрували явні порушення приватності контексту, була проаналізована далі.
Сам фреймворк був реалізований за допомогою моделей, які менші за типові чат-агенти, такі як ChatGPT, щоб дозволити локальне розгортання через Ollama.

Схема системи втручання у промпти.
Три LLM, які були оцінені, це Mixtral-8x7B-Instruct-v0.1; Llama-3.1-8B-Instruct; і DeepSeek-R1-Distill-Llama-8B.
Промпти користувачів обробляються фреймворком у трьох етапах: ідентифікація контексту; класифікація чутливої інформації; і переформулювання.
Було реалізовано два підходи до класифікації чутливої інформації: динамічна і структурована класифікація: динамічна класифікація визначає суттєві деталі на основі їхнього використання у конкретній розмові; структурована класифікація дозволяє вказати попередньо визначений список чутливих атрибутів, які завжди вважаються несуттєвими. Модель переформулює промпт, якщо виявляє несуттєві чутливі деталі, видаляючи або перефразовуючи їх, щоб мінімізувати ризики приватності, зберігаючи при цьому корисність.
Домашні правила
Хоча структурована класифікація як концепція не добре проілюстрована у папері IBM, вона найбільш подібна до методу “Приватні визначення даних” ініціативи Private Prompts, яка надає завантажувану самостійну програму, яка може переписати промпти – хоча без можливості безпосередньо втрутитися на рівні мережі, як підхід IBM (замість цього користувач повинен скопіювати та вставити змінені промпти).

Виконуваний файл Private Prompts дозволяє користувачеві програмувати автоматичні заміни для тексту, введеного користувачем.
У вищезазначеному зображенні ми бачимо, що користувач Private Prompts може програмувати автоматичні заміни для екземплярів чутливої інформації. У обох випадках, для Private Prompts та методу IBM, здається малоймовірним, що користувач з достатнім присутнім розумом і особистим інсайтом, щоб курирувати такий список, фактично потребуватиме цього продукту – хоча його можна побудувати впродовж часу, коли інциденти накопичуються.
У ролі адміністратора структурована класифікація могла б працювати як накладений брандмауер або цензор для працівників; і у домашній мережі вона могла б, з деякими складними налаштуваннями, стати домашнім фільтром мережі для всіх користувачів мережі; однак, в кінцевому підсумку, цей метод аргументується як надлишковий, оскільки користувач, який міг би правильно налаштувати це, також міг би ефективно самоціензуритися спочатку.
Відгук ChatGPT
Оскільки ChatGPT недавно запустив свій глибокий дослідницький інструмент для платних користувачів, я використав цю можливість, щоб попросити ChatGPT переглянути пов’язану літературу та надати “цинічний” погляд на папір IBM. Я отримав найбільш оборонний і зневажливий відповідь, яку система коли-небудь давала, коли її просили оцінити або проаналізувати нову публікацію:

ChatGPT-4o має низьку думку про проект IBM.
‘Якщо користувачі не довіряють OpenAI, Google чи Anthropic керувати їхніми даними відповідально,’ ChatGPT стверджує. ‘чому вони довіряють третьому програмному шару між ними та AI? Посередник сам стає новою точкою відмови – потенційно реєструючи, неправильно обробляючи або навіть витікаючи дані до того, як вони коли-небудь досягнуть LLM. Це нічого не розв’язує, якщо воно просто створює новий суб’єкт для експлуатації даних користувача.’
Ця об’єктивція здається самозахисною та непридатною, враховуючи багаторічну історію відкритих проектів, які дійсно приносять користь кінцевим користувачам завдяки зусиллям спільноти розробників та учасників; і враховуючи зростаючий потенціал мобільних пристроїв для запуску – і навіть навчання – легких LLM. Безумовно, у цьому випадку випадок використання не надто вимогливий.
Далі ChatGPT впевнено пропускає суть питання про наявність легкої LLM для нагляду за входом до комерційної LLM, яку не можна запустити на локальній машині (через те, що LLM занадто велика, а надання локального доступу є занадто ризикованим для компанії, яка її робить):
‘Ефективна фільтрація приватності вимагає розуміння входу перед тим, як вирішити, що видалити. Якщо посередник достатньо розумний, щоб визначити чутливу інформацію (ім’я, адресу, фінансові деталі), то він вже обробляє та аналізує цю інформацію – тобто він повинен зберігати або вивчати саме те, що він повинен видалити.
‘Це вводить парадокс: а) Глупий фільтр (базова заміна за допомогою регулярних виразів) буде неефективним і пропустить тонкі ризики приватності. б) Розумний фільтр (LLM-орієнтований переписувач) повинен обробляти весь вхід, роблячи його таким же небезпечним, як і оригінальний LLM.
‘Якщо ви довіряєте посереднику достатньо, щоб прочитати та переписати ваші входи, чому б не довіряти самому LLM?’
Відповідь на останнє питання полягає в тому, що локальна LLM призначена бути повністю на боці користувача, і, безумовно, відкритою, з мінімальними або нульовими потребами у мережевому доступі. Еквівалентна комерційна версія, хоч би наскільки доброзичлива на початку, в кінцевому підсумку буде вразлива до корпоративних зсувів та змін умов обслуговування, тоді як відповідна відкрита ліцензія запобігатиме цьому типу “корупції”.
ChatGPT далі стверджував, що пропозиція IBM “перебиває намір користувача”, оскільки вона могла б переінтерпретувати промпт у альтернативу, яка впливає на його корисність. Однак, це є більш широкою проблемою у санітарній обробці промптів, і не специфічною для цього конкретного використання.
У підсумку (ігноруючи його пропозицію використовувати локальні LLM “замість”, що саме пропонується у папері IBM), ChatGPT висловив думку, що підхід IBM представляє бар’єр для прийняття через “фрикцію користувача” при реалізації методів попередження та редагування у чаті.
Тут ChatGPT, можливо, правий; але якщо значний тиск буде прикладений через подальші публічні інциденти або якщо прибутки в одному географічному регіоні будуть загрожувати через зростаючу регуляцію (і компанія відмовиться просто покинути постраждалу область цілком), історія споживчої техніки свідчить про те, що заходи безпеки в кінцевому підсумку перестануть бути необов’язковими будь-як.
Висновок
Ми не можемо реально очікувати, що OpenAI колись реалізує заходи безпеки типу тих, які пропонуються у папері IBM, і в центральній концепції, яку він пропонує; принаймні не ефективно.
І, безумовно, не глобально; як і Apple (AAPL ) блокує певні функції iPhone в Європі, і LinkedIn має різні правила для експлуатації даних користувачів у різних країнах, можна припустити, що будь-яка AI-компанія буде застосовувати найбільш прибуткові умови та положення, які є прийнятними для будь-якої країни, в якій вона діє – у кожному випадку, за рахунок права користувача на захист даних, якщо це необхідно. Першопубліковано четверга, 27 лютого 2025 р. Оновлено четверга, 27 лютого 2025 р. 15:47:11 через неправильне посилання, пов’язане з Apple – MA












