Взгляд Anderson
MLaaS: Предотвращение кражи моделей API с помощью вариационных автоэнкодеров

Машинное обучение как услуга (MLaaS) коммерциализирует результаты дорогостоящих исследований и обучения моделей через API, которые предоставляют клиентам доступ к выводам системы. Хотя логика системы неизбежно раскрывается до некоторой степени через эти транзакции, основная архитектура модели, веса, определяющие полезность модели, и конкретные данные обучения, которые сделали ее полезной, охраняются из-за нескольких причин.
Во-первых,框架, вероятно, использовал ряд бесплатных или открытых исходных кодов (FOSS) репозиториев, и потенциальные конкуренты могли бы легко сделать то же самое в погоне за одной и той же целью; во-вторых, в многих случаях веса, используемые моделями, представляют 95% или более способности модели интерпретировать данные обучения лучше, чем конкурирующие модели, и, по сути, составляют основную ценность дорогостоящих инвестиций, как в плане исследовательских часов, так и в плане крупномасштабного, хорошо оснащенного обучения моделей на промышленных GPU.
Кроме того, смесь проприетарных и публичных данных за моделью является потенциально взрывоопасным вопросом: когда данные являются “оригинальной” работой, полученной через дорогостоящие методы, возможность пользователя API сделать вывод о структуре или содержании данных через запросы API может позволить им по сути воспроизвести ценность работы, либо понимая схему данных (что позволяет практически воспроизвести), либо воспроизводя веса, которые оркестрируют особенности данных, что потенциально позволяет воспроизвести “пустую”, но эффективную архитектуру, в которую можно будет полезно обработать последующие материалы.
Отмывание данных
Более того, то, как данные абстрагируются в латентном пространстве модели машинного обучения во время обучения, эффективно “отмывает” их в обобщенные функции, которые делают трудным для правообладателей понять, была ли их оригинальная работа ассимилирована без разрешения в модель.
Текущая лэзе-фэр климат во всем мире в отношении этой практики, вероятно, будет подвергаться все более сильной регуляции в течение следующих 5-10 лет. Проект регуляций ЕС для ИИ уже содержит ограничения о происхождении данных и предполагаемую прозрачную структуру, которая сделает трудным для компаний, собирающих данные, обойти правила домена о веб-скрапинге для исследовательских целей. Другие правительства, включая США, теперь обязуются аналогичным регуляторным рамкам в долгосрочной перспективе.
По мере того, как область машинного обучения эволюционирует от культуры доказательства концепции к жизнеспособной коммерческой экосистеме, модели машинного обучения, найденные с нарушениями ограничений на данные, даже в ранних итерациях своих продуктов, могут обнаружить себя юридически уязвимыми.
Следовательно, риск вывода источников данных через вызовы API относится не только к промышленному шпионажу через инверсию модели и другие методы, но, по сути, к возникающим судебным методам защиты интеллектуальной собственности, которые могут повлиять на компании после окончания “дикого запада” эпохи исследований машинного обучения.
API-Driven Exfiltration as a Means to Develop Adversarial Attack
Некоторые фреймворки машинного обучения постоянно обновляют свои данные обучения и алгоритмы, а не получают определительную, долгосрочную единую модель из большого корпуса исторических данных (как, например, GPT-3). К ним относятся системы, связанные с информацией о трафике, и другие секторы, где данные в реальном времени имеют решающее значение для продолжающейся ценности услуги машинного обучения.
Если логика или веса модели могут быть “отображены” путем систематического опроса через API, эти факторы потенциально могут быть использованы против системы в виде атак соперников, где злонамеренно созданные данные могут быть оставлены в дикой природе, в областях, где целевая система, вероятно, их обнаружит; или путем проникновения в процедуры сбора данных другими методами.
Следовательно, меры против API-центрированного отображения имеют последствия также для безопасности моделей машинного обучения.
Предотвращение API-Driven Exfiltration
Несколько исследовательских инициатив возникли в последние годы, чтобы предоставить методологии, которые могут предотвратить вывод архитектуры модели и конкретных источников данных через вызовы API. Последняя из них изложена в предварительной совместной работе исследователей из Индийского института науки в Бангалоре и Nference, платформы программного обеспечения на основе ИИ, базирующейся в Кембридже, штат Массачусетс.
Названная Stateful Detection of Model Extraction Attacks, исследование предлагает систему под названием VarDetect, для которой предварительный код был опубликован на GitHub.
Работая на стороне сервера, VarDetect непрерывно отслеживает запросы пользователей к API, ищет три различных шаблона атак по извлечению модели. Исследователи сообщают, что VarDetect является первым механизмом защиты, который выдерживает все три типа. Кроме того, он может противостоять контрмерам атакующих, которые осознают механизм защиты и пытаются его обойти, скрывая шаблоны атак паузами или увеличивая объем запросов, чтобы скрыть запросы, которые пытаются построить карту модели.
VarDetect использует вариационные автоэнкодеры (VAE), чтобы эффективно создать эвристику-стиль оценки для входящих запросов. В отличие от предыдущих методов, система обучается на проприетарных данных, исключая необходимость доступа к данным атакующих, слабость предыдущих подходов, и маловероятный сценарий.

Пользовательская модель, разработанная для проекта, получена из трех публично доступных наборов данных или подходов: работы, разработанной в 2016 году Швейцарским федеральным технологическим институтом и Cornell Tech; добавляя шум к “проблемному домену” данных, как впервые продемонстрировано в PRADA-папке 2017 года из Финляндии; и ползая публично доступными изображениями, вдохновленными исследованиями ActiveThief 2020 года из Индийского института науки.

Сравнение безобидных и ‘злокачественных’ образцов данных по пяти наборам данных, использованным в VarDetect.
Частотные распределения, соответствующие характеристикам набора данных на борту, будут помечены как сигналы извлечения.
Исследователи признают, что обычные шаблоны запросов от безобидных пользователей могут потенциально вызвать ложные положительные результаты в системе, предотвращая нормальное использование. Следовательно, такие воспринимаемые “безопасные” сигналы могут быть добавлены в набор данных VarDetect, став частью алгоритма через расписание обучения, в зависимости от предпочтений системы-хозяина.













