Взгляд Anderson

Кража моделей машинного обучения через вывод API

mm
Добавьте Unite.AI в избранные источники в Google

Новые исследования канадских ученых предлагают возможный метод, с помощью которого злоумышленники могут украсть результаты дорогостоящих моделей машинного обучения, даже если доступ к проприетарной системе осуществляется только через высоко санитарный и, казалось бы, хорошо защищенный API (интерфейс или протокол, обрабатывающий запросы пользователей на стороне сервера и возвращающий только ответ на вывод).

По мере того, как исследовательский сектор все больше ориентируется на монетизацию дорогостоящей подготовки моделей с помощью реализаций Machine Learning as a Service (MLaaS), новая работа предполагает, что модели самообучения (SSL) более уязвимы для такого рода экстракции моделей, поскольку они обучаются без меток, что упрощает извлечение, и обычно предоставляют результаты, содержащие большое количество полезной информации для человека, желающего воспроизвести (скрытую) исходную модель.

В симуляциях “черного ящика” (где исследователи предоставили себе доступ к местной “жертве” модели, не имея больше доступа, чем обычный пользователь через веб-API), исследователи смогли воспроизвести целевые системы с относительно низкими ресурсами:

‘[Наш] метод может украсть копию модели жертвы, которая достигает значительной производительности в менее чем 1/5 запросов, использованных для обучения модели жертвы. Против модели жертвы, обученной на 1,2 миллиона не помеченных образцов из ImageNet, с точностью 91,9% на задаче классификации Fashion-MNIST, наш прямой метод экстракции с функцией потерь InfoNCE украл копию кодировщика, который достигает точности 90,5% за 200 тысяч запросов.

‘Аналогично, против модели жертвы, обученной на 50 тысяч не помеченных образцов из CIFAR10, с точностью 79,0% на задаче классификации CIFAR10, наш прямой метод экстракции с функцией потерь SoftNN украл копию, которая достигает точности 76,9% за 9 тысяч запросов.’

Исследователи использовали три метода атаки, обнаружив, что 'Прямая экстракция' была наиболее эффективной. Эти модели были украдены из локально воссозданной модели жертвы CIFAR10 с использованием 9 тысяч запросов из тестового набора CIFAR10. Источник: https://arxiv.org/pdf/2205.07890.pdf

Исследователи использовали три метода атаки, обнаружив, что ‘Прямая экстракция’ была наиболее эффективной. Эти модели были украдены из локально воссозданной модели жертвы CIFAR10 с использованием 9 тысяч запросов из тестового набора CIFAR10. Источник: https://arxiv.org/pdf/2205.07890.pdf

Исследователи также отметили, что методы, которые подходят для защиты моделей, обученных с учителем, не хорошо адаптируются к моделям, обученным на основе самообучения – хотя такие модели представляют собой некоторые из наиболее ожидаемых и празднуемых результатов сектора синтеза изображений.

Новая работа озаглавлена О трудности защиты самообучения от экстракции моделей, и исходит из Университета Торонто и Института векторных вычислений искусственного интеллекта.

Самоосознание

В самообучении модель обучается на не помеченных данных. Без меток модель самообучения должна учиться ассоциациям и группам из неявной структуры данных, ища подобные аспекты данных и постепенно сгруппировывая их в узлы или представления.

Где подход самообучения является жизнеспособным, он невероятно продуктивен, поскольку он обходит необходимость в дорогостоящей (часто аутсорсинговой и спорной) категоризации с помощью краудворкеров, и по сути рационализирует данные автономно.

Три подхода самообучения, рассмотренные авторами новой работы, являются SimCLR, Сиамская сеть; SimSiam, еще одна сиамская сеть, центрированная на обучении представлений; и Barlow Twins, подход самообучения, который достиг государственного уровня классификатора ImageNet на выпуске в 2021 году.

Экстракция моделей для помеченных данных (т.е. модели, обученной с помощью обучения с учителем) является относительно хорошо документированной областью исследований. Она также легче защитить, поскольку атакующий должен получить метки из модели жертвы, чтобы воссоздать ее.

Модель атаки 'nockoff-классификатор' против архитектуры обучения с учителем. Источник: https://arxiv.org/pdf/1812.02766.pdf

Из предыдущей работы, модель атаки ‘nockoff-классификатор’ против архитектуры обучения с учителем. Источник: https://arxiv.org/pdf/1812.02766.pdf

Без белого ящика это не является тривиальной задачей, поскольку типичный вывод из запроса API к такой модели содержит меньше информации, чем типичный вывод SSL API.

Из работы*:

‘Предыдущие работы по экстракции моделей были сосредоточены на настройке обучения с учителем, где модель жертвы обычно возвращает метку или другие низкоразмерные выводы, такие как оценки уверенности или логиты.

‘Напротив, модели самообучения возвращают высокоразмерные представления; де-факто вывод для модели ResNet-50 Sim-CLR, популярной архитектуры в области зрения, является 2048-мерным вектором.

‘Мы гипотетизируем, что это значительно большая утечка информации из кодировщиков делает их более уязвимыми для атак экстракции, чем модели обучения с учителем.’

Архитектура и данные

Исследователи протестировали три подхода к выводу/экстракции моделей самообучения: Прямая экстракция, при которой вывод API сравнивается с выводом воссозданной модели через подходящую функцию потерь, такую как среднеквадратическая ошибка (MSE); воссоздание головки проекции, где важная аналитическая функциональность модели, обычно отбрасываемая перед развертыванием, воссоздается и используется в реплике модели; и доступ к головке проекции, который возможен только в случаях, когда оригинальные разработчики сделали архитектуру доступной.

В методе #1, Прямая экстракция, вывод модели жертвы сравнивается с выводом локальной модели; метод #2 включает воссоздание головки проекции, использованной в исходной архитектуре обучения (и обычно не включенной в развернутую модель).

В методе #1, Прямая экстракция, вывод модели жертвы сравнивается с выводом локальной модели; метод #2 включает воссоздание головки проекции, использованной в исходной архитектуре обучения (и обычно не включенной в развернутую модель).

Исследователи обнаружили, что Прямая экстракция была наиболее эффективным методом для получения функциональной реплики целевой модели, и имеет дополнительное преимущество в том, что она наиболее трудна для характеризации как ‘атака’ (поскольку она по сути ведет себя мало отлично от типичного и действительного конечного пользователя).

Авторы обучили модели жертвы на трех наборах изображений: CIFAR10, ImageNet, и Stanford’s Street View House Numbers (SVHN). ImageNet была обучена на ResNet50, в то время как CIFAR10 и SVHN были обучены на ResNet18 и ResNet24 с помощью свободно доступной реализации SimCLR на PyTorch.

Производительность моделей в развернутом виде (т.е. при развертывании) была протестирована против CIFAR100, STL10, SVHN и Fashion-MNIST. Исследователи также экспериментировали с более ‘белыми ящиками’ методами присвоения моделей, хотя оказалось, что Прямая экстракция, наименее привилегированный подход, дала лучшие результаты.

Чтобы оценить представления, выводимые и реплицируемые в атаках, авторы добавили линейный прогностический слой к модели, который был дообучен на полном помеченном обучающем наборе из последующей (развернутой) задачи, при этом остальные слои сети были заморожены. Таким образом, точность тестирования на прогностическом слое может служить метрикой производительности. Поскольку она не вносит вклад в процесс вывода, это не представляет ‘белый ящик’ функциональности.

Результаты тестирования, полученные с помощью (не вносящего вклад) линейного слоя оценки. Точность в жирном шрифте.

Результаты тестирования, полученные с помощью (не вносящего вклад) линейного слоя оценки. Точность в жирном шрифте.

Комментируя результаты, исследователи заявляют:

‘Мы обнаружили, что прямая цель имитации представлений жертвы дает высокую производительность на задачах, несмотря на то, что атака требует только доли (менее 15% в определенных случаях) количества запросов, необходимых для обучения украденной модели в первую очередь.’

И продолжают:

‘[Это] является сложной задачей защитить кодировщики, обученные с помощью самообучения, поскольку вывод представлений утечет значительное количество информации. Наиболее перспективными оборонами являются реактивные методы, такие как водяные знаки, которые могут внедрять конкретные дополнения в кодировщики с высокой емкостью.’

 

* Мое преобразование внутренних цитат работы в гиперссылки.

Опубликовано впервые 18 мая 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai