Погляд Anderson

Викрадення моделей машинного навчання через вивід API

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження з Канади пропонують можливий метод, за допомогою якого атакувальники можуть викрасти плоди дорогих рамок машинного навчання, навіть якщо є доступ лише до пропрієтарної системи через високо санітарний і, як видається, добре захищений API (інтерфейс або протокол, який обробляє запити користувача на стороні сервера і повертає лише відповідь виводу).

Як дослідницький сектор все частіше орієнтується на монетизацію дорогого навчання моделей через реалізації Machine Learning as a Service (MLaaS), нова робота припускає, що Самоорганізоване навчання (SSL) моделі більш вразливі до цього типу викрадення моделей, оскільки вони тренуються без міток користувача, що спрощує витягування, і зазвичай повертають результати, які містять велику кількість корисної інформації для когось, хто бажає повторити (прихований) джерельну модель.

У “чорних скринінгах” (де дослідники надали собі жодного доступу до місцевої “жертви” моделі, окрім того, який має типовий кінцевий користувач через веб-API), дослідники змогли повторити цільові системи з відносно низькими ресурсами:

‘[Наші] атаки можуть викрасти копію моделі жертви, яка досягає суттєвої продуктивності вниз за менш ніж 1/5 запитів, використаних для навчання моделі жертви. Проти моделі жертви, навченої на 1,2 млн немітованих зразків з ImageNet, з точністю 91,9% на задачі класифікації Fashion-MNIST, наш прямі атака на витягування з втратою InfoNCE викрала копію кодувача, який досягає 90,5% точності за 200 тис. запитів.

‘Аналогічно, проти моделі жертви, навченої на 50 тис. немітованих зразків з CIFAR10, з точністю 79,0% на задачі класифікації CIFAR10, наш прямі атака на витягування з втратою SoftNN викрала копію, яка досягає 76,9% точності за 9 тис. запитів.’

Дослідники використовували три методи атак, знайшовши, що 'Пряме витягування' було найбільш ефективним. Ці моделі були викрадені з локально повтореної моделі кодувача CIFAR10 за допомогою 9 тис. запитів з тестової вибірки CIFAR10. Джерело: https://arxiv.org/pdf/2205.07890.pdf

Дослідники використовували три методи атак, знайшовши, що ‘Пряме витягування’ було найбільш ефективним. Ці моделі були викрадені з локально повтореної моделі кодувача CIFAR10 за допомогою 9 тис. запитів з тестової вибірки CIFAR10. Джерело: https://arxiv.org/pdf/2205.07890.pdf

Дослідники також зазначають, що методи, які підходять для захисту моделей, навчених під наглядом, не адаптуються добре до моделей, навчених на основі ненадгледжуваного навчання – хоча такі моделі представляють деякі з найбільш очікуваних і святкових плодів сектора синтезу зображень.

Нова робота називається Про труднощі захисту самоорганізованого навчання проти витягування моделей, і походить від Університету Торонто та Інституту векторної інформатики.

Самоусвідомлення

У самоорганізованому навчанні модель тренується на немітованих даних. Без міток модель SSL повинна вивчити асоціації та групи з неявної структури даних, шукаючи подібні аспекти даних і поступово збираючи ці аспекти в вузли чи представлення.

Коли підхід SSL є життєздатним, він неймовірно продуктивний, оскільки він обходить потребу у дорогій (часто аутсорсинговій та спірній) категоризації людьми, і фактично раціоналізує дані автономно.

Три підходи SSL, розглянуті авторами нової роботи, це SimCLR, Сіамська мережа; SimSiam, інша сіамська мережа, центрована на вивченні представлень; і Barlow Twins, підхід SSL, який досяг найкращої відомої продуктивності класифікатора ImageNet на момент його виходу у 2021 році.

Витягування моделей для мітованих даних (тобто моделі, навченої під наглядом) відносно документована галузь досліджень. Це також легше захистити від нього, оскільки атакувальник повинен отримати мітки від моделі жертви, щоб відтворити її.

Модель атаки 'кнопка класифікатора' проти архітектури навчання під наглядом. Джерело: https://arxiv.org/pdf/1812.02766.pdf

З попередньої роботи, модель атаки ‘кнопка класифікатора’ проти архітектури навчання під наглядом. Джерело: https://arxiv.org/pdf/1812.02766.pdf

Без білої коробки це не є тривіальною задачею, оскільки типовий вивід від запиту API до такої моделі містить менше інформації, ніж з типовим виводом SSL API.

З паперу*:

‘Минулі роботи щодо витягування моделей зосередилися на умовах навчання під наглядом, де модель жертви зазвичай повертає мітку або інші низьковимірні виводи, такі як оцінки впевненості або логіти.

‘На відміну від цього, кодувачі SSL повертають високовимірні представлення; де-факто вивід для моделі ResNet-50 Sim-CLR, популярної архітектури в галузі зору, є 2048-вимірний вектор.

‘Ми гіпотезуємо, що це значно вище витік інформації з кодувачів робить їх більш вразливими до атак на витягування, ніж моделі SL.’

Архітектура та дані

Дослідники протестували три підходи до витягування моделей SSL: Пряме витягування, при якому вивід API порівнюється з виводом локальної моделі через відповідну функцію втрат, таку як середня квадратична похибка (MSE); відтворення голови проєкції, де важлива аналітична функція моделі, зазвичай викинута до розгортання, повторно збирається і використовується в репліці моделі; і доступ до голови проєкції, який можливий лише в тих випадках, коли оригінальні розробники надали архітектуру.

У методі #1, Пряме витягування, вивід моделі жертви порівнюється з виводом локальної моделі; метод #2 включає в себе відтворення голови проєкції, використаної в оригінальній архітектурі навчання (і зазвичай не включеної в розгорнуту модель).

У методі #1, Пряме витягування, вивід моделі жертви порівнюється з виводом локальної моделі; метод #2 включає в себе відтворення голови проєкції, використаної в оригінальній архітектурі навчання (і зазвичай не включеної в розгорнуту модель).

Дослідники виявили, що Пряме витягування було найбільш ефективним методом для отримання функціональної копії цільової моделі, і має додаткову перевагу у тому, що воно найважче характеризувати як “атаку” (оскільки воно практично не відрізняється від типового і валідного кінцевого користувача).

Автори тренували моделі жертви на трьох наборах зображень: CIFAR10, ImageNet і Stanford’s Street View House Numbers (SVHN). ImageNet був навчений на ResNet50, тоді як CIFAR10 і SVHN були навчені на ResNet18 і ResNet24 за допомогою вільної реалізації SimCLR у PyTorch.

Продуктивність моделей внизу (тобто розгорнута) була протестована проти CIFAR100, STL10, SVHN і Fashion-MNIST. Дослідники також експериментували з більш “білою коробкою” методами привласнення моделей, хоча виявилося, що Пряме витягування, найменш привілейований підхід, дав найкращі результати.

Для оцінки представлень, які витягуються і повторюються в атаках, автори додали лінійний шар передбачення до моделі, який був донастроювався на повному мітковому навчальному наборі з подальшої (низової) задачі, при цьому інші шари мережі були заморожені. Таким чином, точність тестового прогнозування може функціонувати як метрика продуктивності. Оскільки вона нічого не внесла до процесу висновку, це не представляє “білу коробку” функціональності.

Результати тестових прогонів, здійснені завдяки (не внесенню) Лінійному оцінюванню. Точності в жирному шрифті.

Результати тестових прогонів, здійснені завдяки (не внесенню) Лінійному оцінюванню. Точності в жирному шрифті.

Коментуючи результати, дослідники заявляють:

‘Ми знаходимо, що пряма мета імітації представлень жертви дає високу продуктивність на низових задачах, незважаючи на те, що атака вимагає лише частини (менше 15% у деяких випадках) кількості запитів, необхідних для навчання викраденої моделі спочатку.’

І продовжують:

‘[Це] складно захистити кодувачі, навчені SSL, оскільки вивід представлень витікає суттєву кількість інформації. Найбільш перспективними захистами є реактивні методи, такі як водяні знаки, які можуть вбудовувати конкретні доповнення у високоякісні кодувачі.’

 

* Моє перетворення внутрішніх посилань статті на гіперпосилання.

Перша публікація 18 травня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai