Погляд Anderson
MLaaS: Запобігання крадіжці моделей API за допомогою варіаційних автоенкодерів

Машинне навчання як сервіс (MLaaS) комерціалізує результати дорогих досліджень та навчання моделей через API, які надають клієнтам доступ до висновків системи. Хоча логіка системи визначається до певної міри через ці транзакції, основна архітектура моделі, ваги, які визначають корисність моделі, та конкретні навчальні дані, які зробили її корисною, охороняються через кілька причин.
По-перше,.framework, ймовірно, використовував ряд вільних або відкритих джерел коду, і потенційні суперники могли б зробити те саме в пошуках тих самих цілей; по-друге, у багатьох випадках ваги, використовувані моделями, представляють 95% або більше можливості моделі інтерпретувати навчальні дані краще, ніж суперницькі моделі, і, ймовірно, становлять основну цінність дорогих інвестицій, як у вигляді дослідницьких годин, так і у високомасштабному, добре оснащеному навчанні моделей на промислових GPU.
Також, поєднання власних і публічних даних за моделлю навчання є потенційно вибуховим питанням: де дані є “оригінальною” роботою, отриманою через дорогі методи, можливість користувача API вивести структуру даних або вміст через запит API може дозволити їм фактично реконструювати цінність роботи, або шляхом розуміння схеми даних (що дозволяє практичну репродукцію), або шляхом відтворення ваг, які оркеструють особливості даних, що потенційно дозволяє відтворити “пусту”, але ефективну архітектуру, в яку можна корисно обробляти подальший матеріал.
Відмивання даних
Далі, спосіб, у який дані абстрагуються у латентному просторі моделі машинного навчання під час навчання, фактично “відмивають” їх у узагальнені функції, що робить важким для власників авторських прав зрозуміти, чи була їхня оригінальна робота асімільована без дозволу в модель.
Поточна лезе-фер атмосфера у світі щодо цієї практики, ймовірно, буде піддаватися все більш жорсткій регуляції протягом наступних 5-10 років. Проєкт регуляцій ЄС щодо штучного інтелекту вже містить обмеження щодо походження даних та прозорості, які зроблять важким для компаній, що збирають дані, обійти регуляції щодо веб-скрапінгу для дослідницьких цілей. Інші уряди, включаючи США, тепер відмовляються від подібних регуляторних рамок на довгий термін.
По мірі того, як галузь машинного навчання розвивається від культури доказів концепції до життєздатної комерційної екосистеми, моделі машинного навчання, які виявилися порушенням обмежень на дані, навіть у ранніх ітераціях своїх продуктів, можуть виявитися юридично вразливими.
Отже ризик виведення джерел даних через запит API стосується не тільки промислової шпигунства через інверсію моделі та інші методи, але й, ймовірно, до нових судових методів захисту інтелектуальної власності, які можуть вплинути на компанії після закінчення “дикого заходу” епохи досліджень машинного навчання.
API-індукована екзфільтрація як засіб розробки атакувальної атаки
Деякі рамки машинного навчання постійно оновлюють свої навчальні дані та алгоритми, а не виводять остаточну, довгострокову модель з великого корпусу історичних даних (як у випадку з GPT-3, наприклад). До них належать системи, пов’язані з інформацією про рух, та інші галузі, де реальний час даних критичний для тривалої цінності послуги ML.
Якщо логіка моделі або вагове визначення можна “відобразити” шляхом систематичного опитування через API, ці фактори потенційно можуть бути використані проти системи у вигляді атакувальних атак, де зловмисно створені дані можуть бути залишені у дикому вигляді в місцях, де цільова система, ймовірно, їх підхопить; або шляхом проникнення в процедури закупівлі даних іншими методами.
Отже заходи проти API-центричної картографії мають наслідки також для безпеки моделей машинного навчання.
Запобігання API-індукованій екзфільтрації
За останні роки з’явилося кілька дослідницьких ініціатив, спрямованих на розробку методологій, які можуть запобігти виведенню архітектури моделі та конкретних джерел даних через запит API. Остання з них описана у попередньому співробітництві між дослідниками Індійського інституту науки в Бангалорі та Nference, штучно-інтелектуальною програмною платформою, розташованою в Кембриджі, штат Массачусетс.
Названа Станова детекція атак на витяг моделей, дослідження пропонує систему під назвою VarDetect, для якої попередній код було опубліковано на GitHub.
VarDetect безперервно моніторить запити користувачів до API, шукаючи три різних шаблони атак на витяг моделей. Дослідники повідомляють, що VarDetect є першою оборонною механізмом свого роду, який витримує всі три типи. Крім того, він може протидіяти контрзаходам атакувальників, які стають відомими про оборонний механізм і намагаються його обійти, збільшуючи кількість запитів, щоб заплутати запити, які намагаються створити карту моделі.
VarDetect використовує варіаційні автоенкодери (VAE), щоб ефективно створити евристичний оцінювальний зонд для вхідних запитів. На відміну від попередніх методів, система тренується на власних даних, що усуває потребу у доступі до даних атакувальників, слабкість попередніх підходів, і малоймовірний сценарій.

Модель, розроблена для проекту, походить від трьох публічних наборів даних або підходів: роботи, розробленої у 2016 році Швейцарським федеральним технологічним інститутом та Cornell Tech; додаванням шуму до “проблемної області” даних, вперше продемонстрованим у папері PRADA 2017 року дослідження з Фінляндії; та爬ленням публічних зображень, надихнутим дослідженням ActiveThief 2020 року дослідження від Індійського інституту науки.

Порівняння доброзичливих та ‘зловмисних’ зразків даних по п’яти наборам даних, використаним у VarDetect.
Частотні розподіли, які відповідають характеристикам з набору даних на борту, будуть позначені як сигнали витягування.
Дослідники визнають, що звичайні шаблони запитів від доброзичливих користувачів можуть потенційно спровокувати хибні позитиви в системі, запобігання нормальному використанню. Отже такі сприйняті “безпечні” сигнали можуть згодом бути додані до набору даних VarDetect, стаючи частиною алгоритму через роликовий графік навчання, залежно від переваг системи-господаря.













