Andersonův úhel

Krádež modelů strojového učení prostřednictvím výstupu API

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Kanady nabízí možný způsob, jak útočníci mohli ukrást výsledky drahých rámců strojového učení, i když mají přístup pouze k proprietárnímu systému prostřednictvím vysoce sanitizovaného a zdánlivě dobře chráněného API (rozhraní nebo protokolu, který zpracovává dotazy uživatelů na serverové straně a vrací pouze odpověď).

Jak se výzkumný sektor stále více zaměřuje na monetizaci nákladného školení modelů prostřednictvím implementací Machine Learning as a Service (MLaaS), nové práce naznačují, že Samoučící se učení (SSL) modely jsou náchylnější k tomuto typu extrakce modelu, protože jsou školeny bez uživatelských popisků, což usnadňuje extrakci a obvykle poskytují výsledky, které obsahují大量 informací pro někoho, kdo chce replikovat (skrytý) zdroj modelu.

V ‘black box’ testovacích simulacích (kde výzkumníci sami sobě poskytli přístup k místnímu ‘oběť’ modelu pouze prostřednictvím webového API), výzkumníci byli schopni replikovat cílové systémy s relativně nízkými zdroji:

‘[Naše] útoky mohou ukrást kopii oběti modelu, který dosahuje značného výkonu v méně než 1/5 dotazů, které se používají k výcviku oběti. Proti oběti modelu, který byl vyškoleno na 1,2M nelabelovaných vzorků z ImageNet, s 91,9% přesností na downstream úkolu Fashion-MNIST klasifikace, náš přímý extrakční útok s InfoNCE ztrátou ukradl kopii encoderu, který dosahuje 90,5% přesnosti v 200K dotazech.

‘Podobně, proti oběti, která byla vyškolena na 50K nelabelovaných vzorků z CIFAR10, s 79,0% přesností na downstream úkolu CIFAR10 klasifikace, náš přímý extrakční útok s SoftNN ztrátou ukradl kopii, která dosahuje 76,9% přesnosti v 9 000 dotazech.’

Výzkumníci použili tři útočné metody, zjistili, že 'Direct Extraction' byla nejúčinnější. Tyto modely byly ukradeny z místně rekreovaného CIFAR10 oběti encoderu pomocí 9 000 dotazů z CIFAR10 testovací sady. Zdroj: https://arxiv.org/pdf/2205.07890.pdf

Výzkumníci použili tři útočné metody, zjistili, že ‘Direct Extraction’ byla nejúčinnější. Tyto modely byly ukradeny z místně rekreovaného CIFAR10 oběti encoderu pomocí 9 000 dotazů z CIFAR10 testovací sady. Zdroj: https://arxiv.org/pdf/2205.07890.pdf

Výzkumníci také poznamenali, že metody, které jsou vhodné pro ochranu dohlížených modelů před útoky, se nehodí dobře pro modely školené na základě nesupervizovaného učení – ačkoli takové modely představují některé z nejvíce očekávaných a oslavovaných plodů obrazové syntézy.

Nová práce se jmenuje O obtížnosti obrany Samoučícího se učení proti extrakci modelu, a pochází z University of Toronto a Vector Institute for Artificial Intelligence.

Sebevědomí

V Samoučícím se učení je model školen na nelabelovaných datech. Bez popisků musí model SSL naučit asociace a skupiny z implicitní struktury dat, hledat podobné aspekty dat a postupně je seskupovat do uzlů, nebo reprezentací.

Kde je přístup SSL proveditelný, je to neuvěřitelně produktivní, protože obejde potřebu drahé (často outsourcovat a kontroverzní) kategoriizace pomocí davových pracovních sil, a vlastně racionalizuje data autonomně.

Tři přístupy SSL, které autoři nové práce zvažují, jsou SimCLR, Siamese Network; SimSiam, další Siamese Network zaměřený na učení reprezentací; a Barlow Twins, přístup SSL, který dosáhl nejlepšího výkonu ImageNet klasifikátoru na jeho vydání v roce 2021.

Extrakce modelu pro labelovaná data (tj. model školený prostřednictvím dohlíženého učení) je relativně dokumentovaná oblast výzkumu. Je také snazší bránit se proti němu, protože útočník musí získat popisky z oběti modelu, aby mohl replikovat jej.

Model útočného 'knockoff klasifikátoru' proti architektuře dohlíženého učení. Zdroj: https://arxiv.org/pdf/1812.02766.pdf

Model útočného ‘knockoff klasifikátoru’ proti architektuře dohlíženého učení. Zdroj: https://arxiv.org/pdf/1812.02766.pdf

Bez bílého boxu přístupu není to triviální úkol, protože typický výstup z API požadavku na takový model obsahuje méně informací než typický SSL API.

Z práce*:

‘Minulé práce na extrakci modelu se zaměřily na nastavení Dohlíženého učení (SL), kde oběti model obvykle vrací popisek nebo jiné nízko-rozlišené výstupy, jako skóre důvěry nebo logits.

‘Naopak, SSL kodéry vrací vysoké-rozlišené reprezentace; de facto výstup pro ResNet-50 Sim-CLR model, populární architekturu ve vidění, je 2048-rozlišený vektor.

‘Hypotézujeme, že toto podstatně vyšší únik informací z kodérů je činí více zranitelnými vůči útokům na extrakci než SL modely.’

Architektura a data

Výzkumníci otestovali tři přístupy k SSL modelu inference/extrakci: Přímá extrakce, ve které je výstup API porovnán s rekreovaným kodérem prostřednictvím vhodné ztrátové funkce, jako je Mean Squared Error (MSE); rekonstrukce projekční hlavy, kde je kritická analytická funkce modelu, obvykle odstraněna před nasazením, reassemblovaná a použita v replikovaném modelu; a přístup k projekční hlavě, který je možný pouze v případech, kdy původní vývojáři zpřístupnili architekturu.

V metodě #1, Přímá extrakce, je výstup oběti modelu porovnán s výstupem místního modelu; metoda #2 zahrnuje rekonstrukci projekční hlavy použité v původní trénovací architektuře (a obvykle není zahrnuta v nasazeném modelu).

V metodě #1, Přímá extrakce, je výstup oběti modelu porovnán s výstupem místního modelu; metoda #2 zahrnuje rekonstrukci projekční hlavy použité v původní trénovací architektuře (a obvykle není zahrnuta v nasazeném modelu).

Výzkumníci zjistili, že Přímá extrakce byla nejúčinnější metodou pro získání funkční repliky cílového modelu, a má navíc výhodu, že je nejobtížnější charakterizovat jako ‘útok’ (protože se chová málo jinak než typický a platný koncový uživatel).

Autoři trénovali oběti modely na tři image datové sady: CIFAR10, ImageNet, a Stanford’s Street View House Numbers (SVHN). ImageNet byl trénován na ResNet50, zatímco CIFAR10 a SVHN byly trénovány na ResNet18 a ResNet24 přes volně dostupnou PyTorch implementaci SimCLR.

Downstream (tj. nasazený) výkon modelů byl testován proti CIFAR100, STL10, SVHN, a Fashion-MNIST. Výzkumníci také experimentovali s více ‘bílými boxy’ metodami modelu přivlastnění, ačkoli se ukázalo, že Přímá extrakce, nejméně privilegovaný přístup, poskytla nejlepší výsledky.

Pro hodnocení reprezentací, které jsou inferovány a replikovány v útocích, autoři přidali lineární predikční vrstvu k modelu, která byla jemně vyladěna na plném labelovaném trénovacím sadě z následného (downstream) úkolu, s ostatními vrstvami sítě zmrazenými. Takto lze testovací přesnost na predikční vrstvě použít jako metriku pro výkon. Protože nepřispívá k inferenčnímu procesu, toto nepředstavuje ‘bílou box’ funkčnost.

Výsledky testovacích běhů, umožněné (nepřispívající) Lineární evaluací. Přesnosti v tučném písmu.

Výsledky testovacích běhů, umožněné (nepřispívající) Lineární evaluací. Přesnosti v tučném písmu.

Komentář k výsledkům, výzkumníci prohlašují:

‘Zjistili jsme, že přímý cíl napodobování reprezentací oběti poskytuje vysoké výkony na downstream úkolech, navzdory tomu, že útok vyžaduje pouze zlomek (méně než 15% v určitých případech) počtu dotazů potřebných k trénování ukradeného encoderu v první řadě.’

A pokračují:

‘[Je] obtížné bránit kodéry školené SSL, protože výstupní reprezentace úniku podstatného množství informací. Nejlepší obranou jsou reaktivní metody, jako je vodoznak, které mohou vkládat specifické augmentace do vysokokapacitních kodérů.’

 

* Moje konverze inline citací z práce na hypertextové odkazy.

Poprvé publikováno 18. května 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai