Andersonův úhel
MLaaS: Prevence krádeže modelů API s využitím variabilních autoencoderů

Machine Learning As a Service (MLaaS) komoditizuje výsledky drahého výzkumu a školení modelů prostřednictvím API, které zákazníkům poskytují přístup k informacím ze systému. Ačkoli systém odhaluje své důvody do určité míry prostřednictvím těchto transakcí, jádrové architektury modelu, váhy, které definují užitečnost modelu, a konkrétní data, která jej učinila užitečným, jsou žárlivě střežena z několika důvodů.
První důvod je, že rámec pravděpodobně využil řadu volně dostupných nebo otevřených zdrojových kódových repozitářů, a potenciální rivalové by mohli stejně snadno učinit ve snaze o dosažení stejného cíle; druhý důvod je, že ve mnoha případech váhy používané modely představují 95 % nebo více schopnosti modelu interpretovat trénovací data lépe než rivality modely, a lze je považovat za jádrovou hodnotu drahého investice, a to jak z hlediska výzkumných hodin, tak z hlediska rozsáhlého a dobře zajištěného školení modelů na průmyslových GPU.
Kromě toho je směsice proprietárních a veřejně přístupných dat za trénovacím datasetem modelu potenciálně závažným problémem: pokud jsou data “originální” prací získané prostřednictvím nákladných metod, schopnost uživatele API odvodit strukturu nebo obsah dat prostřednictvím povolených požadavků API by jim mohla umožnit prakticky rekonstruovat hodnotu práce, buď tím, že pochopí schéma dat (což by umožnilo praktickou reprodukci), nebo tím, že reprodukuje váhy, které orchestrují funkce dat, což by mohlo umožnit reprodukci “prázdné”, ale účinné architektury, do které by mohly být následně užitečně zpracovány další materiály.
Praní dat
Další problém spočívá v tom, že způsob, jakým jsou data abstrahována v latentním prostoru modelu strojového učení během školení, efektivní “práni” dat do obecných funkcí, které činí obtížným pro držitele autorských práv pochopit, zda jejich původní práce byla bez povolení začleněna do modelu.
Současný laissez faire klima po celém světě týkající se této praxe se pravděpodobně stane předmětem stále přísnější regulace v příštích 5-10 letech. Návrh evropských předpisů pro umělou inteligenci již obsahuje ustanovení o původu dat a transparentním rámci, který by činil obtížným pro společnosti shromažďující data obcházet předpisy o web-scrapingu pro výzkumné účely. Další vlády, včetně USA, se nyní zavázaly k podobným regulačním rámcům na dlouhodobou perspektivu.
Jak se oblast strojového učení vyvíjí z kultury proof-of-concept do životaschopné komerční ekosféry, modely strojového učení, které porušily omezení týkající se dat, by se mohly ocitnout v právních potížích.
Protože riziko odvození zdrojů dat přes API požadavky se netýká pouze průmyslové špionáže prostřednictvím inverze modelu a dalších metod, ale také nově se vyvíjejících forenzních metod pro ochranu duševního vlastnictví, které by mohly být použity proti společnostem po skončení “divoké západní” éry výzkumu strojového učení.
API-poháněná exfiltrace jako prostředek k vývoji adversářského útoku
Některé rámce strojového učení neustále aktualizují svá trénovací data a algoritmy, spíše než odvozují definitivní, dlouhodobý model z velkého korpusu historických dat (jako je tomu u GPT-3). Tyto zahrnují systémy související s informacemi o dopravě a dalšími sektory, kde jsou reálná data kritická prongoing hodnotu služeb strojového učení.
Pokud lze logiku nebo váhy modelu “zmapovat” systematickým dotazováním přes API, tyto faktory lze potenciálně použít proti systému ve formě adversářských útoků, kde lze úmyslně vytvořená data nechat volně dostupná v místech, kde je cílový systém pravděpodobně najde; nebo infiltrováním rutin pro získávání dat jinými metodami.
Proto opatření proti API-centrickému mapování mají důsledky také pro bezpečnost modelů strojového učení.
Prevence API-poháněné exfiltrace
V posledních letech se objevilo několik výzkumných iniciativ, které poskytují metodologie, které mohou zabránit odvození architektury modelu a konkrétních zdrojových dat přes API požadavky. Nejnovější z nich je popsán v předtiskové spolupráci mezi výzkumníky z Indického institutu vědy v Bengaluru a Nference, platformou založenou na umělém inteligenci se sídlem v Cambridge, Massachusetts.
Nazvaný Stateful Detection of Model Extraction Attacks, výzkum navrhuje systém nazvaný VarDetect, pro který je k dispozici předběžný kód na GitHubu.
VarDetect běží na serverové straně a nepřetržitě monitoruje uživatelské dotazy do API, hledaje tři rozdílné vzorce útoků na extrakci modelu. Výzkumníci uvádějí, že VarDetect je prvním mechanismem obrany, který vydrží proti všem třem typům útoků. Navíc může čelit protiopatřením útočníků, kteří se dozvědí o mechanismu obrany a kteří se pokusí ho porazit skrytím vzorců útoků nebo zvýšením objemu dotazů, aby zakryli požadavky, které se snaží vytvořit mapu modelu.
VarDetect používá Variabilní Autoencodery (VAE) k efektivnímu vytvoření heuristické evaluativní sondy pro příchozí požadavky. Na rozdíl od předchozích metod je systém školen na proprietárních datech, což eliminuje potřebu přístupu k datům útočníků, což je slabina předchozích přístupů, a nepravděpodobná situace.

Vlastní model navržen pro projekt je odvozen z tří veřejně dostupných datových sad nebo přístupů: práce vyvinuté v roce 2016 Švýcarským federálním technologickým institutem a Cornell Tech; přidáním šumu do “problémového” doménových dat, jak bylo poprvé prokázáno v roce 2017 PRADA papíru z Finska; a procházením veřejně přístupných obrázků, inspirovaných výzkumem ActiveThief 2020 z Indického institutu vědy.

Srovnání benigních a ‘maligních’ datových vzorků napříč pěti datovými sadami používanými ve VarDetect.
Frekvenční distribuce, které odpovídají charakteristikám z integrované datové sady, budou označeny jako signály extrakce.
Výzkumníci přiznávají, že běžné vzorce požadavků od benigních uživatelů mohou potenciálně spustit falešně pozitivní signály v systému, což by bránilo normálnímu použití. Protože takové vnímané “bezpečné” signály mohou být následně přidány do datové sady VarDetect, stávají se součástí algoritmu prostřednictvím rolovacího školicího plánu, v závislosti na preferencích hostitelského systému.













