Unghiul lui Anderson
Furarea Modelelor de Învățare Automată prin Interfața de ieșire a API-ului

Noi cercetări din Canada oferă o posibilă metodă prin care atacatorii ar putea fura roadele scumpe ale cadrelor de învățare automată, chiar și atunci când singura acces la un sistem proprietar este prin intermediul unei interfețe sau protocol de procesare a cererilor utilizatorului pe server, și returnează doar răspunsul de ieșire.
Pe măsură ce sectorul de cercetare se îndreaptă tot mai mult spre monetizarea costisitoare a antrenării modelelor prin implementări de Învățare Automată ca Serviciu (MLaaS), noua lucrare sugerează că modelele de Învățare Auto-Supervizată (SSL) sunt mai vulnerabile la acest tip de extragere a modelului, deoarece sunt antrenate fără etichete, simplificând extragerea și furnizând de obicei rezultate care conțin o cantitate mare de informații utile pentru a replica modelul (ascuns) sursă.
În simulări de test “cutie neagră” (unde cercetătorii și-au acordat acces la un model “victimă” locală, fără a avea mai mult acces decât un utilizator obișnuit prin intermediul unei interfețe web API), cercetătorii au putut replica sistemele țintă cu resurse relativ scăzute:
‘[Atacurile noastre] pot fura o copie a modelului victim care obține o performanță considerabilă în mai puțin de 1/5 din cererile utilizate pentru antrenarea modelului victim. Împotriva unui model victim antrenat pe 1,2 milioane de exemple neetichetate din ImageNet, cu o acuratețe de 91,9% la sarcina de clasificare Fashion-MNIST, atacul nostru direct de extragere cu pierderea InfoNCE a furat o copie a encoder-ului care obține o acuratețe de 90,5% în 200.000 de cereri.
‘La fel, împotriva unui model victim antrenat pe 50.000 de exemple neetichetate din CIFAR10, cu o acuratețe de 79,0% la sarcina de clasificare CIFAR10, atacul nostru direct de extragere cu pierderea SoftNN a furat o copie care obține o acuratețe de 76,9% în 9.000 de cereri.’

Cercetătorii au utilizat trei metode de atac, constatând că ‘Extragerea Directă’ a fost cea mai eficientă. Aceste modele au fost furate de la un model local recreat CIFAR10, utilizând 9.000 de cereri din setul de test CIFAR10. Sursă: https://arxiv.org/pdf/2205.07890.pdf
Cercetătorii notează, de asemenea, că metodele care sunt potrivite pentru a proteja modelele supravegheate de atacuri nu se adaptează bine la modelele antrenate pe o bază nesupravegheată – chiar dacă astfel de modele reprezintă unele dintre cele mai așteptate și celebrate roade ale sectorului de sinteză a imaginilor.
Noua lucrare se intitulează Despre Dificultatea de a Apara Învățarea Auto-Supervizată împotriva Extragerii Modelului și provine de la Universitatea din Toronto și Institutul Vector pentru Inteligență Artificială.
Conștientizarea Sinelui
În Învățarea Auto-Supervizată, un model este antrenat pe date neetichetate. Fără etichete, un model SSL trebuie să învețe asocieri și grupuri din structura implicită a datelor, căutând aspecte similare ale datelor și corălindu-le treptat în noduri sau reprezentări.
În cazul în care o abordare SSL este viabilă, este incredibil de productivă, deoarece ocolește nevoia de etichetare costisitoare (adesea externalizată și controvesată) și raționalizează datele în mod autonom.
Cele trei abordări SSL luate în considerare de autorii noii lucrări sunt SimCLR, o Rețea Siameză; SimSiam, o altă Rețea Siameză centrată pe învățarea reprezentărilor; și Barlow Twins, o abordare SSL care a obținut o performanță de clasificare Imagini de top la lansarea sa în 2021.
Extragea modelului pentru date etichetate (adică un model antrenat prin învățare supravegheată) este o zonă de cercetare relativ bine documentată. De asemenea, este mai ușor de apărat împotriva atacurilor, deoarece atacatorul trebuie să obțină etichetele de la modelul victim pentru a recrea modelul.

Un model de atac ‘knockoff classifier’ împotriva unei arhitecturi de învățare supravegheată. Sursă: https://arxiv.org/pdf/1812.02766.pdf
Fără acces ‘cutie albă’, aceasta nu este o sarcină trivială, deoarece răspunsul obișnuit de la o cerere API către un astfel de model conține mai puține informații decât în cazul unei API SSL obișnuite.
Din lucrare*:
‘Lucrările anterioare despre extragerea modelului s-au concentrat pe setarea Învățării Supravegheate (SL), unde modelul victim returnează de obicei o etichetă sau alte ieșiri de dimensiune mică, cum ar fi scoruri de încredere sau logits.
‘În contrast, encoderele SSL returnează reprezentări de dimensiune mare; de fapt, ieșirea pentru un model Sim-CLR ResNet-50, o arhitectură populară în viziune, este un vector de dimensiune 2048.
‘Ipotezăm că această scurgere de informații mult mai mare din encodere îi face mai vulnerabile la atacuri de extragere decât modelele SL.’
Arhitectură și Date
Cercetătorii au testat trei abordări pentru inferența/extragerea modelului SSL: Extragea Directă, în care ieșirea API este comparată cu ieșirea unui encoder recreat prin intermediul unei funcții de pierdere adecvate, cum ar fi Eroarea Medie Pătratică (MSE); recrearea capului de proiecție, unde o funcționalitate analitică crucială a modelului, de obicei eliminată înainte de implementare, este reasamblată și utilizată într-un model replica; și accesarea capului de proiecție, care este posibilă doar în cazurile în care dezvoltatorii originali au făcut arhitectura disponibilă.

În metoda #1, Extragea Directă, ieșirea modelului victim este comparată cu ieșirea unui model local; metoda #2 implică recrearea capului de proiecție utilizat în arhitectura de antrenare originală (și de obicei nu inclus într-un model implementat).
Cercetătorii au constatat că Extragea Directă a fost cea mai eficientă metodă pentru obținerea unei replici funcționale a modelului țintă și are beneficiul suplimentar de a fi cea mai dificil de caracterizat ca un ‘atac’ (deoarece se comportă foarte puțin diferit decât un utilizator valabil obișnuit).
Autorii au antrenat modele victim pe trei seturi de imagini: CIFAR10, ImageNet și Numerele de Stradă Stanford (SVHN). ImageNet a fost antrenat pe ResNet50, în timp ce CIFAR10 și SVHN au fost antrenate pe ResNet18 și ResNet24, utilizând o implementare PyTorch disponibilă gratuit a SimCLR.
Performanța modelului în aval (implementat) a fost testată împotriva CIFAR100, STL10, SVHN și Fashion-MNIST. Cercetătorii au experimentat, de asemenea, cu metode mai ‘cutie albă’ de apropriere a modelului, deși s-a dovedit că Extragea Directă, abordarea cu cele mai puține privilegii, a oferit cele mai bune rezultate.
Pentru a evalua reprezentările inferate și replicate în atacuri, autorii au adăugat un strat de predicție liniară la model, care a fost ajustat pe setul de antrenare etichetat complet din sarcina (în aval) ulterioară, cu restul stratului de rețea înghețat. În acest fel, acuratețea testului pe stratul de predicție poate funcționa ca o metrică pentru performanță. Deoarece nu contribuie la procesul de inferență, aceasta nu reprezintă funcționalitate ‘cutie albă’.

Rezultatele rulărilor de test, posibile datorită stratului de Evaluare Liniară (non-contributor). Scoruri de acuratețe în caractere aldine.
Comentând rezultatele, cercetătorii afirmă:
‘Constatăm că obiectivul direct de a imita reprezentările victimei oferă o performanță ridicată la sarcinile în aval, în ciuda faptului că atacul necesită doar o fracțiune (mai puțin de 15% în anumite cazuri) din numărul de cereri necesare pentru antrenarea encoder-ului furat în primul rând.’
Și continuă:
‘[Este] dificil de apărat encoderele antrenate cu SSL, deoarece reprezentările de ieșire scurg o cantitate substanțială de informații. Cele mai promițătoare apărări sunt metodele reactive, cum ar fi marcarea cu apă, care pot încorpora anumite augmentări în encodere de înaltă capacitate.’
* Conversia mea a citărilor inline din lucrare în legături hipertext.
Publicat pentru prima dată pe 18 mai 2022.












