Unghiul lui Anderson

De ce atacurile de imagine adversative nu sunt de glumă

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Atacarea sistemelor de recunoaștere a imaginilor cu imagini adversative create cu atenție a fost considerată o dovadă amuzantă, dar trivială, de-a lungul ultimilor cinci ani. Cu toate acestea, o nouă cercetare din Australia sugerează că utilizarea casuală a seturilor de date de imagine foarte populare pentru proiecte comerciale de inteligență artificială ar putea crea o problemă de securitate nouă și durabilă.

 

De aproximativ doi ani, un grup de academicieni de la Universitatea din Adelaide încearcă să explice ceva foarte important despre viitorul sistemelor de recunoaștere a imaginilor bazate pe inteligență artificială.

Acest lucru ar fi dificil (și foarte costisitor) de remediat în acest moment și ar fi incredibil de costisitor de remediat odată ce tendințele actuale în cercetarea recunoașterii imaginilor au fost pe deplin dezvoltate în implementări comercializate și industrializate în următorii 5-10 ani.

Înainte de a intra în detalii, să aruncăm o privire asupra unei flori care este clasificată ca Președintele Barack Obama, din una dintre cele șase videoclipuri pe care echipa le-a publicat pe pagina proiectului:

Sursă: https://www.youtube.com/watch?v=Klepca1Ny3c

Sursă: https://www.youtube.com/watch?v=Klepca1Ny3c

În imaginea de mai sus, un sistem de recunoaștere facială care recunoaște clar pe Barack Obama este înșelat să creadă cu o certitudine de 80% că un bărbat anonim care ține o imagine adversativă creată și imprimată a unei flori este de asemenea Barack Obama. Sistemul nu se sinchisește nici măcar că “fața falsă” se află pe pieptul subiectului, și nu pe umeri.

Deși este impresionant că cercetătorii au reușit să realizeze acest tip de captură de identitate prin generarea unei imagini coerente (o floare) în loc de zgomot aleatoriu obișnuit, pare că astfel de exploatații ciudate apar destul de des în cercetarea de securitate a viziunii computerizate. De exemplu, acele ochelari cu model ciudat care au reușit să înșele recunoașterea facială în 2016, sau imagini adversative create special care încearcă să rescrie semne de circulație.

Dacă sunteți interesați, modelul de rețea neuronală convoluțională (CNN) care este atacat în exemplul de mai sus este VGGFace (VGG-16), antrenat pe setul de date PubFig de la Universitatea Columbia. Alte mostre de atac dezvoltate de cercetători au folosit resurse diferite în combinații diferite.

O tastatură este reclasificată ca o scoică, într-un model WideResNet50 pe ImageNet. Cercetătorii au asigurat, de asemenea, că modelul nu are o predispoziție către scoici. Vezi videoclipul complet pentru demonstrații extinse și suplimentare la https://www.youtube.com/watch?v=dhTTjjrxIcU

O tastatură este reclasificată ca o scoică, într-un model WideResNet50 pe ImageNet. Cercetătorii au asigurat, de asemenea, că modelul nu are o predispoziție către scoici. Vezi videoclipul complet pentru demonstrații extinse și suplimentare la https://www.youtube.com/watch?v=dhTTjjrxIcU

Recunoașterea de imagini ca un vector de atac emergent

Atacurile impresionante pe care le prezintă și le ilustrează cercetătorii nu sunt critici la adresa unor seturi de date sau arhitecturi de învățare automată specifice care le folosesc. Nici nu pot fi apărate cu ușurință prin schimbarea seturilor de date sau a modelelor, reantrenarea modelelor sau orice altă “remediu simplu” care face ca practicienii de învățare automată să se îndoiască de demonstrațiile sporadice ale acestui tip de șiretenie.

În schimb, exploatațiile echipei din Adelaide exemplifică o slăbiciune centrală în întreaga arhitectură actuală a dezvoltării inteligenței artificiale pentru recunoașterea de imagini; o slăbiciune care ar putea expune multe sisteme de recunoaștere de imagini viitoare la manipularea facilă de către atacatori și să pună orice măsuri defensive ulterioare în dificultate.

Imaginați-vă că noile atacuri de imagini adversative (cum ar fi floarea de mai sus) sunt adăugate ca “exploatații zero-day” la sistemele de securitate ale viitorului, exact cum cadrul actual anti-malware și antivirus își actualizează definițiile de virus în fiecare zi.

Potentialul pentru atacuri de imagini adversative noi ar fi inepuizabil, deoarece arhitectura fundamentală a sistemului nu a anticipat problemele descendente, așa cum s-a întâmplat cu internetul, Bug-ul de mileniu și Turnul înclinat din Pisa.

În ce mod, atunci, ne pregătim pentru aceasta?

Obținerea datelor pentru un atac

Imaginile adversative, cum ar fi exemplul “floarea” de mai sus, sunt generate prin accesarea seturilor de date de imagine care au antrenat modelele computerizate. Nu aveți nevoie de “acces privilegiat” la datele de antrenament (sau arhitecturile de modele), deoarece cele mai populare seturi de date (și multe modele antrenate) sunt disponibile în mod liber și într-o scenă de torrent în continuă actualizare.

De exemplu, uriașul Goliath al seturilor de date de viziune computerizată, ImageNet, este disponibil pentru descărcare în toate iterările sale, ocolind restricțiile sale obișnuite de acces și făcând disponibile elemente secundare importante, cum ar fi seturile de validare.

Sursă: https://academictorrents.com

Sursă: https://academictorrents.com

Dacă aveți datele, puteți (așa cum observă cercetătorii din Adelaide) “reversa” efectiv orice set de date popular, cum ar fi CityScapes sau CIFAR.

În cazul PubFig, setul de date care a permis “Floarea lui Obama” din exemplul anterior, Universitatea Columbia a abordat o tendință în creștere a problemelor de drepturi de autor în jurul redistribuirii seturilor de date de imagine prin instruirea cercetătorilor cum să reproducă setul de date prin legături curate, în loc de a face compilația direct disponibilă, observând ‘Acest lucru pare a fi modul în care alte baze de date mari pe internet par să evolueze’.

În majoritatea cazurilor, acest lucru nu este necesar: Kaggle estimează că cele mai populare zece seturi de date de imagine în viziunea computerizată sunt: CIFAR-10 și CIFAR-100 (ambele direct descărcabile); CALTECH-101 și 256 (ambele disponibile și disponibile ca torrent); MNIST (oficial disponibil, și pe torrent); ImageNet (vezi mai sus); Pascal VOC (disponibil, și pe torrent); MS COCO (disponibil, și pe torrent); Sports-1M (disponibil); și YouTube-8M (disponibil).

Acestă disponibilitate este, de asemenea, reprezentativă pentru gama mai largă de seturi de date de viziune computerizată disponibile, deoarece obscuritatea este moartea într-o cultură de dezvoltare deschisă “publică sau pieri”.

În orice caz, lipsa seturilor de date noi și gestionabile, costul ridicat al dezvoltării seturilor de date de imagine, dependența de “vechi favorite” și tendința de a adapta pur și simplu seturile de date mai vechi toate exacerbează problema descrisă în noua lucrare din Adelaide.

Critici tipice ale metodelor de atac de imagine adversativă

Cea mai frecventă și persistentă critică a inginerilor de învățare automată împotriva eficacității celei mai recente tehnici de atac de imagine adversativă este că atacul este specific unei anumite seturi de date, unui anumit model sau ambelor; că nu este “generalizabil” la alte sisteme; și, în consecință, reprezintă doar o amenințare trivială.

A doua cea mai frecventă plângere este că atacul de imagine adversativă este ‘cutie albă’, ceea ce înseamnă că ai nevoie de acces direct la mediul de antrenament sau la date. Acesta este, de fapt, un scenariu puțin probabil, în majoritatea cazurilor – de exemplu, dacă ați dori să exploatați procesul de antrenament pentru sistemele de recunoaștere facială ale Poliției Metropolitane din Londra, ați trebui să spargeți drumul în NEC, fie cu o consolă, fie cu o secure.

‘ADN-ul’ pe termen lung al seturilor de date populare de viziune computerizată

În ceea ce privește prima critică, ar trebui să luăm în considerare nu numai faptul că un număr mic de seturi de date de viziune computerizată domină industria de anul în an (de exemplu, ImageNet pentru mai multe tipuri de obiecte, CityScapes pentru scene de conducere și FFHQ pentru recunoașterea facială); dar și faptul că, ca date de imagine simple și anotate, acestea sunt “independente de platformă” și foarte transferabile.

În funcție de capacitățile sale, orice arhitectură de antrenare a viziunii computerizate va găsi unele caracteristici ale obiectelor și claselor din setul de date ImageNet. Unele arhitecturi pot găsi mai multe caracteristici decât altele sau pot face legături mai utile decât altele, dar toate ar trebui să găsească cel puțin caracteristicile de nivel superior:

Datele ImageNet, cu numărul minim viabil de identificări corecte – caracteristici de nivel superior.

Datele ImageNet, cu numărul minim viabil de identificări corecte – caracteristici de nivel superior.

Aceste caracteristici de nivel superior disting și “amprentează” un set de date și reprezintă “cârligele” de încredere pe care se pot baza metodele de atac de imagine adversativă pe termen lung care pot traversa diferite sisteme și pot crește odată cu “vechiul” set de date, pe măsură ce acesta este perpetuat în noi cercetări și produse.

O arhitectură mai sofisticată va produce identificări mai precise și granulare, caracteristici și clase:

Cu cât un generator de atacuri adversative se bazează mai mult pe aceste caracteristici inferioare (de exemplu, “Bărbat tânăr caucazian” în loc de “Față”), cu atât va fi mai puțin eficient în arhitecturi ulterioare care utilizează versiuni diferite ale setului de date original – cum ar fi un subset sau un set filtrat, în care multe dintre imaginile originale din setul de date complet nu sunt prezente:

Atacuri adversative asupra modelelor preantrenate ‘zeroate’

Ce se întâmplă în cazurile în care pur și simplu descărcați un model preantrenat care a fost inițial antrenat pe un set de date foarte popular și îi dați date complet noi?

Modelul a fost deja antrenat pe (de exemplu) ImageNet, iar tot ce a rămas sunt greutățile, care ar fi putut dura săptămâni sau luni pentru a fi antrenate și sunt acum gata să vă ajute să identificați obiecte similare cu cele care existau în datele originale (acum absente).

Cu datele originale eliminate din arhitectura de antrenament, ceea ce rămâne este 'predispoziția' modelului de a clasifica obiectele în felul în care a învățat inițial să o facă, ceea ce va face ca multe dintre 'semnăturile' originale să se reformeze și să devină din nou vulnerabile la aceleași metode de atac de imagine adversativă.

Cu datele originale eliminate din arhitectura de antrenament, ceea ce rămâne este ‘predispoziția’ modelului de a clasifica obiectele în felul în care a învățat inițial să o facă, ceea ce va face ca multe dintre ‘semnăturile’ originale să se reformeze și să devină din nou vulnerabile la aceleași metode de atac de imagine adversativă.

Aceste greutăți sunt valoroase. Fără date sau greutăți, aveți de fapt o arhitectură goală, fără date. Veți trebui să o antrenați de la zero, la un cost mare de timp și resurse de calcul, exact cum au făcut autorii originali (probabil pe hardware mai puternic și cu un buget mai mare decât aveți la dispoziție).

Problema este că greutățile sunt deja foarte bine formate și rezistente. Deși se vor adapta într-o oarecare măsură în timpul antrenamentului, vor comporta în mod similar pe datele dvs. noi, la fel cum s-au comportat pe datele originale, producând caracteristici de semnătură pe care un sistem de atac adversativ le poate reidentifica.

Pe termen lung, acest lucru păstrează și el “ADN-ul” seturilor de date de viziune computerizată care sunt de doisprezece sau mai multe ani și care ar fi putut trece printr-o evoluție notabilă de la eforturile deschise la implementări comercializate și industrializate – chiar și în cazurile în care datele de antrenament originale au fost eliminate complet la începutul proiectului. Unele dintre aceste implementări comerciale ar putea să nu aibă loc încă pentru mulți ani.

Fără cutie albă necesară

În ceea ce privește a doua critică comună a sistemelor de atac de imagine adversativă, autorii noii lucrări au descoperit că capacitatea lor de a înșela sistemele de recunoaștere cu imagini create și imprimate de flori este foarte transferabilă pe o serie de arhitecturi.

În timp ce observă că metoda lor “Universal NaTuralistic adversarial paTches” (TnT) este prima care utilizează imagini recunoscute (în loc de zgomot de perturbație aleatoriu) pentru a înșela sistemele de recunoaștere de imagini, autorii afirmă și:

‘[TnT] sunt eficiente împotriva mai multor clasificatori de ultimă generație, de la WideResNet50 utilizat în sarcina de recunoaștere vizuală la scară largă a setului de date ImageNet la modelele VGG-face din sarcina de recunoaștere facială a setului de date PubFig atât în atacuri țintite, cât și în atacuri nețintite.

‘TnT pot avea: i) naturalismul realizabil [cu] declanșatoare utilizate în metodele de atac Trojan; și ii) generalizarea și transferabilitatea exemplarelor adversative la alte rețele.

‘Acest lucru ridică îngrijorări cu privire la securitatea și siguranța rețelelor neuronale already deployate, precum și a celor viitoare, în care atacatorii pot utiliza pete de obiecte naturale și neînsemnate pentru a înșela sistemele neuronale fără a tampona modelul și fără a fi descoperiți.’

Autorii sugerează că măsurile de apărare convenționale, cum ar fi degradarea preciziei unei rețele, ar putea teoretic oferi o anumită apărare împotriva petelor TnT, dar că ‘TnT pot ocoli cu succes aceste metode de apărare dovedite cu majoritatea sistemelor de apărare care obțin 0% robustețe’.

Possibile soluții alternative includ învățarea federată, în care proveniența imaginilor contributive este protejată, și abordări noi care ar putea “cripta” direct datele în timpul antrenamentului, cum ar fi una recent sugerată de Universitatea de Aeronautică și Astronautică din Nanjing.

Chiar și în aceste cazuri, ar fi important să se antreneze pe date de imagine cu adevărat noi – de acum, imaginile și anotările asociate din micul grup de seturi de date de viziune computerizată cele mai populare sunt atât de încorporate în ciclurile de dezvoltare din întreaga lume, încât par mai degrabă software decât date; software care, de obicei, nu a fost actualizat semnificativ de ani de zile.

Concluzie

Atacurile de imagine adversativă sunt posibile nu numai datorită practicilor deschise de învățare automată, ci și datorită unei culturi de dezvoltare a inteligenței artificiale care este motivată să reutilizeze seturi de date de viziune computerizată bine stabilite din mai multe motive: acestea au dovedit deja eficacitatea; sunt mult mai ieftine decât “a începe de la zero”; și sunt întreținute și actualizate de minți și organizații de avangardă din academia și industrie, la niveluri de finanțare și personal care ar fi dificil de replicat pentru o singură companie.

În plus, în multe cazuri în care datele nu sunt originale (cum ar fi CityScapes), imaginile au fost colectate înainte de controversele recente cu privire la practicile de confidențialitate și colectare a datelor, lăsând aceste seturi de date mai vechi într-o stare de “purgatoriu semi-legal” care ar putea părea un “port sigur” din punctul de vedere al unei companii.

 

Atacuri TnT! Peticule adversative naturalistice universale împotriva sistemelor de rețele neuronale profunde este coautorat de Bao Gia Doan, Minhui Xue, Ehsan Abbasnejad, Damith C. Ranasinghe de la Universitatea din Adelaide, împreună cu Shiqing Ma de la Departamentul de Știință a Calculatoarelor de la Universitatea Rutgers.

 

 

Actualizat la 1 decembrie 2021, 7:06 GMT+2 – corectat o greșeală de ortografie.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai