Unghiul lui Anderson

Inteligența Artificială Explicabilă Ar Putea Ceda Mai Ușor Date Confidențiale

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetătorii de la Universitatea Națională din Singapore au concluzionat că, cu cât inteligența artificială devine mai explicabilă, cu atât va deveni mai ușor să se ocolească funcțiile vitale de confidențialitate din sistemele de învățare automată. Ei au descoperit, de asemenea, că, chiar și atunci când un model nu este explicabil, este posibil să se utilizeze explicațiile unor modele similare pentru a “decoda” date sensibile în modelul neexplicabil.

Cercetarea, intitulată Exploatând Explicații pentru Atacuri de Inversare a Modelului, subliniază riscurile utilizării “opacității accidentale” a modului în care funcționează rețelele neuronale, ca și cum ar fi o funcție de securitate proiectată – mai ales având în vedere valul de noi inițiative globale, inclusiv proiectul de regulament al Uniunii Europene privind inteligența artificială, care caracterizează inteligența artificială explicabilă (XAI) ca o condiție prealabilă pentru normalizarea eventuală a învățării automate în societate.

În cercetare, o identitate reală a fost reconstruită cu succes din date anonime care se referă la expresii faciale, prin exploatarea multiplelor explicații ale sistemului de învățare automată. Sursă: https://arxiv.org/pdf/2108.10800.pdf

În cercetare, o identitate reală a fost reconstruită cu succes din date anonime care se referă la expresii faciale, prin exploatarea multiplelor explicații ale sistemului de învățare automată. Sursă: https://arxiv.org/pdf/2108.10800.pdf

Cercetătorii comentează:

‘Inteligența artificială explicabilă (XAI) oferă mai multe informații pentru a ajuta utilizatorii să înțeleagă deciziile modelului, dar această cunoaștere suplimentară expune riscuri suplimentare pentru atacuri de confidențialitate. Prin urmare, furnizarea de explicații dăunează confidențialității.’

Reidentificarea Datelor Private

Participanții la seturile de date de învățare automată pot fi de acord să fie incluși, presupunând anonimitatea; în cazul informațiilor cu identificare personală (PII) care ajung în sistemele de inteligență artificială prin colectare de date ad-hoc (de exemplu, prin rețele sociale), participarea poate fi tehnic legală, dar pune sub semnul întrebării noțiunea de “consimțământ”.

Mai multe metode au apărut în ultimii ani, care s-au dovedit a fi capabile să dez-anonimizeze PII din fluxurile de date ale învățării automate aparent opace. Extracția modelului utilizează accesul API (adică “cutie neagră”, fără disponibilitate specială a codului sursă sau a datelor) pentru a extrage PII chiar și de la furnizorii de servicii de învățare automată la scară largă, inclusiv Amazon Web Services, în timp ce Atacurile de Inferență a Apartenenței (MIAs), care funcționează sub constrângeri similare, pot obține informații medicale confidențiale; în plus, Atacurile de Inferență a Atributului (AIAs) pot recupera date sensibile din ieșirea API.

Revelarea Fețelor

Pentru noul articol, cercetătorii s-au concentrat pe un atac de inversare a modelului, proiectat pentru a obține o identitate dintr-un subset de date de emoții faciale care nu ar trebui să poată dezvălui această informație.

Obiectivul sistemului a fost de a asocia imagini găsite în sălbăticie (postate casual pe internet sau într-o posibilă scurgere de date) cu incluziunea lor în seturile de date care stau la baza unui algoritm de învățare automată.

Cercetătorii au antrenat un model de atac de inversare capabil să reconstruiască imaginea contribuitoare din ieșirea anonimă a API, fără acces special la arhitectura originală. Lucrările anterioare în acest domeniu s-au concentrat pe sisteme în care identificarea (protejarea sau dezvăluirea) era obiectivul atât al sistemului țintă, cât și al sistemului atacant; în acest caz, cadrul a fost proiectat pentru a exploata ieșirea unui domeniu și a o aplica într-un alt domeniu.

O rețea neuronală convoluvională transpusă (CNN) a fost utilizată pentru a prezice o “față originală” pe baza vectorului de predicție țintă (hartă de saliență) pentru un sistem de recunoaștere a emoțiilor, utilizând o arhitectură U-Net pentru a îmbunătăți performanța reconstrucției faciale.

Sistemul de reidentificare este alimentat și informat de inteligența artificială explicabilă (XAI), unde cunoașterea activării neuronilor, printre multe alte aspecte publice ale XAI, este exploatată pentru a reconstrui mecanismele interne ale arhitecturii, doar din ieșirea acesteia, permițând reidentificarea imaginilor din setul de date contribuitor.

Sistemul de reidentificare este alimentat și informat de inteligența artificială explicabilă (XAI), unde cunoașterea activării neuronilor, printre multe alte aspecte publice ale XAI, este exploatată pentru a reconstrui mecanismele interne ale arhitecturii, doar din ieșirea acesteia, permițând reidentificarea imaginilor din setul de date contribuitor.

Testarea

La testarea sistemului, cercetătorii l-au aplicat împotriva a trei seturi de date: iCV-MEFED expresii faciale; CelebA; și MNIST cifre manuscrise. Pentru a se potrivi cu dimensiunea modelului utilizat de cercetători, cele trei seturi de date au fost redimensionate la 128×128, 265×256 și 32×32 pixeli. 50% din fiecare set a fost utilizat ca date de antrenare, iar cealaltă jumătate a fost utilizată ca set de date de atac pentru a antrena modelele antagoniste.

Fiecare set de date a avut modele țintă diferite, iar fiecare rețea de atac a fost dimensionată în funcție de limitările explicațiilor care stăteau la baza procesului, mai degrabă decât utilizarea unor modele neuronale mai profunde, a căror complexitate ar fi depășit generalizarea explicațiilor.

Tipurile de explicații XAI utilizate pentru a alimenta încercările au inclus Explicația Gradient, Intrarea Gradient, Grad-CAM și Propagarea Relevanței Stratului (LRP). Cercetătorii au evaluat, de asemenea, multiple explicații în cadrul experimentelor.

Reconstrucția imaginii facilitată de un atac de inversare conștient de XAI, pe cele trei seturi de date, cu sarcini țintă și de atac identice.

Reconstrucția imaginii facilitată de un atac de inversare conștient de XAI, pe cele trei seturi de date, cu sarcini țintă și de atac identice.

Metricile pentru test au fost similaritatea pixel cu pixel, evaluată prin Erroarea Medie Pătratică (MSE); Similaritatea Imaginii (SSIM), un indice de similaritate bazat pe percepție; acuratețea atacului, determinată de capacitatea unui clasificator de a reeticheta cu succes o imagine reconstruită; și similaritatea încorporării atacului, care compară încorporările de caracteristici ale datelor sursă cunoscute cu datele reconstruite.

Reidentificarea a fost realizată, cu niveluri variabile în funcție de sarcină și de seturi de date, pe toate seturile. Mai mult, cercetătorii au descoperit că, prin crearea unui model țintă substitut (pe care, în mod natural, l-au controlat în totalitate), a fost posibil să se realizeze reidentificarea datelor din modele “închise” externe, pe baza principiilor cunoscute ale XAI.

Cercetătorii au descoperit că cele mai precise rezultate au fost obținute prin explicații bazate pe activare (hartă de saliență), care au scurs mai multe informații cu identificare personală (PII) decât abordările bazate pe sensibilitate (gradient).

În lucrările viitoare, echipa intenționează să incorporeze diferite tipuri de explicații XAI în atacuri noi, cum ar fi visualizările de caracteristici și vectorii de activare a conceptelor.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai