Andersonin kulma

Selitettävä tekoäly saattaa paljastaa luottamuksellisia tietoja helpommin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Singaporen kansallisyliopistosta ovat tulleet siihen tulokseen, että mitä selitettävampi tekoäly on, sitä helpommin voidaan kiertää tärkeät yksityisyydensuojan ominaisuudet koneoppimisjärjestelmissä. He myös totesivat, että vaikka malli ei ole selitettävissä, on mahdollista käyttää samankaltaisten mallien selityksiä “dekoodaamaan” arkaluontoisia tietoja selitettävissä malleissa.

Tutkimus, jonka otsikko on Exploiting Explanations for Model Inversion Attacks, korostaa selitettävän tekoälyn käytön riskejä, joita voidaan käyttää hyväksi koneoppimisjärjestelmissä. Tämä johtuu siitä, että uudet globaalit aloitteet, kuten Euroopan unionin luonnos tekoälysäännöksistä, korostavat selitettävän tekoälyn tärkeyttä tekoälyn lopullisen hyväksymisen edellytyksenä yhteiskunnassa.

Tutkimuksessa todellinen identiteetti rekonstruoitiin onnistuneesti anonyymistä datasta, joka liittyi kasvojen ilmeisiin, hyödyntämällä useita tekoälyjärjestelmän selityksiä. Lähde: https://arxiv.org/pdf/2108.10800.pdf

Tutkimuksessa todellinen identiteetti rekonstruoitiin onnistuneesti anonyymistä datasta, joka liittyi kasvojen ilmeisiin, hyödyntämällä useita tekoälyjärjestelmän selityksiä. Lähde: https://arxiv.org/pdf/2108.10800.pdf

Tutkijat kommentoivat:

‘Selitettävä tekoäly (XAI) tarjoaa enemmän tietoa, jotta käyttäjät voivat ymmärtää mallin päätöksiä, mutta tämä lisätieto altistaa myös enemmän riskeille yksityisyyden hyökkäyksissä. Siksi selitysten tarjoaminen vahingoittaa yksityisyyttä.’

Yksityisten tietojen uudelleenmääritys

Koneoppimisdatan osallistujat saattavat olla antaneet suostumuksensa osallistumiseen olettaen anonyymisuutta; henkilökohtaisten tunnistetietojen (PII) osalta, jotka päätyvät tekoälyjärjestelmiin ad hoc -tiedonkeruumenettelyjen kautta (esim. sosiaaliverkostoja hyödyntämällä), osallistuminen saattaa olla teknisesti laillista, mutta se rasittaa “suostumuksen” käsitettä.

Useita menetelmiä on kehitetty viime vuosina, jotka ovat osoittautuneet kykeneviksi de-anonyymoimaan PII:ta ilmeisesti epäselvistä koneoppimisdatavirroista. Mallin purkaminen käyttää API-käyttöä (ts. “mustan ruudun” käyttöä, jossa ei ole erityistä pääsyä lähdekoodiin tai dataan) poistamaan PII:ta jopa suurimittakaavaisista MLaaS-toimittajista, mukaan lukien Amazon Web Services, kun taas Jäsenyysjohtuvat hyökkäykset (MIAt) voivat toimia samojen rajoitusten alaisina ja mahdollisesti hankkia luottamuksellista lääketieteellistä tietoa; lisäksi omistushyökkäykset voivat paljastaa arkaluontoisia tietoja API-tulosteesta.

Kasvojen paljastaminen

Tutkimuksessa tutkijat ovat keskittyneet mallin kääntämishyökkäykseen, jonka tavoitteena on hankkia identiteetti kasvojen tunteiden alijoukosta, joka ei pitäisi pystyä paljastamaan tätä tietoa.

Järjestelmän tavoitteena oli liittää internetissä löytyvät kuvat (joko vapaaehtoisesti julkaistuja tai potentiaalisessa tietoturvaloukkauksessa) niihin tietoihin, jotka muodostavat koneoppimisalgoritmin perustan.

Tutkijat kouluttivat kääntämishyökkäysmallin, joka pystyi rekonstruoimaan alkuperäisen kuvan anonyymistä API-tulosteesta ilman erityistä pääsyä alkuperäiseen arkkitehtuuriin. Aikaisemmat tutkimukset tässä alalla ovat keskittyneet järjestelmiin, joissa tunnistaminen (suojelu tai paljastaminen) oli sekä kohdejärjestelmän että hyökkäysjärjestelmän tavoite; tässä tapauksessa kehys on suunniteltu hyödyntämään toisen alan tulostetta ja soveltamaan sitä toiseen alaan.

Käännetyt konvoluutio-neuroverkko (CNN) käytettiin ennustamaan “alkuperäinen” lähdekuva tunteen tunnistusjärjestelmän kohdesaliency-kartan (saliency-kartan) perusteella, käyttäen U-Net-arkkitehtuuri parantamaan kasvojen rekonstruktio-ominaisuuksia.

Kääntämishyökkäysjärjestelmä perustuu selitettävään tekoälyyn (XAI), jossa neuronin aktivaation tietojen ja muiden julkisesti saatavilla olevien XAI-ominaisuuksien avulla voidaan rekonstruoita arkkitehtuurin sisäiset toiminnat ainoastaan sen tulosteiden perusteella, mahdollistaen osallistujien tietojen uudelleenmäärityksen.

Kääntämishyökkäysjärjestelmä perustuu selitettävään tekoälyyn (XAI), jossa neuronin aktivaation tietojen ja muiden julkisesti saatavilla olevien XAI-ominaisuuksien avulla voidaan rekonstruoita arkkitehtuurin sisäiset toiminnat ainoastaan sen tulosteiden perusteella, mahdollistaen osallistujien tietojen uudelleenmäärityksen.

Testaus

Järjestelmän testaamisessa tutkijat sovelsivat sitä kolmeen aineistoon: iCV-MEFED kasvojen ilmeiden aineistoon; CelebA aineistoon; ja MNIST-käsinkirjoitettuihin numeroihin. Aineistot muunnettiin tutkijoiden käyttämän mallin koon mukaisesti 128×128, 265×256 ja 32×32 pikseliksi. Kunkin aineiston 50 % käytettiin koulutusdatana ja loput 50 % hyökkäysdatana kouluttamaan vastustajamalleja.

Kunkin aineiston kohdemallit erosivat toisistaan, ja kunkin hyökkäysverkon koko mukautettiin selitysten rajoituksiin, eikä syvempiä neuroverkkoja, joiden monimutkaisuus ylittäisi selitysten yleistettävyyden.

XAI-selitystyypit, joita käytettiin hyökkäyksien mahdollistamiseen, olivat Gradient-selitys, Gradient-syöte, Grad-CAM ja kerroksittainen merkityksen määritys (LRP). Tutkijat arvioivat myös useita selityksiä kokeiden aikana.

Kuvan rekonstruktio XAI-tietoisen kääntämishyökkäyksen avulla kaikissa kolmessa aineistossa, joissa oli samat kohde- ja hyökkäystehtävät.

Kuvan rekonstruktio XAI-tietoisen kääntämishyökkäyksen avulla kaikissa kolmessa aineistossa, joissa oli samat kohde- ja hyökkäystehtävät.

Testien mittarit olivat pikselikohtainen samankaltaisuus, joka arvioitiin keskiarvon neliövirheen (MSE) avulla; kuvien samankaltaisuus (SSIM), joka perustuu havainnon perusteella; hyökkäyksen tarkkuus, joka määriteltiin luokittelijan kykynä uudelleenmerkitä rekonstruoitua kuvaa; ja hyökkäyksen upotusyhtäläisyyden vertailu, joka vertaa tunnettuja lähdeaineistojen piirteitä rekonstruoituun dataan.

Uudelleenmääritys saavutettiin eri tasolla kaikissa aineistoissa. Lisäksi tutkijat totesivat, että keksimällä vastamalli, jota heillä oli täysi hallinta, oli mahdollista saavuttaa uudelleenmääritys “suljettujen” mallien datasta perustuen tunnettuihin XAI-periaatteisiin.

Tutkijat totesivat, että tarkin tuloksen saavuttiin aktivaatiopohjaisilla (saliency-kartan) selityksillä, jotka paljastivat enemmän PII:ta kuin herkkyyteen perustuvat (gradient-pohjaiset) lähestymistavat.

Tulevassa tutkimuksessa tiimi aikoo sisällyttää erilaisia XAI-selityksiä uusiin hyökkäyksiin, kuten piirteiden visualisointiin ja käsiteaktivaatiovektoreihin.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai