Haastattelut
Bailey Kacsmar, PhD-opiskelija Waterloon yliopistossa – Haastattelusarja

Bailey Kacsmar on PhD-opiskelija tietojenkäsittelytieteen tiedekunnassa Waterloon yliopistossa ja tuleva opettaja Albertan yliopistossa. Hänen tutkimuskiinnostuksensa ovat kehittäämässä käyttäjien tietoisia tietosuojan parantamiseen tähtääviä teknologioita, rinnakkain teknisten lähestymistapojen ja niiden vastaavien käyttäjien havaintojen, huolenaiheiden ja ymmärryksen tutkimisen kautta. Hänen työnsä pyrkii tunnistamaan mahdollisuudet ja rajoitukset tietosuojalle koneoppimisen sovelluksissa.
Miksi tietosuojan tutkiminen on niin tärkeää?
Tietosuojan tutkiminen on tärkeää, koska tekoäly ei voi toimia ilman dataa. Data on kätevä abstraktio, joka lopulta kuvailee ihmisiä ja heidän käyttäytymistään. Harvoin työskentelemme datan parissa, joka liittyy esimerkiksi puuviljelmiin tai veden tasoihin, joten aina kun työskentelemme datan parissa, joka voi vaikuttaa ihmisiin, meidän on oltava tietoisia siitä ja ymmärrettävä, miten järjestelmämme voi tehdä hyvää tai vahinkoa. Tämä on erityisen totta tekoälylle, jossa monet järjestelmät hyötyvät massiivisista datamääristä tai pyrkivät käyttämään erittäin arkaluontoista dataa (kuten terveydenhuollon dataa) kehittääkseen uusia ymmärryksiä maailmasta.
Mitkä ovat joitain tapoja, joilla olet nähnyt, että koneoppiminen on pettänyt käyttäjien luottamuksen?
Pettäminen on voimakas sana. Kuitenkin aina, kun järjestelmä käyttää tietoa ihmisistä ilman heidän suostumustaan, ilman heidän tietämistään ja ilman huomioon ottamista mahdollisista vahingoista, se aiheuttaa riskin yksilöiden tai yhteiskunnan luottamuksen pettämiseen. Tämä johtuu siitä, että tällaiset käytännöt voivat olla esimerkiksi koulutusmallia käyttäjien sähköpostilaatikoissa, koulutusmallia käyttäjien tekstiviesteissä tai terveydenhuollon datassa ilman, että asioiden kohteet ovat tietoisia siitä.
Miten määrittelet differentiaalisen tietosuojan, ja mitkä ovat sinun näkemyksesi siitä?
Differentiaalinen tietosuojan määrittely on menetelmä, joka on saavuttanut merkittävyyden teknisen tietosuojan saavuttamisessa. Teknisten tietosuojan määrittelyt sisältävät yleensä kaksi olennaisen osaa: mitä suojellaan ja keneltä. Teknisen tietosuojan takeet ovat suojauksia, jotka saavutetaan, kun tietyt oletukset täyttyvät. Nämä oletukset voivat liittyä potentiaalisiin vihollisiin, järjestelmien monimutkaisuuteen tai tilastoihin. Se on erittäin hyödyllinen menetelmä, jolla on laaja soveltamisala. On kuitenkin tärkeää muistaa, että differentiaalinen tietosuojan määrittely ei ole sama kuin tietosuojan määrittely.
Tietosuojan määrittely ei rajoitu yhteen määrittelyyn tai käsitteeseen, ja on tärkeää olla tietoinen muista käsitteistä. Esimerkiksi kontekstuaalinen eheys on tietosuojan käsite, joka ottaa huomioon, miten eri sovellukset tai organisaatiot muuttavat yksilön tietosuojan havaintoja tietyssä tilanteessa. On myös oikeudellisia tietosuojan käsitteitä, kuten Kanadan PIPEDA, Euroopan GDPR ja Kalifornian kuluttajansuojalaki (CCPA). Kaikki tämä tarkoittaa, että emme voi kohdella teknisiä järjestelmiä kuin ne olisivat tyhjiössä, erillään muista tietosuojan tekijöistä, vaikka differentiaalinen tietosuojan määrittely olisi käytössä.
Miten määrittelet federated learningin, ja mitkä ovat sinun näkemyksesi siitä?
Federated learning on tapa tehdä koneoppimista, kun malli on koulutettava useiden omistajien tai sijaintien jakamasta datasaaliista. Se ei ole luonnostaan tietosuojan parantamiseen tähtäävä koneoppimisen laji. Tietosuojan parantamiseen tähtäävä koneoppiminen tarvitsee muodollisen määrittelyn siitä, mitä suojellaan, keneltä suojellaan ja mitkä ehdot on täytettävä, jotta nämä suojaukset pitävät paikkansa. Esimerkiksi, kun ajattelemme yksinkertaista differentiaalista yksityisyyttä, se takaa, ettei kukaan, joka katsoo tulosta, voi määrittää, oliko tietty datakohta osa siitä.
Lisäksi differentiaalinen tietosuojan määrittely ei anna tätä takuuta, jos esimerkiksi on korrelaatiota datapisteiden välillä. Federated learningillä ei ole tätä ominaisuutta; se kouluttaa mallin datasaaliista ilman, että datan omistajien on tarvida antaa dataa suoraan toisilleen tai kolmannelle osapuolelle. Vaikka tämä kuulostaa tietosuojan ominaisuudelta, tarvitaan muodollinen takuu, ettei voida oppia suojattua tietoa välikäsien ja tulosten avulla, joita epäluotettavat osapuolet havaitsevat. Tämä muodollisuus on erityisen tärkeää federated learning -ympäristössä, jossa epäluotettavat osapuolet sisältävät kaikki datan antavat osapuolet.
Mitkä ovat nykyisten lähestymistapojen rajoitukset?
Nykyisten lähestymistapojen rajoitukset voidaan parhaiten kuvailla tietosuojan ja hyödyn välinen tasapaino. Vaikka tehdään kaikki muu, kuten viestintä tietosuojan vaikutuksista, arviointi järjestelmän toiminnasta, yms., lopulta tulee kysymykseen, miten saavutetaan “ihanteellinen” tasapaino. Mitä on oikea kynnys ja miten rakennetaan siihen, jotta toiminnallisuus saavutetaan samalla, kun tarvittavat tietosuojan suojaukset toteutetaan.
Voitko kertoa yksityiskohtia siitä, mitä nämä ratkaisut ovat?
Mitä tarkoitan näillä ratkaisuilla, on se, että voimme kehittää teknisiä tietosuojajärjestelmiä. Kuitenkin, kun tehdään niin, on tärkeää määrittää, ovatko tietosuojan takeet saavutettavissa niille, joita se vaikuttaa. Tämä voi tarkoittaa järjestelmän kehittämistä sen jälkeen, kun on selvitetty, mitä suojauksia väestö arvostaa. Tämä voi tarkoittaa järjestelmän päivittämistä sen jälkeen, kun on selvitetty, miten ihmiset käyttävät järjestelmää todellisissa uhka- ja riskitilanteissa. Tekninen ratkaisu voi olla oikea järjestelmä, joka toteuttaa edellä mainitun määrittelyn. Käyttäjien tietoinen ratkaisu suunnittelee järjestelmänsä käyttäjien ja muiden vaikuttavien syötteen perusteella tarkoituksenmukaisessa sovellusalueessa.
Miksi opiskelijat pitäisi olla kiinnostuneita tekoälyn tietosuojasta?
Luulen, että opiskelijat pitäisi olla kiinnostuneita, koska se on asia, joka vain kasvaa yleisyydessään yhteiskunnassamme. Katsokaa vain Chat-GPT:n nopeaa leviämistä uutisartikkeleissa, sosiaalisessa mediassa ja keskusteluissa sen vaikutuksista. Olemme yhteiskunnassa, jossa datan kerääminen ja käyttäminen on niin upottunut arkeen, että olemme lähes jatkuvasti antamassa tietoa itsestämme eri yrityksille ja organisaatioille. Nämä yritykset haluavat käyttää tätä dataa joko parantamaan palvelujaan tai voittoa varten. Tässä vaiheessa on epärealistista ajatella, että nämä yritysten datakäytännöt muuttuvat. Kuitenkin olemassa olevat tietosuojan säilyttävät järjestelmät, jotka suojaavat käyttäjiä samalla, kun sallivat tietyn analyysin, jonka yritykset haluavat, voivat auttaa tasapainottamaan riskien ja hyödykkeiden kaupan, josta on tullut niin implisiittinen osa yhteiskuntaamme.
Kiitos haastattelusta, lukijat, jotka ovat kiinnostuneita oppimaan lisää, voivat vierailla Bailey Kacsmarin Github-sivulla.












