Interviuri
Bailey Kacsmar, candidat la doctorat la Universitatea din Waterloo – Seria de interviuri

Bailey Kacsmar este candidat la doctorat în Școala de Științe Computaționale de la Universitatea din Waterloo și viitor membru al facultății la Universitatea din Alberta. Interesele sale de cercetare se axează pe dezvoltarea tehnologiilor care îmbunătățesc confidențialitatea, prin studiul paralel al abordărilor tehnice pentru calculul privat, alături de percepțiile, îngrijorările și înțelegerea utilizatorilor cu privire la aceste tehnologii. Lucrarea sa are ca scop identificarea potențialului și limitărilor confidențialității în aplicațiile de învățare automată.
Cercetările dvs. se axează pe dezvoltarea tehnologiilor care îmbunătățesc confidențialitatea, de ce este atât de importantă confidențialitatea în inteligența artificială?
Confidențialitatea în inteligența artificială este atât de importantă, în mare parte pentru că inteligența artificială din lumea noastră nu există fără date. Datele, deși o abstracție utilă, descriu în final oamenii și comportamentele lor. Rareori lucrăm cu date despre populații de arbori și niveluri de apă; astfel, ori de câte ori lucrăm cu ceva care poate afecta oameni reali, trebuie să fim conștienți de acest lucru și să înțelegem cum sistemul nostru poate face bine sau rău. Acest lucru este deosebit de adevărat pentru inteligența artificială, unde multe sisteme beneficiază de cantități masive de date sau încearcă să utilizeze date extrem de sensibile (cum ar fi datele de sănătate) pentru a dezvolta noi înțelegeri ale lumii noastre.
Care sunt unele moduri în care ați văzut că învățarea automată a trădat confidențialitatea utilizatorilor?
Trădat este un cuvânt puternic. Cu toate acestea, ori de câte ori un sistem utilizează informații despre oameni fără consimțământul lor, fără a-i informa și fără a considera posibilele prejudicii, există riscul de a trăda normele de confidențialitate individuale sau sociale. În esență, acest lucru duce la trădare prin mii de tăieturi mici. Astfel de practici pot include antrenarea unui model pe cutiile poștale electronice ale utilizatorilor, antrenarea pe mesaje text ale utilizatorilor sau pe date de sănătate; toate acestea fără a informa subiecții datelor.
Puteti defini ce este confidențialitatea diferențială și care sunt punctele dvs. de vedere asupra acesteia?
Confidențialitatea diferențială este o definiție sau tehnică care a căpătat o importanță deosebită în ceea ce privește utilizarea pentru realizarea confidențialității tehnice. Definițiile tehnice ale confidențialității, în general, includ două aspecte cheie; ce este protejat și de cine. În cadrul confidențialității tehnice, garanțiile de confidențialitate sunt protecții care sunt realizate în baza unor ipoteze. Aceste ipoteze pot fi despre adversari potențiali, complexități ale sistemului sau statistici. Este o tehnică incredibil de utilă, cu o gamă largă de aplicații. Cu toate acestea, ceea ce este important de reținut este că confidențialitatea diferențială nu este echivalentă cu confidențialitatea.
Confidențialitatea nu se limitează la o singură definiție sau concept și este important să fim conștienți de noțiunile dincolo de aceasta. De exemplu, integritatea contextuală, care este o noțiune conceptuală a confidențialității, ține cont de modul în care diferite aplicații sau organizații modifică percepțiile de confidențialitate ale unui individ în raport cu o situație. Există, de asemenea, noțiuni legale ale confidențialității, cum ar fi cele cuprinse în Legea canadiană privind protecția informațiilor personale și documentelor electronice (PIPEDA), Regulamentul general al Uniunii Europene privind protecția datelor (GDPR) și Legea consumatorilor din California (CCPA). Toate acestea subliniază faptul că nu putem trata sistemele tehnice ca și cum ar exista într-un vid, lipsite de alți factori de confidențialitate, chiar dacă se utilizează confidențialitatea diferențială.
O altă tehnică de învățare a mașinilor care îmbunătățește confidențialitatea este învățarea federată; cum ați defini această tehnică și care sunt punctele dvs. de vedere asupra acesteia?
Învățarea federată este o modalitate de a efectua învățarea automată atunci când modelul urmează să fie antrenat pe o colecție de seturi de date distribuite pe mai multe proprietari sau locații. Nu este în mod intrinsec o tehnică de învățare a mașinilor care îmbunătățește confidențialitatea. O tehnică de învățare a mașinilor care îmbunătățește confidențialitatea trebuie să definească în mod formal ce este protejat, de la cine este protejat și care sunt condițiile care trebuie îndeplinite pentru ca aceste protecții să fie valabile. De exemplu, atunci când ne gândim la un calcul diferențial simplu, acesta garantează că o persoană care examinează rezultatul nu va putea determina dacă un anumit punct de date a fost contribuit sau nu.
Mai mult, confidențialitatea diferențială nu oferă această garanție dacă, de exemplu, există o corelație între punctele de date. Învățarea federată nu are această caracteristică; ea antrenează pur și simplu un model pe o colecție de date fără a cere deținătorilor de date să furnizeze direct seturile de date unul altuia sau unei terțe părți. Deși acest lucru sună ca o caracteristică de confidențialitate, ceea ce este necesar este o garanție formală că nu se poate învăța informația protejată dată intermediarilor și ieșirilor pe care părțile neîncredere le vor observa. Această formalitate este deosebit de importantă în contextul federat, unde părțile neîncredere includ toate părțile care furnizează date pentru a antrena modelul colectiv.
Care sunt unele limitări actuale ale acestor abordări?
Limitările actuale pot fi descrise cel mai bine ca fiind natura compromisului între confidențialitate și utilitate. Chiar dacă facem tot restul, comunicăm implicațiile de confidențialitate celor afectați, evaluăm sistemul pentru ceea ce încercăm să realizăm, etc., în cele din urmă se reduce la realizarea unui compromis între confidențialitate și utilitate. Cum determinăm “punctul ideal” de echilibru și ne îndreptăm spre el, astfel încât să realizăm funcționalitatea dorită și să oferim protecții de confidențialitate necesare?
În prezent, urmăriți să dezvoltați tehnologia de confidențialitate conștientă de utilizator prin studiul paralel al soluțiilor tehnice pentru calculul privat. Puteți intra în detalii despre unele dintre aceste soluții?
Ceea ce înțeleg prin aceste soluții este că putem, în mod vag, dezvolta orice număr de sisteme tehnice de confidențialitate. Cu toate acestea, atunci când facem acest lucru, este important să determinăm dacă garanțiile de confidențialitate ajung la cei afectați. Acest lucru poate însemna dezvoltarea unui sistem după ce aflăm ce tipuri de protecții valorizează populația. Acest lucru poate însemna actualizarea unui sistem după ce aflăm cum oamenii utilizează în realitate un sistem, având în vedere considerațiile lor reale de amenințare și risc. O soluție tehnică poate fi un sistem corect care satisfăce definiția pe care am menționat-o anterior. O soluție conștientă de utilizator ar proiecta sistemul său pe baza inputurilor de la utilizatori și alți factori implicați în domeniul de aplicare intenționat.
În prezent, căutați studenți absolvenți interesați să înceapă în septembrie 2024; de ce credeți că studenții ar trebui să fie interesați de confidențialitatea inteligenței artificiale?
Cred că studenții ar trebui să fie interesați pentru că este ceva care va crește în pervazivitatea sa în societatea noastră. Pentru a avea o idee despre cât de repede se dezvoltă aceste sisteme, nu trebuie să căutăm mai departe de amplificarea recentă a Chat-GPT prin articole de știri, media socială și dezbateri despre implicațiile sale. Trăim într-o societate în care colectarea și utilizarea datelor sunt atât de încorporate în viața noastră de zi cu zi, încât suntem aproape constant furnizori de informații despre noi înșine pentru diverse companii și organizații. Aceste companii doresc să utilizeze datele, în unele cazuri pentru a-și îmbunătăți serviciile, în altele pentru profit. La acest punct, pare nerealist să credem că practicile corporative de utilizare a datelor vor schimba. Cu toate acestea, existența sistemelor care protejează confidențialitatea și permit anumite analize dorite de companii poate ajuta la echilibrarea compromisului risc-recompensă care a devenit atât de implicit în societatea noastră.
Mulțumim pentru acest interviu excelent; cititorii interesați să afle mai multe pot vizita pagina GitHub a lui Bailey Kacsmar.












