Interviuri
Patricia Thaine, CEO la Private AI – Seria de interviuri

Patricia Thaine este co-fondatoare și CEO al Private AI, candidat la doctorat în științe computaționale la Universitatea din Toronto și afiliat postuniversitar la Institutul Vector, efectuând cercetări pe tema prelucrării naturale a limbajului cu protecție a confidențialității, cu accent pe criptografia aplicată. Ea efectuează, de asemenea, cercetări pe metode computaționale pentru decriptarea limbilor pierdute.
Patricia este beneficiara bursei de studii postuniversitare NSERC, a bursei de studii postuniversitare RBC, a bursei de studii postuniversitare Beatrice “Trixie” Worsley în științe computaționale și a bursei de studii postuniversitare din Ontario. Ea are opt ani de experiență în cercetare și dezvoltare de software, inclusiv la Laboratorul de dezvoltare a limbajului de la McGill, Laboratorul de lingvistică computațională de la Universitatea din Toronto, Departamentul de lingvistică de la Universitatea din Toronto și Agenția de sănătate publică a Canadei.
Ce v-a atras inițial la știința computerelor?
Capacitatea de a rezolva probleme și de a fi creativ în același timp. Este ca o meserie. Vezi cum ideile tale de produs devin realitate, la fel ca un tâmplar care construiește mobilier. Așa cum am auzit pe cineva spunând odată: programarea este instrumentul creativ suprem. Faptul că produsele pe care le construiești pot fi scalate și utilizate de oameni din întreaga lume este un avantaj suplimentar.
Puteți discuta despre povestea de origine a Private AI și despre cum a apărut din observația dvs. că există o lipsă de instrumente ușor de integrat pentru protejarea confidențialității?
Prin vorbire și scriere, producem și transferăm unele dintre informațiile noastre cele mai sensibile către companiile ale căror servicii le utilizăm. Când am luat în considerare care produse NLP să construim, a existat un strat de confidențialitate pe care trebuia să îl integrăm, care pur și simplu nu exista pe piață. Pentru a utiliza soluții de confidențialitate, companiile trebuiau să transfere datele utilizatorilor lor către o terță parte, să utilizeze soluții open-source de calitate inferioară, care nu erau suficiente pentru a proteja în mod corespunzător confidențialitatea utilizatorilor, sau să construiască o soluție în interior, cu foarte puțină expertiză în domeniul confidențialității. Așadar, am decis să ne concentrăm pe crearea celor mai bune produse posibile pentru dezvoltatori și echipe de IA care au nevoie ca rezultatele tehnologiilor de îmbunătățire a confidențialității să funcționeze ușor pentru nevoile lor.
De ce este importantă inteligența artificială care protejează confidențialitatea?
Aproximativ 80 la sută din informațiile produse sunt nestructurate, iar IA este singura modalitate de a da sens tuturor acestor date. Poate fi utilizată în scopuri bune, cum ar fi ajutarea la detectarea căderilor pentru populația vârstnică, sau în scopuri rele, cum ar fi profilarea și urmărirea indivizilor din populații subreprezentate. Asigurarea faptului că confidențialitatea este integrată în software-ul pe care îl creăm face mult mai dificil ca IA să fie utilizată într-un mod dăunător.
Cum este confidențialitatea un avantaj competitiv?
Există multe motive, dar iată câteva:
- Majoritatea utilizatorilor se preocupă de confidențialitate, iar pe măsură ce consumatorii devin mai educați, această preocupare crește: 70 la sută din consumatori se preocupă de confidențialitatea datelor lor.
- Este mult mai ușor să faci afaceri cu alte companii dacă ai protocoale și tehnologii de protecție a datelor și confidențialității adecvate.
- Când ai construit produsele tale într-un mod care protejează confidențialitatea, ai o mai bună urmărire a punctelor de vulnerabilitate din serviciul tău și, în special prin minimizarea datelor, te dai seama de datele pe care nu le mai necesiti și care te-ar putea pune în pericol în cazul unui atac cibernetic.
Puteți discuta despre importanța confidențialității datelor de antrenament și de ce este susceptibilă la inginerie inversă?
Acesta este un întrebare excelent și trebuie să existe mult mai multă educație pe această temă. În mod simplist, modelele de învățare automată memorează informații. Cu cât modelele sunt mai mari, cu atât mai multe memorează cazuri marginale. Ceea ce înseamnă că informațiile pe care le-au fost antrenate aceste modele pot fi divulgate în producție. Acest lucru a fost demonstrat în mai multe lucrări de cercetare, inclusiv Secret Sharer: Evaluarea și testarea memorării neintenționate în rețelele neuronale și Extragerea datelor de antrenament din modelele de limbaj mari.
De asemenea, a fost demonstrat că informații personale pot fi extrase din încorporările de cuvinte și, pentru cei care au îndoieli cu privire la faptul că acesta este un problemă reală, a existat și un scandal în acest an când un robot de dragoste coreean a scris detalii ale utilizatorilor în conversații cu alți utilizatori.
Care sunt punctele dvs. de vedere cu privire la învățarea federată și confidențialitatea utilizatorilor?
Învățarea federată este un pas mare atunci când cazul de utilizare o permite. Cu toate acestea, este încă posibil să se extragă informații despre intrările unui utilizator din actualizările de greutate trimise către cloud de la dispozitivul unui utilizator anume, așadar este important să se combine învățarea federată cu alte tehnologii de îmbunătățire a confidențialității (confidențialitate diferențială și criptografie omomorfică/calcul securizat al părților multiple). Fiecare tehnologie de îmbunătățire a confidențialității trebuie să fie aleasă în funcție de cazul de utilizare – niciuna nu poate fi utilizată ca o unealtă pentru a rezolva toate problemele. Noi trecem prin arborele decizional aici. Un avantaj mare este că nu trimiteți niciodată datele brute în afara dispozitivului dvs. Un dezavantaj mare este că, dacă aveți nevoie de date pentru a depana un sistem sau pentru a vedea dacă este antrenat corespunzător, devine mult mai dificil să le obțineți. Învățarea federată este un bun început, cu multe probleme nerezolvate cu care atât cercetarea, cât și industria lucrează.
Private AI permite dezvoltatorilor să integreze analiza de confidențialitate cu câteva linii de cod pentru a asigura confidențialitatea, cum funcționează acest lucru?
Tehnologia noastră rulează ca un API REST, căruia utilizatorii noștri îi trimit cereri POST cu textul pe care doresc să îl redacteze, să îl deidentifice sau să îl pseudonimizeze/augmenteze cu date realiste. Unii dintre clienții noștri ne trimit transcrieri de apeluri care trebuie să fie redactate pentru a fi conforme cu PCI, în timp ce alții ne trimit conversații întregi, astfel încât să poată utiliza apoi informațiile pentru a antrena chatbot-uri, analize de sentiment sau alte modele NLP. Utilizatorii noștri pot alege, de asemenea, care entități au nevoie să păstreze sau să utilizeze ca metadate pentru a urmări unde sunt stocate datele cu caracter personal. Noi eliminăm durerea de a trebui să antrenați un sistem precis pentru a detecta și a înlocui informații personale în date foarte murdare.
De ce este confidențialitatea pentru dispozitivele IoT o problemă actuală și care sunt punctele dvs. de vedere cu privire la rezolvarea acesteia?
În cele din urmă, cel mai bun mod de a rezolva o problemă de confidențialitate este foarte dependent de cazul de utilizare, iar dispozitivele IoT nu fac excepție. În timp ce unele cazuri de utilizare pot depinde de implementarea pe margine, inferența pe margine și învățarea federată care protejează confidențialitatea (de exemplu, detectarea mulțimii în orașe inteligente), alte cazuri de utilizare pot avea nevoie de agregarea datelor și de anonimizare (de exemplu, informații despre consumul de energie). Cu toate acestea, dispozitivele IoT sunt un exemplu excelent de modul în care confidențialitatea și securitatea trebuie să meargă mână în mână. Aceste dispozitive sunt notoriu nesigure la atacuri cibernetice, așadar nu există limite pentru ceea ce pot face tehnologiile de îmbunătățire a confidențialității fără a remedia vulnerabilitățile de bază ale dispozitivului. Pe de altă parte, fără a găsi modalități de a îmbunătăți confidențialitatea utilizatorilor, informațiile colectate din interiorul caselor noastre pot fi distribuite, necontrolate, către părți necunoscute, făcându-le extrem de dificil să garantăm securitatea informațiilor. Avem două fronturi pe care trebuie să le îmbunătățim și proiectul de legislație care este redactat de Comisia Europeană cu privire la securitatea dispozitivului IoT ar putea fi ceea ce va determina producătorii de dispozitive să își asume responsabilitatea față de securitatea și confidențialitatea consumatorilor.
Există altceva pe care ați dori să îl împărtășiți despre Private AI?
Suntem un grup de experți în domeniul confidențialității, limbajului natural, limbajului vorbit, procesării de imagine, implementării modelului de învățare automată în medii cu resurse reduse, sprijiniți de M12, fondul de venture al Microsoft (MSFT ).
Noi ne asigurăm că produsele pe care le creăm, pe lângă faptul că sunt extrem de precise, sunt și computațional eficiente, astfel încât să nu aveți o factură uriașă la cloud la sfârșitul lunii. De asemenea, datele clienților noștri nu sunt niciodată transferate către noi – totul este procesat în mediul lor.
Mulțumim pentru acest interviu minunat, pentru a afla mai multe, vizitați Private AI.












