Lideri de opinie

Există o soluție clară pentru riscurile la adresa confidențialității generate de inteligența artificială?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Riscurile la adresa confidențialității generate de inteligența artificială sunt foarte reale. De la supravegherea sporită și expunerea la campanii de phishing și vishing mai eficiente ca niciodată, inteligența artificială generează riscuri la adresa confidențialității în masă, în mod indiscriminat, oferind actorilor răi, fie că sunt criminali, sponsorizați de stat sau guvern, instrumentele de care au nevoie pentru a ținti indivizi și grupuri.

Soluția cea mai clară la această problemă implică consumatorii și utilizatorii care, în mod colectiv, își întorc spatele la hype-ul legat de inteligența artificială, cerând transparență de la cei care dezvoltă sau implementează așa-zise caracteristici ale inteligenței artificiale și o reglementare eficientă din partea organismelor guvernamentale care supraveghează operațiunile lor. Deși este demn de urmărit, acest lucru nu este probabil să se întâmple în curând.

Ceea ce rămâne sunt abordări rezonabile, chiar dacă necesar incomplete, pentru mitigarea riscurilor la adresa confidențialității generate de inteligența artificială. Prognoza pe termen lung, sigură, dar plictisitoare, este că, cu cât publicul devine mai educat despre confidențialitatea datelor în general, cu atât riscurile la adresa confidențialității generate de adoptarea în masă a inteligenței artificiale vor fi mai mici.

Oare toată lumea înțelege corect conceptul de inteligență artificială generativă?

Hype-ul în jurul inteligenței artificiale este atât de ubicuu încât o anchetă a ceea ce oamenii înțeleg prin inteligență artificială generativă este aproape inutilă. Desigur, niciuna dintre aceste “caracteristici ale inteligenței artificiale”, funcționalități și produse nu reprezintă, de fapt, exemple de inteligență artificială adevărată, orice ar însemna acest lucru. Mai degrabă, acestea sunt, în mare parte, exemple de învățare automată (ML), învățare profundă (DL) și modele de limbaj mari (LLM).

Inteligența artificială generativă, așa cum sugerează și numele, poate genera conținut nou – fie text (inclusiv limbaje de programare), sunet (inclusiv muzică și voci umane) sau videoclipuri (cu sunet, dialog, tăieturi și schimbări de cameră). Toate acestea sunt realizate prin antrenarea LLM-urilor pentru a identifica, a corela și a reproduce modele în conținutul generat de oameni.

Să luăm ChatGPT ca exemplu. Ca și multe LLM-uri, este antrenat în trei etape ample:

  • Pre-antrenament: În această fază, LLM-ul este “hrănit” cu material textual de pe internet, cărți, reviste academice și orice altceva care conține text potențial relevant sau util.
  • Reglare fină a instrucțiunilor supravegheate: Modelele sunt antrenate pentru a răspunde mai coerent la instrucțiuni, utilizând perechi de instrucțiuni și răspunsuri de înaltă calitate, în general, obținute de la oameni.
  • Învățare prin întărire din feedbackul uman (RLHF): LLM-urile, cum ar fi ChatGPT, suferă adesea această etapă suplimentară de antrenament, în timpul căreia interacțiunile cu utilizatorii umani sunt utilizate pentru a rafina alinierea modelului cu cazurile de utilizare tipice.

Toate cele trei etape ale procesului de antrenament implică date, fie depozite masive de date pre-gătite (cum ar fi cele utilizate în pre-antrenament), fie date colectate și procesate aproape în timp real (cum ar fi cele utilizate în RLHF). Aceste date sunt cele care poartă cea mai mare parte a riscurilor la adresa confidențialității generate de inteligența artificială.

Care sunt riscurile la adresa confidențialității generate de inteligența artificială?

Confidențialitatea este compromisă atunci când informații personale despre un individ (subiectul datelor) sunt puse la dispoziția altor indivizi sau entități fără consimțământul subiectului datelor. LLM-urile sunt pre-antrenate și reglate pe o gamă extrem de largă de date care pot și adesea conțin date personale. Aceste date sunt, de obicei, extrase din surse public disponibile, dar nu întotdeauna.

Chiar și atunci când aceste date sunt luate din surse public disponibile, faptul că sunt agregate și procesate de un LLM și apoi, în esență, făcute căutabile prin interfața LLM-ului, poate fi considerat o încălcare suplimentară a confidențialității.

Etapa de învățare prin întărire din feedbackul uman (RLHF) complică lucrurile. În această etapă de antrenament, interacțiunile reale cu utilizatorii umani sunt utilizate pentru a corecta și rafina răspunsurile LLM-ului. Acest lucru înseamnă că interacțiunile unui utilizator cu un LLM pot fi vizualizate, partajate și diseminate de oricine are acces la datele de antrenament.

În majoritatea cazurilor, acest lucru nu reprezintă o încălcare a confidențialității, având în vedere că majoritatea dezvoltatorilor de LLM includ politici de confidențialitate și termeni de serviciu care cer utilizatorilor să consimtă înainte de a interacționa cu LLM-ul. Riscul la adresa confidențialității se află, mai degrabă, în faptul că mulți utilizatori nu sunt conștienți că au fost de acord cu o astfel de colectare și utilizare a datelor. Astfel de utilizatori sunt probabil să dezvăluie informații private și sensibile în timpul interacțiunilor cu aceste sisteme, fără a-și da seama că aceste interacțiuni nu sunt confidențiale și nu sunt private.

În acest fel, ajungem la cele trei moduri principale în care inteligența artificială generează riscuri la adresa confidențialității:

  • Depozitele mari de date de pre-antrenament care pot conține informații personale sunt vulnerabile la compromitere și extragere.
  • Informațiile personale incluse în datele de pre-antrenament pot fi scurse către alți utilizatori ai aceluiași LLM prin răspunsurile sale la întrebări și instrucțiuni.
  • Informațiile personale și confidențiale furnizate în timpul interacțiunilor cu LLM-urile ajung la angajații LLM-urilor și, posibil, la contractori terți, de unde pot fi vizualizate sau scurse.

Toate acestea sunt riscuri pentru confidențialitatea utilizatorilor, dar șansele ca informații cu caracter personal (PII) să ajungă în mâinile greșite par, încă, destul de scăzute. Acest lucru se întâmplă, cel puțin, până când brokerii de date intră în scenă. Aceste companii se specializează în detectarea PII și colectarea, agregarea și diseminarea, dacă nu chiar difuzarea, acestor informații.

Cu PII și alte date personale devenind, într-un fel, o marfă și industria brokerilor de date apărând pentru a profita de aceasta, orice date personale care “ies” acolo sunt foarte probabil să fie preluate de brokerii de date și răspândite pe scară largă.

Riscurile la adresa confidențialității generate de inteligența artificială în context

Înainte de a examina riscurile la adresa confidențialității generate de inteligența artificială în contextul unor produse, servicii și parteneriate corporatiste specifice, să facem un pas înapoi și să aruncăm o privire mai structurată asupra gamei complete de riscuri generate de inteligența artificială. Scriind pentru IAPP, Moraes și Previtali au abordat o abordare bazată pe date pentru a rafina “Taxonomia confidențialității” a lui Solove din 2006, reducând cele 16 riscuri la adresa confidențialității descrise acolo la 12 riscuri la adresa confidențialității specifice inteligenței artificiale.

Acestea sunt cele 12 riscuri la adresa confidențialității incluse în taxonomia revizuită a lui Moraes și Previtali:

  • Supraveghere: Inteligența artificială exacerbă riscurile la adresa supravegherii prin creșterea scalei și ubiquității colectării datelor personale.
  • Identificare: Tehnologiile inteligenței artificiale permit legarea automată a identității pe diverse surse de date, creșterea riscurilor legate de expunerea identității personale.
  • Agregare: Inteligența artificială combină diverse fragmente de date despre o persoană pentru a face inferențe, creând riscuri de invazie a confidențialității.
  • Frenologie și fiziognomie: Inteligența artificială inferă personalitatea sau atributele sociale din caracteristicile fizice, o nouă categorie de risc care nu este în taxonomia lui Solove.
  • Utilizare secundară: Inteligența artificială exacerbă utilizarea datelor personale în scopuri altfel decât cele inițiale prin reutilizarea datelor.
  • Excludere: Inteligența artificială face mai gravă lipsa de informare sau control al utilizatorilor asupra modului în care sunt utilizate datele lor prin practici de date opace.
  • Insecuritate: Cerințele de date și practicile de stocare ale inteligenței artificiale riscă scurgeri de date și accesuri neautorizate.
  • Expunere:Inteligența artificială poate dezvălui informații sensibile, cum ar fi prin tehnici de inteligență artificială generativă.
  • Distorsionare:Capacitatea inteligenței artificiale de a genera conținut realist, dar fals, sporește răspândirea informațiilor false sau înșelătoare.
  • Divulgare: Inteligența artificială poate determina partajarea incorectă a datelor atunci când inferă informații sensibile suplimentare din datele brute.
  • Creșterea accesibilității: Inteligența artificială face informații sensibile mai accesibile unui public mai larg decât cel intenționat.
  • Intruziune: Tehnologiile inteligenței artificiale invadează spațiul personal sau singurătatea, adesea prin măsuri de supraveghere.

Acest lucru face o citire destul de alarmantă. Este important de notat că această taxonomie, în favoarea sa, ia în considerare tendința inteligenței artificiale generative de a halucina – de a genera și prezenta cu încredere informații factual inexacte. Acest fenomen, chiar dacă rareori dezvăluie informații reale, este și el un risc la adresa confidențialității. Răspândirea informațiilor false și înșelătoare afectează confidențialitatea subiectului în moduri mai subtile decât în cazul informațiilor exacte, dar o afectează totuși.

Să ne concentrăm asupra unor exemple concrete despre cum aceste riscuri la adresa confidențialității se manifestă în contextul unor produse și servicii AI reale.

Interacțiuni directe cu sisteme de inteligență artificială generativă bazate pe text

Cazul cel mai simplu este cel în care un utilizator interacționează direct cu un sistem de inteligență artificială generativă, cum ar fi ChatGPT, Midjourney sau Gemini. Interacțiunile utilizatorului cu multe dintre aceste produse sunt înregistrate, stocate și utilizate pentru RLHF (învățare prin întărire din feedbackul uman), reglare fină a instrucțiunilor supravegheate și chiar pentru pre-antrenarea altor LLM-uri.

O analiză a politicilor de confidențialitate ale multor servicii de acest tip dezvăluie, de asemenea, alte activități de partajare a datelor, susținute de scopuri foarte diferite, cum ar fi marketingul și brokerajul de date. Acesta este un alt tip de risc la adresa confidențialității generat de inteligența artificială: aceste sisteme pot fi caracterizate ca imense canalizări de date, colectând date furnizate de utilizatori, precum și cele generate prin interacțiunile lor cu LLM-ul subiacent.

Interacțiuni cu sisteme de inteligență artificială generativă încorporate

Unii utilizatori pot interacționa cu interfețe de inteligență artificială generativă încorporate în orice produs pe care îl folosesc. Utilizatorul poate ști că utilizează o “caracteristică a inteligenței artificiale”, dar este mai puțin probabil să știe ce implică acest lucru în ceea ce privește riscurile la adresa confidențialității. Ceea ce vine în prim-plan cu sistemele încorporate este lipsa de apreciere a faptului că datele personale partajate cu LLM-ul ar putea ajunge în mâinile dezvoltatorilor și brokerilor de date.

Există două grade de lipsă de conștientizare aici: unii utilizatori realizează că interacționează cu un produs de inteligență artificială generativă; și alții cred că utilizează produsul în care inteligența artificială generativă este încorporată sau accesată. În orice caz, utilizatorul ar fi putut (și, probabil, a făcut) să fi consimțit în mod tehnic la termenii și condițiile asociate cu interacțiunile sale cu sistemul încorporat.

Alte parteneriate care expun utilizatorii la sisteme de inteligență artificială generativă

Unele companii încorporează sau includ în alt mod interfețe de inteligență artificială generativă în software-ul lor în moduri mai puțin evidente, lăsând utilizatorii să interacționeze – și să partajeze informații – cu terți fără să-și dea seama. Din fericire, “inteligența artificială” a devenit un atât de bun punct de vânzare încât este puțin probabil ca o companie să păstreze astfel de implementări secrete.

Un alt fenomen în acest context este reacția puternică pe care au avut-o unele companii după ce au încercat să partajeze datele utilizatorilor sau ale clienților cu companii de inteligență artificială generativă, cum ar fi OpenAI. Compania de ștergere a datelor Optery, de exemplu, a revocat recent o decizie de a partaja datele utilizatorilor cu OpenAI pe o bază de opt-out, ceea ce înseamnă că utilizatorii erau înscriși în program în mod implicit.

Nu numai că clienții au fost rapidi în a-și exprima dezamăgirea, dar serviciul de ștergere a datelor al companiei a fost imediat delistat de pe lista de servicii de ștergere a datelor recomandate de Ghidurile de confidențialitate. În favoarea Optery, compania și-a revocat rapid și transparent decizia, dar reacția generală este cea care este semnificativă aici: oamenii încep să aprecieze riscurile partajării datelor cu “companii de inteligență artificială”.

Cazul Optery este un exemplu bun aici, deoarece utilizatorii săi se află, într-un fel, în avangarda scepticismului crescând în jurul implementărilor de inteligență artificială. Tipurile de oameni care optează pentru un serviciu de ștergere a datelor sunt, de obicei, cei care vor acorda atenție schimbărilor în termenii și condițiile de confidențialitate.

Dovezi ale unei reacții puternice împotriva utilizării datelor de inteligență artificială generativă

Consumatorii conștienți de confidențialitate nu au fost singurii care au ridicat îngrijorări cu privire la sistemele de inteligență artificială generativă și riscurile la adresa confidențialității asociate. La nivel legislativ, Actul privind inteligența artificială al UE categorizează riscurile în funcție de gravitate, cu confidențialitatea datelor fiind criteriul explicit sau implicit pentru atribuirea gravității în majoritatea cazurilor. Actul abordează, de asemenea, problemele consimțământului informat pe care le-am discutat anterior.

SUA, notoriu lent în a adopta legislație cuprinzătoare și federală privind confidențialitatea datelor, are, cel puțin, unele pârghii datorită Ordinului executiv 14110. Din nou, îngrijorările legate de confidențialitatea datelor se află în prim-planul scopurilor menționate în Ordin: “utilizarea necorespunzătoare a tehnologiilor de inteligență artificială ar putea exacerba daunele sociale, cum ar fi frauda, discriminarea, prejudecățile și dezinformarea” – toate legate de disponibilitatea și diseminarea datelor personale.

Revenind la nivelul consumatorului, nu doar consumatorii conștienți de confidențialitate au fost cei care s-au împotrivit implementărilor de inteligență artificială generativă care invadau confidențialitatea. Caracteristica “Recall” a lui Microsoft (MSFT ), “împuternicită de inteligență artificială”, destinată sistemului de operare Windows 11, este un exemplu de primă mână. Odată ce s-a dezvăluit amploarea riscurilor la adresa confidențialității și securității, reacția a fost suficient de puternică pentru a determina gigantul tehnologic să facă un pas înapoi. Din nefericire, Microsoft pare să nu fi abandonat ideea, dar reacția inițială a publicului este, în orice caz, încurajatoare.

Rămânând la Microsoft, programul său Copilot a fost criticat pe scară largă pentru atât probleme de confidențialitate a datelor, cât și de securitate a datelor. Deoarece Copilot a fost antrenat pe date de pe GitHub (în mare parte cod sursă), a apărut, de asemenea, controversă în jurul presupuselor încălcări de către Microsoft a acordurilor de licențiere a software-ului programatorilor și dezvoltatorilor. În astfel de cazuri, granițele dintre confidențialitatea datelor și drepturile de proprietate intelectuală încep să se estompeze, conferind confidențialității o valoare monetară – ceea ce nu este ușor de realizat.

Poate cel mai mare indicator că inteligența artificială devine un steag roșu în ochii consumatorilor este reacția publică rezervată și chiar precaută pe care Apple (AAPL ) a primit-o la lansarea inițială a inteligenței artificiale, în special în ceea ce privește acordurile de partajare a datelor cu OpenAI.

Solțiile parțiale

Există pași pe care legislatorii, dezvoltatorii și companiile îi pot face pentru a ameliora unele dintre riscurile generate de inteligența artificială. Acestea sunt soluții specializate pentru aspecte specifice ale problemei generale, niciuna dintre aceste soluții nu este suficientă, dar toate, împreună, ar putea face o diferență reală.

  • Minimizarea datelor. Minimizarea cantității de date colectate și stocate este un obiectiv rezonabil, dar este direct opus dorinței dezvoltatorilor de inteligență artificială generativă pentru date de antrenament.
  • Transparența. Având în vedere stadiul actual al tehnologiei de învățare automată, acest lucru poate să nu fie chiar fezabil din punct de vedere tehnic în multe cazuri. O perspectivă asupra datelor procesate și asupra modului în care se generează un anumit output este un mod de a asigura confidențialitatea în interacțiunile cu sistemele de inteligență artificială generativă.
  • Anonimizarea. Orice informații cu caracter personal care nu pot fi excluse din datele de antrenament (prin minimizarea datelor) ar trebui să fie anonimizate. Problema este că multe tehnici populare de anonimizare și pseudonimizare sunt ușor de învins.
  • Consimțământul utilizatorului. Cerința ca utilizatorii să consimtă la colectarea și partajarea datelor lor este esențială, dar prea deschisă la abuz și prea predispusă la complacerea consumatorului pentru a fi eficientă. Aici este nevoie de consimțământ informat, iar majoritatea consumatorilor, corect informați, nu ar consimți la un astfel de partajare de date, așa că stimulentele sunt aliniate greșit.
  • Securizarea datelor în tranzit și la rest. Un alt fundament al atât confidențialității datelor, cât și al securității datelor, protejarea datelor prin mijloace criptografice și alte mijloace poate fi întotdeauna făcută mai eficientă. Cu toate acestea, sistemele de inteligență artificială generativă tind să scurgă date prin interfețele lor, făcând acest lucru doar o parte a soluției.
  • Aplicarea dreptului de autor și a legislației privind proprietatea intelectuală în contextul așa-zisei inteligențe artificiale. Învățarea automată poate funcționa într-o “cutie neagră”, făcând dificilă, dacă nu imposibilă, urmărirea materialului cu drept de autor și a proprietății intelectuale care ajung în care output de inteligență artificială generativă.
  • Auditurile. O altă măsură de pârghie crucială, împiedicată de natura “cutiei negre” a LLM-urilor și a sistemelor de inteligență artificială generativă pe care le susțin. Această limitare inerentă este compusă de natura închisă a sursă a majorității produselor de inteligență artificială generativă, care limitează auditurile la cele efectuate la discreția dezvoltatorului.

Toate aceste abordări ale problemei sunt valabile și necesare, dar niciuna nu este suficientă. Toate necesită sprijin legislativ pentru a avea un efect semnificativ, ceea ce înseamnă că sunt condamnate să rămână în urma acestui domeniu dinamic care continuă să evolueze.

Soluția clară

Soluția la riscurile la adresa confidențialității generate de inteligența artificială nu este revoluționară și nici excitantă, dar dusă la concluzia sa logică, rezultatele sale ar putea fi ambele. Soluția clară implică consumatorii obișnuiți care devin conștienți de valoarea datelor lor pentru companii și de prețiozitatea confidențialității pentru ei înșiși.

Consumatorii sunt sursele și motoarele din spatele informațiilor private care alimentează ceea ce se numește economia supravegherii moderne. Odată ce o masă critică de consumatori începe să oprească fluxul de date personale în sfera publică și începe să ceară responsabilitate de la companiile care fac comerț cu date personale, sistemul va trebui să se corecteze singur.

Lucrul încurajator despre inteligența artificială generativă este că, spre deosebire de modelele actuale de publicitate și marketing, nu trebuie să implice informații personale la niciun stadiu. Datele de pre-antrenament și de reglare fină nu trebuie să conțină informații cu caracter personal, iar utilizatorii nu trebuie să le expună în timpul interacțiunilor cu sistemele de inteligență artificială generativă.

Pentru a-și înlătura informațiile personale din datele de antrenament, oamenii pot merge direct la sursă și își pot șterge profilurile de la diversele brokeri de date (inclusiv site-urile de căutare a persoanelor) care agregă înregistrări publice, aducându-le în circulație pe piața deschisă. Serviciile de ștergere a datelor personale automatizează procesul, făcându-l rapid și ușor. Desigur, ștergerea datelor personale din bazele de date ale acestor companii are multe alte beneficii și niciun dezavantaj.

Oamenii generează, de asemenea, date personale atunci când interacționează cu software-ul, inclusiv inteligența artificială generativă. Pentru a opri fluxul acestor date, utilizatorii vor trebui să fie mai conștienți că interacțiunile lor sunt înregistrate, revizuite, analizate și partajate. Opțiunile lor pentru a evita acest lucru se reduc la a limita ceea ce dezvăluie către sistemele online și la a utiliza LLM-uri pe dispozitiv și cu sursă deschisă, ori de câte ori este posibil. Oamenii, în general, fac deja o treabă bună în a-și modula ceea ce discută în public – doar trebuie să extindem aceste instincte în domeniul inteligenței artificiale generative.

David Balaban este un cercetător în domeniul securității calculatoarelor, cu peste 17 ani de experiență în analiza malware-ului și evaluarea software-ului antivirus. David conduce proiectele MacSecurity.net și Privacy-PC.com care prezintă opinii ale experților pe probleme actuale de securitate a informației, incluzând ingineria socială, malware, testarea de penetrare, inteligența amenințărilor, confidențialitatea online și hacking-ul cu pălărie albă. David are o puternică experiență în soluționarea problemelor de malware, cu o focalizare recentă pe măsurile de contracarare a ransomware-ului.