Unghiul lui Anderson

În mod tot mai frecvent, HIPAA nu poate opri AI-ul să dezanonimizeze datele pacienților

mm
Adaugă Unite.AI la sursele tale preferate pe Google
An AI-generated image featuring a crowd of businesspeople gathered around the hospital bed of a masked patient, trying to remove his mask. Z-Image Turbo + Qwen Edit V1, via Krita AI Diffusion.

Chiar și după ce spitalele elimină numele și codurile poștale, AI-ul modern poate, uneori, să afle totuși cine sunt pacienții. O veste bună pentru companiile de asigurări; nu la fel de bună pentru beneficiarii îngrijirii medicale.

 

Noi cercetări de la Universitatea din New York arată că notele medicale ale pacienților din Statele Unite, lipsite de nume și alte identificatori HIPAA, pot expune pacienții la re-identificare. Prin antrenarea modelelor de limbaj AI pe un corpus mare de înregistrări medicale reale, neanonimizate, detalii care definesc identitatea rămân – în unele cazuri, permițând inferența cartierului pacientului din diagnostic singur.

Noua studiu plasează acest risc în contextul unui piață profitabilă de date medicale dezanonimizate, unde spitalele și brokerii de date vând sau licențiază în mod rutinier note clinice curățate către firme farmaceutice, asigurători și dezvoltatori de AI.

Autorii noii studii contestă chiar și conceptul de “dezanonimizare”, înscris în protecțiile pacienților stabilite de HIPAA după ce guvernatorul Massachusetts William Weld și-a avut datele medicale dezanonimizate în 1997:

‘[Chiar și] sub conformarea perfectă a Safe Harbor, notele “dezanonimizate” rămân statistic legate de identitate prin corelațiile care confirmă utilitatea lor clinică. Conflictul este structural, nu tehnic.’

Cercetătorii susțin că cadrele actuale de dezanonimizare conforme cu HIPAA lasă două “uși din spate” disponibile pentru “atacuri de legătură”:

Din noua lucrare, un diagramă cauzală care ilustrează modul în care dezanonimizarea în stil HIPAA elimină atribute sensibile explicite, lăsând corelații legate de identitate intacte, permițând inferența identității pacientului prin informații medicale și nesensibile.

Din noua lucrare, un diagramă cauzală care ilustrează modul în care dezanonimizarea în stil HIPAA elimină atribute sensibile explicite, lăsând corelații legate de identitate intacte, permițând inferența identității pacientului prin informații medicale și nesensibile. Sursă

În exemplul de mai sus, vedem nu numai că pacientul este însărcinat – cel mai ușor de dezanonimizat, deoarece stabilește genul biologic în mod neechivoc –, ci și că îi place o activitate care nu este asociată cu grupurile cu venituri mai mici, conform cercetătorilor:

‘Deși atributele protejate (data nașterii și codul poștal) sunt șterse, putem totuși infera că pacientul este o femeie adultă pe baza sarcinii și că locuiește într-un cartier bogat, dată fiind hobby-ul de echitație.’

Într-un experiment, chiar și după ce identificatorii pacienților au fost eliminați, peste 220.000 de note clinice de la 170.000 de pacienți de la NYU Langone au purtat încă suficient semnal pentru a permite inferența trăsăturilor demografice.

Analizarea în detaliu

Un model bazat pe BERT a fost reglat pentru a prezice șase atribute din înregistrările dezanonimizate și, după cum notează lucrarea, a depășit ghicirile aleatorii cu doar 1.000 de exemple de antrenament. Sexul biologic a fost recuperat cu o acuratețe de peste 99,7%, iar chiar și semnalele mai slabe, cum ar fi luna în care au fost luate notele, au fost prezise la niveluri mai bune decât ghicirile aleatorii.

Pentru scopuri experimentale, trăsăturile inferate au fost apoi utilizate într-un atac de legătură împotriva bazei de date Langone, producând un risc maxim de re-identificare unică de 0,34% – aproximativ de 37 de ori mai mare decât o bază de clasă majoritară simplă. Aplicat la populația Statelor Unite, acest atac singur ar dezanonimiza 800.000 de pacienți.

Autorii cadrează problema ca o “paradoxă”, deoarece ceea ce rămâne în urma înregistrărilor medicale dezanonimizate conforme cu HIPAA este, în mod evident, o bază viabilă pentru atacuri de dezanonimizare:

‘[Majoritatea] riscului de re-identificare provine nu din Informațiile de Sănătate Protejate, ci din conținutul medical și nesensibil pe care îl considerăm sigur pentru a fi împărtășit.’

Hărți la nivel de cartier ale ratei de mortalitate intraspitalicească, duratei medii de ședere spitalicească și venitului pe cap de locuitor în New York, arătând cum rezultatele clinice și variabilele socioeconomice se grupează geografic și creează modele legate de identitate în notele medicale dezanonimizate.

Hărți ale cartierelor din New York, arătând diferențe în ratele de deces spitalicești, durata medie de ședere și nivelurile de venit, ilustrând cum rezultatele medicale și bogăția variază în funcție de zonă și pot lăsa indicii legați de locație chiar și în notele medicale dezanonimizate. Vă rugăm să consultați lucrarea sursă pentru exemple suplimentare

Lucrarea susține că regulile Safe Harbor ale HIPAA nu mai funcționează așa cum intenționau factorii de decizie: eliminarea a 18 identificatori poate să satisfacă litera legii, dar, conform autorilor, nu împiedică identitatea să fie inferată de modelele actuale de limbaj. Ei cadrează sistemul însuși ca fiind construit pe ipoteze învechite cu privire la ceea ce pot și nu pot infera modelele de limbaj din textul medical obișnuit.

Lucrarea sugerează, de asemenea, că cei care sunt probabil să beneficieze de slăbiciunile menționate sunt corporații mari legate de asigurări medicale, mai degrabă decât entități criminale convențional definite (cum ar fi hackeri, șantajiști sau ingineri sociali)*:

‘Persistența Safe Harbor, în ciuda limitărilor cunoscute, nu este o supraveghere, ci o caracteristică a unui sistem optimizat pentru lichiditatea datelor, mai degrabă decât pentru protecția pacienților. Notele clinice dezanonimizate reprezintă o piață de miliarde de dolari, creând disincentive structurale pentru instituțiile de sănătate să adopte alternative care protejează confidențialitatea, care ar putea reduce utilitatea datelor sau ar necesita investiții costisitoare în infrastructură.

‘Există o urgență de a investiga, înțelege și aborda cu atenție acest dezavantaj.’

Acesta este un document de poziție, fără răspunsuri clare oferite; cu toate acestea, autorii sugerează că cercetarea în legătură cu dezanonimizarea ar trebui să se îndrepte spre contracte sociale și consecințe legale ale încălcării, mai degrabă decât spre soluții tehnice (probabil același abordare utilizat de DMCA pentru a restricționa copierea lucrărilor protejate de drepturi de autor, atunci când soluțiile tehnice au eșuat).

Noua lucrare se intitulează Paradoxul dezanonimizării: O critică a portului sigur al HIPAA în era modelelor de limbaj și provine de la patru cercetători de la Universitatea din New York, în asociere cu spitalul NYU Langone.

Metodă

Pentru a testa teoria lor, autorii au dezvoltat un atac de legătură în două etape, utilizând 222.949 de note clinice identificate de la 170.283 de pacienți tratați la NYU Langone, cu toate notele împărțite pe pacient în 80% antrenament, 10% validare și 10% teste, pentru a preveni contaminarea încrucișată.

Pentru context, această colecție este de 3,34 ori mai mare decât setul de date MIMIC-IV, cea mai mare colecție publică de înregistrări electronice de sănătate (EHR). Din motive de confidențialitate, setul de date Langone nu va fi disponibil în nicio formă, deși utilizatorii pot experimenta cu principiile proiectului prin intermediul unui depozit GitHub care generează date sintetice.

Șase atribute demografice au fost selectate pentru a aproxima trioul clasic de re-identificare identificat într-o lucrare anterioară influentă: sex biologic; cartier; anul notei; luna notei; venitul zonal; și tipul de asigurare:

Atribute demografice inferate din notele clinice dezanonimizate ale pacienților de la NYU Langone, cuprinzând sex biologic, cartier, anul notei, luna notei, venitul zonal și tipul de asigurare, selectate pentru a aproxima trioul de identificare unică descris în 'Identificarea simplă a demografiei adesea identifică oamenii în mod unic' - https://dataprivacylab.org/projects/identifiability/paper1.pdf

Atribute demografice inferate din notele clinice dezanonimizate ale pacienților de la NYU Langone, cuprinzând sex biologic, cartier, anul notei, luna notei, venitul zonal și tipul de asigurare, selectate pentru a aproxima trioul de identificare unică descris în ‘Identificarea simplă a demografiei adesea identifică oamenii în mod unic’.

Notele au fost dezanonimizate utilizând UCSF philter înainte de modelare.

Un model BERT-base-uncased cu 110 milioane de parametri, pre-antrenat pe text general pentru a evita expunerea anterioară la date clinice, a fost reglat separat pentru fiecare atribut, utilizând opt GPU-uri NVIDIA A100 cu 40GB memorie, sau GPU-uri H100, cu 80GB memorie, pentru până la zece epoci. Optimizarea a utilizat AdamW, cu o rată de învățare de 2×10−5, și o dimensiune eficientă a lotului de 256

Generalizarea pe setul de test a fost evaluată utilizând acuratețe și ROC-AUC ponderat, acesta din urmă ales pentru a ține cont de dezechilibru de clasă pe atribute.

Pentru a face atacul mai realist, predicțiile modelului nu au fost tratate ca răspunsuri definitive. În schimb, pentru fiecare atribut, cele mai probabile valori au fost păstrate, iar baza de date a pacienților a fost filtrată pentru a include orice pacient care se potrivea cu aceste trăsături prezise. Acest lucru a produs o listă scurtă de identități posibile pentru fiecare notă, mai degrabă decât o singură ghicire.

Evaluarea riscului

Riscul de re-identificare a fost calculat în două etape: măsurarea frecvenței cu care pacientul real apare în grupul scurtat; și estimarea șanselor de a selecta persoana corectă din acel grup.

Deoarece ultimul pas a presupus că cineva alege un nume la întâmplare din posibilele potriviri, numărul raportat este o estimare prudentă, iar un atacator hotărât ar putea face mai bine.

Experimentul a presupus acces la întreaga populație de pacienți din baza de date externă. Acest lucru reflectă un scenariu realist, în care o instituție mare sau un broker de date încearcă legătura, mai degrabă decât un individ care acționează cu informații limitate, consolidând și mai mult natura amenințării pe care autorii o abordează în lucrare.

Rezultate

Riscul a fost măsurat la trei niveluri: rată de succes a re-identificării de grup a capturat frecvența cu care pacientul real apare în setul de candidați scurtați ai modelului, pe baza predicțiilor corecte top k pentru toate atributele; re-identificare individuală din grup a măsurat șansa de a selecta persoana corectă odată ce grupul a fost identificat; și probabilitatea de re-identificare unică a înmulțit cele două, dând probabilitatea generală de a identifica în mod unic un pacient din notele dezanonimizate:

Acuratețea predicției pentru sex biologic, cartier, an, lună, venit și tip de asigurare, arătând că BERT-base-uncased antrenat pe notele clinice dezanonimizate ale pacienților de la NYU Langone depășește ghicirile aleatorii chiar și cu 1.000 de exemple de antrenament, cu acuratețea îmbunătățindu-se constant pe măsură ce setul de date crește la 178.000 de exemple.

Acuratețea predicției pentru sex biologic, cartier, an, lună, venit și tip de asigurare, arătând că BERT-base-uncased antrenat pe notele clinice dezanonimizate ale pacienților de la NYU Langone depășește ghicirile aleatorii chiar și cu 1.000 de exemple de antrenament, cu acuratețea îmbunătățindu-se constant pe măsură ce setul de date crește la 178.000 de exemple.

Dintre aceste rezultate inițiale, autorii notează:

‘Așa cum se arată [mai sus], notele clinice dezanonimizate rămân vulnerabile la predicția atributelor. Pe toate cele șase atribute și pe toate regimurile de date (1k până la 177k de exemple), modelul de limbaj (roșu) depășește în mod constant bazele aleatorii (gri).

‘Aceste rezultate susțin empiric faptul că procesul de dezanonimizare păstrează semnale exploatabile în cele două căi de acces din spate.

‘Riscul de confidențialitate este imediat: modelele ating performanțe peste ghicirile aleatorii cu doar 1.000 de exemple de antrenament. În timp ce sexul biologic este cel mai expus atribut (recuperat cu o acuratețe de peste 99,7%), chiar și semnalele mai slabe (luna notei) sunt prezise cu o acuratețe mai bună decât ghicirile aleatorii.’

În al doilea grafic de rezultate de mai jos, o direcție arată cât de des modelul include pacientul real în lista sa scurtă. Cealaltă arată cât de mică este acea listă scurtă:

Frecvența cu care lista scurtă a modelului conține pacientul real, reprezentată grafic împotriva cât de ușor este să alegi persoana corectă din acea listă scurtă – arătând că modelul de limbaj creează un risc mai mare de re-identificare decât ghicirile simple, ajungând la 0,34%, comparativ cu 0,0091% pentru cea mai puternică bază de comparație.

Frecvența cu care lista scurtă a modelului conține pacientul real, reprezentată grafic împotriva cât de ușor este să alegi persoana corectă din acea listă scurtă – arătând că modelul de limbaj creează un risc mai mare de re-identificare decât ghicirile simple, ajungând la 0,34%, comparativ cu 0,0091% pentru cea mai puternică bază de comparație.

Cu cât pacientul real apare mai des, și cu cât lista scurtă este mai mică, cu atât riscul este mai mare. Modelul de limbaj al autorilor a depășit o ghicire simplă a clasei majoritare pe ambele fronturi, ajungând la un vârf de 0,34% șansă de a identifica în mod unic un pacient – aproximativ de 37 de ori mai mare decât baza de comparație cea mai puternică.

Autorii notează că, pentru pacienții cu istorii medicale neobișnuite sau identități marginalizate, riscurile de dezanonimizare sunt mai mari și concluzionează cu o recomandare pentru o reevaluare serioasă a standardului Safe Harbor al HIPAA:

‘[Standardul] Safe Harbor al HIPAA funcționează pe o definiție binară a confidențialității: datele sunt fie “identificate”, fie “dezanonimizate”. HIPAA presupune că eliminarea unei liste statice de token-uri face datele “sigure”, decuplând în mod eficient narativa clinică de identitatea pacientului.

‘Cu toate acestea, analiza noastră cauzală și rezultatele empirice sugerează că această decuplare este o iluzie.

‘Notele clinice sunt în mod inerent legate de identitate. Diagnosticul medical și narativa neștearsă a unui pacient sunt produse directe ale traiectoriei sale unice de viață, creând o semnătură multidimensională care poate fi cartografiată înapoi la individ.’

Autorii subliniază, de asemenea, că regulile actuale de dezanonimizare se concentrează pe eliminarea unei liste fixe de identificatori, ignorând modelele lăsate în urmă în textul rămas. Modelele de limbaj mari, notează ei, sunt construite pentru a detecta și combina astfel de modele – ceea ce înseamnă că detalii clinice obișnuite pot începe să funcționeze ca “identificatori indirecți”.

Lucrarea se încheie cu o serie de recomandări, incluzând o îndemnare de a înceta reglarea modelelor pe date sintetice, sau “date dezclasificate”, deoarece prima păstrează riscuri de confidențialitate în ceea ce privește datele reale utilizate pentru a le informa; și a doua presupune că standardul anterior de protecție al HIPAA este încă eficient.

Concluzie

Deoarece “ușile din spate” de acest tip sunt, în mod evident, de cel mai mare beneficiu pentru organizații mari, cum ar fi companiile de asigurări – care vor folosi, probabil, aceste informații într-un mod clandestin și fără divulgare – o abordare de tip “blocare legală” (în care actul de a ocoli protecția este interzis, indiferent de tehnologiile utilizate) este o abordare ineficientă.

Este bine cunoscut că companiile de asigurări ar dori să obțină acces la informații de acest tip și că, direct sau prin asociere cu brokeri de date, au un nivel extraordinar de acces la înregistrări medicale private; și cu cât compania este mai mare, cu atât baza sa de date nativă de clienți va fi.

Prin urmare, dacă prevederile și garanțiile stricte ale HIPAA devin mai mult un “acord de gentleman” decât o barieră eficientă împotriva exploatării corporative, o revizuire pare, într-adevăr, oportună.

 

* Conversia mea a citărilor inline ale autorilor în legături hipertext.

Publicat pentru prima dată miercuri, 11 februarie 2026

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai