Andersons vinkel
Alltmer kan HIPAA inte stoppa AI frÃĨn att avanonymisera patientdata

Ãven efter att sjukhus har tagit bort namn och postkoder kan modern AI fortfarande ibland lista ut vem patienterna ÃĪr. Bra nyheter fÃķr fÃķrsÃĪkringsbolag, men inte sÃĨ mycket fÃķr vÃĨrdmottagare.
Â
Nya forskningsresultat frÃĨn New York University visar att amerikanska patienters medicinska anteckningar, fria frÃĨn namn och andra HIPAA-identifierare, kan utsÃĪtta patienter fÃķr ÃĨteridentifiering. Genom att trÃĪna AI-sprÃĨkmodeller pÃĨ en stor mÃĪngd verkliga, ocensurerade patientjournaler, kvarstÃĨr identitetsdefinierande detaljer â i vissa fall tillÃĨter en patients grannskap att hÃĪrledas frÃĨn diagnos alone.
Den nya studien placerar denna risk i sammanhanget av en lucrativ marknad fÃķr avidentifierad hÃĪlsodata, dÃĪr sjukhus och databroker rutinmÃĪssigt sÃĪljer eller licensierar rengjorda kliniska anteckningar till lÃĪkemedelsfÃķretag, fÃķrsÃĪkringsbolag och AI-utvecklare.
FÃķrfattarna till den nya studien utmanar till och med sjÃĪlva begreppet âavidentifieringâ, som faststÃĪlls i patienternas skydd enligt HIPAA efter att Massachusetts guvernÃķr William Welds medicinska data avidentifierades 1997:
â[Ãven] under perfekt Safe Harbor-efterlevnad, fÃķrblir âavidentifieradeâ anteckningar statistiskt kopplade till identitet genom de korrelationer som bekrÃĪftar deras kliniska anvÃĪndbarhet. Konflikten ÃĪr strukturell snarare ÃĪn teknisk.â
Forskarna hÃĪvdar att nuvarande, HIPAA-kompatibla avidentifieringsramar lÃĪmnar tvÃĨ bakdÃķrrar Ãķppna fÃķr âlÃĪnkattackerâ:

FrÃĨn den nya artikeln, en kausal diagram som visar hur HIPAA-stil avidentifiering tar bort explicita kÃĪnsliga attribut medan identitetslÃĪnkade korrelationer fÃķrblir intakta, vilket tillÃĨter patientens identitet att hÃĪrledas genom icke-kÃĪnsliga och medicinska uppgifter. KÃĪlla
I exemplet ovan ser vi inte bara att patienten ÃĪr gravid â den lÃĪgsta hÃĪngande frukten i avidentifiering, eftersom det etablerar biologiskt kÃķn otvetydigt â utan ocksÃĨ att hon gillar en fritid som inte ÃĪr associerad med lÃĨginkomstgrupper, enligt forskarna:
âÃven om de skyddade attributen (fÃķdelsedatum och postkod) ÃĪr redigerade, kan vi fortfarande sluta oss till att patienten ÃĪr en vuxen kvinna baserat pÃĨ graviditeten, och bor i ett vÃĪlmÃĨende omrÃĨde med tanke pÃĨ hÃĪstridning som fritid.â
I ett experiment kvarstod mer ÃĪn 220 000 kliniska anteckningar frÃĨn 170 000 NYU Langone-patienter fortfarande med tillrÃĪckligt signal fÃķr att tillÃĨta demografiska egenskaper att hÃĪrledas.
Drilling Down
En BERT-baserad modell var finjusterad fÃķr att fÃķrutsÃĪga sex attribut frÃĨn de avidentifierade anteckningarna, och, enligt artikeln, ÃķvertrÃĪffade slumpmÃĪssiga gissningar med sÃĨ fÃĨ som 1 000 trÃĪningsexempel. Biologiskt kÃķn ÃĨterstÃĪlldes med Ãķver 99,7 % noggrannhet, och ÃĪven svagare signaler som mÃĨnaden anteckningarna togs var fÃķrutsagda med bÃĪttre ÃĪn slumpmÃĪssig noggrannhet.
FÃķr experimentella ÃĪndamÃĨl anvÃĪndes de hÃĪrledda egenskaperna sedan i en lÃĪnkattack mot Langone-databasen, vilket producerade en maximal unik ÃĨteridentifieringsrisk pÃĨ 0,34 % â ungefÃĪr 37 gÃĨnger hÃķgre ÃĪn en enkel majoritetsklassbaslinje. TillÃĪmpat pÃĨ den amerikanska befolkningen skulle denna attack ensam avidentifiera 800 000 patienter.
FÃķrfattarna rammar in problemet som en âparadoxâ, eftersom det som lÃĪmnas kvar i HIPAA-kompatibla avidentifierade patientjournaler tydligt utgÃķr en livskraftig grund fÃķr avidentifieringsattacker:
â[Den] ÃķvervÃĪldigande majoriteten av ÃĨteridentifieringsriskerna hÃĪrrÃķr inte frÃĨn skyddad hÃĪlsoinformation, utan frÃĨn den icke-kÃĪnsliga och medicinska innehÃĨllet som vi anser vara sÃĪkert att dela.â

Stadsdelskartor Ãķver New York City som visar skillnader i sjukhusdÃķdstal, genomsnittlig vistelse och inkomstnivÃĨ, vilket visar hur hÃĪlsoutfall och rikedom varierar med omrÃĨde och kan lÃĪmna platslÃĪnkade ledtrÃĨdar ÃĪven i avidentifierade medicinska anteckningar. Se kÃĪllartikeln fÃķr ytterligare exempel
Artikeln hÃĪvdar att HIPAA:s Safe Harbor-regler inte lÃĪngre fungerar som lagstiftarna avsÃĨg: att ta bort 18 identifierare kan tillfredsstÃĪlla lagens bokstav, men enligt fÃķrfattarna, fÃķrhindrar det inte att identitet kan hÃĪrledas av nuvarande sprÃĨkmodeller. De rammar in systemet som byggt pÃĨ fÃķrÃĨldrade antaganden om vad LLM kan och inte kan hÃĪrleda frÃĨn vanlig medicinsk text.
Arbetet fÃķreslÃĨr ocksÃĨ att de som sannolikt kommer att dra nytta av de angivna svagheterna ÃĪr stora fÃķretag relaterade till medicinsk fÃķrsÃĪkring, snarare ÃĪn konventionellt definierade kriminella enheter (sÃĨsom hackare, utpressare eller sociala ingenjÃķrer)*:
âDen bestÃĨende Safe Harbor trots kÃĪnda begrÃĪnsningar ÃĪr inte ett fÃķrbiseende utan en funktion i ett system optimerat fÃķr dataflyt snarare ÃĪn patientens skydd. Avidentifierade kliniska anteckningar representerar en multi-miljardmarknad, som skapar strukturella incitament fÃķr sjukvÃĨrdsinstitutioner att anta integritetsbevarande alternativ som kan minska dataanvÃĪndbarhet eller krÃĪva dyra infrastrukturinvesteringar.
âDet finns en brÃĨdska att noggrant undersÃķka, fÃķrstÃĨ och hantera denna incitament.â
Detta ÃĪr en positionspapper, med inga tydliga svar erbjuds; men fÃķrfattarna fÃķreslÃĨr att forskning om avidentifiering bÃķr fokusera pÃĨ sociala kontrakt och rÃĪttsliga konsekvenser av brott, snarare ÃĪn tekniska lÃķsningar (vilket ÃĪr samma tillvÃĪgagÃĨngssÃĪtt som anvÃĪnds av DMCA fÃķr att begrÃĪnsa kopiering av immateriella rÃĪttigheter, nÃĪr tekniska lÃķsningar misslyckades).
Den nya artikeln heter Avidentifieringens paradox: En kritik av HIPAA Safe Harbour i LLM-erans tidevarv, och kommer frÃĨn fyra forskare vid New York University, i samarbete med NYU Langone-sjukhuset.
Metod
FÃķr att testa sin teori utvecklade fÃķrfattarna en tvÃĨstegs lÃĪnkattack med 222 949 identifierade kliniska anteckningar frÃĨn 170 283 patienter som behandlats vid NYU Langone, med alla anteckningar uppdelade efter patient i 80 % trÃĪnings-, 10 % validerings- och 10 % testdelar, fÃķr att fÃķrhindra korskontamination.
FÃķr sammanhanget ÃĪr denna samling 3,34 gÃĨnger stÃķrre ÃĪn MIMIC-IV-databasen, den stÃķrsta offentligt tillgÃĪngliga elektroniska hÃĪlsoregister (EHR). Av sekretesskÃĪl kommer Langone-databasen inte att gÃķras tillgÃĪnglig i nÃĨgon form, men anvÃĪndare kan experimentera med projektets principer via ett GitHub-repo som genererar syntetisk data.
Sex demografiska attribut valdes fÃķr att approximera den klassiska ÃĨteridentifieringstreen identifierad i en influensrik tidigare studie: biologiskt kÃķn; grannskap; anteckningsÃĨr; anteckningsmÃĨnad; omrÃĨdesinkomst; och fÃķrsÃĪkringstyp:

Demografiska attribut som hÃĪrletts frÃĨn avidentifierade NYU Langone-kliniska anteckningar, bestÃĨende av biologiskt kÃķn, grannskap, anteckningsÃĨr, anteckningsmÃĨnad, omrÃĨdesinkomst och fÃķrsÃĪkringstyp, valda fÃķr att approximera den unika identifieringstreen beskriven i âSimple Demographics Often Identify People Uniquelyâ.
Anteckningarna avidentifierades med UCSF philter innan modellering.
En BERT-bas-uncased-modell med 110 miljoner parametrar, fÃķrtrÃĪnad pÃĨ allmÃĪn domÃĪntext fÃķr att undvika tidigare exponering fÃķr klinisk data, finjusterades separat fÃķr varje attribut, med ÃĨtta NVIDIA A100 GPU:er med 40 GB minne, eller H100 GPU:er, med 80 GB minne, fÃķr upp till tio epoker. Optimering anvÃĪnde AdamW, med en inlÃĪrningshastighet pÃĨ 2Ã10â5, och en effektiv batchstorlek pÃĨ 256
Generalisering pÃĨ den avsatta testmÃĪngden utvÃĪrderades med noggrannhet och vÃĪgd ROC-AUC, den senare vald fÃķr att ta hÃĪnsyn till klass obalans Ãķver attribut.
FÃķr att gÃķra attacken mer realistisk behandlades modellens fÃķrutsÃĪgelser inte som enskilda definitiva svar. IstÃĪllet, fÃķr varje attribut, behÃķlls de top k mest sannolika vÃĪrden, och patientdatabasen filtrerades fÃķr att inkludera alla som matchade dessa fÃķrutsagda egenskaper. Detta producerade en kortlista av mÃķjliga identiteter fÃķr varje anteckning, snarare ÃĪn en enda gissning.
RiskbedÃķmning
à teridentifieringsrisk berÃĪknades i tvÃĨ steg: mÃĪtning av hur ofta den verkliga patienten fÃķrekom i den kortlistade gruppen; och uppskattning av chansen att vÃĪlja den riktiga personen frÃĨn den gruppen.
Eftersom det sista steget antog att nÃĨgon enkelt valde ett namn slumpmÃĪssigt frÃĨn de mÃķjliga matchningarna, ÃĪr den rapporterade siffran en fÃķrsiktig uppskattning, och en beslutsam angripare kunde troligen gÃķra bÃĪttre.
Experimentet antog tillgÃĨng till den fullstÃĪndiga patientpopulationen i den externa databasen. Detta reflekterar ett vÃĪrsta-scenario men realistiskt scenario dÃĪr en stor institution eller databroker, med bred tÃĪckning av patientjournaler, fÃķrsÃķker lÃĪnka, snarare ÃĪn en individ som agerar med begrÃĪnsad information, vilket ytterligare fÃķrstÃĪrker hotets natur som fÃķrfattarna behandlar i arbetet.
Resultat
Risk mÃĪttes pÃĨ tre nivÃĨer: gruppreidentifieringsframgÃĨngsgrad fÃĨngade hur ofta den verkliga patienten fÃķrekom i modellens kortlistade kandidatuppsÃĪttning, baserat pÃĨ korrekta topp k-fÃķrutsÃĪgelser Ãķver alla attribut; individuell reidentifiering frÃĨn grupp mÃĪtte chansen att vÃĪlja den riktiga personen nÃĪr gruppen hade identifierats; och sannolikhet fÃķr unik reidentifiering multiplicerade de tvÃĨ, vilket resulterade i den totala sannolikheten att unikt identifiera en patient frÃĨn avidentifierade anteckningar:

FÃķrutsÃĪgelse noggrannhet fÃķr biologiskt kÃķn, grannskap, ÃĨr, mÃĨnad, inkomst och fÃķrsÃĪkringstyp, som visar att BERT-bas-uncased trÃĪnad pÃĨ UCSF philter-avidentifierade NYU Langone-anteckningar ÃķvertrÃĪffar slumpmÃĪssiga gissningar ÃĪven med 1 000 trÃĪningsexempel, med noggrannhet som fÃķrbÃĪttras stadigt nÃĪr datamÃĪngden vÃĪxer till 178 000 prover.
Av dessa initiala resultat noterar fÃķrfattarna:
âSom visas [ovan], fÃķrblir avidentifierade kliniska anteckningar sÃĨrbara fÃķr attributfÃķrutsÃĪgelse. Ãver alla sex attribut och alla dataregimer (1k till 177k exempel), ÃķvertrÃĪffar sprÃĨkmodellen (rÃķd) konsekvent [slumpmÃĪssiga baslinjer (grÃĨ)].
âDessa resultat stÃķder empiriskt att avidentifieringsprocessen behÃĨller utnyttjbara signaler i de tvÃĨ bakdÃķrrarna.
âRisken ÃĪr omedelbar: modeller uppnÃĨr bÃĪttre ÃĪn slumpmÃĪssig prestanda med sÃĨ fÃĨ som 1 000 trÃĪningsexempel. Medan biologiskt kÃķn ÃĪr det mest utsatta attributet (ÃĨterstÃĪllt med > 99,7 % noggrannhet), fÃķrutsÃĪgs ÃĪven de svagaste signalerna (mÃĨnad fÃķr anteckning) med bÃĪttre ÃĪn slumpmÃĪssig noggrannhet.â
I den andra resultattabellen nedan visas hur ofta modellen inkluderar den verkliga patienten i sin kortlista. den andra hur liten den kortlistan ÃĪr:

Hur ofta modellens kortlista innehÃĨller den verkliga patienten, plottad mot hur lÃĪtt det ÃĪr att vÃĪlja rÃĪtt person frÃĨn den kortlistan â som visar att sprÃĨkmodellen skapar hÃķgre total ÃĨteridentifieringsrisk ÃĪn enkel gissning, som nÃĨr 0,34 %, jÃĪmfÃķrt med 0,0091 % fÃķr den starkaste baslinjen.
Ju oftare den verkliga patienten fÃķrekommer, och ju mindre kortlistan ÃĪr, desto hÃķgre ÃĪr risken. FÃķrfattarnas sprÃĨkmodell ÃķvertrÃĪffade en enkel majoritetsklassgissning pÃĨ bÃĨda fronter, vilket vid sin topp motsvarade en 0,34 % chans att unikt identifiera en patient â ungefÃĪr 37 gÃĨnger hÃķgre ÃĪn den starkaste baslinjen.
FÃķrfattarna noterar att fÃķr patienter med ovanliga medicinska historier eller marginaliserade identiteter ÃĪr risken fÃķr avidentifiering hÃķgre, och avslutar med en rekommendation fÃķr en allvarlig omprÃķvning av HIPAA Safe Harbor-standarden:
â[HIPAA] Safe Harbor-standarden [fungerar] pÃĨ en binÃĪr definition av integritet: data ÃĪr antingen âidentifieradeâ eller âavidentifierade.â HIPAA antar att borttagning av en statisk lista med token renderar data âsÃĪkraâ, vilket effektivt kopplar loss den kliniska berÃĪttelsen frÃĨn patientens identitet.
âMen vÃĨr kausala grafanalys och empiriska resultat tyder pÃĨ att denna koppling ÃĪr en illusion.
âKliniska anteckningar ÃĪr inherenterade med identitet. En patients medicinska diagnos och icke-redigerade berÃĪttelser ÃĪr direkta produkter av deras unika livsbana, som skapar en hÃķgdimensionell signatur som kan mappas tillbaka till individen.â
FÃķrfattarna betonar vidare att nuvarande avidentifieringsregler fokuserar pÃĨ att ta bort en fast lista med identifierare, samtidigt som de ignorerar mÃķnster som lÃĪmnas kvar i den ÃĨterstÃĨende texten. Stora sprÃĨkmodeller, noterar de, ÃĪr byggda fÃķr att upptÃĪcka och kombinera sÃĨdana mÃķnster â vilket innebÃĪr att vanliga kliniska detaljer kan bÃķrja fungera som âindirekta identifierareâ.
Artikeln avslutas med ett antal rekommendationer, inklusive en adjuration att sluta finjustera modeller pÃĨ syntetisk data, eller âavklassificeradâ data, eftersom den fÃķrsta behÃĨller integritetsrisker i fÃķrhÃĨllande till den verkliga data som anvÃĪndes fÃķr att informera den; och den andra antar att den tidigare standarden fÃķr HIPAA-eran skydd fortfarande ÃĪr effektiv.
Slutsats
Eftersom âbakdÃķrrarâ av detta slag ÃĪr tydligt mest till nytta fÃķr stora organisationer, sÃĨsom fÃķrsÃĪkringsbolag â som fÃķrmodligen kommer att anvÃĪnda dem pÃĨ ett hemligt sÃĪtt, och utan avslÃķjande â ÃĪr en DCMA-stil ârÃĪttslig blockeringâ (dÃĪr sjÃĪlva skyddskringningen i sig ÃĪr fÃķrbjuden, oavsett de tekniker som anvÃĪnds) en ineffektiv tillvÃĪgagÃĨngssÃĪtt.
Det ÃĪr vÃĪlkÃĪnt att fÃķrsÃĪkringsbolag vill fÃĨ tillgÃĨng till information av detta slag, och att de, direkt eller genom association med databroker, har en extraordinÃĪr tillgÃĨng till privata hÃĪlsojournaler; och ju stÃķrre fÃķretaget ÃĪr, desto stÃķrre ÃĪr deras naturliga kunddatabas kommer att vara.
DÃĪrfÃķr, om HIPAA:s bestÃĪmmelser och skydd blir mer en âgentlemannens Ãķverenskommelseâ ÃĪn en effektiv barriÃĪr mot korporativ exploatering, verkar en Ãķversyn vara pÃĨ sin plats.
Â
* Min omvandling av fÃķrfattarnas inline-citat till hyperlÃĪnkar.
Publicerad fÃķrsta gÃĨngen onsdag, 11 februari 2026












