Andersons vinkel
Alltmer kan HIPAA inte stoppa AI från att avanonymisera patientdata

Även efter att sjukhus har tagit bort namn och postkoder kan modern AI fortfarande ibland lista ut vem patienterna är. Bra nyheter för försäkringsbolag, men inte så mycket för vårdmottagare.
Nya forskningsresultat från New York University visar att amerikanska patienters medicinska anteckningar, fria från namn och andra HIPAA-identifierare, kan utsätta patienter för återidentifiering. Genom att träna AI-språkmodeller på en stor mängd verkliga, ocensurerade patientjournaler, kvarstår identitetsdefinierande detaljer – i vissa fall tillåter en patients grannskap att härledas från diagnos alone.
Den nya studien placerar denna risk i sammanhanget av en lucrativ marknad för avidentifierad hälsodata, där sjukhus och databroker rutinmässigt säljer eller licensierar rengjorda kliniska anteckningar till läkemedelsföretag, försäkringsbolag och AI-utvecklare.
Författarna till den nya studien utmanar till och med själva begreppet “avidentifiering”, som fastställs i patienternas skydd enligt HIPAA efter att Massachusetts guvernör William Welds medicinska data avidentifierades 1997:
‘[Även] under perfekt Safe Harbor-efterlevnad, förblir “avidentifierade” anteckningar statistiskt kopplade till identitet genom de korrelationer som bekräftar deras kliniska användbarhet. Konflikten är strukturell snarare än teknisk.’
Forskarna hävdar att nuvarande, HIPAA-kompatibla avidentifieringsramar lämnar två bakdörrar öppna för “länkattacker”:

Från den nya artikeln, en kausal diagram som visar hur HIPAA-stil avidentifiering tar bort explicita känsliga attribut medan identitetslänkade korrelationer förblir intakta, vilket tillåter patientens identitet att härledas genom icke-känsliga och medicinska uppgifter. Källa
I exemplet ovan ser vi inte bara att patienten är gravid – den lägsta hängande frukten i avidentifiering, eftersom det etablerar biologiskt kön otvetydigt – utan också att hon gillar en fritid som inte är associerad med låginkomstgrupper, enligt forskarna:
‘Även om de skyddade attributen (födelsedatum och postkod) är redigerade, kan vi fortfarande sluta oss till att patienten är en vuxen kvinna baserat på graviditeten, och bor i ett välmående område med tanke på hästridning som fritid.’
I ett experiment kvarstod mer än 220 000 kliniska anteckningar från 170 000 NYU Langone-patienter fortfarande med tillräckligt signal för att tillåta demografiska egenskaper att härledas.
Drilling Down
En BERT-baserad modell var finjusterad för att förutsäga sex attribut från de avidentifierade anteckningarna, och, enligt artikeln, överträffade slumpmässiga gissningar med så få som 1 000 träningsexempel. Biologiskt kön återställdes med över 99,7 % noggrannhet, och även svagare signaler som månaden anteckningarna togs var förutsagda med bättre än slumpmässig noggrannhet.
För experimentella ändamål användes de härledda egenskaperna sedan i en länkattack mot Langone-databasen, vilket producerade en maximal unik återidentifieringsrisk på 0,34 % – ungefär 37 gånger högre än en enkel majoritetsklassbaslinje. Tillämpat på den amerikanska befolkningen skulle denna attack ensam avidentifiera 800 000 patienter.
Författarna rammar in problemet som en “paradox”, eftersom det som lämnas kvar i HIPAA-kompatibla avidentifierade patientjournaler tydligt utgör en livskraftig grund för avidentifieringsattacker:
‘[Den] överväldigande majoriteten av återidentifieringsriskerna härrör inte från skyddad hälsoinformation, utan från den icke-känsliga och medicinska innehållet som vi anser vara säkert att dela.’

Stadsdelskartor över New York City som visar skillnader i sjukhusdödstal, genomsnittlig vistelse och inkomstnivå, vilket visar hur hälsoutfall och rikedom varierar med område och kan lämna platslänkade ledtrådar även i avidentifierade medicinska anteckningar. Se källartikeln för ytterligare exempel
Artikeln hävdar att HIPAA:s Safe Harbor-regler inte längre fungerar som lagstiftarna avsåg: att ta bort 18 identifierare kan tillfredsställa lagens bokstav, men enligt författarna, förhindrar det inte att identitet kan härledas av nuvarande språkmodeller. De rammar in systemet som byggt på föråldrade antaganden om vad LLM kan och inte kan härleda från vanlig medicinsk text.
Arbetet föreslår också att de som sannolikt kommer att dra nytta av de angivna svagheterna är stora företag relaterade till medicinsk försäkring, snarare än konventionellt definierade kriminella enheter (såsom hackare, utpressare eller sociala ingenjörer)*:
‘Den bestående Safe Harbor trots kända begränsningar är inte ett förbiseende utan en funktion i ett system optimerat för dataflyt snarare än patientens skydd. Avidentifierade kliniska anteckningar representerar en multi-miljardmarknad, som skapar strukturella incitament för sjukvårdsinstitutioner att anta integritetsbevarande alternativ som kan minska dataanvändbarhet eller kräva dyra infrastrukturinvesteringar.
‘Det finns en brådska att noggrant undersöka, förstå och hantera denna incitament.’
Detta är en positionspapper, med inga tydliga svar erbjuds; men författarna föreslår att forskning om avidentifiering bör fokusera på sociala kontrakt och rättsliga konsekvenser av brott, snarare än tekniska lösningar (vilket är samma tillvägagångssätt som används av DMCA för att begränsa kopiering av immateriella rättigheter, när tekniska lösningar misslyckades).
Den nya artikeln heter Avidentifieringens paradox: En kritik av HIPAA Safe Harbour i LLM-erans tidevarv, och kommer från fyra forskare vid New York University, i samarbete med NYU Langone-sjukhuset.
Metod
För att testa sin teori utvecklade författarna en tvåstegs länkattack med 222 949 identifierade kliniska anteckningar från 170 283 patienter som behandlats vid NYU Langone, med alla anteckningar uppdelade efter patient i 80 % tränings-, 10 % validerings- och 10 % testdelar, för att förhindra korskontamination.
För sammanhanget är denna samling 3,34 gånger större än MIMIC-IV-databasen, den största offentligt tillgängliga elektroniska hälsoregister (EHR). Av sekretesskäl kommer Langone-databasen inte att göras tillgänglig i någon form, men användare kan experimentera med projektets principer via ett GitHub-repo som genererar syntetisk data.
Sex demografiska attribut valdes för att approximera den klassiska återidentifieringstreen identifierad i en influensrik tidigare studie: biologiskt kön; grannskap; anteckningsår; anteckningsmånad; områdesinkomst; och försäkringstyp:

Demografiska attribut som härletts från avidentifierade NYU Langone-kliniska anteckningar, bestående av biologiskt kön, grannskap, anteckningsår, anteckningsmånad, områdesinkomst och försäkringstyp, valda för att approximera den unika identifieringstreen beskriven i ‘Simple Demographics Often Identify People Uniquely’.
Anteckningarna avidentifierades med UCSF philter innan modellering.
En BERT-bas-uncased-modell med 110 miljoner parametrar, förtränad på allmän domäntext för att undvika tidigare exponering för klinisk data, finjusterades separat för varje attribut, med åtta NVIDIA A100 GPU:er med 40 GB minne, eller H100 GPU:er, med 80 GB minne, för upp till tio epoker. Optimering använde AdamW, med en inlärningshastighet på 2×10−5, och en effektiv batchstorlek på 256
Generalisering på den avsatta testmängden utvärderades med noggrannhet och vägd ROC-AUC, den senare vald för att ta hänsyn till klass obalans över attribut.
För att göra attacken mer realistisk behandlades modellens förutsägelser inte som enskilda definitiva svar. Istället, för varje attribut, behölls de top k mest sannolika värden, och patientdatabasen filtrerades för att inkludera alla som matchade dessa förutsagda egenskaper. Detta producerade en kortlista av möjliga identiteter för varje anteckning, snarare än en enda gissning.
Riskbedömning
Återidentifieringsrisk beräknades i två steg: mätning av hur ofta den verkliga patienten förekom i den kortlistade gruppen; och uppskattning av chansen att välja den riktiga personen från den gruppen.
Eftersom det sista steget antog att någon enkelt valde ett namn slumpmässigt från de möjliga matchningarna, är den rapporterade siffran en försiktig uppskattning, och en beslutsam angripare kunde troligen göra bättre.
Experimentet antog tillgång till den fullständiga patientpopulationen i den externa databasen. Detta reflekterar ett värsta-scenario men realistiskt scenario där en stor institution eller databroker, med bred täckning av patientjournaler, försöker länka, snarare än en individ som agerar med begränsad information, vilket ytterligare förstärker hotets natur som författarna behandlar i arbetet.
Resultat
Risk mättes på tre nivåer: gruppreidentifieringsframgångsgrad fångade hur ofta den verkliga patienten förekom i modellens kortlistade kandidatuppsättning, baserat på korrekta topp k-förutsägelser över alla attribut; individuell reidentifiering från grupp mätte chansen att välja den riktiga personen när gruppen hade identifierats; och sannolikhet för unik reidentifiering multiplicerade de två, vilket resulterade i den totala sannolikheten att unikt identifiera en patient från avidentifierade anteckningar:

Förutsägelse noggrannhet för biologiskt kön, grannskap, år, månad, inkomst och försäkringstyp, som visar att BERT-bas-uncased tränad på UCSF philter-avidentifierade NYU Langone-anteckningar överträffar slumpmässiga gissningar även med 1 000 träningsexempel, med noggrannhet som förbättras stadigt när datamängden växer till 178 000 prover.
Av dessa initiala resultat noterar författarna:
‘Som visas [ovan], förblir avidentifierade kliniska anteckningar sårbara för attributförutsägelse. Över alla sex attribut och alla dataregimer (1k till 177k exempel), överträffar språkmodellen (röd) konsekvent [slumpmässiga baslinjer (grå)].
‘Dessa resultat stöder empiriskt att avidentifieringsprocessen behåller utnyttjbara signaler i de två bakdörrarna.
‘Risken är omedelbar: modeller uppnår bättre än slumpmässig prestanda med så få som 1 000 träningsexempel. Medan biologiskt kön är det mest utsatta attributet (återställt med > 99,7 % noggrannhet), förutsägs även de svagaste signalerna (månad för anteckning) med bättre än slumpmässig noggrannhet.’
I den andra resultattabellen nedan visas hur ofta modellen inkluderar den verkliga patienten i sin kortlista. den andra hur liten den kortlistan är:

Hur ofta modellens kortlista innehåller den verkliga patienten, plottad mot hur lätt det är att välja rätt person från den kortlistan – som visar att språkmodellen skapar högre total återidentifieringsrisk än enkel gissning, som når 0,34 %, jämfört med 0,0091 % för den starkaste baslinjen.
Ju oftare den verkliga patienten förekommer, och ju mindre kortlistan är, desto högre är risken. Författarnas språkmodell överträffade en enkel majoritetsklassgissning på båda fronter, vilket vid sin topp motsvarade en 0,34 % chans att unikt identifiera en patient – ungefär 37 gånger högre än den starkaste baslinjen.
Författarna noterar att för patienter med ovanliga medicinska historier eller marginaliserade identiteter är risken för avidentifiering högre, och avslutar med en rekommendation för en allvarlig omprövning av HIPAA Safe Harbor-standarden:
‘[HIPAA] Safe Harbor-standarden [fungerar] på en binär definition av integritet: data är antingen “identifierade” eller “avidentifierade.” HIPAA antar att borttagning av en statisk lista med token renderar data “säkra”, vilket effektivt kopplar loss den kliniska berättelsen från patientens identitet.
‘Men vår kausala grafanalys och empiriska resultat tyder på att denna koppling är en illusion.
‘Kliniska anteckningar är inherenterade med identitet. En patients medicinska diagnos och icke-redigerade berättelser är direkta produkter av deras unika livsbana, som skapar en högdimensionell signatur som kan mappas tillbaka till individen.’
Författarna betonar vidare att nuvarande avidentifieringsregler fokuserar på att ta bort en fast lista med identifierare, samtidigt som de ignorerar mönster som lämnas kvar i den återstående texten. Stora språkmodeller, noterar de, är byggda för att upptäcka och kombinera sådana mönster – vilket innebär att vanliga kliniska detaljer kan börja fungera som “indirekta identifierare”.
Artikeln avslutas med ett antal rekommendationer, inklusive en adjuration att sluta finjustera modeller på syntetisk data, eller “avklassificerad” data, eftersom den första behåller integritetsrisker i förhållande till den verkliga data som användes för att informera den; och den andra antar att den tidigare standarden för HIPAA-eran skydd fortfarande är effektiv.
Slutsats
Eftersom “bakdörrar” av detta slag är tydligt mest till nytta för stora organisationer, såsom försäkringsbolag – som förmodligen kommer att använda dem på ett hemligt sätt, och utan avslöjande – är en DCMA-stil “rättslig blockering” (där själva skyddskringningen i sig är förbjuden, oavsett de tekniker som används) en ineffektiv tillvägagångssätt.
Det är välkänt att försäkringsbolag vill få tillgång till information av detta slag, och att de, direkt eller genom association med databroker, har en extraordinär tillgång till privata hälsojournaler; och ju större företaget är, desto större är deras naturliga kunddatabas kommer att vara.
Därför, om HIPAA:s bestämmelser och skydd blir mer en “gentlemannens överenskommelse” än en effektiv barriär mot korporativ exploatering, verkar en översyn vara på sin plats.
* Min omvandling av författarnas inline-citat till hyperlänkar.
Publicerad första gången onsdag, 11 februari 2026












