Ángulo de Anderson

Cada vez mÃĄs, HIPAA no puede evitar que la IA desanonymice los datos de los pacientes

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
An AI-generated image featuring a crowd of businesspeople gathered around the hospital bed of a masked patient, trying to remove his mask. Z-Image Turbo + Qwen Edit V1, via Krita AI Diffusion.

Incluso despuÃĐs de que los hospitales eliminan los nombres y los cÃģdigos postales, la IA moderna todavía puede averiguar quiÃĐnes son los pacientes en algunos casos. Buenas noticias para las compaÃąÃ­as de seguros; no tanto para los receptores de atenciÃģn mÃĐdica.

 

Una nueva investigaciÃģn de la Universidad de Nueva York encuentra que las notas mÃĐdicas de los pacientes estadounidenses, despojadas de nombres y otros identificadores de HIPAA, pueden exponer a los pacientes a re-identificaciÃģn. Al entrenar modelos de lenguaje de IA en un gran corpus de registros de pacientes reales y no censurados, los detalles que definen la identidad permanecen – en algunos casos, permitiendo inferir el vecindario de un paciente a partir del diagnÃģstico solo.

El nuevo estudio coloca este riesgo en el contexto de un lucrativo mercado en datos de salud desidentificados, donde los hospitales y los corredores de datos venden o licencian regularmente notas clínicas limpias a empresas farmacÃĐuticas, aseguradoras y desarrolladores de IA.

Los autores del nuevo estudio desafían incluso el concepto de ‘desidentificaciÃģn’, consagrado en las protecciones de los pacientes establecidas por HIPAA despuÃĐs de que el gobernador de Massachusetts, William Weld, tuvo sus datos mÃĐdicos desanonymizados en 1997:

‘[Incluso] bajo el cumplimiento perfecto del Puerto Seguro, las notas “desidentificadas” permanecen estadísticamente unidas a la identidad a travÃĐs de las correlaciones que confirman su utilidad clínica. El conflicto es estructural en lugar de tÃĐcnico.’

Los investigadores sostienen que los marcos de desidentificaciÃģn actualmente compatibles con HIPAA dejan dos puertas traseras disponibles para ‘ataques de enlace’:

De la nueva publicaciÃģn, un diagrama causal que ilustra cÃģmo la desidentificaciÃģn de estilo HIPAA elimina atributos sensibles explícitos mientras deja intactas las correlaciones vinculadas a la identidad, permitiendo inferir la identidad del paciente a travÃĐs de informaciÃģn no sensible y mÃĐdica. Fuente - https://arxiv.org/pdf/2602.08997

De la nueva publicaciÃģn, un diagrama causal que ilustra cÃģmo la desidentificaciÃģn de estilo HIPAA elimina atributos sensibles explícitos mientras deja intactas las correlaciones vinculadas a la identidad, permitiendo inferir la identidad del paciente a travÃĐs de informaciÃģn no sensible y mÃĐdica. Fuente

En el ejemplo anterior, vemos no solo que el paciente estÃĄ embarazada – la fruta mÃĄs fÃĄcil de desidentificar, ya que establece el gÃĐnero biolÃģgico de manera inequívoca – sino tambiÃĐn que le gusta un pasatiempo no asociado con grupos de bajos ingresos, segÚn los investigadores:

‘Aunque los atributos protegidos (DOB y ZIP code) estÃĄn redactados, todavía podemos inferir que el paciente es una mujer adulta en funciÃģn del embarazo, y reside en un vecindario acomodado dado el pasatiempo de la equitaciÃģn.’

En un experimento, incluso despuÃĐs de que se eliminaron los identificadores de los pacientes, mÃĄs de 220,000 notas clínicas de 170,000 pacientes de NYU Langone todavía llevaban suficiente seÃąal para permitir que se infirieran los rasgos demogrÃĄficos.

PerforaciÃģn

Un modelo basado en BERT se ajustÃģ para predecir seis atributos a partir de los registros desidentificados, y, segÚn la publicaciÃģn, superÃģ las conjeturas al azar con tan solo 1,000 ejemplos de entrenamiento. El sexo biolÃģgico se recuperÃģ con una precisiÃģn superior al 99,7%, y incluso las seÃąales mÃĄs dÃĐbiles, como el mes en que se tomaron las notas, se predijeron con una precisiÃģn superior a la casualidad.

Con fines experimentales, esos rasgos inferidos se utilizaron luego en un ataque de enlace contra la base de datos de Langone, produciendo un riesgo mÃĄximo de reidentificaciÃģn Único del 0,34% – aproximadamente 37 veces mayor que una base de clase de mayoría simple. Aplicado a la poblaciÃģn estadounidense, este ataque solo desidentificaría a 800,000 pacientes.

Los autores enmarcan el problema como una ‘paradoja’, porque lo que queda en los registros de pacientes desidentificados compatibles con HIPAA es claramente una base viable para ataques de desidentificaciÃģn:

‘[La] gran mayoría del riesgo de reidentificaciÃģn proviene no de la InformaciÃģn de Salud Protegida, sino del contenido no sensible y mÃĐdico que consideramos seguro para compartir.’

Mapas de nivel de distrito de la tasa de mortalidad en el hospital, la duraciÃģn media de la estancia en el hospital y el ingreso per cÃĄpita en toda la ciudad de Nueva York, que muestran cÃģmo los resultados clínicos y las variables socioeconÃģmicas se agrupan geogrÃĄficamente y crean patrones vinculados a la identidad dentro de las notas desidentificadas.

Mapas de los distritos de la ciudad de Nueva York que muestran las diferencias en las tasas de mortalidad en el hospital, la duraciÃģn media de la estancia y los ingresos, que ilustran cÃģmo los resultados de la salud y la riqueza varían segÚn el ÃĄrea y pueden dejar pistas vinculadas a la ubicaciÃģn incluso en las notas mÃĐdicas desidentificadas. Por favor, consulte la publicaciÃģn original para obtener mÃĄs ejemplos

La publicaciÃģn argumenta que las reglas del Puerto Seguro de HIPAA ya no funcionan como los legisladores pretendían: eliminar 18 identificadores puede satisfacer la letra de la ley, pero segÚn los autores, no evita que la identidad se infiera por los modelos de lenguaje actuales. Enmarcan el sistema en sí como construido sobre suposiciones obsoletas con respecto a lo que los LLM pueden y no pueden inferir del texto mÃĐdico ordinario.

El trabajo tambiÃĐn sugiere que aquellos que probablemente se beneficien de las debilidades declaradas son grandes corporaciones relacionadas con el seguro mÃĐdico, en lugar de entidades criminales convencionalmente definidas (como hackers, chantajistas o ingenieros sociales)*:

‘La persistencia del Puerto Seguro a pesar de las limitaciones conocidas no es un descuido, sino una característica de un sistema optimizado para la liquidez de datos en lugar de la protecciÃģn del paciente. Las notas clínicas desidentificadas representan un mercado de varios miles de millones de dÃģlares, creando desincentivos estructurales para que las instituciones de atenciÃģn mÃĐdica adopten alternativas que preserven la privacidad que podrían reducir la utilidad de los datos o requerir inversiones costosas en infraestructura.

‘Hay una urgencia por investigar, comprender y abordar este desincentivo con cuidado.’

Esta es una publicaciÃģn de posiciÃģn, sin respuestas claras; sin embargo, los autores sugieren que la investigaciÃģn sobre la desidentificaciÃģn debería pivotar hacia los contratos sociales y las consecuencias legales de la violaciÃģn, en lugar de soluciones tÃĐcnicas (arguablemente el mismo enfoque utilizado por la DMCA para restringir la copia de obras protegidas por derechos de autor, cuando las soluciones tÃĐcnicas fallaron).

La nueva publicaciÃģn se titula Paradoja de la desidentificaciÃģn: Una crítica del Puerto Seguro de HIPAA en la era de los LLM, y proviene de cuatro investigadores de la Universidad de Nueva York, en asociaciÃģn con el hospital NYU Langone.

MÃĐtodo

Para probar su teoría, los autores desarrollaron un ataque de enlace de dos etapas utilizando 222,949 notas clínicas identificadas de 170,283 pacientes tratados en NYU Langone, con todas las notas divididas por paciente en 80% de entrenamiento, 10% de validaciÃģn y 10% de pruebas, para evitar la contaminaciÃģn cruzada.

En contexto, esta colecciÃģn es 3,34 veces mÃĄs grande que el conjunto de datos MIMIC-IV, la colecciÃģn de Registros ElectrÃģnicos de Salud (EHR) mÃĄs grande disponible pÚblicamente. Por razones de privacidad, el conjunto de datos de Langone no se harÃĄ disponible en ninguna forma, aunque los usuarios pueden experimentar con los principios del proyecto a travÃĐs de un repositorio de GitHub que genera datos sintÃĐticos.

Se curaron seis atributos demogrÃĄficos para aproximar el trío clÃĄsico de reidentificaciÃģn identificado en un trabajo influyente anterior: sexo biolÃģgico; vecindario; aÃąo de la nota; mes de la nota; ingreso del ÃĄrea; y tipo de seguro:

Atributos demogrÃĄficos inferidos a partir de notas clínicas desidentificadas de NYU Langone, que comprenden sexo biolÃģgico, vecindario, aÃąo de la nota, mes de la nota, ingreso del ÃĄrea y tipo de seguro, seleccionados para aproximar el trío de identificador Único descrito en 'Simple Demographics Often Identify People Uniquely' - https://dataprivacylab.org/projects/identifiability/paper1.pdf

Atributos demogrÃĄficos inferidos a partir de notas clínicas desidentificadas de NYU Langone, que comprenden sexo biolÃģgico, vecindario, aÃąo de la nota, mes de la nota, ingreso del ÃĄrea y tipo de seguro, seleccionados para aproximar el trío de identificador Único descrito en ‘Simple Demographics Often Identify People Uniquely’.

Las notas se desidentificaron utilizando UCSF philter antes del modelado.

Un modelo BERT-base-sin caso con 110 millones de parÃĄmetros, preentrenado en texto de dominio general para evitar la exposiciÃģn previa a datos clínicos, se ajustÃģ por separado para cada atributo, utilizando ocho GPU NVIDIA A100 con 40GB de memoria, o GPU H100 con 80GB de memoria, durante un mÃĄximo de diez ÃĐpocas. La optimizaciÃģn utilizÃģ AdamW, con una tasa de aprendizaje de 2×10−5, y un tamaÃąo de lote efectivo de 256

GeneralizaciÃģn en el conjunto de pruebas se evaluÃģ utilizando PrecisiÃģn y ROC-AUC ponderado, este Último elegido para tener en cuenta el desequilibrio de clases en los atributos.

Para hacer que el ataque sea mÃĄs realista, las predicciones del modelo no se trataron como respuestas definitivas Únicas. En su lugar, para cada atributo, se mantuvieron los k valores mÃĄs probables, y la base de datos de pacientes se filtrÃģ para incluir a cualquiera que coincidiera con esos rasgos predichos. Esto produjo una lista corta de posibles identidades para cada nota, en lugar de una sola suposiciÃģn.

EvaluaciÃģn del riesgo

Luego se calculÃģ el riesgo de reidentificaciÃģn en dos etapas: midiendo con quÃĐ frecuencia el paciente real aparecía dentro de ese grupo seleccionado; y estimando la probabilidad de seleccionar la persona correcta dentro de ese grupo.

Debido a que el Último paso asumiÃģ que alguien simplemente eligiÃģ un nombre al azar de las posibles coincidencias, el nÚmero informado es una estimaciÃģn conservadora, y un atacante determinado probablemente podría hacerlo mejor.

El experimento asumiÃģ acceso a la poblaciÃģn de pacientes completa en la base de datos externa. Esto refleja un escenario realista pero peor, en el que una instituciÃģn grande o un corredor de datos, con una amplia cobertura de registros de pacientes, intenta el enlace, en lugar de un individuo que actÚa con informaciÃģn limitada, lo que refuerza aÚn mÃĄs la naturaleza de la amenaza que los autores estÃĄn abordando en el trabajo.

Resultados

El riesgo se midiÃģ en tres niveles: tasa de ÃĐxito de reidentificaciÃģn de grupo capturÃģ con quÃĐ frecuencia el paciente real aparecía dentro del conjunto de candidatos seleccionados por el modelo, en funciÃģn de predicciones correctas de los primeros k en todos los atributos; reidentificaciÃģn individual desde el grupo midiÃģ la probabilidad de seleccionar la persona correcta una vez que se había identificado el grupo; y probabilidad de reidentificaciÃģn Única multiplicÃģ los dos, lo que dio como resultado la probabilidad general de identificar de forma Única a un paciente a partir de notas desidentificadas:

PrecisiÃģn de predicciÃģn para sexo biolÃģgico, vecindario, aÃąo, mes, ingreso y tipo de seguro, que muestra que BERT-base-uncased entrenado en notas desidentificadas de NYU Langone supera las conjeturas al azar incluso con 1,000 ejemplos de entrenamiento, con una precisiÃģn que mejora constantemente a medida que el conjunto de datos crece a 178,000 muestras.

PrecisiÃģn de predicciÃģn para sexo biolÃģgico, vecindario, aÃąo, mes, ingreso y tipo de seguro, que muestra que BERT-base-uncased entrenado en notas desidentificadas de NYU Langone supera las conjeturas al azar incluso con 1,000 ejemplos de entrenamiento, con una precisiÃģn que mejora constantemente a medida que el conjunto de datos crece a 178,000 muestras.

De estos resultados iniciales, los autores seÃąalan:

‘Como se ilustra [arriba], las notas clínicas desidentificadas siguen siendo vulnerables a la predicciÃģn de atributos. En todos los seis atributos y todos los regímenes de datos (1k a 177k ejemplos), el modelo de lenguaje (rojo) supera consistentemente las conjeturas al azar (gris).

‘Estos resultados apoyan empíricamente que el proceso de desidentificaciÃģn retiene seÃąales que pueden ser explotadas en las dos vías traseras.

‘El riesgo para la privacidad es inmediato: los modelos logran un rendimiento superior al azar con tan solo 1,000 ejemplos de entrenamiento. Mientras que el sexo biolÃģgico es el atributo mÃĄs expuesto (recuperado con una precisiÃģn superior al 99,7%), incluso las seÃąales mÃĄs dÃĐbiles (mes de la nota) se predicen con una precisiÃģn superior a la casualidad.’

En el segundo grÃĄfico de resultados a continuaciÃģn, una direcciÃģn muestra con quÃĐ frecuencia el modelo incluye al paciente real en su lista corta. la otra muestra cuÃĄn pequeÃąa es esa lista corta:

CÃģmo de frecuente el modelo incluye al paciente real en su lista corta, trazado contra cuÃĄn fÃĄcil es elegir la persona correcta de esa lista corta – que muestra que el modelo de lenguaje crea un riesgo de reidentificaciÃģn general mÃĄs alto que el simple azar, alcanzando el 0,34%, en comparaciÃģn con el 0,0091% para la base de clase de mayoría mÃĄs fuerte.

CÃģmo de frecuente el modelo incluye al paciente real en su lista corta, trazado contra cuÃĄn fÃĄcil es elegir la persona correcta de esa lista corta – que muestra que el modelo de lenguaje crea un riesgo de reidentificaciÃģn general mÃĄs alto que el simple azar, alcanzando el 0,34%, en comparaciÃģn con el 0,0091% para la base de clase de mayoría mÃĄs fuerte.

Cuanto mÃĄs a menudo aparezca el paciente real, y cuanto mÃĄs pequeÃąa sea la lista corta, mayor es el riesgo. El modelo de lenguaje de los autores superÃģ una conjetura de clase de mayoría simple en ambos frentes, en su punto mÃĄximo se tradujo en una probabilidad del 0,34% de identificar de forma Única a un paciente – aproximadamente 37 veces mayor que la base de clase de mayoría mÃĄs fuerte.

Los autores seÃąalan que para los pacientes con historias mÃĐdicas poco comunes o identidades marginadas, los riesgos de desidentificaciÃģn son mÃĄs altos, y concluyen con una recomendaciÃģn para una reevaluaciÃģn seria del estÃĄndar del Puerto Seguro de HIPAA:

‘[El] estÃĄndar del Puerto Seguro de HIPAA [funciona] con una definiciÃģn binaria de la privacidad: los datos son “identificados” o “desidentificados”. HIPAA asume que eliminar una lista estÃĄtica de tokens hace que los datos sean “seguros”, efectivamente desconectando la narrativa clínica de la identidad del paciente.

‘Sin embargo, nuestro anÃĄlisis de grÃĄficos causales y los resultados empíricos sugieren que esta desconexiÃģn es un espejismo.

‘Las notas clínicas estÃĄn inherentemente entrelazadas con la identidad. El diagnÃģstico mÃĐdico y las narrativas no redactadas de un paciente son productos directos de su trayectoria de vida Única, creando una firma de alta dimensiÃģn que se puede asignar de regreso al individuo.’

Los autores enfatizan aÚn mÃĄs que las reglas de desidentificaciÃģn actuales se centran en eliminar una lista fija de identificadores, mientras ignoran los patrones que quedan en el texto restante. Los modelos de lenguaje grandes, seÃąalan, estÃĄn diseÃąados para detectar y combinar dichos patrones – lo que significa que los detalles clínicos ordinarios pueden comenzar a funcionar como ‘identificadores indirectos’.

La publicaciÃģn concluye con una serie de recomendaciones, incluyendo una advertencia para dejar de ajustar los modelos en datos sintÃĐticos, o ‘datos desclasificados’, ya que el primero retiene riesgos para la privacidad con respecto a los datos reales utilizados para informarlo; y el segundo asume que el estÃĄndar de protecciÃģn de la era de HIPAA sigue siendo efectivo.

ConclusiÃģn

Debido a que las ‘puertas traseras’ de este tipo son claramente de mayor beneficio para las grandes organizaciones, como las compaÃąÃ­as de seguros – que presumiblemente las utilizarÃĄn de manera encubierta y sin divulgaciÃģn – un ‘bloqueo legal’ al estilo de la DMCA (donde el acto de circunvalaciÃģn de la protecciÃģn estÃĄ prohibido, independientemente de las tecnologías utilizadas) es un enfoque ineficaz.

Es bien sabido que las compaÃąÃ­as de seguros querrían acceder a esta informaciÃģn, y que, directa o indirectamente a travÃĐs de corredores de datos, tienen un nivel extraordinario de acceso a registros de atenciÃģn mÃĐdica privados; y cuanto mayor sea la empresa, mayor serÃĄ su base de datos de clientes nativa.

Por lo tanto, si las restricciones y salvaguardias de HIPAA se estÃĄn convirtiendo mÃĄs en un ‘acuerdo de caballeros’ que en una barrera efectiva contra la explotaciÃģn corporativa, una revisiÃģn ciertamente parece oportuna.

 

* Mi conversiÃģn de las citas en línea de los autores a enlaces.

Publicado por primera vez el miÃĐrcoles 11 de febrero de 2026

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]