Ãngulo de Anderson
Cada vez mÃĄs, HIPAA no puede evitar que la IA desanonymice los datos de los pacientes

Incluso despuÃĐs de que los hospitales eliminan los nombres y los cÃģdigos postales, la IA moderna todavÃa puede averiguar quiÃĐnes son los pacientes en algunos casos. Buenas noticias para las compaÃąÃas de seguros; no tanto para los receptores de atenciÃģn mÃĐdica.
Â
Una nueva investigaciÃģn de la Universidad de Nueva York encuentra que las notas mÃĐdicas de los pacientes estadounidenses, despojadas de nombres y otros identificadores de HIPAA, pueden exponer a los pacientes a re-identificaciÃģn. Al entrenar modelos de lenguaje de IA en un gran corpus de registros de pacientes reales y no censurados, los detalles que definen la identidad permanecen â en algunos casos, permitiendo inferir el vecindario de un paciente a partir del diagnÃģstico solo.
El nuevo estudio coloca este riesgo en el contexto de un lucrativo mercado en datos de salud desidentificados, donde los hospitales y los corredores de datos venden o licencian regularmente notas clÃnicas limpias a empresas farmacÃĐuticas, aseguradoras y desarrolladores de IA.
Los autores del nuevo estudio desafÃan incluso el concepto de âdesidentificaciÃģnâ, consagrado en las protecciones de los pacientes establecidas por HIPAA despuÃĐs de que el gobernador de Massachusetts, William Weld, tuvo sus datos mÃĐdicos desanonymizados en 1997:
â[Incluso] bajo el cumplimiento perfecto del Puerto Seguro, las notas âdesidentificadasâ permanecen estadÃsticamente unidas a la identidad a travÃĐs de las correlaciones que confirman su utilidad clÃnica. El conflicto es estructural en lugar de tÃĐcnico.â
Los investigadores sostienen que los marcos de desidentificaciÃģn actualmente compatibles con HIPAA dejan dos puertas traseras disponibles para âataques de enlaceâ:

De la nueva publicaciÃģn, un diagrama causal que ilustra cÃģmo la desidentificaciÃģn de estilo HIPAA elimina atributos sensibles explÃcitos mientras deja intactas las correlaciones vinculadas a la identidad, permitiendo inferir la identidad del paciente a travÃĐs de informaciÃģn no sensible y mÃĐdica. Fuente
En el ejemplo anterior, vemos no solo que el paciente estÃĄ embarazada â la fruta mÃĄs fÃĄcil de desidentificar, ya que establece el gÃĐnero biolÃģgico de manera inequÃvoca â sino tambiÃĐn que le gusta un pasatiempo no asociado con grupos de bajos ingresos, segÚn los investigadores:
âAunque los atributos protegidos (DOB y ZIP code) estÃĄn redactados, todavÃa podemos inferir que el paciente es una mujer adulta en funciÃģn del embarazo, y reside en un vecindario acomodado dado el pasatiempo de la equitaciÃģn.â
En un experimento, incluso despuÃĐs de que se eliminaron los identificadores de los pacientes, mÃĄs de 220,000 notas clÃnicas de 170,000 pacientes de NYU Langone todavÃa llevaban suficiente seÃąal para permitir que se infirieran los rasgos demogrÃĄficos.
PerforaciÃģn
Un modelo basado en BERT se ajustÃģ para predecir seis atributos a partir de los registros desidentificados, y, segÚn la publicaciÃģn, superÃģ las conjeturas al azar con tan solo 1,000 ejemplos de entrenamiento. El sexo biolÃģgico se recuperÃģ con una precisiÃģn superior al 99,7%, y incluso las seÃąales mÃĄs dÃĐbiles, como el mes en que se tomaron las notas, se predijeron con una precisiÃģn superior a la casualidad.
Con fines experimentales, esos rasgos inferidos se utilizaron luego en un ataque de enlace contra la base de datos de Langone, produciendo un riesgo mÃĄximo de reidentificaciÃģn Único del 0,34% â aproximadamente 37 veces mayor que una base de clase de mayorÃa simple. Aplicado a la poblaciÃģn estadounidense, este ataque solo desidentificarÃa a 800,000 pacientes.
Los autores enmarcan el problema como una âparadojaâ, porque lo que queda en los registros de pacientes desidentificados compatibles con HIPAA es claramente una base viable para ataques de desidentificaciÃģn:
â[La] gran mayorÃa del riesgo de reidentificaciÃģn proviene no de la InformaciÃģn de Salud Protegida, sino del contenido no sensible y mÃĐdico que consideramos seguro para compartir.â

Mapas de los distritos de la ciudad de Nueva York que muestran las diferencias en las tasas de mortalidad en el hospital, la duraciÃģn media de la estancia y los ingresos, que ilustran cÃģmo los resultados de la salud y la riqueza varÃan segÚn el ÃĄrea y pueden dejar pistas vinculadas a la ubicaciÃģn incluso en las notas mÃĐdicas desidentificadas. Por favor, consulte la publicaciÃģn original para obtener mÃĄs ejemplos
La publicaciÃģn argumenta que las reglas del Puerto Seguro de HIPAA ya no funcionan como los legisladores pretendÃan: eliminar 18 identificadores puede satisfacer la letra de la ley, pero segÚn los autores, no evita que la identidad se infiera por los modelos de lenguaje actuales. Enmarcan el sistema en sà como construido sobre suposiciones obsoletas con respecto a lo que los LLM pueden y no pueden inferir del texto mÃĐdico ordinario.
El trabajo tambiÃĐn sugiere que aquellos que probablemente se beneficien de las debilidades declaradas son grandes corporaciones relacionadas con el seguro mÃĐdico, en lugar de entidades criminales convencionalmente definidas (como hackers, chantajistas o ingenieros sociales)*:
âLa persistencia del Puerto Seguro a pesar de las limitaciones conocidas no es un descuido, sino una caracterÃstica de un sistema optimizado para la liquidez de datos en lugar de la protecciÃģn del paciente. Las notas clÃnicas desidentificadas representan un mercado de varios miles de millones de dÃģlares, creando desincentivos estructurales para que las instituciones de atenciÃģn mÃĐdica adopten alternativas que preserven la privacidad que podrÃan reducir la utilidad de los datos o requerir inversiones costosas en infraestructura.
âHay una urgencia por investigar, comprender y abordar este desincentivo con cuidado.â
Esta es una publicaciÃģn de posiciÃģn, sin respuestas claras; sin embargo, los autores sugieren que la investigaciÃģn sobre la desidentificaciÃģn deberÃa pivotar hacia los contratos sociales y las consecuencias legales de la violaciÃģn, en lugar de soluciones tÃĐcnicas (arguablemente el mismo enfoque utilizado por la DMCA para restringir la copia de obras protegidas por derechos de autor, cuando las soluciones tÃĐcnicas fallaron).
La nueva publicaciÃģn se titula Paradoja de la desidentificaciÃģn: Una crÃtica del Puerto Seguro de HIPAA en la era de los LLM, y proviene de cuatro investigadores de la Universidad de Nueva York, en asociaciÃģn con el hospital NYU Langone.
MÃĐtodo
Para probar su teorÃa, los autores desarrollaron un ataque de enlace de dos etapas utilizando 222,949 notas clÃnicas identificadas de 170,283 pacientes tratados en NYU Langone, con todas las notas divididas por paciente en 80% de entrenamiento, 10% de validaciÃģn y 10% de pruebas, para evitar la contaminaciÃģn cruzada.
En contexto, esta colecciÃģn es 3,34 veces mÃĄs grande que el conjunto de datos MIMIC-IV, la colecciÃģn de Registros ElectrÃģnicos de Salud (EHR) mÃĄs grande disponible pÚblicamente. Por razones de privacidad, el conjunto de datos de Langone no se harÃĄ disponible en ninguna forma, aunque los usuarios pueden experimentar con los principios del proyecto a travÃĐs de un repositorio de GitHub que genera datos sintÃĐticos.
Se curaron seis atributos demogrÃĄficos para aproximar el trÃo clÃĄsico de reidentificaciÃģn identificado en un trabajo influyente anterior: sexo biolÃģgico; vecindario; aÃąo de la nota; mes de la nota; ingreso del ÃĄrea; y tipo de seguro:

Atributos demogrÃĄficos inferidos a partir de notas clÃnicas desidentificadas de NYU Langone, que comprenden sexo biolÃģgico, vecindario, aÃąo de la nota, mes de la nota, ingreso del ÃĄrea y tipo de seguro, seleccionados para aproximar el trÃo de identificador Único descrito en âSimple Demographics Often Identify People Uniquelyâ.
Las notas se desidentificaron utilizando UCSF philter antes del modelado.
Un modelo BERT-base-sin caso con 110 millones de parÃĄmetros, preentrenado en texto de dominio general para evitar la exposiciÃģn previa a datos clÃnicos, se ajustÃģ por separado para cada atributo, utilizando ocho GPU NVIDIA A100 con 40GB de memoria, o GPU H100 con 80GB de memoria, durante un mÃĄximo de diez ÃĐpocas. La optimizaciÃģn utilizÃģ AdamW, con una tasa de aprendizaje de 2Ã10â5, y un tamaÃąo de lote efectivo de 256
GeneralizaciÃģn en el conjunto de pruebas se evaluÃģ utilizando PrecisiÃģn y ROC-AUC ponderado, este Último elegido para tener en cuenta el desequilibrio de clases en los atributos.
Para hacer que el ataque sea mÃĄs realista, las predicciones del modelo no se trataron como respuestas definitivas Únicas. En su lugar, para cada atributo, se mantuvieron los k valores mÃĄs probables, y la base de datos de pacientes se filtrÃģ para incluir a cualquiera que coincidiera con esos rasgos predichos. Esto produjo una lista corta de posibles identidades para cada nota, en lugar de una sola suposiciÃģn.
EvaluaciÃģn del riesgo
Luego se calculÃģ el riesgo de reidentificaciÃģn en dos etapas: midiendo con quÃĐ frecuencia el paciente real aparecÃa dentro de ese grupo seleccionado; y estimando la probabilidad de seleccionar la persona correcta dentro de ese grupo.
Debido a que el Último paso asumiÃģ que alguien simplemente eligiÃģ un nombre al azar de las posibles coincidencias, el nÚmero informado es una estimaciÃģn conservadora, y un atacante determinado probablemente podrÃa hacerlo mejor.
El experimento asumiÃģ acceso a la poblaciÃģn de pacientes completa en la base de datos externa. Esto refleja un escenario realista pero peor, en el que una instituciÃģn grande o un corredor de datos, con una amplia cobertura de registros de pacientes, intenta el enlace, en lugar de un individuo que actÚa con informaciÃģn limitada, lo que refuerza aÚn mÃĄs la naturaleza de la amenaza que los autores estÃĄn abordando en el trabajo.
Resultados
El riesgo se midiÃģ en tres niveles: tasa de ÃĐxito de reidentificaciÃģn de grupo capturÃģ con quÃĐ frecuencia el paciente real aparecÃa dentro del conjunto de candidatos seleccionados por el modelo, en funciÃģn de predicciones correctas de los primeros k en todos los atributos; reidentificaciÃģn individual desde el grupo midiÃģ la probabilidad de seleccionar la persona correcta una vez que se habÃa identificado el grupo; y probabilidad de reidentificaciÃģn Única multiplicÃģ los dos, lo que dio como resultado la probabilidad general de identificar de forma Única a un paciente a partir de notas desidentificadas:

PrecisiÃģn de predicciÃģn para sexo biolÃģgico, vecindario, aÃąo, mes, ingreso y tipo de seguro, que muestra que BERT-base-uncased entrenado en notas desidentificadas de NYU Langone supera las conjeturas al azar incluso con 1,000 ejemplos de entrenamiento, con una precisiÃģn que mejora constantemente a medida que el conjunto de datos crece a 178,000 muestras.
De estos resultados iniciales, los autores seÃąalan:
âComo se ilustra [arriba], las notas clÃnicas desidentificadas siguen siendo vulnerables a la predicciÃģn de atributos. En todos los seis atributos y todos los regÃmenes de datos (1k a 177k ejemplos), el modelo de lenguaje (rojo) supera consistentemente las conjeturas al azar (gris).
âEstos resultados apoyan empÃricamente que el proceso de desidentificaciÃģn retiene seÃąales que pueden ser explotadas en las dos vÃas traseras.
âEl riesgo para la privacidad es inmediato: los modelos logran un rendimiento superior al azar con tan solo 1,000 ejemplos de entrenamiento. Mientras que el sexo biolÃģgico es el atributo mÃĄs expuesto (recuperado con una precisiÃģn superior al 99,7%), incluso las seÃąales mÃĄs dÃĐbiles (mes de la nota) se predicen con una precisiÃģn superior a la casualidad.â
En el segundo grÃĄfico de resultados a continuaciÃģn, una direcciÃģn muestra con quÃĐ frecuencia el modelo incluye al paciente real en su lista corta. la otra muestra cuÃĄn pequeÃąa es esa lista corta:

CÃģmo de frecuente el modelo incluye al paciente real en su lista corta, trazado contra cuÃĄn fÃĄcil es elegir la persona correcta de esa lista corta â que muestra que el modelo de lenguaje crea un riesgo de reidentificaciÃģn general mÃĄs alto que el simple azar, alcanzando el 0,34%, en comparaciÃģn con el 0,0091% para la base de clase de mayorÃa mÃĄs fuerte.
Cuanto mÃĄs a menudo aparezca el paciente real, y cuanto mÃĄs pequeÃąa sea la lista corta, mayor es el riesgo. El modelo de lenguaje de los autores superÃģ una conjetura de clase de mayorÃa simple en ambos frentes, en su punto mÃĄximo se tradujo en una probabilidad del 0,34% de identificar de forma Única a un paciente â aproximadamente 37 veces mayor que la base de clase de mayorÃa mÃĄs fuerte.
Los autores seÃąalan que para los pacientes con historias mÃĐdicas poco comunes o identidades marginadas, los riesgos de desidentificaciÃģn son mÃĄs altos, y concluyen con una recomendaciÃģn para una reevaluaciÃģn seria del estÃĄndar del Puerto Seguro de HIPAA:
â[El] estÃĄndar del Puerto Seguro de HIPAA [funciona] con una definiciÃģn binaria de la privacidad: los datos son âidentificadosâ o âdesidentificadosâ. HIPAA asume que eliminar una lista estÃĄtica de tokens hace que los datos sean âsegurosâ, efectivamente desconectando la narrativa clÃnica de la identidad del paciente.
âSin embargo, nuestro anÃĄlisis de grÃĄficos causales y los resultados empÃricos sugieren que esta desconexiÃģn es un espejismo.
âLas notas clÃnicas estÃĄn inherentemente entrelazadas con la identidad. El diagnÃģstico mÃĐdico y las narrativas no redactadas de un paciente son productos directos de su trayectoria de vida Única, creando una firma de alta dimensiÃģn que se puede asignar de regreso al individuo.â
Los autores enfatizan aÚn mÃĄs que las reglas de desidentificaciÃģn actuales se centran en eliminar una lista fija de identificadores, mientras ignoran los patrones que quedan en el texto restante. Los modelos de lenguaje grandes, seÃąalan, estÃĄn diseÃąados para detectar y combinar dichos patrones â lo que significa que los detalles clÃnicos ordinarios pueden comenzar a funcionar como âidentificadores indirectosâ.
La publicaciÃģn concluye con una serie de recomendaciones, incluyendo una advertencia para dejar de ajustar los modelos en datos sintÃĐticos, o âdatos desclasificadosâ, ya que el primero retiene riesgos para la privacidad con respecto a los datos reales utilizados para informarlo; y el segundo asume que el estÃĄndar de protecciÃģn de la era de HIPAA sigue siendo efectivo.
ConclusiÃģn
Debido a que las âpuertas traserasâ de este tipo son claramente de mayor beneficio para las grandes organizaciones, como las compaÃąÃas de seguros â que presumiblemente las utilizarÃĄn de manera encubierta y sin divulgaciÃģn â un âbloqueo legalâ al estilo de la DMCA (donde el acto de circunvalaciÃģn de la protecciÃģn estÃĄ prohibido, independientemente de las tecnologÃas utilizadas) es un enfoque ineficaz.
Es bien sabido que las compaÃąÃas de seguros querrÃan acceder a esta informaciÃģn, y que, directa o indirectamente a travÃĐs de corredores de datos, tienen un nivel extraordinario de acceso a registros de atenciÃģn mÃĐdica privados; y cuanto mayor sea la empresa, mayor serÃĄ su base de datos de clientes nativa.
Por lo tanto, si las restricciones y salvaguardias de HIPAA se estÃĄn convirtiendo mÃĄs en un âacuerdo de caballerosâ que en una barrera efectiva contra la explotaciÃģn corporativa, una revisiÃģn ciertamente parece oportuna.
Â
* Mi conversiÃģn de las citas en lÃnea de los autores a enlaces.
Publicado por primera vez el miÃĐrcoles 11 de febrero de 2026












