Ángulo de Anderson
Cada vez más, HIPAA no puede evitar que la IA desanonymice los datos de los pacientes

Incluso después de que los hospitales eliminan los nombres y los códigos postales, la IA moderna todavía puede averiguar quiénes son los pacientes en algunos casos. Buenas noticias para las compañías de seguros; no tanto para los receptores de atención médica.
Una nueva investigación de la Universidad de Nueva York encuentra que las notas médicas de los pacientes estadounidenses, despojadas de nombres y otros identificadores de HIPAA, pueden exponer a los pacientes a re-identificación. Al entrenar modelos de lenguaje de IA en un gran corpus de registros de pacientes reales y no censurados, los detalles que definen la identidad permanecen – en algunos casos, permitiendo inferir el vecindario de un paciente a partir del diagnóstico solo.
El nuevo estudio coloca este riesgo en el contexto de un lucrativo mercado en datos de salud desidentificados, donde los hospitales y los corredores de datos venden o licencian regularmente notas clínicas limpias a empresas farmacéuticas, aseguradoras y desarrolladores de IA.
Los autores del nuevo estudio desafían incluso el concepto de ‘desidentificación’, consagrado en las protecciones de los pacientes establecidas por HIPAA después de que el gobernador de Massachusetts, William Weld, tuvo sus datos médicos desanonymizados en 1997:
‘[Incluso] bajo el cumplimiento perfecto del Puerto Seguro, las notas “desidentificadas” permanecen estadísticamente unidas a la identidad a través de las correlaciones que confirman su utilidad clínica. El conflicto es estructural en lugar de técnico.’
Los investigadores sostienen que los marcos de desidentificación actualmente compatibles con HIPAA dejan dos puertas traseras disponibles para ‘ataques de enlace’:

De la nueva publicación, un diagrama causal que ilustra cómo la desidentificación de estilo HIPAA elimina atributos sensibles explícitos mientras deja intactas las correlaciones vinculadas a la identidad, permitiendo inferir la identidad del paciente a través de información no sensible y médica. Fuente
En el ejemplo anterior, vemos no solo que el paciente está embarazada – la fruta más fácil de desidentificar, ya que establece el género biológico de manera inequívoca – sino también que le gusta un pasatiempo no asociado con grupos de bajos ingresos, según los investigadores:
‘Aunque los atributos protegidos (DOB y ZIP code) están redactados, todavía podemos inferir que el paciente es una mujer adulta en función del embarazo, y reside en un vecindario acomodado dado el pasatiempo de la equitación.’
En un experimento, incluso después de que se eliminaron los identificadores de los pacientes, más de 220,000 notas clínicas de 170,000 pacientes de NYU Langone todavía llevaban suficiente señal para permitir que se infirieran los rasgos demográficos.
Perforación
Un modelo basado en BERT se ajustó para predecir seis atributos a partir de los registros desidentificados, y, según la publicación, superó las conjeturas al azar con tan solo 1,000 ejemplos de entrenamiento. El sexo biológico se recuperó con una precisión superior al 99,7%, y incluso las señales más débiles, como el mes en que se tomaron las notas, se predijeron con una precisión superior a la casualidad.
Con fines experimentales, esos rasgos inferidos se utilizaron luego en un ataque de enlace contra la base de datos de Langone, produciendo un riesgo máximo de reidentificación único del 0,34% – aproximadamente 37 veces mayor que una base de clase de mayoría simple. Aplicado a la población estadounidense, este ataque solo desidentificaría a 800,000 pacientes.
Los autores enmarcan el problema como una ‘paradoja’, porque lo que queda en los registros de pacientes desidentificados compatibles con HIPAA es claramente una base viable para ataques de desidentificación:
‘[La] gran mayoría del riesgo de reidentificación proviene no de la Información de Salud Protegida, sino del contenido no sensible y médico que consideramos seguro para compartir.’

Mapas de los distritos de la ciudad de Nueva York que muestran las diferencias en las tasas de mortalidad en el hospital, la duración media de la estancia y los ingresos, que ilustran cómo los resultados de la salud y la riqueza varían según el área y pueden dejar pistas vinculadas a la ubicación incluso en las notas médicas desidentificadas. Por favor, consulte la publicación original para obtener más ejemplos
La publicación argumenta que las reglas del Puerto Seguro de HIPAA ya no funcionan como los legisladores pretendían: eliminar 18 identificadores puede satisfacer la letra de la ley, pero según los autores, no evita que la identidad se infiera por los modelos de lenguaje actuales. Enmarcan el sistema en sí como construido sobre suposiciones obsoletas con respecto a lo que los LLM pueden y no pueden inferir del texto médico ordinario.
El trabajo también sugiere que aquellos que probablemente se beneficien de las debilidades declaradas son grandes corporaciones relacionadas con el seguro médico, en lugar de entidades criminales convencionalmente definidas (como hackers, chantajistas o ingenieros sociales)*:
‘La persistencia del Puerto Seguro a pesar de las limitaciones conocidas no es un descuido, sino una característica de un sistema optimizado para la liquidez de datos en lugar de la protección del paciente. Las notas clínicas desidentificadas representan un mercado de varios miles de millones de dólares, creando desincentivos estructurales para que las instituciones de atención médica adopten alternativas que preserven la privacidad que podrían reducir la utilidad de los datos o requerir inversiones costosas en infraestructura.
‘Hay una urgencia por investigar, comprender y abordar este desincentivo con cuidado.’
Esta es una publicación de posición, sin respuestas claras; sin embargo, los autores sugieren que la investigación sobre la desidentificación debería pivotar hacia los contratos sociales y las consecuencias legales de la violación, en lugar de soluciones técnicas (arguablemente el mismo enfoque utilizado por la DMCA para restringir la copia de obras protegidas por derechos de autor, cuando las soluciones técnicas fallaron).
La nueva publicación se titula Paradoja de la desidentificación: Una crítica del Puerto Seguro de HIPAA en la era de los LLM, y proviene de cuatro investigadores de la Universidad de Nueva York, en asociación con el hospital NYU Langone.
Método
Para probar su teoría, los autores desarrollaron un ataque de enlace de dos etapas utilizando 222,949 notas clínicas identificadas de 170,283 pacientes tratados en NYU Langone, con todas las notas divididas por paciente en 80% de entrenamiento, 10% de validación y 10% de pruebas, para evitar la contaminación cruzada.
En contexto, esta colección es 3,34 veces más grande que el conjunto de datos MIMIC-IV, la colección de Registros Electrónicos de Salud (EHR) más grande disponible públicamente. Por razones de privacidad, el conjunto de datos de Langone no se hará disponible en ninguna forma, aunque los usuarios pueden experimentar con los principios del proyecto a través de un repositorio de GitHub que genera datos sintéticos.
Se curaron seis atributos demográficos para aproximar el trío clásico de reidentificación identificado en un trabajo influyente anterior: sexo biológico; vecindario; año de la nota; mes de la nota; ingreso del área; y tipo de seguro:

Atributos demográficos inferidos a partir de notas clínicas desidentificadas de NYU Langone, que comprenden sexo biológico, vecindario, año de la nota, mes de la nota, ingreso del área y tipo de seguro, seleccionados para aproximar el trío de identificador único descrito en ‘Simple Demographics Often Identify People Uniquely’.
Las notas se desidentificaron utilizando UCSF philter antes del modelado.
Un modelo BERT-base-sin caso con 110 millones de parámetros, preentrenado en texto de dominio general para evitar la exposición previa a datos clínicos, se ajustó por separado para cada atributo, utilizando ocho GPU NVIDIA A100 con 40GB de memoria, o GPU H100 con 80GB de memoria, durante un máximo de diez épocas. La optimización utilizó AdamW, con una tasa de aprendizaje de 2×10−5, y un tamaño de lote efectivo de 256
Generalización en el conjunto de pruebas se evaluó utilizando Precisión y ROC-AUC ponderado, este último elegido para tener en cuenta el desequilibrio de clases en los atributos.
Para hacer que el ataque sea más realista, las predicciones del modelo no se trataron como respuestas definitivas únicas. En su lugar, para cada atributo, se mantuvieron los k valores más probables, y la base de datos de pacientes se filtró para incluir a cualquiera que coincidiera con esos rasgos predichos. Esto produjo una lista corta de posibles identidades para cada nota, en lugar de una sola suposición.
Evaluación del riesgo
Luego se calculó el riesgo de reidentificación en dos etapas: midiendo con qué frecuencia el paciente real aparecía dentro de ese grupo seleccionado; y estimando la probabilidad de seleccionar la persona correcta dentro de ese grupo.
Debido a que el último paso asumió que alguien simplemente eligió un nombre al azar de las posibles coincidencias, el número informado es una estimación conservadora, y un atacante determinado probablemente podría hacerlo mejor.
El experimento asumió acceso a la población de pacientes completa en la base de datos externa. Esto refleja un escenario realista pero peor, en el que una institución grande o un corredor de datos, con una amplia cobertura de registros de pacientes, intenta el enlace, en lugar de un individuo que actúa con información limitada, lo que refuerza aún más la naturaleza de la amenaza que los autores están abordando en el trabajo.
Resultados
El riesgo se midió en tres niveles: tasa de éxito de reidentificación de grupo capturó con qué frecuencia el paciente real aparecía dentro del conjunto de candidatos seleccionados por el modelo, en función de predicciones correctas de los primeros k en todos los atributos; reidentificación individual desde el grupo midió la probabilidad de seleccionar la persona correcta una vez que se había identificado el grupo; y probabilidad de reidentificación única multiplicó los dos, lo que dio como resultado la probabilidad general de identificar de forma única a un paciente a partir de notas desidentificadas:

Precisión de predicción para sexo biológico, vecindario, año, mes, ingreso y tipo de seguro, que muestra que BERT-base-uncased entrenado en notas desidentificadas de NYU Langone supera las conjeturas al azar incluso con 1,000 ejemplos de entrenamiento, con una precisión que mejora constantemente a medida que el conjunto de datos crece a 178,000 muestras.
De estos resultados iniciales, los autores señalan:
‘Como se ilustra [arriba], las notas clínicas desidentificadas siguen siendo vulnerables a la predicción de atributos. En todos los seis atributos y todos los regímenes de datos (1k a 177k ejemplos), el modelo de lenguaje (rojo) supera consistentemente las conjeturas al azar (gris).
‘Estos resultados apoyan empíricamente que el proceso de desidentificación retiene señales que pueden ser explotadas en las dos vías traseras.
‘El riesgo para la privacidad es inmediato: los modelos logran un rendimiento superior al azar con tan solo 1,000 ejemplos de entrenamiento. Mientras que el sexo biológico es el atributo más expuesto (recuperado con una precisión superior al 99,7%), incluso las señales más débiles (mes de la nota) se predicen con una precisión superior a la casualidad.’
En el segundo gráfico de resultados a continuación, una dirección muestra con qué frecuencia el modelo incluye al paciente real en su lista corta. la otra muestra cuán pequeña es esa lista corta:

Cómo de frecuente el modelo incluye al paciente real en su lista corta, trazado contra cuán fácil es elegir la persona correcta de esa lista corta – que muestra que el modelo de lenguaje crea un riesgo de reidentificación general más alto que el simple azar, alcanzando el 0,34%, en comparación con el 0,0091% para la base de clase de mayoría más fuerte.
Cuanto más a menudo aparezca el paciente real, y cuanto más pequeña sea la lista corta, mayor es el riesgo. El modelo de lenguaje de los autores superó una conjetura de clase de mayoría simple en ambos frentes, en su punto máximo se tradujo en una probabilidad del 0,34% de identificar de forma única a un paciente – aproximadamente 37 veces mayor que la base de clase de mayoría más fuerte.
Los autores señalan que para los pacientes con historias médicas poco comunes o identidades marginadas, los riesgos de desidentificación son más altos, y concluyen con una recomendación para una reevaluación seria del estándar del Puerto Seguro de HIPAA:
‘[El] estándar del Puerto Seguro de HIPAA [funciona] con una definición binaria de la privacidad: los datos son “identificados” o “desidentificados”. HIPAA asume que eliminar una lista estática de tokens hace que los datos sean “seguros”, efectivamente desconectando la narrativa clínica de la identidad del paciente.
‘Sin embargo, nuestro análisis de gráficos causales y los resultados empíricos sugieren que esta desconexión es un espejismo.
‘Las notas clínicas están inherentemente entrelazadas con la identidad. El diagnóstico médico y las narrativas no redactadas de un paciente son productos directos de su trayectoria de vida única, creando una firma de alta dimensión que se puede asignar de regreso al individuo.’
Los autores enfatizan aún más que las reglas de desidentificación actuales se centran en eliminar una lista fija de identificadores, mientras ignoran los patrones que quedan en el texto restante. Los modelos de lenguaje grandes, señalan, están diseñados para detectar y combinar dichos patrones – lo que significa que los detalles clínicos ordinarios pueden comenzar a funcionar como ‘identificadores indirectos’.
La publicación concluye con una serie de recomendaciones, incluyendo una advertencia para dejar de ajustar los modelos en datos sintéticos, o ‘datos desclasificados’, ya que el primero retiene riesgos para la privacidad con respecto a los datos reales utilizados para informarlo; y el segundo asume que el estándar de protección de la era de HIPAA sigue siendo efectivo.
Conclusión
Debido a que las ‘puertas traseras’ de este tipo son claramente de mayor beneficio para las grandes organizaciones, como las compañías de seguros – que presumiblemente las utilizarán de manera encubierta y sin divulgación – un ‘bloqueo legal’ al estilo de la DMCA (donde el acto de circunvalación de la protección está prohibido, independientemente de las tecnologías utilizadas) es un enfoque ineficaz.
Es bien sabido que las compañías de seguros querrían acceder a esta información, y que, directa o indirectamente a través de corredores de datos, tienen un nivel extraordinario de acceso a registros de atención médica privados; y cuanto mayor sea la empresa, mayor será su base de datos de clientes nativa.
Por lo tanto, si las restricciones y salvaguardias de HIPAA se están convirtiendo más en un ‘acuerdo de caballeros’ que en una barrera efectiva contra la explotación corporativa, una revisión ciertamente parece oportuna.
* Mi conversión de las citas en línea de los autores a enlaces.
Publicado por primera vez el miércoles 11 de febrero de 2026












