Ángulo de Anderson
Los datos médicos anonimizados de hace décadas pueden provocar diagnósticos erróneos de IA ahora

Según una nueva colaboración de investigación entre Alemania y el Reino Unido, los registros de pacientes anonimizados que se incluyeron en conjuntos de datos médicos hace décadas pueden hacer que los sistemas de IA entrenados con ellos reconozcan las características del paciente real años después – y traten a un paciente de 2026 como si aún fuera 2012 (o el año en que sus datos anonimizados se incluyeron por primera vez en el conjunto de datos).
Esto podría significar, por ejemplo, que un paciente registrado como bajo tratamiento contra el cáncer hace 20 años, y que posteriormente entró en remisión a largo plazo, ahora sea tratado por el sistema de IA en el contexto de su yo anterior, afectado por el cáncer – aumentando lógicamente incluso las posibilidades de un diagnóstico falso de recurrencia.
Por el contrario, si la versión de 2012 de los datos de ese paciente reflejaba una salud perfecta en revisiones rutinarias, este punto de vista optimista podría imponerse potencialmente a la versión más antigua y actual del paciente, ocultando la detección de nuevas condiciones o problemas que podrían necesitar tratamiento.

Del nuevo artículo, una ilustración de cómo el sesgo de memorización puede afectar a un paciente que regresa. Un modelo entrenado con los ECG saludables anteriores de Alice asigna solo un 15 % de probabilidad a su posterior infarto, en comparación con un 73 % para un modelo que nunca vio sus registros históricos. Fuente
Limitar la ‘Inmigración de Datos’
El escenario se vuelve más probable debido a diversas directivas nacionales y regionales que recomiendan que los datos de pacientes para tales fines deberían tomarse idealmente del país en el que se pretende usar los sistemas derivados de ellos, lo que ‘localiza’ el conjunto de pacientes en los conjuntos de datos y, notablemente, aumenta la probabilidad de este tipo de evento de desanonimización no detectado.
Por inferencia, limitar la cantidad de datos disponibles a solo un conjunto de datos nacional aumenta la probabilidad de memorización – la posibilidad de que el modelo vea los mismos datos tantas veces durante el entrenamiento que se vuelva ‘fijado’ en estos patrones sobreaprendidos. Por el contrario, cuanto mayor y más diverso sea un conjunto de datos, más probable es que generalice a datos no vistos después del entrenamiento, en lugar de memorizar puntos de datos o configuraciones específicas.
Sin embargo, añadir datos médicos ‘extranjeros’ corre el riesgo de introducir evidencia de tendencias de salud nacionales e idiosincrasias que no aplicarían en el país donde se despliega el modelo entrenado; en este sentido, como concede el nuevo artículo, una cierta cantidad de memorización es apropiada y útil, ya que ayuda al modelo a trabajar dentro de las características médicas generales más probables de una población particular.
El artículo indica*:
‘[When] los modelos se despliegan prospectivamente, la memorización crea un riesgo específico y poco apreciado. Debido a que los registros de un paciente son altamente auto‑similares a lo largo del tiempo, un registro futuro puede actuar como una pista parcial para un registro histórico memorizado, desplazando las predicciones del modelo hacia el estado de salud previo del paciente.
Esto no es un escenario hipotético. Los modelos de IA médica se despliegan rutinariamente en la misma población de la que se obtuvieron sus datos de entrenamiento.
‘Por ejemplo, el programa nacional de detección de cáncer de mama de Alemania programa utiliza un modelo de IA entrenado con 1,2 millones de mamografías provenientes de la misma población de detección a la que ahora sirve.
‘El despliegue comparable está en marcha en otros lugares, incluidos los programas nacionales de detección de cáncer de mama en el Reino Unido y Suecia.
‘Las directrices regulatorias fomentan activamente esto, con el EU AI Act que exige que los datos de entrenamiento reflejen el entorno geográfico y contextual del uso previsto (Art. 10(4)), y directrices internacionales similares para el desarrollo de IA médica que solicitan que la población de pacientes prevista esté suficientemente representada en el conjunto de datos de entrenamiento del modelo.’
¿Calamidad Histórica Persistente..?
Aunque el artículo no aborda el asunto, parece estadísticamente lógico que los pacientes que no (o dejaron de) asistir regularmente a revisiones médicas a lo largo de sus vidas, y cuyos registros anonimizados ingresaron periódicamente al flujo de datos de IA, probablemente aparezcan en los datos de pacientes anonimizados casi exclusivamente en los momentos en que necesitaban tratamiento – lo que tendería a aumentar la probabilidad de ‘proyectar’ una condición curada hace mucho tiempo al mismo paciente ahora, ya que los registros no tienen un contrapeso de ‘buena salud’.
Esto se confirma con investigaciones previas sobre ‘sesgo de presencia informada’ en los registros electrónicos de salud, que encuentran que los conjuntos de datos médicos representan desproporcionadamente los períodos en que los pacientes están enfermos y interactúan con los servicios de salud.
Un estudio descubrió que los pacientes gravemente enfermos tenían 5.05 veces más días con datos de laboratorio y 6.85 veces más con órdenes de medicación que los pacientes más saludables.
En 2022, alrededor del 76 % de los adultos de EE. UU. informaron haber tenido un examen de rutina en el año anterior, definido por los CDC como un examen físico general, más que un tratamiento para una condición específica; y en Europa, una encuesta multipaís de 2023 descubrió que el 58 % asistió al menos a algunos chequeos preventivos; pero solo el 15 % asistió a todas las citas preventivas que consideraba relevantes.
El alcance del efecto
El estudio probó el efecto en cuatro grandes conjuntos de datos médicos, que incluyen grabaciones de ECG, radiografías de tórax y registros electrónicos de salud; a saber, la base de datos de radiografías de tórax MIMIC-CXR y los registros de atención de urgencias MIMIC-IV-ED, junto con MIMIC-ECG y la colección mucho mayor de ECGs HEEDB. Los conjuntos de datos variaron en tamaño desde decenas de miles de pacientes hasta más de 1.8 millones de personas.
Los autores señalan que el efecto calculado varía considerablemente, con cambios en la probabilidad predicha que superan los 70 puntos porcentuales en algunos casos:

Resultados que muestran cómo los datos históricos del paciente modifican predicciones posteriores. Los paneles superiores comparan la frecuencia y magnitud de estos cambios en los cuatro conjuntos de datos; los paneles inferiores muestran cómo el efecto varía con el tiempo transcurrido desde el último registro de entrenamiento del paciente. Los efectos significativos se vuelven menos frecuentes con el tiempo, pero siguen siendo detectables décadas después.
Como control, los investigadores dividieron aleatoriamente los modelos en grupos y repitieron la comparación, aunque esto no produjo cambios significativos en las predicciones futuras.
El efecto, según el artículo, también puede persistir durante décadas. Aunque generalmente se volvió más débil y menos frecuente a medida que aumentaba el intervalo entre los registros, el conjunto de datos HEEDB, que contiene ECGs recopilados desde la década de 1980 hasta 2025, mostró cambios significativos en las predicciones más de 25 años después del registro de entrenamiento más reciente del paciente.
Daño diagnóstico
Los investigadores del nuevo artículo – titulado Memorisation bias in medical AI – simularon a continuación cómo la memorización podría afectar la precisión diagnóstica cuando los pacientes se enfrentan posteriormente a un modelo entrenado con sus registros anteriores.
Los casos futuros se dividieron según si el paciente había desarrollado una condición nueva; ausente de sus datos históricos de entrenamiento; o si regresaba con esencialmente el mismo estado de salud.
Para condiciones nuevas, el efecto resultó consistentemente negativo, con modelos que habían visto previamente los registros históricos del paciente mostrando una menor sensibilidad en una variedad de diagnósticos representados en los cuatro conjuntos de datos. Esto incluía infartos y otras anomalías de ECG; afecciones pulmonares; y resultados críticos más amplios.
En términos prácticos, los modelos produjeron más falsos negativos cuando la salud del paciente había cambiado; pero cuando la salud del paciente no había cambiado, la memoria del modelo de sus registros anteriores hacía más probable producir el diagnóstico correcto. Tanto la sensibilidad como la especificidad aumentaron porque la condición actual del paciente se asemejaba a la condición ya representada en los datos de entrenamiento.
Los autores señalan que esto podría dificultar la evaluación precisa de dichos sistemas: si la mayoría de los pacientes que regresan aún tienen las mismas condiciones, el modelo tendrá un mejor desempeño con ellos, lo que potencialmente oculta su menor sensibilidad hacia los pacientes que han desarrollado nuevas condiciones.
Remedios
Como posible medida de protección, los investigadores probaron privacidad diferencial (que limita la cantidad de información sobre cualquier ejemplo de entrenamiento individual que un modelo puede retener) durante el entrenamiento.
Aunque proteger los registros individuales redujo el efecto de memorización, no lo eliminó, incluso en la configuración más fuerte probada. Aplicar la protección a nivel de paciente, cubriendo todos los registros pertenecientes a la misma persona, fue mucho más eficaz y casi eliminó el efecto.
Sin embargo, debe observarse que si un conjunto de datos ha sido anonimizado de forma irrecuperable, los datos del paciente no pueden aislarse de manera que permita tales métodos; y, los investigadores observan, si el conjunto de datos no se entrena con privacidad diferencial habilitada, ataques de inferencia de membresía se convierten en un riesgo; si lo está, los recursos necesarios para el entrenamiento aumentan notablemente
Conclusión
Los autores concluyen observando que, aunque los incidentes preocupantes ocurren actualmente a una tasa relativamente baja, esto podría cambiar en el futuro*:
‘Hay razones para esperar que el número de diagnósticos perdidos atribuibles al sesgo de memorización aumente en el futuro, aunque no lo probamos directamente. Investigaciones previas han demostrado que la proporción de datos de entrenamiento que un modelo memoriza aumenta con la capacidad del modelo [6, 7, 9, 10, 40].’
‘Esto es preocupante, dado que el desarrollo actual de modelos de IA está guiado por las “leyes de escalado” [41], que impulsan un rápido crecimiento tanto en el tamaño de los modelos como de los conjuntos de datos en busca de un mejor rendimiento.’
‘A medida que se entrenan modelos de IA más grandes con datos históricos provenientes de poblaciones de pacientes cada vez mayores, es probable que el número absoluto de individuos afectados por el sesgo de memorización aumente drásticamente, exacerbando los riesgos que identificamos aquí.’
* Mi conversión de las citas en línea de los autores a hipervínculos, con cierta interpretación donde la replicación exacta no es posible o útil.
Primera publicación viernes, 18 de septiembre de 2026












