Anderson 视角
数十年前的匿名医疗数据如今可能导致 AI 误诊

根据德国和英国之间的新研究合作,即使是数十年前纳入医学数据集的匿名患者记录,也可能导致基于这些数据训练的 AI 系统在多年后识别出 真实患者的特征——并将 2026 年的患者视作仍是 2012 年(或其匿名患者数据首次被纳入数据集的那一年)。
这意味着,例如,20 年前被记录接受癌症治疗、随后进入长期缓解的患者,可能会被 AI 系统 以其早期、患癌的状态进行诊疗——从逻辑上甚至会增加误判为复发的可能性。
相反,如果该患者 2012 年的记录在常规体检中显示健康良好,这种乐观的视角可能会被强加到患者的 更早、当前的版本上,掩盖对可能需要治疗的新疾病或问题的检测。

摘自新论文,展示记忆偏差如何影响回访患者的示例。一个在 Alice 早期健康心电图上训练的模型仅给她后期心脏病发作分配 15% 的概率,而从未见过她历史记录的模型则给出 73%。 来源
遏制“数据移民”
各种国家和地区指令建议,此类用途的患者数据最好取自系统预期使用的国家,从而‘本地化’数据集中的患者群体,这显著提升了此类未被检测到的去匿名化事件发生的概率。
由此推断,仅限于国家数据集会增加 记忆化 的可能性——即模型在训练期间多次看到相同数据,以至于对这些过度学习的模式产生‘固定’。相反,数据集越大且越多样化,模型在训练后越有可能对未见数据进行 泛化,而不是记忆特定的数据点或配置。
然而,加入‘外国’医疗数据可能会引入不适用于模型部署所在国家的国家健康趋势和特异性证据;在这方面,正如 新论文 所承认的,适度的记忆化是恰当且有用的,因为它帮助模型在特定人群最可能的总体医学特征范围内工作。
论文指出*:
‘[When] 模型在前瞻性部署时,记忆化会产生一种特定且被低估的风险。由于患者的记录随时间高度自相似,未来的记录可能成为已记忆历史记录的部分提示,使模型的预测倾向于患者先前的健康状态。
这并非假设情景。医学 AI 模型常常在其训练数据来源的同一人群中部署。
‘例如,德国的国家乳腺癌筛查 项目 使用 一个在 120 万来自同一筛查人群的乳腺X线照片上训练的 AI 模型。
‘类似的部署正在其他地区进行,包括国家乳腺癌筛查项目 在英国 和 瑞典。
‘监管指引积极鼓励此做法,EU AI Act 要求训练数据反映预期使用的地理和情境环境(第 10 条第 4 款),以及 类似的国际指南 要求在医学 AI 开发中,模型的训练数据集应充分代表预期的患者群体。’
持续的历史灾难..?
尽管论文未涉及此事,但从统计学角度看,那些一生中未(或曾未)定期进行体检、且其匿名记录间歇性进入 AI 数据流的患者,极有可能在匿名患者数据中 几乎仅在他们需要治疗时出现——这会增加将已长期治愈的疾病‘投射’到同一患者身上的可能性,因为记录中缺乏‘健康’的对照。
这在对电子健康记录中 ‘informed presence bias’ 的 先前研究 中得到验证,发现医学数据集不成比例地代表了患者生病并与医疗服务互动的时期。
一项研究发现,重症患者的实验室数据天数是健康患者的5.05倍,药物医嘱天数是健康患者的6.85倍。
2022年,约76%的美国成年人报告称在过去一年内进行过常规体检,CDC 将其定义为一般体格检查,而非针对特定疾病的治疗;而在欧洲,2023年的一项多国调查发现有58%的人至少参加过一次预防性体检;但只有15%的人参加了所有对他们而言相关的预防性预约。
影响的程度
该研究在四个大型医学数据集上测试了该效应,涵盖心电图记录、胸部X光片和电子健康记录;具体包括MIMIC-CXR胸部X光数据库和MIMIC-IV-ED急诊护理记录,以及MIMIC-ECG和规模更大的HEEDB心电图集合。这些数据集的规模从数万名患者到超过180万人不等。
作者指出,计算得到的效应差异显著,某些情况下预测概率的变化超过70个百分点:

显示历史患者数据如何改变后续预测的结果。顶部面板比较四个数据集中文件变化的频率和幅度;底部面板展示该效应随患者最近一次训练记录时间的变化。显著效应随时间推移变得不常见,但在数十年后仍可检测到。
作为对照,研究人员随机将模型分组并重复比较,结果未出现对未来预测的显著变化。
论文指出,该效应可能持续数十年。尽管随着记录间隔的增加,它通常会变得更弱且不常见,但HEEDB数据集——该数据集收录了从1980年代到2025年的心电图——显示出在患者最近一次训练记录之后超过25年的预测仍出现显著变化。
诊断危害
新论文的研究者——题为医学AI中的记忆偏差——随后模拟了记忆如何在患者后续接触基于其早期记录训练的模型时影响诊断准确性。
未来的病例被划分为:患者是否出现了新疾病;是否在其历史训练数据中缺失;或是否以基本相同的健康状态返回。
对于新疾病,该效应始终呈负面,之前见过患者历史记录的模型在四个数据集所代表的一系列诊断上表现出较低的灵敏度。这包括心梗及其他心电图异常、肺部疾病以及更广泛的危急结果。
在实际意义上,当患者健康状况改变时,模型产生了更多的假阴性;但当患者健康状况未改变时,模型对其早期记录的记忆使其更有可能给出正确诊断。由于患者当前的情况与训练数据中已存在的情况相似,灵敏度和特异度均有所提升。
作者指出,这可能使此类系统的评估变得困难:如果大多数回访患者仍保持相同的疾病,模型在他们身上的表现会更好,可能掩盖其对新发疾病患者的灵敏度下降。
补救措施
作为可能的防护措施,研究人员在训练期间测试了差分隐私(限制模型对任何单个训练实例信息的保留程度)。
尽管保护个人记录降低了记忆效应,但即使在测试的最强设置下也未能完全消除。对患者层面进行保护,即覆盖同一人的所有记录,效果要好得多,几乎消除了该效应。
然而需要注意的是,如果数据集已被不可逆地匿名化,患者数据就无法以允许此类方法的方式进行隔离;研究人员还观察到,如果在训练时未启用差分隐私,成员推断攻击 将成为风险;若启用,则所需的训练资源显著增加。
结论
作者最后指出,尽管目前这些令人担忧的事件发生率相对较低,但未来可能会改变*:
‘有理由预期,由于记忆偏差导致的漏诊数量在未来会增加,尽管我们并未直接测试此点。先前的研究表明,模型记忆的训练数据比例会随模型容量的提升而上升 [6, 7, 9, 10, 40].’
‘这令人担忧,因为当前的 AI 模型开发遵循“规模法则” [41],该法则推动模型和数据集规模的快速增长,以期提升性能。’
‘随着更大的 AI 模型在来源于日益庞大患者群体的历史数据上进行训练,受记忆偏差影响的个体绝对数量可能会大幅上升,进一步加剧我们在此识别的风险。’
* 我将作者的行内引用转换为超链接,并在无法精确复制或不利时进行了一些解释。
首次发布于2026年9月18日,星期五












