Anderson 视角

流行的COVIDx数据集被英国研究人员批评

mm
将 Unite.AI 添加到您在 Google 上的首选来源

英国的一个研究团队对用于计算机视觉分析COVID-19患者胸部X光片的开源数据集的科学信心程度提出批评,特别是针对流行的开源数据集COVIDx。

研究人员在测试了COVIDx在各种AI训练模型中的表现后,声称COVIDx“不能代表真正的临床问题”,使用它获得的结果“夸大了”,并且这些模型“不能很好地推广到真实世界的数据”。

作者还指出,组成COVIDx的贡献数据不一致,原始图像具有各种分辨率,需要自动重新格式化以适应深度学习工作流程的统一大小,这个过程可能会引入与图像缩放算法相关的欺骗性伪影,而不是临床数据的方面。

论文称为《使用开源数据开发COVID-19胸部X光片检测的深度学习解决方案的陷阱》,这是英国利兹大学计算成像与生物医学模拟中心(CISTIB)与利兹五个其他组织的合作成果,包括利兹教学医院NHS信托基金。

研究详细介绍了COVIDx数据集中的“标签滥用”以及“高偏差和混杂风险”。研究人员使用三个可行的深度学习模型对数据集进行实验后,得出结论:“报告的异常性能被夸大,模型性能结果被误导,模型不能很好地推广到临床现实数据”。

五个对比数据集合一

报告指出,当前领域的大多数基于AI的方法都依赖于来自不同开源存储库的“异构”数据集合,尽管这些数据集具有明显不同的特征,但它们被合并到COVIDx数据集中,研究人员认为,这些数据集的质量和类型不够一致。

COVIDx数据集于2020年5月发布,是加拿大滑铁卢大学系统设计工程系领导的联合努力,数据作为COVID-Net开源计划的一部分提供。

组成COVIDx的五个集合是:COVID-19 图像数据集(来自蒙特利尔研究人员的开源数据集);COVID-19胸部X光片数据集 计划;Actualmed COVID-19胸部X光片 数据集;COVID-19放射学 数据库;以及RSNA肺炎检测挑战 数据集,这是为应对COVID-19危机而被利用的众多预COVID数据集之一。

(RICORD – 见下文 – 后来被添加到COVIDx中,但由于它是在研究中感兴趣的模型之后添加的,因此它被排除在测试数据之外,况且,它将进一步增加COVIDx的差异性,这是作者的主要抱怨。)

研究人员声称,COVIDx是与COVID研究相关的科学界中“最大的和最广泛使用”的数据集之一,并且从外部数据集导入到COVIDx中的数据不符合COVIDx数据集的三元模式(即“正常”,“肺炎”和“COVID-19”)。

足够近吗?

在检查贡献数据集的来源和适用性时,研究人员发现RSNA数据的“滥用”,即一种类型的数据被归入另一种类别:

‘RSNA存储库使用来自NIH Chestx-ray8的公开可用胸部X光片数据,设计用于分割任务,包含三类图像,‘肺不透明度’,‘无肺不透明度/不正常’,和‘正常’,对于‘肺不透明度’病例,提供边界框。在编译到COVIDx中时,所有来自‘肺不透明度’类的胸部X光片都被包含在肺炎类中。’

‘有效地,COVIDx方法扩大了‘肺炎’的定义,包括‘所有类似肺炎的肺不透明度’。因此,比较数据类型的可比性受到威胁。研究人员指出:

‘…肺炎类在COVIDx数据集中包含了胸部X光片,具有各种其他病理,包括,胸腔积液,浸润,实变,肺气肿和肿块。实变是可能的肺炎的放射学特征,而不是临床诊断。使用实变作为肺炎的替代品而不记录这一点可能具有误导性。’

与COVIDx相关的替代病理(除了COVID-19)

与COVIDx相关的替代病理(除了COVID-19) 来源:https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf

报告发现,只有6.13%的4305例肺炎病例来源于RSNA被准确标记,代表着仅265例真正的肺炎病例。

此外,许多非肺炎病例被包含在COVIDx中,代表了其他疾病的并发症,或者其他非肺炎相关的疾病。

不正常

报告进一步指出,RSNA挑战数据集对COVIDx的影响使得数据的经验稳定性发生了偏差。研究人员观察到,COVIDx优先考虑RSNA数据的“正常”类,有效地排除了更广泛数据集中的“无肺不透明度/不正常”类。论文指出:

‘虽然这符合“正常”标签的预期,但扩大肺炎类并仅使用“正常”的胸部X光片,而不是肺炎阴性病例,大大简化了分类任务。’

‘最终结果是,数据集反映了一个与真正的临床问题无关的任务。’

不兼容数据标准的潜在偏差

论文指出,COVIDx中存在其他类型的偏差,包括一些贡献数据混合了儿童和成人患者的胸部X光片图像,并且这些数据是COVIDx中唯一的“显著”儿童图像来源。

此外,RSNA数据集的图像具有1024×1024的分辨率,而另一个贡献数据集仅提供299×299的分辨率。由于机器学习模型会将图像重新调整大小以适应可用的训练空间(潜在空间),这意味着299×299的图像将被放大,而较大的图像将被缩小。这会导致与缩放算法相关的伪影,而不是病理学上的变化。

此外,ActMed数据被纳入COVIDx中,包含“圆盘形标记”在COVID-19胸部X光片中,这是一个反复出现的特征,与更广泛的数据集不一致,需要被处理为“反复出现的异常值”。

这是通常通过清理或省略数据来解决的问题,因为标记的反复出现足以在训练中注册为“特征”,但不够频繁,以至于在更广泛的数据集中无法有用地推广。没有机制来减轻这些人工标记的影响,它们可能被机器学习系统的方法视为病理现象。

训练和测试

研究人员使用三个模型测试了COVIDx与两个比较数据集。另外两个数据集是RICORD,包含1096例COVID-19胸部X光片,来自四个国家的361名患者;以及CheXpert,一个公共数据集。

使用的三个模型是COVID-Net,CoroNetDarkCovidNet。所有三个模型都使用卷积神经网络(CNN),尽管CoroNet由一个两阶段图像分类过程组成,使用自动编码器将输出传递给CNN分类器。

测试显示,所有模型在非COVIDx数据集上的性能都有“显著下降”,与使用COVIDx数据时的86%准确率相比。然而,如果数据被错误标记或错误分组,这些都是有效的错误结果。研究人员在可比的外部数据集上观察到准确率显著降低,这些数据集被认为是更现实和正确分类的数据。

此外,论文指出:

‘对COVIDx测试数据的500个grad-CAM显著性图进行临床审查,显示出对临床上无关紧要的特征的显著趋势,通常包括对骨骼结构和软组织的关注,而不是COVID-19感染的典型特征——双肺野的弥漫性双侧浸润。’

这是一个确认的COVID-19病例的X光片,使用COVIDx训练的DarkCovidNet模型,预测概率仅为0.938

这是一个确认的COVID-19病例的X光片,使用COVIDx训练的DarkCovidNet模型,预测概率仅为0.938

结论

研究人员批评COVIDx数据集中缺乏与X光片图像相关的人口统计或临床数据,认为没有这些数据,无法考虑“混杂因素”,如年龄。

他们还指出,COVIDx数据集中发现的问题可能适用于其他以类似方式获取的数据集(即,将预COVID放射学图像数据库与最近的COVID X光片图像数据混合,缺乏充分的数据架构、方差补偿和明确的限制)。

总结COVIDx的缺点时,研究人员强调了“清晰”的儿童X光片的不均衡包含,以及他们对COVIDx标签滥用和高偏差风险的看法,认为“报告的异常性能 [在COVIDx中]被夸大,模型性能结果被误导,模型不能很好地推广到临床现实数据。”

报告得出结论:

‘由于缺乏可用的医院数据和在问题域中不充分的模型评估,使用开源数据可能会误导研究界。继续发表夸大的模型性能指标可能会损害医学诊断中AI研究的可信度,特别是在疾病具有高度公共利益的领域。研究质量必须提高,以防止这种情况的发生,这必须从数据开始。’

 

 

*尽管研究人员声称已经在线上发布了新论文的数据、文件和代码,可访问,但需要登录,并且在撰写本文时,尚无公共访问权限。
** ChestX-ray8:医院规模的胸部X光片数据库和常见胸部疾病的弱监督分类和定位基准 –
https://arxiv.org/pdf/1705.02315.pdf

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai