医疗健康
基于性别偏见数据训练的AI模型在疾病诊断中表现更差

最近,一项发表在PNAS期刊上的研究, 由来自阿根廷的研究人员进行,表明训练数据中存在性别偏见会导致模型在诊断疾病和其他医疗问题时表现更差。正如Statnews报道的那样,研究人员团队尝试训练模型,female患者明显欠代表或完全排除在外,发现算法在诊断female患者时表现明显更差。同样,当male患者被排除或欠代表时,也会出现同样的情况。
在过去的五年中,随着AI模型和机器学习变得更加普遍,人们越来越关注偏见数据集和由此产生的偏见机器学习模型的问题。机器学习中的数据偏见可以导致尴尬、社会上有害和排他性的AI应用,但是在医疗应用中,生命可能处于危险之中。然而,尽管人们已经意识到这个问题,但很少有研究尝试量化偏见数据集的损害程度。研究团队发现,数据偏见可能比许多专家之前估计的更为极端。
最近几年,AI在医疗领域最流行的应用之一是使用AI模型根据医疗图像诊断患者。研究团队分析了用于检测各种医疗条件(如肺炎、心脏病或疝气)从X光片的模型。研究团队研究了三个开源模型架构:Inception-v3、ResNet和DenseNet-121。这些模型是在斯坦福大学和国家卫生研究院的两个开源数据集上训练的。虽然这些数据集本身在性别代表性方面相对平衡,但研究人员人为地偏斜了数据,通过将它们分成具有性别不平衡的子集。
研究团队创建了五个不同的训练数据集,每个数据集由不同比例的male和female患者扫描图像组成。五个训练集的划分如下:
- 所有图像都是male患者的
- 所有图像都是female患者的
- 25% male患者和75% female患者
- 75% female患者和25% male患者
- 一半male患者和一半female患者
在模型训练完成后,测试了来自male和female患者的扫描图像集合。一个值得注意的趋势在各种医疗条件中都存在,即当训练数据明显性别偏斜时,模型的准确性明显更差。一个有趣的现象是,如果训练数据中一个性别过度代表,模型在该性别上的表现并不会因此而改善。无论模型是否在一个性别的数据上训练,相比于在一个包含所有性别的数据集上训练,模型在该性别上的表现并不会更好。
该研究的首席作者Enzo Ferrante被Statnews引用,强调了训练数据的多样性和代表性对于所有预期测试模型的人群的重要性。
尚不完全清楚为什么在一个性别上训练的模型在另一个性别上表现更差。一些差异可能是由于生理差异,但社会和文化因素也可能导致一些差异。例如,女性可能倾向于在疾病进展的不同阶段接受X光检查。这种情况可能会影响模型从训练图像中学习到的特征(和模式)。如果情况确实如此,那么对于研究人员来说,要去除数据集中的偏见将变得更加困难,因为偏见将通过数据收集的机制被烘焙到数据集中。
即使是那些密切关注数据多样性的研究人员,有时也无法避免使用偏斜或有偏见的数据。存在医疗条件诊断差异的情况往往会导致数据不平衡。例如,关于乳腺癌患者的数据几乎全部来自女性。同样,自闭症在男性和女性中表现不同,因此该病症在男孩中被诊断的比率远高于女孩。
然而,研究人员控制偏斜数据和数据偏见的重要性不言而喻。为此,未来的研究将有助于研究人员量化偏见数据的影响。












