ヘルスケア
性別偏りのあるデータで訓練されたAIモデルは、疾患の診断に劣る

最近、研究がPNAS誌に発表され、アメリカの研究者によって行われたこの研究では、訓練データに性別偏りがあると、疾患やその他の医療問題の診断におけるモデルのパフォーマンスが低下することが示唆された。 Statnewsによると、研究チームは、女性患者が著しく少数派またはまったく含まれない訓練モデルを実験し、アルゴリズムが女性患者を診断する際に大幅に劣ることを発見した。男性患者が除外されたり少数派だったりした場合も同様の結果が得られた。
過去半世紀で、AIモデルや機械学習がより一般的になったため、偏ったデータセットやそれらから生じる偏った機械学習モデルの問題に対する関心が高まっている。機械学習におけるデータ偏りは、不快で社会的に有害で排他的なAIアプリケーションにつながる可能性があるが、医療アプリケーションの場合は人命が懸かっている。ただし、問題が知られているにもかかわらず、偏ったデータセットがどれほど有害であるかを量化しようとした研究はほとんどない。研究チームが行った研究では、データ偏りが予想よりも極端な影響を及ぼす可能性があることがわかった。
医療の文脈では、AIモデルを使用して医療画像に基づいて患者を診断することが、最近の最も人気のある用途の1つである。研究チームは、X線から肺炎、心拡大、またはヘルニアなどのさまざまな医療状態の存在を検出するために使用されるモデルを分析した。研究チームは、Inception-v3、ResNet、DenseNet-121の3つのオープンソースモデルアーキテクチャを調査した。これらのモデルは、スタンフォード大学と国立衛生研究所から提供された2つのオープンソースデータセットからの胸部X線で訓練された。データセット自体は性別の表現において比較的バランスの取れたものであるが、研究者はデータを人為的に偏らせて、性別のバランスが取れていないサブセットに分割した。
研究チームは、5つの異なる訓練データセットを作成し、それぞれが異なる男女患者スキャンの比率で構成されていた。5つの訓練セットは以下のように分割された。
- すべての画像が男性患者
- すべての画像が女性患者
- 25%の男性患者と75%の女性患者
- 75%の女性患者と25%の男性患者
- 半分が男性患者、半分が女性患者
モデルを1つのサブセットで訓練した後、男性と女性の両方の患者からのスキャンのコレクションでテストした。さまざまな医療状態において、訓練データが著しく性別偏りの場合、モデルの精度が大幅に低下するという注目すべき傾向が見られた。興味深いのは、訓練データで1つの性別が過剰に表現されていた場合、その性別が過剰に表現されていることから利益を得ていないことである。モデルの訓練データが1つの性別に偏っていたか、または両方の性別を含んでいたかに関係なく、包含的なデータセットで訓練された場合と比較して、どちらの性別でもパフォーマンスが向上しなかった。
研究の主任著者であるEnzo Ferranteは、Statnewsによって引用されたが、研究は訓練データが多様で表現的であることが重要であることを強調しているという。つまり、モデルをテストするすべての集団に対して、データが代表的である必要がある。
1つの性別で訓練されたモデルが、別の性別で劣るパフォーマンスを示す理由は完全には明らかではない。生理的な違いが一部の差異の原因である可能性があるが、社会的および文化的要因も一部の差異の原因である可能性がある。たとえば、女性は、疾患の進行段階が異なる場合にX線を撮影される可能性がある。もしもそうならば、訓練画像内で見られる特徴(そしてモデルによって学習されるパターン)に影響を与える可能性がある。もしもそうならば、研究者がデータセットから偏りを除去することは非常に難しい。なぜなら、偏りはデータ収集のメカニズムを通じてデータセットに組み込まれるからである。
データの多様性に注意を払う研究者でも、偏ったデータでなければならない状況に直面することがある。医療状態の診断方法に差がある場合、データが偏っている可能性がある。たとえば、乳がん患者に関するデータはほぼすべて女性から収集される。同様に、自閉症は男性と女性で異なる症状を示すことがあり、結果として、自閉症は男性の子供よりも女性の子供に診断されることが多い。
それでも、研究者ができる限り、偏ったデータやデータ偏りを制御することが非常に重要である。将来的には、研究者が偏ったデータの影響を量化するのに役立つ研究が行われることになる。












