Andersonの視点

数十年前に匿名化された医療データが、現在AIの誤診を引き起こす可能性

mm
Unite.AI を Google の優先ソースに追加
Image by Vitaly Gariev at Unsplash, altered by GPT Image 2.5 to generate an older woman and to turn the real younger woman into an apparition representing stale patient data. Source: https://unsplash.com/photos/doctor-checks-patients-blood-pressure-with-stethoscope-NDOYHZ_98Rw license source - https://unsplash.com/license

ドイツと英国の新たな共同研究によると、数十年前に医療データセットに含まれた匿名化患者記録が、AIシステムがそれらで学習した際に何年も後に実際の患者の特徴を認識し、2026年の患者を2012年(または匿名化患者データが最初にデータセットに含まれた年)と同様に扱う可能性がある。

例えば、20年前にがん治療を受けたと記録され、その後長期寛解に入った患者が、AIシステムによって過去のがん罹患状態の文脈で扱われる可能性がある。論理的には再発の誤診の可能性さえ高まる。

逆に、2012年版のその患者データが定期健診で完全な健康状態を示していた場合、この楽観的な見方が年齢を重ねた現在のバージョンの患者に適用され、新たな症状や治療が必要な問題の検出が隠蔽される可能性がある。

新しい論文から、記憶バイアスが再来患者にどのように影響するかの例示。Aliceの以前の健康な心電図で訓練されたモデルは、後の心筋梗塞に対してわずか15%の確率を割り当てるのに対し、過去の記録を一切見たことのないモデルは73%を割り当てる。出典 - https://arxiv.org/pdf/2609.17223

新しい論文から、記憶バイアスが再来患者にどのように影響するかの例示。Aliceの以前の健康な心電図で訓練されたモデルは、後の心筋梗塞に対してわずか15%の確率を割り当てるのに対し、過去の記録を一切見たことのないモデルは73%を割り当てる。 出典

「データ移民」の抑制

このシナリオは、患者データは理想的にはそれを使用するシステムが導入される国から取得すべきだと勧告する様々な国内・地域指令により、データセット内の患者プールが「ローカライズ」され、未検出の再匿名化イベントの可能性が著しく高まることで、より起こりやすくなる。

推論すると、データを国内データセットのみに限定すると記憶の可能性が高まる――モデルが訓練中に同じデータを何度も目にし、過学習したパターンに『固執』してしまう可能性である。逆に、データセットが大きく多様であるほど、訓練後に見たことのないデータへ一般化できる可能性が高く、特定のデータポイントや構成を記憶することは少なくなる。

しかし、‘外国’の医療データを追加すると、訓練されたモデルが展開される国には当てはまらない国内の健康傾向や特異性の証拠が導入されるリスクがある。この点に関して、新しい論文が認めるように、ある程度の記憶は適切で有用であり、特定の集団の最も可能性の高い一般的医療特性の中でモデルが機能するのに役立つ。

論文は次のように述べている*:

‘[When]モデルは前向きに展開され、記憶は特有で過小評価されがちなリスクを生む。患者の記録は時間とともに高度に自己類似的であるため、将来の記録が記憶された過去の記録への部分的な手がかりとなり、モデルの予測を患者の過去の健康状態へとシフトさせる。

これは仮説的なシナリオではない。医療AIモデルは、訓練データが取得されたのと同じ集団に対して定期的に展開されている。

‘例えば、ドイツの国立乳がんスクリーニングプログラムは、同じスクリーニング対象集団から取得した120万枚のマンモグラムで訓練されたAIモデルを使用しています

‘同様の展開は他の地域でも進行中で、国立乳がんスクリーニングプログラムはイギリスでおよびスウェーデンで実施されている。

‘規制指針はこれを積極的に奨励しており、EU AI Actは訓練データが使用予定の地理的・文脈的設定を反映すること(第10条(4))を求め、医療AI開発に関する類似の国際ガイドラインは、対象患者集団がモデルの訓練データセットに十分に反映されることを求めている。

永続的な歴史的災害…?

論文はこの点に触れていないが、統計的に論理的に考えると、生涯を通じて定期的に健康診断を受けなかった患者、そして匿名化記録が不定期にAIデータストリームに流入した患者は、匿名化患者データにほぼ治療が必要な時にのみ現れる可能性が高く、記録に「健康」な対照がないため、長期間治癒した状態を現在の同一患者に「投影」する確率が高まるだろう。

これは先行研究により裏付けられている。電子健康記録における‘情報に基づく出席バイアス’を対象とした研究では、医療データセットが患者が病気で医療サービスとやり取りしている期間を過度に代表していることが判明している。

ある研究は、重症患者が最も健康な患者に比べて、検査データが記録された日数が5.05倍、投薬指示が記録された日数が6.85倍多いことを見出した。

2022年、米国の成人の約76%が報告した、前年度に定期的な健康診断(CDCが定義する一般的な身体検査)を受けたと。ヨーロッパでは、2023年の多国間調査が判明した、58%が少なくとも一部の予防検診を受けているが、関連性があると考えられるすべての予防的診療を受けたのはわずか15%である。

効果の程度

この研究は、ECG記録、胸部X線、電子カルテを含む4つの大規模医療データセットにわたって効果を検証した。具体的には、MIMIC-CXR胸部X線データベースMIMIC-IV-ED救急医療記録、さらにMIMIC-ECG、そしてはるかに大規模なHEEDB ECGコレクションである。データセットの規模は数万人から1.8百万人以上に及んだ。

著者らは、算出された効果は大きく変動し、予測確率の変化がケースによっては70パーセンテージポイントを超えることを指摘している:

過去の患者データが後の予測をどのように変化させるかを示す結果。上部パネルは4つのデータセット全体での変化の頻度と規模を比較し、下部パネルは患者の最終トレーニング記録からの経過時間に伴う効果の変化を示す。顕著な効果は時間とともに減少するが、数十年後でも検出可能である。

過去の患者データが後の予測をどのように変化させるかを示す結果。上部パネルは4つのデータセット全体での変化の頻度と規模を比較し、下部パネルは患者の最終トレーニング記録からの経過時間に伴う効果の変化を示す。顕著な効果は時間とともに減少するが、数十年後でも検出可能である。

対照として、研究者はモデルをランダムにグループ分けし比較を再実施したが、将来の予測に有意な変化は生じなかった。

論文は、この効果が数十年にわたって持続する可能性があると指摘している。記録間隔が長くなるにつれて一般的に弱まって頻度も減少するが、1980年代から2025年まで収集されたECGを含むHEEDBデータセットは、患者の最新トレーニング記録から25年以上後でも予測に有意な変化を示した。

診断上の危害

新しい論文(タイトルは医療AIにおける記憶バイアス)の研究者は、患者が以前の記録で訓練されたモデルに後で遭遇した際に、記憶が診断精度にどのように影響するかをシミュレーションした。

将来の症例は、患者が新たな疾患を発症したか、過去のトレーニングデータに存在しなかったか、あるいは本質的に同じ健康状態で再来院したかに基づいて分類された。

新たな疾患に対しては、効果は一貫してマイナスであり、患者の過去記録を事前に学習したモデルは、4つのデータセットに含まれるさまざまな診断において感度が低下した。これには心筋梗塞やその他のECG異常、肺疾患、そして広範な重大アウトカムが含まれる。

実務上、患者の健康状態が変化した場合、モデルは偽陰性を多く生成したが、患者の健康状態が変わっていない場合、モデルが以前の記録を記憶していることで正しい診断を出す可能性が高まった。患者の現在の状態がトレーニングデータにすでに含まれる状態に似ているため、感度と特異度の両方が向上した。

著者らは、これによりシステムの正確な評価が困難になる可能性があると指摘している。もし再来院患者の大半が同じ状態であれば、モデルはそれらに対して高い性能を示すため、新たな疾患を発症した患者に対する感度低下が隠れてしまう恐れがある。

対策

可能な安全策として、研究者は訓練中に差分プライバシー(個々の訓練例に関する情報がモデルにどれだけ保持されるかを制限する)をテストした。

個別の記録を保護することで記憶バイアスは減少したが、最も強い設定でも完全には排除されなかった。患者レベルで保護を適用し、同一人物に属するすべての記録を対象とした場合、はるかに効果的で、効果はほぼ排除された。

ただし、データセットが不可逆的に匿名化されている場合、患者のデータをこのような手法でリングフェンスすることはできず、研究者は、データセットが差分プライバシーを有効にせずに訓練された場合、メンバーシップ推測攻撃リスクとなること、そして有効にした場合は訓練に必要なリソースが顕著に増加することを指摘している。

結論

著者らは、現在懸念される事象は比較的低頻度で発生しているものの、将来的に変化する可能性があることを指摘して締めくくっている*:

‘将来的に記憶バイアスに起因する見逃し診断の数が増加すると予測する理由がありますが、これを直接テストしたわけではありません。先行研究では、モデルの容量が大きくなるにつれて、モデルが記憶するトレーニングデータの割合が増加することが示されています [6, 7, 9, 10, 40].’

‘現在のAIモデル開発が「スケーリング法則」によって導かれていることを考えると、これは懸念すべきことです。この法則は、性能向上を目指してモデルとデータセットの規模が急速に拡大することを促進します [41].’

‘より大規模なAIモデルが、ますます大きな患者集団から得られた過去データで訓練されるにつれて、記憶バイアスの影響を受ける個人の絶対数は急激に増加し、ここで指摘したリスクがさらに悪化する可能性があります。’

 

 

* 著者のインライン引用をハイパーリンクに変換したものです。正確な再現が不可能または有益でない場合には、一部解釈を加えています。

2026年9月18日金曜日に最初に公開

機械学習のライターで、人間画像合成の専門家です。Metaphysic.ai の研究コンテンツ部門の元責任者で、DNEG の Brahma.ai に統合されるまで勤務していました。
ウェブサイト: martinanderson.ai
連絡先: martin@martinanderson.ai