Andersonの視点

HIPAAがAIによる匿名化解除を止めることができないことが増えています

mm
Unite.AI を Google の優先ソースに追加
An AI-generated image featuring a crowd of businesspeople gathered around the hospital bed of a masked patient, trying to remove his mask. Z-Image Turbo + Qwen Edit V1, via Krita AI Diffusion.

病院が名前や郵便番号を除去した後でも、現代のAIは時々まだ患者が誰であるかを推測することができます。保険会社にとってはよいニュースですが、医療受給者にとってはそうではありません。

 

ニューヨーク大学の新しい研究によると、US患者さんの医療記録、名前やその他のHIPAA識別子を除去したものは、患者さんを再識別の危険にさらすことができます。実世界の未編集の患者記録の大量のコーパスでAI言語モデルを訓練することで、身元を特定する詳細が残ります。診断のみから患者さんの近隣が推測できる場合もあります。

この新しい研究は、匿名化されたヘルスデータの利益的な市場の文脈でこのリスクを配置します。ここでは、病院やデータブローカーが通常、スクラブされた臨床ノートを製薬会社、保険会社、AI開発者に販売またはライセンスします。

研究者は、HIPAAによって確立された患者保護の根底にある「匿名化」の概念に異議を唱えています。1997年にマサチューセッツ州知事ウィリアム・ウェルドの医療データが匿名化されたとき以来です:

‘[さもなければ] 完全なセーフハーバー遵守の下で、「匿名化」されたノートは、実際の身元と統計的に結びついたままです。矛盾は技術的なものではなく、構造的なものです。’

研究者は、現在のHIPAA準拠の匿名化フレームワークが「リンク攻撃」に対して2つのバックドアを残していることを主張しています:

新しい論文から、HIPAAスタイルの匿名化が明示的な機密属性を除去しながら、身元と関連付けられた相関関係を保持していることを示す因果図。ソース - https://arxiv.org/pdf/2602.08997

新しい論文から、HIPAAスタイルの匿名化が明示的な機密属性を除去しながら、身元と関連付けられた相関関係を保持していることを示す因果図。ソース – https://arxiv.org/pdf/2602.08997

上記の例では、患者さんが妊娠していることだけでなく、低所得グループに関連しない趣味を持っていることもわかります。研究者によると:

‘保護された属性(生年月日と郵便番号)は赤字ですが、妊娠から、患者さんが成人の女性であると推測でき、ドレスエージュという趣味から、豊かな近隣に住んでいることがわかります。’

ある実験では、患者識別子が除去された後でも、170,000人のNYU Langone患者さんの22万件以上の臨床ノートには、人口統計学的特性を推測するのに十分な信号が残っていたことがわかりました。

詳しく見てみる

BERTベースのモデルは、ファインチューニングされ、匿名化されたレコードから6つの属性を予測するために使用されました。論文によると、1,000個のトレーニング例だけで、ランダムな推測を上回る結果を達成しました。生物学的性別は99.7%以上の精度で回復され、月の推測など、より微妙な信号もランダムな推測を上回る精度で予測されました。

実験の目的で、推測された特性はLangoneデータベースに対するリンク攻撃で使用され、最大0.34%のユニークな再識別リスクを生み出しました。これは、単純な多数決ベースラインよりも約37倍高い値です。

研究者は、この問題を「パラドックス」として捉えています。なぜなら、HIPAA準拠の匿名化された患者記録に残っているものは、明らかに匿名化攻撃のための有効な基礎であるからです:

‘[ほとんどの] 再識別リスクは、保護されたヘルス情報からではなく、安全とみなされている非機密および医療コンテンツから生じます。’

ニューヨーク市のボロ区別の死亡率、平均入院期間、1人当たりの収入の地図、ヘルスケアの成果と社会経済変数が地理的にクラスター化し、匿名化されたノート内に身元と関連付けられたパターンを作成することを示しています。ソース論文に記載されている追加の例を参照してください

ニューヨーク市のボロ区別の死亡率、平均入院期間、1人当たりの収入の地図、ヘルスケアの成果と社会経済変数が地理的にクラスター化し、匿名化されたノート内に身元と関連付けられたパターンを作成することを示しています。ソース論文に記載されている追加の例を参照してください

論文では、HIPAAのセーフハーバー規則がもはや政策立案者の意図した方法で機能していないと主張しています。18の識別子を除去することは法律の文字を満たすかもしれませんが、研究者によると、それは身元を推測することを防ぐものではありません。彼らは、システム自体が、LLMが通常の医療テキストから何を推測できるかできないかについての古い仮定に基づいて構築されていると主張しています。

研究も、弱点の恩恵を受ける可能性が高いのは、医療保険に関連する大企業であると示唆しています。伝統的な意味での犯罪者(ハッカー、ブラックメーラー、ソーシャルエンジニアなど)ではなく:

‘セーフハーバーの存続は、既知の限界にもかかわらず、過失ではなく、システムの特徴です。’データの流動性のために最適化されたシステムです。患者保護のためにではありません。’‘匿名化された臨床ノートは数十億ドル規模の市場を表します。ヘルスケア機関は、データの有用性を低下させたり、高額なインフラ投資を必要とする可能性のあるプライバシー保護代替案を採用する構造的な不正劣化を作り出します。 ‘

‘この不正劣化を慎重に調査し、理解し、対処する必要性があります。’

これは、明確な答えを提供していないポジションペーパーですが、研究者は、匿名化の研究を技術的な解決策ではなく、社会契約と違反の法的結果に向けてシフトすることを提案しています(DMCAが技術的な解決策が失敗した場合に、著作権保護された作品のコピーを制限するために使用するアプローチと同じです)。

新しい論文は、匿名化のパラドックス:LLMの時代のHIPAAセーフハーバーの批判というタイトルで、ニューヨーク大学の4人の研究者によってNYU Langone病院と協力して作成されました。

方法

彼らの理論をテストするために、研究者は、170,283人の患者さんに治療された222,949件の識別可能な臨床ノートを使用して、2段階のリンク攻撃を開発しました。ノートは、患者さんごとに80%のトレーニング、10%の検証、10%のテストに分割されました。

このコレクションは、MIMIC-IVデータセットの3.34倍大きく、公開されている電子ヘルスレコード(EHR)コレクションの中で最大です。プライバシーの理由により、Langoneデータセットはどのような形式でも公開されませんが、ユーザーは、GitHubリポジトリを介して、プロジェクトの原則を実験することができます。

6つの人口統計学的属性が、影響力のある先行研究で特定されたクラシックな再識別トリオを近似するために作成されました:生物学的性別近隣ノートの年ノートの月地域の収入;および保険の種類

UCSF philterで匿名化されたNYU Langone臨床ノートから推測された人口統計学的属性、生物学的性別、近隣、ノートの年、ノートの月、地域の収入、保険の種類で構成され、'Simple Demographics Often Identify People Uniquely' - https://dataprivacylab.org/projects/identifiability/paper1.pdfで説明されている一意の識別子トリオを近似するように選択されました

UCSF philterで匿名化されたNYU Langone臨床ノートから推測された人口統計学的属性、生物学的性別、近隣、ノートの年、ノートの月、地域の収入、保険の種類で構成され、’Simple Demographics Often Identify People Uniquely’ – https://dataprivacylab.org/projects/identifiability/paper1.pdfで説明されている一意の識別子トリオを近似するように選択されました

ノートは、UCSF philterを使用して匿名化された後、モデリングされました。

BERTベースのアンケースドモデルは、アンケースドで、110百万パラメータを持ち、一般ドメインのテキストで事前に訓練され、臨床データへの事前の露出を避けました。各属性ごとに個別にファインチューニングされ、8つのNVIDIA A100 GPUまたは80GBのメモリを備えたH100 GPUを使用して、最大10エポックまで訓練されました。最適化には、AdamWが使用され、学習率は2×10−5で、有効なバッチサイズは256でした。

一般化は、精度と加重ROC-AUCを使用して、保持されたテストセットで評価されました。後者は、属性間のクラス不均衡を考慮するために選択されました。

モデルが単一の決定的な答えを与えるのではなく、各属性に対して最も可能性の高い上位k個の値を保持し、患者データベースをそれらの予測された特性と一致するすべての患者さんを含むようにフィルタリングすることで、攻撃をより現実的にしました。これにより、各ノートに対して可能な身元のショートリストが生成され、単一の推測ではなく、生成されました。

リスク評価

再識別リスクは2段階で計算されました。実際の患者さんがショートリスト内に含まれる頻度を測定し、ショートリスト内から正しい人物を選択する確率を推定しました。

最後のステップでは、誰かがショートリストから名前をランダムに選択することを前提としています。報告された数値は慎重な推定値であり、決心した攻撃者はより良い結果を達成できる可能性があります。

実験では、外部データベースの完全な患者さん人口へのアクセスが想定されました。これは、広範な患者さんレコードのカバレッジを持つ大規模な機関またはデータブローカーがリンケージを試みる現実的なシナリオを反映しており、研究者が取り組んでいる脅威の性質をさらに強調しています。

結果

リスクは3つのレベルで測定されました:グループの再識別成功率は、正しい上位k個の予測をすべての属性にわたって使用して、実際の患者さんがショートリスト内に含まれる頻度を捉えました;グループからの個人の再識別は、ショートリストが特定された後に正しい人物を選択する確率を測定しました;および一意の再識別の確率は、両方を掛けて、匿名化されたノートから患者さんを一意に識別する全体的な可能性を生み出しました:

生物学的性別、近隣、年、月、収入、保険の種類の予測精度を示す図。BERTベースのアンケースドモデルは、1,000個のトレーニング例でさえランダムな推測を上回り、データセットが178,000サンプルに増えるにつれて精度が着実に改善することを示しています。

生物学的性別、近隣、年、月、収入、保険の種類の予測精度を示す図。BERTベースのアンケースドモデルは、1,000個のトレーニング例でさえランダムな推測を上回り、データセットが178,000サンプルに増えるにつれて精度が着実に改善することを示しています。

これらの初期結果について、研究者は次のように述べています:

‘図に示すように、匿名化された臨床ノートは属性予測に対して依然として脆弱です。すべての属性とすべてのデータレジーム(1kから177kの例)で、言語モデル(赤)が一貫してランダムなベースライン(灰色)を上回ります。 ‘

‘これらの結果は、匿名化プロセスが2つのバックドアパスで利用可能な信号を保持していることを実証的に支持しています。 ‘

‘プライバシーリスクは即時です。モデルは1,000個のトレーニング例だけでランダムな推測を上回るパフォーマンスを達成します。生物学的性別は最も露呈している属性であり、99.7%以上の精度で回復されますが、月の推測など、最も微妙な信号もランダムな推測を上回る精度で予測されます。’

2番目の結果グラフでは、1つの方向はモデルがショートリスト内に実際の患者さんを含める頻度を示し、もう1つの方向はショートリストがどのくらい小さいかを示しています:

モデルがショートリスト内に実際の患者さんを含める頻度を、ショートリストから正しい人物を選択する容易さとプロットした図。言語モデルは、0.34%に達し、最も強いベースラインの0.0091%と比較して、ランダムな推測よりも高い全体的な再識別リスクを作成します。

モデルがショートリスト内に実際の患者さんを含める頻度を、ショートリストから正しい人物を選択する容易さとプロットした図。言語モデルは、0.34%に達し、最も強いベースラインの0.0091%と比較して、ランダムな推測よりも高い全体的な再識別リスクを作成します。

実際の患者さんがショートリスト内に含まれる頻度が高く、ショートリストが小さいほど、リスクは高くなります。研究者の言語モデルは、ショートリスト内に実際の患者さんが含まれる頻度と、ショートリストから正しい人物を選択する容易さの両方で、単純な多数決推測を上回りました。ピーク時には、0.34%の確率で患者さんを一意に識別することになりました。これは、最も強いベースラインよりも約37倍高い値です。

研究者は、希少な医療歴史や疎外された身元を持つ患者さんの場合、匿名化のリスクが高く、HIPAAのセーフハーバー規格の見直しを勧告しています:

‘HIPAAのセーフハーバー規格は、プライバシーに二項定理を適用しています。データは「識別可能」または「匿名化」です。HIPAAは、18のトークンを除去することでデータを「安全」にできるという仮定に基づいています。 ‘

‘しかし、私たちの因果グラフ分析と実証的結果は、この仮定が幻想であることを示しています。 ‘

‘臨床ノートは、患者さんの身元と密接に結びついています。患者さんの医療診断と編集されていない物語は、患者さんのユニークな人生の軌跡の直接的な産物であり、高次元のシグネチャを作成し、個人の身元に戻すことができます。 ‘

研究者はさらに強調していますが、現在の匿名化規則は、固定された識別子のリストを除去することに重点を置き、残りのテキストに残されたパターンを無視しています。LLMは、パターンを検出して組み合わせるように設計されているため、通常の臨床的詳細は間接的な識別子として機能し始める可能性があります。

論文は、いくつかの勧告で終わります。シンセティックデータや「デクラス化」されたデータでモデルをファインチューニングすることを止めることを勧告しています。前者は、モデルを訓練するために使用された実際のデータに関するプライバシーリスクを保持し、後者は、HIPAA時代の保護の以前の標準がまだ有効であると想定しています。

結論

このような「バックドア」が大企業、たとえば保険会社にとって最も役立つものであるため、DCMAスタイルの「法的ブロック」(保護の回避行為自体が法律で禁止されている)アプローチは効果的ではありません。

保険会社がこのような情報へのアクセスを望み、データブローカーとの関連で、プライベートなヘルスケアレコードへのアクセスが非常に高いことはよく知られています。会社が大きいほど、ネイティブ顧客データベースが大きくなります。

したがって、HIPAAの厳格さと安全対策が、企業の搾取に対する効果的な障壁ではなく、「紳士協定」になってきている場合、見直しは時期尚早ではありません。

 

* 著者のインライン引用をハイパーリンクに変換したものです。

2026年2月11日水曜日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]