Andersonの視点
合成データはプライバシーを確実に保護できないと研究者は主張する

フランスとイギリスの新しい研究コラボレーションは、合成データがプライバシー、品質、および利用可能性の問題(その他の問題を含む)を解決できるという業界の自信を疑問視している。
いくつかの重要な点の中で、著者は、合成データが実際のデータからモデル化されているため、推論攻撃やメンバーシップ攻撃から信頼できる保護を提供しないと主張している。これらの攻撃は、データを匿名化してから実際の人物と再関連付けることを目的としている。
さらに、メンバーシップ攻撃や推論攻撃のリスクが高い人々、たとえば重篤な病気や高額な医療費を持つ人々(医療レコードの匿名化の場合)は、そのような技術によって再同定される可能性が高い。
研究論文では以下のことが述べられている:
‘合成データセットにアクセスすると、戦略的な攻撃者は、ターゲットレコードが元のデータに含まれていることを高い信頼性で推論できる。’
研究論文ではまた、差分プライバシー合成データ、個々のレコードのシグネチャを隠すものは、実際には個人のプライバシーを保護するが、情報検索システムの有用性を著しく損なうことになる。
実際、研究者は、「現実の」情報を「一歩離れた」方法で合成データを介して使用する、差分プライバシー方式は、セキュリティシナリオを悪化させる。
‘[合成]データセットは、このトレードオフについての透明性を提供しない。予測することはできない。どのようなデータ特性が保存され、どのようなパターンが抑制されるか。’
新しい論文、合成データ – 匿名化の地獄は、パリのエコール・ポリテクニーク・フェデラール・ド・ローザンヌ(EPFL)の2人の研究者と、ロンドン大学大学院(UCL)の1人の研究者によるものである。
研究者たちは、既存のプライベート生成モデル学習アルゴリズムのテストを行い、特定の実装決定がフレームワークで提供される正式なプライバシーガラントを侵害し、多様なレコードを推論攻撃にさらすことを発見した。
著者たちは、これらの漏洩を軽減する可能性のある各アルゴリズムの改訂版を提供し、コードをオープンソースライブラリとして公開している。彼らは、これにより、研究者が合成データのプライバシーゲインを評価し、有用に匿名化方法を比較できるようになるという。新しいフレームワークには、生成モデル学習アルゴリズムに適用できる2つの関連プライバシーアタック方法が含まれている。
合成データ
合成データは、機械学習モデルをさまざまなシナリオでトレーニングするために使用される。たとえば、情報が不足している場合、代替データでそれを補うことができる。顔写真の合成データセットで、CGI生成された顔で「難しい」または「まれな」顔写真を提供することができる。
他のタイプのCGI画像も、後に実データで実行されるデータセットを埋めるために使用されている。たとえば、手や家具の画像などである。
プライバシー保護の観点から、合成データは、実際のデータから特徴を抽出して、類似の架空のレコードを生成する生成対抗ネットワーク(GAN)システムによって生成できる。これらのレコードは、後に(未見、実際の)データに一般化する可能性が高いが、実際のデータの詳細を隠すことを目的としている。
方法論
新しい研究のために、著者たちは、5つの生成モデル学習アルゴリズムのプライバシーゲインを評価した。3つのモデルは、明示的なプライバシープロテクションを提供していないが、他の2つは差分プライバシーガラントを提供している。これらの表形式モデルは、幅広いアーキテクチャを表すために選択された。
攻撃されたモデルは、BayNet、PrivBay(PrivBayes/BayNetの派生)、CTGAN、PATEGAN、およびIndHistであった。
モデルの評価フレームワークは、Pythonライブラリとして実装され、2つのコアクラス、GenerativeModelsとPrivacyAttacksを備えていた。後者には、メンバーシップ推論アドバーサリとメンバーシップ推論攻撃の2つの側面がある。フレームワークはまた、「サニタイズ」(匿名化)されたデータと合成データのプライバシーメリットを評価することができる。
テストに使用された2つのデータセットは、Adult Data Set(UCI Machine Learning Repository)と、Hospital Discharge Data Public Use Data File(テキサス州保健福祉部)であった。テキサス州のデータセットのバージョンには、2013年の患者レコードからサンプリングされた50,000のレコードが含まれている。
攻撃と発見
研究の一般的な目的は、実データと合成データの「関連付け」(再関連付け)を確立することである。研究で使用された攻撃モデルには、ロジスティック回帰、ランダムフォレスト、k近傍法クラス分類器が含まれる。
著者たちは、2つのターゲットグループを選択し、それぞれに5つのランダムに選択されたレコードを含める。人口の「マイノリティ」カテゴリのレコードは、最もリンケージ攻撃に脆弱である。さらに、95パーセント点以下の属性値を持つレコードも選択した。たとえば、死亡リスクの高いレコード、総病院費用の高いレコード、疾患の重篤さのレコードなどである。
これらのレコードは、実際の攻撃者から見ると、メンバーシップ推論やその他の種類のデータ漏洩攻撃の対象となる「高価」または「高リスク」患者である。
複数の攻撃モデルが、10のターゲットに対してパブリックリファレンス情報で「シャドウモデル」を開発するためにトレーニングされた。実験の結果(前述)では、多くのレコードがリンケージ攻撃に対して「高度に脆弱」であることが示された。また、結果は、GAN方法で生成された合成データから、20%のすべてのターゲットがプライバシーゲイン0を受けたことも示している。
研究者たちは、結果は、合成データを生成する方法、攻撃ベクトル、ターゲットデータセットの特性によって異なることを指摘している。報告書では、多くの場合、合成データアプローチによる有効なアイデンティティ抑制は、結果システムの有用性を低下させることを発見した。実際、システムの有用性と精度は、再同定攻撃に対する脆弱性の直接的な指標となることが多い。
研究者たちは以下のことを結論付ける:
‘合成データセットが元のデータの特性を高い精度で保存し、したがって広告されているユースケースのためにデータの有用性を保持する場合、同時に攻撃者が個人の機密情報を抽出できる。 ‘
‘私たちが評価した匿名化メカニズムを通じてプライバシーの高い利益を得ることができるのは、公開された合成またはサニタイズされた元のデータのバージョンが、生のデータの個々のレコードのシグナルを伝達せず、実際にはそのレコードを抑制する場合のみである。’












