Andersonの視点

説明可能なAIは機密データをより簡単に漏らす可能性がある

mm
Unite.AI を Google の優先ソースに追加

シンガポール国立大学の研究者は、AIが説明可能になるほど、機密性の高いプライバシー機能を回避することが容易になることを発見しました。さらに、モデルが説明可能でない場合でも、類似したモデルの説明を使用して、非説明可能なモデル内の機密データを「解読」することが可能であることを発見しました。

この研究では、Exploiting Explanations for Model Inversion Attacksというタイトルで、機械学習システムのプライバシー機能を回避するための説明可能なAIのリスクを強調しています。欧州連合の人工知能規制案を含む新しいグローバルな取り組みは、説明可能なAI(XAI)を社会における機械学習の正常化の前提条件として位置付けているため、説明可能なAIの使用のリスクが高まっています。

研究では、XAIを使用して、顔の表情に関する匿名データから実際のIDを再構築することに成功しました。ソース:https://arxiv.org/pdf/2108.10800.pdf

研究では、XAIを使用して、顔の表情に関する匿名データから実際のIDを再構築することに成功しました。ソース:https://arxiv.org/pdf/2108.10800.pdf

研究者は次のように述べています:

「説明可能な人工知能(XAI)は、ユーザーがモデルによる決定を理解するための追加情報を提供します。しかし、この追加情報はプライバシー攻撃のリスクをさらすことになります。したがって、説明を提供することはプライバシーを損なうことになります。」

プライベートデータの再同定

機械学習のデータセットに参加する人々は、匿名性を保つという前提で参加することがあります。個人情報(PII)がAIシステムに流入する場合、参加は技術的には合法ですが、同意の概念を損なう可能性があります。

最近では、機械学習のデータフローからPIIを匿名化する方法が複数開発されています。モデル抽出は、APIアクセス(ソースコードやデータへのアクセスなし)を使用して、PIIを抽出します。さらに、Amazon Web Services を含む大規模なMLaaSプロバイダーからもPIIを抽出できます。メンバーシップ推論攻撃(MIAs)は、機密性の高い医療情報を取得する可能性があります。属性推論攻撃(AIAs)は、APIの出力から機密データを回復することができます。

顔の再同定

この研究では、顔の表情データのサブセットからIDを取得するように設計されたモデルインバージョン攻撃に焦点を当てています。

システムの目的は、インターネット上で見つかった画像(投稿された画像やデータ漏洩の画像)を、機械学習アルゴリズムの基礎となるデータセットと関連付けることでした。

研究者は、匿名化されたAPI出力から元の画像を再構築することができるインバージョン攻撃モデルをトレーニングしました。以前の研究では、同定(保護または開示)がターゲットシステムと攻撃システムの両方の目的でしたが、この場合、フレームワークは別のドメインに適用するために設計されています。

転置された畳み込みニューラルネットワーク(CNN)を使用して、感情認識システムのターゲット予測ベクトル(サリエンシーマップ)に基づいて、元のソース顔の予測を行いました。さらに、U-Netアーキテクチャを使用して、顔の再構築性能を向上させました。

XAIを使用した再同定システムは、出力のみからアーキテクチャの内部動作を再構築することで、データセットの画像を再同定することができます。

XAIを使用した再同定システムは、出力のみからアーキテクチャの内部動作を再構築することで、データセットの画像を再同定することができます。

テスト

システムのテストでは、研究者は3つのデータセットを使用しました:iCV-MEFED顔の表情、CelebA、およびMNIST手書き数字。データセットはそれぞれ128×128、265×256、32×32ピクセルにリサイズされました。各データセットの50%をトレーニングデータとして使用し、残りの50%を攻撃データセットとして使用して、対抗モデルをトレーニングしました。

各データセットには異なるターゲットモデルがあり、各攻撃ネットワークは、説明の制限に従って設計されました。説明の一般化を超える複雑なニューラルモデルは使用されませんでした。

使用されたXAI説明タイプには、勾配説明勾配入力Grad-CAM、およびレイヤーウイズ関連伝播(LRP)が含まれます。研究者は、複数の説明を実験で評価しました。

3つのデータセットを使用したXAIを使用したインバージョン攻撃による画像の再構築。

3つのデータセットを使用したXAIを使用したインバージョン攻撃による画像の再構築。

テストの指標は、ピクセルごとの類似性を評価する平均二乗誤差(MSE)でした。さらに、画像の類似性(SSIM)を評価しました。攻撃の精度は、分類器が再構築された画像を再ラベルすることができるかどうかで決定されました。攻撃の埋め込み類似性は、既知のソースデータの特徴埋め込みと再構築されたデータの特徴埋め込みを比較しました。

再同定は、タスクとデータセットによって異なるレベルで達成されました。さらに、研究者は、サロゲートターゲットモデル(完全に制御可能)を使用して、外部の「クローズド」モデルからのデータの再同定も可能であることを発見しました。

研究者は、活性化ベースの説明(サリエンシーマップ)が最も正確な結果をもたらし、感度ベースのアプローチ(勾配)よりもPIIを漏らすことが多いことを発見しました。

将来の研究では、研究チームは、特徴の視覚化や概念の活性化ベクトルなどの新しいXAI説明を新しい攻撃に組み込むことを計画しています。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai