ソートリーダー

プライバシーを保つ3つの機械学習テクニック – この10年間で最も重要な問題を解決する

mm
Unite.AI を Google の優先ソースに追加

Persistent SystemsのマシンラーニングおよびAI研究者、Amogh Tarcarによる記事

データプライバシーは、幅広い分野の専門家によると、この10年間で最も重要な問題となるだろう。この10年間で最も重要な問題となるのは、特にマシンラーニング(ML)でアルゴリズムに大量のデータを与える場合である。

従来、MLモデリング技術は、複数のソースからのデータを単一のデータセンターに集めることに頼ってきました。MLモデルは、巨大な量のデータにアクセスできる場合に最も強力になるからです。しかし、この技術にはプライバシー上の課題があります。さまざまなソースからのデータを集めることは、HIPAA、GDPR、CCPAなどの規制上の懸念により、現在は実現しがたいことです。また、データを集中化することで、データの悪用やセキュリティ上の脅威の範囲と規模が拡大します。

これらの課題を克服するために、プライバシーを保つマシンラーニング(PPML)の柱が開発され、特定の技術がプライバシー上のリスクを軽減し、データが合理的に安全に保たれるようにしました。以下は、最も重要なテクニックのいくつかです。

1. フェデレーテッドラーニング

フェデレーテッドラーニングは、データの集約問題を逆転させるMLトレーニング技術です。単一のMLモデルを作成するためにデータを集めるのではなく、フェデレーテッドラーニングはMLモデル自体を集めます。これにより、データはソースロケーションを離れることはなく、複数の当事者が直接機密データを共有せずに共同のMLモデルを構築できます。

これは、ベースのMLモデルから始めて、各クライアントノードに共有します。各ノードは、ローカルトレーニングを実行して、モデルを更新します。モデル更新は、コーディネータノードに周期的に共有され、コーディネータノードはこれらの更新を処理して、新しいグローバルモデルを取得します。こうして、データセットを共有せずに、多様なデータセットからの洞察を得ることができます。

ソース:Persistent Systems

ヘルスケアの文脈では、これは患者データを安全に保ちながら、研究者に集団の知恵を提供するための、非常に強力でプライバシーを保つツールです。データを集めることなく、フェデレーテッドラーニングはセキュリティの追加レイヤーを作成します。しかし、モデルとモデル更新自体は、脆弱な場合にはセキュリティリスクを引き起こします。

2. 差分プライバシー

MLモデルは、メンバーシップ推論攻撃の対象となります。例えば、がんワクチンの開発を支援するために、ヘルスケアデータを病院に共有したとします。病院はデータを安全に保ちますが、フェデレーテッドラーニングを使用して、公開可能なMLモデルをトレーニングします。数ヶ月後、ハッカーはメンバーシップ推論攻撃を使用して、モデルトレーニングにデータが使用されたかどうかを判断します。ハッカーは、がんのリスクに基づいて保険会社に情報を提供し、保険料を引き上げる可能性があります。

差分プライバシーは、MLモデルに対する攻撃者攻撃を妨げ、特定のデータポイントがトレーニングに使用されたかどうかを識別できなくします。つまり、MLで機密トレーニングデータを公開するリスクを軽減します。これは、データまたはMLモデルのパラメータに「統計ノイズ」を適用して、データを乱雑化し、特定の個人のデータがモデルトレーニングに使用されたかどうかを判断することが困難になるようにします。

例えば、Facebookは最近、Opacusをリリースしました。これは、差分プライバシーに基づくMLトレーニングアルゴリズムであるDP-SGD(Differentially Private Stochastic Gradient Descent)を使用してPyTorchモデルをトレーニングするための高速ライブラリです。以下のGIFは、ノイズを使用してデータをマスクする方法を示しています。

 

このノイズは、Epsilonと呼ばれるパラメータによって制御されます。Epsilon値が低いと、モデルは完全なデータプライバシーを保ちますが、ユーティリティと精度は低くなります。逆に、Epsilon値が高いと、データプライバシーは低下しますが、精度は向上します。バランスをとることが重要です。

3. ホモモルフィック暗号化

従来の暗号化は、データが暗号化された後、MLアルゴリズムによって解釈できなくなるため、MLと互換性がありません。ただし、ホモモルフィック暗号化は、特定の計算を続行できる特殊な暗号化スキームです。

ソース:OpenMined

この力は、トレーニングが完全に暗号化された空間で行われるという点にあります。データ所有者だけでなく、モデル所有者も保護されます。モデル所有者は、暗号化されたデータで推論を実行できますが、データを直接見ることはできず、悪用することもできません。

フェデレーテッドラーニングに適用すると、モデル更新の融合は、完全に暗号化された環境で行われるため、メンバーシップ推論攻撃のリスクが大幅に軽減されます。

プライバシーの10年

2021年に入り、プライバシーを保つマシンラーニングは、活発な研究が行われている新興分野です。この10年間は、フェデレーテッドラーニング、差分プライバシー、ホモモルフィック暗号化を使用して、基礎となるデータのプライバシーを保ちながら、MLモデルを解放することについてです。これらは、プライバシーを意識した方法でマシンラーニングのソリューションを進歩させる新しい方法を提供します。

Amoghは、 Persistent SystemsのAI Research Labに所属するマシンラーニングの研究者です。彼の現在の研究は、Federated Learningアプリケーションと知識抽出のためのNLPツールの構築に焦点を当てています。