Andersonの視点
マシンラーニングモデルをあなたについて忘れさせる
マシンラーニングモデルから特定のデータを削除することは、すでにコーヒーに入れた二杯目の砂糖を取り除くことに似ています。データはすでにモデル内の多くのニューロンと密接に結びついています。如果データポイントがモデルを定義する初期の高次元部分のトレーニングに参加した場合、データを削除するとモデルが機能する方法を根本的に再定義する可能性があり、またはモデルを再トレーニングする必要があります。
それでも、欧州では、一般データ保護規則(GDPR)の第17条が、企業がユーザーのデータを削除することを要求しています。この法律は、データの削除がデータベースの「ドロップ」クエリーよりも簡単であると想定して作成されました。将来、人工知能法案がGDPRの精神を人工知能システムへの適用を目的とした法律にコピーすることになります。
世界中で、個人がマシンラーニングシステムから自分のデータを削除する権利を要求する法律が検討されています。2018年のカリフォルニア州消費者プライバシー法(CCPA)は、すでに州住民にこの権利を提供しています。
なぜ重要か
データセットが実行可能なマシンラーニングモデルにトレーニングされると、データの特性は抽象化され、一般化されます。モデルはデータから原則や広範な傾向を推論するように設計されており、最終的に特定の非一般化されたデータを分析するのに役立つアルゴリズムを生成します。
しかし、モデルインバージョンなどの技術は、最終的な抽象化されたアルゴリズムの下にあるデータを再識別する可能性を明らかにしました。また、メンバーシップ推論攻撃は、匿名性の約束でしか含められなかった機密データを含むソースデータを暴露することもできます。
マシンラーニングモデルにアムネジアを誘発する
したがって、コーヒーから砂糖を取り除くという課題に直面しています。最近の研究者にとって、これは頭痛の種でした。2021年、EUが支援する論文「A Comparative Study on the Privacy Risks of Face Recognition Libraries」は、人気の顔認識アルゴリズムが再識別攻撃で性別や人種に基づく差別を可能にすることができることを発見しました。2015年、コロンビア大学の研究者は、データ内の合計を更新することで「マシンアンラーニング」方法を提案しました。2019年、スタンフォード大学の研究者は、K-meansクラスタリングの実装のための新しい削除アルゴリズムを提供しました。
現在、中国と米国の研究コンソーシアムは、新しい「忘却」方法を導入する論文を発表しました。この方法は、90%以上の忘却率を達成し、モデルの全体的なパフォーマンスに5%の精度の低下しか発生しません。
論文のタイトルは「Learn to Forget: Machine Unlearning via Neuron Masking」で、中国とバークレーの研究者が参加しています。
ニューロンマスキングは、モデルの特定のデータを削除するためのフィルタとして機能し、モデルの再トレーニングを必要としません。
生物学的起源
研究者は、このアプローチが「アクティブな忘却」の生物学的プロセスから着想を得たと述べています。このプロセスでは、特定の記憶のエングラム細胞を消去するために、ドパミンの特殊なタイプを操作します。
フォーサケンは、このプロセスを模倣するマスクグラディエントを継続的に生成し、非対象データのカタストロフィックな忘却を避けるために、このプロセスを遅くしたり停止したりするための安全装置を備えています。
影響の制限
寄与データの削除は、機械学習アルゴリズムの機能に悪影響を及ぼす可能性があります。研究者は、過剰なトレーニングを避けるために通常使用されるノルム正則化を利用して、この問題を解決しました。
研究者は、データの分散を確立するために、実際のデータセットに含まれない「外側の」データ(OOD)を使用しました。
データセットでのテスト
この方法は、8つの標準データセットでテストされ、再トレーニングと比較して高い忘却率とほとんどの精度の低下が見られませんでした。
モデルはすでに抽象化されたデータの特性を抽出し、アルゴリズムを生成しています。したがって、データを完全に削除するには、モデルの重みをゼロから再トレーニングする必要があります。












