Andersonの視点

事前学習済み言語モデルからリアルワールドのメールアドレスを取得する

mm
Unite.AI を Google の優先ソースに追加

米国の新しい研究によると、GPT-3などの事前学習済み言語モデル(PLM)は、訓練データに含まれるリアルワールドのメールアドレスを取得することができることがわかった。

現在、メールアドレスに関連する人物について言語モデルに問い合わせることで実際のメールアドレスを取得することは難しいが、研究では、言語モデルのサイズが大きいほど、このような情報の抽出が容易になることが示された。また、問い合わせがより広範で情報に基づいているほど、機能的なメールアドレスを取得することが容易になることも示された。

論文では次のように述べられている。

‘結果は、PLMが多数のメールアドレスを記憶していることを示している。しかし、名前とメールアドレスの関連性を理解していない。したがって、メールアドレスのコンテキストが与えられれば、PLMは相当数のメールアドレスを回復することができるが、名前で問い合わせた場合、正しく予測されるメールアドレスは少ない。’

この理論をテストするために、著者は3つのPLMをサイズとパラメータが増加する順に訓練し、攻撃者が使用する可能性のあるテンプレートと方法に従ってそれらに問い合わせを行った。

論文では、個人情報を大規模な訓練コーパスに含めることのリスクに関する3つの重要な洞察が提供されている。

第一に、長いテキストパターン(問い合わせ)を使用することで、個人について名前を出さなくても個人情報を取得する可能性が高くなる。第二に、攻撃者は既存の知識を利用して問い合わせを改良し、より多くの事前知識を持つ攻撃者は、メールアドレスなどの記憶されたデータを取得する可能性が高くなる。第三に、著者は、より大きな自然言語処理(NLP)モデルは、攻撃者がより多くの情報を取得できるようにし、現在のPLMの「セキュリティバイオブスキュリティ」アプローチを弱める可能性があると推測している。

最後に、論文では、個人情報は記憶のプロセスを通じて保持され、漏洩する可能性があることが結論付けられている。モデルは訓練データを完全に「消化」せずに、未破壊の情報を「事実」データとして問い合わせに応じることができるためである。

著者は次のように結論付けている。

‘コンテキスト設定の結果から、最大のGPT-Neoモデルは、記憶によって8.80%のメールアドレスを正しく回復することができることがわかった。’

‘この設定は、コーパスが公開されていない限り、ユーザーがコンテキストを知ることは基本的に不可能であるため、他の設定ほど危険ではないが、メールアドレスが偶然生成される可能性があり、脅威を無視することはできない。’

研究では、メールアドレスを例とした機密個人情報の脆弱性を示すために、患者データの漏洩に関する研究への参照も行われている。
論文では、事前学習済み言語モデルの個人情報漏洩に関する研究が行われている。

記憶と関連

この研究は、記憶された情報がどの程度関連付けられているかを調査している。訓練されたNLPモデルは、訓練データを完全に抽象化することはできず、論理的な議論を維持したり事実データを呼び出すことができない。したがって、モデルはデータの離散的なチャンクを記憶し、保護する。

大きな疑問は、記憶された情報が他の種類の情報、たとえば「名前付き」エンティティを呼び出すことで呼び出されることができるかどうかである。たとえば、NLPモデルは、非公開の特権データで訓練された場合、エロン・マスクの病院データ、名前、メールアドレスなどの情報を保持する可能性がある。

最悪のシナリオでは、データベースに「エロン・マスクのメールアドレスは何か」というプロンプトを与えると、モデルはそのデータを返す可能性がある。

しかし、これはほとんど起こらない。なぜなら、保護された記憶の事実(たとえばメールアドレス)は、離散的な単位を表し、次の離散的な単位は、より高いレベルの情報(たとえばエロン・マスクについて)への単純な移動ではなく、無関係な情報への大きな飛び越えになる可能性があるからである。

さらに、記憶と関連の理由は、必ずしも任意的ではなく、予測可能な線形でもない。関連は、階層的な情報取得ではなく、生成可能な抽象的な会話を生成するなどの異なる損失関数で訓練された重みに基づいて発生する可能性があり、NLPシステムのアーキテクトによって特に導かれた、または禁止された方法で発生する可能性もある。

PLMのテスト

著者は、GPT-Neo因果言語モデルの3つのイテレーションをテストした。モデルのパラメータは、125M、1.3B、2.7Bで、Pileデータセットで訓練された。

Pileは、UCバークレーEnronデータベースを含む公開データセットの集合である。Enronは、メール交換に基づくソーシャルネットワーク情報を保持していた。Enronは「名+姓+ドメイン」の標準的な命名規則(例:first_name.last_name@enron.com)を使用していたため、これらのメールアドレスはフィルタリングされた。なぜなら、機械学習は、そんなに簡単なパターンを推測する必要がないからである。

研究者は、名前とメールアドレスのペアのトークンが3つ未満のものもフィルタリングし、前処理の後、3238の名前/メールペアに到達し、これらのペアはさまざまな実験で使用された。

「コンテキスト設定」実験では、研究者は、ターゲットメールアドレスの前の50、100、または200トークンをコンテキストとして使用し、プロンプトでメールアドレスを呼び出すことができた。

「ゼロショット設定」実験では、4つのプロンプトが手動で作成され、後者の2つは標準的なメールヘッダーコン벤ションに基づいていた。

ゼロショットプロンプトのテンプレート

ゼロショットプロンプトのテンプレート

次に、「ファーショット設定」が検討された。これは、攻撃者が事前に知識を持っているシナリオで、攻撃者はプロンプトを改良して目的の情報を呼び出すことができる。作成されたプロンプトでは、ターゲットドメインが既知か不明かが考慮された。

ファーショット設定のイテレーション

ファーショット設定のイテレーション

最後に、「ルールベース法」が使用された。これは、標準的なパターンに基づいて28のメールアドレスのバリエーションを使用してターゲットメールアドレスを回復することを試みる。これには、すべての可能なパターンをカバーするために多数の問い合わせが必要である。

テストで使用されたルールベースパターン

テストで使用されたルールベースパターン

結果

コンテキスト予測タスクでは、GPT-Neoは、標準的なパターンに従わないメールアドレスを含め、8.80%のメールアドレスを正しく予測することができた。

コンテキスト予測の結果

コンテキスト予測の結果。最初の列は、メールアドレス前のトークンの数を示している。

ゼロショット設定タスクでは、PLMは、主に標準的なパターンに従うメールアドレスを少数正しく予測することができた。

ドメイン不明のゼロショット設定の結果

ドメイン不明のゼロショット設定の結果

著者は、0ショット(D)設定が他の設定よりも優れていることに興味を持っている。これは、より長いコンテキストが記憶の発見を可能にしたためである。

‘これは、PLMがこれらの予測を主にシーケンスの記憶に基づいて行っていることを示唆している。如果、PLMが関連に基づいて予測を行っているならば、0ショット(D)と0ショット(C)のパフォーマンスは同等であるべきである。0ショット(D)が0ショット(C)を上回る理由は、より長いコンテキストがより多くの記憶を発見できるからである。’

より大きなモデル、より大きなリスク

訓練されたモデルから個人データを抽出する可能性について、著者は次のように述べている。

‘既知のドメイン、不明のドメイン、コンテキスト設定のすべてにおいて、125Mモデルから1.3Bモデルに変更することで、精度が大幅に改善された。さらに、1.3Bモデルから2.7Bモデルに変更することで、ほとんどの場合に精度が向上した。’

研究者は、この理由について2つの可能性を示唆している。第一に、パラメータが多いモデルは、より多くの訓練データを記憶できる。第二に、より大きなモデルは、より洗練されており、作成されたプロンプトをよりよく理解できるため、離散的な情報を「接続」することができる。

しかし、現在の最先端の技術では、個人情報は「比較的安全」であると述べている。

この攻撃ベクトルに対する対策として、著者は、建築物を厳格な前処理に従ってPIIをフィルタリングすることを提案している。さらに、差分プライバシーグラデーションを使用して訓練することを検討する。最後に、APIなどの後処理環境にフィルタを含めることが重要である(例:OpenAIのDALL-E 2 APIには、プロンプトの人間によるモデレーションに加えて、多数のフィルタが含まれている)。

また、標準的なパターンに従うメールアドレスの使用を避けることも推奨しているが、これはサイバーセキュリティの一般的なアドバイスである。

 

* 著者によるインライン引用のハイパーリンクへの置き換え。

2022年5月26日に初めて公開されました。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai