Andersonの視点

LLMデータ漏洩からプロンプトを保護する

mm
Unite.AI を Google の優先ソースに追加
ChatGPT-4o: 'Orthographic 1792x1024 view of a SIMs-like police officer holding up his hand to a citizen to stop them going any further'

意見 IBM NeurIPS 2024の提出は、ユーザーがLarge Language Model (LLM) such as ChatGPTと会話をしている時に、個人情報や機密情報をメッセージに提出することを自動的に介入して防ぐシステムを提案しています。

ユーザーがプロンプト介入サービスとどのようにやり取りするかを調べるために使用されたモックアップの例。ソース:https://arxiv.org/pdf/2502.18509

ユーザーがプロンプト介入サービスとどのようにやり取りするかを調べるために使用されたモックアップの例。ソース:https://arxiv.org/pdf/2502.18509

上記のモックアップは、IBMの研究者が、ユーザーがこのような「介入」に抵抗する可能性をテストするために使用しました。

GUIの実装については詳細が少ないですが、ブラウザープラグインやローカルの「ファイアウォール」LLMフレームワークと通信する機能を組み込むことができます。あるいは、OpenAI APIに直接接続できるアプリケーションを作成し、OpenAIのスタンドアロンプログラムを再現することができますが、追加のセキュリティ対策が必要です。

ChatGPT自身は、重要な情報を含むと認識されるプロンプトへの応答を自動的にセルフセンスします。たとえば、銀行の詳細:

ChatGPTは、認識された重要なセキュリティ情報を含むプロンプトに応答しません。上記のプロンプトの詳細は架空のものです。

ChatGPTは、認識された重要なセキュリティ情報を含むプロンプトに応答しません。上記のプロンプトの詳細は架空のものです。

しかし、ChatGPTは、個人情報に対してはより寛容です。たとえば、仕事や開示に関連する理由で、ユーザーの利益にならない情報を公開する場合:

上記の例は架空のものですが、ChatGPTは、潜在的な評判や収入リスクを伴う機密情報について会話を始めることを躊躇しません。

上記の例は架空のものですが、ChatGPTは、潜在的な評判や収入リスクを伴う機密情報について会話を始めることを躊躇しません。

上記の場合、代わりに次のように書く方がよかったでしょう: 「白血病の診断が人の書く能力や移動性に与える影響は何ですか?」

IBMプロジェクトは、ユーザーのリクエストを「個人的」から「一般的」な立場に再解釈します。

IBMシステムのスキーマ。このシステムは、ローカルのLLMまたはNLPベースのヒューリスティックを使用して、潜在的なプロンプトの機密情報を識別します。

IBMシステムのスキーマ。このシステムは、ローカルのLLMまたはNLPベースのヒューリスティックを使用して、潜在的なプロンプトの機密情報を識別します。

これは、オンラインLLMによって収集されたデータが、将来的に後続のモデルや広告フレームワークに流れ込むことはないと仮定しています。ただし、現在はそのようなシステムや構成は存在しませんが、インターネットの採用初期の1990年代には、そのような機能も利用できませんでした。以来、クロスドメイン情報共有によるパーソナライズされた広告は、様々なスキャンダルパラノイアを引き起こしています。

したがって、歴史は、LLMプロンプト入力を今サニタイズする方がよいことを示唆しています。そうしないと、データが大量に蓄積し、LLMベースの提出が永久的なサイクルデータベースやモデル、またはその他の情報ベースの構造やスキーマに終わる可能性があります。

私を覚えて

「汎用」またはサニタイズされたLLMプロンプトを使用することに対する一つの要因は、正直に言って、ChatGPTのような高価なAPI専用LLMをカスタマイズする機能は、現在の技術の状態ではかなり魅力的です。しかし、これには、長期的にプライベート情報を公開するリスクがあります。

私は頻繁に、Windows PowerShellスクリプトやBATファイルの自動化や技術的な問題についてChatGPTに助言を求めます。そのため、ChatGPTが私のハードウェア、技術的なスキル、環境要因やカスタムルールについての詳細を永続的に記憶することを役に立ちます:

ChatGPTは、ユーザーが将来のプロンプトへの応答を考慮する際に適用される「キャッシュ」のメモリを開発することを許可します。

ChatGPTは、ユーザーが将来のプロンプトへの応答を考慮する際に適用される「キャッシュ」のメモリを開発することを許可します。

これは、情報をOpenAI(または他の主要LLMプロバイダー)の外部サーバーに保存することを意味します。ただし、OpenAIが設定した条件を尊重することを保証することはできません。

一般的に、ChatGPTでメモリのキャッシュを構築する能力は、LLMの限られた注意ウィンドウのため最も役に立ちます。長期的な(パーソナライズされた)埋め込みがないと、ユーザーは、anterograde amnesiaを患っているようなエンティティと会話をしているように感じます。

一時的な健忘

ChatGPTの会話を「一時的な」ものにすることはできますが、会話の履歴を参照できるようにしておくことは役に立ちます。そうすれば、時間が許せば、よりまとまったローカルレコードに凝縮できます。ただし、OpenAIは一時的な会話はトレーニングに使用されないと述べていますが、破棄されることはないと述べていません。ChatGPTのインフラストラクチャでは、一時的な会話は履歴に表示されません。

最近の論争は、OpenAIのようなAPIベースのプロバイダーがユーザーのプライバシーを保護する責任を負うべきではないことを示唆しています。たとえば、emergent memorizationの発見は、より大きなLLMがトレーニングデータの一部を完全に記憶する可能性が高く、ユーザー固有のデータの漏洩リスクが増大することを示しています。

異なる思考

LLMのユーティリティとリスクの間の緊張は、創造的な解決策を必要とします。IBMの提案は、この分野で興味深い基本的なテンプレートのようです。

ユーティリティとデータプライバシーをバランスさせたIBMベースの3つの改訂。最下部(ピンク)のバンドでは、システムが有意義な方法でサニタイズできないプロンプトが表示されます。

ユーティリティとデータプライバシーをバランスさせたIBMベースの3つの改訂。最下部(ピンク)のバンドでは、システムが有意義な方法でサニタイズできないプロンプトが表示されます。

IBMのアプローチは、LLMへの送信前に、ネットワークレベルで出力パケットを傍受して必要に応じて書き直します。記事の冒頭に表示されるより複雑なGUI統合は、将来的にこのアプローチがどこへ行くかを示唆するものに過ぎません。

プロンプトとしてのセキュリティリスク

「プロンプト介入」の概念は、Windows OSのセキュリティに似ています。Windows OSのセキュリティは、1990年代のオプションの商用製品のパッチワークから、Windowsインストールに標準で付属する、非オプションの厳格なネットワーク防御ツールのスイートに進化しました。

プロンプトのサニタイズがネットワークファイアウォールと同様に進化する場合、IBMの提案は、将来のブループリントとなる可能性があります。ユーザーのマシンに完全にローカルのLLMを展開して、LLM APIへの出力プロンプトをフィルタリングします。このシステムは、GUIフレームワークや通知と統合する必要があり、ユーザーにコントロールを提供します。ただし、管理ポリシーによっては、ビジネス環境ではオーバーライドされる可能性があります。

研究者は、ShareGPTのオープンソースバージョンの分析を実施して、リアルワールドシナリオでコンテキストプライバシーがどれほど侵害されるかを理解しました。

Llama-3.1-405B-Instructは、コンテキストの整合性の侵害を検出する「ジャッジモデル」として使用されました。会話のサブセットは、長さに基づいて分析され、ジャッジモデルはコンテキスト、機密情報、タスクの必要性を評価して、潜在的なコンテキストの整合性の侵害を特定しました。

これらの会話のサブセットは、明確なコンテキストプライバシーの侵害を示し、さらに分析されました。

フレームワークは、Ollamaを介してローカルに展開できるように、ChatGPTなどの典型的なチャットエージェントよりも小さいモデルを使用して実装されました。

プロンプト介入システムのスキーマ。

プロンプト介入システムのスキーマ。

評価されたLLMは、Mixtral-8x7B-Instruct-v0.1Llama-3.1-8B-InstructDeepSeek-R1-Distill-Llama-8Bでした。

ユーザープロンプトは、フレームワークによって3つのステージで処理されます: コンテキストの特定機密情報の分類改訂

機密情報の分類には2つのアプローチが実装されました: ダイナミック構造化。ダイナミック分類は、特定の会話内での使用に基づいて重要な詳細を決定します。構造化分類では、常に非必須と見なされる機密属性の事前定義済みリストを指定できます。モデルは、非必須の機密情報を検出した場合、プロンプトを改訂して、プライバシーリスクを最小限に抑えながら有用性を維持します。

自宅のルール

構造化分類は、Private Promptsイニシアチブの「プライベートデータ定義」方法に似ています。これは、プロンプトを書き直すスタンドアロン프ログラムを提供しますが、IBMのアプローチのようにネットワークレベルで介入する機能はありません。

Private Promptsの実行可能ファイルは、ユーザー入力テキストの代替の置換を指定できます。

Private Promptsの実行可能ファイルは、ユーザー入力テキストの代替の置換を指定できます。

上記の画像では、Private Promptsのユーザーが機密情報の自動置換をプログラムできることがわかります。Private PromptsとIBMの方法では、リストを適切に設定できるユーザーは、実際にはこの製品を必要としない可能性がありますが、インシデントが発生するにつれてリストを構築することはできます。

ChatGPTの意見

ChatGPTは最近、有料ユーザー向けのディープリサーチツールを発表しました。そこで、ChatGPTにIBMの提案に関する関連文献をレビューして、批判的な意見を求めました。ChatGPTは、いつも以上に防御的で軽蔑的な応答を示しました。

ChatGPT-4oは、IBMプロジェクトに対して低い評価をしています。

ChatGPT-4oは、IBMプロジェクトに対して低い評価をしています。

「ユーザーがOpenAI、Google 、またはAnthropicにデータを責任を持って扱うことを信頼しない場合、」ChatGPTは述べています。「なぜ第三者のソフトウェアレイヤーを信頼するのでしょうか? そのレイヤーは、LLMに到達する前にデータをログ、誤って扱う、または漏洩させる可能性のある新しい障害となります。新しいエンティティがユーザーデータを搾取することを許可するだけです。」

この反対意見は、自己利益を優先しているように見えますが、オープンソースプロジェクトの歴史や、コミュニティの開発者や貢献者の長期的な努力によって、ユーザーに利益をもたらすプロジェクトの可能性を無視しています。

次に、ChatGPTは、商用LLMにアクセスするためにローカルで軽量LLMを使用するというIBMの提案のポイントを間違えています:

「プライバシーフィルタリングを効果的に行うには、入力を理解する必要があります。機密データ(名前、住所、金融情報)を認識することができれば、入力を分析してフィルタリングする必要があります。つまり、消去すべきものを処理または分析する必要があります。」

「パラドックスが生じます: a)基本的なフィルタ(正規表現置換)は、繊細なプライバシーリスクを逃し、効果がないでしょう。b)スマートフィルタ(LLM駆動の改訂)は、入力を完全に処理する必要があり、元のLLMと同じくらい危険です。」

「あなたが入力と改訂を読むのに十分な信頼を寄せている場合、LLM自体を信頼する理由は何ですか?」

この最後の質問に対する答えは、ローカルLLMはユーザー側で完全に動作し、オープンソースであるため、ネットワークアクセスは必要最小限度であるということです。同等の商用バージョンは、将来的に企業の変化やサービス条件の変更に脆弱になる可能性がありますが、適切なオープンソースライセンスであれば、このような「汚染」を防ぐことができます。

ChatGPTはさらに、IBMの提案は「ユーザーの意図を壊す」と主張しました。プロンプトを代替のものに書き換える可能性があるからです。しかし、これはプロンプトのサニタイズのより広範な問題であり、IBMの提案に特有のものではありません。

ChatGPTは、IBMの方法は、警告や編集方法をチャットに実装する「ユーザーのフリクション」により、採用の障壁になるだろうと結論付けています。

ここで、ChatGPTは正しいかもしれません。しかし、将来的に、さらなる公共のインシデントや、規制による地理的な区域での利益の減少によって、消費者テクノロジーの歴史は、ガードがもはやオプションではなくなっていることを示唆しています。

結論

OpenAIは、IBMの提案のようなセキュリティ対策を実装することは現実的ではありません。少なくとも、世界的に実施することはできません。

確かに、AppleはiPhoneの特定の機能をヨーロッパでブロックし、LinkedInはユーザーデータの搾取に関する異なるルールを各国で採用しているように、AI企業は、各国で最も利益の高い条件と規約を採用するでしょう。ただし、ユーザーのデータプライバシー権は、必要に応じて犠牲になります。

初版:2025年2月27日木曜日

2025年2月27日木曜日15:47:11にアップデートされました。Apple関連のリンクが間違っていたため – MA

機械学習のライターであり、ヒューマンイメージ合成のドメインスペシャリスト。Metaphysic.aiでの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合に伴い退任。
ポートフォリオサイト:martinanderson.ai
コンタクト:[email protected]