ソートリーダー

ジェネレーティブAIによるプライバシーリスクに対する明確な解決策はあるか?

mm
Unite.AI を Google の優先ソースに追加

ジェネレーティブAIによるプライバシーリスクは非常にリアルです。監視の増加やフィッシングやヴィッシングキャンペーンの効果的な実行など、ジェネレーティブAIは大量のプライバシーデータを収集し、悪意のある者に個人やグループを標的にするためのツールを提供しています。

この問題に対する最も明確な解決策は、消費者やユーザーがAIのハYPEから離れ、開発者や実装者から透明性を要求し、政府機関から有効な規制を要求することです。ただし、これはすぐに起こる可能性は低いです。

ジェネレーティブAIのプライバシーリスクを軽減するための妥当なアプローチが残ります。長期的には、ユーザーがデータプライバシーについてより教育を受けるにつれて、ジェネレーティブAIの大量採用によるプライバシーリスクが軽減される可能性があります。

ジェネレーティブAIの概念をみんなが正しく理解しているか?

AIのハYPEは非常に普遍的であるため、ジェネレーティブAIの概念について調査する必要はありません。もちろん、これらの「AI」機能、機能、製品は、真の意味での人工知能を表すものではありません。むしろ、マシンラーニング(ML)、ディープラーニング(DL)、大規模言語モデル(LLM)などの例です。

ジェネレーティブAIは、名前の通り、新しいコンテンツを生成できます。テキスト(プログラミング言語を含む)、オーディオ(音楽や人間のような声)、ビデオ(音、ダイアログ、カット、カメラの変更)など、すべてが人間が生成したコンテンツ内のパターンを識別、照合、再現することで実現します。

ChatGPTを例に挙げてみましょう。多くのLLMと同様に、ChatGPTは3つの段階でトレーニングされています。

  • 事前トレーニング: この段階では、LLMはインターネット、書籍、学術雑誌など、テキストを含むすべての潜在的に関連性のあるまたは有用な情報源から「食事」を与えられます。
  • 教師あり指示の微調整: モデルは、高品質の指示と応答のペアを使用して、指示に応じてより一貫性のある応答を生成するようにトレーニングされます。これらのペアは通常、人間から提供されます。
  • 人間のフィードバックからの強化学習(RLHF): ChatGPTのようなLLMは、人間のユーザーとのやり取りを使用してモデルを人間のユーザーの使用例に合わせて改良する、追加のトレーニング段階を経ることがよくあります。

トレーニングのすべての段階では、データが関与します。事前トレーニングでは大量の事前収集されたデータ、RLHFではほぼリアルタイムで収集および処理されたデータが使用されます。ジェネレーティブAIに伴うプライバシーリスクのほとんどは、このデータに起因します。

ジェネレーティブAIがもたらすプライバシーリスクとは何か?

プライバシーは、個人情報が個人または団体の同意なしに他の人または団体に公開されたときに侵害されます。LLMは、個人情報を含む可能性のある非常に広範なデータで事前トレーニングおよび微調整されています。このデータは通常、公開されている情報源から収集されますが、常にそうであるとは限りません。

公開されている情報源からデータを取得したとしても、LLMのインターフェイスを介して検索可能になるようにデータを集約および処理することは、プライバシーのさらなる侵害と見なされる可能性があります。

人間のフィードバックからの強化学習(RLHF)段階では、実際の人間のユーザーとのやり取りが、LLMの応答を修正および改良するために使用されます。これは、ユーザーのLLMとのやり取りが、データへのアクセス権を持つ誰かによって表示、共有、配布される可能性があることを意味します。

ほとんどの場合、これはプライバシーの侵害ではありません。ジェネレーティブAIの開発者は、ユーザーがLLMとやり取りする前にプライバシーポリシーと利用規約に同意するように求めます。ここでのプライバシーリスクは、多くのユーザーがデータ収集と使用に同意したことを認識していないことです。したがって、これらのシステムとやり取りするときに、機密情報やデリケートな情報を公開する可能性があります。

このようにして、ジェネレーティブAIがプライバシーリスクをもたらす3つの主な方法に到達します。

  • 個人情報を含む可能性のある大量の事前トレーニングデータは、侵害や漏洩のリスクにさらされています。
  • 事前トレーニングデータに含まれる個人情報は、LLMの応答を介して同じLLMを使用する他のユーザーに漏洩する可能性があります。
  • LLMとやり取りする際に提供される個人情報や機密情報は、LLMの従業員やサードパーティの契約者に渡る可能性があり、そこから漏洩する可能性があります。

これらはすべてユーザーのプライバシーのリスクですが、個人情報が間違った手に渡る可能性はまだ比較的低いようです。ただし、データブローカーが登場すると、状況は変わります。これらの会社は、個人情報を嗅ぎ出して収集、集約、配布することを専門としています。

個人情報と他の個人データが商品となり、データブローカー業界がこの商品から利益を得るために現れたため、公開された個人データはデータブローカーによって拾われ、広範囲に拡散される可能性が非常に高いです。

ジェネレーティブAIのプライバシーリスクの背景

ジェネレーティブAIがユーザーのプライバシーに及ぼすリスクを、特定の製品、サービス、企業パートナーシップの文脈で検討する前に、ジェネレーティブAIの全面的なリスクを体系的に検討してみましょう。IAPPのMoraesとPrevitaliは、Soloveの2006年の「プライバシーの分類学」をデータ駆動型アプローチで洗練し、16のプライバシーリスクをAI固有の12のプライバシーリスクに減らしました。

MoraesとPrevitaliの改訂された分類学には、以下の12のプライバシーリスクが含まれています。

  • 監視: AIは、個人データの収集を拡大し、普遍化することで監視のリスクを悪化させます。
  • 身元確認: AI技術は、自動的な身元連携を可能にし、個人情報の漏洩のリスクを高めます。
  • 集約: AIは、個人に関するさまざまなデータを組み合わせて、プライバシーの侵害のリスクをもたらします。
  • フレノロジーとフィジオノミー: AIは、身体的特徴から個性や社会的属性を推測する、新しいリスクカテゴリです。
  • 二次的使用: AIは、個人データを当初の目的以外の目的で使用することを悪化させます。
  • 除外: AIは、ユーザーがデータの使用方法を制御できない不透明なデータ処理を悪化させます。
  • 不確実性: AIのデータ要件とストレージ慣行は、データ漏洩と不正アクセスのリスクをもたらします。
  • 暴露: AIは、機密情報を公開する、ジェネレーティブAI技術を使用して、機密情報を公開する可能性があります。
  • 歪曲: AIは、偽のコンテンツを生成する能力により、誤った情報の拡散を悪化させます。
  • 開示: AIは、生のデータから機密情報を推測することで、データの不適切な共有につながる可能性があります。
  • アクセス性の向上: AIは、機密情報を意図しない広範なオーディエンスに公開する可能性があります。
  • 侵入: AI技術は、監視対策を通じて、個人の空間や孤立を侵害する可能性があります。

これはかなり心配な読み物です。ただし、この分類学は、ジェネレーティブAIが妄想を起こす、つまり事実的に不正確な情報を生成して、自信を持って提示する傾向があることを考慮に入れています。この現象は、実際の情報を明らかにすることはほとんどないものの、間接的にプライバシーに影響を及ぼします。

実際のAI製品の文脈でこれらのプライバシーリスクがどのように発生するかを見てみましょう。

テキストベースのジェネレーティブAIシステムとの直接的なやり取り

最も単純なケースは、ユーザーがChatGPT、Midjourney、またはGeminiなどのジェネレーティブAIシステムと直接やり取りする場合です。ユーザーのこれらの製品とのやり取りは、ログに記録され、保存され、RLHF(人間のフィードバックからの強化学習)、教師あり指示の微調整、さらには他のLLMの事前トレーニングに使用されます。

これらのサービスの中には、プライバシーポリシーを分析すると、さまざまな目的でデータを共有することを可能にする、異なる種類のデータ共有活動が含まれていることがわかります。ジェネレーティブAIがもたらす別の種類のプライバシーリスクです。これらのシステムは、ユーザーが提供するデータと、システムとのやり取りを介して生成されるデータの両方を収集する、巨大なデータファンネルと見なすことができます。

組み込まれたジェネレーティブAIシステムとのやり取り

一部のユーザーは、製品に組み込まれたジェネレーティブAIインターフェイスとやり取りしている可能性があります。ユーザーは「AI」機能を使用していることを認識しているかもしれませんが、データプライバシーのリスクについてはあまり認識していない可能性があります。ここで浮き彫りになるのは、LLMに共有された個人データが開発者やデータブローカーに渡る可能性があるという事実に対する認識不足です。

ここには2つのレベルの認識不足があります。ユーザーはジェネレーティブAI製品とやり取りしていることを認識しているかもしれませんし、またはジェネレーティブAIが組み込まれた製品を使用していることを認識しているかもしれません。どちらの場合でも、ユーザーは技術的に組み込まれたシステムとのやり取りに同意したはずですが、おそらくはそのようなシステムとやり取りすることになります。

ユーザーをジェネレーティブAIシステムにさらす他のパートナーシップ

一部の企業は、ユーザーが気付かないうちに、ジェネレーティブAIインターフェイスをソフトウェアに組み込んだり、組み込んだりしています。幸いなことに、「AI」は売り文句として非常に効果的であるため、企業がそのような実装を秘密にしておく可能性は低いです。

この文脈では、データ除去サービスOpteryが最近、ユーザーデータをOpenAIと共有することを計画していたが、後に計画を撤回したという事例が挙げられます。顧客は、不満を表明しました。また、プライバシーガイドの推奨データ除去サービスリストからOpteryのサービスが削除されました。Opteryは決定を撤回したことは評価に値しますが、重要なのは、顧客の反発です。ユーザーは、データを「AI」企業と共有することのリスクを認識し始めています。

Opteryのケースは、ユーザーがデータをOpenAIと共有することに反対したため、ここで良い例となります。Opteryのユーザーは、データ除去サービスを使用するため、データプライバシーについて特に注意を払う傾向があります。Opteryのユーザーは、サービス提供条件やプライバシーポリシーの変更にも注意を払うでしょう。

ジェネレーティブAIのデータ使用に対する反発の証拠

プライバシーに配慮した消費者だけが、ジェネレーティブAIシステムやそれに関連するデータプライバシーリスクについて懸念を表明しているわけではありません。立法レベルでは、EUの人工知能法は、リスクを重大度に基づいて分類し、ほとんどの場合、データプライバシーが明示的または暗黙的な基準となります。この法律は、前述のインフォームドコンセントの問題にも対処しています。

米国は、連邦レベルの包括的なデータプライバシーレギュレーションを採用するのを不思議と遅くしているものの、大統領令14110により、ある程度のガイドラインが整っています。再び、データプライバシーの懸念が目的の前面にあります。「AIテクノロジーの無責任な使用は、詐欺、差別、偏見、デマなどの社会的害を悪化させる可能性があります」ということです。すべてが、個人データの可用性と拡散に関連しています。

消費者レベルに戻ると、特にプライバシーに配慮した消費者だけが、プライバシーの侵害を伴うジェネレーティブAIの実装に反対しているわけではありません。Microsoft (MSFT ) の「AIを搭載した」Recall機能は、Windows 11オペレーティングシステムのために計画されていましたが、プライバシーとセキュリティのリスクが明らかになると、後退しました。Microsoftはまだこのアイデアを諦めていないようですが、初期の一般の反応は心強いものです。

MicrosoftのCopilotプログラムは、データプライバシーとデータセキュリティの両方の問題で広く批判されています。CopilotはGitHubのデータでトレーニングされたため、プログラマーや開発者のソフトウェアライセンス契約の明らかな侵害も問題となりました。ジェネレーティブAIの文脈では、データプライバシーと知的財産権の境界が曖昧になることがあります。

おそらく、AIが消費者の目に赤信号になる最大の兆候は、Apple (AAPL ) が初めてAIを発表したときに、特にOpenAIとのデータ共有契約について、消極的または警戒的な反応を受けたことです。

部分的な解決策

立法者、開発者、企業は、ジェネレーティブAIがもたらす一部のリスクを軽減するための措置を講じることができます。これらは、ジェネレーティブAIのプライバシーリスクに対する部分的な解決策です。どれも十分ではありませんが、すべてが一緒に機能すれば、実際的な違いをもたらす可能性があります。

  • データ最小化: 収集および保存されるデータの量を最小限に抑えることは、妥当な目標ですが、ジェネレーティブAI開発者のトレーニングデータに対する欲求と直接対立しています。
  • 透明性: 現在のマシンラーニングの現状では、技術的に実現可能な場合でも、多くの場合実現可能ではありません。生成された出力の際にどのデータが処理され、どう処理されるかについての洞察は、ジェネレーティブAIとのやり取りにおけるプライバシーの確保方法の1つです。
  • 匿名化: データ最小化によって除外できないPIIは匿名化されるべきですが、多くの一般的な匿名化および仮名化テクニックは簡単に敗北します。
  • ユーザーの同意: データの収集と共有にユーザーが同意することを要求することは不可欠ですが、同意の乱用や消費者の怠慢さに直面して効果が低いです。ここで必要なのは、インフォームドコンセントです。正しく情報を得た消費者は、データ共有に同意しないだろうから、インセンティブは一致しません。
  • データの転送中および保存時のセキュリティ: データプライバシーとデータセキュリティの両方の基盤です。データを暗号化および保護することは常に改善できますが、ジェネレーティブAIシステムはインターフェイスを介してデータを漏洩させる傾向があります。
  • 「AI」の文脈における著作権および知的財産法の執行: これは、ジェネレーティブAIの出力に著作権または知的財産が含まれる場合、データプライバシーと知的財産権の両方の問題となります。MLは「ブラックボックス」で動作し、ジェネレーティブAIの出力にどの著作権または知的財産が含まれるかを追跡することは困難です。
  • 監査: これはもう1つの重要なガイドレール対策ですが、LLMとサポートするジェネレーティブAIシステムのブラックボックス性によって妨げられます。さらに、ほとんどのジェネレーティブAI製品はクローズドソースであるため、監査は開発者の都合によってのみ実行されます。

これらのアプローチはすべて有効で必要ですが、どれも十分ではありません。すべてに法的支援が必要です。つまり、ジェネレーティブAIの分野が進化し続けるにつれて、常に時代遅れになることになります。

明確な解決策

ジェネレーティブAIがもたらすプライバシーリスクに対する解決策は、革命的でも興奮するものでもありませんが、論理的に結論付ければ、結果は革命的かもしれません。明確な解決策は、日常の消費者が自分のデータの価値とデータプライバシーの無価値性を認識することです。

消費者は、プライベート情報を提供する源であり、プライベート情報が流れ込む流れです。消費者が大量にプライベートデータの流れを公共の場から遮断し始め、企業から説明責任を求め始めると、システムは自己修復するでしょう。

ジェネレーティブAIの良い点は、現在の広告やマーケティングモデルと違って、必ずしも個人情報を必要としないことです。事前トレーニングデータや微調整データには、個人情報や個人データを含める必要はありません。ユーザーは、ジェネレーティブAIシステムとやり取りするときに、同じ情報を公開する必要はありません。

トレーニングデータから個人情報を除去するには、ユーザーはデータブローカー(人検索サイトを含む)からプロファイルを削除することで、直接対策を講じることができます。これらの会社は、公開された記録を集め、オープンマーケットで流通させます。 個人データ除去サービスは、このプロセスを自動化し、迅速かつ簡単に実行します。当然、データブローカーのデータベースから個人データを除去することは、他の利点もありますが、欠点はありません。

ユーザーは、ソフトウェア(ジェネレーティブAIを含む)とやり取りするときに個人データを生成します。データの流れを止めるには、ユーザーは、インタラクションが記録され、レビューされ、分析され、共有されることが多いことを認識する必要があります。ユーザーの選択肢は、オンラインシステムに公開する内容を制限し、可能な限り、デバイス内でオープンソースのLLMを使用することです。一般的に、ユーザーはすでに、公共の場で話し合う内容を調整することをよく行っています。ジェネレーティブAIの分野にこれらの直感を拡張する必要があります。

David Balabanは、17年以上のマルウェア分析とアンチウイルスソフトウェア評価の経験を持つコンピュータセキュリティ研究者です。Davidは、MacSecurity.net Privacy-PC.comプロジェクトを運営しており、これらは社会工学、 マルウェア、ペネトレーションテスト、脅威インテリジェンス、オンラインプライバシー、ホワイトハットハッキングを含む現代の情報セキュリティ問題についての専門家の意見を提供しています。Davidは、マルウェアのトラブルシューティングの強い背景を持っており、最近はランサムウェア対策に焦点を当てています。