AIモデルとプラットフォーム

LLMからコピーライトされたデータを忘れる – それは可能か?

mm
Unite.AI を Google の優先ソースに追加

人工知能(AI)と機械学習(ML)の分野では、大規模言語モデル(LLM)は成果と課題を両方示しています。大量のテキストデータセットでトレーニングされたLLMモデルは、人間の言語と知識を包含しています。

しかし、人間の理解を吸収し、模倣する能力は、法的、倫理的、技術的な課題をもたらします。また、LLMを動かす巨大なデータセットには、有害なコンテンツ、コピーライトされたテキスト、不正確さ、または個人データが含まれている可能性があります。

選択されたデータをLLMから忘れることは、法的遵守と倫理的責任を確保するために、重要な問題となりました。

LLMがコピーライトされたデータを忘れるという概念を探ることで、基本的な質問に答えることができます: それは可能か?

LLMの忘却が必要な理由

LLMには、コピーライトされたデータを含む論争のあるデータが含まれています。LLMにそのようなデータを含めることは、プライベート情報、偏った情報、コピーライトデータ、および誤ったまたは有害な要素に関する法的課題をもたらします。

したがって、忘却は、LLMがプライバシー規制に従い、コピーライト法に準拠することを保証するために不可欠です。これにより、責任ある倫理的なLLMが促進されます。

コピーライト法と知的財産権に関するストック画像

しかし、LLMが取得した膨大な知識からコピーライトされたコンテンツを抽出することは課題です。ここでは、問題を解決するために役立つ忘却テクニックがいくつか紹介します:

  • データフィルタリング: この方法では、モデルがトレーニングデータからコピーライトされた要素、ノイズ、または偏ったデータを体系的に識別して除去します。ただし、フィルタリングにより、フィルタリングプロセス中に貴重なコピーライトされていない情報が失われる可能性があります。
  • グラディエント法: これらの方法では、損失関数のグラディエントに基づいてモデルのパラメーターを調整し、MLモデルのコピーライトされたデータの問題に対処します。ただし、調整により、非コピーライトされたデータでのモデルの全体的なパフォーマンスが悪影響を受ける可能性があります。
  • コンテキスト内忘却: このテクニックでは、モデルのパラメーターを更新して、特定のトレーニングポイントの影響を効率的に除去しますが、関連しない知識には影響しません。ただし、この方法では、特に大規模モデルにおいて、正確な忘却を達成することが困難であり、その有効性はさらに評価が必要です。

これらのテクニックはリソースを大量に消費し、時間がかかるため、実装が困難です。

事例研究

LLMの忘却の重要性を理解するために、これらの事例研究では、企業がLLMとコピーライトされたデータに関する法的課題に直面していることを強調しています。

OpenAI訴訟: OpenAIは、著名なAI企業であり、LLMのトレーニングデータに関する複数の訴訟に直面しています。これらの法的措置は、LLMのトレーニングでコピーライトされた素材を使用したことについて疑問を提起しています。また、モデルがトレーニングプロセスで統合された各コピーライトされた作品に対する許可を得るためのメカニズムに関する調査を引き起こしています。

サラ・シルバーマン訴訟: サラ・シルバーマン事件では、ChatGPTモデルが許可なく彼女の本の要約を生成したという主張が含まれています。この法的措置は、AIとコピーライトされたデータの将来に関する重要な問題を強調しています。

法的枠組みを技術の進歩と一致させることで、AIモデルの責任ある使用が保証されます。また、研究コミュニティは、これらの課題に対処して、LLMを倫理的で公平なものにする必要があります。

従来のLLM忘却テクニック

LLMの忘却は、複雑なレシピから特定の成分を分離するようなもので、最終的な料理に寄与するのは望ましい成分だけです。従来のLLM忘却テクニック、つまり、カーソルデータでファインチューニングと再トレーニングを行う方法には、コピーライトされたデータを除去するための明確なメカニズムが欠けています。

これらの従来の方法では、モデルのパラメーターを調整できますが、コピーライトされたコンテンツを正確にターゲットにするのに苦労し、意図しないデータ損失と最適でないコンプライアンスのリスクがあります。

従来の方法の限界と強力な解決策の必要性により、代替の忘却テクニックを実験する必要があります。

新しいテクニック: トレーニングデータのサブセットを忘れる

マイクロソフトの研究論文では、LLMのコピーライトされたデータを忘れるための画期的なテクニックが導入されています。Llama2-7bモデルとハリー・ポッターの本の例に焦点を当てて、LLMがハリー・ポッターの世界を忘れるための3つの重要なコンポーネントを紹介しています。これらのコンポーネントには、次のものが含まれます:

  • 強化モデル識別: 強化モデルを作成するには、忘却するコンテンツ(例:ハリー・ポッター)を強化するために、ターゲットデータでファインチューニングを行います。
  • 特有の表現の置き換え: ターゲットデータ内のハリー・ポッターの特有の表現を一般的なものに置き換え、より一般化された理解を促進します。
  • 代替予測によるファインチューニング: ベースラインモデルは、これらの代替予測に基づいてファインチューニングされ、関連するコンテキストに直面したときに、元のテキストを効果的に削除します。

マイクロソフトのテクニックは初期段階であり、限界があるかもしれませんが、より強力で倫理的で適応性の高いLLMを実現するための有望な進歩を表しています。

新しいテクニックの結果

マイクロソフトの研究論文で提示された、LLMがコピーライトされたデータを忘れるための革新的な方法は、責任ある倫理的なモデルへの一歩です。

新しいテクニックでは、コピーライトされた作品を含む「books3」データセットでトレーニングされたMetaのLlama2-7bモデルから、ハリー・ポッター関連のコンテンツを消去します。注目すべきは、モデルの元の応答が、一般的なプロンプトに対してJ.K.ローリングの宇宙を微妙に理解していることを示しています。

しかし、マイクロソフトの提案されたテクニックは、その応答を著しく変換しました。ここでは、元のLlama2-7bモデルとファインチューニングされたバージョンの間の顕著な違いを示すプロンプトの例があります。

ファインチューニングされたプロンプトの比較

画像ソース

この表は、ファインチューニングされた忘却モデルが、Hellaswag、Winogrande、piqa、boolq、arcなどのさまざまなベンチマークでパフォーマンスを維持していることを示しています。

新しいテクニックのベンチマーク評価

画像ソース

評価方法は、モデルプロンプトとその後の応答分析に依存しており、より繊細な、対抗的な情報抽出方法を見落とす可能性があります。

テクニックは有望ですが、特にLLM内でのより広範な忘却タスクに対処するために、洗練と拡張が必要です。

新しい忘却テクニックの課題

マイクロソフトの忘却テクニックは有望ですが、AIのコピーライト課題と制約がいくつかあります。

主な限界と改善が必要な領域は次のとおりです:

  • コピーライト情報の漏洩: この方法では、コピーライト情報の漏洩のリスクを完全に軽減できない可能性があります。モデルは、ファインチューニングプロセス中にターゲットコンテンツの知識を一部保持している可能性があります。
  • さまざまなデータセットの評価: 有効性を評価するために、テクニックはさまざまなデータセットで評価される必要があります。初期の実験は、ハリー・ポッターの本のみに焦点を当てています。
  • スケーラビリティ: 実世界のシナリオでの適用性と適応性を評価するために、大規模なデータセットとより複雑な言語モデルでテストすることが不可欠です。

AI関連の法的ケース、特にLLMを対象としたコピーライト訴訟の増加は、明確なガイドラインの必要性を強調しています。マイクロソフトが提案した忘却方法のような有望な進歩は、倫理的、法的、責任あるAIへの道を開いています。

AIとMLの最新ニュースや分析を逃さないでください – unite.aiを今すぐ訪問してください。

Haziqaは、AIおよびSaaS企業向けの技術コンテンツの作成における豊富な経験を持つデータサイエンティストです。