AIモデルとプラットフォーム
制御された忘却:AIの記憶の次の大きな課題

これまで、AIの分野は一つの目標に焦点を当てていた:システムをよりよく記憶させること。巨大なデータセットでモデルを訓練し、情報を保持して呼び出す能力を着実に改善してきた。しかし、現在、不快な現実を認識しなければならない。忘れることができないシステムは、自身の記憶に囚われている。強みと思われたものが、深刻な弱点になっている。
人間は自然に忘れる。情報を放棄し、適応し、前進する。AIシステムは異なる。忘れることを教えなければ、すべてを記憶する。実際の問題が生じる。AIは、プライバシー侵害、古い情報、埋め込まれた偏見、学習新しいタスクでシステムが壊れるという問題に苦労している。忘れることを教えることが、次の課題である。AIに賢く、選択的に、賢明に忘れることを教える必要がある。
忘却の二つの顔
AIにおける忘却は、2つの異なる形で現れる。各々が独自の問題を持つ。
最初は、カタストロフィック・フォーゲッティングである。これは、ニューラルネットワークが新しいタスクで訓練された後、以前学習した知識を失うことである。例えば、猫と犬を識別するように訓練されたモデルが、鳥を識別することを学習した後、猫と犬を識別する能力を失うことがある。
2番目の形は、制御された忘却である。これは、故意に情報をモデルから削除することである。プライバシー法規制であるGDPRは、個人に「忘れられる権利」を与え、会社はデータを消去することを要求する。これは、壊れたシステムを修復することではなく、故意にデータを削除することである。
これら2つの問題は、反対方向に引っ張る。1つは忘れることを止めることを要求する。もう1つは忘れることを可能にすることを要求する。同時に両方を管理することは、AIの最も難しい課題の1つである。
記憶が負債になる時
AIの研究は、記憶を改善することに長年焦点を当てていた。モデルは大きくなり、データセットは大きくなり、コンテキストウィンドウは長くなった。GPT-4oのようなシステムは、128,000トークンのコンテキストを扱うことができ、Claudeは200,000まで達する。這らの進歩はパフォーマンスを改善したが、新しい問題ももたらした。
モデルがあまりにも多くを記憶する場合、古いまたは無関係な情報を呼び出すことができる。これは計算を浪費し、ユーザーを混乱させることがある。例えば、会社のナレッジベースで訓練されたカスタマーサポートチャットボットを考えてみよう。ポリシーを更新した後、チャットボットは古い情報に戻ってしまう。これは、AIが記憶を適切に優先順位付けできないためである。AIは、現在の情報と古い情報を区別できない。
プライバシー法規制は、状況をより困難にする。GDPRでは、ユーザーがデータを削除することを要求した場合、会社はデータを削除する必要がある。しかし、AIモデルからデータを削除することは、コンピューターからファイルを削除するのと同じではない。モデル内のパラメータに個人データが含まれると、ネットワーク内の数百万の接続にわたって広がる。システム全体を再訓練してデータを削除することは、高価で、多くの場合不可能である。研究によると、大規模なモデルはサイバー攻撃に対してより脆弱である。モデルが大きくなるにつれて、記憶することが多くなり、慎重に作成されたプロンプトで個人データを再生することができる。攻撃者は、許可されていない情報を抽出することができる。
忘却が難しい理由
AIモデルは、ファイルをフォルダーに保存するのと同じように、訓練データを保存しない。訓練情報を圧縮し、モデル内の重みと活性化に混合する。1つのデータを他のすべてを混乱させずに削除することは非常に難しい。また、特定の訓練データがモデルの内部重みに与える影響を簡単に追跡することはできない。モデルがデータから学習した知識は、モデルのパラメータを通じて広がり、追跡することが難しい。
削除要求ごとにモデルを最初から再訓練することは実行可能ではない。GDPRに基づいて個人データを消去する必要がある場合、AIシステムからデータを削除する必要がある。しかし、各削除要求ごとにモデルを再訓練することは、ほとんどの生産環境では高価で遅い。数十億のデータポイントで訓練された大規模な言語モデルでは、このアプローチは禁止的に高価で時間がかかることになる。
忘却の検証も別の課題である。どのようにしてデータが実際に忘れられたことを証明することができるか。会社は、外部の監査を受けて情報を消去したことを示す必要がある。信頼できる検証方法がない場合、企業はコンプライアンスを証明できず、ユーザーはデータが真正に消去されたことを信頼できない。
これらの課題により、マシン・アンラーニングという新しい分野が生まれた。これは、特定のデータの影響を訓練済みモデルから除去する技術に焦点を当てている。しかし、これらの方法はまだ初期段階である。正確なアンラーニングには、モデルを再訓練する必要があり、近似方法では削除された情報の痕跡が残る可能性がある。
安定性・可塑性のジレンマ
私たちが解決しなければならない核心的な課題は、カタストロフィック・フォーゲッティングを防ぎながら、制御された忘却を可能にすることである。これにより、AIが直面している重要な課題に到達する:安定性・可塑性のジレンマである。モデルは、新しい情報を学習するのに十分な柔軟性を持つ必要があるが、古い知識を保持するのに十分な安定性も必要である。モデルを安定性の方向に押しすぎると、適応できない。反対に、柔軟性の方向に押しすぎると、すべてを忘れることがある。
人間の記憶は、このジレンマを解決するための有用なヒントを提供する。神経科学は、忘却は欠陥ではなく、能動的なプロセスであることを示唆している。脳は、古いまたは低価値の情報を除去または抑制することで、新しい記憶をよりアクセスしやすくする。新しい言語を学ぶとき、古い言語を消去するのではなく、使用を停止すると、呼び出すことがより難しくなる。情報はまだ存在するが、優先順位が低い。脳は、削除ではなく、選択的な抑制を使用する。
AIの研究者は、同様のアイデアを採用し始めている。生成的なリプレイ技術は、脳が記憶を保存する方法を模倣する。過去の知識の抽象的な表現を生成し、生のデータを保存するのではなく、カタストロフィック・フォーゲッティングを軽減し、記憶をコンパクトに保つ。もう1つの有望なアイデアは、知能的な減衰である。保存された記憶は、最近性、関連性、有用性によってスコア付けされる。重要性の低い記憶は、優先順位を失い、必要な場合にのみ呼び出される。情報は利用可能だが、必要な場合にのみ表示される。AIシステムは、潜在的に有用な情報を捨てることなく、大規模な知識ベースを管理できる。
目標は、消去することではなく、記憶と忘却を賢くバランスさせることである。
未来の姿
業界は、3つの主要な方向に進んでいる。
最初に、ハイブリッド・メモリ・アーキテクチャが登場している。これらのシステムは、エピソード記憶(特定の経験)とセマンティック記憶(一般的な知識)を組み合わせる。ランキングとプルーニングのメカニズムを使用して、重要な情報を保持し、関連性の低いものをフェードアウトさせる。ベクターデータベースであるPineconeやWeaviateは、メモリを効率的に管理および取得するのに役立つ。
2番目に、プライバシーを強化するテクノロジーが普及している。フェデレーテッド・ラーニング、差分プライバシー、ホモモルフィック・エンクリプションなどの技術は、機密性の高い個人データの必要性を減らす。これらの方法により、モデルはコラボレーション的に訓練されたり、機密性の高いユーザー情報を収集せずに訓練されたりする。忘却を直接解決するものではないが、後に忘れる必要がある個人データの量を減らす。
3番目に、マシン・アンラーニングが改善している。新しい方法により、特定のデータに関連するモデルのパラメータを、完全な再訓練なしで調整できる。これらのアプローチは初期段階にあるが、データ削除要件のコンプライアンスに向けて進んでいる。ただし、アンラーニングが真正にデータのすべての痕跡を除去することを検証することは、依然として困難である。研究者は、アンラーニングの効果を測定するためのテストを開発中である。
結論
AIシステムは、記憶することにおいて優れている。しかし、忘れることにおいては未だ貧弱である。このギャップは、無視することができない。AIがより強力になり、規制がより厳しくなるにつれて、賢く忘れる能力は、記憶する能力と同等の重要性を持つことになる。AIをより安全で、より適応性があり、よりプライバシーに配慮したものにするために、賢く、選択的に、賢明に忘れることを教える必要がある。制御された忘却は、データのプライバシーを保護するだけでなく、AIシステムが自身の記憶の囚われから解放されるのを助けるだろう。












