Andersonの視点
大規模言語モデルは、テストするためのデータセットを暗記している

あなたが映画、書籍、または商品の推薦にAIを頼っている場合、新しい研究によると、一部のシステムは、スキルではなく、記憶に基づいて結果を出している可能性があるということです。つまり、モデルは、有用な提案を作ることを学ぶのではなく、評価に使用されるデータセットからアイテムを思い出すことが多く、パフォーマンスの過大評価や、ユーザーに適していない、または古い推薦につながる可能性があります。
機械学習では、テスト分割を使用して、トレーニングされたモデルが、トレーニングに使用されたものと似ているが、同一ではない問題を解決する能力をテストします。
例えば、新しいAIの「犬の品種認識」モデルが、10万枚の犬の写真のデータセットでトレーニングされた場合、通常、80/20の分割が行われます。80,000枚の写真がモデルをトレーニングするために提供され、20,000枚の写真がテスト用の材料として保持されます。
当然、AIのトレーニングデータが、テスト分割の「秘密」の20%セクションを含む場合、モデルはテストをパーフェクトに合格します。なぜなら、モデルはすでに100%のドメインデータを見ているからです。しかし、これはモデルが将来、実際の「生」のデータでどのように動作するかを正確に反映していません。
映画のネタバレ
AIが試験で不正行為を行う問題は、モデルの規模とともに成長しています。今日のシステムは、Common Crawlなどの巨大な、無差別なWebスクレイピングコーパスでトレーニングされているため、ベンチマークデータセット(つまり、保持された20%)がトレーニングミックスに混入する可能性は、エッジケースではなく、デフォルトとなります。これは、データ汚染と呼ばれる症状です。また、この規模では、エラーを検出できる手動キュレーションは、論理的に不可能です。
イタリアのポリテクニコ・ディ・バーリの新しい論文では、研究者は、MovieLens-1Mという単一の映画推薦データセットの役割に焦点を当てています。彼らは、このデータセットが、いくつかの主要なAIモデルによって部分的に暗記されていると主張しています。
このデータセットは、レコメンダーシステムのテストに広く使用されているため、モデルの記憶に存在する可能性は、テストを無意味にする可能性があります。知能と思われるものは、実際には単純な再生であり、直感的な推薦スキルは、以前の露出を反映した統計的なエコーである可能性があります。
著者は次のように述べています:
「私たちの研究結果は、LLMがMovieLens-1Mデータセットに関する広範な知識を持っていることを示しています。これには、アイテム、ユーザー属性、インタラクション履歴が含まれます。注目すべきは、シンプルなプロンプトでGPT-4oがデータセット内のほぼ80%の映画タイトルを回復できることです。」
「調査されたモデルのうち、MovieLens-1Mの知識から完全に自由なものはありません。これは、MovieLens-1Mデータがモデルのトレーニングセットに含まれている可能性が高いことを示唆しています。」
「ユーザー属性とインタラクション履歴の取得についても同様の傾向が見られます。」
新しい論文は、Do LLMs Memorize Recommendation Datasets? A Preliminary Study on MovieLens-1Mと題されています。ポリテクニコの6人の研究者によって書かれ、GitHubでその作業のパイプラインが公開されています。
方法
研究者は、モデルが本当に学習しているか、単に思い出しているかを判断するために、最初にこのコンテキストでの記憶の意味を定義し、モデルがMovieLens-1Mデータセットから特定の情報を取得できるかどうかをテストしました。
モデルが映画のID番号を見せられ、タイトルとジャンルを生成できる場合、それはアイテムの記憶とみなされました。モデルがユーザーIDからユーザーの詳細(年齢、職業、郵便番号など)を生成できる場合、それはユーザーの記憶とみなされました。また、モデルが既知のシーケンスからのユーザーの次の映画評価を再現できる場合、それはモデルが特定のインタラクションデータを思い出している証拠とみなされました。
これらの記憶の各形式は、モデルに新しい情報を与えることなく、慎重に作成されたプロンプトを使用してテストされました。応答の正確性が高いほど、モデルがすでにそのデータをトレーニング中に遭遇していた可能性が高くなります。

新しい論文で使用された評価プロトコルのゼロショットプロンプティング Source: https://arxiv.org/pdf/2505.10212
データとテスト
適切なデータセットをキュレーションするために、著者は、最近の2つの主要な会議論文、ACM RecSys 2024とACM SIGIR 2024を調査しました。MovieLens-1Mは、約5分の1の提出で最も頻繁に引用されました。以前の研究が同様の結論に達したため、これは驚くことではありませんでしたが、データセットの優位性を確認するものでした。
MovieLens-1Mは3つのファイルで構成されています:Movies.datは、映画をID、タイトル、ジャンルでリストします。Users.datは、ユーザーIDを基本的なバイオグラフィフィールドにマップします。Ratings.datは、誰が何を評価し、いつ評価したかを記録します。
このデータが大規模言語モデルによって記憶されているかどうかを調べるために、研究者は、論文で最初に導入されたプロンプティング技術を使用しました。Extracting Training Data from Large Language Modelsであり、後に続編でBag of Tricks for Training Data Extraction from Language Modelsとして適応されました。
方法は直接的です。データセットの形式を反映する質問を提示し、モデルが正しく回答できるかどうかを確認します。ゼロショット、チェーンオブソート、ファーショットプロンプティングがテストされ、最後の方法が最も効果的であることがわかりました。より複雑なアプローチでは、より高いリコールが得られる可能性がありますが、これは何が記憶されているかを明らかにするのに十分であると考えられました。

モデルが最小限のコンテキストでMovieLens-1Mの特定の値を再現できるかどうかをテストするために使用されるファーショットプロンプティング
記憶を測定するために、研究者は3つの形式のリコールを定義しました:アイテム、ユーザー、インタラクション。これらのテストでは、モデルが映画のIDから映画のタイトルを取得したり、ユーザーIDからユーザーの詳細を生成したり、以前の評価に基づいてユーザーの次の評価を予測したりできるかどうかを調べました。各テストは、データセットのどれだけを再構築できるかを反映するカバレッジメトリックを使用してスコア付けされました。
テストされたモデルは、GPT-4o、GPT-4o mini、GPT-3.5 turbo、Llama-3.3 70B、Llama-3.2 3B、Llama-3.2 1B、Llama-3.1 405B、Llama-3.1 70B、Llama-3.1 8Bでした。これらのモデルはすべて、温度を0に設定し、top_pを1に設定し、頻度と存在のペナルティを無効にして実行されました。固定されたランダムシードにより、実行ごとに一貫した出力が保証されました。

モデルごとのMovieLens-1Mエントリの割合
MovieLens-1Mをどれだけ深く吸収しているかを調べるために、研究者は各モデルにデータセットの3つのファイル(Movies.dat、Users.dat、Ratings.dat)からの正確なエントリを提示しました。
初期テストの結果は、GPTとLlamaファミリー間だけでなく、モデルサイズ間でも大きな違いがあることを示しています。GPT-4oとGPT-3.5 turboはデータセットの大部分を容易に回復しますが、ほとんどのオープンソースモデルは同じ材料のわずかな部分しか回復できません。これは、事前トレーニングでのこのベンチマークへの露出が均等ではないことを示唆しています。
これらは小さな差ではありません。3つのファイル全体で、最も強力なモデルは、単に弱いモデルを上回ったのではなく、MovieLens-1Mの全体の部分を回復しました。
GPT-4oの場合、カバレッジは、データセットの非自明な部分が直接記憶されていることを示唆するほど高かったです。
著者は次のように述べています:
「私たちの研究結果は、LLMがMovieLens-1Mデータセットに関する広範な知識を持っていることを示しています。これには、アイテム、ユーザー属性、インタラクション履歴が含まれます。」
「注目すべきは、シンプルなプロンプトでGPT-4oがデータセット内のほぼ80%の映画タイトルを回復できることです。調査されたモデルのうち、MovieLens-1Mの知識から完全に自由なものはありません。これは、MovieLens-1Mデータがモデルのトレーニングセットに含まれている可能性が高いことを示唆しています。」
「ユーザー属性とインタラクション履歴の取得についても同様の傾向が見られます。」
次に、著者は、記憶の推薦タスクへの影響をテストするために、各モデルをレコメンダーシステムとして動作させるよう促しました。パフォーマンスをベンチマークするために、彼らは出力を7つの標準方法と比較しました:UserKNN、ItemKNN、BPRMF、EASER、LightGCN、MostPop、およびRandomです。
MovieLens-1Mデータセットは、Leave-One-Outサンプリング戦略を使用して、80/20の割合でトレーニングセットとテストセットに分割されました。使用されたメトリックは、Hit Rate(HR@[n])とnDCG(@[n])でした。

標準ベースラインとLLMベースの方法の推薦精度
ここで、複数の大規模言語モデルが、すべてのメトリックで従来のベースラインを上回りました。GPT-4oは、すべての列で大きなリードを確立しました。GPT-3.5 turboやLlama-3.1 405Bなどのミッドサイズモデルも、BPRMFやLightGCNなどのベンチマーク方法を一貫して上回りました。
小さいLlamaバリアントでは、パフォーマンスは大きく異なりましたが、Llama-3.2 3Bは、HR@1で最高のスコアを達成しました。
結果は、著者によると、記憶されたデータが、特に最も強力なモデルにとって、レコメンダー形式のプロンプティングにおける測定可能な利点に変換される可能性があることを示しています。
研究者はさらに次のように述べています:
「推薦のパフォーマンスは見かけ上は優れていますが、テーブル2とテーブル1を比較すると、興味深いパターンが見られます。各グループ内で、記憶が高いモデルは、推薦タスクで優れたパフォーマンスを示しています。」
「例えば、GPT-4oはGPT-4o miniを上回り、Llama-3.1 405BはLlama-3.1 70Bと8Bを上回ります。」
「これらの結果は、LLMの評価が、トレーニングデータに漏洩したデータセットで行われる場合、記憶によって推進される過大評価されたパフォーマンスにつながる可能性があることを強調しています。」
モデルのスケールがこの問題に与える影響について、著者は、モデルのサイズ、記憶、推薦パフォーマンスの間に関連性があることを観察しました。大きいモデルは、MovieLens-1Mデータセットをより多く保持し、ダウンストリームタスクでもより強力に動作しました。
Llama-3.1 405Bの場合、平均的な記憶率は12.9%でしたが、Llama-3.1 8Bは、5.82%しか保持しませんでした。これは、記憶の約55%の減少であり、nDCGとHRの両方で約54.23%と47.36%の低下に相当しました。
パターンは、記憶が減少すると、パフォーマンスも減少することを示しました:
「これらの結果は、モデルのスケールを増やすと、データセットの記憶が増えるため、パフォーマンスが向上することを示しています。」
「したがって、大きいモデルは、推薦のパフォーマンスが優れていますが、トレーニングデータの潜在的な漏洩にも関連しています。」
最終的なテストでは、記憶がMovieLens-1Mの人気バイアスを反映しているかどうかを調べました。アイテムは、インタラクションの頻度によってグループ化され、以下のグラフは、大きいモデルが一貫して最も人気のあるエントリを優先していることを示しています。

モデルごとのアイテムのカバレッジ
GPT-4oは、最も人気のあるアイテムの89.06%を回復しましたが、最も人気のないアイテムの63.97%しか回復しませんでした。GPT-4o miniと小さいLlamaモデルは、すべてのバンドでカバレッジが大幅に低下しました。研究者は、この傾向は、記憶がモデルのサイズとともに増加し、トレーニングデータの既存の不均衡も増幅することを示唆していることを示しています。
彼らは次のように続けています:
「私たちの研究結果は、LLMに人気バイアスがあることを示しています。最も人気のあるアイテムの上位20%は、最も人気のないアイテムの下位20%よりも回復しやすいです。」
「この傾向は、トレーニングデータの分布の影響を強調しています。ここでは、人気の映画が過剰に表現されており、それらがモデルの記憶に不釣り合いな影響を与えている可能性があります。」
結論
このジレンマは新しいものではありません。トレーニングセットが大きくなるにつれて、それらをキュレーションする可能性は逆に減少します。MovieLens-1Mは、おそらく他にも、膨大なコーパスの中で無視され、機械では検出できないエラーを生み出す可能性があります。
この問題は、すべてのスケールで繰り返され、自動化には抵抗します。解決策を見つけるには、人間の判断が必要です。新しい論文は、前進する方法を提供していません。
* このコンテキストでのカバレッジメトリックは、言語モデルが質問されたときに元のデータセットをどれだけ再構築できるかを示すパーセンテージです。モデルが映画のIDで提示され、正しいタイトルとジャンルで応答した場合、それは成功したリコールとみなされます。成功したリコールの総数は、データセット内のエントリの総数で割り、カバレッジスコアが算出されます。たとえば、モデルが1,000アイテムのうち800アイテムの情報を正しく返した場合、そのカバレッジは80パーセントになります。
初版は2025年5月16日に公開されました












