Andersons Blickwinkel
Große Sprachmodelle merken sich die Daten, die für die Tests gedacht sind

Wenn Sie auf künstliche Intelligenz (KI) vertrauen, um zu empfehlen, was Sie sehen, lesen oder kaufen sollen, zeigt neue Forschung, dass einige Systeme diese Ergebnisse möglicherweise aus Erinnerung ableiten, anstatt nützliche Vorschläge zu machen: Anstatt zu lernen, nützliche Vorschläge zu machen, erinnern sich die Modelle oft an Elemente aus den Datensätzen, die zur Bewertung verwendet werden, was zu einer Überschätzung der Leistung und Empfehlungen führt, die möglicherweise veraltet oder schlecht auf den Benutzer abgestimmt sind.
In der maschinellen Lerntheorie wird ein Test-Split verwendet, um zu sehen, ob ein trainiertes Modell gelernt hat, Probleme zu lösen, die ähnlich, aber nicht identisch mit dem Material sind, auf dem es trainiert wurde.
Wenn also ein neues KI-Modell zum Erkennen von Hunderassen auf einem Datensatz von 100.000 Bildern von Hunden trainiert wird, enthält es normalerweise einen 80/20-Split – 80.000 Bilder, die zum Trainieren des Modells bereitgestellt werden, und 20.000 Bilder, die zurückgehalten und als Material für die Tests des fertigen Modells verwendet werden.
Es ist offensichtlich, dass, wenn die Trainingsdaten des KI-Modells unbeabsichtigt den “geheimen” 20-Prozent-Anteil des Test-Splits enthalten, das Modell diese Tests bestehen wird, weil es bereits die Antworten kennt (es hat bereits 100 Prozent der Domänen-Daten gesehen). Natürlich spiegelt dies nicht genau wider, wie das Modell später auf neue “Live”-Daten in einem Produktionskontext funktionieren wird.
Movie Spoilers
Das Problem des “Cheatens” von KI bei ihren Prüfungen ist mit der Größe der Modelle selbst gewachsen. Da heutige Systeme auf riesigen, unselektiven Web-Scraping-Korpora wie Common Crawl trainiert werden, ist die Möglichkeit, dass Benchmark-Datensätze (d. h. die zurückgehaltene 20 Prozent) in die Trainingsmischung gelangen, kein Randfall mehr, sondern die Norm – ein Syndrom, das als Datenkontamination bekannt ist; und in diesem Umfang ist die manuelle Kuratierung, die solche Fehler auffangen könnte, logistisch unmöglich.
Dieser Fall wird in einem neuen Papier der italienischen Politecnico di Bari erforscht, in dem die Forscher den übermäßigen Einfluss eines einzelnen Movie-Empfehlungs-Datensatzes, MovieLens-1M, untersuchen, den sie dafür halten, dass er von mehreren führenden KI-Modellen während des Trainings teilweise memorisiert wurde.
Weil dieser spezifische Datensatz so häufig bei der Tests von Empfehlungssystemen verwendet wird, macht seine Anwesenheit in den Modellen möglicherweise diese Tests sinnlos: Was wie Intelligenz erscheint, kann in Wirklichkeit einfache Erinnerung sein, und was wie ein intuitives Empfehlungsgeschick erscheint, kann nur ein statistischer Echo sein, der frühere Expositionen widerspiegelt.
Die Autoren erklären:
‘Unsere Ergebnisse zeigen, dass LLMs umfassendes Wissen über den MovieLens-1M-Datensatz besitzen, einschließlich Elementen, Benutzereigenschaften und Interaktionshistorien. Bemerkenswerterweise ermöglicht ein einfacher Prompt GPT-4o, fast 80 Prozent der [Namen der meisten Filme im Datensatz] wiederzuerlangen.
‘Keines der untersuchten Modelle ist frei von diesem Wissen, was darauf hindeutet, dass MovieLens-1M-Daten wahrscheinlich in ihren Trainingssets enthalten sind. Wir beobachteten ähnliche Trends bei der Wiedererlangung von Benutzereigenschaften und Interaktionshistorien.’
Das kurze neue Papier trägt den Titel Memorisieren LLMs Empfehlungsdatensätze? Eine vorläufige Studie zu MovieLens-1M und stammt von sechs Forschern der Politecnico. Die Pipeline, um ihre Arbeit zu reproduzieren, wurde auf GitHub verfügbar gemacht.
Method
Um zu verstehen, ob die Modelle tatsächlich lernten oder einfach nur erinnerten, begannen die Forscher damit, zu definieren, was Memorisation in diesem Kontext bedeutet, und begannen damit, zu testen, ob ein Modell in der Lage war, spezifische Informationen aus dem MovieLens-1M-Datensatz abzurufen, wenn es auf die richtige Weise angestoßen wurde.
Wenn ein Modell einem Film-ID-Nummer gezeigt wurde und den Titel und das Genre produzieren konnte, zählte das als Memorisation eines Elements; wenn es Details über einen Benutzer (wie Alter, Beruf oder Postleitzahl) aus einer Benutzer-ID generieren konnte, zählte das auch als Benutzermemorisation; und wenn es eine Benutzers Bewertung für einen Film aus einer bekannten Sequenz von vorherigen Bewertungen reproduzieren konnte, wurde das als Beweis dafür angesehen, dass das Modell möglicherweise spezifische Interaktionsdaten abruft, anstatt allgemeine Muster zu lernen.
Jede dieser Formen der Erinnerung wurde mit sorgfältig formulierten Prompts getestet, die darauf abzielten, das Modell ohne neue Informationen anzustiften. Je genauer die Antwort war, desto wahrscheinlicher war es, dass das Modell diese Daten bereits während des Trainings gesehen hatte:

Zero-Shot-Prompting für das Evaluierungsprotokoll, das im neuen Papier verwendet wird. Quelle: https://arxiv.org/pdf/2505.10212
Daten und Tests
Um einen geeigneten Datensatz zu erstellen, untersuchten die Autoren aktuelle Papiere von zwei der wichtigsten Konferenzen auf diesem Gebiet, ACM RecSys 2024 und ACM SIGIR 2024. MovieLens-1M erschien am häufigsten, in über einem Fünftel der Einreichungen. Da frühere Studien zu ähnlichen Schlussfolgerungen gekommen waren, war dies nicht überraschend, sondern vielmehr eine Bestätigung der Dominanz des Datensatzes.
MovieLens-1M besteht aus drei Dateien: Movies.dat, die Filme nach ID, Titel und Genre auflistet; Users.dat, die Benutzer-IDs mit grundlegenden biografischen Feldern verknüpft; und Ratings.dat, die aufzeichnet, wer was bewertet hat und wann.
Um herauszufinden, ob diese Daten von großen Sprachmodellen memorisiert worden waren, wandten sich die Forscher Techniken zu, die erstmals im Papier Extrahieren von Trainingsdaten aus großen Sprachmodellen vorgestellt und später im nachfolgenden Werk Bag of Tricks für die Extrahierung von Trainingsdaten aus Sprachmodellen angepasst wurden.
Die Methode ist direkt: Stellen Sie eine Frage, die dem Datensatzformat entspricht, und sehen Sie, ob das Modell richtig antwortet. Zero-Shot, Chain-of-Thought und Few-Shot-Prompting wurden getestet, und es wurde festgestellt, dass die letztere Methode, bei der das Modell einige Beispiele gezeigt wird, am effektivsten war; selbst wenn anspruchsvollere Ansätze möglicherweise höhere Erinnerungsraten liefern könnten, wurde dies als ausreichend angesehen, um zu zeigen, was memorisiert worden war.

Few-Shot-Prompt, der verwendet wird, um zu testen, ob ein Modell spezifische MovieLens-1M-Werte bei minimaler Kontextabfrage reproduzieren kann.
Um die Memorisation zu messen, definierten die Forscher drei Formen der Erinnerung: Element, Benutzer und Interaktion. Diese Tests untersuchten, ob ein Modell einen Film-Titel aus seiner ID abrufen, Benutzerdetails aus einer Benutzer-ID generieren oder eine Benutzers Bewertung für einen Film auf der Grundlage früherer Bewertungen vorhersagen konnte. Jeder wurde mit einer Abdeckungsmetrik* bewertet, die den Anteil des Datensatzes widerspiegelte, der durch Prompting rekonstruiert werden konnte.
Die getesteten Modelle waren GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; und Llama-3.1 8B. Alle wurden mit Temperatur auf Null gesetzt, top_p auf eins gesetzt und sowohl Häufigkeits- als auch Anwesenheitsstrafen deaktiviert. Ein fester Zufallsseed gewährleistete konsistente Ausgaben über die Läufe hinweg.

Anteil der MovieLens-1M-Einträge, die aus movies.dat, users.dat und ratings.dat abgerufen wurden, mit Modellen, die nach Version und Parameteranzahl sortiert sind.
Um zu untersuchen, wie tief MovieLens-1M absorbiert worden war, forderten die Forscher jedes Modell auf, genaue Einträge aus den drei (vorher genannten) Dateien des Datensatzes abzurufen: Movies.dat, Users.dat und Ratings.dat.
Die Ergebnisse der anfänglichen Tests, die oben gezeigt werden, zeigen deutliche Unterschiede nicht nur zwischen GPT- und Llama-Familien, sondern auch zwischen Modellgrößen. Während GPT-4o und GPT-3.5 turbo große Teile des Datensatzes mühelos abrufen, erinnern sich die meisten Open-Source-Modelle nur an einen Bruchteil des gleichen Materials, was auf eine ungleichmäßige Exposition gegenüber diesem Benchmark im Training hinweist.
Diese sind keine kleinen Margen. Über alle drei Dateien hinweg erzielten die stärksten Modelle nicht nur bessere Ergebnisse als schwächere, sondern erinnerten sich auch an ganze Teile von MovieLens-1M.
Im Fall von GPT-4o war die Abdeckung hoch genug, um zu suggerieren, dass ein nicht unwesentlicher Anteil des Datensatzes direkt memorisiert worden war.
Die Autoren erklären:
‘Unsere Ergebnisse zeigen, dass LLMs umfassendes Wissen über den MovieLens-1M-Datensatz besitzen, einschließlich Elementen, Benutzereigenschaften und Interaktionshistorien.
‘Bemerkenswerterweise ermöglicht ein einfacher Prompt GPT-4o, fast 80 Prozent der MovieID::Titel-Einträge wiederzuerlangen. Keines der untersuchten Modelle ist frei von diesem Wissen, was darauf hindeutet, dass MovieLens-1M-Daten wahrscheinlich in ihren Trainingssets enthalten sind.
‘Wir beobachteten ähnliche Trends bei der Wiedererlangung von Benutzereigenschaften und Interaktionshistorien.’
Als nächstes testeten die Autoren den Einfluss der Memorisation auf Empfehlungsaufgaben, indem sie jedes Modell aufforderten, als Empfehlungssystem zu fungieren. Um die Leistung zu bewerten, verglichen sie die Ausgabe mit sieben Standardmethoden: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; und Random.
Der MovieLens-1M-Datensatz wurde im Verhältnis 80/20 in Trainings- und Testsets aufgeteilt, wobei eine Leave-One-Out-Stichprobensampling-Strategie verwendet wurde, um die reale Verwendung zu simulieren. Die verwendeten Metriken waren Hit Rate (HR@[n]); und nDCG(@[n]):

Empfehlungspräzision bei Standard-Baselines und LLM-basierten Methoden. Modelle sind nach Familie und Parameteranzahl sortiert, wobei fett gedruckte Werte den höchsten Wert innerhalb jeder Gruppe anzeigen.
Hier übertrafen mehrere große Sprachmodelle traditionelle Baselines in allen Metriken, wobei GPT-4o in jeder Spalte eine breite Führung etablierte, und sogar mittelgroße Modelle wie GPT-3.5 turbo und Llama-3.1 405B konsistent Baselines wie BPRMF und LightGCN übertrafen.
Unter den kleineren Llama-Varianten variierte die Leistung stark, aber Llama-3.2 3B ragte heraus, mit dem höchsten HR@1 in seiner Gruppe.
Die Ergebnisse, so die Autoren, deuten darauf hin, dass memorisierte Daten zu messbaren Vorteilen bei Empfehlungsaufgaben führen können, insbesondere für die stärksten Modelle.
In einer zusätzlichen Beobachtung fahren die Forscher fort:
‘Obwohl die Empfehlungsleistung hervorragend erscheint, zeigt ein Vergleich von Tabelle 2 mit Tabelle 1 ein interessantes Muster. Innerhalb jeder Gruppe zeigt das Modell mit höherer Memorisation auch eine bessere Leistung bei der Empfehlungsaufgabe.
‘Beispielsweise übertrifft GPT-4o GPT-4o mini, und Llama-3.1 405B übertrifft Llama-3.1 70B und 8B.
‘Diese Ergebnisse zeigen, dass die Bewertung von LLMs auf Datensätzen, die in ihren Trainingsdaten enthalten sind, zu überoptimistischen Leistungen führen kann, die durch Memorisation und nicht durch Verallgemeinerung angetrieben werden.’
In Bezug auf den Einfluss der Modellgröße auf dieses Problem beobachteten die Autoren eine klare Korrelation zwischen Größe, Memorisation und Empfehlungsleistung, wobei größere Modelle nicht nur mehr von dem MovieLens-1M-Datensatz behielten, sondern auch besser in Downstream-Aufgaben abschnitten.
Llama-3.1 405B zeigte beispielsweise eine durchschnittliche Memorisationsrate von 12,9 %, während Llama-3.1 8B nur 5,82 % behielt. Dieser Rückgang der Erinnerung um fast 55 % korrespondierte mit einem Rückgang der nDCG um 54,23 % und einem Rückgang der HR um 47,36 % bei den Bewertungscutoffs.
Das Muster hielt überall vor – wo die Memorisation abnahm, nahm auch die scheinbare Leistung ab:
‘Diese Ergebnisse deuten darauf hin, dass eine Erhöhung der Modellgröße zu einer stärkeren Memorisation des Datensatzes führt, was zu einer besseren Leistung führt.
‘Folglich zeigen größere Modelle nicht nur eine bessere Empfehlungsleistung, sondern bergen auch Risiken im Zusammenhang mit möglichen Lecks in den Trainingsdaten.’
Der letzte Test untersuchte, ob die Memorisation den Popularitätsbias widerspiegelt, der in MovieLens-1M angelegt ist. Elemente wurden nach Interaktionshäufigkeit gruppiert, und die folgende Grafik zeigt, dass größere Modelle konsistent die beliebtesten Einträge bevorzugen:

Elementabdeckung nach Modell über drei Popularitätsstufen: Top 20 % der beliebtesten, mittlere 20 % der moderat beliebten und untere 20 % der am wenigsten interagierten Elemente.
GPT-4o konnte 89,06 % der Top-Elemente abrufen, aber nur 63,97 % der am wenigsten beliebten. GPT-4o mini und kleinere Llama-Modelle zeigten eine viel geringere Abdeckung über alle Bänder hinweg. Die Forscher stellen fest, dass dieser Trend darauf hindeutet, dass die Memorisation nicht nur mit der Modellgröße skaliert, sondern auch bestehende Ungleichgewichte in den Trainingsdaten verstärkt.
Sie fahren fort:
‘Unsere Ergebnisse zeigen einen deutlichen Popularitätsbias in LLMs, wobei die Top 20 % der beliebtesten Elemente erheblich einfacher abzurufen sind als die unteren 20 %.
‘Dieser Trend unterstreicht den Einfluss der Verteilung der Trainingsdaten, in denen beliebte Filme überrepräsentiert sind, was zu ihrer unverhältnismäßigen Memorisation durch die Modelle führt.’
Schlussfolgerung
Das Dilemma ist nicht mehr neu: Wenn die Trainingssets wachsen, nimmt die Aussicht auf ihre Kuratierung umgekehrt proportional ab. MovieLens-1M, vielleicht unter vielen anderen, gelangt in diese riesigen Korpora ohne Aufsicht, anonym inmitten der schieren Menge an Daten.
Das Problem wiederholt sich in jeder Größenordnung und widersteht der Automatisierung. Jede Lösung erfordert nicht nur Anstrengung, sondern auch menschliches Urteilsvermögen – die langsame, fehlerhafte Art, die Maschinen nicht liefern können. In diesem Sinne bietet das neue Papier keinen Weg nach vorn.
* Eine Abdeckungsmetrik in diesem Kontext ist ein Prozentsatz, der zeigt, wie viel des ursprünglichen Datensatzes ein Sprachmodell reproduzieren kann, wenn es die richtige Art von Frage gestellt wird. Wenn ein Modell einem Film-ID-Nummer gezeigt wird und den Titel und das Genre produzieren kann, zählt das als erfolgreiche Erinnerung. Die Gesamtzahl der erfolgreichen Erinnerungen wird dann durch die Gesamtzahl der Einträge im Datensatz geteilt, um einen Abdeckungsscore zu erzeugen. Zum Beispiel, wenn ein Modell korrekte Informationen für 800 von 1.000 Elementen zurückgibt, beträgt seine Abdeckung 80 Prozent.
Erstveröffentlichung am Freitag, dem 16. Mai 2025












