Andersons vinkel

Store sprogmodeller gemmer data fra testdatasset

mm
Føj Unite.AI til dine foretrukne kilder på Google
'Robot cheating in an exam' - ChatGPT-4o and Adobe Firefly

Hvis du afhænger af AI til at anbefale, hvad du skal se, læse eller købe, viser ny forskning, at nogle systemer måske baserer disse resultater på hukommelse i stedet for evner: i stedet for at lære at give nyttige forslag, husker modellerne ofte genstande fra de datasset, der blev brugt til at evaluere dem, hvilket fører til overestimeret præstation og anbefalinger, der kan være forældede eller dårligt tilpasset brugeren.

 

I maskinlæring bruges en testdeling til at se, om en trænet model har lært at løse problemer, der er lignende, men ikke identiske med det materiale, den blev trænet på.

Så hvis en ny AI-model til at genkende hunderacer bliver trænet på en datasset med 100.000 billeder af hunde, vil den normalt have en 80/20-delning – 80.000 billeder, der er tilgængelige for at træne modellen; og 20.000 billeder, der er tilbageholdt og brugt som materiale til at teste den færdige model.

Det er tydeligt, at hvis AI’s træningsdata utilsigtet inkluderer den “hemmelige” 20% del af testdelingen, vil modellen bestå disse tests, fordi den allerede kender svarene (den har allerede set 100% af domænedata). Det afspejler naturligvis ikke nøjagtigt, hvordan modellen vil fungere senere, på nye “live”-data, i en produktionskontekst.

Movie Spoilers

Problemet med, at AI bedrager på sine eksamener, er vokset i takt med modellernes størrelse. Fordi i dagens systemer trænes på enorme, ukvalificerede web-skrapede korpora som Common Crawl, er muligheden for, at benchmark-datasset (dvs. den tilbageholdte 20%) kommer ind i træningsblandingen, ikke længere en randtilfælde, men standarden – et syndrom kendt som dataforurening; og på denne skala er den manuelle kuratering, der kunne fange sådanne fejl, logistisk umulig.

Dette tilfælde er blevet undersøgt i en ny artikel fra Italiens Politecnico di Bari, hvor forskerne fokuserer på den store rolle, som en enkelt film-anbefalingsdatasset, MovieLens-1M, har spillet, som de mener er blevet delvist husket af flere førende AI-modeller under træning.

Fordi denne specifikke datasset er så bredt brugt i testen af anbefalingsystemer, gør dens tilstedeværelse i modellernes hukommelse disse tests meningsløse: hvad der ser ud som intelligens, kan i virkeligheden være simple genkaldelser, og hvad der ligner en intuitiv anbefalingsfærdighed, kan blot være en statistisk ekko, der afspejler tidligere eksponering.

Forfatterne skriver:

‘Vores resultater viser, at LLM’er besidder omfattende viden om MovieLens-1M-datasset, der dækker genstande, brugerattributter og interaktionshistorier.

‘Bemærkelsesværdigt er, at en simpel prompt kan få GPT-4o til at genskabe næsten 80% af film-ID’er og -titler. Ingen af de undersøgte modeller er fri for denne viden, hvilket tyder på, at MovieLens-1M-data sandsynligvis er inkluderet i deres træningssets.

‘Vi observerede lignende tendenser i genskabelsen af brugerattributter og interaktionshistorier.’

Den korte nye artikel har titlen Do LLMs Memorize Recommendation Datasets? A Preliminary Study on MovieLens-1M og kommer fra seks Politecnico-forskere. Pipelinen til at genskabe deres arbejde er blevet gjort tilgængelig på GitHub.

Metode

For at forstå, om modellerne i spørgsmålet virkelig lærte eller blot huskede, begyndte forskerne med at definere, hvad huskning betyder i denne kontekst, og begyndte med at teste, om en model kunne genskabe specifikke stykker af information fra MovieLens-1M-datasset, når den blev bedt på den rigtige måde.

Hvis en model blev vist en films ID-nummer og kunne producere dens titel og genre, talte det som huskning af en genstand; hvis den kunne generere detaljer om en bruger (såsom alder, beskæftigelse eller postnummer) fra en bruger-ID, talte det også som brugerhuskning; og hvis den kunne genskabe en brugers næste filmvurdering fra en kendt række af tidligere vurderinger, blev det anset som bevis for, at modellen måske huskede specifikke interaktionsdata, i stedet for at lære generelle mønstre.

Hver af disse former for genkaldelse blev testet ved hjælp af omhyggeligt skrevne prompts, der var designet til at nægte modellen uden at give den nye information. Jo mere præcis svaret var, jo mere sandsynligt var det, at modellen allerede havde mødt disse data under træning:

Zero-shot prompting for the evaluation protocol used in the new paper. Source: https://arxiv.org/pdf/2505.10212

Zero-shot prompting for the evaluation protocol used in the new paper. Source: https://arxiv.org/pdf/2505.10212

Data og tests

For at kuratere en passende datasset, gennemgik forfatterne nylige artikler fra to af fagets største konferencer, ACM RecSys 2024, og ACM SIGIR 2024. MovieLens-1M dukkede op mest, nævnt i lidt over en femtedel af indsendelserne. Da tidligere studier havde nået lignende konklusioner, var dette ikke et overraskende resultat, men snarere en bekræftelse af datassetets dominans.

MovieLens-1M består af tre filer: Movies.dat, der listar filmene efter ID, titel og genre; Users.dat, der mapper bruger-IDs til grundlæggende biografiske felter; og Ratings.dat, der optager, hvem der vurderede hvad og hvornår.

For at finde ud af, om disse data var blevet husket af store sprogmodeller, vendte forskerne sig til prompt-teknikker, der først blev introduceret i artiklen Extracting Training Data from Large Language Models, og senere tilpasset i det efterfølgende arbejde Bag of Tricks for Training Data Extraction from Language Models.

Metoden er direkte: stille et spørgsmål, der spejler datasset-formatet, og se, om modellen svarer korrekt. Zero-shot, Chain-of-Thought, og few-shot prompting blev testet, og det blev fundet, at den sidste metode, hvor modellen vises et par eksempler, var den mest effektive; selvom mere avancerede tilgange måske kunne give højere genkaldelse, blev denne betragtet som tilstrækkelig til at afsløre, hvad der var blevet husket.

Few-shot prompt used to test whether a model can reproduce specific MovieLens-1M values when queried with minimal context.

Few-shot prompt used to test whether a model can reproduce specific MovieLens-1M values when queried with minimal context.

For at måle huskning definerede forskerne tre former for genkaldelse: genstand, bruger, og interaktion. Disse tests undersøgte, om en model kunne genskabe en filmtitel fra dens ID, generere brugeroplysninger fra en bruger-ID eller forudsige en brugers næste vurdering baseret på tidligere vurderinger. Hver blev vurderet ved hjælp af en dækningsscore, der afspejlede, hvor meget af datasset, der kunne genskabes gennem prompting.

Modellerne, der blev testet, var GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; og Llama-3.1 8B. Alle blev kørt med temperatur sat til nul, top_p sat til en, og både frekvens og tilstedeværelsesstraffe deaktiveret. En fast tilfældigt seed sikrede konsistent output over kørsler.

Proportion of MovieLens-1M entries retrieved from movies.dat, users.dat, and ratings.dat, with models grouped by version and sorted by parameter count.

Proportion of MovieLens-1M entries retrieved from movies.dat, users.dat, and ratings.dat, with models grouped by version and sorted by parameter count.

For at afprøve, hvor dybt MovieLens-1M var blevet absorberet, blev hver model promptet til at genskabe præcise indtastninger fra datassetets tre (ovennævnte) filer: Movies.dat, Users.dat, og Ratings.dat.

Resultaterne fra de første tests, vist ovenfor, afslører skarpe forskelle ikke kun mellem GPT- og Llama-familier, men også på tværs af modellernes størrelse. Mens GPT-4o og GPT-3.5 turbo genskaber store dele af datasset med lethed, kan de fleste open-source-modeller kun genskabe en brøkdel af det samme materiale, hvilket tyder på, at der er en urent eksponering for dette benchmark i fortræning.

Disse er ikke små marginer. Over alle tre filer gjorde de stærkeste modeller ikke blot bedre end de svagere, men genskabte hele dele af MovieLens-1M.

I tilfældet af GPT-4o var dækningen høj nok til at antyde, at en ikke ubetydelig del af datasset var blevet direkte husket.

Forfatterne skriver:

‘Vores resultater viser, at LLM’er besidder omfattende viden om MovieLens-1M-datasset, der dækker genstande, brugerattributter og interaktionshistorier.

‘Bemærkelsesværdigt er, at en simpel prompt kan få GPT-4o til at genskabe næsten 80% af film-ID’er og -titler. Ingen af de undersøgte modeller er fri for denne viden, hvilket tyder på, at MovieLens-1M-data sandsynligvis er inkluderet i deres træningssets.

‘Vi observerede lignende tendenser i genskabelsen af brugerattributter og interaktionshistorier.’

Herefter testede forfatterne effekten af huskning på anbefalingstasks ved at prompte hver model til at fungere som et anbefalingssystem. For at benchmark præstationen sammenlignede de outputtet med syv standardmetoder: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; og Random.

MovieLens-1M-datasset blev delt 80/20 i trænings- og testsets, ved hjælp af en leave-one-out-prøvestrategi til at simulere virkeligt brug. Metrikkerne, der blev brugt, var Hit Rate (HR@[n]); og nDCG(@[n]):

Recommendation accuracy on standard baselines and LLM-based methods. Models are grouped by family and ordered by parameter count. Bold values indicate the highest score within each group.

Recommendation accuracy on standard baselines and LLM-based methods. Models are grouped by family and ordered by parameter count, with bold values indicating the highest score within each group.

Her udgør flere store sprogmodeller traditionelle baseline-metoder over alle metrikker, med GPT-4o, der etablerer en stor føring i hver kolonne, og selv mid-size-modeller som GPT-3.5 turbo og Llama-3.1 405B konsekvent overgår benchmark-metoder som BPRMF og LightGCN.

Blandt de mindre Llama-variationer varierer præstationen skarpt, men Llama-3.2 3B står ud, med den højeste HR@1 i sin gruppe.

Resultaterne, som forfatterne foreslår, indikerer, at husket data kan oversætte til målbare fordele i anbefalingstasks, især for de stærkeste modeller.

I en yderligere observation fortsætter forskerne:

‘Selvom anbefalingspræstationen ser ud til at være fremragende, viser sammenligningen af Tabel 2 med Tabel 1 en interessant mønster.

‘Inden for hver gruppe er modellen med højere huskning også den, der viser bedre præstation i anbefalingstasken.

‘For eksempel overgår GPT-4o GPT-4o mini, og Llama-3.1 405B overgår Llama-3.1 70B og 8B.

‘Disse resultater fremhæver, at evaluering af LLM’er på datasset, der er lækket i deres træningsdata, kan føre til overoptimistisk præstation, drevet af huskning i stedet for generalisering.’

Med hensyn til effekten af modellens størrelse på dette problem observerede forfatterne en klar korrelation mellem størrelse, huskning og anbefalingspræstation, med større modeller, der ikke blot huskede mere af MovieLens-1M-datasset, men også opnåede bedre resultater i downstream-opgaver.

Llama-3.1 405B viste for eksempel en gennemsnitlig huskningsrate på 12,9%, mens Llama-3.1 8B kun huskede 5,82%. Denne næsten 55% reducering i genkaldelse svarede til en 54,23% reducering i nDCG og en 47,36% reducering i HR over evalueringsslutningerne.

Mønsteret holdt over hele linjen – hvor huskning reduceredes, reduceredes også den synlige præstation:

‘Disse resultater viser, at en øgning af modellens størrelse fører til større huskning af datasset, hvilket resulterer i forbedret præstation.

‘Derfor, selvom større modeller viser bedre anbefalingspræstation, stiller de også risici i forbindelse med potentiel lækkage af træningsdata.’

Den endelige test undersøgte, om huskning afspejler populæritetsforvrængning i MovieLens-1M. Genstande blev grupperet efter interaktionsfrekvens, og diagrammet nedenfor viser, at større modeller konsekvent favoriserer de mest populære indgange:

Item coverage by model across three popularity tiers: top 20% most popular; middle 20% moderately popular; and the bottom 20% least interacted items.

Item coverage by model across three popularity tiers: top 20% most popular; middle 20% moderately popular; and the bottom 20% least interacted items.

GPT-4o genskabte 89,06% af top-rangerede genstande, men kun 63,97% af de mindst populære. GPT-4o mini og mindre Llama-modeller viste meget lavere dækning over alle bånd. Forskerne mener, at denne tendens tyder på, at huskning ikke blot skalerer med modellens størrelse, men også forstærker eksisterende ubalancer i træningsdata.

De fortsætter:

‘Vores resultater viser en tydelig popularitetsforvrængning i LLM’er, hvor de øverste 20% af populære genstande er markant lettere at genskabe end de nederste 20%.

‘Dette mønster fremhæver træningsdatadistributionens indflydelse, hvor populære film er overrepræsenteret, hvilket fører til deres disproportionsvise huskning af modellerne.’

Konklusion

Dilemmat er ikke længere nyt: når træningssets størrelse øges, mindskes muligheden for at kuratere dem i omvendt proportion. MovieLens-1M, måske blandt mange andre, kommer ind i disse enorme korpora uden oversigt, anonymt blandt den enorme mængde af data.

Problemet gentager sig på hver skala og modstår automatisering. Enhver løsning kræver ikke blot indsats, men også menneskelig dømmekraft – den langsomme, fejlbarlige slags, som maskiner ikke kan levere. I denne henseende tilbyder den nye artikel ingen vej frem.

 

* En dækningsscore i denne kontekst er en procentdel, der viser, hvor meget af det originale datasset en sprogmodel kan genskabe, når den bliver spurgt på den rigtige måde. Hvis en model bliver promptet med en film-ID og responderer med den korrekte titel og genre, tæller det som en succesfuld genkaldelse. Det totale antal succesfulde genkaldelser divideres herefter med det totale antal indtastninger i datasset for at producere en dækningsscore. For eksempel, hvis en model korrekt returnerer information for 800 af 1.000 genstande, vil dens dækning være 80 procent.

Offentliggjort fredag, 16. maj 2025

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai