Andersons vinkel

Stora språkmodeller memoriserar testdatamängderna som är avsedda att testa dem

mm
Lägg till Unite.AI bland dina föredragna källor på Google
'Robot cheating in an exam' - ChatGPT-4o and Adobe Firefly

Om du förlitar dig på AI för att rekommendera vad du ska titta på, läsa eller köpa, visar ny forskning att vissa system kan basera dessa resultat på minne snarare än färdighet: istället för att lära sig att göra användbara förslag, återkallar modellerna ofta artiklar från de datamängder som används för att utvärdera dem, vilket leder till överdriven prestanda och rekommendationer som kan vara föråldrade eller dåligt anpassade till användaren.

 

I maskinlärning används en testdelning för att se om en tränad modell har lärt sig att lösa problem som är liknande, men inte identiska med det material den tränades på.

Så om en ny AI-modell för “hundrasigillig” känning tränas på en datamängd med 100 000 bilder av hundar, kommer den vanligtvis att ha en 80/20-delning – 80 000 bilder som tillhandahålls för att träna modellen; och 20 000 bilder som hålls tillbaka och används som material för att testa den färdiga modellen.

Det är uppenbart att om AI:s träningsdata oavsiktligt innehåller den “hemliga” 20-procentiga delen av testdelningen, kommer modellen att klara testet, eftersom den redan känner till svaren (den har redan sett 100 procent av domändata). Detta återspeglar naturligtvis inte korrekt hur modellen kommer att fungera senare, på nya “live”-data, i en produktionskontext.

Filmspoiler

Problemet med AI som fusk på sina prov har vuxit i takt med modellernas storlek. Eftersom dagens system tränas på enorma, ostrukturerade webb-skrämda korpusar som Common Crawl, är möjligheten att benchmark-datamängder (dvs. den tillbakahållna 20 procenten) hamnar i träningsblandningen inte längre en randfall, utan standard – ett syndrom som kallas dataförorening; och i denna skala är den manuella kurering som kunde upptäcka sådana fel logistiskt omöjlig.

Detta fall undersöks i en ny rapport från Italiens Politecnico di Bari, där forskarna fokuserar på den oproportionerliga rollen som en enda filmrekommendationsdatamängd, MovieLens-1M, som de hävdar har memoriserats av flera ledande AI-modeller under träning.

Eftersom denna specifika datamängd används så mycket i testning av rekommendationssystem, kan dess närvaro i modellernas minne potentiellt göra dessa tester meningslösa: vad som verkar vara intelligens kan i själva verket vara enkel återkallning, och vad som ser ut som en intuitiv rekommendationsskicklighet kan bara vara en statistisk ekon som återspeglar tidigare exponering.

Författarna hävdar:

‘Våra fynd visar att LLM har omfattande kunskap om MovieLens-1M-datamängden, som täcker artiklar, användarattribut och interaktionshistorier.

‘Noterbart är att en enkel prompt möjliggör för GPT-4o att återställa nästan 80 procent av [filmnamnen i datamängden]. Inga av de undersökta modellerna är fria från denna kunskap, vilket tyder på att MovieLens-1M-data sannolikt ingår i deras träningsuppsättningar.

‘Vi observerade liknande trender vid återvinning av användarattribut och interaktionshistorier.’

Den korta nya rapporten heter Memoriserar LLM rekommendationsdatamängder? En preliminär studie om MovieLens-1M och kommer från sex Politecnico-forskare. Pipelinen för att reproducera deras arbete har gjorts tillgänglig på GitHub.

Metod

För att förstå om modellerna i fråga verkligen lärde sig eller bara återkallade, började forskarna med att definiera vad memorisering betyder i detta sammanhang och började med att testa om en modell kunde hämta specifika informationsbitar från MovieLens-1M-datamängden, när den tillfrågades på rätt sätt.

Om en modell visades en films ID-nummer och kunde producera dess titel och genre, räknades det som att memorisera en artikel; om den kunde generera information om en användare (såsom ålder, yrke eller postnummer) från en användar-ID, räknades det också som användarmemorisering; och om den kunde reproducera en användares nästa filmbedömning från en känd sekvens av tidigare, togs det som bevis för att modellen kan återkalla specifik interaktionsdata, snarare än att lära sig allmänna mönster.

Var och en av dessa former av återkallande testades med hjälp av noggrant skrivna prompter, utformade för att puffa modellen utan att ge den ny information. Ju mer exakt svaret var, desto mer sannolikt var det att modellen redan hade stött på den data under träning:

Zero-shot-promptning för utvärderingsprotokollet som används i den nya rapporten. Källa: https://arxiv.org/pdf/2505.10212

Zero-shot-promptning för utvärderingsprotokollet som används i den nya rapporten. Källa: https://arxiv.org/pdf/2505.10212

Data och tester

För att kurera en lämplig datamängd undersökte författarna nyliga artiklar från två av fältets stora konferenser, ACM RecSys 2024 och ACM SIGIR 2024. MovieLens-1M dök upp oftast, citerad i lite över en femtedel av inlämningshandlingarna. Eftersom tidigare studier hade nått liknande slutsatser, var detta inte en överraskande result, utan snarare en bekräftelse på datamängdens dominans.

MovieLens-1M består av tre filer: Movies.dat, som listar filmer efter ID, titel och genre; Users.dat, som kartlägger användar-ID till grundläggande biografiska fält; och Ratings.dat, som registrerar vem som betygsatte vad och när.

För att ta reda på om denna data hade memoriserats av stora språkmodeller, vände sig forskarna till prompttekniker som först introducerades i artikeln Att extrahera träningsdata från stora språkmodeller och senare anpassades i det efterföljande arbetet En samling tricks för att extrahera träningsdata från språkmodeller.

Metoden är direkt: ställ en fråga som speglar datamängdens format och se om modellen svarar korrekt. Zero-shot, Chain-of-Thought och few-shot-promptning testades, och det visade sig att den senare metoden, där modellen visas ett fåtal exempel, var den mest effektiva; även om mer avancerade tillvägagångssätt kan ge högre återkallande, ansågs detta tillräckligt för att avslöja vad som hade memoriserats.

Few-shot-prompt använd för att testa om en modell kan reproducera specifika MovieLens-1M-värden när den tillfrågas med minimal kontext.

Few-shot-prompt använd för att testa om en modell kan reproducera specifika MovieLens-1M-värden när den tillfrågas med minimal kontext.

För att mäta memorisering definierade forskarna tre former av återkallande: artikel, användare och interaktion. Dessa tester undersökte om en modell kunde hämta en filmrubrik från dess ID, generera användardetaljer från ett användar-ID eller förutsäga en användares nästa betyg baserat på tidigare.

Modellerna som testades var GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; och Llama-3.1 8B. Alla kördes med temperatur inställd på noll, top_p inställd på ett, och både frekvens och närvaro straff avaktiverade. En fast slumpmässig seed säkerställde konsekvent utdata över körningar.

Andel av MovieLens-1M-poster som hämtats från movies.dat, users.dat och ratings.dat, med modeller grupperade efter version och sorterade efter parameterantal.

Andel av MovieLens-1M-poster som hämtats från movies.dat, users.dat och ratings.dat, med modeller grupperade efter version och sorterade efter parameterantal.

För att undersöka hur djupt MovieLens-1M hade absorberats, puffade forskarna varje modell för exakta poster från datamängdens tre (ovannämnda) filer: Movies.dat, Users.dat och Ratings.dat.

Resultat från de första testerna, som visas ovan, visar skarpa skillnader inte bara mellan GPT- och Llama-familjerna, utan också över modellstorlekar. Medan GPT-4o och GPT-3.5 turbo återställer stora delar av datamängden med lätthet, återkallar de flesta öppen källkodsmodellerna endast en bråkdel av samma material, vilket tyder på ojämn exponering för denna benchmark under förträning.

Dessa är inte små marginaler. Över alla tre filer presterade de starkaste modellerna inte bara bättre än svagare modeller, utan återkallade hela delar av MovieLens-1M.

I fallet med GPT-4o var täckningen tillräckligt hög för att antyda att en icke försumbar andel av datamängden hade memoriserats direkt.

Författarna hävdar:

‘Våra fynd visar att LLM har omfattande kunskap om MovieLens-1M-datamängden, som täcker artiklar, användarattribut och interaktionshistorier.

‘Noterbart är att en enkel prompt möjliggör för GPT-4o att återställa nästan 80 procent av MovieID::Titel-posterna. Inga av de undersökta modellerna är fria från denna kunskap, vilket tyder på att MovieLens-1M-data sannolikt ingår i deras träningsuppsättningar.

‘Vi observerade liknande trender vid återvinning av användarattribut och interaktionshistorier.’

Sedan testade författarna effekten av memorisering på rekommendationsuppgifter genom att puffa varje modell för att agera som ett rekommendationssystem. För att utvärdera prestanda jämfördes utdata mot sju standardmetoder: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; och Random.

MovieLens-1M-datamängden delades upp i 80/20 i tränings- och testuppsättningar, med en leave-one-out-strategi för att simulera verklig användning. Metrikerna som användes var Hit Rate (HR@[n]); och nDCG(@[n]):

Rekommendationsnoggrannhet på standardbaslinjer och LLM-baserade metoder. Modeller grupperade efter familj och sorterade efter parameterantal. Värden i fetstil indikerar den högsta poängen inom varje grupp.

Rekommendationsnoggrannhet på standardbaslinjer och LLM-baserade metoder. Modeller grupperade efter familj och sorterade efter parameterantal, med värden i fetstil som indikerar den högsta poängen inom varje grupp.

Här presterade flera stora språkmodeller bättre än traditionella baslinjer över alla metriker, med GPT-4o som etablerade en stor ledning i varje kolumn, och till och med medelstora modeller som GPT-3.5 turbo och Llama-3.1 405B konsekvent överträffade benchmark-metoder som BPRMF och LightGCN.

Bland mindre Llama-variationer varierade prestandan skarpt, men Llama-3.2 3B utmärker sig, med den högsta HR@1 i sin grupp.

Resultaten, författarna föreslår, indikerar att memoriserad data kan översättas till mätbara fördelar i rekommendationsliknande promptning, särskilt för de starkaste modellerna.

I en ytterligare observation fortsätter forskarna:

‘Även om rekommendationsprestandan verkar utmärkt, visar en jämförelse mellan tabell 2 och tabell 1 en intressant trend. Inom varje grupp är modellen med högre memorisering också den som presterar bättre i rekommendationsuppgiften.

‘Till exempel presterar GPT-4o bättre än GPT-4o mini, och Llama-3.1 405B presterar bättre än Llama-3.1 70B och 8B.

‘Dessa resultat betonar att utvärdering av LLM på datamängder som läckt in i deras träningsdata kan leda till överoptimistisk prestanda, driven av memorisering snarare än generalisering.’

När det gäller modellens storlek observerade författarna en tydlig korrelation mellan storlek, memorisering och rekommendationsprestanda, med större modeller som inte bara behöll mer av MovieLens-1M-datamängden, utan också presterade bättre i nedströmsuppgifter.

Llama-3.1 405B visade till exempel en genomsnittlig memoriseringstakt på 12,9 procent, medan Llama-3.1 8B endast behöll 5,82 procent. Denna nästan 55-procentiga minskning av återkallande motsvarade en 54,23-procentig minskning av nDCG och en 47,36-procentig minskning av HR över utvärderingsgränserna.

Mönstret hölls genom hela – där memorisering minskade, minskade också den uppenbara prestandan:

‘Dessa fynd tyder på att en ökning av modellens storlek leder till större memorisering av datamängden, vilket resulterar i förbättrad prestanda.

‘Följaktligen, medan större modeller visar bättre rekommendationsprestanda, innebär de också risker relaterade till potentiell läckage av träningsdata.’

Den sista testen undersökte om memorisering återspeglar popularitetsbias som är inbyggd i MovieLens-1M. Artiklarna grupperades efter interaktionsfrekvens, och diagrammet nedan visar att större modeller konsekvent favoriserade de mest populära posterna:

Artikelns täckning per modell över tre popularitetsnivåer: de 20 procent mest populära; de 20 procent mest mittengagerade; och de 20 procent minst interagerade artiklarna.

Artikelns täckning per modell över tre popularitetsnivåer: de 20 procent mest populära; de 20 procent mittengagerade; och de 20 procent minst interagerade artiklarna.

GPT-4o återställde 89,06 procent av de högst rankade artiklarna, men endast 63,97 procent av de minst populära. GPT-4o mini och mindre Llama-modeller visade mycket lägre täckning över alla band.

Forskarna hävdar att denna trend tyder på att memorisering inte bara ökar med modellstorlek, utan också förstärker befintliga obalanser i träningsdata.

De fortsätter:

‘Våra fynd visar en uttalad popularitetsbias i LLM, där de 20 procent mest populära artiklarna är betydligt lättare att hämta än de 20 procent minst populära.

‘Denna trend betonar träningsdatadistributionens inflytande, där populära filmer är överrepresenterade, vilket leder till deras oproportionerliga memorisering av modellerna.’

Slutsats

Dilemmat är inte längre nytt: allteftersom träningsuppsättningarna växer, minskar möjligheten att kurera dem i omvänd proportion. MovieLens-1M, kanske tillsammans med många andra, kommer in i dessa enorma korpusar utan tillsyn, anonym bland den enorma mängden data.

Problemet upprepar sig i varje skala och motstår automatisering. Varje lösning kräver inte bara ansträngning, utan också mänsklig bedömning – den långsamma, felföryggade typen som maskiner inte kan tillhandahålla. I detta avseende erbjuder den nya rapporten ingen väg framåt.

 

* En täckningsmetrik i detta sammanhang är en procent som visar hur mycket av den ursprungliga datamängden en språkmodell kan reproducera när den tillfrågas på rätt sätt. Om en modell tillfrågas med ett film-ID och svarar med den korrekta titeln och genren, räknas det som en lyckad återkallning. Antalet lyckade återkallanden divideras sedan med det totala antalet poster i datamängden för att producera en täckningspoäng. Till exempel, om en modell korrekt returnerar information för 800 av 1 000 artiklar, är dess täckning 80 procent.

Publicerad första gången fredagen den 16 maj 2025

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai