Angle d’Anderson

Les grands modèles de langage mémorisent les jeux de données destinés à les tester

mm
Ajouter Unite.AI à vos sources préférées sur Google
'Robot cheating in an exam' - ChatGPT-4o and Adobe Firefly

Si vous vous fiez à l’IA pour vous recommander ce que regarder, lire ou acheter, de nouvelles recherches indiquent que certains systèmes peuvent baser ces résultats sur la mémoire plutôt que sur les compétences: au lieu d’apprendre à faire des suggestions utiles, les modèles rappellent souvent des éléments des jeux de données utilisés pour les évaluer, ce qui conduit à des performances surestimées et à des recommandations qui peuvent être obsolètes ou mal adaptées à l’utilisateur.

 

Dans l’apprentissage automatique, un test-split est utilisé pour voir si un modèle entraîné a appris à résoudre des problèmes similaires, mais non identiques, à ceux sur lesquels il a été formé.

Ainsi, si un nouveau modèle d’IA de reconnaissance de races de chiens est formé sur un jeu de données de 100 000 photos de chiens, il comportera généralement un split 80/20 – 80 000 photos fournies pour former le modèle; et 20 000 photos retenues et utilisées comme matériel pour tester le modèle terminé.

Il est évident que si les données de formation du modèle d’IA incluent involontairement la section « secrète » de 20 % du test-split, le modèle obtiendra d’excellents résultats aux tests, car il connaît déjà les réponses (il a déjà vu 100 % des données du domaine). Bien sûr, cela ne reflète pas avec précision la façon dont le modèle se comportera plus tard, sur de nouvelles données « en direct », dans un contexte de production.

Spoilers de films

Le problème de tricherie de l’IA lors de ses examens a augmenté au rythme de l’échelle des modèles eux-mêmes. Puisque les systèmes d’aujourd’hui sont formés sur des corpus web-scraped vastes et indifférenciés tels que Common Crawl, la possibilité que les jeux de données de référence (c’est-à-dire les 20 % retenus) se glissent dans le mélange de formation n’est plus un cas de bord, mais la norme – un syndrome connu sous le nom de contamination de données; et à cette échelle, la curation manuelle qui pourrait détecter de telles erreurs est logistiquement impossible.

Ce cas est exploré dans un nouvel article de l’Institut polytechnique de Bari, en Italie, où les chercheurs se concentrent sur le rôle disproportionné d’un seul jeu de données de recommandation de films, MovieLens-1M, qu’ils affirment avoir été partiellement mémorisé par plusieurs modèles d’IA de pointe lors de la formation.

Parce que ce jeu de données est si largement utilisé dans le test des systèmes de recommandation, sa présence dans la mémoire des modèles rend potentiellement ces tests sans signification: ce qui apparaît comme de l’intelligence peut en fait être un simple rappel, et ce qui ressemble à une compétence de recommandation intuitive peut être simplement un écho statistique reflétant une exposition antérieure.

Les auteurs déclarent:

‘Nos résultats démontrent que les LLM possèdent une connaissance approfondie du jeu de données MovieLens-1M, couvrant les éléments, les attributs des utilisateurs et les historiques d’interaction. Notamment, une invite simple permet à GPT-4o de récupérer près de 80 % des enregistrements MovieID::Title.

‘Aucun des modèles examinés n’est exempt de ces connaissances, suggérant que les données MovieLens-1M sont probablement incluses dans leurs jeux de formation. Nous avons observé des tendances similaires dans la récupération des attributs des utilisateurs et des historiques d’interaction.’

Le court nouvel article est intitulé Les LLM mémorisent-ils les jeux de données de recommandation? Une étude préliminaire sur MovieLens-1M, et provient de six chercheurs de l’Institut polytechnique de Bari. Le pipeline pour reproduire leur travail a été mis à disposition sur GitHub.

Méthode

Pour comprendre si les modèles en question apprenaient vraiment ou se contentaient simplement de rappeler, les chercheurs ont commencé par définir ce que signifie la mémorisation dans ce contexte, et ont commencé par tester si un modèle était capable de récupérer des informations spécifiques du jeu de données MovieLens-1M, lorsqu’il était invité de la bonne manière.

Si un modèle était présenté avec un numéro d’ID de film et pouvait produire son titre et son genre, cela comptait comme une mémorisation d’élément; si il pouvait générer des détails sur un utilisateur (tels que l’âge, la profession ou le code postal) à partir d’un ID d’utilisateur, cela comptait également comme une mémorisation d’utilisateur; et si il pouvait reproduire la note de film suivante d’un utilisateur à partir d’une séquence connue de notes précédentes, cela était considéré comme une preuve que le modèle se souvenait peut-être de données d’interaction spécifiques, plutôt que d’apprendre des modèles généraux.

Chacune de ces formes de rappel a été testée à l’aide d’invites soigneusement rédigés, conçus pour inciter le modèle sans lui fournir de nouvelles informations. Plus la réponse était précise, plus il était probable que le modèle ait déjà rencontré ces données lors de la formation:

Zero-shot prompting pour le protocole d'évaluation utilisé dans le nouvel article. Source: https://arxiv.org/pdf/2505.10212

Zero-shot prompting pour le protocole d’évaluation utilisé dans le nouvel article. Source: https://arxiv.org/pdf/2505.10212

Données et tests

Pour créer un jeu de données approprié, les auteurs ont examiné des articles récents de deux des principales conférences du domaine, ACM RecSys 2024, et ACM SIGIR 2024. MovieLens-1M est apparu le plus souvent, cité dans plus d’un cinquième des soumissions. Puisque des études antérieures avaient atteint des conclusions similaires, cela n’était pas une surprise, mais plutôt une confirmation de la dominance du jeu de données.

MovieLens-1M se compose de trois fichiers: Movies.dat, qui liste les films par ID, titre et genre; Users.dat, qui mappe les ID d’utilisateur aux champs biographiques de base; et Ratings.dat, qui enregistre qui a noté quoi et quand.

Pour découvrir si ces données avaient été mémorisées par les grands modèles de langage, les chercheurs se sont tournés vers des techniques d’invites introduites pour la première fois dans l’article Extracting Training Data from Large Language Models, et plus tard adaptées dans le travail ultérieur Bag of Tricks for Training Data Extraction from Language Models.

La méthode est directe: poser une question qui reflète le format du jeu de données et voir si le modèle répond correctement. Zero-shot, Chain-of-Thought, et few-shot prompting ont été testés, et il a été constaté que la dernière méthode, dans laquelle le modèle est présenté avec quelques exemples, était la plus efficace; même si des approches plus élaborées pourraient donner lieu à un rappel plus élevé, cela a été considéré comme suffisant pour révéler ce qui avait été mémorisé.

Few-shot prompt utilisé pour tester si un modèle peut reproduire des valeurs spécifiques de MovieLens-1M lorsqu'il est interrogé avec un contexte minimal.

Few-shot prompt utilisé pour tester si un modèle peut reproduire des valeurs spécifiques de MovieLens-1M lorsqu’il est interrogé avec un contexte minimal.

Pour mesurer la mémorisation, les chercheurs ont défini trois formes de rappel: élément, utilisateur, et interaction. Ces tests examinaient si un modèle pouvait récupérer un titre de film à partir de son ID, générer des détails d’utilisateur à partir d’un ID d’utilisateur, ou prédire la note suivante d’un utilisateur en fonction des notes précédentes. Chacun a été noté à l’aide d’une métrique de couverture* qui reflétait la quantité de données du jeu qui pouvait être reconstruite grâce à l’invit.

Les modèles testés étaient GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; et Llama-3.1 8B. Tous ont été exécutés avec température réglée à zéro, top_p réglé à un, et les pénalités de fréquence et de présence désactivées. Une graine aléatoire fixe a garanti une sortie cohérente entre les exécutions.

Proportion d'entrées de MovieLens-1M récupérées à partir de movies.dat, users.dat et ratings.dat, avec les modèles regroupés par version et classés par nombre de paramètres.

Proportion d’entrées de MovieLens-1M récupérées à partir de movies.dat, users.dat et ratings.dat, avec les modèles regroupés par version et classés par nombre de paramètres.

Pour sonder à quel point MovieLens-1M avait été absorbé, les chercheurs ont invité chaque modèle à récupérer des entrées exactes des trois fichiers (précités) du jeu de données: Movies.dat, Users.dat, et Ratings.dat.

Les résultats des tests initiaux, présentés ci-dessus, révèlent des différences marquées non seulement entre les familles GPT et Llama, mais également entre les tailles de modèles. Alors que GPT-4o et GPT-3.5 turbo récupèrent de grandes parties du jeu de données avec facilité, la plupart des modèles open-source ne rappellent qu’une fraction du même matériel, suggérant une exposition inégale à cette référence lors de la formation préalable.

Ces différences ne sont pas minimes. Sur l’ensemble des trois fichiers, les modèles les plus forts n’ont pas seulement surpassé les modèles plus faibles, mais ont rappelé des portions entières de MovieLens-1M.

Dans le cas de GPT-4o, la couverture était suffisamment élevée pour suggérer qu’une part non négligeable du jeu de données avait été directement mémorisée.

Les auteurs déclarent:

‘Nos résultats démontrent que les LLM possèdent une connaissance approfondie du jeu de données MovieLens-1M, couvrant les éléments, les attributs des utilisateurs et les historiques d’interaction.

‘Notamment, une invite simple permet à GPT-4o de récupérer près de 80 % des enregistrements MovieID::Title. Aucun des modèles examinés n’est exempt de ces connaissances, suggérant que les données MovieLens-1M sont probablement incluses dans leurs jeux de formation. Nous avons observé des tendances similaires dans la récupération des attributs des utilisateurs et des historiques d’interaction.’

Ensuite, les auteurs ont testé l’impact de la mémorisation sur les tâches de recommandation en invitant chaque modèle à agir comme un système de recommandation. Pour évaluer les performances, ils les ont comparées à sept méthodes standard: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; et Aléatoire.

Le jeu de données MovieLens-1M a été divisé en 80/20 en jeux de formation et de test, en utilisant une stratégie d’échantillonnage leave-one-out pour simuler une utilisation réelle. Les métriques utilisées étaient Hit Rate (HR@[n]); et nDCG(@[n]):

Précision de la recommandation sur les références standard et les méthodes basées sur les LLM. Les modèles sont regroupés par famille et classés par nombre de paramètres. Les valeurs en gras indiquent le score le plus élevé dans chaque groupe.

Précision de la recommandation sur les références standard et les méthodes basées sur les LLM. Les modèles sont regroupés par famille et classés par nombre de paramètres, avec des valeurs en gras indiquant le score le plus élevé dans chaque groupe.

Ici, plusieurs grands modèles de langage ont surpassé les références traditionnelles dans toutes les métriques, avec GPT-4o établissant une large avance dans chaque colonne, et même des modèles de taille moyenne tels que GPT-3.5 turbo et Llama-3.1 405B surpassant régulièrement les méthodes de référence telles que BPRMF et LightGCN.

Parmi les variantes Llama plus petites, les performances ont varié fortement, mais Llama-3.2 3B se distingue, avec le HR@1 le plus élevé dans son groupe.

Les résultats, suggèrent les auteurs, indiquent que les données mémorisées peuvent se traduire par des avantages mesurables dans les tâches de recommandation, en particulier pour les modèles les plus forts.

Dans une observation supplémentaire, les chercheurs poursuivent:

‘Bien que les performances de recommandation semblent exceptionnelles, la comparaison du tableau 2 avec le tableau 1 révèle un modèle intéressant. Dans chaque groupe, le modèle avec une mémorisation plus élevée démontre également de meilleures performances dans la tâche de recommandation.

‘Par exemple, GPT-4o surpasse GPT-4o mini, et Llama-3.1 405B surpasse Llama-3.1 70B et 8B.

‘Ces résultats mettent en évidence que l’évaluation des LLM sur des jeux de données qui ont été divulgués dans leurs jeux de formation peut conduire à des performances trop optimistes, motivées par la mémorisation plutôt que par la généralisation.’

En ce qui concerne l’impact de la taille du modèle sur ce problème, les auteurs ont observé une corrélation claire entre la taille, la mémorisation et les performances de recommandation, les modèles plus grands retenant non seulement plus de données du jeu de données MovieLens-1M, mais également performant mieux dans les tâches en aval.

Llama-3.1 405B, par exemple, a montré un taux de mémorisation moyen de 12,9 %, tandis que Llama-3.1 8B n’a retenu que 5,82 %. Cette réduction de près de 55 % du rappel a correspondu à une baisse de 54,23 % de la nDCG et de 47,36 % du HR à travers les seuils d’évaluation.

Le modèle est maintenu tout au long – là où la mémorisation diminue, les performances apparentes diminuent également:

‘Ces résultats suggèrent que l’augmentation de la taille du modèle conduit à une mémorisation plus importante du jeu de données, ce qui se traduit par de meilleures performances.

‘Par conséquent, même si les modèles plus grands présentent de meilleures performances de recommandation, ils posent également des risques liés à une éventuelle fuite de données de formation.’

Le dernier test a examiné si la mémorisation reflète le biais de popularité intégré à MovieLens-1M. Les éléments ont été regroupés par fréquence d’interaction, et le graphique ci-dessous montre que les modèles plus grands favorisent systématiquement les entrées les plus populaires:

Couverture des éléments par modèle sur trois niveaux de popularité: 20 % les plus populaires; 20 % modérément populaires; et 20 % les moins interactifs.

Couverture des éléments par modèle sur trois niveaux de popularité: 20 % les plus populaires; 20 % modérément populaires; et 20 % les moins interactifs.

GPT-4o a récupéré 89,06 % des éléments les plus populaires, mais seulement 63,97 % des moins populaires. GPT-4o mini et les modèles Llama plus petits ont montré une couverture beaucoup plus faible dans toutes les bandes. Les chercheurs affirment que cette tendance suggère que la mémorisation non seulement augmente avec la taille du modèle, mais amplifie également les déséquilibres préexistants dans les données de formation.

Ils poursuivent:

‘Nos résultats révèlent un biais de popularité prononcé dans les LLM, les 20 % d’éléments les plus populaires étant nettement plus faciles à récupérer que les 20 % les moins populaires.

‘Cette tendance met en évidence l’influence de la distribution des données de formation, où les films populaires sont surreprésentés, ce qui conduit à leur mémorisation disproportionnée par les modèles.’

Conclusion

Le dilemme n’est plus nouveau: à mesure que les jeux de formation grandissent, la perspective de les curer diminue dans une proportion inverse. MovieLens-1M, peut-être parmi d’autres, entre dans ces vastes corpus sans surveillance, anonyme au milieu du volume de données.

Le problème se répète à chaque échelle et résiste à l’automatisation. Toute solution exige non seulement des efforts, mais également un jugement humain – le type lent et imparfait que les machines ne peuvent pas fournir. À cet égard, le nouvel article ne propose pas de voie à suivre.

 

* Une métrique de couverture dans ce contexte est un pourcentage qui montre combien du jeu de données original un modèle de langage est capable de reproduire lorsqu’il est invité avec la bonne question. Si un modèle est invité avec un ID de film et répond avec le titre et le genre corrects, cela compte comme un rappel réussi. Le nombre total de rappels réussis est ensuite divisé par le nombre total d’entrées dans le jeu de données pour produire un score de couverture. Par exemple, si un modèle retourne correctement des informations pour 800 éléments sur 1 000, sa couverture est de 80 %.

Publié pour la première fois vendredi 16 mai 2025

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]