Angle d’Anderson

Les données ‘Rogue’ polluant les performances des modèles d’IA génératifs

mm
Ajouter Unite.AI à vos sources préférées sur Google
Flux Dev, Firefly.

Une nouvelle étude révèle que de nombreux jeux de données d’images populaires utilisés pour entraîner les modèles d’IA sont contaminés par des images de test ou des quasi-duplicats, permettant ainsi aux modèles de tricher en mémorisant les réponses au lieu d’apprendre. Les fuites sont généralisées mais généralement non détectées, gonflant discrètement les scores et donnant un avantage injuste aux modèles formés sur des données à grande échelle.

 

Lorsque vous passez un examen de conduite, on ne vous indique généralement pas à l’avance exactement quels routes seront utilisées pour l’examen. Si c’était le cas (et que vous manquiez un peu d’intégrité), vous pourriez « optimiser » l’examen en vous entraînant régulièrement sur cette route, au lieu de développer des compétences de conduite plus larges qui peuvent gérer n’importe quelle route de manière raisonnable.

Dans la formation de modèles d’apprentissage automatique, ceci est une analogie raisonnable pour un test split – une division des données du jeu d’entraînement entre (généralement) une division de 70 % pour les données qui seront utilisées pour former le modèle, avec les 30 % restants utilisés comme données « en conditions réelles ».

Étant donné que les données en conditions réelles n’ont jamais été vues par le modèle, si le modèle se comporte bien sur ces données, on peut supposer qu’il est efficace et performant; si ce n’est pas le cas, le modèle peut avoir surapprenti sur un ensemble équilibré – ou bien les données nécessitaient une curation et une définition supplémentaires.

Quoi qu’il en soit, ne pas évaluer les modèles sur leurs données d’entraînement est la pierre angulaire de la méthode actuelle dans la recherche et le développement de l’IA.

Encore une fois, s’il vous plaît

Selon un nouvel article de recherche du Japon, le secteur de la recherche en vision par ordinateur et en IA générative n’a pas du tout égalé les efforts des chercheurs en LLM pour s’assurer que les données de test ne polluent pas les données d’entraînement; lors de tests, les chercheurs ont constaté que chaque jeu de données d’images à grande échelle qu’ils ont étudié, y compris ceux qui alimentent certains des plus grands systèmes d’IA génératifs actuels, a dans une certaine mesure permis à ses données de test de se croiser avec ses données d’entraînement – ce qui signifie que les références et les rapports de performance pour les modèles formés sur ces divisions ne seront pas plus précis que le résultat d’un examen d’un étudiant qui a introduit une tricherie dans la salle d’examen, et ne refléteront pas les performances réelles sur des données vraiment nouvelles.

Exemples de contamination des données trouvés par les chercheurs, où des points de données en double ou quasi-doubles existent à la fois dans les données d'entraînement et de test. Source: https://arxiv.org/pdf/2508.17416

Exemples de contamination des données trouvés par les chercheurs, où des points de données en double ou quasi-doubles existent à la fois dans les données d’entraînement et de test. Source: https://arxiv.org/pdf/2508.17416

Dans l’image ci-dessus, issue du nouvel article, nous voyons des exemples de points de données en double ou quasi-doubles trouvés à la fois dans les données d’entraînement et de test de divers modèles – suffisamment pour invalider les performances du modèle sur ces données et gonfler légèrement ses scores généraux, ce qui facilite l’apparence d’un niveau de généralisation que le modèle n’a peut-être pas réellement atteint.

Pour aggraver les choses, la contamination semble se produire dans une diversité de scénarios possibles, notamment la ‘pré-formation‘, où les poids des modèles ancestraux plus anciens sont utilisés pour « lancer » un nouveau modèle. Si le modèle ancestral en amont a certaines des mêmes données que le nouveau jeu de données qui est pré-formé, alors une contamination croisée peut se produire même si la division 70/30 ou 80/20 est propre.

Cumulatif

Ceci est presque certain de se produire même dans les derniers jeux de données: la portée des jeux de données de vision et de langage a considérablement augmenté au cours des cinq dernières années, englobant non seulement les nouvelles données d’images du Web, mais également la récolte d’une grande partie des mêmes données qui peuplaient les anciens jeux de données historiques.

De plus, les routines automatisées conçues pour parcourir et filtrer des milliards d’images pour les doublons et les quasi-doublons sont maintenant confrontées à une tâche si lourde que la curation elle-même – son coût en termes de temps et d’argent – doit maintenant être considérée dans le contexte des limites budgétaires

Pendant ce temps, la duplication d’images est une conséquence inévitable du type de ad hoc de collecte de données web derrière des collections massives telles que Common Crawl, en raison de la pratique courante de réaffichage et de recompression d’images, et d’application d’éditions telles que des crops, et même de retournement (pour éviter la détection, lorsque l’image peut avoir été utilisée sans autorisation, par exemple).

Les auteurs observent*:

‘La fuite de données est un problème répandu, prévalent dans la plupart des jeux de données visuels. La fuite peut obscurcir la capacité de généralisation des modèles, ce qui est particulièrement problématique lors de la comparaison de modèles formés sur différents jeux de données, ce qui conduit à des comparaisons injustes.

‘Nous exhortons les concepteurs de jeux de données à examiner attentivement les implications de ces évaluations. Pour une évaluation de modèle plus équitable, nous recommandons l’utilisation de détecteurs de doublons qui prennent en compte à la fois les fuites dures et douces.

‘Idéalement, les images fuies devraient être supprimées du jeu d’entraînement, et si cela n’est pas possible, elles devraient au moins être supprimées du jeu de test.’

L’article élabore sur une série de tests que les chercheurs ont menés sur des jeux de données massifs et populaires – chacun d’entre eux a montré un certain niveau de contamination.

Le nouvel article est intitulé Fuite de données dans les jeux de données visuels, et provient de trois chercheurs de l’Université d’Osaka.

Méthode

Les auteurs de l’article définissent la fuite en termes de trois dimensions: modalité, couverture, et degré.

Modalité distingue si seules les images sont fuies ou si les images et les étiquettes sont exposées; couverture identifie si le chevauchement se produit au sein du même jeu de données ou entre différents jeux de données; et degré définit si le contenu dupliqué est exactement le même ou simplement adjacent.

En ce qui concerne la fuite, les deux scénarios considérés dans le travail sont la fuite intra-jeu de données (où les images d’évaluation réapparaissent dans la division d’entraînement du même jeu de données), et la fuite inter-jeux de données (où les images d’évaluation d’un jeu de données sont présentes dans un autre jeu de données utilisé pour la formation).

En ce qui concerne le degré, les deux niveaux définis sont la fuite douce (où les images ne sont pas identiques mais présentent des variations mineures), et la fuite dure (où les images sont exactement les mêmes à travers les formations et les évaluations).

Les chercheurs abordent la détection de la fuite en termes de récupération d’images, en utilisant des encodeurs d’images pour représenter chaque image comme un vecteur de fonctionnalités. Le jeu de requête est les données d’évaluation, tandis que le collection est le jeu d’entraînement.

Pour les plus petits jeux de données, chaque vecteur de requête a été directement comparé à tous les vecteurs d’entraînement en utilisant la similarité cosinus. Pour les plus grands jeux de données, un index Faiss a été créé pour permettre une recherche plus rapide, K-Nearest Neighbors (KNN) recherche.

Étant donné que l’encodeur doit capturer suffisamment d’informations visuelles pour détecter des similitudes subtiles, mais doit encore rester efficace face à des volumes de données très élevés, les auteurs ont reposé sur des fonctionnalités CLIP précalculées mises à disposition par les créateurs de jeux de données, dans le cas de la collection LAION qui sous-tend la diffusion stable, et des projets ultérieurs.

Les auteurs notent que permettre à CLIP d’utiliser sa compréhension distillée du jeu de données (au lieu d’interroger les fichiers réels à grande échelle) a considérablement accéléré le processus et a offert une meilleure cohérence entre les comparaisons.

Données et tests

L’encodeur d’images CLIP utilisé dans les tests pour le nouvel article était le CLIP ViT-B/32 par défaut, à l’origine utilisé pour passer au crible LAION. Pour établir si des images diverses étaient liées les unes aux autres, KNN a été utilisé sous AutoFaiss.

Les jeux de données ont été regroupés en trois types: jeux de données de pré-formation – de grandes collections de données issues du web, utilisées pour former des modèles généralistes; jeux de données de formation – des collections plus petites, souvent annotées, destinées à un réglage de modèle direct; et jeux de données de référence – annotés manuellement, et utilisés exclusivement pour l’évaluation.

L’analyse a porté sur vingt divisions à travers sept jeux de données: Microsoft COCO a été utilisé à la fois comme jeu de formation et d’évaluation, en incorporant les divisions d’entraînement, de validation, de test et non étiquetées; Flickr30k a servi exclusivement de référence; et la collection Google Conceptual Captions (GCC) a été traitée comme une source de pré-formation, avec sa partie de validation également utilisée pour l’évaluation.

En outre, ImageNet a été utilisé à la fois pour la formation et la référence, tandis que le jeu de données LAION-400M a été utilisé uniquement pour la pré-formation.

OpenImages v4 a contribué aux données de formation et de référence, et TextCaps a fourni à la fois des divisions d’entraînement et de test pour l’évaluation.

Exemples d'annotations d'images de la collection Open Images de Google, examinés dans le nouvel article. Source: https://arxiv.org/pdf/1811.00982

Exemples d’annotations d’images de la collection Open Images de Google, examinés dans le nouvel article. Source: https://arxiv.org/pdf/1811.00982

Pour évaluer à quel point la méthode peut détecter la fuite lorsque les images ont été subtilement modifiées par le redimensionnement, la coupure ou des transformations non sémantiques similaires, les auteurs ont testé sur Flickr30k, en sélectionnant aléatoirement 5 000 images comme requêtes, et en utilisant l’ensemble du jeu de données comme collection de référence.

Chaque image de requête a été transformée avant d’être encodée (c’est-à-dire soumise à une modification non sémantique telle que le redimensionnement ou la coupure), puis mise en correspondance avec l’élément le plus similaire de la collection en utilisant la similarité cosinus; une correspondance n’a été comptée que si l’image d’origine a été récupérée comme résultat principal.

Les trois encodeurs comparés étaient ResNet-152; DINOv2 ViT-B/14; et CLIP ViT-B/32.

Quatre types de transformations d’images non sémantiques ont été utilisés: géométriques (retournements et rotations); coupure (suppression de 20, 50 ou 100 pixels de chaque bord); pixellisation (flou gaussien, ajout de bruit ou échantillonnage à 128 ou 256 pixels); et couleurs (niveaux de gris, inversion ou surimpression de rouge, vert ou bleu).

Du matériel supplémentaire, exemples des transformations appliquées aux données – routines typiques également dans le prétraitement de l'augmentation de données.

Du matériel supplémentaire, exemples des transformations appliquées aux données – routines typiques également dans le prétraitement de l’augmentation de données.

Les auteurs ont ensuite testé la fuite dans la récupération d’images:

Précision de détection de fuite sur 5 000 images de requête Flickr30k soumises à diverses transformations non sémantiques.

Précision de détection de fuite sur 5 000 images de requête Flickr30k soumises à diverses transformations non sémantiques.

Tous les trois encodeurs ont atteint des performances parfaites sur des images non modifiées, et CLIP est resté fiable à travers la coupure, les retournements horizontaux, le bruit et le redimensionnement, surpassant ResNet sur les modifications au niveau des pixels et des couleurs.

DINOv2 a montré une résilience forte aux transformations de couleurs (probablement en raison de sa conception auto-supervisée, estiment les auteurs), mais a été nettement plus faible sur les éditions géométriques et la coupure – les deux étant courantes dans les jeux de données dupliqués.

Puisque LAION inclut déjà des embeddings CLIP, et étant donné sa robustesse et sa vitesse constantes, CLIP a été choisi comme encodeur par défaut pour l’analyse principale.

Fuite dure et douce

Les performances ont été évaluées à différents seuils de similarité cosinus pour distinguer les images exactes et les quasi-duplicats (fuite dure et douce).

Un seuil de 0,98 a été sélectionné pour définir la fuite dure, aboutissant à aucun faux positif et à une détection parfaite d’images identiques.

Pour la fuite douce, un seuil de 0,95 a été choisi, permettant à davantage de quasi-duplicats d’être récupérés tout en maintenant un faible taux de faux positifs. La priorité a été donnée à la précision plutôt qu’à la recall, et les résultats ont donc été estimés de manière conservatrice:

Les courbes de caractéristique de fonctionnement ont été utilisées pour guider la sélection des seuils de fuite dure et douce. Les scores AUC élevés dans les conditions transformées et non transformées montrent que les quasi-duplicats peuvent être distingués de manière fiable des images non liées, même lorsque des modifications minimales sont présentes.

Les courbes de caractéristique de fonctionnement ont été utilisées pour guider la sélection des seuils de fuite dure et douce. Les scores AUC élevés dans les conditions transformées et non transformées montrent que les quasi-duplicats peuvent être distingués de manière fiable des images non liées, même lorsque des modifications minimales sont présentes.

Fuite intra-jeu de données

La fuite intra-jeu de données a été calculée en identifiant le chevauchement d’images entre les divisions d’entraînement et d’évaluation au sein du même jeu de données. Seuls les jeux de données dotés de divisions de référence et d’entraînement ou de pré-formation étaient éligibles, ce qui a limité l’analyse à COCO, GCC, ImageNet, OpenImages et TextCaps.

Pour COCO, le jeu de test a été comparé au jeu d’entraînement, au jeu d’évaluation et aux sous-ensembles non étiquetés, et le jeu de validation a été comparé aux jeux d’entraînement et non étiquetés.

Les taux de fuite intra-jeu de données les plus élevés ont été observés dans les jeux de test et de validation d’ImageNet, la fuite dure atteignant jusqu’à 1,58 % et la fuite douce juste en dessous de 2 %. GCC et COCO ont suivi, COCO val2017 montrant une fuite douce de 3 % et ses jeux de test allant de 1,35 % à 1,38 %. OpenImages a présenté une faible fuite dure à 0,05 %, mais la fuite douce a dépassé 1,3 % dans les jeux de test et de validation. TextCaps a montré la fuite globale la plus faible, à 0,69 %, sans fuite dure détectée:

Taux de fuite intra-jeu de données, montrant la proportion de chaque division d'évaluation qui chevauche avec ses données d'entraînement associées.

Taux de fuite intra-jeu de données, montrant la proportion de chaque division d’évaluation qui chevauche avec ses données d’entraînement associées.

En ce qui concerne ces résultats, les auteurs déclarent:

‘Ces résultats montrent que la fuite intra-jeu de données se produit dans tous les jeux de données analysés, soit dans leur forme dure, soit dans leur forme douce.

‘Étant donné que la fuite de données peut compromettre l’évaluation du modèle et que les jeux de données sont spécifiquement conçus à cette fin, la fuite intra-jeu de données est un risque qui par conception ne devrait pas exister.

‘Pourtant, nous avons identifié de multiples instances dans tous les jeux de données.’

Fuite inter-jeux de données

Pour mesurer la fuite inter-jeux de données (où un modèle est formé sur un jeu de données et évalué sur un autre), quatre jeux de données ont été utilisés comme sources de données d’entraînement: GCC train, ImageNet train, OpenImages train, et LAION.

Ces jeux de données ont été mis en correspondance avec des données d’évaluation issues de la division de test et de validation de COCO 2014, Flickr30K, TextCaps test, la division de test et de validation d’OpenImages, et la division de test et de validation d’ImageNet.

Les embeddings CLIP ViT-B/32 ont été extraits pour tous les jeux de données, à l’exception de LAION, qui fournit ses propres embeddings précalculés. Cependant, puisque ces embeddings diffèrent légèrement de ceux générés à l’aide de la mise en œuvre officielle de CLIP, les images de requête ont été rééchelonnées selon la méthode utilisée dans le référentiel clip-retrieval pour assurer la compatibilité.

La récupération a été effectuée à l’aide d’une recherche KNN, bien que l’échelle de LAION ait nécessité un partitionnement en blocs d’images d’un million, avec chaque bloc indexé séparément:

Fuite inter-jeux de données entre les jeux de données de référence (colonnes) et les jeux de données de pré-formation (lignes). À gauche, nous voyons la 'fuite dure' (images identiques), et à droite, la 'fuite douce' (quasi-duplicats).

Fuite inter-jeux de données entre les jeux de données de référence (colonnes) et les jeux de données de pré-formation (lignes). À gauche, nous voyons la ‘fuite dure’ (images identiques), et à droite, la ‘fuite douce’ (quasi-duplicats).

La fuite inter-jeux de données a été observée à travers tous les jeux de données de référence, avec des degrés de gravité variables. LAION a montré les taux de fuite dure les plus élevés (images identiques), en particulier pour les données de test d’OpenImages et TextCaps, dépassant chacun 3 %. OpenImages a également contribué à une petite quantité de fuite dure à COCO.

Bien que moins grave, ImageNet contenait encore des duplicats durs provenant de chaque référence examinée; et GCC a montré la fuite dure globale la plus faible, restant en dessous de 1 %.

La fuite douce (quasi-duplicats) était plus répandue: LAION a à nouveau produit les taux les plus élevés, avec jusqu’à 7,9 % de chevauchement pour certaines références; OpenImages et TextCaps étaient les références les plus touchées dans l’ensemble; et Flickr30k a montré la fuite la plus faible.

Bien que ces chevauchements puissent ne représenter qu’une petite partie des ensembles d’évaluation, les auteurs notent que leur présence peut permettre la mémorisation et compromettre la validité des tests:

Exemples d'images fuies. À gauche, des cas de 'fuite dure', où les images sont identiques dans un jeu de données (en haut) ou entre les jeux de données (en bas); à droite, des cas de 'fuite douce', où les images sont visuellement quasi-identiques.

Exemples d’images fuies. À gauche, des cas de ‘fuite dure’, où les images sont identiques dans un jeu de données (en haut) ou entre les jeux de données (en bas); à droite, des cas de ‘fuite douce’, où les images sont visuellement quasi-identiques.

Effet sur l’évaluation en aval

L’article examine ensuite comment la fuite de données affecte les évaluations en aval (c’est-à-dire les performances sur des tâches standard lorsque les modèles pré-formés sont testés sur des références qui contiennent des données d’entraînement dupliquées).

Trois tâches ont été considérées: classification à zéro coup; classification supervisée; et récupération d’images-texte.

Pour chaque tâche, les performances du modèle ont été évaluées sur un jeu de données de référence pour lequel des échantillons fuies avaient déjà été identifiés dans les données de pré-formation. Les résultats ont été comparés à travers quatre sous-ensembles: l’ensemble de référence complet; un sous-ensemble d’échantillons fuies; un sous-ensemble d’échantillons non fuies; et un sous-ensemble aléatoire de la même taille que le groupe fuie (utilisé comme contrôle).

L’effet de la fuite de données sur trois tâches en aval a été mesuré en utilisant des sous-ensembles de référence connus pour contenir des images fuies. Dans la classification à zéro coup, un modèle pré-formé sur LAION a atteint une précision nettement plus élevée sur les images fuies de l’ensemble de validation d’ImageNet, confirmant que l’exposition à des quasi-duplicats pendant la formation fournit un avantage mesurable:

Précision de classification à zéro coup sur l'ensemble de validation d'ImageNet à travers les sous-ensembles avec et sans fuite. La colonne finale rapporte les gains de précision par rapport à l'ensemble complet, et les lignes mises en évidence correspondent aux sous-ensembles fuies.

Précision de classification à zéro coup sur l’ensemble de validation d’ImageNet à travers les sous-ensembles avec et sans fuite. La colonne finale rapporte les gains de précision par rapport à l’ensemble complet, et les lignes mises en évidence correspondent aux sous-ensembles fuies.

Pour la classification supervisée, la fuite dans ImageNet a entraîné une chute spectaculaire des performances – à moins que l’image fuie n’ait la même étiquette dans les deux divisions, auquel cas le modèle a atteint une précision quasi-parfaite, révélant un effet de mémorisation fort:

Précision de classification supervisée sur l'ensemble de validation d'ImageNet pour les sous-ensembles avec et sans fuite. Les colonnes de gain montrent le changement par rapport à l'ensemble complet. Les sous-ensembles fuies sont mis en évidence.

Précision de classification supervisée sur l’ensemble de validation d’ImageNet pour les sous-ensembles avec et sans fuite. Les colonnes de gain montrent le changement par rapport à l’ensemble complet. Les sous-ensembles fuies sont mis en évidence.

Dans la récupération d’images-texte, les performances ont à nouveau été améliorées pour les échantillons fuies, avec à la fois la fuite dure et douce conduisant à un rappel plus élevé, et les sous-ensembles fuies donnant également des résultats plus cohérents entre les exécutions:

Performances de récupération d'images-texte sur Flickr30k à travers les sous-ensembles avec et sans fuite, les sous-ensembles fuies étant mis en évidence.

Performances de récupération d’images-texte sur Flickr30k à travers les sous-ensembles avec et sans fuite, les sous-ensembles fuies étant mis en évidence.

Les auteurs concluent:

‘Dans l’ensemble, nous [montrons] des preuves cohérentes que la fuite pose une menace sérieuse à l’évaluation équitable des modèles dans les jeux de données visuels, compromettant l’un des principes fondamentaux de l’apprentissage automatique: ne pas évaluer les modèles sur leurs données d’entraînement.’

Conclusion

Un aspect choquant de l’article, bien que ce ne soit pas une nouveauté, est le compte rendu de l’utilisation de CLIP pour obtenir des embeddings pour la vaste montagne de données d’images dans LAION, représentant une échelle qui ne peut plus être abordée d’aucune autre manière que par agrégat, en traitant des métadonnées tokenisées au lieu des caractéristiques plus détaillées qui peuvent être inspectées lorsque le jeu de données est plus gérable.

C’est une illustration frappante de l’étendue à laquelle la formation de modèles de vision et de langage a définitivement dépassé les limites et les capacités de la surveillance humaine, ou de tout type de curation manuelle au-delà d’échantillons représentatifs.

 

* Peut-être de manière quelque peu confuse, le problème de duplication est défini dans l’article comme ‘fuite’.

Insistance des auteurs.

Publié pour la première fois mardi 26 août 2025

Écrivain sur l'apprentissage automatique, spécialiste du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : [email protected]