Angle d’Anderson

L’IA cite les mêmes articles encore et encore – Tout comme les humains

mm
Ajouter Unite.AI à vos sources préférées sur Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT et d’autres outils d’écriture IA pourraient discrètement transformer la science en un concours de popularité, orientant sans cesse les chercheurs vers les mêmes articles tout en négligeant les travaux nouveaux et novateurs qui pourraient réellement faire progresser le domaine.

 

Monoculture, en termes de fréquence et de statistiques, désigne le fait que le même ensemble limité de sources ou d’actifs se répète sans cesse, étouffant les voix nouvelles et les perspectives fraîches: le même ensemble limité de chansons dans la programmation radio: le même ensemble d’auteurs et de livres dans les rayons d’aéroports: et la même sélection restreinte de fruits et légumes dans les supermarchés:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Oui, nous n’avons que ces bananes – et seulement ces bananes. L’homogénéité des fruits et légumes dans les chaînes alimentaires occidentales ignore les centaines d’autres espèces possibles dans chaque cas, car les différentes filières de génération et de transport sont trop coûteuses à industrialiser pour des types divers de fruits ou légumes.  Source

Cela se produit également dans les citations qui apparaissent dans les nouvelles recherches scientifiques, où les chercheurs, peut‑être par paresse, se rabattent sur un ensemble « fiable » de sources qui gagnent en ampleur jusqu’à dominer les filières de recherche.

On appelle cela l’Effet Matthieu – une théorie sociologique qui suggère que les incumbents bénéficieront toujours ; le syndrome a été comparé à la promesse faite dans Matthieu 13:12, qui déclare « Celui qui a, on le lui donnera davantage, et il aura en abondance. Celui qui n’a pas, même ce qu’il possède lui sera enlevé ».

Le groupe en vogue

L’un des grands espoirs de la recherche augmentée par l’IA était que de nouvelles méthodes d’apprentissage automatique pourraient sortir de l’effet Matthieu – également appelé biais de popularité – et commencer à citer des travaux moins connus qui pourraient être plus incisifs, ou plus pertinents par rapport au point développé dans un article.

Cependant, compte tenu de la manière dont les routines d’entraînement de l’IA interprètent les jeux de données, il n’y a jamais eu de raison valable d’alimenter cet optimisme ; et il a été constaté à plusieurs reprises que lorsque l’IA n’invente pas de citations de façon flagrante – un problème chronique à ce jour – elle perpétue effectivement l’effet Matthieu, tout comme les humains – bien que peut‑être pas pour la même raison.

Lors de l’entraînement, un modèle apprendra à classer très haut les articles les plus cités (ou les plus souvent répétés) d’un jeu d’entraînement, car les routines d’entraînement sont conçues pour extraire des motifs significatifs, et pour écarter les valeurs aberrantes comme du « bruit », ou des anomalies statistiques.

Dans ce régime, l’équivalent de la théorie de la relativité d’Einstein ne recevrait jamais d’attention de la machine, qui, une fois entraînée, estime avoir déjà trouvé ses principes et référents, et ne peut ajuster légèrement cette position qu’en accédant à des publications plus récentes via RAG, ou par d’autres moyens qui étendent la portée du modèle au‑delà de sa matrice d’entraînement.

Le problème est qu’il ne créditera pas ces nouveaux travaux de la même façon que les « vieux favoris » qu’il connaît déjà, voire pas du tout, car ses biais statistiques sont désormais bien ancrés.

Ainsi, l’IA n’observe pas réellement et n’imite pas le comportement humain lorsqu’elle perpétue l’effet Matthieu – elle ne fait que compter le nombre de fois où les chercheurs, par paresse, se rabattent sur les mêmes vieux articles, et les classe de façon similaire. À cet égard, le problème de la répétition des citations est lié au défi de sélectionner un article scientifique réellement intéressant parmi la tempête toujours croissante des publications de recherche en IA, dans la mesure où le travail le plus solide aura souvent le signal le plus faible.

Diagnostiquer la monoculture

Cette problématique est abordée dans un nouvel article intéressant provenant des États‑Unis intitulé When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Ce nouveau travail – une collaboration entre l’Université du Texas à Austin, le Stevens Institute of Technology, la Washington University à St Louis, l’Université Rice et l’Université de Notre‑Dame – vise à prouver de façon définitive l’existence d’une monoculture de citations dans l’apprentissage automatique, afin que ses variables puissent éventuellement être traitées directement à l’avenir, ainsi que le problème lui‑-même.

Dans les tests, les auteurs ont constaté que onze modèles d’OpenAI, Google et Anthropic privilégiaient à plusieurs reprises le même petit groupe d’articles – même après que les signaux de popularité évidents aient été éliminés.

Pour tester cela, 120 articles réels ont été dépouillés de leurs nombres de citations et de leurs lieux de publication, les noms d’auteurs ont été remplacés, et les années de publication réassignées aléatoirement. Des ensembles aléatoires de trente articles ont ensuite été présentés à chaque modèle, qui était autorisé à citer au maximum dix articles.

Huit experts humains dans les domaines concernés ont reçu les mêmes articles anonymisés, mais n’ont pas convergé vers les mêmes favoris que les IA, indiquant que le biais était spécifique aux modèles d’IA plutôt qu’aux articles eux‑mêmes :

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

À partir du nouvel article, résultats de test comparant les choix de citations des modèles d’IA et des experts humains. Sur les onze modèles, les citations étaient concentrées sur un petit groupe d’articles, tandis que certains articles étaient systématiquement ignorés. Les experts humains n’ont montré aucune de ces tendances. Source – https://arxiv.org/pdf/2608.19230 Source

Les mêmes articles restaient populaires même lorsque les modèles étaient uniquement invités à choisir des références, montrant que la rédaction de la revue elle‑même n’était pas à l’origine du biais.

L’expérience a ensuite été prolongée sur onze cycles, avec 120 articles rédigés par IA ajoutés après chaque cycle, afin de tester ce qui se passe lorsque ces préférences partagées opèrent dans un bassin croissant de recherches générées par IA.

À mesure que davantage d’articles rédigés par IA étaient ajoutés, les modèles concentraient de plus en plus leurs citations sur un nombre décroissant d’articles humains originaux.

‘À mesure que les modèles de langage passent de la rédaction de prose à l’exécution d’agents de recherche documentaire avec des appels d’outils, les références fabriquées deviennent plus faciles à détecter et à contraindre.’

‘L’échec plus difficile commence après que chaque candidat soit réel : différents modèles peuvent encore sélectionner le même sous‑ensemble étroit, produisant une monoculture de citations sans qu’aucune citation individuelle ne soit erronée.’

En vue de remédier au problème, l’article soutient que simplement mélanger des modèles de différents fournisseurs ou donner une exposition égale aux articles ne suffira pas, puisque une grande partie de la préférence est partagée entre les modèles. Au contraire, la préférence sous‑jacente pour certains articles devrait changer – éventuellement en accordant délibérément plus de visibilité aux articles négligés. Cependant, les auteurs soulignent que cette approche reste non testée.

Approches de test

Le banc d’essai a été construit à partir de 120 vrais articles de distillation de connaissances recueillis sur arXiv et publiés entre 2015 et 2022. Chaque article comptait entre 50 et 500 citations au moment de la collecte, une fourchette choisie pour exclure à la fois les travaux obscurs et ceux exceptionnellement influents.

L’expérience a commencé en tirant trente articles au hasard de la collection disponible, avec les noms d’auteurs, les années de publication et les nombres de citations masqués. Chaque modèle a produit une courte revue ou un texte de position citant au maximum dix articles, et ces choix ont été comparés à des sélections aléatoires du même matériel:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Méthode utilisée pour tester les préférences de citation. Trente articles sélectionnés aléatoirement ont été présentés à un modèle avec les informations d’identification cachées, après quoi il pouvait citer jusqu’à dix. Ses choix ont été comparés à une sélection aléatoire, tandis que chaque cycle ajoutait 120 articles rédigés par IA à la collection du cycle suivant.

Dans l’expérience prolongée, 120 nouveaux articles générés ont été ajoutés à la collection après chaque cycle, augmentant progressivement la proportion de recherches rédigées par IA.

Lors des tests préliminaires, les modèles avaient tendance à citer la plupart des articles qui leur étaient présentés, sélectionnant généralement entre 22 et 27 sur les 30. Les chercheurs ont donc fixé un maximum de dix citations pour l’expérience principale, obligeant les modèles à faire des choix plus sélectifs.

Ci‑dessus, nous voyons un résumé du dispositif expérimental résultant:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Configuration expérimentale utilisée pour tester les préférences de citation. L’étude a débuté avec 120 vrais articles et a testé onze modèles de trois fournisseurs, en utilisant des ensembles aléatoires de 30 articles et un maximum de dix citations. Les cycles ultérieurs ont ajouté des articles générés par IA, portant la collection à 1 440 articles.

L’expérience initiale a utilisé onze modèles des trois principaux fournisseurs: OpenAI était représenté par GPT-5, GPT-5 mini, GPT-4.1 et GPT-4.1 mini ; Google par Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro et Gemini 3.1 Flash-Lite ; et Anthropic par Claude Opus 4.8, Claude Sonnet 4.6 et Claude Haiku 4.5.

Dans les résultats de test présentés ci‑dessous, nous voyons à quel point chaque modèle a concentré ses citations sur un petit groupe d’articles ; combien d’articles il a totalement ignorés ; et à quel point il a fait les mêmes choix lorsque l’expérience a été répétée:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Résultats de test montrant à quel point chaque modèle a concentré ses citations sur des articles particuliers et combien d’articles il a totalement ignorés. La « part du top 10 % » indique le nombre de citations allées aux 12 articles les plus favorisés, tandis que le « HHI » mesure le degré de concentration des citations globalement. La « Fiabilité » montre à quel point chaque modèle a favorisé les mêmes articles de façon cohérente au cours des tests, et ρ indique à quel point ces préférences étaient similaires entre les modèles. La ligne « Null apparié » indique ce qui serait attendu si les articles étaient choisis aléatoirement.

Que favorisent réellement les modèles ?

Il a été constaté que la préférence était largement dictée par le contenu même des articles. Par exemple, pour GPT-5 mini, environ 90 % de la variation des articles favorisés était attribuable au contenu, plutôt qu’à des facteurs tels que l’ordre de la liste, le bruit de génération ou les métadonnées fabriquées attachées à chaque article. Le même effet de « contenu dominant » a été reproduit avec GPT-4.1 mini.

La carte des préférences (voir ci‑dessous) a également été à peine modifiée lorsque les titres et résumés ont été largement réécrits tout en conservant leur sens. Sur quatre tests de paraphrase réussis, des corrélations de 0,95 à 0,99 ont été obtenues, malgré l’utilisation de différents modèles de trois fournisseurs pour la réécriture.

Des changements dans la carte des préférences n’ont été observés que lorsque le sens sous‑jacent a été modifié de façon mesurable:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Résultats de test comparant les préférences de citation entre les onze modèles. Les chiffres indiquent à quel point chaque paire de modèles favorisait les mêmes articles, des valeurs plus élevées signifiant un accord plus fort. Malgré les différences entre les modèles et les fournisseurs, des préférences globalement similaires ont été observées au sein du groupe.

Les modèles semblent donc répondre principalement au contenu sémantique plutôt qu’à une formulation précise. Cependant, la raison de leur fort accord n’a pas pu être déterminée de façon concluante.

Il est possible, affirment les auteurs, qu’un consensus de citation commun ait été absorbé lors de l’entraînement. Une autre possibilité est que des jugements similaires sur ce qui constitue un article « citable » puissent être atteints de façon indépendante.

Ainsi, l’existence de la préférence partagée a été établie, mais son origine ultime demeure inconnue.

Les auteurs suggèrent que l’utilisation généralisée de l’IA dans la recherche pourrait restreindre la variété des travaux recevant de l’attention, car différents modèles tendent à favoriser de nombreux mêmes articles ; et à mesure que la littérature générée par IA s’accumule, ces préférences partagées pourraient être davantage renforcées par des citations répétées, rendant les recherches moins favorisées de plus en plus difficiles à découvrir. La diversité des citations et la surveillance de la concentration des citations sont donc proposées comme éventuelles mesures de protection.

Le banc d’essai de l’étude pour la concentration récursive des citations est désormais disponible sur GitHub.

Conclusion

Opinion En tant que lecteur d’un nombre démesuré d’articles de recherche en IA chaque semaine, j’ai vu les « vagues de citations » apparaître et disparaître. Un pilier pérenne est le papier original de Google Attention Is All You Need, le premier article sur les Transformers, qui doit désormais être intégré en dur aux modèles de soumission.

Un autre récidiviste, pendant longtemps, était le travail de 2014 Generative Adversarial Networks, bien qu’il ait finalement été supplanté en fréquence par Denoising Diffusion Probabilistic Models et d’autres études phares basées sur la diffusion.

Dans presque tous les cas, ces citations « récurrentes » ne sont pas fausses en soi ; mais elles sont souvent trop générales pour constituer un soutien utile à l’article qui les cite ; et en ce sens, elles représentent quelque chose de semblable à un « lavage de citations » – l’inclusion de citations « fiables » mais principalement décoratives, pour donner une apparence de crédibilité avec peu d’effort.

 

Première publication le lundi 24 août 2026. Modifié à 23:07 EET pour ajouter le pluriel manquant.

Rédacteur spécialisé en apprentissage automatique, expert du domaine de la synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Site Web: martinanderson.ai
Contact: martin@martinanderson.ai