Angle d’Anderson
Lutter contre le slop d’IA dans les articles scientifiques

L’IA fait tout à grande échelle, du scraping web de niveau attaque DOS à la production, ou à la facilitation, de des volumes aussi vastes de soumissions de recherches scientifiques, au point que le résultat devient à la fois une crise logistique et une crise de qualité, alors que le rapport signal/bruit continue de devenir impraticable.
La semaine dernière, le serveur de prépublications arXiv a annoncé qu’il mettra en place une nouvelle politique de limitation du taux pour les soumetteurs, qui seront désormais plafonnés à deux soumissions par mois. La mesure a été prise, suggère l’annonce, face à une hausse vertigineuse des taux de soumission sur une courte période :

Soumissions mensuelles à la catégorie cs.AI d’arXiv de janvier 2024 à septembre 2026, montrant une augmentation de plus de six fois sur la période. Source
Le billet de blog de Kat Boboris annonçant le changement, qui a suscité des commentaires sur Hacker News jeudi dernier, indiquait qu’arXiv a reçu 40 363 soumissions en septembre 2026 – presque le double des 20 569 reçues en septembre 2024, et plus de quatre fois les 9 869 reçues en septembre 2016.
Les soumissions du mois le plus récent, a observé Boboris, ont également généré près de 9 000 tickets de support pour le personnel et les modérateurs d’arXiv :
‘Nos modérateurs constatent une augmentation des articles minces à portée étroite, ainsi que des articles « salami », où un même travail est découpé et soumis sous forme d’un ensemble d’articles plus petits.
‘Il y a également une augmentation notable des articles denses rédigés par l’IA. Les outils d’IA facilitent la diffusion par les auteurs d’un grand nombre d’articles de faible valeur sur arXiv et d’autres dépôts.’
Déjà, en mai de cette année, arXiv a pris la mesure d’implémenter une interdiction d’un an pour le contenu IA non contrôlé ; et en octobre de l’année dernière, il a indiqué aux soumetteurs d’articles d’enquête et d’articles de position (qui peuvent tous deux être générés avec moins d’effort qu’une étude académique complète) qu’ils auraient besoin d’un appui par les pairs afin d’être publiés sur arXiv.
Pour le moment, la limitation souvent obstructive des requêtes http du domaine arXiv n’est pas très visible, et l’on ne peut qu’espérer que ses flux RSS très utiles survivront à ce retranchement continu. La semaine dernière, Reddit a annoncé l’élimination totale tant redoutée de ses flux RSS, qui aura lieu à partir du milieu du mois prochain. Cependant, le statut à but non lucratif d’arXiv signifie qu’il y a peu de capital similaire à gagner en guidant les lecteurs vers des visites obligatoires du site, ou des connexions imposées – du moins, pour le moment.
Contre la marée montante
Face à de tels problèmes graves et croissants concernant l’impact négatif de l’utilisation de l’IA dans la recherche scientifique – notamment en ce qui concerne la recherche liée à l’IA, qui a éclipsé toutes les autres catégories, et est passée de l’obscurité à devenir un indicateur politique et économique récemment – un courant de recherche a émergé, examinant des moyens de contrer le déclin de la qualité des soumissions d’articles liés à l’IA.
La dernière initiative pour résoudre le problème prend la forme d’une collaboration entre l’Université nationale de Séoul en Corée et l’Université du Minnesota aux États‑Unis. Le document, intitulé Science or Slop ?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, propose de mesurer le « slop scientifique » à travers les échecs dans les liens entre les affirmations, les preuves, les citations et la structure d’un article :

Du nouveau document, un aperçu de l’approche du travail concernant le « slop scientifique », montrant comment les échecs de structure, d’argumentation et d’artefacts de soutien peuvent révéler des faiblesses que les détecteurs d’IA conventionnels manquent. Source
Contrairement aux approches précédentes, le nouveau système va au-delà du texte lui‑même pour évaluer si les affirmations de l’article sont correctement soutenues par ses arguments, ses preuves et ses citations. Les auteurs déclarent *:
‘Chaque partie d’un article peut sembler plausible isolément, de sorte que de telles ruptures sont invisibles aux détecteurs au niveau des tokens et ne peuvent être identifiées ou corrigées qu’au niveau de l’ensemble de l’article. Pour évaluer et atténuer le slop scientifique, cet article aborde trois défis.’
‘Premièrement, les métriques au niveau des tokens ne parviennent pas à saisir comment le raisonnement scientifique se connecte à travers un article. Les sections, les affirmations, les citations, les preuves et les artefacts peuvent chacun sembler plausibles tandis que les relations entre eux se dégradent. Nous observons à plusieurs reprises de tels échecs dans les articles générés de bout en bout par l’IA, et les évaluateurs d’ICLR les pénalisent déjà même dans les soumissions rédigées par des humains.
‘Deuxièmement, la détection de ces schémas reste non mesurée. Les ensembles de test existants n’étiquettent que le texte, ainsi l’étendue à laquelle les détecteurs, y compris les LLM qui lisent l’intégralité du papier, identifient ces schémas n’a jamais été mesurée.
‘Troisièmement, ces schémas sont difficiles à atténuer de manière fiable. Alors que les signaux au niveau des tokens peuvent être supprimés par paraphrase, réparer ces schémas nécessite de restaurer les relations manquantes sans modifier la science sous-jacente.’
Le nouveau benchmark des auteurs, baptisé SciSlopBench, a été intégré dans SciSlopHarness, un cadre conçu pour détecter et réparer les défaillances du raisonnement scientifique d’un article, tout en préservant les preuves scientifiques sous-jacentes :

Exemples comparant des passages défectueux avec les révisions effectuées par SciSlopHarness. Les ajouts non étayés sont rejetés, tandis que les affirmations sont réordonnées ou réécrites si nécessaire afin de mieux refléter les preuves disponibles dans l’article.
Le benchmark SciSlopBench lui‑même a été construit à partir de 390 articles générés par IA, chacun associé à un article rédigé par un humain traitant d’un problème de recherche similaire et d’un type de contribution comparable.
Dans les tests, SciSlopBench a été utilisé pour distinguer 390 paires d’articles, chaque paire étant composée de l’article généré par IA susmentionné et d’un article rédigé par un humain correspondant au même problème de recherche et au même type de contribution. Le benchmark a correctement identifié l’article généré par IA dans 85,9 % de ces comparaisons, surpassant largement les détecteurs de texte IA conventionnels.
Les auteurs déclarent :
‘Alors que les révisions standard laissent un slop résiduel et que les incitations directes sensibles au slop déclenchent du reward hacking, SciSlopHarness réduit l’écart restant entre IA et humain de 63 % par rapport à la meilleure référence de révision, sans nécessiter de cibles de référence humaines.
‘Globalement, nous démontrons que les articles scientifiques générés par IA laissent des traces fondamentales dans leur raisonnement global, et que l’atténuation responsable exige un ancrage strict aux preuves plutôt qu’une simple amélioration du style.’
En plus des contributions apportées par l’article lui‑même, les auteurs ont mis en œuvre les principes de leur nouveau travail sous la forme d’une démo en direct où les utilisateurs peuvent soumettre des articles scientifiques afin d’analyser la quantité de slop IA qu’ils contiennent.
Curieusement, le nouvel article lui‑même, analysé par la démo, obtient un score de slop « modéré » de 40/100† :

Le nouvel article, analysé par son propre algorithme, fait apparaître les zones de « slop » signalées par le nouveau processus des auteurs. Source
Méthode et approche des données
La collaboration 2025 Pourquoi le slop importe a décrit la « compétence superficielle » comme une caractéristique déterminante du slop IA, où une qualité apparente masque un manque de substance. Le nouveau travail applique cette idée plus spécifiquement aux articles scientifiques, définissant le « slop scientifique » comme des échecs qui rendent difficile de suivre comment une étude est organisée ; comment ses affirmations sont étayées ; et comment ses méthodes et ses preuves peuvent être examinées, les échecs étant regroupés en structure ; argument ; et artefacts :

Règles de mesure pour les six types de slop scientifique utilisés dans le benchmark. Le tableau indique ce qui est examiné pour chaque mesure, comment le score est calculé, et ce que représente le score maximal de 1, les scores plus élevés indiquant des échecs plus étendus.
Les six mesures de slop scientifique définies dans l’article sont références inter-section (si les sections font référence de manière significative à du contenu ailleurs dans l’article) ; macro redondance (si les sections ultérieures répètent du matériel antérieur) ; graphique d’argument (si les affirmations sont correctement étayées par le raisonnement précédent) ; isolement des citations (si les citations sont utilisées superficiellement, sans expliquer comment les travaux cités se rapportent à l’article ou les uns aux autres) ; exposition des figures (si les figures de méthode expliquent réellement la méthode) ; et lacune de preuves (si les résultats rapportés sont soutenus par des exemples concrets).
Le benchmark a été construit en associant des articles générés par IA à des articles humains comparables/équivalents, les articles IA étant sélectionnés parmi FARS et la compétition 2025 Agents4Science.
Pour chaque article FARS généré par machine, les chercheurs ont recherché dans ses citations un article rédigé par un humain du même type qui avait été accepté dans un lieu de haut niveau, puis ont sélectionné la correspondance la plus proche par sujet de recherche, produisant 143 paires. Les articles Agents4Science ont de même été appariés à des contreparties humaines, générant 247 paires supplémentaires, portant le benchmark à 390 paires IA‑humain au total. Les articles couvrent les sciences de la vie, sociales et naturelles, bien que le jeu de données soit fortement pondéré vers l’informatique.
Pour les métriques, la performance a été évaluée à l’aide de PairAcc, qui mesure la fréquence à laquelle l’article humain est classé au-dessus de son homologue IA ; et de AUROC, qui mesure la séparation globale entre les articles humains et IA à différents seuils. Les auteurs rapportent également les performances de détection lorsque le taux de faux positifs pour les articles humains est fixé à 5 %.
Tests
Les tests initiaux ont comparé SciSlop aux détecteurs de texte IA Binoculars ; DetectGPT ; et NTS††, ainsi qu’aux systèmes d’évaluation automatisés AI Scientist Reviewer et CycleReviewer.
Pour les tests de révision ultérieurs, quatre références de base ont été utilisées : base prompting ; Claude Code ; reviewer-based refinement ; et slop-aware revision. Les trois premiers n’ont reçu que des instructions générales pour améliorer l’article, tandis que la révision consciente du slop a également reçu les définitions et emplacements du slop détecté. Tous ont été comparés à SciSlopHarness dans des conditions de révision équivalentes.
Pour l’implémentation, les détecteurs de texte ont reçu le texte de l’article, tandis que les autres méthodes ont reçu le code source de l’article et, le cas échéant, l’accès à son code. Binoculars a utilisé Falcon-7B comme modèle de base et instruct ; DetectGPT a utilisé T5-3B pour générer 100 perturbations ; AI Scientist a utilisé Qwen2.5-32B-Instruct ; et CycleReviewer a utilisé son point de contrôle 8B publié. Pour les articles dépassant la limite de 2 048 tokens de Falcon, des fenêtres non chevauchantes ont été évaluées séparément puis moyennées.
Les résultats initiaux de détection sont détaillés dans les deux tableaux ci‑dessous : SciSlop a atteint 85,9 % de PairAcc, contre 68,7 % pour Binoculars et 68,5 % pour le meilleur évaluateur automatisé, réduisant le taux d’erreur de plus de moitié :

Résultats de détection comparant SciSlop aux détecteurs de texte IA et aux évaluateurs automatisés, ainsi que les résultats pour ses six mesures individuelles de slop. SciSlop obtient le PairAcc global le plus élevé, tandis que les références inter‑sections offrent le meilleur résultat individuel.
Les références inter‑sections ont particulièrement bien performé seules, atteignant 90,5 % de PairAcc sans nécessiter de modèle, et détectant 65 % des articles générés par IA à un taux de faux positifs de 5 %, contre 24 % pour Binoculars.
Les auteurs soutiennent que ces résultats indiquent que les relations à travers l’article fournissent un signal plus fort de génération IA que la détection conventionnelle au niveau du texte sur cet ensemble de données, tout en identifiant des faiblesses spécifiques qui pourraient ensuite être ciblées pour la révision.
La relation entre le slop scientifique et les évaluations humaines de la qualité des articles a ensuite été examinée. Comme le montre la première colonne ci‑dessous, un slop plus élevé était associé à des scores ICLR plus faibles pour l’évaluation globale, la solidité, la présentation et la contribution :

Comparaison de SciSlop aux détecteurs de texte IA et aux évaluateurs automatisés par rapport aux résultats d’évaluation ICLR. Le panneau de gauche montre la ressemblance IA par rapport aux scores d’évaluation ; le centre compare les dimensions d’évaluation individuelles ; le droit montre la performance pour distinguer les articles rejetés des articles acceptés sur neuf ans.
Les articles rejetés et acceptés ont également été distingués au-dessus du hasard sur les neuf années examinées, tandis que les détecteurs conventionnels sont tombés en dessous du hasard dans la plupart des comparaisons.
Le slop scientifique a donc été trouvé comme reflétant des faiblesses déjà pénalisées par les évaluateurs humains, plutôt que de fonctionner uniquement comme un signal d’auteur IA.
Les tests finaux ont examiné si SciSlopHarness pouvait éliminer le slop restant après une révision plus générale. Comme le montre ci‑dessous, le harnais s’est rapproché le plus de la moyenne humaine sur les six mesures, tandis que la révision générale laissait souvent un slop substantiel et la révision consciente du slop surcorrigeait parfois :

Résultats de révision comparant SciSlopHarness à quatre méthodes de référence sur les six mesures de slop. Des valeurs plus proches de zéro sont plus proches de la moyenne des articles humains, SciSlopHarness se dirige généralement vers ce niveau, tandis que la révision consciente du slop la dépasse souvent.
Chaque modification proposée a été vérifiée par rapport au raisonnement scientifique du papier et aux preuves à l’appui, les modifications non étayées étant rejetées. Sur les six mesures, l’écart restant par rapport aux articles rédigés par des humains a été réduit de 63 % par rapport à Claude Code, la référence de révision la plus solide.
Conclusion
Il était intéressant, au cours de la rédaction de cet article, de constater non seulement à quel point ce papier obtenait de faibles scores sur son propre site de démonstration, mais aussi d’observer au moins un exemple de citation « paresseuse » ou « cosmétique »††, qui est récemment devenue une petite mais croissante malédiction dans les articles de recherche.
Dans de tels cas, au-delà de cet article particulier, les chercheurs semblent s’appuyer sur leurs propres connaissances plutôt que de s’engager de manière significative avec la littérature existante. Pourtant, contraints par la convention de « montrer leur travail », les citations sont souvent fournies avec ce qui ressemble à de l’impatience, voire du mépris du processus, et reposent souvent apparemment sur le lecteur pour accepter une profusion de références comme une « patine » suffisante de provenance, même si elle ne survivrait pas à un examen approfondi.
Arxiv réagit contre l’industrialisation des soumissions entraînée par l’IA ; la question de savoir s’il y aura des contraintes similaires sur l’implication directe de l’IA dans la recherche, en l’absence d’une catastrophe connexe d’une ampleur suffisante, reste à déterminer.
* Les emphases des auteurs, pas les miennes – mais ma conversion, lorsque nécessaire, des citations en ligne des auteurs en hyperliens.
† Les auteurs ne prétendent pas ne pas avoir utilisé d’IA dans leur propre article, et détaillent une telle utilisation.
†† Il peut intéresser le lecteur de savoir que j’ai dû moi-même rechercher un lien correct pour le cadre NTS, car le lien fourni par les auteurs n’était pas pertinent – l’un des très mêmes indicateurs sur lesquels SciSlop se base !
Première publication dimanche 4 octobre 2026












