Andersons hoek
AI‑slordigheid bestrijden in wetenschappelijke artikelen

AI doet alles op grote schaal, van webscraping op DOS-aanvalniveau tot het produceren of mogelijk maken van zo’n enorme hoeveelheden wetenschappelijke onderzoeksinzendingen, waardoor het resultaat zowel een logistieke crisis als een kwaliteitscrisis wordt, aangezien de signaal‑ruisverhouding steeds ondoorgrondelijker wordt.
Vorige week kondigde preprint‑server arXiv aankondigde aan dat ze een nieuw beleid voor snelheidsbeperking voor indieners zal invoeren, waarbij nu een limiet van twee inzendingen per maand geldt. De maatregel is, zo suggereert de aankondiging, genomen in het licht van een duizelingwekkende stijging van het aantal inzendingen in een korte periode:

Maandelijkse inzendingen in de cs.AI‑categorie van arXiv van januari 2024 tot september 2026, met een meer dan zesvoudige toename gedurende de periode. Bron
Kat Boboris’ blogpost die de stap aankondigde, en die reactie uitlokte op Hacker News afgelopen donderdag, stelde dat arXiv 40,363 inzendingen ontving in september 2026 – bijna het dubbele van de 20,569 in september 2024, en meer dan vier keer zoveel als de 9,869 in september 2016.
De inzendingen van de laatste maand, merkte Boboris op, genereerden ook bijna 9,000 ondersteunings‑tickets voor het arXiv‑personeel en de moderators:
‘Onze moderators merken een toename op van dunne papers met een smalle scope, evenals ‘salami’-papers, waarbij één werk wordt opgesplitst en als een reeks kleinere papers wordt ingediend.
‘Er is ook een duidelijke toename van dichte, door AI geschreven papers. AI‑tools maken het gemakkelijk voor auteurs om arXiv en andere repositories te overspoelen met deze papers van lage kwaliteit.’
Reeds in mei van dit jaar heeft arXiv de maatregel genomen om een eenjarig verbod in te voeren voor onbeheerde AI‑inhoud; en in oktober van vorig jaar heeft het indieners van enquête‑papers en positionele papers (die beide met minder moeite kunnen worden gegenereerd dan een volledige academische studie) verteld dat zij peer‑ondersteuning nodig zouden hebben om bij arXiv te worden gepubliceerd.
Voorlopig is de vaak belemmerende limiet op http‑verzoeken van het arXiv‑domein niet sterk zichtbaar, en men kan alleen hopen dat de zeer nuttige RSS‑feeds deze voortdurende terugtrekking overleven. Vorige week kondigde Reddit aankondigde de al lang gevreesde volledige beëindiging van zijn RSS‑feeds aan, die vanaf het midden van volgende maand zal plaatsvinden. Echter, de non‑profitstatus van arXiv betekent dat er weinig vergelijkbaar kapitaal te behalen valt door lezers te dwingen tot verplichte site‑bezoeken, of verplichte inlogacties – althans, voor nu.
Tegen de stijgende stroom
Gezien zulke ernstige en groeiende problemen rond de negatieve effecten van AI‑gebruik in wetenschappelijk onderzoek – vooral met betrekking tot AI‑gerelateerd onderzoek, dat alle andere categorieën heeft verduisterd en van obscuriteit is opgestegen tot een politiek en economisch teken, recentelijk – is er een onderzoekslijn ontstaan die manieren onderzoekt om de achteruitgang in kwaliteit van AI‑gerelateerde paper‑inzendingen tegen te gaan.
Het nieuwste initiatief om het probleem aan te pakken komt in de vorm van een samenwerking tussen Seoul National University in Korea en de University of Minnesota in de VS. Het artikel, getiteld Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, stelt voor om ‘wetenschappelijke slordigheid’ te meten aan de hand van falen in de verbindingen tussen de beweringen, het bewijs, de citaten en de structuur van een artikel:

Uit het nieuwe artikel, een overzicht van de benadering van het werk voor ‘wetenschappelijke slordigheid’, dat laat zien hoe falen in structuur, argumentatie en ondersteunende artefacten zwaktes kunnen onthullen die conventionele AI‑tekstdetectoren missen. Bron
In tegenstelling tot eerdere benaderingen kijkt het nieuwe systeem verder dan de tekst zelf om te beoordelen of de beweringen van het artikel adequaat worden ondersteund door de argumenten, het bewijs en de citaten. De auteurs stellen*:
‘Elk onderdeel van een artikel kan er op zichzelf plausibel uitzien, waardoor dergelijke tekortkomingen onzichtbaar zijn voor token‑niveau detectors en alleen op het niveau van het volledige artikel kunnen worden geïdentificeerd of gerepareerd. Om wetenschappelijke slordigheid te benchmarken en te mitigeren, behandelt dit artikel drie uitdagingen.
‘Ten eerste falen token‑niveau‑metriek om vast te leggen hoe wetenschappelijk redeneren zich over een artikel heen verbindt. Secties, beweringen, citaten, bewijs en artefacten kunnen elk plausibel lijken terwijl de relaties daartussen afbreken. We observeren herhaaldelijk dergelijke falen in end‑to‑end door AI‑gegenereerde artikelen, en ICLR‑reviewers straffen ze al zelfs in door mensen geschreven inzendingen.
‘Ten tweede, de detectie van deze patronen blijft ongemeten. Bestaande testsets labelen alleen de tekst, dus de mate waarin detectors, inclusief LLM’s die het volledige artikel lezen, deze patronen identificeren, is nooit gemeten.
‘Ten derde, deze patronen zijn moeilijk betrouwbaar te mitigeren. Terwijl token‑niveau signalen kunnen worden verwijderd door te parafraseren, vereist het repareren van deze patronen het herstellen van de ontbrekende relaties zonder de onderliggende wetenschap te wijzigen.’
De nieuwe benchmark van de auteurs, genaamd SciSlopBench, is geïntegreerd in SciSlopHarness, een framework dat is ontworpen om fouten in de wetenschappelijke redenering van een artikel te detecteren en te repareren, terwijl het onderliggende wetenschappelijk bewijs behouden blijft:

Voorbeelden die gebrekkige passages vergelijken met revisies gemaakt door SciSlopHarness. Niet‑ondersteunde toevoegingen worden afgewezen, terwijl beweringen waar nodig worden herschikt of herschreven om beter overeen te komen met het bewijs dat in het artikel beschikbaar is.
De SciSlopBench‑benchmark zelf is opgebouwd uit 390 door AI gegenereerde artikelen, elk gekoppeld aan een door mensen geschreven artikel dat een vergelijkbaar onderzoeksprobleem en type bijdrage behandelt.
In tests werd SciSlopBench gebruikt om 390 paren van artikelen te onderscheiden, waarbij elk paar bestond uit het bovengenoemde door AI gegenereerde artikel en een door mensen geschreven artikel dat was gematcht op onderzoeksprobleem en type bijdrage. De benchmark identificeerde het door AI gegenereerde artikel correct in 85,9 % van deze vergelijkingen, wat aanzienlijk beter presteert dan conventionele AI‑tekstdetectoren.
De auteurs stellen:
‘Terwijl standaardrevisies residuele slop achterlaten en directe slop‑bewuste prompts beloningshacking veroorzaken, vermindert SciSlopHarness de resterende AI‑mens kloof met 63 % ten opzichte van de sterkste revisiebasislijn zonder menselijke referentiedoelen te vereisen.
‘Over het geheel genomen tonen we aan dat door AI gegenereerde wetenschappelijke artikelen fundamentele sporen achterlaten in hun globale redenering, en dat verantwoord mitigeren strikte bewijsgrondslag vereist in plaats van louter prozaverfijning.’
Naast de bijdragen van het artikel zelf hebben de auteurs de principes van hun nieuwe werk geoperationaliseerd in de vorm van een live demo waarin gebruikers wetenschappelijke artikelen kunnen indienen voor analyse van de hoeveelheid AI‑slop die ze bevatten.
Interessant genoeg krijgt het nieuwe artikel zelf, geanalyseerd door de demo, een ‘matig’ slop‑cijfer van 40/100†:

Het nieuwe artikel, geanalyseerd door zijn eigen algoritme, krijgt ‘slop’-gebieden gemarkeerd door het nieuwe proces van de auteurs. Source
Methode‑ en Data‑aanpak
De samenwerking uit 2025 Why Slop Matters beschreef ‘oppervlakkige competentie’ als een kenmerkend aspect van AI‑slop, waarbij schijnbare kwaliteit een gebrek aan inhoud verbergt. Het nieuwe werk past dit idee specifieker toe op wetenschappelijke artikelen en definieert ‘wetenschappelijke slop’ als fouten die het moeilijk maken te volgen hoe een studie is gestructureerd; hoe de beweringen worden onderbouwd; en hoe de methoden en het bewijs kunnen worden onderzocht, waarbij de fouten worden gegroepeerd in structuur; argument; en artefacten:

Meetregels voor de zes typen wetenschappelijke slop die in de benchmark worden gebruikt. De tabel toont wat voor elke maat wordt onderzocht, hoe de score wordt berekend, en wat de maximale score van 1 vertegenwoordigt, waarbij hogere scores duiden op meer uitgebreide fouten.
De zes meetinstrumenten voor wetenschappelijke slop die in het artikel worden gedefinieerd zijn kruis‑sectiereferenties (of secties betekenisvol verwijzen naar materiaal elders in het artikel); macro redundantie (of latere secties eerder materiaal herhalen); argumentgrafiek (of beweringen correct worden ondersteund door voorafgaande redenering); citatiesisolatie (of citaten oppervlakkig worden gebruikt zonder uit te leggen hoe de geciteerde werken zich verhouden tot het artikel of tot elkaar); figuurexpositie (of methodfiguren de methode daadwerkelijk uitleggen); en bewijs‑kloof (of gerapporteerde resultaten worden ondersteund door concrete voorbeelden).
De benchmark werd geconstrueerd door AI‑gegenereerde artikelen te koppelen aan vergelijkbare/equivalente door mensen geschreven artikelen, waarbij de AI‑artikelen werden geselecteerd uit FARS en de 2025 Agents4Science competitie.
Voor elk door een machine gegenereerd FARS‑paper zochten de onderzoekers in de citaties naar een door een mens geschreven paper van hetzelfde type dat was geaccepteerd op een top‑tier conferentie, en selecteerden vervolgens de meest overeenkomstige op onderzoeksonderwerp, waardoor 143 paren ontstonden. De Agents4Science‑papers werden op dezelfde manier gekoppeld aan door mensen geschreven tegenhangers, wat nog eens 247 paren opleverde en de benchmark op in totaal 390 AI‑mens‑paren bracht. De papers bestrijken de levenswetenschappen, sociale wetenschappen en natuurwetenschappen, hoewel de dataset sterk zwaarder weegt naar de informatica.
Voor de metriek werd de prestatie geëvalueerd met PairAcc, dat meet hoe vaak het menselijk paper hoger wordt gerangschikt dan zijn AI‑tegenhanger; en AUROC, dat de algehele scheiding tussen menselijk en AI‑papers over verschillende drempels meet. De auteurs rapporteren ook detectieprestaties wanneer de vals‑positieve rate voor menselijke papers is vastgesteld op 5 %.
Tests
De eerste tests vergeleken SciSlop met de AI‑tekstdetectoren Binoculars; DetectGPT; en NTS††, evenals de geautomatiseerde beoordelingssystemen AI Scientist Reviewer en CycleReviewer.
Voor de latere revisietests werden vier baselines gebruikt: basis‑prompting; Claude Code; reviewer‑gebaseerde verfijning; en slop‑bewuste revisie. De eerste drie kregen alleen algemene instructies om het paper te verbeteren, terwijl slop‑bewuste revisie bovendien de definities en locaties van gedetecteerde slop kreeg. Alle methoden werden vergeleken met SciSlopHarness onder gelijkwaardige revisie‑omstandigheden.
Voor de implementatie kregen de tekstdetectoren de proza van het paper, terwijl de andere methoden de broncode van het paper ontvingen en, waar nodig, toegang tot de code kregen. Binoculars gebruikte Falcon-7B basis‑ en instructiemodellen; DetectGPT gebruikte T5-3B om 100 perturbaties te genereren; AI Scientist gebruikte Qwen2.5-32B-Instruct; en CycleReviewer gebruikte zijn vrijgegeven 8B‑checkpoint. Voor papers die de limiet van 2,048 tokens van Falcon overschrijden, werden niet‑overlappende vensters afzonderlijk gescoord en gemiddeld.
De initiële detectieresultaten staan gedetailleerd in de twee onderstaande tabellen: SciSlop behaalde 85,9 % PairAcc, vergeleken met 68,7 % voor Binoculars en 68,5 % voor de sterkste geautomatiseerde reviewer, waardoor de foutmarge met meer dan de helft werd gereduceerd:

Detectieresultaten die SciSlop vergelijken met AI‑tekstdetectoren en geautomatiseerde reviewers, naast resultaten voor zijn zes individuele slop‑metingen. SciSlop behaalt de hoogste algehele PairAcc, terwijl cross‑section‑referenties het sterkste individuele resultaat leveren.
Cross‑section‑referenties presteerden bijzonder sterk op zichzelf, bereikten 90,5 % PairAcc zonder een model te vereisen, en detecteerden 65 % van AI‑gegenereerde papers bij een vals‑positieve rate van 5 %, vergeleken met 24 % voor Binoculars.
De auteurs stellen dat deze resultaten aantonen dat relaties door het hele paper een sterker signaal van AI‑generatie bieden dan conventionele tekst‑niveau detectie op deze dataset, terwijl ze ook specifieke zwaktes identificeren die vervolgens gericht kunnen worden aangepakt voor revisie.
Vervolgens werd de relatie tussen wetenschappelijke slop en menselijke beoordelingen van de kwaliteit van het paper onderzocht. Zoals weergegeven in de eerste kolom hieronder, ging hogere slop gepaard met lagere ICLR‑scores voor de algehele beoordeling, degelijkheid, presentatie en bijdrage:

Vergelijking van SciSlop met AI‑tekstdetectoren en geautomatiseerde reviewers ten opzichte van ICLR‑reviewresultaten. Het linkerpaneel toont AI‑gelijkenis versus review‑scores; het middenpaneel vergelijkt individuele review‑dimensies; het rechterpaneel toont de prestaties bij het onderscheiden van afgewezen en geaccepteerde papers over negen jaar.
Afgewezen en geaccepteerde papers werden ook boven toeval onderscheiden over alle negen onderzochte jaren, terwijl conventionele detectoren onder toeval vielen in de meeste vergelijkingen.
Wetenschappelijke slop bleek daarom zwaktes weer te geven die al door menselijke reviewers werden bestraft, in plaats van uitsluitend als een signaal van AI‑auteurschap te fungeren.
De laatste tests onderzochten of SciSlopHarness slop kon verwijderen die na een meer algemene revisie overbleef. Zoals hieronder weergegeven, eindigde de harness het dichtst bij het menselijk gemiddelde over alle zes metingen, terwijl algemene revisie vaak aanzienlijke slop achterliet en directe slop‑bewuste revisie soms overcorrigeerde:

Revisieresultaten die SciSlopHarness vergelijken met vier basismethoden over de zes slop-maten. Waarden die dichter bij nul liggen, liggen dichter bij het gemiddelde van menselijke papers, waarbij SciSlopHarness over het algemeen naar dit niveau beweegt, terwijl slop‑bewuste revisie dit vaak overschrijdt.
Elke voorgestelde wijziging werd gecontroleerd aan de hand van de wetenschappelijke redenering en ondersteunend bewijs van het artikel, waarbij niet‑ondersteunde bewerkingen werden afgewezen. Over de zes maten werd de resterende kloof ten opzichte van door mensen geschreven papers met 63 % verkleind ten opzichte van Claude Code, de sterkste revisiebasislijn.
Conclusie
Het was interessant, tijdens het schrijven van dit stuk, niet alleen op te merken hoe slecht dit artikel scoorde op zijn eigen demosite, maar ook om ten minste één voorbeeld van een ‘luie’ of ‘cosmetische’ citatie†† waar te nemen, die de laatste tijd een kleine maar groeiende vloek in onderzoekspapers is geworden.
In dergelijke gevallen, buiten dit specifieke artikel, lijken onderzoekers hun eigen kennis te gebruiken in plaats van zich betekenisvol te verdiepen in de bestaande literatuur. Toch, door de conventie gedwongen om hun ‘werk te tonen’, worden citaties vaak geleverd met wat overkomt als ongeduld, zelfs minachting voor het proces, en lijken vaak te vertrouwen op de lezer die een overvloed aan referenties accepteert als een voldoende ‘patina’ van herkomst, hoewel die niet zou overleven onder intensief onderzoek.
Arxiv vecht terug tegen de AI‑gedreven industrialisatie van inzendingen; of er soortgelijke beperkingen zullen komen op de directe betrokkenheid van AI bij onderzoek, zonder een gerelateerd ramp van voldoende omvang, moet nog blijken.
* De nadruk van de auteurs, niet de mijne – maar mijn waar nodig conversie van de inline‑citaties van de auteurs naar hyperlinks.
† De auteurs beweren niet dat er geen AI‑gebruik in hun eigen paper is, en details over dergelijk gebruik.
†† Het kan de lezer interesseren om te weten dat ik zelf een correcte link voor het NTS‑framework moest zoeken, omdat de door de auteurs verstrekte link niet relevant was – een van de exacte meetpunten waarop SciSlop zich richt!
Eerste publicatie zondag 4 oktober 2026












