Andersons hoek

AI citeert steeds dezelfde papers – net als mensen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT en andere AI‑schrijfhulpmiddelen kunnen stilletjes van wetenschap een populariteitswedstrijd maken, waarbij ze onderzoekers steeds weer naar dezelfde papers leiden en nieuwe, originele werken die het vakgebied daadwerkelijk vooruit zouden kunnen helpen, over het hoofd zien.

 

Monocultuur, in termen van frequentie en statistieken, is wanneer dezelfde beperkte reeks bronnen of middelen keer op keer terugkeert, waardoor nieuwe stemmen en frisse perspectieven verdrinken: dezelfde beperkte reeks liedjes in radioplanning; dezelfde reeks auteurs en boeken in luchthavenvakken; en dezelfde beperkte selectie fruit en groenten in supermarkten:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Ja, we hebben deze bananen – en alleen deze bananen. Homogeniteit van fruit en groenten in westerse voedselketens negeert de honderden andere soortmogelijkheden in elk geval, omdat de verschillende productie‑ en transportketens te duur zijn om te industrialiseren voor diverse soorten fruit of groenten. Bron

Dit gebeurt ook bij de citaten die in nieuw wetenschappelijk onderzoek verschijnen, waarbij onderzoekers, wellicht lui, terugvallen op een ‘betrouwbare’ reeks bronnen die momentum krijgen totdat ze bepaalde onderzoekslijnen gaan domineren.

Dit staat bekend als het Matthew‑effect – een sociologische theorie die suggereert dat gevestigden altijd zullen profiteren; het syndroom is vergeleken met de belofte in Mattheüs 13:12, die stelt ‘Wie heeft, krijgt meer, en hij zal in overvloed hebben. Wie niet heeft, zelfs wat hij heeft, zal van hem worden weggenomen’.

De populaire groep

Een van de grote verwachtingen van AI‑ondersteund onderzoek was dat nieuwe machine‑learningmethoden het Matthew‑effect – ook wel bekend als populariteitsbias – zouden kunnen doorbreken en minder bekende werken zouden gaan citeren die wellicht scherper of beter passend zijn bij het punt dat in een paper wordt gemaakt.

Echter, op basis van de manier waarop AI‑trainingsroutines datasets interpreteren, was er nooit een goede reden voor dit optimisme; en herhaaldelijk is gebleken dat wanneer AI geen citaten verzint – een chronisch probleem tot nu toe – het inderdaad het Matthew‑effect in stand houdt, net zoals mensen dat doen – zij het wellicht om andere redenen.

Tijdens het trainen leert een model de meest geciteerde (of ‘meest vaak herhaalde’) papers in een trainingsset hoog te rangschikken, omdat de trainingsroutines zijn ontworpen om betekenisvolle patronen te ontdekken en uitschieters af te wijzen als ‘ruis’ of statistische anomalieën.

Onder dit regime zou het equivalent van Einsteins relativiteitstheorie nooit aandacht van de machine krijgen, die, eenmaal getraind, het gevoel heeft haar principes en referenties al gevonden te hebben, en slechts licht kan bijsturen door nieuwere publicaties te raadplegen via RAG of andere methoden die het bereik van het model buiten de getrainde matrix uitbreiden.

Het probleem is dat het zulke nieuwe werken niet op dezelfde manier erkent als de ‘oude favorieten’ die het al kende, of ze helemaal niet erkent, omdat de statistische vooroordelen inmiddels sterk verankerd zijn.

Dus AI observeert en imiteert menselijk gedrag niet echt wanneer het het Matthew‑effect in stand houdt – het telt slechts hoe vaak onderzoekers lui terugvallen op dezelfde oude papers en rangschikt die papers hoog. In dit opzicht is het probleem van citatenrepetitie verwant aan de uitdaging om een echt interessant wetenschappelijk artikel te selecteren uit de steeds groter wordende lawine van AI‑onderzoekspublicaties, omdat het sterkste werk vaak het zwakste signaal heeft.

Mono diagnosticeren

Dit probleem wordt behandeld in een interessant nieuw artikel uit de VS getiteld ‘When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models’. Het nieuwe werk – een samenwerking tussen de University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University en de University of Notre Dame – streeft ernaar het bestaan van citatenmonocultuur in machine learning onomstotelijk aan te tonen, zodat de variabelen in de toekomst direct aangepakt kunnen worden, samen met het probleem zelf.

In tests ontdekten de auteurs dat elf modellen van OpenAI, Google en Anthropic consequent dezelfde kleine groep papers bevoordeelden – zelfs nadat duidelijke populariteitssignalen waren verwijderd.

Om dit te testen werden 120 echte papers ontdaan van citatietellingen en publicatieplaatsen, terwijl auteursnamen werden vervangen en publicatiejaren willekeurig opnieuw werden toegekend. Willekeurige sets van dertig papers werden vervolgens aan elk model getoond, dat niet meer dan tien kon citeren.

Acht menselijke experts in de relevante vakgebieden kregen dezelfde geanonimiseerde papers, maar convergeerden niet op dezelfde favorieten als de AI’s, wat aangeeft dat de bias specifiek was voor de AI‑modellen en niet voor de papers zelf:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Uit het nieuwe artikel, testresultaten die citatiekeuzes van AI‑modellen en menselijke experts vergelijken. Over alle elf modellen waren citaten geconcentreerd op een kleinere groep papers, terwijl sommige papers volledig werden overgeslagen. Menselijke experts vertoonden geen van beide tendensen. Bron

Dezelfde papers bleven populair zelfs wanneer de modellen alleen werden gevraagd referenties te kiezen, wat aantoont dat het schrijven van de review zelf de bias niet veroorzaakte.

Het experiment werd vervolgens uitgebreid tot elf rondes, waarbij na elke ronde 120 AI‑geschreven papers werden toegevoegd, om te testen wat er gebeurt wanneer deze gedeelde voorkeuren opereren in een groeiende pool van AI‑gegenereerd onderzoek.

Naarmate er meer AI‑geschreven papers werden toegevoegd, concentreerden de modellen hun citaten steeds meer op een krimpend aantal van de oorspronkelijke menselijke papers.

‘Naarmate taalmodellen evolueren van het opstellen van proza naar het uitvoeren van literatuur‑zoekagenten met tool‑calls, worden gefabriceerde referenties makkelijker te detecteren en te beperken.

‘De ernstigere fout treedt op nadat elke kandidaat reëel is: verschillende modellen kunnen nog steeds dezelfde smalle subset selecteren, waardoor citatenmonocultuur ontstaat zonder dat een enkele citatie onjuist is.’

Om het probleem te verhelpen betoogt het artikel dat het simpelweg combineren van modellen van verschillende leveranciers of het gelijkmatig blootstellen van papers niet voldoende is, aangezien veel van de voorkeur gedeeld wordt tussen modellen. In plaats daarvan zou de onderliggende voorkeur voor specifieke papers moeten veranderen – mogelijk door bewust verwaarloosde papers meer prominentie te geven. De auteurs benadrukken echter dat deze aanpak nog niet getest is.

Testmethoden

De benchmark werd opgebouwd uit 120 echte knowledge‑distillation‑papers verzameld van arXiv en gepubliceerd tussen 2015 en 2022. Elke paper had op het moment van verzameling tussen de 50 en 500 citaten, een bereik gekozen om zowel obscure als uitzonderlijk invloedrijke werken uit te sluiten.

Het experiment begon met het willekeurig selecteren van dertig papers uit de beschikbare collectie, waarbij auteursnamen, publicatiejaren en citatietellingen verborgen werden. Elk model produceerde een korte review of position paper die niet meer dan tien papers citeerde, en deze keuzes werden vergeleken met willekeurige selecties uit hetzelfde materiaal:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Schema voor de methode die werd gebruikt om citatievoorkeuren te testen. Dertig willekeurig geselecteerde papers werden aan een model getoond met verborgen identificerende informatie, waarna het tot tien kon citeren. Zijn keuzes werden vergeleken met een willekeurige selectie, terwijl elke ronde 120 AI‑geschreven papers toevoegde aan de collectie van de volgende ronde.

In het uitgebreide experiment werden na elke ronde 120 nieuw gegenereerde papers aan de collectie toegevoegd, waardoor geleidelijk het aandeel AI‑geschreven onderzoek toenam.

In de voorlopige tests citeerden de modellen meestal de meeste papers die ze te zien kregen, doorgaans 22 tot 27 van de 30. De onderzoekers stelden daarom een maximum van tien citaten in voor het hoofdexperiment, waardoor de modellen gedwongen werden meer selectieve keuzes te maken.

Hieronder zien we een samenvatting van het resulterende experimentele ontwerp:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Experimentele opzet gebruikt om citatievoorkeuren te testen. De studie begon met 120 echte papers en testte elf modellen van drie leveranciers, met willekeurige sets van 30 papers en een maximum van tien citaten. Latere rondes voegden AI‑gegenereerde papers toe, waardoor de collectie groeide tot 1.440 papers.

Het initiële experiment gebruikte elf modellen van de drie grote providers: OpenAI werd vertegenwoordigd door GPT-5, GPT-5 mini, GPT-4.1 en GPT-4.1 mini; Google door Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro en Gemini 3.1 Flash‑Lite; en Anthropic door Claude Opus 4.8, Claude Sonnet 4.6 en Claude Haiku 4.5.

In de onderstaande testresultaten zien we hoeveel elk model zijn citaten concentreerde op een kleine groep papers; hoeveel papers het volledig negeerde; en hoe consistent het dezelfde keuzes maakte wanneer het experiment werd herhaald:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Testresultaten die laten zien hoe sterk elk model zijn citaten concentreerde op specifieke papers en hoeveel papers het volledig negeerde. ‘Top‑10 % aandeel’ toont hoeveel citaten naar de 12 meest bevoordeelde papers gingen, terwijl ‘HHI’ meet hoe geconcentreerd de citaten in het algemeen waren. ‘Betrouwbaarheid’ toont hoe consistent elk model dezelfde papers prefereerde over de tests, en ρ toont hoe vergelijkbaar die voorkeuren waren tussen modellen. De rij ‘Matched null’ geeft aan wat men zou verwachten als papers willekeurig werden gekozen.

Waar geven de modellen eigenlijk de voorkeur aan?

De voorkeur bleek overweldigend gedreven te worden door de inhoud van de papers zelf. Voor GPT‑5 mini was bijvoorbeeld ongeveer 90 % van de variatie in welke papers werden bevoordeeld toe te schrijven aan de inhoud, in plaats van factoren zoals volgorde, generatie‑ruis of de gefabriceerde metadata die aan elke paper is gekoppeld. Hetzelfde ‘dominante inhoud’-effect werd gereproduceerd met GPT‑4.1 mini.

De voorkeurskaart (zie hieronder) veranderde nauwelijks toen titels en samenvattingen ingrijpend werden herschreven terwijl hun betekenis behouden bleef. Over vier succesvolle parafrase‑tests werden correlaties van 0,95–0,99 behaald, ondanks dat verschillende modellen van drie leveranciers werden gebruikt voor het herschrijven.

Veranderingen in de voorkeurskaart werden alleen waargenomen wanneer de onderliggende betekenis meetbaar werd gewijzigd:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Testresultaten die citatievoorkeuren vergelijken over de elf modellen. De cijfers tonen hoe nauw elk paar modellen dezelfde papers bevoordeelde, waarbij hogere waarden duiden op grotere overeenstemming. Ondanks verschillen tussen modellen en leveranciers werden over de groep heen grotendeels vergelijkbare voorkeuren gevonden.

De modellen lijken daarom voornamelijk te reageren op semantische inhoud in plaats van op specifieke bewoordingen. De reden voor hun sterke overeenstemming kon echter niet definitief worden vastgesteld.

Het is mogelijk, stellen de auteurs, dat een gemeenschappelijke citatenconsensus tijdens het trainen is opgenomen. Een alternatieve mogelijkheid is dat soortgelijke oordelen over wat een ‘citeerbare’ paper is, onafhankelijk van elkaar worden bereikt.

Daarom is het bestaan van de gedeelde voorkeur vastgesteld, maar de uiteindelijke oorsprong blijft onbekend.

De auteurs suggereren dat wijdverspreid gebruik van AI in onderzoek het bereik van werk dat aandacht krijgt kan vernauwen, omdat verschillende modellen de neiging hebben veel van dezelfde papers te bevoordelen; en naarmate AI‑gegenereerde literatuur zich ophoopt, kunnen deze gedeelde voorkeuren verder worden versterkt door herhaalde citatie, waardoor minder bevoordeeld onderzoek steeds moeilijker te ontdekken wordt. Citaten‑diversiteit en het monitoren van citatenconcentratie worden daarom voorgesteld als mogelijke waarborgen.

De benchmark van de studie voor recursieve citatenconcentratie is nu beschikbaar op GitHub.

Conclusie

Opinie

Als iemand die wekelijks een buitensporig aantal AI‑onderzoeksartikelen leest, heb ik ‘citatengolven’ komen en gaan zien. Een blijvende rots in de branding is Google’s Attention Is All You Need, het originele Transformers‑paper, dat inmiddels hard‑gecodeerd moet zitten in indieningssjablonen.

Een andere veelvoorkomende dader, gedurende lange tijd, was het 2014‑paper Generative Adversarial Networks, hoewel het uiteindelijk in frequentie werd verdrongen door Denoising Diffusion Probabilistic Models en andere diffusion‑gebaseerde kernstudies.

In bijna alle gevallen zijn deze ‘herhalende’ citaten niet per se fout; maar ze zijn vaak te breed van scope om een nuttige ondersteuning te vormen voor het paper waarin ze worden geciteerd; en in die zin vertegenwoordigen ze iets dat lijkt op ‘citation‑washing’ – de opname van ‘betrouwbare’ maar voornamelijk decoratieve broncitaten, voor een low‑effort indruk van geloofwaardigheid.

 

Eerste publicatie maandag 24 augustus 2026. Aangepast 23:07 EET om ontbrekende meervoudsvorm toe te voegen.

Bronnen uit het oorspronkelijke artikel: archive.is [1] · publishersweekly.com [2] · projects.research-and-innovation.ec.europa.eu [3] · unite.ai [4] · web.archive.org [5] · link.springer.com [6] · unite.ai [7] · unite.ai [8] · unite.ai [9] · pubmed.ncbi.nlm.nih.gov [10] · unite.ai [11] · unite.ai [12] · unite.ai [13] · unite.ai [14] · unite.ai [15] · developers.openai.com [16] · openai.com [17] · developers.openai.com [18] · unite.ai [19] · unite.ai [20] · unite.ai [21] · unite.ai [22] · unite.ai [23] · archive.is [24] · unite.ai [25]

Schrijver over machine learning, domeinspecialist in menselijke beeldsynthetisatie. Voormalig hoofd van onderzoekscontent bij Metaphysic.ai, tot de ontbinding ervan in DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai