Andersons vinkel
AI citerar samma artiklar om och om igen – precis som människor

ChatGPT och andra AI‑skrivverktyg kan i det tysta förvandla vetenskap till en popularitetstävling, genom att upprepade gånger styra forskare mot samma artiklar samtidigt som de förbiser nya och nyskapande verk som faktiskt skulle kunna driva fältet framåt.
Monokultur, i termer av frekvens och statistik, är när samma begränsade uppsättning källor eller resurser återkommer om och om igen, och dränker nya röster och fräscha perspektiv: samma begränsade urval av låtar i radioprogrammering; samma samma mängd författare och böcker i flygplatsbokhyllor; och samma begränsade sortiment av frukt och grönsaker i stormarknader:

Ja, vi har just dessa bananer – och bara dessa bananer. Homogeniteten av frukt och grönsaker i västerländska livsmedelskedjor bortser från de hundratals andra artmöjligheter i varje fall, eftersom de olika produktions‑ och transportkedjorna är för dyra att industrialisera för olika typer av frukt eller grönsaker. Källa
Detta sker också i de citeringar som dyker upp i ny vetenskaplig forskning, där forskare, kanske lat, defaultar till en ‘pålitlig’ uppsättning källor som får fart tills de börjar dominera forskningsgrenar.
Detta är känt som Matthew‑effekten – en sociologisk teori som antyder att de som redan har alltid gynnas; syndromet har jämförts med löftet i Matteus 13:12, som uttalar ‘Den som har, skall få mer, och han skall ha överflöd. Den som inte har, även det han har skall tas ifrån honom’.
De i mängden
En av de stora förhoppningarna med AI‑förstärkt forskning har varit att nya maskininlärningsmetoder skulle kunna bryta sig loss från Matthew‑effekten – även känd som popularitetsbias – och börja citera mindre kända verk som kan vara mer träffsäkra eller mer relevanta för den poäng som framförs i en artikel.
Men baserat på hur AI‑träningsrutiner tolkar datamängder fanns det aldrig någon god grund för denna optimism; och det har upprepade gånger visat sig att när AI inte uppfinner citeringar rakt av – ett kroniskt problem hittills – så förlänger den faktiskt Matthew‑effekten, precis som människor gör – om än kanske inte av samma anledning.
Under träning lär sig en modell att rangordna de mest citerade (eller ‘mest återkommande’) artiklarna i en träningsuppsättning högt, eftersom träningsrutinerna är utformade för att framkalla meningsfulla mönster, och för att avfärda avvikare som ‘brus’ eller statistiska anomalier.
Under detta regime skulle motsvarigheten till Einsteins relativitetsteori aldrig få uppmärksamhet från maskinen, som, när den väl är tränad, anser att den redan har funnit sina principer och referenser, och kan bara lättjustera detta perspektiv genom att nå ut till nyare publikationer via RAG, eller på andra sätt som utökar modellens räckvidd bortom dess tränade matris.
Problemet är att den inte kommer att ge erkännande åt sådana nya verk på samma sätt som de ‘gamla favoriterna’ den redan kände till, eller alls, eftersom dess statistiska bias nu är djupt inrotade.
Alltså observerar och imiterar AI inte egentligen mänskligt beteende när den förlänger Matthew‑effekten – den räknar bara hur många gånger forskare latmaskigt defaultar till samma gamla artiklar och rangordnar dem högt. I detta avseende är problemet med citeringsupprepning relaterat till utmaningen att välja en genuint intressant vetenskaplig artikel ur den ständigt växande snöstormen av AI‑forskningspublikationer, eftersom det starkaste arbetet ofta har den svagaste signalen.
Diagnostisera monokultur
Denna fråga behandlas i ett intressant nytt papper från USA med titeln When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Det nya arbetet – ett samarbete mellan University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University och University of Notre Dame – syftar till att definitivt bevisa existensen av citeringsmonokultur inom maskininlärning, så att dess variabler potentiellt kan adresseras direkt i framtiden, tillsammans med själva problemet.
I testerna fann författarna att elva modeller från OpenAI, Google och Anthropic upprepade gånger föredrog samma lilla grupp av artiklar – även efter att uppenbara popularitetssignaler hade tagits bort.
För att testa detta togs 120 verkliga artiklar bort från citeringsantal och publikationstillfällen, samtidigt som författarnamn ersattes och publiceringsår slumpmässigt tilldelades. Slumpmässiga uppsättningar av trettio artiklar visades sedan för varje modell, som fick citera högst tio.
Åtta mänskliga experter inom de relevanta fälten fick samma blinda artiklar, men konvergerade inte på samma favoriter som AI‑erna, vilket visar att biasen var specifik för AI‑modellerna snarare än artiklarna själva:

Från det nya papperet, testresultat som jämför citeringsval av AI‑modeller och mänskliga experter. Bland alla elva modeller koncentrerades citeringar på en mindre grupp artiklar, medan vissa artiklar helt enkelt ignorerades upprepade gånger. Mänskliga experter visade ingen sådan tendens. Källa
Samma artiklar förblev populära även när modellerna enbart ombads välja referenser, vilket visar att själva skrivandet av recensionen inte orsakade biasen.
Experimentet utökades sedan över elva omgångar, med 120 AI‑skrivna artiklar tillagda efter varje omgång, för att testa vad som händer när dessa gemensamma preferenser verkar i en växande pool av AI‑genererad forskning.
När fler AI‑skrivna artiklar lades till koncentrerade modellerna i allt högre grad sina citeringar på ett minskande antal av de ursprungliga mänskliga artiklarna.
Författarna skriver:
‘När språkmodeller går från att skriva prosa till att köra litteratursökande agenter med verktygsanrop, blir fabricerade referenser lättare att fånga och begränsa.
‘Det svårare felet börjar efter att varje kandidat är verklig: olika modeller kan fortfarande välja samma smala delmängd, vilket skapar citeringsmonokultur utan att någon enskild citering är fel.’
Som en åtgärd för att lösa problemet argumenterar papperet för att enbart blanda modeller från olika leverantörer eller ge artiklar lika exponering inte kommer att räcka, eftersom en stor del av preferensen delas mellan modellerna. Istället skulle den underliggande preferensen för specifika artiklar behöva förändras – möjligen genom att medvetet ge försummade artiklar större framträdande. Författarna betonar dock att detta tillvägagångssätt fortfarande är otestat.
Testmetoder
Benchmarket byggdes på 120 verkliga kunskapsdestillationsartiklar insamlade från arXiv och publicerade mellan 2015 och 2022. Varje artikel hade mellan 50 och 500 citeringar vid insamlingstillfället, ett intervall som valdes för att utesluta både obskyra och exceptionellt inflytelserika verk.
Experimentet inleddes med att slumpmässigt dra trettio artiklar från den tillgängliga samlingen, med författarnamn, publiceringsår och citeringsantal dolda. Varje modell producerade en kort recension eller positionstext som citerade högst tio artiklar, och dessa val jämfördes med slumpmässiga urval från samma material:

Schema för metoden som användes för att testa citeringspreferenser. Trettio slumpmässigt utvalda artiklar visades för en modell med identifierande information dold, varpå den kunde citera upp till tio. Dess val jämfördes med slumpmässigt urval, medan varje omgång lade till 120 AI‑skrivna artiklar till nästa omgångs samling.
I det utökade experimentet tillkom 120 nygenererade artiklar till samlingen efter varje omgång, vilket gradvis ökade andelen AI‑skriven forskning.
I preliminära tester tenderade modellerna att citera de flesta av de artiklar de visades, vanligtvis valde de 22 till 27 av de 30. Forskarna satte därför ett tak på tio citeringar för huvudexperimentet, vilket tvingade modellerna att göra mer selektiva val.
Nedan ser vi en sammanfattning av den resulterande experimentdesignen:

Experimentell uppsättning som användes för att testa citeringspreferenser. Studien började med 120 verkliga artiklar och testade elva modeller från tre leverantörer, med slumpmässiga uppsättningar av 30 artiklar och ett tak på tio citeringar. Senare omgångar lade till AI‑genererade artiklar, vilket utökade samlingen till 1 440 artiklar.
Det initiala experimentet använde elva modeller från de tre största leverantörerna: OpenAI representerades av GPT-5, GPT-5 mini, GPT-4.1 och GPT-4.1 mini; Google av Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro och Gemini 3.1 Flash-Lite; samt Anthropic av Claude Opus 4.8, Claude Sonnet 4.6 och Claude Haiku 4.5.
I testresultaten nedan ser vi hur mycket varje modell koncentrerade sina citeringar till en liten grupp artiklar; hur många artiklar den helt ignorerade; och hur konsekvent den gjorde samma val när experimentet upprepades:

Testresultat som visar hur starkt varje modell koncentrerade sina citeringar på specifika artiklar och hur många artiklar den helt ignorerade. ‘Top-10 % andel’ visar hur många citeringar som gick till de 12 mest föredragna artiklarna, medan ‘HHI’ mäter hur koncentrerade citeringarna var totalt. ‘Tillförlitlighet’ visar hur konsekvent varje modell föredrog samma artiklar över tester, och ρ visar hur lika dessa preferenser var mellan modellerna. ‘Matched null’-raden indikerar vad som skulle förväntas om artiklar valdes slumpmässigt.
Vad föredrar modellerna egentligen?
Preferensen visade sig övervägande drivas av innehållet i artiklarna själva. Till exempel, för GPT-5 mini, kunde omkring 90 % av variationen i vilka artiklar som föredrogs tillskrivas innehållet, snarare än faktorer som listordning, genereringsbrus eller den fabricerade metadata som fästs på varje artikel. Samma ‘dominerande innehåll’-effekt reproducerades med GPT-4.1 mini.
Preferenskartan (se nedan) förändrades också knappt när titlar och abstrakt omarbetades väsentligt medan deras betydelse bevarades. I fyra lyckade parafraseringstester erhölls korrelationer på 0,95–0,99, trots att olika modeller från tre leverantörer användes för omarbetningen.
Förändringar i preferenskartan observerades endast när den underliggande betydelsen mättligt förändrades:

Testresultat som jämför citeringspreferenser över de elva modellerna. Siffrorna visar hur nära varje modellpar föredrog samma artiklar, där högre värden indikerar större överensstämmelse. Trots skillnader mellan modeller och leverantörer hittades relativt liknande preferenser över gruppen
Modellerna verkar därför huvudsakligen svara på semantiskt innehåll snarare än specifik formulering. Anledningen till deras starka överensstämmelse kunde dock inte avgöras entydigt.
Det är möjligt, hävdar författarna, att ett gemensamt citeringskonsensus kan ha absorberats under träningen. Ett alternativt scenario är att liknande bedömningar av vad som utgör en ‘citerbar’ artikel kan nås oberoende.
Därför fastställdes existensen av den gemensamma preferensen, men dess slutgiltiga ursprung förblir okänt.
Författarna föreslår att omfattande användning av AI i forskning kan begränsa spektrumet av verk som får uppmärksamhet, eftersom olika modeller tenderar att föredra många av samma artiklar; och när AI‑genererad litteratur samlas kan dessa gemensamma preferenser ytterligare förstärkas genom återkommande citeringar, vilket gör mindre föredragna forskningsresultat allt svårare att upptäcka. Citeringsdiversitet och övervakning av citeringskoncentration föreslås därför som möjliga skyddsåtgärder.
Studiens benchmark för rekursiv citeringskoncentration är nu tillgänglig på GitHub.
Slutsats
Åsikt Som någon som läser ett orimligt antal AI‑forskningsartiklar varje vecka, har jag sett ‘citeringsvågor’ komma och gå. En ständig pelare är Googles Attention Is All You Need, den ursprungliga Transformers‑artikeln, som nu sannolikt är hårdkodad i inlämningsmallar.
En annan återkommande företeelse, under en längre tid, var 2014‑utgåvan Generative Adversarial Networks, även om den så småningom ersattes i frekvens av Denoising Diffusion Probabilistic Models och andra diffusion‑baserade huvudstudier.
I nästan alla fall är dessa ‘återkommande’ citeringar inte fel i sig; men de är ofta för brett omfattande för att vara ett användbart stöd till den artikel de citeras i; och i den bemärkelsen representerar de något liknande ‘citerings-tvätt’ – inkluderingen av ‘pålitliga’ men främst dekorativa källcitat, för att ge ett lågt ansträngningsintryck av trovärdighet.
Först publicerad måndag 24 augusti 2026. Ändrad 23:07 EET för att lägga till saknad plural.












