Andersons vinkel
AI siterer de samme papirene gang på gang – akkurat som mennesker

ChatGPT og andre AI‑skrivverktøy kan stille og rolig gjøre vitenskapen til en popularitetskonkurranse, ved gjentatte ganger å lede forskere mot de samme artiklene mens de overser nye og nyskapende arbeider som faktisk kunne fremme feltet.
Monokultur, når det gjelder frekvens og statistikk, er der det samme begrensede settet av kilder eller ressurser gjentar seg gang på gang, og drukner nye stemmer og friske perspektiver: den samme begrensede mengden sanger i radiosendinger; den samme samlingen av forfattere og bøker i flyplassbokhyller; og den samme begrensede utvalget av frukt og grønnsaker i supermarkeder:

Ja, vi har disse bananene – og bare disse bananene. Homogeniteten av frukt og grønnsaker i vestlige matkjeder ignorerer de hundrevis av andre arters muligheter i hvert tilfelle, fordi de ulike produksjons- og transportkjedene er for kostbare til å industrialisere for mangfoldige typer frukt eller grønnsaker. Kilde
Dette skjer også i sitatene som dukker opp i ny vitenskapelig forskning, hvor forskere, kanskje lattermildt, default til et «pålitelig» sett av kilder som får momentum til de begynner å dominere forskningsgrener.
Dette kalles Matteus-effekten, en sosiologisk teori som sier at de som allerede har en fordel, vil fortsette å tjene på den. Fenomenet er blitt sammenlignet med løftet i Matteus 13:12, som sier: «Den som har, skal få mer og ha overflod. Den som ikke har, skal bli fratatt selv det han har.»
De i mengden
Et av de store håpene med AI‑forsterket forskning har vært at nye maskinlæringsmetoder kan bryte ut av Matthew‑effekten – også kjent som popularitetsbias – og begynne å sitere mindre kjente arbeider som kan være mer treffende eller mer relevante for poenget i en artikkel.
Imidlertid, basert på hvordan AI‑treningsrutiner tolker datasett, har det aldri vært noe godt grunnlag for denne optimismen; og det har gjentatte ganger blitt funnet at når AI ikke oppfinner sitater direkte – et kronisk problem så langt – så opprettholder den faktisk Matthew‑effekten, akkurat som mennesker gjør – selv om kanskje av en annen grunn.
Under trening vil en modell lære å rangere høyt de mest siterte (eller «mest ofte gjentatte») artiklene i et treningssett, fordi treningsrutinene er designet for å avdekke meningsfulle mønstre, og for å avvise avvik som «støy» eller statistiske anomalier.
Under dette regimet vil ekvivalenten til Einsteins relativitetsteori aldri få oppmerksomhet fra maskinen, som, når den er trent, føler at den allerede har funnet sine prinsipper og referanser, og kun kan justere dette svakt ved å hente nyere publikasjoner gjennom RAG, eller på andre måter som utvider modellens rekkevidde utover den trente matrisen.
Problemet er at den ikke vil kreditere slike nye arbeider på samme måte som de «gamle favorittene» den allerede kjenner, eller i det hele tatt, fordi de statistiske skjevhetene nå er dypt innprentet.
Dermed observerer og etterligner ikke AI egentlig menneskelig atferd når den opprettholder Matthew‑effekten – den teller bare hvor mange ganger forskere lattermildt default til de samme gamle artiklene, og rangerer dem tilsvarende høyt. I denne sammenheng er problemet med gjentatte sitater knyttet til utfordringen med å plukke ut en virkelig interessant vitenskapelig artikkel fra den stadig voksende snøstormen av AI‑forskningspublikasjoner, ettersom det sterkeste arbeidet ofte har det svakeste signalet.
Diagnostisering av monokultur
Dette problemet tas opp i et interessant nytt papir fra USA med tittelen When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Det nye arbeidet – et samarbeid mellom University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University og University of Notre Dame – søker å entydig bevise eksistensen av sitat‑monokultur i maskinlæring, slik at variablene kan potensielt adresseres direkte i fremtiden, sammen med selve problemet.
I tester fant forfatterne at elleve modeller fra OpenAI, Google og Anthropic gjentatte ganger foretrakk den samme lille gruppen av artikler – selv etter at åpenbare popularitetssignaler var fjernet.
For å teste dette ble 120 ekte artikler frarøvet siteringsantall og publikasjonssteder, mens forfatternavn ble erstattet, og publikasjonsår tilfeldig omfordelt. Tilfeldige sett med tretti artikler ble deretter vist til hver modell, som fikk lov til å sitere maksimalt ti.
Åtte menneskelige eksperter innen de aktuelle feltene fikk de samme blinde artiklene, men konvergerte ikke til de samme favorittene som AI‑ene, noe som viser at skjevheten var spesifikk for AI‑modellene og ikke artiklene selv:

Fra det nye papiret, testresultater som sammenligner siteringsvalg av AI‑modeller og menneskelige eksperter. På tvers av alle elleve modeller var sitatene konsentrert om en mindre gruppe artikler, mens noen artikler ble fullstendig oversett gjentatte ganger. Menneskelige eksperter viste ingen slik tendens. Kilde
De samme artiklene forble populære selv når modellene kun ble bedt om å velge referanser, noe som viser at selve skrivingen av anmeldelsen ikke forårsaket skjevheten.
Eksperimentet ble deretter utvidet over elleve runder, med 120 AI‑skrevne artikler lagt til etter hver runde, for å teste hva som skjer når disse delte preferansene opererer i en voksende pool av AI‑generert forskning.
Etter hvert som flere AI‑skrevne artikler ble lagt til, konsentrerte modellene i økende grad sine sitater på et krympende antall av de opprinnelige menneskelige artiklene.
«Når språkmodeller går fra å skrive prosa til å kjøre litteratursøk‑agenter med verktøykall, blir fabrikerte referanser lettere å oppdage og begrense.
«Den vanskeligere feilen begynner etter at hver kandidat er reell: ulike modeller kan fortsatt velge det samme smale underutvalget, og skape sitat‑monokultur uten at noen enkelt sitering er feil.»
Som en løsning på problemet argumenterer papiret for at det ikke er nok å bare blande modeller fra ulike leverandører eller gi artikler lik eksponering, siden mye av preferansen deles på tvers av modeller. I stedet må den underliggende preferansen for bestemte artikler endres – muligens ved bevisst å gi oversette artikler større fremtredelse. Forfatterne understreker imidlertid at denne tilnærmingen fortsatt er uprøvd.
Testmetoder
Benchmark‑testen ble bygget fra 120 ekte kunnskapsdestillasjons‑artikler samlet fra arXiv og publisert mellom 2015 og 2022. Hver av dem hadde mellom 50 og 500 siteringer på tidspunktet for innsamlingen, et intervall valgt for å ekskludere både obskure og eksepsjonelt innflytelsesrike arbeider.
Eksperimentet startet med å trekke tretti artikler tilfeldig fra den tilgjengelige samlingen, med forfatternavn, publikasjonsår og siteringstall skjult. Hver modell produserte en kort anmeldelse eller posisjonstekst som siterte maksimalt ti artikler, og disse valgene ble sammenlignet med tilfeldige utvalg fra samme materiale:

Skjema for metoden som brukes til å teste siteringspreferanser. Tretti tilfeldig valgte artikler ble vist til en modell med identifiserende informasjon skjult, hvoretter den kunne sitere opptil ti. Valgene ble sammenlignet med tilfeldig utvalg, mens hver runde la til 120 AI‑skrevne artikler i neste runde sin samling.
I den utvidede eksperimentet ble 120 nygenererte artikler lagt til samlingen etter hver runde, og økte gradvis andelen AI‑skrevet forskning.
I foreløpige tester hadde modellene en tendens til å sitere de fleste artiklene de ble vist, vanligvis 22 til 27 av de 30. Forskerne satte derfor en maksimumsgrense på ti siteringer for hovedeksperimentet, for å tvinge modellene til å gjøre mer selektive valg.
Nedenfor ser vi en oppsummering av det resulterende eksperimentelle designet:

Eksperimentell oppsett brukt til å teste siteringspreferanser. Studien startet med 120 ekte artikler og testet elleve modeller fra tre leverandører, ved å bruke randomiserte sett med 30 artikler og maksimalt ti siteringer. Senere runder la til AI‑genererte artikler, og utvidet samlingen til 1 440 artikler.
Den innledende eksperimentet brukte elleve modeller fra de tre største leverandørene: OpenAI var representert av GPT-5, GPT-5 mini, GPT-4.1 og GPT-4.1 mini; Google av Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro og Gemini 3.1 Flash‑Lite; og Anthropic av Claude Opus 4.8, Claude Sonnet 4.6 og Claude Haiku 4.5.
I testresultatene som vises nedenfor ser vi hvor mye hver modell konsentrerte sine sitater blant en liten gruppe artikler; hvor mange artikler den ignorerte helt; og hvor konsistent den gjorde de samme valgene når eksperimentet ble gjentatt:

Testresultater som viser hvor sterkt hver modell konsentrerte sine sitater på bestemte artikler og hvor mange artikler den ignorerte helt. «Top‑10 % andel» viser hvor mange sitater som gikk til de 12 mest foretrukne artiklene, mens «HHI» måler hvor konsentrerte sitatene var totalt. «Reliabilitet» viser hvor konsistent hver modell foretrakk de samme artiklene på tvers av tester, og ρ viser hvor like disse preferansene var på tvers av modeller. «Matched null»-raden indikerer hva som ville vært forventet dersom artikler ble valgt tilfeldig.
Hva favoriserer modellene egentlig?
Preferansen ble funnet å være overveldende drevet av innholdet i artiklene selv. For eksempel, for GPT-5 mini, kunne omtrent 90 % av variasjonen i hvilke artikler som ble foretrukket tilskrives innholdet, snarere enn faktorer som rekkefølge i listen, generasjonsstøy eller den fabrikerte metadataen knyttet til hver artikkel. Den samme «dominerende innhold»-effekten ble gjenskapt med GPT-4.1 mini.
Preferansekartet (se nedenfor) ble også knapt endret når titler og sammendrag ble betydelig omskrevet mens meningen ble bevart. På tvers av fire vellykkede parafraser fikk man korrelasjoner på 0,95–0,99, til tross for at ulike modeller fra tre leverandører ble brukt til omskrivningen.
Endringer i preferansekartet ble kun observert når den underliggende meningen ble merkbart endret:

Testresultater som sammenligner siteringspreferanser på tvers av de elleve modellene. Tallene viser hvor nært hvert par av modeller foretrakk de samme artiklene, med høyere verdier som indikerer større enighet. Til tross for forskjeller mellom modeller og leverandører, ble bredt sett lignende preferanser funnet på tvers av gruppen
Modellene ser derfor ut til å reagere hovedsakelig på semantisk innhold snarere enn spesifikke formuleringer. Imidlertid kunne årsaken til deres sterke enighet ikke fastslås entydig.
Det er mulig, hevder forfatterne, at en felles siteringskonsensus kan ha blitt absorbert under trening. Et alternativt scenario er at lignende vurderinger av hva som utgjør en «siterbar» artikkel kan nås uavhengig.
Dermed ble eksistensen av den delte preferansen etablert, men dens ultimate opprinnelse forblir ukjent.
Forfatterne antyder at omfattende bruk av AI i forskning kan innsnevre spekteret av arbeid som får oppmerksomhet, fordi ulike modeller har en tendens til å favorisere mange av de samme artiklene; og etter hvert som AI‑generert litteratur akkumuleres, kan disse delte preferansene bli ytterligere forsterket gjennom gjentatte sitater, noe som gjør mindre foretrukket forskning stadig vanskeligere å oppdage. Mangfold i siteringer og overvåking av siteringskonsentrasjon foreslås derfor som mulige sikkerhetsmekanismer.
Studiets benchmark for rekursiv siteringskonsentrasjon er nå tilgjengelig på GitHub.
Konklusjon
Meningsytring Som en som leser et uforholdsmessig stort antall AI‑forskningsartikler hver uke, har jeg sett «siteringsbølger» komme og gå. En evigvarende støttespiller er Googles Attention Is All You Need, den originale Transformer‑artikkelen, som nå sannsynligvis er hardkodet inn i innsendingsmaler.
En annen gjentakende gjerningsperson, i lang tid, var 2014‑utgaven Generative Adversarial Networks, selv om den til slutt ble erstattet i frekvens av Denoising Diffusion Probabilistic Models og andre diffusions‑baserte hovedstudier.
I nesten alle tilfeller er disse «gjentakende» sitatene ikke feil i seg selv; men de er ofte for vidtgående til å være en nyttig støtte til artikkelen de siteres i; og i den forstand representerer de noe som ligner på «siteringsvask» – inkludering av «pålitelige», men primært dekorative kildehenvisninger, for å skape en lettvint aura av troverdighet.
Først publisert mandag 24. august 2026. Endret 23:07 EET for å legge til manglende flertall.
Kilder fra originalartikkelen: unite.ai [1] · link.springer.com [2] · unite.ai [3] · unite.ai [4] · unite.ai [5] · pubmed.ncbi.nlm.nih.gov [6] · unite.ai [7] · unite.ai [8] · unite.ai [9]












