Andersons vinkel
Bekjempe AI‑slurv i vitenskapelige artikler

AI gjør alt i stor skala, fra webskraping på nivå med DOS‑angrep til å produsere, eller muliggjøre, så store mengder av vitenskapelige forskningsinnleveringer at resultatet blir både en logistisk krise og en kvalitetskrise, ettersom signal‑til‑støy‑forholdet fortsetter å bli uoverskuelig.
Forrige uke preprint‑serveren arXiv kunngjorde at den vil innføre en ny begrensningspolitikk for innsendinger, som nå vil bli begrenset til to innsendinger per måned. Tiltaket er blitt iverksatt, antyder kunngjøringen, i møte med en svimlende økning i innsendingstakten over en kort tidsperiode:

Månedlige innsendinger til arXivs cs.AI‑kategori fra januar 2024 til september 2026, som viser en mer enn seksdobling over perioden. Kilde
Kat Boboris’ blogginnlegg som kunngjorde tiltaket, som fikk kommentarer på Hacker News forrige torsdag, oppga at arXiv mottok 40 363 innsendinger i september 2026 – nesten dobbelt så mange som de 20 569 som ble mottatt i september 2024, og mer enn fire ganger så mange som de 9 869 som ble mottatt i september 2016.
Boboris observerte at de siste månedens innsendinger også genererte nesten 9 000 støttesaker for arXiv‑personell og moderatorer:
‘Våre moderatorer observerer en økning i tynne artikler med snevert omfang, samt ‘salami’-artikler, der et enkelt arbeid deles opp og sendes inn som et sett med mindre artikler.
‘Det er også en tydelig økning i tette, AI‑skrevne artikler. AI‑verktøy gjør det enkelt for forfattere å oversvømme arXiv og andre arkiver med disse lavverdige artiklene.’
Allerede i mai i år innførte arXiv et ettårsforbud på ukontrollert AI‑innhold; og i oktober i fjor informerte de innsendinger av undersøkelsesartikler og posisjonsartikler (begge kan genereres med mindre innsats enn en full akademisk studie) om at de ville trenge fagfellegodkjenning for å bli publisert på arXiv.
For øyeblikket er arXivs ofte hindrende begrensning av http‑forespørsler ikke så tydelig, og man kan bare håpe at de svært nyttige RSS‑strømmene overlever denne pågående innstrammingen. Forrige uke Reddit kunngjorde den lenge fryktede totale elimineringen av sine RSS‑strømmer, som vil finne sted fra midten av neste måned. Imidlertid betyr arXivs ideelle status at det er lite liknende kapital å oppnå ved å lede lesere til obligatoriske sidebesøk, eller tvungne pålogginger – i det minste for øyeblikket.
Mot den stigende bølgen
I møte med slike alvorlige og voksende problemer rundt den negative effekten av AI‑bruk i vitenskapelig forskning – spesielt når det gjelder AI‑relatert forskning, som har overskygget alle andre kategorier, og har gått fra å være ukjent til å bli en politisk og økonomisk indikator nylig – har en forskningslinje dukket opp som undersøker måter å motvirke nedgangen i kvaliteten på AI‑relaterte artikkelinngivelser.
Den siste til å ta tak i problemet kommer i form av et samarbeid mellom Sør‑Koreas Seoul National University og University of Minnesota i USA. Artikkelen, med tittelen Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, foreslår å måle ‘vitenskapelig slurv’ gjennom feil i sammenhengene mellom en artikkels påstander, bevis, sitater og struktur:

Fra den nye artikkelen, en oversikt over arbeidets tilnærming til ‘vitenskapelig slurv’, som viser hvordan feil i struktur, argumentasjon og støttende artefakter kan avdekke svakheter som konvensjonelle AI‑tekstdetektorer overser. Kilde
I motsetning til tidligere tilnærminger ser det nye systemet utover selve teksten for å vurdere om artikkelens påstander er riktig støttet av argumentene, bevisene og sitatene. Forfatterne uttaler*:
‘Hver del av en artikkel kan fremstå plausibel i isolasjon, så slike sammenbrudd er usynlige for token‑nivådetektorer og kan kun identifiseres eller repareres på helartikkel‑nivå. For å benchmarke og dempe vitenskapelig slurv adresserer denne artikkelen tre utfordringer.
‘Først mislykkes token‑nivå‑metrikker i å fange hvordan vitenskapelig resonnering knytter seg på tvers av en artikkel. Seksjoner, påstander, sitater, bevis og artefakter kan hver fremstå plausibel mens forholdene mellom dem bryter sammen. Vi observerer gjentatte ganger slike feil i ende‑til‑ende AI‑genererte artikler, og ICLR‑vurderere straffer dem allerede i innleveringer skrevet av mennesker.
‘Andre, oppdagelse av disse mønstrene forblir umålt. Eksisterende testsett merker kun teksten, så i hvilken grad detektorer, inkludert LLM-er som leser hele artikkelen, identifiserer disse mønstrene, har aldri blitt målt.
‘Tredje, disse mønstrene er vanskelige å dempe pålitelig. Mens token‑nivå‑signal kan fjernes ved omskriving, krever reparasjon av disse mønstrene å gjenopprette de manglende relasjonene uten å endre den underliggende vitenskapen.’
Forfatternes nye benchmark, kalt SciSlopBench, er implementert i SciSlopHarness, et rammeverk designet for å oppdage og reparere feil i en artikkels vitenskapelige resonnering, samtidig som det bevarer det underliggende vitenskapelige beviset:

Eksempler som sammenligner feilaktige avsnitt med revisjoner gjort av SciSlopHarness. Uunderbygde tillegg avvises, mens påstander omorganiseres eller skrives om der det er nødvendig for bedre å gjenspeile bevisene som er tilgjengelige i artikkelen.
SciSlopBench‑benchmarken ble bygget fra 390 AI‑genererte artikler, hver paret med en menneskeskrevet artikkel som adresserer et lignende forskningsproblem og bidragstype.
I tester ble SciSlopBench brukt til å skille mellom 390 par av artikler, der hvert par bestod av den nevnte AI‑genererte artikkelen og en menneskeskrevet artikkel matchet etter forskningsproblem og bidragstype. Benchmarken identifiserte korrekt den AI‑genererte artikkelen i 85,9 % av sammenligningene, og overgikk dermed tradisjonelle AI‑tekstdetektorer betydelig.
Forfatterne uttaler:
‘Mens standardrevisjoner etterlater restslop og direkte slop‑bevisst prompting utløser belønningsjuks, reduserer SciSlopHarness det gjenværende AI‑menneske‑gapet med 63 % sammenlignet med den sterkeste revisjonsbasen uten å kreve menneskelige referansemål.
‘Generelt viser vi at AI‑genererte vitenskapelige artikler etterlater grunnleggende spor i deres globale resonnering, og at ansvarlig demping krever streng evidensbasert forankring snarere enn kun prosa‑forbedring.’
I tillegg til bidragene fra selve artikkelen har forfatterne gjort prinsippene i deres nye arbeid operasjonelle i form av en live‑demo hvor brukere kan sende inn vitenskapelige artikler for analyse av hvor mye AI‑slop de inneholder.
Interessant nok får den nye artikkelen selv, analysert av demoen, en ‘moderat’ slop‑score på 40/100†:

Den nye artikkelen, analysert av sin egen algoritme, får ‘slop’-områder markert av forfatternes nye prosess. Kilde
Metode og datatilnærming
Samarbeidet 2025 Why Slop Matters beskrev ‘overfladisk kompetanse’ som et definerende kjennetegn ved AI‑slop, hvor tilsynelatende kvalitet skjuler mangel på substans. Det nye arbeidet anvender denne idéen mer spesifikt på vitenskapelige artikler, og definerer ‘vitenskapelig slop’ som feil som gjør det vanskelig å følge hvordan en studie er organisert; hvordan påstandene støttes; og hvordan metodene og bevisene kan undersøkes, med feilene gruppert i struktur; argument; og artefakter:

Måleregler for de seks typene vitenskapelig slop som brukes i benchmarken. Tabellen viser hva som undersøkes for hver måling, hvordan poengsummen beregnes, og hva maksimalpoengsummen 1 representerer, med høyere poengsummer som indikerer mer omfattende feil.
De seks målingene av vitenskapelig slop som er definert i artikkelen er tverrsnittreferanser (om seksjoner refererer meningsfullt til materiale andre steder i artikkelen); makroredundans (om senere seksjoner gjentar tidligere materiale); argumentgraf (om påstander er korrekt støttet av foregående resonnering); sitatisolasjon (om sitater brukes overfladisk uten å forklare hvordan de siterte verkene forholder seg til artikkelen eller til hverandre); figurforklaring (om metodefigurer faktisk forklarer metoden); og bevisgap (om rapporterte resultater støttes av konkrete eksempler).
Benchmarket ble konstruert ved å pare AI‑genererte artikler med sammenlignbare/ekvivalente menneskeskrevne artikler, med AI‑artiklene kurert fra FARS og 2025 Agents4Science-konkurransen.
For hver maskin‑genererte FARS‑artikkel søkte forskerne i referansene etter en menneskeskapt artikkel av samme type som var akseptert på et topprangert forum, og valgte deretter den nærmeste matchen etter forskningsområde, noe som ga 143 par. Agents4Science‑artiklene ble på samme måte paret med menneskeskapte motparter, noe som ga ytterligere 247 par og førte benchmarken opp på totalt 390 AI‑menneske‑par. Artiklene dekker livs‑, samfunns‑ og naturvitenskapene, selv om datasettet er tungt vektlagt datavitenskap.
For målene ble ytelsen evaluert ved bruk av PairAcc, som måler hvor ofte den menneskelige artikkelen rangeres over sin AI‑motpart; og AUROC, som måler den samlede separasjonen mellom menneskelige og AI‑artikler på tvers av ulike terskler. Forfatterne rapporterer også deteksjonsytelse når falsk‑positiv‑raten for menneskelige artikler er fastsatt til 5 %.
Tester
Innledende tester sammenlignet SciSlop med AI‑tekstdetektorene Binoculars; DetectGPT; og NTS††, samt de automatiserte vurderingssystemene AI Scientist Reviewer og CycleReviewer.
For de senere revisjonstestene ble fire referansemetoder brukt: grunnprompting; Claude Code; vurderer‑basert raffinering; og slop‑bevisst revisjon. De første tre fikk kun generelle instruksjoner om å forbedre artikkelen, mens slop‑bevisst revisjon i tillegg fikk definisjonene og plasseringene av oppdaget slop. Alle ble sammenlignet med SciSlopHarness under tilsvarende revisjonsforhold.
For implementering ble tekstdetektorene gitt artikkelens prosa, mens de andre metodene fikk artikkelens kildekode og, der det var nødvendig, tilgang til koden. Binoculars brukte Falcon-7B base‑ og instruksjonsmodeller; DetectGPT brukte T5-3B til å generere 100 perturberinger; AI Scientist brukte Qwen2.5-32B-Instruct; og CycleReviewer brukte sin utgitte 8B‑sjekkpunkt. For artikler som overskred Falcons 2 048‑token‑grense, ble ikke‑overlappende vinduer vurdert separat og deretter gjennomsnittet.
De innledende deteksjonsresultatene er detaljert i de to tabellene nedenfor: SciSlop oppnådde 85,9 % PairAcc, sammenlignet med 68,7 % for Binoculars og 68,5 % for den sterkeste automatiserte vurdereren, og reduserte feilraten med mer enn halvparten:

Deteksjonsresultater som sammenligner SciSlop med AI‑tekstdetektorer og automatiserte vurderere, samt resultater for dets seks individuelle slop‑mål. SciSlop oppnår den høyeste samlede PairAcc, mens tverrsnittreferanser gir det sterkeste individuelle resultatet.
Tverrsnittreferanser presterte spesielt sterkt på egen hånd, nådde 90,5 % PairAcc uten å kreve en modell, og oppdaget 65 % av AI‑genererte artikler ved en falsk‑positiv‑rate på 5 %, sammenlignet med 24 % for Binoculars.
Forfatterne hevder at disse resultatene viser at relasjoner på tvers av artikkelen gir et sterkere signal om AI‑generering enn konvensjonell tekstnivå‑deteksjon på dette datasettet, samtidig som de identifiserer konkrete svakheter som senere kan rettes i en revisjon.
Forholdet mellom vitenskapelig slop og menneskelige vurderinger av artikkelens kvalitet ble undersøkt deretter. Som vist i den første kolonnen nedenfor, var høyere slop assosiert med lavere ICLR‑poeng for samlet vurdering, soliditet, presentasjon og bidrag:

Sammenligning av SciSlop med AI‑tekstdetektorer og automatiserte vurderere mot ICLR‑vurderingsresultater. Venstre panel viser AI‑likhet i forhold til vurderingspoeng; midten sammenligner individuelle vurderingsdimensjoner; høyre viser ytelse i å skille avviste fra aksepterte artikler over ni år.
Avviste og aksepterte artikler ble også skilt fra hverandre over sjanse på tvers av alle de ni årene som ble undersøkt, mens konvensjonelle detektorer lå under sjanse i de fleste sammenligninger.
Vitenskapelig slop ble derfor funnet å reflektere svakheter som allerede ble straffet av menneskelige vurderere, snarere enn å kun fungere som et signal på AI‑forfatterskap.
De siste testene undersøkte om SciSlopHarness kunne fjerne slop som fortsatt var til stede etter en mer generell revisjon. Som vist nedenfor, endte harnessen nærmest menneskelig gjennomsnitt på tvers av alle seks målene, mens generell revisjon ofte etterlot betydelig slop, og direkte slop‑bevisst revisjon noen ganger overkorrigerte:

Revisjonsresultater som sammenligner SciSlopHarness med fire basismetoder på tvers av de seks slop‑målingene. Verdier nærmere null er nærmere gjennomsnittet for menneskelige artikler, med SciSlopHarness som generelt beveger seg mot dette nivået mens slop‑bevisst revisjon ofte overskrider det.
Hver foreslåtte endring ble sjekket mot papirens vitenskapelige begrunnelse og støttende bevis, med uunderbygde redigeringer avvist. På tvers av de seks målingene ble den gjenværende gapet fra menneskeskrevne artikler redusert med 63 % sammenlignet med Claude Code, den sterkeste revisjonsbasen.
Konklusjon
Det var interessant, i løpet av skrivingen av dette innlegget, å merke ikke bare hvor dårlig dette papiret scoret på sin egen demosite, men også å observere minst ett eksempel på en ‘lat’ eller ‘kosmetisk’ sitering††, som den siste tiden har blitt en liten men voksende plage i forskningsartikler.
I slike tilfeller, utover dette spesifikke papiret, ser forskere ut til å trekke på sin egen kunnskap i stedet for å engasjere seg meningsfullt med den eksisterende litteraturen. Likevel, begrenset av konvensjonen om å ‘vise sitt arbeid’, blir siteringer ofte gitt med det som fremstår som utålmodighet, til og med forakt for prosessen, og ser ofte ut til å stole på at leseren aksepterer en overflod av referanser som en tilstrekkelig ‘patina’ av opprinnelse, selv om den ikke ville overleve grundig gransking.
Arxiv kjemper tilbake mot den AI‑drevne industrialiseringen av innleveringer; om det vil bli lignende begrensninger på AI sin direkte involvering i forskning, uten en relatert katastrofe av tilstrekkelig størrelse, gjenstår å se.
* Forfatternes vektlegging, ikke min – men min konvertering der det er nødvendig av forfatternes innebygde siteringer til hyperlenker.
† Forfatterne påstår ikke null AI‑bruk i sin egen artikkel, og detaljer om slik bruk.
†† Det kan interessere leseren å vite at jeg måtte lete meg frem til en korrekt lenke selv for NTS‑rammeverket, fordi lenken som forfatterne leverte ikke var relevant – ett av de svært viktige målene som SciSlop fokuserer på!
Først publisert søndag 4. oktober 2026












