Andersons vinkel

Bekæmpelse af AI‑sludder i videnskabelige artikler

mm
Føj Unite.AI til dine foretrukne kilder på Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

AI gør alt i stor skala, fra webscraping på DOS‑angrebsniveau til at producere eller muliggøre så enorme mængder af videnskabelige forskningsindsendelser, så resultatet bliver både en logistisk krise og en kvalitetskrise, efterhånden som signal‑til‑støj‑forholdet fortsat bliver uoverskueligt.

Sidste uge, preprint‑serveren arXiv annoncerede at den vil indføre en ny hastighedsbegrænsningspolitik for indsendere, som nu vil blive begrænset til to indsendelser pr. måned. Foranstaltningen er ifølge meddelelsen truffet i lyset af en svimlende stigning i indsendelsesrater over en kort tidsperiode:

Månedlige indsendelser til arXiv's cs.AI‑kategori fra januar 2024 til september 2026, der viser en mere end seksfold stigning over perioden. Kilde – https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Månedlige indsendelser til arXiv’s cs.AI‑kategori fra januar 2024 til september 2026, der viser en mere end seksfold stigning over perioden. Kilde

Kat Boboris’ blogindlæg, der annoncerede flytningen, og som fik kommentarer på Hacker News sidste torsdag, oplyste, at arXiv modtog 40,363 indsendelser i september 2026 – næsten dobbelt så mange som de 20,569 i september 2024, og mere end fire gange så mange som de 9,869 i september 2016.

Boboris observerede, at den seneste måneds indsendelser også genererede næsten 9,000 support‑billetter til arXiv‑personale og moderatorer:

‘Vores moderatorer observerer en stigning i tynde artikler med snævert omfang, såvel som ‘salami’-artikler, hvor et enkelt arbejde deles op og indsendes som et sæt af mindre artikler.

‘Der er også en markant stigning i tætte, AI‑skrevne artikler. AI‑værktøjer gør det nemt for forfattere at oversvømme arXiv og andre arkiver med disse lav‑værdi‑artikler.’

Allerede i maj i år har arXiv truffet foranstaltningen med at implementere et etårigt forbud for ukontrolleret AI‑indhold; og i oktober sidste år har de fortalt indsendere af undersøgelses‑ og positionspapirer (begge kan genereres med mindre indsats end en fuld akademisk undersøgelse), at de ville have brug for fagfællegodkendelse for at blive offentliggjort på arXiv.

For øjeblikket er arXiv‑domænets ofte hindrende begrænsning af http‑anmodninger ikke så tydelig, og man kan kun håbe, at deres meget nyttige RSS‑feeds overlever denne igangværende nedskæring. Sidste uge Reddit annoncerede den længe frygtede totale afskaffelse af sine RSS‑feeds, som vil finde sted fra midten af næste måned. Dog betyder arXivs non‑profit‑status, at der er lidt samme kapital at opnå ved at lede læsere til obligatoriske sidebesøg, eller tvungne login – i hvert fald for nu.

Mod den stigende strøm

I lyset af sådanne alvorlige og voksende problemer omkring den negative effekt af AI‑brug i videnskabelig forskning – især inden for AI‑relateret forskning, som har overskygget alle andre kategorier og er steget fra ukendelighed til at blive en politisk og økonomisk indikator for nylig – er der opstået en forskningsstrøm, der undersøger måder at modvirke nedgangen i kvaliteten af AI‑relaterede artikelindsendelser.

Den seneste indsats for at tackle problemet kommer i form af et samarbejde mellem Sydkoreas Seoul National University og University of Minnesota i USA. Artiklen, med titlen Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, foreslår at måle ‘videnskabelig sludder’ gennem fejl i forbindelserne mellem en artikels påstande, beviser, kildehenvisninger og struktur:

Fra den nye artikel, en oversigt over arbejdet's tilgang til 'videnskabelig sludder', der viser hvordan fejl i struktur, argumentation og understøttende artefakter kan afsløre svagheder, som konventionelle AI‑tekstdetektorer overser. Kilde – https://arxiv.org/pdf/2610.00531

Fra den nye artikel, en oversigt over arbejdet’s tilgang til ‘videnskabelig sludder’, der viser hvordan fejl i struktur, argumentation og understøttende artefakter kan afsløre svagheder, som konventionelle AI‑tekstdetektorer overser. Kilde

I modsætning til tidligere tilgange ser det nye system ud over selve teksten for at vurdere, om artiklens påstande er korrekt understøttet af dens argumenter, beviser og kildehenvisninger. Forfatterne anfører*:

‘Hver del af en artikel kan fremstå plausibel isoleret, så sådanne nedbrud er usynlige for token‑niveau‑detektorer og kan kun identificeres eller rettes på hele artiklens niveau. For at benchmarke og afbøde videnskabelig sludder adresserer denne artikel tre udfordringer.’

‘Først fejler token‑niveau‑målinger i at fange, hvordan videnskabelig ræsonnement forbinder sig på tværs af en artikel. Sektioner, påstande, kildehenvisninger, beviser og artefakter kan hver især fremstå plausible, mens relationerne mellem dem bryder sammen. Vi observerer gentagne gange sådanne fejl i ende‑til‑ende AI‑genererede artikler, og ICLR‑reviewere straffer dem allerede også i menneskeskrevne indsendelser.

‘For det andet er detektion af disse mønstre forblivet umålt. Eksisterende testsæt mærker kun teksten, så i hvilken grad detektorer, inklusive LLM’er der læser hele papiret, identificerer disse mønstre, er aldrig blevet målt.

‘Tredje er disse mønstre vanskelige at afbøde pålideligt. Mens token‑niveau‑signaler kan fjernes ved omskrivning, kræver reparation af disse mønstre at de manglende relationer genoprettes uden at ændre den underliggende videnskab.’

Forfatternes nye benchmark, kaldet SciSlopBench, er blevet indlejret i SciSlopHarness, en ramme designet til at opdage og reparere fejl i et papers videnskabelige ræsonnement, mens den underliggende videnskabelige evidens bevares:

Eksempler der sammenligner fejlbehæftede afsnit med revisioner foretaget af SciSlopHarness. Ikke‑understøttede tilføjelser afvises, mens påstande omarrangeres eller omskrives efter behov for bedre at afspejle den tilgængelige evidens i papiret.

Eksempler der sammenligner fejlbehæftede afsnit med revisioner foretaget af SciSlopHarness. Ikke‑understøttede tilføjelser afvises, mens påstande omarrangeres eller omskrives efter behov for bedre at afspejle den tilgængelige evidens i papiret.

SciSlopBench‑benchmarken selv blev bygget ud fra 390 AI‑genererede papirer, hver parret med et menneskeskrevet papir, der adresserer et lignende forskningsproblem og bidragstype.

I tests blev SciSlopBench brugt til at skelne mellem 390 papirpar, hvor hvert par bestod af det førnævnte AI‑genererede papir og et menneskeskrevet papir matchet efter forskningsproblem og bidragstype. Benchmarken identificerede korrekt det AI‑genererede papir i 85,9 % af disse sammenligninger, hvilket væsentligt overgik konventionelle AI‑tekstdetektorer.

Forfatterne udtaler:

‘Mens standardrevisioner efterlader rest‑slop, og direkte slop‑bevidst prompting udløser belønningsmanipulation, reducerer SciSlopHarness den resterende AI–human‑kløft med 63 % over den stærkeste revisionsbaseline uden at kræve menneskelige reference‑mål.

‘Samlet set demonstrerer vi, at AI‑genererede videnskabelige papirer efterlader grundlæggende spor i deres overordnede ræsonnement, og at ansvarlig afhjælpning kræver streng evidensbaseret forankring frem for blot sproglig forfinelse.’

I tillæg til bidragene fra selve papiret har forfatterne operationaliseret principperne i deres nye arbejde i form af en live‑demo, hvor brugere kan indsende videnskabelige papirer til analyse af, hvor meget AI‑slop de indeholder.

Interessant nok ligger det nye papir selv, analyseret af demoen, på en ‘moderat’ slop‑score på 40/100†:

Det nye papir, analyseret af dets egen algoritme, markerer 'slop'-områder identificeret af forfatternes nye proces. Kilde: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Det nye papir, analyseret af dets egen algoritme, får ‘slop’-områder markeret af forfatternes nye proces. Kilde

Metode og data‑tilgang

Samarbejdet 2025 Why Slop Matters beskrev ‘overfladisk kompetence’ som et karakteristisk træk ved AI‑slop, hvor tilsyneladende kvalitet skjuler mangel på substans. Det nye arbejde anvender denne idé mere specifikt på videnskabelige papirer og definerer ‘videnskabelig slop’ som fejl, der gør det svært at følge, hvordan en undersøgelse er organiseret; hvordan dens påstande understøttes; og hvordan dens metoder og evidens kan undersøges, hvor fejlene grupperes i struktur; argument; og artefakter:

Måleregler for de seks typer videnskabelig slop, der anvendes i benchmarken. Tabellen viser, hvad der undersøges for hver måling, hvordan scoren beregnes, og hvad den maksimale score på 1 repræsenterer, hvor højere scorer indikerer mere omfattende fejl.

Måleregler for de seks typer videnskabelig slop, der anvendes i benchmarken. Tabellen viser, hvad der undersøges for hver måling, hvordan scoren beregnes, og hvad den maksimale score på 1 repræsenterer, hvor højere scorer indikerer mere omfattende fejl.

De seks målinger af videnskabelig slop, der er defineret i papiret, er tværsnitsreferencer (om sektioner meningsfuldt refererer til materiale andre steder i papiret); makro redundans (om senere sektioner gentager tidligere materiale); argumentgraf (om påstande er korrekt understøttet af forudgående ræsonnement); citeringsisolering (om citater bruges overfladisk uden at forklare, hvordan de citerede værker forholder sig til papiret eller til hinanden); figur‑eksponering (om metodefigurer faktisk forklarer metoden); og bevis‑gab (om rapporterede resultater understøttes af konkrete eksempler).

Benchmarken blev konstrueret ved at parre AI‑genererede papirer med sammenlignelige/ækvivalente menneskeskrevne papirer, hvor AI‑papirerne blev udvalgt fra FARS og 2025 Agents4Science-konkurrencen.

For hver maskin-genereret FARS-artikel søgte forskerne i dens referencer efter en menneskeskrevet artikel af samme type, som var blevet accepteret på et top-tier venue, og udvalgte derefter det tætteste match efter forskningsemne, hvilket resulterede i 143 par. Agents4Science-artiklerne blev på samme måde parret med menneskeskrevne modparter, hvilket tilføjede yderligere 247 par og bragte benchmarken op på i alt 390 AI‑menneske‑par. Artiklerne dækker livs-, samfunds- og naturvidenskaberne, selvom datasættet er tungt vægtet mod datalogi.

For metrikkerne blev ydeevnen evalueret ved hjælp af PairAcc, som måler hvor ofte den menneskelige artikel rangeres over sin AI‑modpart; og AUROC, som måler den samlede adskillelse mellem menneskelige og AI‑artikler på tværs af forskellige tærskler. Forfatterne rapporterer også detektionsydelse, når falsk‑positiv‑raten for menneskelige artikler fastsættes til 5 %.

Tests

Indledningsvis blev SciSlop sammenlignet med AI‑tekstdetektorerne Binoculars; DetectGPT; og NTS††, samt de automatiserede anmeldelsessystemer AI Scientist Reviewer og CycleReviewer.

For de senere revisions‑tests blev fire baselines anvendt: base prompting; Claude Code; reviewer‑based refinement; og slop‑aware revision. De første tre modtog kun generelle instruktioner om at forbedre artiklen, mens slop‑aware revision også fik definitionerne og placeringerne af den detekterede slop. Alle blev sammenlignet med SciSlopHarness under ækvivalente revisions‑betingelser.

Til implementeringen fik tekstdetektorerne artiklens prosa, mens de øvrige metoder modtog artiklens kildekode og, hvor påkrævet, adgang til dens kode. Binoculars brugte Falcon-7B base‑ og instruct‑modeller; DetectGPT brugte T5-3B til at generere 100 perturbationer; AI Scientist brugte Qwen2.5-32B-Instruct; og CycleReviewer brugte sin frigivne 8B‑checkpoint. For artikler, der overskred Falcons grænse på 2.048 token, blev ikke‑overlappende vinduer scoreret separat og gennemsnittet.

De indledende detektionsresultater er detaljeret i de to tabeller nedenfor: SciSlop opnåede 85,9 % PairAcc, sammenlignet med 68,7 % for Binoculars og 68,5 % for den stærkeste automatiserede reviewer, hvilket reducerer fejlraten med mere end halvdelen:

Detektionsresultater, der sammenligner SciSlop med AI‑tekstdetektorer og automatiserede anmeldere, samt resultater for dets seks individuelle slop‑mål. SciSlop opnår den højeste samlede PairAcc, mens tværsnitsreferencer giver det stærkeste individuelle resultat.

Detektionsresultater, der sammenligner SciSlop med AI‑tekstdetektorer og automatiserede anmeldere, samt resultater for dets seks individuelle slop‑mål. SciSlop opnår den højeste samlede PairAcc, mens tværsnitsreferencer giver det stærkeste individuelle resultat.

Tværsnitsreferencer klarede sig særligt stærkt på egen hånd, nåede 90,5 % PairAcc uden at kræve en model, og detekterede 65 % af AI‑genererede artikler ved en falsk‑positiv‑rate på 5 %, sammenlignet med 24 % for Binoculars.

Forfatterne argumenterer for, at disse resultater indikerer, at relationer på tværs af artiklen giver et stærkere signal for AI‑generering end konventionel tekst‑niveau detektion i dette datasæt, samtidig med at specifikke svagheder identificeres, som efterfølgende kan målrettes for revision.

Forholdet mellem videnskabelig slop og menneskelige vurderinger af artiklens kvalitet blev derefter undersøgt. Som vist i den første kolonne nedenfor, var højere slop forbundet med lavere ICLR‑score for samlet bedømmelse, soliditet, præsentation og bidrag:

Sammenligning af SciSlop med AI‑tekstdetektorer og automatiserede anmeldere i forhold til ICLR‑reviewresultater. Det venstre panel viser AI‑lignende karakteristika mod review‑scores; midten sammenligner individuelle review‑dimensioner; højre viser præstation i at skelne afviste fra accepterede artikler over ni år.

Sammenligning af SciSlop med AI‑tekstdetektorer og automatiserede anmeldere i forhold til ICLR‑reviewresultater. Det venstre panel viser AI‑lignende karakteristika mod review‑scores; midten sammenligner individuelle review‑dimensioner; højre viser præstation i at skelne afviste fra accepterede artikler over ni år.

Afviste og accepterede artikler blev også skelnet over tilfældet i alle ni undersøgte år, mens konventionelle detektorer lå under tilfældet i de fleste sammenligninger.

Videnskabelig slop blev derfor fundet at afspejle svagheder, som allerede straffes af menneskelige anmeldere, snarere end kun at fungere som et signal for AI‑forfatterskab.

De afsluttende tests undersøgte, om SciSlopHarness kunne fjerne slop, der stadig var til stede efter mere generel revision. Som vist nedenfor, sluttede harnessen tættest på det menneskelige gennemsnit på tværs af alle seks mål, mens generel revision ofte efterlod betydelig slop, og direkte slop‑aware revision nogle gange overkorrigerede:

Revisionsresultater, der sammenligner SciSlopHarness med fire baseline‑metoder på tværs af de seks slop‑mål. Værdier tættere på nul er tættere på det menneskelige artikels gennemsnit, hvor SciSlopHarness generelt bevæger sig mod dette niveau, mens slop‑aware revision ofte overskrider det.

Revisionsresultater, der sammenligner SciSlopHarness med fire baseline‑metoder på tværs af de seks slop‑mål. Værdier, der er tættere på nul, er tættere på gennemsnittet for menneskelige artikler, hvor SciSlopHarness generelt bevæger sig mod dette niveau, mens slop‑bevidst revision ofte overskrider det.

Hver foreslået ændring blev kontrolleret mod papirens videnskabelige begrundelse og understøttende beviser, og uunderbyggede redigeringer blev afvist. På tværs af de seks mål blev den resterende forskel til menneskeskrevne artikler reduceret med 63 % sammenlignet med Claude Code, den stærkeste revisionsbaseline.

Konklusion

Det var interessant, i løbet af skrivningen af dette stykke, at bemærke ikke kun hvor dårligt dette papir scorede på sit eget demo‑site, men også at observere mindst ét eksempel på en ‘doven’ eller ‘kosmetisk’ citation††, som for nylig er blevet en mindre men voksende forbandelse i forskningsartikler.

I sådanne tilfælde, ud over dette specifikke papir, ser forskere ud til at trække på deres egen viden i stedet for at engagere sig meningsfuldt med den eksisterende litteratur. Alligevel, begrænset af konventionen om at ‘vise deres arbejde’, leveres citationer ofte med det, der læses som utålmodighed, endda foragt for processen, og ofte synes de tydeligt at stole på, at læseren accepterer en overflod af referencer som en tilstrækkelig ‘patina’ af oprindelse, selvom den ikke ville overleve grundig granskning.

Arxiv kæmper tilbage mod den AI‑drevne industrialisering af indsendelser; om der vil blive indført lignende begrænsninger på AI’s direkte involvering i forskning, uden en relateret katastrofe af tilstrækkelig størrelse, er endnu uvist.

 

* Forfatternes vægtlægning, ikke min – men min konvertering hvor nødvendigt af forfatternes inline‑citationer til hyperlinks.

† Forfatterne påstår ikke nul AI‑brug i deres egen artikel, og detaljerer sådan brug.

†† Det kan interessere læseren at vide, at jeg måtte finde et korrekt link selv til NTS‑rammen, fordi linket leveret af forfatterne ikke var relevant – et af de meget mål, som SciSlop fokuserer på!

Først offentliggjort søndag den 4. oktober 2026

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai