Andersons vinkel

Bekämpa AI‑slopp i vetenskapliga artiklar

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

AI gör allt i stor skala, från DOS-attack-level web scraping till att producera, eller möjliggöra, så stora volymer av vetenskapliga forskningsinskickningar så att resultatet blir både en logistisk kris och en kvalitetskris, eftersom signal‑till‑brus‑förhållandet fortsätter bli oöverskådligt.

Förra veckan, förhandsgranskningsservern arXiv meddelade att den kommer införa en ny hastighetsbegränsningspolicy för inskickare, som nu kommer att begränsas till två inskickningar per månad. Åtgärden har vidtagits, enligt meddelandet, i mötet med en hisnande ökning av inskickningshastigheter under en kort tidsperiod:

Månatliga inskickningar till arXivs cs.AI‑kategori från januari 2024 till september 2026, vilket visar en mer än sexfaldig ökning under perioden. Källa – https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Månatliga inskickningar till arXivs cs.AI‑kategori från januari 2024 till september 2026, vilket visar en mer än sexfaldig ökning under perioden. Källa

Kat Boboris bloggpost som meddelade flytten, vilken fick kommentarer på Hacker News i torsdags, uppgav att arXiv mottog 40 363 inskickningar i september 2026 – nästan dubbelt så många som de 20 569 som mottogs i september 2024, och mer än fyra gånger så många som de 9 869 som mottogs i september 2016.

Boboris observerade att den senaste månadens inskickningar också genererade nästan 9 000 supportärenden för arXivs personal och moderatorer:

‘Våra moderatorer observerar en ökning av tunna papper med snävt omfång, samt ‘salami’-papper, där ett enda arbete delas upp och skickas in som en samling mindre papper. ‘

‘Det finns också en tydlig ökning av täta, AI‑skrivna papper. AI‑verktyg gör det enkelt för författare att översvämma arXiv och andra arkiv med dessa lågvärdepapper.’

Redan i maj i år införde arXiv en ettårig avstängning för oreglerat AI‑innehåll; och i oktober förra året meddelade de till inskickare av enkätartiklar och positionsartiklar (båda kan genereras med mindre ansträngning än en fullständig akademisk studie) att de skulle behöva stöd från granskare för att kunna publiceras på arXiv.

För närvarande är arXivs ofta hindrande begränsning av http‑förfrågningar inte särskilt märkbar, och man kan bara hoppas att dess mycket användbara RSS‑flöden överlever denna pågående åtstramning. Förra veckan Reddit meddelade den länge fruktade totala avskaffandet av sina RSS‑flöden, vilket kommer att ske från mitten av nästa månad. Dock innebär arXivs ideella status att det finns lite liknande kapital att vinna genom att leda läsare till obligatoriska webbplatsbesök, eller tvingade inloggningar – åtminstone för tillfället.

Mot den stigande vågen

I mötet med sådana allvarliga och växande problem kring den negativa effekten av AI‑användning i vetenskaplig forskning – framför allt avseende AI‑relaterad forskning, som har överskuggat alla andra kategorier och gått från okändhet till att bli en politisk och ekonomisk indikator på senare tid – har en forskningslinje uppkommit som undersöker sätt att motverka nedgången i kvalitet på AI‑relaterade artikelinskickningar.

Det senaste initiativet för att tackla problemet kommer i form av ett samarbete mellan Sydkoreas Seoul National University och University of Minnesota i USA. Artikel, med titeln Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, föreslår att mäta ‘scientific slop’ genom misslyckanden i kopplingarna mellan en artikels påståenden, bevis, citeringar och struktur:

Från den nya artikeln, en översikt av arbetets tillvägagångssätt för 'scientific slop', som visar hur misslyckanden i struktur, argument och stödjande artefakter kan avslöja svagheter som konventionella AI‑textdetektorer missar. Källa – https://arxiv.org/pdf/2610.00531

Från den nya artikeln, en översikt av arbetets tillvägagångssätt för ‘scientific slop’, som visar hur misslyckanden i struktur, argument och stödjande artefakter kan avslöja svagheter som konventionella AI‑textdetektorer missar. Källa

Till skillnad från tidigare metoder ser det nya systemet bortom själva texten för att bedöma om artikelns påståenden är korrekt understödda av dess argument, bevis och citeringar. Författarna påstår*:

‘Varje del av en artikel kan verka trovärdig i isolering, så sådana brister är osynliga för token‑nivådetektorer och kan endast identifieras eller åtgärdas på hela artikelns nivå. För att benchmarka och mildra scientific slop adresserar denna artikel tre utmaningar.

‘Först misslyckas token‑nivåmått med att fånga hur vetenskapligt resonemang kopplas ihop i en artikel. Avsnitt, påståenden, citat, bevis och artefakter kan alla framstå som trovärdiga medan relationerna mellan dem bryts ner. Vi observerar upprepade gånger sådana misslyckanden i helautomatiskt AI‑genererade artiklar, och ICLR‑granskare straffar dem redan i mänskligt skrivna inskickningar.

‘För det andra, förblir detektering av dessa mönster omätbar. Befintliga testset markerar endast texten, så i vilken grad detektorer, inklusive LLM:er som läser hela artikeln, identifierar dessa mönster har aldrig mätts.

‘För det tredje, är dessa mönster svåra att på ett tillförlitligt sätt mildra. Medan token‑nivå‑signaler kan tas bort genom omformulering, kräver reparation av dessa mönster återställning av de saknade relationerna utan att förändra den underliggande vetenskapen.’

Författarnas nya benchmark, benämnd SciSlopBench, har förkroppsligats i SciSlopHarness, ett ramverk utformat för att upptäcka och reparera fel i en artikels vetenskapliga resonemang, samtidigt som det underliggande vetenskapliga beviset bevaras:

Exempel som jämför bristfälliga avsnitt med revideringar gjorda av SciSlopHarness. Ogrundade tillägg avvisas, medan påståenden omordnas eller skrivas om där det behövs för att bättre återspegla de bevis som finns i artikeln.

Exempel som jämför bristfälliga avsnitt med revideringar gjorda av SciSlopHarness. Ogrundade tillägg avvisas, medan påståenden omordnas eller skrivas om där det behövs för att bättre återspegla de bevis som finns i artikeln.

SciSlopBench‑benchmarken byggdes på 390 AI‑genererade artiklar, där varje artikel paras ihop med en mänskligt skriven artikel som behandlar ett liknande forskningsproblem och bidragstyp.

I tester användes SciSlopBench för att särskilja mellan 390 par artiklar, där varje par bestod av den ovan nämnda AI‑genererade artikeln och en mänskligt skriven artikel matchad efter forskningsproblem och typ av bidrag. Benchmarken identifierade korrekt den AI‑genererade artikeln i 85,9 % av jämförelserna, vilket avsevärt överträffade konventionella AI‑textdetektorer.

Författarna konstaterar:

‘Medan standardrevideringar lämnar kvar slop och direkt slop‑medveten prompting triggar belöningsmanipulation, minskar SciSlopHarness den återstående AI‑mänskliga klyftan med 63 % jämfört med den starkaste revideringsbaslinjen utan att kräva mänskliga referensmål.

‘Sammanfattningsvis visar vi att AI‑genererade vetenskapliga artiklar lämnar grundläggande spår i sitt globala resonemang, och att ansvarsfull mitigering kräver strikt evidensbas snarare än enbart stilistisk förbättring.’

Förutom bidragen i själva artikeln har författarna operationaliserat principerna i sitt nya arbete i form av en live demo där användare kan skicka in vetenskapliga artiklar för analys av hur mycket AI‑slop de innehåller.

Intressant nog får den nya artikeln själv, analyserad av demonstrationen, ett ‘måttligt’ slop‑resultat på 40/100†:

Den nya artikeln, analyserad av sin egen algoritm, flaggar 'slop'-områden som identifierats av författarnas nya process. Source: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Den nya artikeln, analyserad av sin egen algoritm, får ‘slop’-områden flaggade av författarnas nya process. Source

Metod och datatillvägagångssätt

Samarbetet 2025 Why Slop Matters beskrev ‘ytlig kompetens’ som ett kännetecken för AI‑slop, där ett till synes högkvalitativt intryck döljer brist på substans. Det nya arbetet tillämpar denna idé mer specifikt på vetenskapliga artiklar och definierar ‘vetenskaplig slop’ som fel som gör det svårt att följa hur en studie är strukturerad; hur dess påståenden understöds; och hur dess metoder och bevis kan granskas, med felen grupperade i struktur; argument; och artefakter:

Mätningsregler för de sex typerna av vetenskaplig slop som används i benchmarken. Tabellen visar vad som undersöks för varje mått, hur poängen beräknas och vad maximipoängen 1 representerar, där högre poäng indikerar mer omfattande fel.

Mätningsregler för de sex typerna av vetenskaplig slop som används i benchmarken. Tabellen visar vad som undersöks för varje mått, hur poängen beräknas och vad maximipoängen 1 representerar, där högre poäng indikerar mer omfattande fel.

De sex måtten på vetenskaplig slop som definieras i artikeln är referenser över sektioner (om sektioner refererar meningsfullt till material någon annanstans i artikeln); makro redundans (om senare sektioner upprepar tidigare material); argumentgraf (om påståenden understöds korrekt av föregående resonemang); citeringsisolering (om citat används ytligt utan att förklara hur de citerade verken relaterar till artikeln eller till varandra); figur‑exponering (om metodfigurer faktiskt förklarar metoden); och bevislucka (om rapporterade resultat understöds av konkreta exempel).

Benchmarken konstruerades genom att para AI‑genererade artiklar med jämförbara/ekvivalenta mänskligt skrivna artiklar, där AI‑artiklarna valdes från FARS och 2025 Agents4Science-tävlingen.

För varje maskin‑genererad FARS‑artikel sökte forskarna i dess referenser efter en mänskligt författad artikel av samma typ som hade accepterats på en topprankad publikation, och valde sedan den närmaste matchen baserat på forskningsämne, vilket resulterade i 143 par. Agents4Science‑artiklarna parades på liknande sätt med mänskligt skrivna motsvarigheter, vilket skapade ytterligare 247 par och förde upp benchmarken till totalt 390 AI‑mänskliga par. Artiklarna täcker livs‑, samhälls‑ och naturvetenskaperna, även om datasetet är tungt viktat mot datavetenskap.

För metrikerna utvärderades prestandan med hjälp av Parningsnoggrannhet, som mäter hur ofta den mänskliga artikeln rankas över sin AI‑motsvarighet; och AUROC, som mäter den övergripande separationen mellan mänskliga och AI‑artiklar över olika trösklar. Författarna rapporterar också detekteringsprestanda när falsk‑positiv‑frekvensen för mänskliga artiklar är fixerad till 5 %.

Tester

De inledande testerna jämförde SciSlop med AI‑textdetektorerna Binoculars; DetectGPT; och NTS††, samt de automatiserade granskningssystemen AI Scientist Reviewer och CycleReviewer.

För de senare revisions‑testerna användes fyra baslinjer: baspromptning; Claude Code; granskarbaserad förfining; och slop‑medveten revision. De första tre fick endast allmänna instruktioner för att förbättra artikeln, medan slop‑medveten revision dessutom fick definitionerna och placeringarna av upptäckt slop. Alla jämfördes med SciSlopHarness under likvärdiga revisionsförhållanden.

För implementeringen fick textdetektorerna artikelnas prosa, medan de övriga metoderna fick artikelnas källkod och, där det krävdes, åtkomst till dess kod. Binoculars använde Falcon-7B bas‑ och instruktionsmodeller; DetectGPT använde T5-3B för att generera 100 perturbationer; AI Scientist använde Qwen2.5-32B-Instruct; och CycleReviewer använde sin släppta 8 B‑checkpoint. För artiklar som överskred Falcons 2 048‑token‑gräns poängsattes icke‑överlappande fönster separat och medelvärdesberäknades.

De inledande detekteringsresultaten beskrivs i de två tabellerna nedan: SciSlop uppnådde 85,9 % parningsnoggrannhet, jämfört med 68,7 % för Binoculars och 68,5 % för den starkaste automatiserade granskaren, vilket minskade felprocenten med mer än hälften:

Detekteringsresultat som jämför SciSlop med AI‑textdetektorer och automatiserade granskare, tillsammans med resultat för dess sex individuella slop‑mått. SciSlop uppnår den högsta totala parningsnoggrannheten, medan kors‑sektion‑referenser ger det starkaste individuella resultatet.

Detekteringsresultat som jämför SciSlop med AI‑textdetektorer och automatiserade granskare, tillsammans med resultat för dess sex individuella slop‑mått. SciSlop uppnår den högsta totala parningsnoggrannheten, medan kors‑sektion‑referenser ger det starkaste individuella resultatet.

Kors‑sektion‑referenser presterade särskilt starkt på egen hand, nådde 90,5 % parningsnoggrannhet utan att kräva en modell, och detekterade 65 % av AI‑genererade artiklar vid en falsk‑positiv‑frekvens på 5 %, jämfört med 24 % för Binoculars.

Författarna hävdar att dessa resultat visar att relationer över hela artikeln ger en starkare signal för AI‑generering än konventionell text‑nivå‑detektion i detta dataset, samtidigt som de identifierar specifika svagheter som därefter kan riktas mot för revision.

Förhållandet mellan vetenskaplig slop och mänskliga bedömningar av artikelför kvalitet undersöktes därefter. Som visas i den första kolumnen nedan, var högre slop förknippat med lägre ICLR‑poäng för totalbedömning, soliditet, presentation och bidrag:

Jämförelse av SciSlop med AI‑textdetektorer och automatiserade granskare mot ICLR‑granskningsresultat. Den vänstra panelen visar AI‑likhet mot granskningspoäng; mitten jämför individuella granskningsdimensioner; den högra visar prestanda i att särskilja avvisade från accepterade artiklar över nio år.

Jämförelse av SciSlop med AI‑textdetektorer och automatiserade granskare mot ICLR‑granskningsresultat. Den vänstra panelen visar AI‑likhet mot granskningspoäng; mitten jämför individuella granskningsdimensioner; den högra visar prestanda i att särskilja avvisade från accepterade artiklar över nio år.

Avvisade och accepterade artiklar kunde också särskiljas bättre än slumpen under alla nio undersökta år, medan konventionella detektorer presterade under slumpen i de flesta jämförelser.

Vetenskaplig slop visade sig därför spegla svagheter som redan bestraffas av mänskliga granskare, snarare än att enbart fungera som en signal för AI‑författarskap.

De sista testerna undersökte om SciSlopHarness kunde ta bort slop som återstod efter en mer generell revision. Som visas nedan nådde verktyget den närmaste människogennomsnittet över alla sex mått, medan generell revision ofta lämnade kvar betydande slop och direkt slop‑medveten revision ibland överkorrigerade:

Revisionsresultat som jämför SciSlopHarness med fyra baslinjemetoder över de sex slop‑måtten. Värden närmare noll ligger närmare människartiklarnas genomsnitt, där SciSlopHarness generellt rör sig mot denna nivå medan slop‑medveten revision ofta överskrider den.

Revisionsresultat som jämför SciSlopHarness med fyra baslinjemetoder över de sex slop-måtten. Värden närmare noll ligger närmare genomsnittet för mänskligt skrivna artiklar, där SciSlopHarness generellt rör sig mot denna nivå medan slop‑medveten revision ofta överskrider den.

Varje föreslagen förändring kontrollerades mot papirets vetenskapliga resonemang och stödjande bevis, och ogrundade redigeringar avslogs. Över de sex måtten minskade den återstående klyftan till mänskligt skrivna artiklar med 63 % jämfört med Claude Code, den starkaste revisionsbaslinjen.

Slutsats

Det var intressant, under skrivandet av detta inlägg, att notera inte bara hur dåligt detta papper presterade på sin egen demosida, utan också att observera åtminstone ett exempel på en ”lättsam” eller ”kosmetisk” citering††, som på senare tid har blivit en liten men växande förbannelse i forskningsartiklar.

I sådana fall, bortom just detta papper, verkar forskare förlita sig på sin egen kunskap snarare än att engagera sig meningsfullt med den befintliga litteraturen. Ändå, begränsade av konventionen att ”visa sitt arbete”, levereras citat ofta med en ton som upplevs som otålig, ibland föraktfull mot processen, och förlitar sig ofta på att läsaren accepterar en överflöd av referenser som ett tillräckligt ”patina” av ursprung, även om det inte skulle stå emot noggrann granskning.

Arxiv motarbetar den AI‑drivna industrialiseringen av inskickade artiklar; huruvida liknande begränsningar kommer att införas för AI:s direkta medverkan i forskning, utan någon motsvarande katastrof av tillräcklig omfattning, återstår att se.

 

* Författarnas betoningar, inte mina – men min konvertering där det behövs av författarnas inline‑citat till hyperlänkar.

† Författarna påstår inte att de använt noll AI i sin egen artikel, och detaljerar sådan användning.

†† Det kan vara av intresse för läsaren att veta att jag själv fick leta upp en korrekt länk för NTS‑ramverket, eftersom länken som författarna angav inte var relevant – en av de mycket metrik som SciSlop fokuserar på!

Först publicerad söndag 4 oktober 2026

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai