Andersonin kulma
AI:n aiheuttaman laadun heikkenemisen torjuminen tieteellisissä julkaisuissa

AI tekee kaiken mittakaavassa, DOS-hyökkäystason verkkokaavintastä tällaisiin valtaviin määriin tieteellisiä tutkimusjulkaisujen käsikirjoituksia, jolloin tuloksena on sekä logistinen kriisi että laadun kriisi, kun signaali‑kohinasuhde jatkaa navigoimattomaksi tulemista.
Viime viikolla esijulkaisualusta arXiv julkaisi aikovansa ottaa käyttöön uuden nopeusrajoituspolitiikan lähettäjille, joille nyt on asetettu enimmäismäärä kaksi käsikirjoitusta kuukaudessa. Toimenpide on otettu käyttöön, ilmoituksen mukaan, vastauksena lyhyessä ajassa tapahtuneeseen huimaavaan käsikirjoitusten määrän nousuun:

ArXivin cs.AI -kategorian kuukausittaiset lähetykset tammikuusta 2024 syyskuuhun 2026, mikä osoittaa yli kuusinkertaisen kasvun tarkastelujakson aikana. Lähde
Kat Boboris’n blogikirjoitus, joka herätti kommenttia Hacker Newsissä viime torstaina, totesi, että arXiv sai 40 363 käsikirjoitusta syyskuussa 2026 – lähes kaksinkertaisesti 20 569:een, joka saatiin syyskuussa 2024, ja yli neljä kertaa 9 869:een, joka saatiin syyskuussa 2016.
Boboris’n havaintojen mukaan viime kuukauden lähetykset aiheuttivat myös lähes 9 000 tukipyyntöä ArXivin henkilökunnalle ja moderaattoreille:
‘Moderaattorimme havaitsevat ohuiden, kapean aihepiirin käsikirjoitusten määrän kasvun, sekä “salami”-käsikirjoituksia, joissa yksi työ jaetaan ja lähetetään sarjana pienempiä artikkeleita.’
‘Havaitaan myös merkittävä kasvu tiiviissä, AI:n kirjoittamissa käsikirjoituksissa. AI-työkalut tekevät kirjoittajille helppoa tulvia ArXiviin ja muihin arkistoihin näillä vähäarvoisilla julkaisuilla.’
Jo tänä toukokuussa arXiv toteutti vuosikiellon tarkistamattomalle AI-sisällölle; ja viime vuoden lokakuussa se ilmoitti kysely- ja positionpaperien (joiden laatiminen vaatii vähemmän työtä kuin täysi akateeminen tutkimus) että ne vaatisivat vertaistukea julkaistakseen ne ArXivissä.
Tällä hetkellä arXivin usein estelevä http-pyyntöjen rajoitus ei ole kovin näkyvissä, ja voi toivoa, että sen erittäin hyödylliset RSS-syötteet selviävät tästä jatkuvasta leikkauksesta. Viime viikolla Reddit ilmoitti pitkään pelätyn RSS-syötteiden täydellisestä poistamisesta, mikä tapahtuu ensi kuun puolivälistä. Kuitenkin arXivin voittoa tavoittelematon asema tarkoittaa, että samankaltaista pääomaa on vähän saada ohjaamalla lukijoita pakollisiin sivukäynteihin tai pakollisiin kirjautumisiin – ainakin toistaiseksi.
Nousun Vastaan
Kun kohtaamme tällaiset vakavat ja kasvavat ongelmat, jotka liittyvät AI:n negatiiviseen vaikutukseen tieteellisessä tutkimuksessa – erityisesti AI:hen liittyvässä tutkimuksessa, joka on varjostanut kaikki muut kategoriat ja noussut tuntemattomuudesta poliittiseksi ja taloudelliseksi merkiksi viime aikoina – on syntynyt tutkimuslinja, joka tarkastelee keinoja vastata AI:hen liittyvien käsikirjoitusten laadun heikkenemiseen.
Uusin tähän ongelmaan puuttuva toimenpide on yhteistyö Etelä-Korean Seoul National Universityn ja Yhdysvaltain University of Minnesotan välillä. artikkeli, jonka otsikko on Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, ehdottaa ‘tieteellisen laatuheikkenemisen’ mittaamista käsikirjoituksen väitteiden, todisteiden, viitteiden ja rakenteen välisen yhteyden epäonnistumisten kautta:

Uudesta artikkelista katsaus työn lähestymistapaan ‘tieteellinen laatuheikkeneminen’, joka osoittaa, miten rakenteen, argumentin ja tukielementtien epäonnistumiset voivat paljastaa heikkouksia, jotka perinteiset AI-tekstintunnistimet eivät havaitse. Lähde
Toisin kuin aikaisemmat lähestymistavat, uusi järjestelmä tarkastelee tekstin ulkopuolelle arvioidakseen, onko käsikirjoituksen väitteet asianmukaisesti tuettu argumenteilla, todisteilla ja viitteillä. Tekijät toteavat*:
‘Jokainen käsikirjoituksen osa voi näyttää erillisenä uskottavalta, joten tällaiset heikkoudet ovat piilossa token-tason tunnistajilta ja ne voidaan tunnistaa tai korjata vain koko käsikirjoituksen tasolla. Mittaamaan ja lieventämään tieteellistä laatuheikkenemistä, tämä artikkeli käsittelee kolmea haastetta.’
‘Ensinnäkin token-tason mittarit eivät pysty kuvaamaan, miten tieteellinen päättely yhdistyy käsikirjoituksen läpi. Luvut, väitteet, viitteet, todisteet ja tukielementit voivat kaikki vaikuttaa uskottavilta, vaikka niiden väliset suhteet hajoavat. Havaimme toistuvasti tällaisia epäonnistumisia pääte-päästä AI:n tuottamissa käsikirjoituksissa, ja ICLR:n tarkastajat rankaisevat niitä jo ihmisten kirjoittamissa käsikirjoituksissa.
‘Toiseksi, näiden mallien havaitseminen on edelleen mittaamatta. Nykyiset testijoukot merkitsevät vain tekstin, joten se, missä määrin tunnistimet, mukaan lukien koko paperin lukevat LLM:t, havaitsevat nämä mallit, on koskaan mittaamatta.
‘Kolmanneksi, näiden mallien lieventäminen on luotettavasti vaikeaa. Kun token-tasoiset signaalit voidaan poistaa parafrasoinnilla, näiden mallien korjaaminen vaatii puuttuvien suhteiden palauttamista muuttamatta taustatieteellistä sisältöä.’
Tekijöiden uusi vertailuarvio, nimeltään SciSlopBench, on sisällytetty SciSlopHarness-kehykseen, jonka on suunniteltu havaitsemaan ja korjaamaan paperin tieteellisen päättelyn epäonnistumisia säilyttäen samalla taustatieteelliset todisteet:

Esimerkkejä virheellisten kohtien vertailusta SciSlopHarnessin tekemien korjausten kanssa. Tukemattomat lisäykset hylätään, kun taas väitteet järjestellään uudelleen tai kirjoitetaan uudelleen tarpeen mukaan paremmin heijastamaan paperissa saatavilla olevia todisteita.
SciSlopBench-vertailuarvio itsessään rakennettiin 390 AI:n tuottamasta paperista, joista jokainen paritettiin ihmisen kirjoittaman paperin kanssa, joka käsittelee samankaltaista tutkimusongelmaa ja kontribuutiotyyppiä.
Testeissä SciSlopBenchia käytettiin erottamaan 390 paperiparia, joista jokainen pari koostui edellä mainitusta AI:n tuottamasta paperista ja tutkimusongelmaltaan ja kontribuutioltaan vastaavasta ihmisen kirjoittamasta paperista. Vertailuarvio tunnisti AI:n tuottaman paperin oikein 85,9 % näistä vertailuista, ylittäen merkittävästi perinteiset AI-tekstintunnistimet.
Tekijät toteavat:
‘Vaikka tavalliset tarkistukset jättävät jäljelle ylimääräistä sloppia ja suora slop-tietoiseen kehotukseen perustuva palkkioiden manipulointi, SciSlopHarness vähentää jäljelle jäävää AI–human gapia 63% vahvimmassa tarkistusvertailussa ilman, että ihmisen referenssikohteita tarvitaan.
‘Yleisesti osoitamme, että AI:n tuottamat tieteelliset artikkelit jättävät perustavanlaatuisia jälkiä niiden globaalissa päättelyssä, ja että vastuullinen lieventäminen vaatii tiukkaa todistepohjaista perustaa eikä pelkkää proosan hiomista.’
Lisäksi paperin itsensä tekemien kontribuutioiden lisäksi tekijät ovat toteuttaneet uuden työn periaatteet live-demo-muodossa, jossa käyttäjät voivat lähettää tieteellisiä papereita analysoitavaksi niiden sisältämän AI-slopin määrän perusteella.
Mielenkiintoista on, että itse paperi, jota demo analysoi, saa kohtuullisen ‘slop’-pisteen 40/100†:

Uusi paperi, jonka oma algoritmi on analysoinut, merkitsee ‘slop’-alueita, jotka on tunnistettu tekijöiden uudessa prosessissa. Lähde
Menetelmä ja datalähestymistapa
Vuoden 2025 yhteistyö Miksi Slop on Tärkeä kuvaili ‘pintapuolista pätevyyttä’ AI-slopin määrittelevänä ominaisuutena, jossa näennäinen laatu peittää aineettoman puutteen. Uusi työ soveltaa tätä ajatusta tarkemmin tieteellisiin papereihin, määritellen ‘tieteellisen slopin’ epäonnistumisina, jotka vaikeuttavat tutkimuksen järjestelyn, väitteiden tukemisen sekä menetelmien ja todisteiden tarkastelun seuraamista, ja ryhmittelee epäonnistumiset rakenteeseen; argumenttiin; ja artefakteihin:

Mittausohjeet benchmarkissa käytettyihin kuuteen tieteellisen slopin tyyppiin. Taulukko näyttää, mitä kunkin mittarin osalta tarkastellaan, miten pisteet lasketaan ja mitä maksimiarvo 1 tarkoittaa, korkeammat pisteet osoittaen laajempia epäonnistumisia.
Paperissa määritellyt kuusi tieteellisen slopin mittaria ovat ristikko-viitteet (onko osioissa merkityksellisiä viitteitä muualle paperissa); makro makro‑redundanssi (toistavatko myöhemmät osiot aikaisempaa materiaalia); argumenttikaavio (tukeeko väitteet asianmukaisesti edeltävää päättelyä); lähde-eristäminen (käytetäänkö viitteitä pintapuolisesti ilman selitystä, miten viitatut teokset liittyvät paperiin tai toisiinsa); kuvan esittely (selittävätkö menetelmäkuvat itse menetelmän); ja todisteväli (tukeeko raportoitu tulos konkreettisia esimerkkejä).
Benchmarkti rakennettiin parittamalla AI:n tuottamat paperit vastaaviin ihmisen kirjoittamiin papereihin, AI-paperit kerättiin FARS-lähteestä ja 2025 Agents4Science-kilpailusta.
Kullekin koneellisesti tuotetulle FARS-paperille tutkijat hakivat sen viitteistä ihmisen kirjoittaman saman tyyppisen paperin, joka oli hyväksytty huippuluokan konferenssissa, ja valitsivat sen jälkeen lähimmän aihepiirin perusteella, jolloin syntyi 143 paria. Agents4Science-paperit paritettiin samalla tavalla ihmisen kirjoitettuihin vastineisiinsa, jolloin syntyi 247 uutta paria, ja benchmarkiin tuli yhteensä 390 AI‑ihminen-paria. Paperit kattavat elämän-, yhteiskunta‑ ja luonnontieteet, vaikka aineisto painottuu voimakkaasti tietojenkäsittelytieteeseen.
Mittausten osalta suorituskykyä arvioitiin käyttäen PairAcc, joka mittaa kuinka usein ihmisen paperi sijoittuu AI‑vastineensa yläpuolelle; sekä AUROC, joka mittaa kokonaisvaltaista erottavuutta ihmisen ja AI‑paperien välillä eri kynnysarvoilla. Tekijät raportoivat myös havaitsemisen suorituskyvystä, kun ihmisen papereiden väärien positiivisten osuus on kiinnitetty 5 %:iin.
Testit
Alkuperäiset testit vertasivat SciSlopia AI‑tekstintunnistimiin Binoculars; DetectGPT; ja NTS††, sekä automatisoituihin tarkistusjärjestelmiin AI Scientist Reviewer ja CycleReviewer.
Myöhemmissä tarkistustesteissä käytettiin neljää vertailumenetelmää: base prompting; Claude Code; reviewer-based refinement; ja slop-aware revision. Kolme ensimmäistä saivat vain yleiset ohjeet paperin parantamiseksi, kun taas slop-aware revisionille annettiin lisäksi määritelmät ja sijainnit havaituista slopeista. Kaikki vertailtiin SciSlopHarnessiin samojen tarkistusehtojen alla.
Toteutuksessa tekstintunnistimet saivat paperin proosan, kun taas muut menetelmät saivat paperin lähdekoodin ja tarvittaessa pääsyn sen koodiin. Binoculars käytti Falcon-7B perus‑ ja ohjeistamismalleja; DetectGPT käytti T5-3B luodakseen 100 häiriötä; AI Scientist käytti Qwen2.5-32B-Instruct; ja CycleReviewer käytti julkaistua 8 B‑mallipistettä. Papereille, jotka ylittävät Falcon‑mallin 2 048‑token‑rajan, pisteet laskettiin erillisissä, päällekkäisissä ikkunoissa ja keskiarvoiltiin.
Alkuperäiset havaitsemistulokset on esitetty alla olevissa kahdessa taulukossa: SciSlop saavutti 85,9 % PairAcc‑arvon, kun Binoculars oli 68,7 % ja vahvin automatisoitu tarkistaja 68,5 %, mikä leikkasi virheprosentin yli puoleen:

SciSlopin havaitsemistulokset AI‑tekstintunnistimia ja automatisoituja tarkistajia vastaan, sekä sen kuuden yksittäisen slop‑mittarin tulokset. SciSlop saavuttaa korkein kokonais‑PairAcc, kun taas poikkileikkausviitteet antavat vahvimman yksittäisen tuloksen.
Poikkileikkausviitteet suoriutuivat erityisen hyvin itsenäisesti, saavuttaen 90,5 % PairAcc‑arvon ilman mallia, ja havaitsevat 65 % AI‑luoduista papereista 5 %:n väärien positiivisten raja-arvolla, kun Binoculars havaitsee vain 24 %.
Tekijät väittävät, että nämä tulokset osoittavat, että paperin sisäiset suhteet antavat vahvemman signaalin AI‑generoinnista kuin perinteinen tekstitasoinen havaitseminen tässä aineistossa, ja samalla ne paljastavat erityisiä heikkouksia, joihin voidaan myöhemmin kohdistaa tarkistuksia.
Seuraavaksi tarkasteltiin tieteellisen slopin ja ihmisten arvioiman paperin laadun välistä yhteyttä. Kuten ensimmäisessä sarakkeessa alla, suurempi slop korreloi alhaisempien ICLR‑pisteiden kanssa kokonaisarvioinnissa, soundness‑arviossa, esityksessä ja kontribuutiosta:

SciSlopin vertailu AI‑tekstintunnistimiin ja automatisoituihin tarkistajiin ICLR‑arviointitulosten valossa. Vasemmassa paneelissa AI‑luonne suhteessa arviointipisteisiin; keskellä yksittäisten arviointikriteerien vertailu; oikealla hylättyjen ja hyväksyttyjen papereiden erottelun suorituskyky yhdeksän vuoden ajalta.
Hylätyt ja hyväksytyt paperit erotettiin myös satunnaisuutta paremmin kaikilla tarkastelluilla yhdeksällä vuodella, kun taas perinteiset tunnistimet alituivat satunnaisuuden alapuolelle useimmissa vertailuissa.
Tieteellinen slop siis heijastaa heikkouksia, jotka ihmisen arvioijat jo rankaisevat, eikä toimi pelkästään AI‑kirjoittajuuden signaalina.
Viimeisissä testeissä tarkasteltiin, voisiko SciSlopHarness poistaa slopin, joka jäi jäljelle yleisemmistä tarkistuksista. Kuten alla on esitetty, harness päättyi lähimpänä ihmisen keskiarvoa kaikissa kuudessa mittarissa, kun taas yleinen tarkistus jätti usein merkittävää slopia ja suora slop-aware revision saattoi joskus yli korjata:

Revision tulokset, joissa verrataan SciSlopHarnessia neljään perusmenetelmään kuuden slop-mittarin osalta. Arvot, jotka ovat lähellä nollaa, ovat lähellä ihmisen kirjoittaman paperin keskiarvoa, ja SciSlopHarness pyrkii yleensä kohti tätä tasoa, kun taas slop-tietoisuus korjauksessa ylittää sen usein.
Jokainen ehdotettu muutos tarkistettiin paperin tieteellisen perustelun ja tukevan evidenssin perusteella, ja tukemattomat muokkaukset hylättiin. Kuuden mittarin osalta jäljelle jäävä ero ihmisen kirjoittamiin papereihin väheni 63 % verrattuna Claude Codeen, vahvimpaan korjausperuslinjaan.
Johtopäätös
Olisi ollut mielenkiintoista kirjoittaessani tätä tekstiä huomata, että tämä paperi sai heikon pisteytyksen omalla demosivullaan, ja lisäksi havaita vähintään yksi esimerkki “laiskasta” tai “kosmeettisesta” viitteest䆆, joka on viime aikoina noussut pieneksi mutta kasvavaksi kiroukseksi tutkimuspapereissa.
Tällaisissa tapauksissa, tämän tietyn paperin ulkopuolella, tutkijat vaikuttavat turvautuvan omaan tietämykseensä sen sijaan, että he merkityksellisesti sitoutuisivat olemassa olevaan kirjallisuuteen. Kuitenkin perinteen rajoittamana “näyttämään työnsä”, viitteet annetaan usein siltä vaikuttaen, että ne heijastavat kiireellisyyttä, jopa halveksuntaa prosessia kohtaan, ja näyttävät luottavan siihen, että lukija hyväksyy viitteiden tulvan riittävänä “patinana” alkuperästä, vaikka se ei kestäisi tarkkaa tarkastelua.
Arxiv vastustaa AI‑ohjaamaa käsikirjoitusten teollistumista; onko tulevaisuudessa vastaavia rajoituksia AI:n suoraan osallistumiselle tutkimukseen, ilman merkittävää siihen liittyvää katastrofia, on vielä nähtävissä.
* Kirjoittajien painotukset, ei minun – mutta tarvittaessa tekemiini muunnoksiin kirjoittajien sisäisistä viitteistä hyperlinkeiksi.
† Kirjoittajat eivät väitä nollaa AI‑käyttöä omassa paperissaan, ja tarkentavat tällaista käyttöä.
†† Saattaa kiinnostaa lukijaa tietää, että jouduin itse etsimään oikean linkin NTS‑kehykselle, koska kirjoittajien antama linkki ei ollut relevantti – yksi niistä mittareista, joihin SciSlop keskittyy!
Ensimmäisen kerran julkaistu sunnuntaina 4. lokakuuta 2026












